跳到正文

#数据/训练

今日 1 条
今天10月2日周五
9月29日周二
  1. Hugging Face Blog69

    NVIDIA 发布开源表格基础模型 Kumo Tabular,覆盖分类与回归

    NVIDIA 发布开源表格基础模型 Kumo Tabular,在单次前向推理中完成表格分类与回归预测,无需训练或特征工程,权重与代码已在 Hugging Face 和 GitHub 开源。

    推荐理由:原文同时给出架构细节与四项表格基准的排名结果,读者可以横向比较它在自身数据规模和列类型下是否值得替换现有方法。

9月18日周五
9月10日周四
9月3日周四
7月26日周日
3月13日周五
  1. Berkeley AI Research39

    SPEX 与 ProxySPEX:面向大语言模型的可扩展交互识别方法

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大语言模型中以可扩展方式识别驱动模型行为的特征交互。方法借助信号处理与编码理论,基于稀疏性与低阶性假设将指数级搜索重构为可解的稀疏恢复问题;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能,可应用于特征归因、数据归因与模型组件归因等可解释性任务。

12月15日周四
  1. Hugging Face Blog44

    Hugging Face 🤗 Datasets 音频数据集完全指南

    🤗 Datasets 是一个开源音频数据集下载与预处理库,可通过一行 Python 代码完成加载。Hugging Face Hub 上托管有 77 个语音识别数据集和 28 个音频分类数据集,文章以 GigaSpeech 为例演示 load_dataset 用法。库内置 Dataset Preview 可在线试听前 100 个样本,并支持流式模式处理大规模数据。