AutoSynthData:为智能体生成企业训练数据
ServiceNow CoreAI 构建 AutoSynthData 框架,通过分析目标模型在企业环境</think>
ServiceNow CoreAI 构建 AutoSynthData 框架,通过分析目标模型在企业环境</think>
NVIDIA 发布开源表格基础模型 Kumo Tabular,在单次前向推理中完成表格分类与回归预测,无需训练或特征工程,权重与代码已在 Hugging Face 和 GitHub 开源。
推荐理由:原文同时给出架构细节与四项表格基准的排名结果,读者可以横向比较它在自身数据规模和列类型下是否值得替换现有方法。
联合国系统推出 UN System Data Commons,一个基于 Data Commons by Google 构建的开源 AI 就绪平台,将分散的全球统计数据整合为可搜索的知识图谱。
Mistral 与 Cloudera 宣布建立合作,将 Mistral 模型集成到 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全隔离环境中部署 AI 推理,并基于专有数据训练自有模型。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
Berkeley AI</think>
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大语言模型中以可扩展方式识别驱动模型行为的特征交互。方法借助信号处理与编码理论,基于稀疏性与低阶性假设将指数级搜索重构为可解的稀疏恢复问题;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能,可应用于特征归因、数据归因与模型组件归因等可解释性任务。
🤗 Datasets 是一个开源音频数据集下载与预处理库,可通过一行 Python 代码完成加载。Hugging Face Hub 上托管有 77 个语音识别数据集和 28 个音频分类数据集,文章以 GigaSpeech 为例演示 load_dataset 用法。库内置 Dataset Preview 可在线试听前 100 个样本,并支持流式模式处理大规模数据。