AutoSynthData:为智能体生成企业训练数据
ServiceNow CoreAI 构建 AutoSynthData 框架,通过分析目标模型在企业环境</think>
ServiceNow CoreAI 构建 AutoSynthData 框架,通过分析目标模型在企业环境</think>
NVIDIA 发布开源表格基础模型 Kumo Tabular,在单次前向推理中完成表格分类与回归预测,无需训练或特征工程,权重与代码已在 Hugging Face 和 GitHub 开源。
推荐理由:原文同时给出架构细节与四项表格基准的排名结果,读者可以横向比较它在自身数据规模和列类型下是否值得替换现有方法。
联合国系统推出 UN System Data Commons,一个基于 Data Commons by Google 构建的开源 AI 就绪平台,将分散的全球统计数据整合为可搜索的知识图谱。
Mistral 与 Cloudera 宣布建立合作,将 Mistral 模型集成到 Cloudera 混合数据平台,支持企业在私有云、公有云、本地及完全隔离环境中部署 AI 推理,并基于专有数据训练自有模型。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
Berkeley AI</think>
Pollen Robotics 在 Hugging Face 发布开源系统 Grabette,用手持夹爪配合相机和 IMU 录制人手操作演示,并在浏览器中自动完成 SLAM 处理,产出标准 LeRobot 数据集用于机器人策略训练。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大语言模型中以可扩展方式识别驱动模型行为的特征交互。方法借助信号处理与编码理论,基于稀疏性与低阶性假设将指数级搜索重构为可解的稀疏恢复问题;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能,可应用于特征归因、数据归因与模型组件归因等可解释性任务。
Google Research 提出 MapTrace 合成数据生成管线,用于教多模态大语言模型(MLLM)在地图上追踪路径。该管线利用 Gemini 2.5 Pro 与 Imagen-4 生成多样化地图,并由 MLLM 充当 Mask Critic 与 Path Critic 把关质量,最终产出 200 万组带标注问答对并开源。