AutoSynthData:为智能体生成企业训练数据
ServiceNow CoreAI 构建 AutoSynthData 框架,通过分析目标模型在企业环境</think>
ServiceNow CoreAI 构建 AutoSynthData 框架,通过分析目标模型在企业环境</think>
NVIDIA NeMo Agent Toolkit(NAT)可通过自定义插件将 Amazon S3 Vectors 接入其记忆子系统,作为生产环境的多智能体持久记忆层。
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
AWS 博客拆解 Amazon Quick 各组件的提示词工程模式与误区,分别针对 Quick Research、Quick Flows 和 Quick Sight 给出差异化技巧。
OpenAI 发布 GPT-6.1 Sol 模型,定位接近 Astra 智能水平,覆盖编码、计算机使用和专业工作场景,API 输入和输出 token 价格为 Astra 标准定价的五分之一。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款模型,作为本月初发布的 GPT-6 Astra 的更经济版本,采用与 Astra 相似的训练方法延续其在专业工作、事实性、编码、计算机使用与协作风格上的能力提升。
推荐理由:给出 Sol 和 Luna 与 GPT-6 Astra 及 Claude Opus 5、Fable 5 等竞品在成本和能力上的对照数据,可作为评估企业级工作流性价比的参考。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。
GitHub Copilot 应用内置 diff、终端和浏览器三大面板,让用户无需切换应用即可在同一界面完成 AI 代码改动的审查、运行与预览。diff 面板以绿/红色高亮新增与删除行,终端面板可直接运行项目命令,浏览器面板的 Pick & Polish 工具可对页面元素选中后迭代调整。
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
GitHub Copilot app 支持并行运行多个 AI Agent 会话,每个会话独立工作互不干扰。每条会话运行在独立的 Git worktree 上并各自保留上下文,切换时无需重新说明任务。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。
推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。
Title: "AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR" This is a research prototype introduction paper。
Berkeley AI</think>
Hugging Face 与 Microsoft 在 Microsoft Build 2026 上联合推出 Foundry 上的 Hugging Face 模型集合,把开放权重模型以每周刷新的策展目录接入 Foundry Managed Compute,可一键部署到 NVIDIA A100、H100 与 AMD MI300X 加速器。
推荐理由:原文详述了从社区筛选、许可证审核、运行时签名到一键部署的完整流水线,方便评估将开放权重模型搬上 Azure 的工程代价。
ScarfBench 是一个面向企业 Java 框架迁移的开源 AI 智能体评测基准,覆盖 Spring、Jakarta EE 与 Quarkus。基准包含 34 个应用、204 个迁移任务和 1,331 个专家测试,要求迁移后应用能够成功构建、部署并保持原有行为。
GRASP 是面向世界模型的梯度规划新方法,通过将轨迹提升为虚拟状态以跨时间并行优化、对状态迭代加入随机性以增强探索、并重塑梯度让动作获得清晰信号,解决长horizon规划中梯度条件变差、损失景观充满局部极小等难题。
Google Research 在 EMNLP 2025 发表的论文提出分解式两阶段流程,先逐屏总结用户操作,再从屏幕摘要序列中提取意图,让小型多模态大语言模型可在设备端完成用户意图理解。该方法在移动端和网页轨迹上均优于 CoT 提示与端到端微调;其中 Gemini 1.5 Flash 8B 配合分解流程即可达到与 Gemini 1.5 Pro 相当的 F1 分数,同时显著降低成本与延迟。