跳到正文

#Agent

今日 2 条
今天10月2日周五
10月1日周四
9月30日周三
9月29日周二
9月23日周三
  1. OpenAI News77

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款模型

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna 两款模型,作为本月初发布的 GPT-6 Astra 的更经济版本,采用与 Astra 相似的训练方法延续其在专业工作、事实性、编码、计算机使用与协作风格上的能力提升。

    推荐理由:给出 Sol 和 Luna 与 GPT-6 Astra 及 Claude Opus 5、Fable 5 等竞品在成本和能力上的对照数据,可作为评估企业级工作流性价比的参考。

9月16日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。

    推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。

9月11日周五
9月5日周六
  1. GitHub Blog · AI & ML65

    GitHub Copilot 发布 Project HydraFusion 研究预览,通过多模型编排提升编码任务质量

    GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。

    推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。

9月4日周五
9月2日周三
  1. Google DeepMind68

    Gemini 推出 agentic 视频理解功能,最多可减少 88% token 消耗

    Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。

    推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。

8月26日周三
7月26日周日
7月7日周二
  1. Hugging Face Blog65

    Hugging Face 开放权重模型集合上线 Microsoft Foundry Managed Compute

    Hugging Face 与 Microsoft 在 Microsoft Build 2026 上联合推出 Foundry 上的 Hugging Face 模型集合,把开放权重模型以每周刷新的策展目录接入 Foundry Managed Compute,可一键部署到 NVIDIA A100、H100 与 AMD MI300X 加速器。

    推荐理由:原文详述了从社区筛选、许可证审核、运行时签名到一键部署的完整流水线,方便评估将开放权重模型搬上 Azure 的工程代价。

7月1日周三
4月20日周一
1月23日周五
  1. Google Research38

    Google Research:通过分解式两阶段流程让小模型在设备端实现比肩大模型的用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出分解式两阶段流程,先逐屏总结用户操作,再从屏幕摘要序列中提取意图,让小型多模态大语言模型可在设备端完成用户意图理解。该方法在移动端和网页轨迹上均优于 CoT 提示与端到端微调;其中 Gemini 1.5 Flash 8B 配合分解流程即可达到与 Gemini 1.5 Pro 相当的 F1 分数,同时显著降低成本与延迟。