GitHub Copilot 发布 Project HydraFusion 研究预览,通过多模型编排提升编码任务质量
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
GitHub 推出 Project HydraFusion 研究预览,已在 GitHub Copilot CLI 中通过 /experimental 向所有 Copilot 套餐开放,按底层模型标准 token 费率计费。
推荐理由:给出了多模型运行时编排的实现细节与三项智能体编码基准的成本与质量对比,可作为评估运行时调度思路取舍的参照。
GitHub Copilot app 支持并行运行多个 AI Agent 会话,每个会话独立工作互不干扰。每条会话运行在独立的 Git worktree 上并各自保留上下文,切换时无需重新说明任务。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。
推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。
Title: "AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR" This is a research prototype introduction paper。
Mistral 与 HUMAIN 宣布战略合作,覆盖沙特及中东地区 AI 基础设施、先进模型开发与行业落地,合作规模达数亿欧元。双方将围绕网络安全和语音等方向开发并本地化先进 AI 模型,并计划打造在阿拉伯语上表现强劲的前沿模型。Mistral 将探索使用 HUMAIN 的数据中心基础设施以满足本地算力需求,双方还将针对受监管行业制定联合市场策略。
The article is about MindTopo, a new benchmark from Microsoft Research for testing topological reasoning in multimodal AI models (VLMs - Vision Language Models). Key points。
Berkeley AI</think>
Pollen Robotics 在 Hugging Face 发布开源系统 Grabette,用手持夹爪配合相机和 IMU 录制人手操作演示,并在浏览器中自动完成 SLAM 处理,产出标准 LeRobot 数据集用于机器人策略训练。
Hugging Face 与 Amazon SageMaker AI 推出一键深度链接集成,用户在模型页选择「Customize on SageMaker AI」或「Deploy on SageMaker AI」后可直接跳转到 SageMaker Studio 对应工作流,模型预加载、环境预配置。
Hugging Face 与 Microsoft 在 Microsoft Build 2026 上联合推出 Foundry 上的 Hugging Face 模型集合,把开放权重模型以每周刷新的策展目录接入 Foundry Managed Compute,可一键部署到 NVIDIA A100、H100 与 AMD MI300X 加速器。
推荐理由:原文详述了从社区筛选、许可证审核、运行时签名到一键部署的完整流水线,方便评估将开放权重模型搬上 Azure 的工程代价。
Hugging Face 与 SkyPilot 联合将 HF Storage 接入为 SkyPilot 一等存储后端,跨云读取免 egress 与 CDN 费用。
推荐理由:把 HF Storage 作为 SkyPilot 一等后端,用 hf:// 协议免流量读取模型与数据集,可作为跨云调度时的存储选型参考。
ScarfBench 是一个面向企业 Java 框架迁移的开源 AI 智能体评测基准,覆盖 Spring、Jakarta EE 与 Quarkus。基准包含 34 个应用、204 个迁移任务和 1,331 个专家测试,要求迁移后应用能够成功构建、部署并保持原有行为。
伯克利 AI Research 发布综述与视角文章,探讨自适应并行推理(Adaptive Parallel Reasoning)作为高效推理扩展的新范式。文章指出当前 Self-consistency、Best-of-N、ParaThinker、GroupThink、Hogwild!
OpenAI 发布《ChatGPT Work 日常工作》使用指南,介绍在重复性任务、信息更新、研究调研、项目规划与团队协作等常见场景下的实用工作流。指南面向希望把 AI 整合到日常运营的用户,展示 ChatGPT Work 在典型工作场景中的具体用法。
GRASP 是面向世界模型的梯度规划新方法,通过将轨迹提升为虚拟状态以跨时间并行优化、对状态迭代加入随机性以增强探索、并重塑梯度让动作获得清晰信号,解决长horizon规划中梯度条件变差、损失景观充满局部极小等难题。
Hyatt 在其全球员工队伍中部署 ChatGPT Enterprise,采用 GPT-5.4 和 Codex 模型提升生产力、运营效率和宾客体验。OpenAI 为本次企业级 AI 落地提供技术支持。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大语言模型中以可扩展方式识别驱动模型行为的特征交互。方法借助信号处理与编码理论,基于稀疏性与低阶性假设将指数级搜索重构为可解的稀疏恢复问题;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能,可应用于特征归因、数据归因与模型组件归因等可解释性任务。
Demis Hassabis 回顾 AlphaGo 2016 年以"第 37 手"击败围棋世界冠军李世石十周年,称这一突破开启了现代 AI 时代。其后 AlphaFold 预测了 2 亿个蛋白质结构并于 2024 年获诺贝尔化学奖,全球超 300 万研究者在使用;AlphaProof 和 Gemini Deep Think 先后在 IMO 取得银牌和金牌。
Nano Banana 2(Gemini 3.1 Flash Image)是 Google DeepMind 发布的最新图像生成模型,将 Pro 级能力与 Flash 速度结合。
推荐理由:Nano Banana 2 把 Pro 级能力下放到 Flash 速度,读者可对比 Pro 与 2 的能力侧重,挑选适合自己工作流的版本。
Google DeepMind 推出音乐生成模型 Lyria 3,已在 Gemini app 内以 beta 形式上线,支持用文字或图片生成最长 30 秒的个性化音乐曲目。
推荐理由:Lyria 3 在 Gemini app 内提供文图生 30 秒音乐的能力,读者可据此了解自动写词、风格控制和 SynthID 水印的具体落地方式。
Google Research 提出 MapTrace 合成数据生成管线,用于教多模态大语言模型(MLLM)在地图上追踪路径。该管线利用 Gemini 2.5 Pro 与 Imagen-4 生成多样化地图,并由 MLLM 充当 Mask Critic 与 Path Critic 把关质量,最终产出 200 万组带标注问答对并开源。
Google DeepMind 宣布与印度政府及机构建立"国家 AI 合作"计划,将 AlphaGenome、AI Co-scientist、Earth AI、AlphaFold 等前沿模型提供给印度科研人员;同步启动 3000 万美元的 Google.org Impact Challenge: AI for Science。
Google DeepMind 上线 Project Genie 实验原型,基于 Genie 3 世界模型构建,面向 18 岁以上美国 Google AI Ultra 订阅者开放。该 Web 应用由 Genie 3、Nano Banana Pro 与 Gemini 共同驱动,支持通过文字与图像提示创建可实时生成路径的可探索世界,并可在已有世界基础上进行二次创作,单次生成时长上限 60 秒。
Google Research 在 EMNLP 2025 发表的论文提出分解式两阶段流程,先逐屏总结用户操作,再从屏幕摘要序列中提取意图,让小型多模态大语言模型可在设备端完成用户意图理解。该方法在移动端和网页轨迹上均优于 CoT 提示与端到端微调;其中 Gemini 1.5 Flash 8B 配合分解流程即可达到与 Gemini 1.5 Pro 相当的 F1 分数,同时显著降低成本与延迟。
OpenAI 与盖茨基金会联合启动 Horizon 1000 项目,投入 5000 万美元在非洲推进基层医疗医疗 AI 能力。项目计划到 2028 年覆盖 1,000 家诊所,目前为试点阶段。
The original title is quite abstract and doesn't explicitly say "发布" or "推出". It's more of an analysis/opinion piece about OpenAI's business model. Per rule 5。
OpenAI 启动新一轮 RFP 提案征集,旨在通过加速美国本土制造强化美国 AI 供应链,同时推动就业增长并扩展 AI 基础设施规模。
OpenAI 与 Cerebras 达成合作,新增 750MW 高速 AI 算力,用于降低推理延迟,让 ChatGPT 在实时 AI 工作负载下响应更快。
Zenken 在全公司部署 ChatGPT Enterprise,显著提升销售业绩、缩短提案准备时间并提高中标率。借助 AI 工作流支持,精简团队可为客户提供更个性化、高效的销售互动。
NeuralGCM 在 Science Advances 发表新版论文,直接以 NASA 2001–2018 年卫星降水观测训练混合 AI-物理模型,在 15 天天气预报与多年代气候模拟上均优于传统物理模型。相比 IPCC 报告所用领先工具,平均误差降低 40%,对最强 0.1% 极端降水及日变化周期改进尤为显著。
NeurIPS 2025 论文提出基于互信息的成像系统评估与设计框架,以信息量统一替代分辨率、信噪比等传统指标。方法利用已知噪声物理直接计算噪声熵,用概率模型(如 PixelCNN)估计测量分布,在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了信息估计对解码器性能的预测能力。
OpenAI 与 SoftBank Group 宣布与 SB Energy 合作建设多吉瓦级 AI 数据中心园区,其中包含 Stargate 计划下位于德州的 1.2 GW 设施。
Datadog 采用 OpenAI 的 Codex 进行系统级代码审查。OpenAI 与 Datadog 联合发布品牌素材展示该用例场景。
"OpenAI 发布面向医疗行业的 OpenAI for Healthcare,提供支持 HIPAA 合规的企业级 AI。该产品旨在减轻医护人员行政负担,并为临床工作流提供支持。
Tolan 基于 GPT-5.1 构建了一款语音优先的 AI 陪伴产品,结合低延迟响应、实时上下文重建与记忆驱动的人格机制,使语音对话更加自然流畅。
OpenAI 推出 ChatGPT Health,一个连接用户健康数据与应用的专用 ChatGPT 体验,主打隐私保护和医师参与设计。原文仅提供摘要,更多功能细节与可用范围未在材料中给出。
OpenAI 宣布 Grove Cohort 2 创始人计划开放申请,为期 5 周,面向从零创意到已有产品的各阶段创始人。参与者可获 $50K API credits、早期 AI 工具访问权限,以及 OpenAI 团队的实战指导。