Google DeepMind 发布 Gemini 4 Argon,主打编码与企业长链路任务
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
Google DeepMind 公布新一代前沿模型 Gemini 4 Argon,主打编码、企业知识工作(法律、金融)和网络安全防御等长链路任务。
推荐理由:原文同时披露了 Argon 在编码、企业知识工作与网络安全等长链路场景的关键基准成绩与定价,可供与同类前沿模型横向对比。
Google DeepMind 发布 SynthID Bio,把水印技术扩展到合成生物学,可在蛋白质序列与预测的 3D 结构中嵌入可验证签名,同时保留生物功能。
Google Research 提出 Diffusion Controller 框架,将扩散模型去噪过程重构为连续控制问题,通过一个轻量级"转向阻尼器"附加网络引导生成、保持基础模型冻结不变。其白盒微调版本在 Stable Diffusion v1.4 上对基线模型取得 90% 胜率,并支持对无法修改内部权重的闭源模型进行控制。
Google DeepMind 在 Gemini 3.8 Live 中推出 Live Avatar 功能,把近实时视频生成与原生语音对话结合,为企业场景提供带口型同步、自然表情和流畅轮换的对话体验。
Google Beam 新增加拿大、英国、法国、德国、日本共 5 个国家,覆盖扩展至 6 个国家,由 18 家渠道合作伙伴交付 HP Dimension 设备。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。
推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。
Google 宣布扩展 AI & Economy 研究项目,2025 年诺贝尔经济学奖得主 Philippe Aghion 担任学术顾问,多伦多大学教授 Ajay Agrawal 任访问学者,原麦肯锡全球研究院合伙人 Anu Madgavkar 与宾夕法尼亚大学沃顿商学院教授 Daniel Rock 出任项目主任。
Google 的 Envisioning Studio 与时装设计师 Jane Wade 和 Sergio Hudson 合作,在 AI 创意工坊 Google Flow 中共同开发了两款定制工具,分别用于纽约时装周的造型与秀场设计。
联合国系统推出 UN System Data Commons,一个基于 Data Commons by Google 构建的开源 AI 就绪平台,将分散的全球统计数据整合为可搜索的知识图谱。
Actually the original title structure is "Bypassing inference bottlenecks。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。
Google AI Blog 发布"AI for Societal Impact"主题合集,展示 AI 在疾病早筛与治疗、自然灾害预测、教育扩展和经济机会拓展等关键领域的实际应用案例。该合集汇集了全球研究者和社区合作伙伴的项目,展现专家与本地领导者如何借助 AI 突破让更多人共享技术红利。
Google Research 在 ACL 2026 提出的 ToolGrad 采用"答案优先"范式:先生成工具调用链再反推用户查询,借助文本"梯度"迭代构建 API workflow。
Google Search 推出多项橄榄球新功能,包括实时比赛动态(Live Game Feed)提供逐回合更新与 AI 洞察,可连接 Yahoo Fantasy 和 Sleeper 梦幻账户后在 AI Mode 中获取个性化阵容建议。Live Game Feed 现已在美国英语移动端上线,覆盖职业比赛,本月稍后扩展至大学队;梦幻账户联动同步在美国英语开放。
Google DeepMind 发布 WeatherNext 3 全球天气预报模型,引入实时地球同步卫星观测替代传统 NWP 数据,每小时更新并支持最高 5 公里分辨率。
推荐理由:WeatherNext 3 以实时卫星观测替代 NWP 数据训练,分辨率较前代提升约五倍,中等时效降水精度相对 IMERG 改善最高 60%。
Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 中上线 agentic 视频理解功能,可将 token 消耗降低最多 88%、成本降低最多 66%,分析精度最高提升 7%。
推荐理由:对比传统固定帧率处理方式,原文给出 token 消耗与精度的具体改进幅度,可作为评估新视频管线效果的参考。
Title: "AgentHands: Generating interactive hand gestures for spatially grounded agent conversations in XR" This is a research prototype introduction paper。
Demis Hassabis 回顾 AlphaGo 2016 年以"第 37 手"击败围棋世界冠军李世石十周年,称这一突破开启了现代 AI 时代。其后 AlphaFold 预测了 2 亿个蛋白质结构并于 2024 年获诺贝尔化学奖,全球超 300 万研究者在使用;AlphaProof 和 Gemini Deep Think 先后在 IMO 取得银牌和金牌。
Nano Banana 2(Gemini 3.1 Flash Image)是 Google DeepMind 发布的最新图像生成模型,将 Pro 级能力与 Flash 速度结合。
推荐理由:Nano Banana 2 把 Pro 级能力下放到 Flash 速度,读者可对比 Pro 与 2 的能力侧重,挑选适合自己工作流的版本。
Google DeepMind 推出音乐生成模型 Lyria 3,已在 Gemini app 内以 beta 形式上线,支持用文字或图片生成最长 30 秒的个性化音乐曲目。
推荐理由:Lyria 3 在 Gemini app 内提供文图生 30 秒音乐的能力,读者可据此了解自动写词、风格控制和 SynthID 水印的具体落地方式。
Google Research 提出 MapTrace 合成数据生成管线,用于教多模态大语言模型(MLLM)在地图上追踪路径。该管线利用 Gemini 2.5 Pro 与 Imagen-4 生成多样化地图,并由 MLLM 充当 Mask Critic 与 Path Critic 把关质量,最终产出 200 万组带标注问答对并开源。
Google DeepMind 宣布与印度政府及机构建立"国家 AI 合作"计划,将 AlphaGenome、AI Co-scientist、Earth AI、AlphaFold 等前沿模型提供给印度科研人员;同步启动 3000 万美元的 Google.org Impact Challenge: AI for Science。
Google DeepMind 上线 Project Genie 实验原型,基于 Genie 3 世界模型构建,面向 18 岁以上美国 Google AI Ultra 订阅者开放。该 Web 应用由 Genie 3、Nano Banana Pro 与 Gemini 共同驱动,支持通过文字与图像提示创建可实时生成路径的可探索世界,并可在已有世界基础上进行二次创作,单次生成时长上限 60 秒。
Google Research 在 EMNLP 2025 发表的论文提出分解式两阶段流程,先逐屏总结用户操作,再从屏幕摘要序列中提取意图,让小型多模态大语言模型可在设备端完成用户意图理解。该方法在移动端和网页轨迹上均优于 CoT 提示与端到端微调;其中 Gemini 1.5 Flash 8B 配合分解流程即可达到与 Gemini 1.5 Pro 相当的 F1 分数,同时显著降低成本与延迟。
NeuralGCM 在 Science Advances 发表新版论文,直接以 NASA 2001–2018 年卫星降水观测训练混合 AI-物理模型,在 15 天天气预报与多年代气候模拟上均优于传统物理模型。相比 IPCC 报告所用领先工具,平均误差降低 40%,对最强 0.1% 极端降水及日变化周期改进尤为显著。