上海AI实验室发布Atria Dawn Preview预览版智能体模型
上海人工智能实验室发布新一代智能体模型 Atria Dawn Preview 预览版,基于 744B 参数的 MoE GLM-5.2 基础模型,256K 上下文,仅支持文本输入,覆盖检索发现、构建创造、交付落地和网络安全四类任务。
推荐理由:在搜索、编码、工具使用、生产力和安全等任务上同时给出与多个主流模型的横向对比数据,读者可以据此评估其相对位置。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
上海人工智能实验室发布新一代智能体模型 Atria Dawn Preview 预览版,基于 744B 参数的 MoE GLM-5.2 基础模型,256K 上下文,仅支持文本输入,覆盖检索发现、构建创造、交付落地和网络安全四类任务。
推荐理由:在搜索、编码、工具使用、生产力和安全等任务上同时给出与多个主流模型的横向对比数据,读者可以据此评估其相对位置。
千问(Qwen)开源统一文生图与图像编辑模型 Qwen-Image-2.1,视觉生成部分采用 7B 参数与 32 层 Single-Stream DiT 结构。
推荐理由:原文给出了 7B 参数 DiT 架构与原生 RGBA、参考图编辑等能力细节,可作为对比同类图像生成模型的参考。
DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,采用 CED 架构、CSA2 与 FP4 KV cache 等压缩手段,将全局 KV cache 占用压至每 token 890 字节,相对 DeepSeek-V4-Flash 和 DeepSeek-V1 分别缩减约 4 倍与 437 倍。
推荐理由:原文给出 CED 架构、CSA2 与 FP4 KV cache 等具体压缩设计,并对照 Opus-5.0、GPT-5.6 等前沿模型列出 agentic 基准成绩,读者可据此评估压缩策略对推理成本的实际收益。
Google DeepMind 与 Google Research 推出 WeatherNext 3 天气预报 AI 模型,是其迄今最先进且精度最高的全球天气模型。
推荐理由:对比上一代在分辨率、刷新频率和降水精度上的提升,以及在搜索、Gemini、地图等产品中的落地范围。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型,分别面向通用推理编码与网络安全防御。
推荐理由:同一价位下编码与推理能力相对前代明显提升,且同步给出安全专用版的基准与开放范围,读者可据此做选型对照。
Google Research发布时序基础模型TimesFM-3,首次原生支持多变量零样本预测。模型拥有3.3亿参数,在超过1万亿时间点的真实与合成数据上预训练。
推荐理由:对比了TimesFM-3与Chronos-2、Toto 2.0等模型在Gift-Eval等基准上的排名,读者可据此了解多变量时序基础模型的当前能力。
DeepSeek 发布 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,在 V4-Flash 架构上加入视觉模块继续训练。
推荐理由:仓库同时给出与 Opus-4.8 的多模态 Agent 基准对比和开源推理实现,读者可据此判断它在 V4 系列里的相对位置。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、4K 放大和视频参考等视频生成控制能力。场景延长可参考最多 10 秒上文,单次累计上限 40 秒;360p 预览生成速度比 720p 快 60%,成本降至三分之一。
推荐理由:原文列出了 Omni 1.1 Flash 在场景延长、首尾帧插值和 4K 放大等具体控制能力上的更新,可帮助开发者判断它能接入哪些视频生产工作流。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,主打实时转写与智能语音交互,提供实时流式(Live API)和预录音频(Interactions API)两种接入方式。
推荐理由:给出了 WER、延迟改善幅度和多语言覆盖等具体基准,并区分了实时与预录两种接入方式,便于评估在语音产品中的替换价值。
IBM 发布 Granite 4.2 推理模型系列,提供 3B/8B/30B 三种 dense decoder-only 规格,以 Apache 2.0 开源。
推荐理由:详细拆解了 Granite 4.2 的架构与多阶段 RL 训练流程,包含 GRPO 异步训练和真实环境智能体 RL 设计,可作为开源推理模型训练方法参考。
智谱发布开源模型 GLM-5.3,与 GLM-5.2 共享基座,全部增益来自后训练。在自研 Z.ai Code Bench 上较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 取得开源 SOTA。
推荐理由:在同一份基准表中与八款模型横向打分,并附详细评测参数与防作弊设置,便于直接复现同口径对比。
智谱发布 GLM-5.3-Flash,是 GLM-5 系列首个原生多模态模型,总参数 320B、激活 18B,价格为 GLM-5.2 的十分之一,编码与智能体基准接近 Claude Opus 4.8。
推荐理由:读者可以横向比较 GLM-5.3-Flash 与 Claude Opus 4.8 在编码与智能体基准上的差距,并参考其混合注意力与稀疏激活设计评估部署成本。
智谱发布开源模型 GLM-5.3,能力提升全部来自对 GLM-5.2 的后训练,底层基础模型未变;自研 Z.ai Code Bench 较 GLM-5.2 提升 50%,Terminal Bench 3.0 和 Agents' Last Exam 取得开源 SOTA,CyberGym 漏洞发现达到 SOTA,漏洞利用类基准较 GLM-5.2 翻倍以上。
推荐理由:原文列出了 GLM-5.3 在十余项编码与 Agent 基准上与闭源、开源模型的逐项分数,可作为评估开源前沿模型能力的对照参考。
千问(Qwen)在 Hugging Face 开源 Qwen3.8-Flash-Next 的 FP8 量化权重,称其为 Qwen4 架构的实验性预览版本。该模型总参数 125B、激活 6B,并附带 51B n-gram embedding 与 4B MTP,原生 262,144 tokens 上下文可通过 YaRN 扩展至 1,000,000 tokens。
推荐理由:作为 Qwen4 架构的实验预览,文中给出的稀疏注意力与 N-gram 嵌入设计可与既有 MoE 路线横向对照。
DeepSeek 正式发布 DeepSeek-V4-Pro 0813,在预览版基础上挂载 DSpark 推测解码模块,重点强化智能体能力。该模型在 HLE 上得分 42.7/60.0(无工具/有工具),Terminal Bench 2.1 达 87.9,DeepSWE 62.7。
推荐理由:正文给出与同代模型的基准对比和 vLLM/SGLang 部署方式,读者可直接评估其相对位置并复现推理流程。
Meta 发布并开源 30B 多模态模型 Muse Glimmer(Apache 2.0),由 Muse 蒸馏而来,主打本地智能体场景,由 Hugging Face 在发布当日同步接入 transformers、llama.cpp、vLLM 与 Inference Endpoints,并支持基于 DFlash 的推测解码加速。
推荐理由:原文汇总 30B 多模态模型的关键基准、DFlash 加速与同日多框架支持,便于评估其在本地智能体工作流中的可用性。
MiniMax 开源发布 Music 3 音乐生成模型,可根据歌词和音乐描述生成长达 5 分钟的 32 kHz 立体声 WAV 完整歌曲。模型采用 8B Global LLM 与 0.6B Local LLM 的分层自回归架构,Global LLM 由 Qwen3-8B 初始化,并配合 Flow Matching 与 Flow-VAE 的连续隐状态合成模块。
推荐理由:给出了 8B Global LLM 与 0.6B Local LLM 的分层架构与 Flow Matching 合成路径,便于参考音乐生成模型的工程设计。
Google DeepMind 在 Nature 论文中宣布其 WeatherNext AI 模型在气旋路径、强度和风结构预报上取得 state-of-the-art 准确度,其三天预报质量相当于此前模型的两天预报,平均带来超过 24 小时的预报提前量,约等于过去二十年气象领域的十年进步。
推荐理由:WeatherNext Cyclones 把气旋路径和强度的预报提前量提升超过一天,并已开源代码与权重,可被气象机构直接用于业务预报。
MiniMax 在 Hugging Face 开源发布全模态生成系统 MiniMax-H3,统一理解文本、图像、视频与音频,并可生成最高 2K 分辨率、最长 15 秒且含原生立体声的视频。
推荐理由:原文给出 H3 三模块拆分、33B Omni-Transformer 架构与 SGLang、diffusers 部署命令,便于复现 768p 与 2K 生成流程。
智谱发布开源旗舰模型 GLM-5.2,主打 1M 上下文长程任务能力,并以 MIT 协议无地区限制开源。模型引入 IndexShare 稀疏注意力架构在 1M 上下文下将每 token FLOPs 减少 2.9 倍,并提供多档思考强度平衡性能与延迟;基准覆盖 HLE、SWE-bench Pro、MCP-Atlas、Terminal-Bench 2.1 等推理、代码与 Agentic 任务。
推荐理由:原文同时给出 1M 上下文、IndexShare 架构细节和与多款前沿模型的横向基准分数,读者可以据此评估 GLM-5.2 在长程任务上的相对位置。