跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 41–60 条 · 共 71 条
9月15日周二
  1. 书生 InternLM60

    上海AI实验室发布Atria Dawn Preview预览版智能体模型

    上海人工智能实验室发布新一代智能体模型 Atria Dawn Preview 预览版,基于 744B 参数的 MoE GLM-5.2 基础模型,256K 上下文,仅支持文本输入,覆盖检索发现、构建创造、交付落地和网络安全四类任务。

    推荐理由:在搜索、编码、工具使用、生产力和安全等任务上同时给出与多个主流模型的横向对比数据,读者可以据此评估其相对位置。

9月14日周一
9月10日周四
  1. DeepSeek80

    DeepSeek 发布 DeepSeek-V4.1-Flash,主打 KV cache 极限压缩

    DeepSeek 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,采用 CED 架构、CSA2 与 FP4 KV cache 等压缩手段,将全局 KV cache 占用压至每 token 890 字节,相对 DeepSeek-V4-Flash 和 DeepSeek-V1 分别缩减约 4 倍与 437 倍。

    推荐理由:原文给出 CED 架构、CSA2 与 FP4 KV cache 等具体压缩设计,并对照 Opus-5.0、GPT-5.6 等前沿模型列出 agentic 基准成绩,读者可据此评估压缩策略对推理成本的实际收益。

9月3日周四
9月1日周二
  1. Google Research64

    TimesFM-3:Google Research发布支持多变量零样本预测的时序基础模型

    Google Research发布时序基础模型TimesFM-3,首次原生支持多变量零样本预测。模型拥有3.3亿参数,在超过1万亿时间点的真实与合成数据上预训练。

    推荐理由:对比了TimesFM-3与Chronos-2、Toto 2.0等模型在Gift-Eval等基准上的排名,读者可据此了解多变量时序基础模型的当前能力。

8月31日周一
8月28日周五
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Omni 1.1 Flash 带来场景延长、首尾帧插值与 4K 放大

    Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、4K 放大和视频参考等视频生成控制能力。场景延长可参考最多 10 秒上文,单次累计上限 40 秒;360p 预览生成速度比 720p 快 60%,成本降至三分之一。

    推荐理由:原文列出了 Omni 1.1 Flash 在场景延长、首尾帧插值和 4K 放大等具体控制能力上的更新,可帮助开发者判断它能接入哪些视频生产工作流。

8月27日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.5 Transcribe 语音转文本模型

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,主打实时转写与智能语音交互,提供实时流式(Live API)和预录音频(Interactions API)两种接入方式。

    推荐理由:给出了 WER、延迟改善幅度和多语言覆盖等具体基准,并区分了实时与预录两种接入方式,便于评估在语音产品中的替换价值。

8月25日周二
  1. 智谱 GLM71

    智谱发布开源模型 GLM-5.3,强化编码与漏洞利用能力

    智谱发布开源模型 GLM-5.3,与 GLM-5.2 共享基座,全部增益来自后训练。在自研 Z.ai Code Bench 上较 GLM-5.2 提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam、CyberGym 取得开源 SOTA。

    推荐理由:在同一份基准表中与八款模型横向打分,并附详细评测参数与防作弊设置,便于直接复现同口径对比。

  2. 智谱 GLM70

    智谱发布 GLM-5.3-Flash 多模态模型,320B 总参数 18B 激活

    智谱发布 GLM-5.3-Flash,是 GLM-5 系列首个原生多模态模型,总参数 320B、激活 18B,价格为 GLM-5.2 的十分之一,编码与智能体基准接近 Claude Opus 4.8。

    推荐理由:读者可以横向比较 GLM-5.3-Flash 与 Claude Opus 4.8 在编码与智能体基准上的差距,并参考其混合注意力与稀疏激活设计评估部署成本。

  3. 智谱 GLM69

    智谱发布开源模型 GLM-5.3,主打编码与漏洞利用能力提升

    智谱发布开源模型 GLM-5.3,能力提升全部来自对 GLM-5.2 的后训练,底层基础模型未变;自研 Z.ai Code Bench 较 GLM-5.2 提升 50%,Terminal Bench 3.0 和 Agents' Last Exam 取得开源 SOTA,CyberGym 漏洞发现达到 SOTA,漏洞利用类基准较 GLM-5.2 翻倍以上。

    推荐理由:原文列出了 GLM-5.3 在十余项编码与 Agent 基准上与闭源、开源模型的逐项分数,可作为评估开源前沿模型能力的对照参考。

8月24日周一
  1. Qwen73

    千问开源 Qwen3.8-Flash-Next 模型,作为 Qwen4 架构实验预览

    千问(Qwen)在 Hugging Face 开源 Qwen3.8-Flash-Next 的 FP8 量化权重,称其为 Qwen4 架构的实验性预览版本。该模型总参数 125B、激活 6B,并附带 51B n-gram embedding 与 4B MTP,原生 262,144 tokens 上下文可通过 YaRN 扩展至 1,000,000 tokens。

    推荐理由:作为 Qwen4 架构的实验预览,文中给出的稀疏注意力与 N-gram 嵌入设计可与既有 MoE 路线横向对照。

8月13日周四
  1. DeepSeek76

    DeepSeek-V4-Pro 0813 正式发布,新增 DSpark 推测解码模块

    DeepSeek 正式发布 DeepSeek-V4-Pro 0813,在预览版基础上挂载 DSpark 推测解码模块,重点强化智能体能力。该模型在 HLE 上得分 42.7/60.0(无工具/有工具),Terminal Bench 2.1 达 87.9,DeepSWE 62.7。

    推荐理由:正文给出与同代模型的基准对比和 vLLM/SGLang 部署方式,读者可直接评估其相对位置并复现推理流程。

8月10日周一
  1. Hugging Face Blog74

    Meta 开源 30B 多模态模型 Muse Glimmer,主打本地智能体场景

    Meta 发布并开源 30B 多模态模型 Muse Glimmer(Apache 2.0),由 Muse 蒸馏而来,主打本地智能体场景,由 Hugging Face 在发布当日同步接入 transformers、llama.cpp、vLLM 与 Inference Endpoints,并支持基于 DFlash 的推测解码加速。

    推荐理由:原文汇总 30B 多模态模型的关键基准、DFlash 加速与同日多框架支持,便于评估其在本地智能体工作流中的可用性。

8月7日周五
  1. MiniMax60

    MiniMax 开源 Music 3 音乐生成模型,支持最长 5 分钟完整歌曲

    MiniMax 开源发布 Music 3 音乐生成模型,可根据歌词和音乐描述生成长达 5 分钟的 32 kHz 立体声 WAV 完整歌曲。模型采用 8B Global LLM 与 0.6B Local LLM 的分层自回归架构,Global LLM 由 Qwen3-8B 初始化,并配合 Flow Matching 与 Flow-VAE 的连续隐状态合成模块。

    推荐理由:给出了 8B Global LLM 与 0.6B Local LLM 的分层架构与 Flow Matching 合成路径,便于参考音乐生成模型的工程设计。

8月6日周四
  1. Google DeepMind68

    Google DeepMind 开源 WeatherNext 2 与 WeatherNext Cyclones,气旋预报提前量提升超一天

    Google DeepMind 在 Nature 论文中宣布其 WeatherNext AI 模型在气旋路径、强度和风结构预报上取得 state-of-the-art 准确度,其三天预报质量相当于此前模型的两天预报,平均带来超过 24 小时的预报提前量,约等于过去二十年气象领域的十年进步。

    推荐理由:WeatherNext Cyclones 把气旋路径和强度的预报提前量提升超过一天,并已开源代码与权重,可被气象机构直接用于业务预报。

7月28日周二
6月16日周二
  1. 智谱 GLM72

    智谱发布 GLM-5.2 旗舰模型,主打 1M 上下文与多档推理强度

    智谱发布开源旗舰模型 GLM-5.2,主打 1M 上下文长程任务能力,并以 MIT 协议无地区限制开源。模型引入 IndexShare 稀疏注意力架构在 1M 上下文下将每 token FLOPs 减少 2.9 倍,并提供多档思考强度平衡性能与延迟;基准覆盖 HLE、SWE-bench Pro、MCP-Atlas、Terminal-Bench 2.1 等推理、代码与 Agentic 任务。

    推荐理由:原文同时给出 1M 上下文、IndexShare 架构细节和与多款前沿模型的横向基准分数,读者可以据此评估 GLM-5.2 在长程任务上的相对位置。