AI 日报 · 2026 年 10 月 7 日 · 星期三
AI日报
Mistral 发布 1T 参数原生多模态大模型 Mistral Large 4 公开预览版,权重计划月底开源
今日多家厂商集中更新产品与生态:Mistral 发布 1T 总参数、49B 激活参数的原生多模态大模型 Mistral Large 4 公开预览版,并计划月底开源权重;GLM 5.3(753B 参数 MoE)正式上线 Amazon Bedrock。OpenAI 与合同管理平台 Ironclad 合作,将 GPT-6 Astra 训练用于合同工作流智能体;Anthropic 将 Cyber Verification Program 整合为三层准入,面向安全团队开放 Claude Opus 5.5 等模型。
模型发布/更新
Mistral 推出 Mistral Large 4 公开预览版,1T 总参数原生多模态大模型
Mistral 推出 1T 总参数、49B 激活参数的原生多模态大模型 Mistral Large 4 公开预览版,权重计划月底开源,API 已上线 Mistral Studio。
OpenAI 与 Ironclad 合作推进 GPT-6 Astra 在合同工作流上的智能体能力
OpenAI 与合同管理平台 Ironclad 合作,将 GPT-6 Astra 训练用于合同相关智能体任务。在 11 项研究任务上,Astra 平均得分 55.0%、GPT-5.6 Sol 为 41.6%,每次尝试平均用时由 37.0 分钟降至 19.2 分钟。团队基于 SEC EDGAR 公开合同生成合成训练任务并采用强化学习训练,OpenAI 同时邀请更多软件公司参与类似合作。
Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2
Google DeepMind 发布 EmbeddingGemma 2 多模态嵌入模型,740M 参数、Apache 2.0 协议,在 MTEB Code 上从 68.76 提升至 78.68。
GLM 5.3 上线 Amazon Bedrock
GLM 5.3 已在 Amazon Bedrock 上线,开发者可通过托管 API 使用 Z.ai 发布的这款 753B 参数 MoE 模型,主要面向编码与长链路智能体场景。
产品发布/更新
Anthropic 扩展 Cyber Verification Program,分三层向安全团队开放 Claude Opus 5.5 等模型
Anthropic 将 Cyber Verification Program(CVP)整合为 Defense Access、Red Team Access、Specialized Access 三层准入,面向安全团队开放 Claude Opus 5.5、Claude Sonnet 5.5 与 Claude Mythos 5.1 等模型,按级别放宽拦截限制。
论文研究
论文提出校准式真实图像认证方法,应对深度伪造检测随生成器迭代失效
这篇论文评测了 20 种深度伪造检测器与近四年发布的 10 种生成器,发现检测准确率随时间从 99.5% 降至 76%,并会被对抗扰动压至 2% 以下。作者将这一不可靠归因于生成器能精确复刻真实内容,提出一种输出校准式可否认性预测的检测范式,在已知生成器集合上将误认证率约束在 1% 以内。
基础模型借鉴训练数据中的 token 线索即可获得推理能力
该研究指出,在基础模型回复开头固定特定 token 线索,可使其在数学和编程推理任务上达到与 RL 训练版本相当的水平。回复前的 '. Okay' 线索将 Olmo-3-7B 的 MATH-500 pass@1 从 42% 提升至 78%,'Alright,' 线索将 Qwen3-14B 从 72% 提升至 87%。