跳到正文

全部动态

今日 6 条
今天10月2日周五
  1. TechCrunch · AI48

    亚马逊云科技发布开源决策模型 Strands Decider 2B,灵感来自 TypeSafe 的 Jev

    亚马逊云科技发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在预设选项间快速选择并输出置信度分数。模型完全开源、可本地运行,由 Amazon 杰出工程师 Marc Brooker 主导、从其个人项目孵化而来,通过 Strands Labs 推出。OpenAI 同周推出同类产品,决策模型赛道涌入大量开源项目。

10月1日周四
9月29日周二
  1. Hugging Face Blog69

    NVIDIA 发布开源表格基础模型 Kumo Tabular,覆盖分类与回归

    NVIDIA 发布开源表格基础模型 Kumo Tabular,在单次前向推理中完成表格分类与回归预测,无需训练或特征工程,权重与代码已在 Hugging Face 和 GitHub 开源。

    推荐理由:原文同时给出架构细节与四项表格基准的排名结果,读者可以横向比较它在自身数据规模和列类型下是否值得替换现有方法。

9月23日周三
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。

    推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。

9月16日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。

    推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。

9月3日周四
11月20日周四
  1. Google DeepMind68

    Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成模型

    Google DeepMind 发布基于 Gemini 3 Pro 的高保真图像生成模型 Nano Banana Pro(Gemini 3 Pro Image),已在 Gemini API、Google AI Studio 与 Vertex AI 启动付费预览。

    推荐理由:作为 Nano Banana 的高保真升级,Gemini 3 Pro Image 在分辨率、文本渲染与本地化上给出了具体能力边界,方便开发者对照 2.5 Flash Image 评估取舍。

8月5日周二
3月17日周一
3月7日周五
  1. Mistral AI66

    Mistral AI 发布 Mistral OCR 文档理解 API

    Mistral AI 发布文档理解 API Mistral OCR,输入图片和 PDF,输出有序的图文交错内容,已在 la Plateforme 上线,价格为 1000 pages/$,单节点最高可处理 2000 页/分钟。

    推荐理由:原文附带与主流 OCR 模型的基准对比,读者可以据此横向判断其在多语言文档理解场景中的相对位置。

2月17日周一
  1. Mistral AI40

    Mistral AI 发布 Mistral Saba:24B 参数中东与南亚区域语言模型

    Mistral AI 发布 24B 参数区域语言模型 Mistral Saba,专为中东和南亚训练,支持阿拉伯语及多种印度源语言,泰米尔语等南印度语言表现尤其突出。官方称其准确率优于 5 倍规模的模型,推理速度超过 150 tokens/秒,可通过 API 或单 GPU 系统本地部署。典型场景包括阿拉伯语对话支持、专业领域微调和文化内容创作。