Microsoft AI 发布面向语音智能体的转写与语音合成新模型
Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型与两款 MAI-Voice-2.1 语音合成模型,分别主打低延迟多语种转写和跨语种一致音色合成。
Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型与两款 MAI-Voice-2.1 语音合成模型,分别主打低延迟多语种转写和跨语种一致音色合成。
Tavus推出其称为首个"人机交互模型"(HIM)的Griffin,在1分钟视频通话后48%的参与者将其误认为真人,优于此前系统最高的2%。在Nvidia进行的音视频对话拟人度测试中,Griffin得分3.83,接近真人3.92,远高于此前最佳AI模型的2.80;轻量版Griffin-Lite已向部分测试者开放研究预览。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。
推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。