AI 语音公司 ElevenLabs 估值翻倍至 220 亿美元
AI 语音初创公司 ElevenLabs 启动 3 亿美元员工股权二次回购,将公司估值从此前 110 亿美元翻倍至 220 亿美元。该轮由 Wellington 和 T. Rowe Price 牵头购买员工已归属股份,是公司 2022 年成立以来第二次同类操作,也是高估值 AI 创业公司用流动性留住员工的典型做法。
AI 语音初创公司 ElevenLabs 启动 3 亿美元员工股权二次回购,将公司估值从此前 110 亿美元翻倍至 220 亿美元。该轮由 Wellington 和 T. Rowe Price 牵头购买员工已归属股份,是公司 2022 年成立以来第二次同类操作,也是高估值 AI 创业公司用流动性留住员工的典型做法。
助听科技初创公司 Legato 宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向存在轻度至中度听力损失的成年人。该眼镜采用 AI 系统区分人声与背景噪音,搭配开放式双扬声器设计,在距耳朵几英寸处可将外泄声音降低 99%,所有音频处理均在本地完成且不配备摄像头。
Suno 推出名为 Speech 的新功能,可在生成语音旁白的同时一并输出背景音乐,已在网页和移动端进入公开测试。该功能提供 Simple(提示词描述)和 Advanced(自定义脚本)两种模式,单条生成最长约 8 分钟,并可调节语音性别、风格和变化度,也可关闭背景音乐仅输出纯净人声。
Microsoft AI 发布 MAI-Transcribe-2-Streaming 实时转写模型与两款 MAI-Voice-2.1 语音合成模型,分别主打低延迟多语种转写和跨语种一致音色合成。
Tavus推出其称为首个"人机交互模型"(HIM)的Griffin,在1分钟视频通话后48%的参与者将其误认为真人,优于此前系统最高的2%。在Nvidia进行的音视频对话拟人度测试中,Griffin得分3.83,接近真人3.92,远高于此前最佳AI模型的2.80;轻量版Griffin-Lite已向部分测试者开放研究预览。
Airbnb 联合创始人兼 CEO Brian Chesky 在访谈中表示,AI 智能体需要自己的操作系统,当前应用与 OS 并未真正为 AI 做好准备。Chesky 认为消费级 AI 尚未被破解,核心障碍在于缺乏面向 AI 的底层基础设施;Airbnb 正让自身应用更智能体化、构建更丰富的界面控制,并计划今年秋季推出用于搜索和客服的语音智能体。
Google DeepMind 在 Gemini 3.8 Live 中推出 Live Avatar 功能,把近实时视频生成与原生语音对话结合,为企业场景提供带口型同步、自然表情和流畅轮换的对话体验。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。
推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。
推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。
🤗 Datasets 是一个开源音频数据集下载与预处理库,可通过一行 Python 代码完成加载。Hugging Face Hub 上托管有 77 个语音识别数据集和 28 个音频分类数据集,文章以 GigaSpeech 为例演示 load_dataset 用法。库内置 Dataset Preview 可在线试听前 100 个样本,并支持流式模式处理大规模数据。