跳到正文

#语音

今日 5 条
今天10月2日周五
  1. TechCrunch · AI55

    AI 语音公司 ElevenLabs 估值翻倍至 220 亿美元

    AI 语音初创公司 ElevenLabs 启动 3 亿美元员工股权二次回购,将公司估值从此前 110 亿美元翻倍至 220 亿美元。该轮由 Wellington 和 T. Rowe Price 牵头购买员工已归属股份,是公司 2022 年成立以来第二次同类操作,也是高估值 AI 创业公司用流动性留住员工的典型做法。

  2. TechCrunch · AI40

    Legato 推出 AI 助听眼镜 Legato Frames,起售价 999 美元

    助听科技初创公司 Legato 宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向存在轻度至中度听力损失的成年人。该眼镜采用 AI 系统区分人声与背景噪音,搭配开放式双扬声器设计,在距耳朵几英寸处可将外泄声音降低 99%,所有音频处理均在本地完成且不配备摄像头。

  3. The Verge · AI55

    Suno 推出 Speech 功能,可同时生成语音与背景音乐

    Suno 推出名为 Speech 的新功能,可在生成语音旁白的同时一并输出背景音乐,已在网页和移动端进入公开测试。该功能提供 Simple(提示词描述)和 Advanced(自定义脚本)两种模式,单条生成最长约 8 分钟,并可调节语音性别、风格和变化度,也可关闭背景音乐仅输出纯净人声。

10月1日周四
  1. TechCrunch · AI51

    Brian Chesky 访谈:AI 智能体需要自己的操作系统

    Airbnb 联合创始人兼 CEO Brian Chesky 在访谈中表示,AI 智能体需要自己的操作系统,当前应用与 OS 并未真正为 AI 做好准备。Chesky 认为消费级 AI 尚未被破解,核心障碍在于缺乏面向 AI 的底层基础设施;Airbnb 正让自身应用更智能体化、构建更丰富的界面控制,并计划今年秋季推出用于搜索和客服的语音智能体。

9月25日周五
9月23日周三
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,支持通过自然语言提示从零创建自定义声音、基于 30 秒样本复制人声,并提供 2000+ 现成声音库与 100+ 语言覆盖。

    推荐理由:原文详细列出了两款新 TTS 模型的声音设计、复制与多语言能力,并给出 Hume AI 基准成绩,可对照此前 3.1 Flash TTS 评估实际提升幅度。

9月16日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者兼顾成本与规模,后者面向高复杂度任务并支持边推理边说话。

    推荐理由:原文给出了两款实时语音模型的多项基准成绩和面向开发者、企业的接入入口,读者可以据此对比现有同类方案的能力差异。

12月15日周四
  1. Hugging Face Blog44

    Hugging Face 🤗 Datasets 音频数据集完全指南

    🤗 Datasets 是一个开源音频数据集下载与预处理库,可通过一行 Python 代码完成加载。Hugging Face Hub 上托管有 77 个语音识别数据集和 28 个音频分类数据集,文章以 GigaSpeech 为例演示 load_dataset 用法。库内置 Dataset Preview 可在线试听前 100 个样本,并支持流式模式处理大规模数据。