跳到正文
热点事件观察中

tiny-audio 开源语音转文字教学项目发布

1 篇报道1 个报道来源2 天前更新

先了解这件事

AI 综述

alexkroman 发布开源语音转文字教学项目 tiny-audio,将冻结的预训练语音编码器通过小型可训练投影层接入预训练 LLM,只训练约 8000 万参数,整体训练成本约 25 美元。 repo 中发布的模型在 LibriSpeech test-clean 上达到 1.8% WER,在 12 个基准(合计 11,822 条样本)上的平均 WER 为 7.4%。权重为 bf16,运行需约 6GB GPU 或 Apple Silicon 显存。 项目附带 3.5 小时免费课程,讲解编码器、投影层与解码器的组合方式,并覆盖训练、与商用 API 对比评估及发布演示的完整流程;代码量小到可在一个下午读完,笔记本上约 5 分钟即可启动一轮训练。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月10日
  1. Hacker News精选
    tiny-audio 开源语音转文字系统:冻结编码器接 LLM,训练成本约 25 美元

    tiny-audio 是一个开源语音转文字系统,将冻结的预训练语音编码器通过小型可训练投影层接入预训练 LLM,整体训练成本约 25 美元,只需训练约 8000 万参数。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。