【开源】Radio Dataset Utility and Organizer (RaDOU) 自动采集电台语音并制作 ASR 训练数据集 (STT DataSet)

Davon 2026-09-13 00:48 1



本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出








最近做了一个小工具 RaDUO(Radio Dataset Utility and Organizer)。


主要是把网络电台的直播流自动录下来,切成短音频,再通过 STT 转成文字,整理成可以用于 ASR 研究和训练的数据集。


支持:



  • 多个电台同时采集

  • 自动切分音频

  • 多种 STT Provider

  • 语言、台站、音频质量等 metadata

  • CSV / JSONL / Excel 导出

  • 自带 GUI 管理整个流程


目前已经开源,有兴趣做语音识别、ASR dataset 或多语言语音数据收集的可以看看。这个项目是个伏笔哈哈哈,我接下来有计划可能自己搞/Fine Tunning STT模型吧(也在学习中)…


懒人包:

电台直播 > 自动录音 > 切分语音 > STT > 整理 metadata > 导出数据集


ermm, 怎么说 也算是一个蒸馏工具毕竟也可以使用已有STT模型替你Transcrripts。毕竟个人来说没法能够搞出几万小时的Dataset嘛,所以只能靠这种方式和人类参与到其中来判定和筛选等等。


GitHub 项目地址:



个人 Project 综合:

最新回复 (3)
  • 莱咖 09-13 01:26
    1

    别说,这个还是挺有用的,特别是个人训练确实数据集是个大问题

  • Davon 楼主 09-13 14:52
    2

    嗯嗯,这就是为什么搞个这个方便收集数据集

  • Davon 楼主 09-13 14:54
    3

    我感觉我这个项目也算是小众^-^ 很少人会去收集STT 数据集,也希望对其他人有帮助吧

* 帖子来源Linux.do
返回