# 请问如何将大段音频转化为文字？

**URL:** <https://meta.appinn.net/t/topic/76157>\
**Category:** 问题求助\
**Created:** [2025 年10 月 22 日 04:32 UTC](https://meta.appinn.net/t/topic/76157 "2025-10-22T04:32:40Z")\
**Posts on this page:** 11\
**Page:** 1

<div class="post-metadata">

**Author:** ![0000](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/0000/32/10381_2.png) [@0000](https://meta.appinn.net/u/0000)\
**Post date:** [2025 年10 月 22 日 04:32 UTC](https://meta.appinn.net/t/topic/76157/1 "2025-10-22T04:32:40Z")

</div>

请问如何将大段音频转化为文字？

---

<div class="post-metadata">

**Author:** ![Qingwa](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/qingwa/32/58632_2.png) [@Qingwa](https://meta.appinn.net/u/Qingwa)\
**Post date:** [2025 年10 月 22 日 05:36 UTC](https://meta.appinn.net/t/topic/76157/2 "2025-10-22T05:36:52Z")

</div>

自己托管一个 whisper？

然后让 CPU 或者 GPT 慢慢跑呗（实际上 potplayer 就行:joy:

---

<div class="post-metadata">

**Author:** ![taoran](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/taoran/32/69463_2.png) [@taoran](https://meta.appinn.net/u/taoran)\
**Post date:** [2025 年10 月 22 日 05:50 UTC](https://meta.appinn.net/t/topic/76157/3 "2025-10-22T05:50:57Z")

</div>

> **[GitHub - ggml-org/whisper.cpp: Port of OpenAI's Whisper model in C/C++](https://github.com/ggml-org/whisper.cpp)**
>
> Port of OpenAI's Whisper model in C/C++

---

<div class="post-metadata">

**Author:** ![jingouwangzi](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/jingouwangzi/32/44279_2.png) [@jingouwangzi](https://meta.appinn.net/u/jingouwangzi)\
**Post date:** [2025 年10 月 22 日 06:37 UTC](https://meta.appinn.net/t/topic/76157/4 "2025-10-22T06:37:55Z")

</div>

通义听悟免费使用

---

<div class="post-metadata">

**Author:** ![xiaokonglong](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/xiaokonglong/32/908_2.png) [@xiaokonglong](https://meta.appinn.net/u/xiaokonglong)\
**Post date:** [2025 年10 月 22 日 06:59 UTC](https://meta.appinn.net/t/topic/76157/5 "2025-10-22T06:59:13Z")

</div>

我测试过很多办法.

免费的, 收费的.

收费的话, 会有一些短时间的免费试用. 比如讯飞等等。  
免费的话, 最常见的就是whisper, 但是它的数据不好, 不论是小模型还是大模型, 中文效果都不好.

目前, 我主要是用的 CapsWriter . 这应该目前自建模型里速度/质量相对比较好的.

> [@CapsWriter-Offline，可能是最好用的 PC 端语音输入工具（离线识别）](https://meta.appinn.net/t/topic/44043):
>
> CapsWriter-Offline 这是 CapsWriter-Offline ，一个 PC 端的语音输入工具。 运行后，只要按下键盘上的 大写锁定键，就会开始录音，当你松开 大写锁定键 时，就会识别你的录音，并将识别结果立刻输入。 视频教程：[CapsWriter-Offline 电脑端离线语音输入工具](https://www.bilibili.com/video/BV1fo4y1T7KN/)特性 完全离线、低延迟、高准确率、中英混输、自动阿拉伯数字、自动调整中英间隔 热词功能：可以在 hot-en.txt hot-zh.txt hot-rule.txt 中添加三种热词，客户端动态载入 日记功能：默认每次录音识别后，识别结果记录在 年份/月份/日期.md ，录音文件保存在 年份/月份/assets 关键词日记：识别结果若以关键词开头，会被额外记录在 年份/月份/日期-关键词.md，关键词在 keywords.txt 中定义 服务端、客户端分离，可以让一台主机为局域网内的电脑提供识别服务 用文本编辑器打开 core\_client.py ，可以编辑服务端地址、快捷键、录音开关…… 懒人包 对于 Windows10 64 位用户，我打包了 exe …

---

<div class="post-metadata">

**Author:** ![BHznJNs](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/bhznjns/32/63097_2.png) [@BHznJNs](https://meta.appinn.net/u/BHznJNs)\
**Post date:** [2025 年10 月 22 日 07:08 UTC](https://meta.appinn.net/t/topic/76157/6 "2025-10-22T07:08:15Z")

</div>

直接用 Gemini，AI Studio 的免费 Gemini 2.5 Pro

---

<div class="post-metadata">

**Author:** ![shadows](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/shadows/32/17001_2.png) [@shadows](https://meta.appinn.net/u/shadows)\
**Post date:** [2025 年10 月 22 日 07:25 UTC](https://meta.appinn.net/t/topic/76157/7 "2025-10-22T07:25:57Z")

</div>

从别的地方收集的信息

> **[Soniox | Soniox v3](https://soniox.com/blog/2025-10-21-soniox-v3/)**
>
> Soniox v3 is our most advanced speech AI yet — designed for accuracy, fluency, and speed at scale.

官网注册赠送200刀额度，据说效果是第一梯队

还有qwen3-asr，阿里云百炼有免费额度

调用B站和剪映接口的

> **[GitHub - WEIFENG2333/AsrTools: ✨ AsrTools: Smart Voice-to-Text Tool | Efficient...](https://github.com/WEIFENG2333/AsrTools)**
>
> ✨ AsrTools: Smart Voice-to-Text Tool | Efficient Batch Processing | User-Friendly Interface | No GPU Required | Supports SRT/TXT Output | Turn your audio into accurate text in an instant!

elevenlabs

> **[GitHub - cylind/scribe2srt: 一款基于 PySide6 和 ElevenLabs API...](https://github.com/cylind/scribe2srt)**
>
> 一款基于 PySide6 和 ElevenLabs API 的桌面应用，能将音视频或JSON转录稿智能地转换为高质量SRT字幕。特别为中、日、韩、英等语言优化了排版规则。

---

<div class="post-metadata">

**Author:** ![kero990](https://meta-edge.appinn.com/letter_avatar_proxy/v4/letter/k/4da419/32.png) [@kero990](https://meta.appinn.net/u/kero990)\
**Post date:** [2025 年10 月 22 日 13:34 UTC](https://meta.appinn.net/t/topic/76157/8 "2025-10-22T13:34:24Z")

</div>

硅基流动提供SenseVoiceSmall模型的API，并且免费访问，甚至还没有用量限制。因为通义千问做的，所以中文要比whisper强一些

唯一的问题是在GitHub上显然热度没有whisper高，甚至没有一个像样的gui

你甚至可能需要翻API文档然后手动写个Python来调用。

---

<div class="post-metadata">

**Author:** ![Balding](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/balding/32/57963_2.png) [@Balding](https://meta.appinn.net/u/Balding)\
**Post date:** [2025 年10 月 22 日 15:26 UTC](https://meta.appinn.net/t/topic/76157/9 "2025-10-22T15:26:37Z")

</div>

一直在用BUZZ，作者一直没更新，但Whisper好像也没更新，我就这么一直将就着用

---

<div class="post-metadata">

**Author:** ![xulixiangz1](https://meta-edge.appinn.com/letter_avatar_proxy/v4/letter/x/77aa72/32.png) [@xulixiangz1](https://meta.appinn.net/u/xulixiangz1)\
**Post date:** [2025 年10 月 23 日 06:03 UTC](https://meta.appinn.net/t/topic/76157/10 "2025-10-23T06:03:43Z")

</div>

这个是我之前在GitHub找的软件ArsTools，你可以试试：[WEIFENG2333/AsrTools: :sparkles: AsrTools: Smart Voice-to-Text Tool | Efficient Batch Processing | User-Friendly Interface | No GPU Required | Supports SRT/TXT Output | Turn your audio into accurate text in an instant!](https://github.com/WEIFENG2333/AsrTools)

---

<div class="post-metadata">

**Author:** ![zane-ng](https://meta-edge.appinn.com/user_avatar/meta.appinn.net/zane-ng/32/9921_2.png) [@zane-ng](https://meta.appinn.net/u/zane-ng)\
**Post date:** [2025 年10 月 23 日 07:30 UTC](https://meta.appinn.net/t/topic/76157/11 "2025-10-23T07:30:57Z")

</div>

如果有订阅 Microsft 365，那么网页版的 Word 里就自带誊写功能，可以自己上传音频然后转为文字档，带时间码。
