OneAsr —— Windows 本地离线批量音视频转 SRT 字幕

软件名称

OneAsr

应用平台

  • Windows
  • Linux
  • macOS

推荐类型

【开发者自荐】

是否收费

免费,开源(MIT)

一句简介

本地离线批量字幕:音视频直接转 SRT / TXT。支持 Windows / Linux / macOS,可走 NVIDIA、AMD、Intel 与 Mac M 芯片加速。

应用简介

基于阿里通义 Qwen3-ASR 与 Qwen3-ForcedAligner,音视频在本机完成识别与词级对齐,直接输出带时间轴的字幕文件。

处理流程:音视频 →〔可选〕人声分离 → VAD 分段 → ASR 识别 → ForcedAligner 对齐 → 智能断句 → *.srt / *.txt

主要功能:

  1. 完全本地离线:识别与对齐均在本机完成,识别过程可断网,素材不出机
  2. 批量队列:一次添加多个音视频文件,进度与各阶段耗时一目了然
  3. 11 种源语言:中文普通话、粤语、English、日本語、한국어、Français、Deutsch、Italiano、Español、Português、Русский(需手动指定,无自动检测)
  4. 双规格 ASR:Qwen3-ASR 0.6B(更快省显存)/ 1.7B(更准)
  5. 词级时间轴:ForcedAligner 对齐打轴 + 字幕长度预设(短 / 标准 / 松),不是整段估时间
  6. VAD 智能分段:目标段长 30–180 秒,长音频更稳
  7. 输出格式可选:SRT / TXT 可同时勾选(至少保留一种),TXT 逐句一行、无时间轴
  8. 中文字形可选:原文(默认)/ 简体 / 繁体,仅中文、粤语素材生效;导出前转换,不影响时间轴
  9. 人声分离(可选):内置 HTDemucs v4,转录前压掉背景音乐 / 噪声
  10. 字幕输出位置:默认与视频同目录,也可指定文件夹
  11. GPU 加速:NVIDIA、AMD、Intel、Mac M 芯片;无独显可走 CPU
  12. 命令行oneasr-cli 与 GUI 同一条流水线

配置要求:Windows 10 / 11、Linux、macOS。推荐独显 4GB+ 显存(0.6B;1.7B 建议 6GB+)。安装包不含模型,设置里从 ModelScope 下载:ASR 0.6B 约 1.6 GB 或 1.7B 约 4.1 GB(二选一),ForcedAligner 约 1.8 GB(必下),人声分离约 84 MB(可选)。

使用方法:安装或解压后运行 → 设置中下载模型 → 添加音视频、选好语言 → 开始。字幕默认与视频同目录,文件名同源。

中文界面。

截图预览:

下载地址

官方网站

更新记录

v1.0.0

  • 支持 Windows / Linux / macOS
  • GPU 加速:NVIDIA、AMD、Intel、Mac M 芯片
  • 对接官方 Qwen 权重;人声分离改为仅人声包(约 84 MB)

v0.2.0

  • 新增 统计面板:底栏入口,累计省下的时间、平均速度、全年热力图等,细节打开自己探索
  • 新增 提示音:交互反馈与任务完成 / 失败提醒,两种音色区分成功失败,设置里一个开关管全部
  • 修复 批次进行中增删任务后,底部进度显示不准的问题
  • 修复 任务列表超过一屏时行被压缩、互相遮挡,现在正常滚动
  • 标题栏左上角显示版本号

v0.1.9

  • 新增 TXT 输出:SRT / TXT 可同时勾选(至少保留一种);TXT 逐句一行、不带时间轴
  • 新增 中文字形:原文(默认)/ 简体 / 繁体,仅对中文、粤语素材生效;转换在导出前完成,时间轴不受影响
  • 新增 人声分离(可选):内置 HTDemucs v4 原生推理,转录前压掉背景音乐 / 噪声;跟随设置里的「推理后端」,「自动」档在 GPU 不可用时回退 CPU 并在状态栏提示,显式选 GPU 则直接报错
  • 管线优化:改为「分离 → 单次解码 16k 主音频」,去掉重复转码;多声道素材交给 ffmpeg 正规下混
  • 设置面板按「输出 / 模型 / 环境」重新分组,输出格式与中文字形并排
  • 阶段名与报错文案全部中文化(加载识别模型 / 加载对齐模型 / 语音识别模型)
  • 另含断句 / SRT 边界修复(俄、法、意词间空格不再丢失,SRT 重叠与零时长 cue 归一化)与下载加固(超时退避重试、SHA-256 校验、模型 revision 固定)

v0.1.8

  • 字幕默认保存到视频同目录(issue #3):视频所在目录不可写时自动回退到输出目录并记录日志
  • 设置面板「字幕输出位置」新增「视频同目录 / 指定目录」切换,指定目录模式保留原目录选择行为
  • (命令行与示例保持 {app_root}/output 行为不变)

v0.1.7

  • 健全错误日志:主日志路径不可写时回落到 %LOCALAPPDATA%/OneAsr;启动即写入环境快照(安装目录可写性、ffmpeg、CUDA 目录、模型就绪状态)
  • 修复安装目录不可写导致模型下载失败:安装包默认目录改为 %LOCALAPPDATA%/Programs,并去掉管理员安装对话框(避免 Program Files 下 models / dll 不可写)
  • 补齐静默盲区日志:拖放拒绝、打开输出目录失败、ASR 工作线程异常退出、下载开始 / 完成 / 取消 / 失败
  • 修复窗口标题残留的发布水印,统一为 OneAsr
1 个赞

macos下有类似的软件吗

有AI优化语气词吗?

没有,离线的。

不太清楚。

能自己上传文案和视频音频对齐来生成字幕吗

建议支持区分发言者的功能?(有点想入坑播客了)

提几个建议:

1.能不能加个自动检测音频语种的功能?而不用每次选择。

2.批量处理时可否添加中途暂停功能?现在任务无法随时停止。

不支持。。

这个模型确实有自动检测,但是有点影响转录精度,我删掉了。暂停功能不行,只能关闭软件。。没开始的任务,可以删除。

有什么准确率数据报告吗?

QwenLM/Qwen3-ASR: Qwen3-ASR is an open-source series of ASR models developed by the Qwen team at Alibaba Cloud, supporting stable multilingual speech/music/song recognition, language detection and timestamp prediction. 官网记了,和常见语音识别对比报告

capswriter