阿牛字幕 0.6.0:改善性能,提升用户体验,九年前的破电脑也能实现转字幕自由
0.6.0,让"拖进来、剪出去"这条路更快、更顺。
内置阿里达摩院开源的 FunASR,SenseVoiceSmall、Paraformer-zh、Fun-ASR-Nano、Fun-ASR-MLT-Nano 按需选择
一次拖进多个文件或整个文件夹,全部排队依次自动转写,素材扔进去,回来字幕全好了
看文字、选句子,像划重点一样剪口播。字数、时长实时统计,选择自动保存
非自回归架构整句并行解码,普通 CPU 也能 10+ 倍速,老电脑照样跑
说话人分离自动标注 (说话人N),标点恢复断好句、点好标,导出 SRT / TXT 同步保留
不上传、不排队、不收钱,支持 CPU / CUDA / MPS / XPU / NPU,隐私安全
| 模型 | 语种 | 速度 | 特点 |
|---|---|---|---|
| SenseVoiceSmall | 中粤英日韩 | 极速 | 小而快,多语种首选 |
| Paraformer-zh | 中粤英 | 极速 | 高精度时间戳,逐字对齐利器 |
| Fun-ASR-Nano | 中英日 + 中文方言口音 | 稍慢 | LLM 架构,上下文理解强 |
| Fun-ASR-MLT-Nano | 31 种语言 | 稍慢 | 广泛多语种识别 |
口播选 Paraformer-zh 或 SenseVoiceSmall,方言口音重的上 Fun-ASR-Nano,外语素材交给 Fun-ASR-MLT-Nano。还可按需开启标点恢复与说话人分离。
拖入视频 → 自动识别字幕 → 像划重点一样选句子 → 一键导出成片选中 / 取消选中,点哪句留哪句
连续选中,废话、卡壳、重复一刷一大片
连续取消选中,划多了随时反悔
视频立刻跳到那句开头,空格键随时播放暂停
生成字幕 → 对照时间轴逐段剪切 → 合并导出。口播的冗余、重复、停顿,全靠手动剪掉。
精准的逐字字幕,选中即保留,取消即删除。字数与时长实时统计,选择自动保存,字幕 / 时间轴两种显示模式按习惯切换。
导出方式随你挑:导出选中(只要好的)、导出非选中(删掉差的),或导出时间线 XML,进 Final Cut Pro、Premiere、达芬奇、剪映接着精剪。



主界面 — 拖入视频,批量排队转写
| 主机配置 | 平均倍速 |
|---|---|
| 2017 年 iMac i5-7500 24G | 10 倍速左右 |
| 2012 年 T520 i5-2520M 8G | 2 倍速左右 |
倍速 = 视频时长 / 处理耗时,越高越快。10 分钟口播,九年前的老 iMac 平均 1 分钟出字幕;大部分比这两台新的电脑,只会更快。
0.6.0,让"拖进来、剪出去"这条路更快、更顺。
两个多月前,阿牛字幕第一次发布。这两个多月,我把整个软件从里到外重写了一遍——而这一切的核心,是把阿里达摩院开源的FunASR完完整整地装进了阿牛字幕。
写了四个软件,经常有朋友问有什么区别、该怎么选。这篇系统梳理一下,算是一个总纲。