阿牛字幕 + FunASR = 九年前的 CPU 也能实现语音转文字自由
不挑电脑,不上云,不花钱。九年前的老 iMac,10 分钟视频 35 秒出字幕。
提到语音转文字,很多人的第一反应是:这得有张好显卡吧?
其实不用。今天用一台九年前的老电脑,把这件事说清楚。
先上数据:九年前的 iMac,跑出 17 倍速
我手头这台测试机,是 2017 年的 iMac(i5-7500,24G 内存)。放在 2026 年,妥妥的老爷机——独立显卡是有的,但帮不上语音识别的忙,转写全程只用 CPU。
就是这台机器,实测数据如下(倍速 = 视频时长 / 处理耗时,越高越快):
| 测试项目 | 结果 |
|---|---|
| 10 分钟口播视频 | 35 秒出字幕,约 17 倍速 |
| 两小时电影 | 8 分钟转写完成,约 15 倍速 |
| 多个长短不一的视频批量排队 | 平均 10 倍速 |
10 分钟的视频,泡杯茶的功夫字幕就出来了;两小时的电影才看到片头,字幕已经躺在列表里。
光有 FunASR 自己的成绩还不够,得找个参照物。同样的视频,用 Whisper (turbo) 在同一批机器上再跑一遍:
| 主机配置 | FunASR (Paraformer) | Whisper (turbo) |
|---|---|---|
| 2012 年 T520 i5-2520M 8G | 3X | 跑不起来 |
| 2017 年 iMac i5-7500 24G | 17X | 0.3X |
| 2026 年 Mac mini M4 16G (Rosetta) | 19X | 未测试 |
0.3X 是什么概念?15 分钟的视频,等了 45 分钟还没转完。而 FunASR 在这台机器上是 17 倍速——差距接近 51 倍。连 2012 年的古董笔记本,FunASR 都能跑到 3 倍速:视频 10 分钟,字幕 3 分钟。
这三条结论都是硬指标:全程纯 CPU、本地完成,不上传、不排队、不收钱。 唯一的一次性等待,是首次使用时下载模型(十多分钟),之后每次转写都是全速。
九年前的 CPU,也实现了语音转文字自由。
为什么这么快?引擎选对了
阿牛字幕快,不是优化硬凑出来的,而是从第一天起就选对了引擎——阿里达摩院开源的 FunASR。
FunASR 是工业级语音识别工具箱,GitHub 星标上万,中文语音识别开源项目里的顶流,大量商业产品用的都是它。它快,根源在模型架构:
- Whisper 这类传统模型是自回归架构:一个字一个字地猜,猜完第一个才能猜第二个,像抄课文,抄一个字看一眼
- FunASR 的极速模型是非自回归架构:整句话的所有字,一次性并行解码出来,像拍了张照,整页内容全出来了
架构的差距是写在引擎里的,不靠堆硬件弥补。所以九年前的 CPU 也能跑出十几倍速——这不是阿牛字幕厉害,是地基打得好。
认识 FunASR 的两个极速模型
阿牛字幕内置了 FunASR 的两个"极速"模型,覆盖绝大多数场景:
| 模型 | 语种 | 特点 |
|---|---|---|
| Paraformer-zh | 中粤英 | 高精度时间戳,逐字对齐利器 |
| SenseVoiceSmall | 中粤英日韩 | 小而快,多语种首选 |
- Paraformer-zh:剪视频首选。时间戳精准到每个字,选中句子导出成片时,剪切点严丝合缝,不会掐头去尾。
- SenseVoiceSmall:模型更小、速度更快,中粤英日韩五语种通吃。素材里有外语?交给他。
两个模型都能按需开启标点恢复和说话人分离——转出来就是断好句、点好标、分清"谁说了什么"的字幕。用哪个都行,反正都够快:上面的 17 倍速,就是这两个模型在这台九年前的 iMac 上跑出来的。
能用来干什么?
- 口播博主:录完拖进去,几十秒出字幕;扫一眼,把"嗯、啊、然后、那个"划掉,一键导出成片。剪口播变成选句子。
- 课程讲师:几小时的课程录像批量扔进去,排队转写,逐字稿和字幕一次搞定。
- 访谈主播:开启说话人分离,谁说了什么一目了然,精彩片段点选导出。
- 会议记录:录音拖进去直接转文字,导出 TXT,会后整理省一半时间。
- 老电脑用户:不用换电脑、不用买显卡、不用装 Python 和 ffmpeg,一切随包内置,下载即用。
选好的句子导出成片,想要精修?还能导出时间线 XML,进 Final Cut Pro、Premiere、达芬奇、剪映接着剪。
写在最后
语音转文字这件事,不该被显卡和云服务会员卡住。阿牛字幕把达摩院的 FunASR 装进了每个人都能用的桌面软件里——九年前的电脑也好,最新的 Mac 也好,拖进视频,字幕就出来了。
免费使用,本地运行,下载即用。
👉 官网下载:https://thinking.vip/a-niu
阿牛字幕 快速生成字幕,选文字剪口播

