阿牛字幕 + FunASR = 九年前的 CPU 也能实现语音转文字自由

萝卜2026-09-10

不挑电脑,不上云,不花钱。九年前的老 iMac,10 分钟视频 35 秒出字幕。

提到语音转文字,很多人的第一反应是:这得有张好显卡吧?

其实不用。今天用一台九年前的老电脑,把这件事说清楚。

先上数据:九年前的 iMac,跑出 17 倍速

我手头这台测试机,是 2017 年的 iMac(i5-7500,24G 内存)。放在 2026 年,妥妥的老爷机——独立显卡是有的,但帮不上语音识别的忙,转写全程只用 CPU。

就是这台机器,实测数据如下(倍速 = 视频时长 / 处理耗时,越高越快):

测试项目 结果
10 分钟口播视频 35 秒出字幕,约 17 倍速
两小时电影 8 分钟转写完成,约 15 倍速
多个长短不一的视频批量排队 平均 10 倍速

10 分钟的视频,泡杯茶的功夫字幕就出来了;两小时的电影才看到片头,字幕已经躺在列表里。

光有 FunASR 自己的成绩还不够,得找个参照物。同样的视频,用 Whisper (turbo) 在同一批机器上再跑一遍:

主机配置 FunASR (Paraformer) Whisper (turbo)
2012 年 T520 i5-2520M 8G 3X 跑不起来
2017 年 iMac i5-7500 24G 17X 0.3X
2026 年 Mac mini M4 16G (Rosetta) 19X 未测试

0.3X 是什么概念?15 分钟的视频,等了 45 分钟还没转完。而 FunASR 在这台机器上是 17 倍速——差距接近 51 倍。连 2012 年的古董笔记本,FunASR 都能跑到 3 倍速:视频 10 分钟,字幕 3 分钟。

这三条结论都是硬指标:全程纯 CPU、本地完成,不上传、不排队、不收钱。 唯一的一次性等待,是首次使用时下载模型(十多分钟),之后每次转写都是全速。

九年前的 CPU,也实现了语音转文字自由。

为什么这么快?引擎选对了

阿牛字幕快,不是优化硬凑出来的,而是从第一天起就选对了引擎——阿里达摩院开源的 FunASR

FunASR 是工业级语音识别工具箱,GitHub 星标上万,中文语音识别开源项目里的顶流,大量商业产品用的都是它。它快,根源在模型架构:

  • Whisper 这类传统模型是自回归架构:一个字一个字地猜,猜完第一个才能猜第二个,像抄课文,抄一个字看一眼
  • FunASR 的极速模型是非自回归架构:整句话的所有字,一次性并行解码出来,像拍了张照,整页内容全出来了

架构的差距是写在引擎里的,不靠堆硬件弥补。所以九年前的 CPU 也能跑出十几倍速——这不是阿牛字幕厉害,是地基打得好。

认识 FunASR 的两个极速模型

阿牛字幕内置了 FunASR 的两个"极速"模型,覆盖绝大多数场景:

模型 语种 特点
Paraformer-zh 中粤英 高精度时间戳,逐字对齐利器
SenseVoiceSmall 中粤英日韩 小而快,多语种首选
  • Paraformer-zh:剪视频首选。时间戳精准到每个字,选中句子导出成片时,剪切点严丝合缝,不会掐头去尾。
  • SenseVoiceSmall:模型更小、速度更快,中粤英日韩五语种通吃。素材里有外语?交给他。

两个模型都能按需开启标点恢复说话人分离——转出来就是断好句、点好标、分清"谁说了什么"的字幕。用哪个都行,反正都够快:上面的 17 倍速,就是这两个模型在这台九年前的 iMac 上跑出来的。

能用来干什么?

  • 口播博主:录完拖进去,几十秒出字幕;扫一眼,把"嗯、啊、然后、那个"划掉,一键导出成片。剪口播变成选句子。
  • 课程讲师:几小时的课程录像批量扔进去,排队转写,逐字稿和字幕一次搞定。
  • 访谈主播:开启说话人分离,谁说了什么一目了然,精彩片段点选导出。
  • 会议记录:录音拖进去直接转文字,导出 TXT,会后整理省一半时间。
  • 老电脑用户:不用换电脑、不用买显卡、不用装 Python 和 ffmpeg,一切随包内置,下载即用。

选好的句子导出成片,想要精修?还能导出时间线 XML,进 Final Cut Pro、Premiere、达芬奇、剪映接着剪。

写在最后

语音转文字这件事,不该被显卡和云服务会员卡住。阿牛字幕把达摩院的 FunASR 装进了每个人都能用的桌面软件里——九年前的电脑也好,最新的 Mac 也好,拖进视频,字幕就出来了。

免费使用,本地运行,下载即用。

👉 官网下载:https://thinking.vip/a-niu

阿牛字幕 快速生成字幕,选文字剪口播

2026-09-10 10:49:0815 次阅读