阿牛字幕 0.7.0:逐字剪辑模式回归,这恐怕是世界上最简洁高效的粗剪工具了

萝卜2026-09-11

点一个字,剪一个字。口播里那些"嗯""啊""然后",终于可以一个一个抠掉了。


0.5.0 把整个软件重写的那次,我把"逐字模式"弄丢了。

当时的理由还挺充分:有了整句选择,谁还一个字一个字点?结果这段时间,被问得最多的一句话就是——"逐字模式怎么没了?"

是我想窄了。整句适合大块取舍,逐字才是精修。删掉一个口癖、剪掉一次卡壳、掐掉半句说到一半的话,整句模式做不到,逐字模式才行。

所以 0.7.0 只做一件事,也是最重要的一件事:逐字剪辑模式,回来了。


一、逐字模式:点哪个字,剪哪个字

打开字幕页,右上角的显示模式依旧是三个:字幕 / 时间轴 / 逐字

逐字模式一开,整篇内容按时间戳逐字铺开,每个字(英文是词)都是独立的条目,都带着自己的起止时间。交互和整句模式完全一致,不用重新学:

  • 单击任意字:选中 / 取消选中
  • 按住拖动:划过去的地方连续选中
  • 按住 Shift 拖动:连续取消,划多了随时反悔
  • 悬停任意字,视频立刻跳到那一刻,边看边抠
  • 播放时当前字自动高亮、自动跟随滚动,空格键播放暂停

好处很实在。一句"然后那个呃我觉得吧",整句模式下你要么全留要么全删;逐字模式下,你可以只留下"我觉得吧",前面那几个语气词一个字一个字地点掉。停顿也一样——转写时在字与字之间自动补出了空白占位条目,留着它,就保留这段停顿;点掉它,停顿就被剪掉。

导出跟随你眼前的视图。 你在逐字模式里选完,点"导出选中",导出的就是逐字级别的片段——毫秒级精确,不是整句。选中即剪辑,到了字这一层,仍然成立。

二、逐字和整句,是一对好搭档

逐字模式不是来取代整句的,它俩分工不同:

模式 适合做什么
字幕 / 时间轴 通读全文,大块取舍,快速删掉整段废话
逐字 精修到字,抠口癖、卡壳、多余停顿

工作流也很顺:先切到时间轴模式,像看文章一样把大段废话划掉;再切到逐字模式,在剩下的内容里精雕。嫌逐字从头选太累?逐字模式顶部横条有个**"同步已选中内容"**按钮——它把当前句子的选中状态,整片覆盖到逐字条目上。于是你可以先粗后精:先用句子选出要留的部分,同步过来,再在逐字模式里做减法。

(提醒一句:同步是"覆盖",逐字模式下已经单独选择的状态会被冲掉,点之前想清楚。)

三、逐字能力,取决于模型

逐字时间戳是转写时就算出来的,不是所有模型都给得出来:

模型 逐字时间戳 说明
Paraformer-zh 时间戳最准,逐字首选
SenseVoiceSmall 需显式开启 CTC 强制对齐,末尾字已修正
Fun-ASR-Nano 支持,末尾字结束时间已修正
Fun-ASR-MLT-Nano 无逐字时间戳,逐字模式不可用

用 MLT-Nano(31 种语言那个)转出来的结果没有逐字时间戳,逐字模式下会提示"暂无逐字内容",模式切换项也会置灰。想要逐字剪辑,转写时选前面三个模型就行。

四、顺带做的一些事

逐字是主角,但也顺手把几处一直想动的地方改了:

  • 推理线程数自适应:不再固定 4 核,改为按本机 CPU 核数设置。核多的机器,转写更快
  • 切换模型释放内存:换模型时先卸载旧模型,不再几个模型一起占着内存
  • Python 运行时按需初始化:改用 node-tar 解压,不再依赖系统 tar 命令;首次真正用到时才解压初始化,启动更轻快
  • 转写页与首页更干净:首页更简洁,转写页改成白底、空状态居中、列表限宽,悬停有反馈;转写提示信息也说人话了,不再卡在 "downloading" 上

升级说明

  • 建议直接下载覆盖安装。FunASR、Python 运行时依旧全部随包内置,无需手动安装依赖
  • 转写结果结构升级到了 v5(新增逐字时间戳)。缓存 key 随版本变化,升级后第一次打开旧文件会重新转写一次,之后恢复秒命中
  • 想要逐字剪辑,旧文件需要重新转写:0.6 及以前的结果里没有逐字时间戳,逐字模式对它们不可用。重新转一遍,逐字就出来了

写在最后

一个软件做减法容易,做加法难;把丢掉的东西再捡回来,最难——因为要承认当初判断错了。

逐字模式回归,阿牛字幕才算真正完整:粗的地方整句划,细的地方逐字抠,从"删掉一整段废话"到"掐掉一个语气词",一套工具全包了。

说它是世界上最简洁高效的粗剪工具,这话有点大,但我是认真的:不谈时间轴,不学关键帧,你只是在看字、选字,剪辑自己完成。

免费使用,本地运行,下载即用。

👉 官网下载体验:https://thinking.vip/a-niu


阿牛字幕 生成字幕,粗剪视频

2026-09-11 20:34:3712 次阅读