上个月我花了4个小时剪一条8分钟的访谈视频。大部分时间在干嘛?在时间轴上找停顿、删“嗯啊”、对齐音轨。剪完之后整个人都不想再看第二遍。
后来一个朋友说:“你试试AutoCut。”
我心想又是一个AI剪辑噱头。结果打开项目主页看了一眼——李沐开源的项目,GitHub上7.5k星。李沐是谁?AI圈的人应该都知道,亚马逊资深科学家,跟着他学深度学习的江湖地位摆在那里。他做这个工具的初衷很朴素:为了讲OpenAI的Whisper语音识别模型,顺手做了一个剪视频的小工具。
顺手做的。结果成了无数内容创作者的效率救星。
一、AutoCut到底是什么?把剪视频变成删句子
传统剪辑软件的底层逻辑是“时间轴”——你在一条线上拖来拖去,找入点、找出口、切、拼。这套逻辑的前提是你得会用Premiere Pro或达芬奇,得懂时间线、轨道、关键帧。
AutoCut彻底换了一套逻辑。它的核心思想极其简单:你只需要删掉字幕里不要的句子,视频就自动剪好了。
工作流程就三步:
AI自动把视频语音转成带时间戳的字幕
你打开字幕文件,像删文档里的句子一样,删掉不要的部分
系统根据你保留的句子,自动剪切对应的视频片段并拼接
30分钟的口播素材,传统剪辑需要90分钟,AutoCut压缩到15分钟以内。不是“快一点”,是快6倍。
二、两种形态,别搞混了
AutoCut目前有两个完全不同的版本,很多人被搞晕了。
开源版(命令行工具) :李沐在GitHub上开源的那个。需要装Python、ffmpeg、Whisper模型,在终端里敲命令跑。适合技术背景的用户,完全免费。
AutoCutVideo(桌面软件) :国内开发者基于同样理念做的免费桌面版。有图形界面,上传视频点几下就能用,不需要敲代码。支持Windows和Mac。官网autocut.video当前版本2.32.5,2025年3月已下线,需要手动下载新版。
我这次测的是开源版,因为它才是AutoCut的灵魂。桌面版功能相对简化,核心逻辑一致但定制化程度低一些。
三、实测全程:从零到剪完一条视频
环境准备
AutoCut基于Python开发,依赖OpenAI的Whisper模型做语音识别。
git clone https://gitcode.com/GitHub_Trending/au/autocut cd autocut pip install .
Ubuntu:
sudo apt install ffmpegmacOS:
brew install ffmpegWindows:
scoop install ffmpeg
第一步:生成字幕
假设你有一个访谈视频interview.mp4:
autocut -t interview.mp4
系统调用Whisper模型识别语音,生成两个字幕文件:interview.srt(标准字幕)和interview.md(Markdown格式,可编辑)。
这一步耗时取决于视频长度和硬件。CPU上跑1小时视频大概45分钟,有GPU加速能压缩到8分钟左右。Whisper提供tiny到large多个模型可选,追求速度用tiny,追求准确率用large。
第二步:编辑文本
用任何文本编辑器打开interview.md,你会看到类似这样的内容:
- 00:00:05,000 --> 00:00:12,500 大家好欢迎来到今天的访谈 - 00:00:12,500 --> 00:00:18,200 今天我们聊一聊AI剪辑工具 - 00:00:19,000 --> 00:00:25,300 嗯...这个...其实我最早接触AI是...
把不需要的句子整行删掉。比如把带“嗯...这个...”那句删了。保留你想要的,删除你不要的。就这么简单。
第三步:自动剪辑
autocut -c interview.mp4 interview.srt interview.md
系统根据你保留的句子,自动从原视频中剪切对应片段并拼接,输出interview_cut.mp4。
整个过程从安装到出片,我第一次跑大概花了20分钟(含研究文档)。第二次只用了5分钟。
高级玩法:文件夹监控
如果你每天要处理大量视频,AutoCut支持守护进程模式,监控文件夹自动处理新视频:
autocut -d ./my_videos -t -c
扔进去一个视频,自动出剪辑版。对批量处理课程录像、播客素材的团队非常实用。
四、好用到哭,但别指望它能干所有事
优点非常突出:
剪辑逻辑极其直观。对“写东西比剪视频熟”的人极度友好。你不用学Premiere Pro的时间轴,会用记事本就能剪视频。
自动化程度高。从语音识别到字幕生成到剪辑拼接全自动,适合快速出内容。
完全开源免费。不需要订阅,不需要买会员,不需要担心“免费版带水印”。
特别适合口播类内容。课程录像、访谈、播客、技术分享——这些内容的核心是“说话”,AutoCut直接命中痛点。有英语老师用AutoCut处理60分钟课堂录像,30分钟产出3条短视频,效率提升320%。
局限同样明显:
只适合粗剪。 节奏设计、特效、转场、精修,还得靠专业软件。AutoCut帮你完成的是“去掉废话、保留精华”这一步,不是“做出一个成品”。
字幕准确率不是100%。 Whisper对中文的支持比英文弱一些。视频越流畅、发音越清晰,转录效果越好。我实测带口音的中文访谈,准确率大概85%-90%,需要手动改几处错别字。
不能删单句中的部分内容。 只能整句保留或整句删除。如果你想保留一句话的前半句删掉后半句,做不到。
需要一点技术门槛。 开源版需要在终端敲命令、装依赖。纯小白可能卡在pip install或ffmpeg配置上。
五、谁该用它?谁不该?
强烈推荐给:
播客/访谈类创作者:去掉“嗯啊”和停顿,保留干货
需要批量处理口播素材的团队:文件夹监控模式一键批量处理
不太适合:
做Vlog、剧情短片、需要复杂转场和特效的人:AutoCut只做粗剪,精修还得用专业软件
对字幕准确率要求100%的人:AI识别有误差,需要手动校对
完全不想碰命令行的人:建议用AutoCutVideo桌面版,有图形界面
六、关于收费:目前完全免费
关于收费的信息比较分散。多个来源确认AutoCut和AutoCutVideo目前完全免费。开源版代码公开,不存在收费问题。桌面版AutoCutVideo也标注为免费软件。
官网显示,曾经打赏过的用户可将打赏加倍兑换成积分或会员——这说明开发者确实在探索商业化路径,但截至目前,核心功能对普通用户仍然免费。
七、一点实在的建议
AutoCut最打动我的不是它的技术多先进,而是它的设计哲学:把视频剪辑从“技术活”变成“文字活”。
传统剪辑软件的问题是,你把80%的精力花在了“怎么操作软件”上,只有20%留给“剪什么内容”。AutoCut把这件事翻了过来——你只需要思考“这段要不要”,剩下的交给机器。
但它不是万能的。它解决的是“粗剪”这个环节,不是整个剪辑流程。我的建议是:用AutoCut做初筛,用专业软件做精修。先让AI帮你把废话删掉、把结构搭好,再进Premiere Pro或达芬奇做转场、调色、加特效。两条腿走路,效率最高。
如果你还没试过,挑一个10分钟的口播视频跑一遍。从安装到出片,花不了你半小时。试完你就知道,为什么那么多人在逃离时间轴了。
