如果你还在用传统剪辑软件,一帧一帧地剪掉“嗯”、“啊”这些语气词,或者为了调色和加字幕在几个软件间来回切换,那么你很可能正在浪费大量时间。视频剪辑,尤其是内容创作中的粗剪和精修,正从一门纯手工艺术,逐渐演变为一个可以被“编程”和“自动化”的工程问题。今天要介绍的项目browser-use/video-use,正是这个趋势下的一个标志性产物。它不是一个带图形界面的新软件,而是一个开源的“视频编辑技能包”(Skill),专为 Claude Code、Cursor、Windsurf 这类具备代码执行能力的 AI 编程助手(Agent)设计。它的核心主张非常激进:让大语言模型(LLM)来“阅读”你的视频,并通过代码指令完成剪辑,而不是让你去“看”时间轴。听起来很科幻?但它的工作方式却异常务实。你只需要把原始视频素材丢进一个文件夹,然后对你的 AI 助手说一句:“把这些剪成一个发布视频。” 接下来,AI 会分析音频转录、生成剪辑策略、征得你的同意,然后调用ffmpeg等工具在后台自动生成final.mp4。它自动完成的工作包括:精确到词语级别的语气词删除、自动色彩分级、为每个剪辑点添加 30 毫秒的音频淡入淡出、烧制风格化字幕,甚至能并行调用子代理来生成动画叠加层。这篇文章要解决的,不是“又一个 AI 工具怎么用”的浅层问题。而是深入探讨:当视频编辑从“手动操作界面”转向“用自然语言描述意图”时,整个工作流会发生什么根本性变化?作为开发者或技术型创作者,我们如何接入并利用这套新范式?它真的能替代人工吗,还是在哪些环节会暴露出现有技术的边界?我们将从 video-use 的工作原理拆解开始,手把手完成从环境搭建、技能注册到实际剪辑的完整流程,并分析其背后的设计哲学。更重要的是,我们会探讨它适合谁、不适合谁,以及在实际使用中可能遇到的“坑”。无论你是想自动化处理自己的播客片段,还是探索 AI Agent 在多媒体领域的应用边界,这篇文章都将提供一份可落地、可复现的实战指南。1. 重新理解“剪辑”:从操作时间轴到描述意图在深入 video-use 之前,我们需要先跳出传统剪辑软件的思维定式。传统流程中,剪辑师是“操作者”:他需要观看素材,在时间轴上找到入点和出点,手动应用特效和转场。这个过程高度依赖人的审美、经验和即时判断。video-use 引入了一种名为“描述性剪辑”的新范式。在这里,你不再是操作者,而是“导演”或“产品经理”。你的核心任务从手动执行,转变为向一个具备代码能力的 AI 助手清晰地描述你的最终目标。例如:传统模式: “把第 2 分钟到 2 分 30 秒的片段拖到时间线,删掉中间‘呃’的那一秒,然后给这个片段加一个‘电影感’滤镜。”video-use 模式: “把这些访谈素材剪成一个 3 分钟的宣传片,节奏要快,去掉所有停顿和语气词,色调要明亮专业,加上大写的关键词字幕。”后者的描述更接近人类沟通的本质——表达意图。AI Agent 的职责,就是理解这个意图,并将其分解、转化为一系列可执行的代码操作(调用ffmpeg命令、调用色彩查找表 LUT、调用字幕生成库等)。这个转变带来的最直接好处是批量化与一致性处理。对于需要处理大量格式类似视频的创作者(如课程剪辑、产品评测、短视频搬运),你无需重复相同的机械操作。只需定义好规则(如“所有视频开头 5 秒淡入,结尾加品牌水印,统一使用‘科技蓝’色调”),AI 可以无差别地应用于所有素材。然而,这个范式也有其明确的边界。它极度依赖高质量的意图描述和AI 对剪辑“常识”的理解。如果你说“剪得更有冲击力一点”,不同的 AI 模型可能会产生截然不同的理解。因此,video-use 的成功应用,一半在于工具本身,另一半在于使用者如何学会与 AI 协作,进行有效的“提示词工程”。2. video-use 核心架构:LLM 如何“阅读”视频?让一个大语言模型去“看”视频,在技术上几乎是灾难性的。一段 10 分钟 30 帧的视频就有 18,000 帧图像,如果直接编码成向量喂给 LLM,其 token 消耗将是天文数字,且绝大部分是无效的视觉噪声。video-use 巧妙地避开了这个陷阱,其核心设计哲学是:LLM 不需要‘看’视频,它只需要‘读’懂视频。它将视频理解拆解为两个层次,这与 browser-use 项目让 LLM 操作浏览器的思路一脉相承——提供结构化的文本信息,而非原始的像素流。2.1 第一层:音频转录文本(核心数据源)这是 LLM 理解视频内容的基石。video-use 默认使用ElevenLabs 的 Scribe API来处理音频,因为它能提供:词语级时间戳:精确到每个单词的开始和结束时间。说话人分离:区分视频中不同的人物(S0, S1)。非语音事件标记:自动识别并标注(笑声)、(掌声)、(叹息)等。处理完成后,所有素材的转录文本会被“打包”成一个名为takes_packed.md的紧凑文件。这个文件通常只有 10KB 左右,却包含了剪辑所需的所有时序和内容信息。LLM 通过阅读这个文件,就能像阅读剧本一样理解视频的叙事流、对话节奏和关键信息点。## C0103 (duration: 43.0s, 8 phrases) [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted. [006.08-006.74] S0 We fixed this. [007.12-009.88] S1 Can you show me how it works in practice? ... (后续内容)2.2 第二层:按需生成的视觉摘要(决策辅助)纯文本无法解决所有剪辑问题。例如,两个相似的句子该选哪一帧作为切出点?某个停顿是自然的呼吸间隙还是需要剪掉的废片?这时就需要视觉参考。video-use 提供了一个按需调用的timeline_view
AI自动化视频剪辑:基于LLM与自然语言指令的工程实践
如果你还在用传统剪辑软件,一帧一帧地剪掉“嗯”、“啊”这些语气词,或者为了调色和加字幕在几个软件间来回切换,那么你很可能正在浪费大量时间。视频剪辑,尤其是内容创作中的粗剪和精修,正从一门纯手工艺术,逐渐演变为一个可以被“编程”和“自动化”的工程问题。今天要介绍的项目browser-use/video-use,正是这个趋势下的一个标志性产物。它不是一个带图形界面的新软件,而是一个开源的“视频编辑技能包”(Skill),专为 Claude Code、Cursor、Windsurf 这类具备代码执行能力的 AI 编程助手(Agent)设计。它的核心主张非常激进:让大语言模型(LLM)来“阅读”你的视频,并通过代码指令完成剪辑,而不是让你去“看”时间轴。听起来很科幻?但它的工作方式却异常务实。你只需要把原始视频素材丢进一个文件夹,然后对你的 AI 助手说一句:“把这些剪成一个发布视频。” 接下来,AI 会分析音频转录、生成剪辑策略、征得你的同意,然后调用ffmpeg等工具在后台自动生成final.mp4。它自动完成的工作包括:精确到词语级别的语气词删除、自动色彩分级、为每个剪辑点添加 30 毫秒的音频淡入淡出、烧制风格化字幕,甚至能并行调用子代理来生成动画叠加层。这篇文章要解决的,不是“又一个 AI 工具怎么用”的浅层问题。而是深入探讨:当视频编辑从“手动操作界面”转向“用自然语言描述意图”时,整个工作流会发生什么根本性变化?作为开发者或技术型创作者,我们如何接入并利用这套新范式?它真的能替代人工吗,还是在哪些环节会暴露出现有技术的边界?我们将从 video-use 的工作原理拆解开始,手把手完成从环境搭建、技能注册到实际剪辑的完整流程,并分析其背后的设计哲学。更重要的是,我们会探讨它适合谁、不适合谁,以及在实际使用中可能遇到的“坑”。无论你是想自动化处理自己的播客片段,还是探索 AI Agent 在多媒体领域的应用边界,这篇文章都将提供一份可落地、可复现的实战指南。1. 重新理解“剪辑”:从操作时间轴到描述意图在深入 video-use 之前,我们需要先跳出传统剪辑软件的思维定式。传统流程中,剪辑师是“操作者”:他需要观看素材,在时间轴上找到入点和出点,手动应用特效和转场。这个过程高度依赖人的审美、经验和即时判断。video-use 引入了一种名为“描述性剪辑”的新范式。在这里,你不再是操作者,而是“导演”或“产品经理”。你的核心任务从手动执行,转变为向一个具备代码能力的 AI 助手清晰地描述你的最终目标。例如:传统模式: “把第 2 分钟到 2 分 30 秒的片段拖到时间线,删掉中间‘呃’的那一秒,然后给这个片段加一个‘电影感’滤镜。”video-use 模式: “把这些访谈素材剪成一个 3 分钟的宣传片,节奏要快,去掉所有停顿和语气词,色调要明亮专业,加上大写的关键词字幕。”后者的描述更接近人类沟通的本质——表达意图。AI Agent 的职责,就是理解这个意图,并将其分解、转化为一系列可执行的代码操作(调用ffmpeg命令、调用色彩查找表 LUT、调用字幕生成库等)。这个转变带来的最直接好处是批量化与一致性处理。对于需要处理大量格式类似视频的创作者(如课程剪辑、产品评测、短视频搬运),你无需重复相同的机械操作。只需定义好规则(如“所有视频开头 5 秒淡入,结尾加品牌水印,统一使用‘科技蓝’色调”),AI 可以无差别地应用于所有素材。然而,这个范式也有其明确的边界。它极度依赖高质量的意图描述和AI 对剪辑“常识”的理解。如果你说“剪得更有冲击力一点”,不同的 AI 模型可能会产生截然不同的理解。因此,video-use 的成功应用,一半在于工具本身,另一半在于使用者如何学会与 AI 协作,进行有效的“提示词工程”。2. video-use 核心架构:LLM 如何“阅读”视频?让一个大语言模型去“看”视频,在技术上几乎是灾难性的。一段 10 分钟 30 帧的视频就有 18,000 帧图像,如果直接编码成向量喂给 LLM,其 token 消耗将是天文数字,且绝大部分是无效的视觉噪声。video-use 巧妙地避开了这个陷阱,其核心设计哲学是:LLM 不需要‘看’视频,它只需要‘读’懂视频。它将视频理解拆解为两个层次,这与 browser-use 项目让 LLM 操作浏览器的思路一脉相承——提供结构化的文本信息,而非原始的像素流。2.1 第一层:音频转录文本(核心数据源)这是 LLM 理解视频内容的基石。video-use 默认使用ElevenLabs 的 Scribe API来处理音频,因为它能提供:词语级时间戳:精确到每个单词的开始和结束时间。说话人分离:区分视频中不同的人物(S0, S1)。非语音事件标记:自动识别并标注(笑声)、(掌声)、(叹息)等。处理完成后,所有素材的转录文本会被“打包”成一个名为takes_packed.md的紧凑文件。这个文件通常只有 10KB 左右,却包含了剪辑所需的所有时序和内容信息。LLM 通过阅读这个文件,就能像阅读剧本一样理解视频的叙事流、对话节奏和关键信息点。## C0103 (duration: 43.0s, 8 phrases) [002.52-005.36] S0 Ninety percent of what a web agent does is completely wasted. [006.08-006.74] S0 We fixed this. [007.12-009.88] S1 Can you show me how it works in practice? ... (后续内容)2.2 第二层:按需生成的视觉摘要(决策辅助)纯文本无法解决所有剪辑问题。例如,两个相似的句子该选哪一帧作为切出点?某个停顿是自然的呼吸间隙还是需要剪掉的废片?这时就需要视觉参考。video-use 提供了一个按需调用的timeline_view