video-use 部署教程。这是一个让AI编程助手(如Claude Code)能够自动编辑视频的工具,通过读取音频转录和按需视觉信息来完成剪辑。

本教程将重点介绍最推荐的 AI助手自动安装 方式,以及备选的 手动安装 步骤。

🚀 方式一:通过AI助手自动安装(推荐)

这是项目设计的主要使用方式,由AI助手(如Claude Code、Codex)自动完成安装和配置。

  1. 启动你的AI编程助手:在终端中进入你想要工作的目录,启动支持该技能的AI助手(如输入 claude 启动Claude Code)。

  2. 粘贴安装提示词:将以下完整的提示词粘贴给AI助手:

    Set up https://github.com/browser-use/video-use for me.

    Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you’re running under, and set up the ElevenLabs API key — ask me to paste it when you need it. Then read SKILL.md for daily usage, and always read helpers/ because that’s where the editing scripts live. After install, don’t transcribe anything on your own — just tell me it’s ready and wait for me to drop footage into a folder.

  3. 跟随AI的指引:AI助手会自动执行以下操作:

    • 克隆此仓库。
    • 安装Python依赖(使用 uvpip)。
    • 检查并安装 ffmpeg 等系统依赖。
    • 在你的AI助手技能目录(如 ~/.claude/skills/)中创建软链接。
    • 它会提示你提供ElevenLabs API密钥,你需要准备好密钥(在 elevenlabs.io 获取)并粘贴给AI。
  4. 完成:AI助手会告知你安装完成,并等待你将视频素材放入文件夹。

🛠️ 方式二:手动安装(备选)

如果你更喜欢手动控制,或者AI助手自动安装失败,可以按以下步骤操作。

1. 克隆仓库并创建技能链接

1
2
3
4
5
6
# 克隆到你的开发目录
git clone https://github.com/browser-use/video-use.git ~/Developer/video-use

# 为你的AI助手创建技能软链接 (以Claude Code为例)
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
# 如果使用 Codex,则: ln -sfn ~/Developer/video-use ~/.codex/skills/video-use

2. 安装Python依赖

1
2
3
4
5
cd ~/Developer/video-use
# 推荐使用 uv (更快)
uv sync
# 或者使用 pip
pip install -e .

3. 安装系统依赖 (必需)

  • ffmpeg (视频处理核心):brew install ffmpeg (macOS) 或 sudo apt install ffmpeg (Ubuntu/Debian)。
  • yt-dlp (可选,用于下载在线视频):brew install yt-dlppip install yt-dlp

4. 配置API密钥

1
2
3
4
# 复制环境变量示例文件
cp .env.example .env
# 编辑 .env 文件,填入你的 ElevenLabs API 密钥
$EDITOR .env # 将 ELEVENLABS_API_KEY=你的密钥 填进去

🎬 使用视频编辑

完成安装后,你就可以开始使用video-use编辑视频了。

  1. 准备素材:将所有原始视频片段放入一个文件夹,例如 ~/my-video-project/raw/

  2. 启动AI助手:在包含视频的文件夹中启动你的AI助手(如 cd ~/my-video-project && claude)。

  3. 下达指令:在AI助手的会话中,输入类似以下的指令:

    edit these into a launch video
    将这些素材剪辑成一个发布视频

  4. AI工作流程:AI助手将:

    • 分析素材:使用ElevenLabs Scribe生成带时间戳的音频转录和视觉摘要,生成 takes_packed.md 作为主要阅读视图。
    • 提出策略:向你建议一个剪辑方案,等待你的批准。
    • 执行剪辑:根据策略生成编辑决策列表(EDL)并渲染视频。
    • 自我评估:自动检查渲染后的视频(如视觉跳跃、音频爆音),如有问题会自动修复并重新渲染(最多3次)。
    • 交付成果:最终视频将保存在素材文件夹下的 edit/final.mp4

⚙️ 工作原理简介

为了让AI能“看懂”视频,video-use采用了双层的智能方法,而非直接处理海量视频帧:

  • 第一层:音频转录(始终加载):利用ElevenLabs Scribe API将音频转为带单词级时间戳、说话人标签和音频事件(如笑声)的文本摘要(约12KB),这是AI的主要“阅读”材料,成本极低。
  • 第二层:视觉复合(按需调用):仅在需要确认剪辑点(如犹豫停顿、镜头比较)时,AI才调用 timeline_view 生成包含胶片条、波形和标签的PNG图像。这种方式避免了直接处理数万帧图像带来的超高Token消耗。

💡 关键要点与提示

  • API密钥:ElevenLabs API是必需的,用于生成高质量音频转录。请确保你的账户有足够余额。
  • 依赖检查ffmpeg 是核心依赖,务必安装且确保其在系统PATH中。
  • 技能注册:确保为你的AI助手正确创建了技能软链接,否则助手无法识别相关指令。
  • 输出位置:所有编辑产出都在视频素材目录下的 edit/ 文件夹中,不会污染技能目录本身。
  • 持续编辑:会话记忆会保存在 project.md 中,方便你下次继续未完成的编辑工作。

如果在部署中遇到问题,可以查阅项目根目录下的 install.mdSKILL.md 文件获取更详细的指导。希望这份指南能帮助你顺利开始AI视频编辑之旅。