很多人开了 X 的蓝 V,真正用到的只有三件事:认证标、长文和少一点广告。

但如果你平时做短视频,最容易被浪费的权益其实是 Grok。

我最近在 Mac Mini 上翻工作流时,发现本机三套视频生产链路都在复用同一个批量生成模块。真正跑通的不是“文字直接批量生成视频”,而是一条更稳的三段式链路:Codex 先生成底稿图片;Grok Imagine 网页端把图片变成视频;ChatCut 接手剪辑、字幕、配音和成片。

换句话说,你不一定要先买第三个视频生成工具。可以先把自己已经在付费的 Grok 用满,再决定是否需要 API 或专业平台。

先说边界:蓝 V 不等于无限免费

X 官方目前有 Basic、Premium 和 Premium+ 三档。蓝色认证标属于 Premium 和 Premium+;Premium 会提高 Grok 使用额度,Premium+ 的额度更高。

但“提高额度”不等于无限生成,也不代表每个账号、地区和灰度阶段都拥有完全相同的 Imagine 权益。真正开始之前,请先登录

grok.com

,确认自己的账号能否进入 Imagine、能否生成视频,以及页面显示的剩余额度。

还要区分两笔账:

• Grok 网页端:使用你现有账号的订阅或周额度

• xAI Imagine API:单独创建 API Key,按生成秒数和分辨率计费

这篇文章主要讲第一条——先把已有会员权益接进自己的视频工作流。API 是需要规模化以后再考虑的第二阶段。

这套组合到底怎么工作?

最终链路只有三步:

Codex 生成底稿图片 → Grok 网页端图生视频 → ChatCut 剪辑成片。

Codex 负责先把画面“钉死”:根据口播拆分镜,统一人物、服装、场景、构图和色调,然后为每个镜头生成一张能直接使用的底稿图片。

Grok 负责让这些底稿动起来。因为有明确的首帧,视频模型不需要每次重新猜人物长什么样、场景在哪里,镜头之间更容易保持一致。

ChatCut 则负责把一堆几秒钟的孤立素材变成真正能发布的作品:对齐口播、裁切节奏、加字幕、配音、音乐和转场。

第一步:让 Codex 生成每个镜头的底稿图片

不要直接把一篇一千字口播塞给视频模型。

先把口播拆成镜头,再为每个镜头生成一张 9:16 底稿。底稿不是普通配图,而是接下来图生视频的首帧:人物站位、表情、服装、道具、背景和光线都应该已经确定。

我会先把下面这段模板交给 Codex:

1
2
3
4
5
6
7
8
9
10
11
12
13
请把下面的中文口播稿拆成分镜,并为每个镜头生成一张图生视频底稿。

要求:
1. 每个镜头对应 5—6 秒视频,只表达一个核心动作;
2. 底稿为 9:16 竖图,主体位于安全区,给运镜留出空间;
3. 每条包含:镜头编号、对应旁白、画面描述、底稿图片提示词、Grok 运动提示词;
4. 先建立人物与视觉风格设定,后续底稿必须保持脸、服装、时代、道具和色调一致;
5. 底稿中不要出现文字、字幕、商标、边框和水印;
6. 抽象观点改写成可以被拍摄的具体场景;
7. 逐张生成底稿,并同时输出 JSON 清单。

口播稿:
【粘贴你的稿件】

底稿图片为什么比直接文生视频更稳?

因为最难保持一致的部分,已经在图片阶段解决了。

Codex 可以先生成角色定妆图、场景基准图和道具参考,再基于这些参考逐镜头出图。你可以在生成视频之前把画面逐张排开,发现人物变脸、服装跳色、构图不适合竖屏时,立刻重做图片,而不是浪费一次视频额度。

为什么还要输出 JSON?

因为真正的批量工作流不能只靠聊天记录。每个镜头需要有编号、底稿图片、运动提示词、生成状态、视频文件和失败原因。这样即使中途关机、额度耗尽或浏览器超时,也知道应该从哪条继续。

第二步:把底稿图片交给 Grok 网页端,让它动起来

xAI 官方确认 Grok Imagine 支持图生视频:上传一张静态图片作为起始画面,再用提示词描述动作、镜头运动、节奏和声音。

我常用的单镜头运动模板是:

1
2
3
4
5
6
7
8
Animate this source image into a 6-second vertical video.

Main action: [6 秒内唯一的核心动作]
Camera movement: [推、拉、摇、移、环绕或固定机位]
Motion intensity: [轻微 / 中等 / 明显]
Ending frame: [镜头最终停在哪里]
Keep unchanged: face, clothing, props, background layout and overall color palette.
Avoid: cuts, new characters, sudden object changes, on-screen text and subtitles.

有了底稿以后,不要在运动提示词里重新描述整张画面,否则模型可能擅自重绘。

例如底稿已经是一名穿灰色夹克的男人坐在凌晨办公室,运动提示词只需要写:“男人缓慢合上电脑并抬头看向窗外,镜头从桌面轻推至侧脸,6 秒内不切镜,保持脸、服装、桌面物品和冷蓝色调不变。”

手工测试时,流程是:打开

grok.com/imagine

,选择图生视频,上传 Codex 生成的底稿图片,粘贴运动提示词,等待结果,然后下载。

Codex 也可以辅助完成重复的网页动作:

\1. 读取下一条分镜和对应底稿图片。

\2. 在已经登录的 Grok 页面上传底稿,并提交运动提示词。

\3. 等待页面出现可播放结果,而不是只看按钮被点过。

\4. 下载视频并按镜头编号命名。

\5. 把该镜头标记为成功、失败或待人工确认。

\6. 再处理下一条。

但要注意:Codex 操作网页只是辅助,核心流程仍然是“底稿图片 → Grok 图生视频”,不能省略底稿阶段。

如果提示词被安全规则拦截、会员额度不足、页面要求验证码或连续生成失败,任务应该停止并告诉你原因,而不是绕过限制、刷新轰炸或偷偷切换账号。

网页端路线适合什么人?

适合已经有 Grok 权益、每天只做少量作品、愿意保留人工检查的人。

它的优势是不需要 API Key,也不会一开始就产生按秒计费;缺点是网页会变化、额度有限、需要保持登录,而且不适合高并发无人值守生产。

第三步:把 Grok 生成的视频交给 ChatCut

所谓“嵌入 ChatCut”,并不是把

grok.com

整个塞进剪辑软件。

更稳定的做法,是让 Grok 成为上游素材生成器,让 ChatCut 接收标准化的视频文件和分镜清单。

每个镜头至少保留这些字段:

1
2
3
4
5
6
7
8
9
10
{
"shot_id": "S01",
"duration": 6,
"voiceover": "这一句对应的中文旁白",
"source_image": "S01_base.png",
"motion_prompt": "提交给 Grok 的运动提示词",
"file": "S01_take01.mp4",
"status": "approved",
"notes": "人物一致,尾帧可与 S02 衔接"
}

ChatCut 拿到的不是一堆名为“下载 1、下载 2”的文件,而是一批能对上旁白、镜头号和版本号的素材。

接下来可以让 Codex 调用 ChatCut Desktop:新建项目、导入口播或配音、根据分镜号放入视频、生成字幕、补音乐、统一画幅,最后再让人检查节奏和事实错误。

本机现有的工作流也是这个方向:先生成底稿,再批量图生视频,最后把视频和清单送入 ChatCut。上游图片模型或视频模型可以更换,后面的素材契约不用推倒重来。

网页会员路线与 API 路线,应该怎么选?

如果你每周只做几条短视频,先用网页端。

如果你需要固定 SLA、并发任务、后台轮询、稳定文件地址或服务器无人值守,再用 API。

xAI 当前公开的 Imagine API 支持图生视频和视频编辑,可配置比例、时长和分辨率;视频最长可到 15 秒。API 是按秒计费,不包含在你的 X 蓝 V 会员费里。

最容易踩的四个坑

第一个坑,是把“蓝 V 有 Grok 权益”写成“无限免费视频”。额度、功能和灰度状态会变化,必须以自己账号页面为准。

第二个坑,是底稿图片没有锁定角色和风格。第一张是写实人物,第二张突然变成插画,Grok 再强也救不回镜头一致性。

第三个坑,是下载后不改名。到了剪辑阶段,几十个 mp4 很快会失控。

第四个坑,是试图去掉 Grok 水印。xAI 官方明确说明,网页端生成的图片和视频会带 Grok 水印,不能通过设置移除;遮挡或篡改来源标识也可能违反使用政策。

我建议从 3 个镜头开始

不要第一次就生成一条 60 秒视频的全部素材。

先拿一段 15 秒口播,拆成 3 个镜头:一个人物镜头、一个环境镜头、一个产品或细节镜头。

验证四件事:

• Codex 生成的三张底稿是否人物、服装和色调一致

• Grok 能否保持底稿主体不变,只完成指定动作与运镜

• 下载文件能否按镜头号落盘

• ChatCut 能否根据清单准确导入和对齐旁白

三条跑通,再扩展到十条。十条跑稳,再考虑无人值守和 API。

写在最后

我以前把蓝 V 当成内容发布会员,后来才意识到,它还可能是视频生产链里已经付过钱的一块算力入口。

真正省钱的不是找到一个“永久免费模型”,而是先把自己已经拥有的工具连接起来。

Codex 生成底稿,Grok 让图片动起来,ChatCut 完成剪辑。

这三个工具单独看都不新鲜。连起来以后,你才得到一条从口播稿到成片的生产线。

参考资料:

• X Premium 权益:

https://help.x.com/en/using-x/x-premium

• Grok 视频生成:

https://x.ai/grok/use-cases/video-generation

• Grok Imagine 能力与 API 计费:

https://docs.x.ai/developers/model-capabilities/imagine

• Grok 网页端 FAQ:

https://docs.x.ai/grok/faq