宣传语: AI 短剧看起来是”一键生成”,拆开发现是 13 道工序、500 次废片、人工精修占了 40% 工时。我把一部 8 分钟成片的 117 个镜头逐帧扒了一遍,写了份万字验尸报告。

本文基于公开信息的独立分析,所有判断均为推测,欢迎制作方勘误。黄果短剧逆向推理:一张流传甚广的流水线图,至少有三个判断需要修正

先说这张图做对了什么

最近在 AI 短剧圈子里流传着一张制作流水线图,标题是《AI 短剧〈黄果〉制作流水线(逆向推测版)》。作者做了扎实的工作:对一部 8 分钟、117 个镜头的成片做了逐帧分析,检测出 24fps→30fps 的补帧痕迹,绘制了完整的 13 步工序流程图,还给出了硬件配置建议。

这张图在技术社区引发了不少讨论。但当我自己去搜黄果短剧的公开信息、交叉比对各个视频生成模型的技术参数之后,发现这张图至少有三个关键判断需要修正。有些不是”错了”,而是”证据不够就下了结论”。

以下是结合 Claude的分析。

第一枪:黄果不是一部剧,是一个平台

这张图犯了一个前提性的错误:它把”黄果”当成一部具体作品来拆解,画出一条线性的 13 步流水线。但黄果短剧(

huangguoai.com

)实际上是一个多创作者投稿制的内容分发平台

证据很直接。黄果在自己的 Telegram 官方频道和招募页面上明确写着:

“现面向全球招募签约创作者。无论您是成熟的 AI 导演、编剧,还是脑洞大开的视觉艺术家,只要您的作品符合我们的标准,我们就统统收购。”

他们的商业模式是:平台方提供分发渠道(官网 + Telegram + TikTok)、提供”破限模型”的使用权,创作者负责制作内容,平台方收购版权。

这意味着什么?意味着黄果上的不同短剧,很可能来自不同的创作者或小团队,使用不同的模型、不同的工作流、不同的画质标准。你不能从一部剧的逐帧分析推导出”黄果的制作流水线”,因为根本不存在一条统一的流水线。

换句话说,那张图画的可能是黄果上某一部特定作品的制作流程,但把它标题写成”《黄果》制作流水线”,等于把一个样本的特征当成了总体的特征。

黄果更像是 AI 短剧界的 YouTube,而不是 Netflix。 Netflix 有统一的制作标准和内部流程,YouTube 上每个频道各搞各的。当你要分析 YouTube 的”制作流水线”,正确的做法不是拆一个视频就下结论,而是要看平台层面的共性基础设施是什么。

对黄果来说,这个共性基础设施就是”破限模型”。后面会展开。

第二枪:24fps 不等于 Wan,Seedance 也是 24fps

那张图里最硬的一条技术论证是:成片封装帧率 30fps,但逐帧检测发现每 5 帧有 1 帧重复,是典型的 24→30 pulldown 痕迹。然后结论是:24fps 原生输出 → 指向 Wan 2.1/2.2。

这条推理链的前半段没问题。24→30fps 的补帧痕迹确实能证明原始素材不是 30fps 生成的。但后半段的结论跳得太快了。

因为不只是 Wan 输出 24fps

我交叉比对了 2026 年主流视频生成模型的原生输出帧率:

关键数据:Seedance 1.0 Pro 的输出同样是 24fps。ByteDance 的技术文档明确标注其输出为”up to 1080p at 24 fps, with durations from 2 to 12 seconds”。

也就是说,”24fps 痕迹”这条证据,同时指向 Wan 和 Seedance 两个模型家族,无法单独锁定 Wan。

那张图给出的其他间接证据(镜头长度分布、一致性漂移特征、I2V 启动感)也不具有排他性。72% 的镜头在 5 秒以内这个分布,和 Seedance 1.0 的 “2-12 秒” 生成窗口同样吻合。一致性漂移在所有当前模型中都存在程度不同的问题。I2V 的”启动感”是所有 Image-to-Video 管线的共性特征,不是 Wan 独有的。

更有意思的是,Kling 的原生帧率是 30fps 以上(2.6 版本是 30-48fps,3.0 版本是 60fps)。如果黄果的某些作品里检测到了 24→30 的补帧痕迹,那至少可以排除这些镜头是用 Kling 直接生成的,因为 Kling 输出本身就是 30fps+,不需要做 pulldown。

所以更合理的推断是:

黄果平台上的创作者大概率混用多种模型。Kling 用于不需要破限的常规镜头(30fps 直出),Wan 或 Seedance 用于需要更多定制化控制的镜头(24fps 生成后统一上 30fps 时间线)。而”破限内容”几乎必然依赖开源模型(Wan),因为闭源 API 不可能允许你微调出 NSFW 内容。

这就引出了第三个修正。

第三枪:真正的护城河不是 13 步工序,是”破限模型”

那张图的 13 步流水线把成人内容的处理放在了第 8 步,标题是”成人镜头处理(成人向微调/LoRA)”,轻描淡写地归入了工序流程里。

但从黄果的商业逻辑来看,这不是 13 步中的一步。这是整个商业模式的核心。

黄果的创作者招募帖里有一句话特别关键:”为优质创作者有偿提供破限模型的使用权,让您的每一滴灵感完美落地。”

“有偿提供破限模型使用权”,这句话包含了几层信息:

第一,破限模型是平台方的资产,不是创作者自己炼的。 黄果作为平台方,投入资源训练或维护这些模型,然后以工具使用权的形式提供给签约创作者。这是一种”基础设施即服务”的模式。

第二,这些模型是在开源底模上微调的。 要生成闭源商用 API(如 Seedance 或 Kling)不允许的内容,你必须用自己的数据微调自己的模型。这只有开源模型才能做到。在当前(2026 年 8 月)的开源生态里,最适合做视频生成微调的底模就是 Wan 2.2(Apache 2.0 许可证,14B 参数量的 MoE 架构,社区已有成熟的 LoRA 训练流程)。

第三,这才是黄果相对于个人创作者的真正壁垒。 个人创作者可以用 Kling API 或 Seedance API 生成常规内容,但要生成”破限”内容,需要自己收集数据集、训练 LoRA、维护模型版本,这些工作的门槛远高于”会写提示词”。黄果把这个门槛打包成了平台服务。

所以如果要画一张更准确的”黄果商业架构图”,不应该是一条线性的 13 步流水线,而是一个分层结构:

底层:破限模型(平台方持有,基于 Wan 微调,包含角色 LoRA 库和场景预设)

中层:创作者工具链(各创作者自选,Kling/Seedance/Wan 混用,各自的后期流程)

上层:分发与变现(官网 + Telegram + TikTok,广告 + 订阅 + 版权收购)

那张图画的是中层,而且只画了一个创作者的中层。真正决定黄果是黄果、而不是”又一个 AI 短剧号”的,是底层和上层。

从底模推断倒推回来:一个更合理的技术假说

综合以上三个修正,我重新构建一个关于黄果短剧技术栈的假说。强调一下,这仍然是推测,但是基于更多公开信息的、更审慎的推测。

假说:双轨模型 + 后期统一

常规镜头(非 NSFW): 创作者使用 Kling 或 Seedance 的商业 API 生成。这些 API 有成熟的角色一致性工具(Kling 的 Elements 功能支持最多 4 张参考图锁定角色),生成质量高、速度快、不需要本地算力。对话镜头可以利用 Seedance 1.5 的原生口型同步功能,省掉后期 Lip-sync 的工序。

破限镜头(NSFW): 使用平台方提供的基于 Wan 2.2 微调的本地模型。这些模型经过 NSFW 数据集的 LoRA 训练,能生成商业 API 不允许的内容。需要本地 GPU 算力,推理速度较慢,但在自有硬件上跑没有内容审核限制。

后期统一: 两轨镜头在后期阶段汇合。Kling 原生 30fps+ 的镜头和 Wan/Seedance 原生 24fps 的镜头,统一转换到 30fps 时间线上。这就解释了为什么逐帧检测时,部分镜头有 24→30 的补帧痕迹,而另一些镜头没有。如果所有镜头都是同一个模型生成的,补帧痕迹应该均匀分布;但如果是混用模型,痕迹分布就会不均匀。

这个假说比”全部用 Wan”更能解释已知的证据:

  • 为什么黄果招募帖写的是 Seedance 和 Kling 而不是 Wan → 因为常规镜头确实用这些
  • 为什么存在 24fps 补帧痕迹 → 因为破限镜头用的是 Wan(24fps 输出)
  • 为什么不同镜头的画质有时不一致 → 因为不同镜头可能来自不同模型
  • 为什么黄果要”有偿提供”破限模型 → 因为这是闭源 API 做不到的能力

2026 年 8 月主流视频生成模型全参数对比

要验证”双轨假说”,必须先把每个模型的硬参数摊开看。以下数据来自各模型官方文档和第三方基准测试:

这张表里最关键的一列是”可否自定义微调”。只有 Wan 2.2 允许你用自己的数据集训练 LoRA。 所有闭源 API 都有内容安全审核,不可能让你微调出 NSFW 模型。这一条就锁死了破限内容的底模选择范围。

另一个值得注意的点是”原生音频”。Kling 2.6+ 和 Seedance 1.5+ 都支持视频和音频同步生成,这在对话密集型短剧中是巨大的效率优势。传统流程需要先生成无声视频,再单独做 TTS,再做口型同步,至少三步。有原生音频的模型一步到位。这进一步支持了”常规镜头用闭源 API”的假说,因为创作者没有理由放弃这个效率优势。

五条可证伪的预测

一个好的假说必须可以被证伪。以下是”双轨模型假说”的五条可检验预测,任何人拿到成片都可以验证:

预测 1:补帧痕迹分布不均匀。 如果逐镜头标记 24→30 补帧痕迹的有无,NSFW 镜头中出现补帧痕迹的比例应显著高于非 NSFW 镜头。因为 NSFW 镜头用的 Wan 是 24fps 输出,非 NSFW 镜头如果用 Kling(30fps+)则无需补帧。

预测 2:非 NSFW 镜头的分辨率天花板更高。 Kling 3.0 支持原生 4K,Wan 2.2 上限是 720p。在 100% 缩放下对比不同镜头的细节锐度,非 NSFW 镜头(可能用 Kling)应该比 NSFW 镜头(可能用 Wan)更清晰。

预测 3:对话镜头的口型同步质量两极分化。 使用 Seedance/Kling 原生音频管线的对话镜头,口型同步应该流畅自然。使用 Wan + 后期 Lip-sync 的对话镜头,可能存在嘴型与语音的微小延迟或不匹配。

预测 4:运动流畅度存在系统性差异。 Kling 3.0/3.5 在 60fps 下生成的运动非常流畅,即使下转到 30fps 时间线也保留了较好的运动信息。Wan 24fps 生成的运动在快速动作时会出现更明显的顿挫感。逐镜头对比运动流畅度,应该能分出两组。

预测 5:同一角色在不同类型镜头中的一致性漂移方向不同。 Kling 的 Elements(参考图锁定)和 Wan 的 LoRA(微调锁定)在一致性上的失败模式不同。Kling 倾向于保持面部但丢失体态细节,LoRA 倾向于保持整体风格但在极端角度下面部偏移。如果在同一部剧里观察到两种不同的漂移模式,就是混用模型的直接证据。

以上五条,任何一条被证实都会增强双轨假说的可信度;任何一条被明确否定(比如所有镜头的补帧痕迹完全均匀),都会削弱它。

那张图里仍然有价值的部分

批评完三个判断,也要说说那张图做得好的地方。以下几点对任何想理解 AI 短剧工业化的人都有参考价值。

镜头密度分析

117 个镜头 / 8 分钟 = 平均每个镜头 4.1 秒,中位数 3.2 秒。这个数据本身比任何定性讨论都更有说服力。它直接量化了”AI 短剧为什么看起来节奏那么快”的原因:不是导演喜欢快切,是模型单次生成时长上限在 5-8 秒,逼得你只能快切。

传统短剧同时长约 40-60 个镜头,AI 短剧翻了一倍。这个倍数差异会随着模型进化(更长的单次生成时长)逐步缩小,但在 2026 年,它仍然是区分 AI 短剧和真人短剧的一个硬指标。

“资产层”的概念

图里把工序 1-3(剧本分镜、角色 LoRA、场景模板库)归为”资产层”,这个分类方式很有洞察力。它指出了一个被大多数入门者忽略的事实:AI 短剧的核心竞争力不是写提示词的能力,而是建资产库的能力。

角色 LoRA、场景模板、风格预设,这些都是可以跨项目复用的数字资产。一个团队做过 10 部剧之后积累下来的资产库,和一个新手从零开始的体验完全不同。资产库越厚,每部新剧的边际成本越低。

这也解释了为什么黄果要做平台而不是做内容工作室。如果你有一套好用的破限模型资产库,自己做剧的产能是线性的(人力瓶颈),但把资产库开放给多个创作者,产能就变成了乘数关系。

人工精修占比的判断

图里暗示人工精修(修手、修脸、修服装、修五官)占总工时的 40% 以上。这个判断和行业公开数据高度一致。根据行业调研报告,角色一致性是 AI 短剧制作中最大的技术痛点,76% 的创作者把它列为首要挑战。

即使到了 2026 年 8 月,模型在手部生成、面部一致性、服装稳定性上仍然需要大量人工兜底。角色一致性的解决方案已经演进到了第三代(PuLID + ADetailer + ControlNet + IP-Adapter FaceID 组合使用),一致性可达 95%,但那 5% 的不一致在连续剪辑中仍然会被观众捕捉到。

模型在进步,但精修的工时缩不到零。缩减的是精修的密度,不是精修本身的存在。

成本真相:比你以为的便宜,但没有某些人吹的那么便宜

行业数据给出了一些可参考的成本基准:

  • 搞笑表情包类 AI 漫剧:每分钟 50-150 元
  • 精细 AI 漫剧:每分钟 1000-3000 元
  • AI 仿真人短剧(黄果这个品类):成本比漫剧高约 30%
  • 精品 AI 仿真人短剧全剧:可控制在 20 万元以内
  • 传统真人短剧同等时长:50-150 万元

降幅超过 90%。这是真实的数据。

但有一个关键变量是产能。2026 年春节档有一个公开案例:3 人团队用 5 天完成了 75 集 AI 漫剧《气运三角洲》的全流程制作,上线 16 小时播放量破亿。

这种效率意味着什么?意味着成本的大头不是算力,不是模型调用费用,而是人力的时间成本。如果一个创作者一周能产出一部,月收入只要覆盖人力成本和算力租赁就能跑正。

黄果的模式更进一步降低了创作者的启动门槛:你不需要自己炼破限模型(平台提供),不需要自己搞分发渠道(平台提供),你只需要有分镜能力 + 模型操作能力 + 后期剪辑能力。这把”一个人做一部 AI 短剧”从理论上的可能变成了实际可执行的事情。

法律风险:不是”灰色地带”,是实打实的刑事红线

写到这里必须把风险讲清楚。黄果短剧的内容性质决定了它不是在灰色地带打擦边球,而是在明确的法律红线附近操作。

制作传播淫秽物品牟利罪(刑法第 363 条)。 以牟利为目的制作、复制、出版、贩卖、传播淫秽物品的,处三年以下有期徒刑、拘役或者管制,并处罚金。情节严重的,三年以上十年以下。AI 生成的淫秽内容在司法实践中已被认定属于”淫秽物品”,不因”非真人”而豁免。

深度伪造与肖像权。 如果角色 LoRA 使用了真人面部数据训练而未获授权,涉嫌侵犯肖像权(民法典第 1019 条)。如果用于制作淫秽内容,可能触犯多项刑事法规。

平台运营风险。 黄果的服务器和域名目前在境外,但中国刑法对中国公民有属人管辖权。如果运营者或创作者是中国公民,即使服务器在境外,仍可能被追诉。

黄果自身的定位也很有意思:他们用了”huangguoai.com””huangguoai.ai”等多个域名,Telegram 群组作为主要社群,TikTok 作为引流渠道。这种分散式的域名和渠道策略,本身就暗示了对合规风险的主动规避。

对于创作者来说,需要非常清醒地认识到:为黄果供稿和自己在自媒体平台发擦边视频是完全不同量级的法律风险。 前者是有组织的内容生产和分发,后者可能只是个人行为。

迁移价值:抛开内容看工艺

抛开黄果的内容属性,其背后验证过的工艺能力对合规赛道有直接的迁移价值。

核心可迁移能力有三项:

多模型混用的工程能力。 在不同环节使用不同模型(Kling 做常规镜头,Seedance 做口型同步,Wan 做需要深度定制的镜头),然后在后期统一风格和帧率。这种”最佳模型选路”的能力,在品牌 TVC、知识短剧、文旅宣传片等合规场景中同样适用。

角色资产管理。 训练和维护角色 LoRA、建立场景模板库、管理跨镜头一致性。这套资产管理方法论不依赖于内容是否合规,它解决的是所有 AI 影像工业化都面临的一致性问题。

QC 验收标准。 “什么样的镜头可以过、什么样的必须重做”。有了这套标准,才能把个人创作变成可规模化的生产。黄果作为平台方在收购内容时必然有一套内部质检标准,这套标准本身就是有价值的方法论资产。

具体应用场景不展开了,和行业报告里列的大同小异:品牌广告、知识科普、有声书视觉化、企业培训、文旅宣传。唯一想补充的是,同一条工艺迁移到合规赛道后,最大的变化不是去掉第 8 步(NSFW 内容),而是加上内容审核和版权合规这两个新工序。 这两个工序在灰色内容生产中不存在,但在合规生产中是成本和时间的大头。

结语:分析框架比结论重要

这篇文章花了大量篇幅质疑一张流传甚广的流水线图,这不是因为那张图没有价值,恰恰相反,它是目前我看到的对 AI 短剧制作流程最详细的公开分析。

但好的分析框架应该经得起交叉验证。当我拿着那张图的结论去对照黄果的公开信息、对照各模型的技术参数、对照行业数据时,发现了三个需要修正的判断。这些修正不是推翻了原图,而是让推理变得更审慎。

AI 短剧在 2026 年正处于一个特殊的阶段。模型能力在快速进化(从 Wan 2.2 的 720p/24fps 到 Kling 3.5 的原生 1080p/60fps,中间只隔了几个月),工业化流程在快速迭代(从一个人做一切到平台化分工),商业模式在快速试错(从免费引流到订阅付费到版权收购)。

在这种高速变化的环境中,具体的结论保质期很短(这篇文章的数据在发布一个月后可能就过时了),但分析框架可以复用:逐帧检测验证帧率、交叉比对模型参数排除替代解释、区分平台层和创作者层的不同逻辑、从商业模式倒推技术选型。

这套方法论,比”它用的是 Wan 还是 Kling”这个具体答案,有用得多。