当视频生成比播放还快:AI 直播把「内容」降级成了「服务」
原创 · 约 32 分钟阅读 · 阅读 --

当视频生成比播放还快:AI 直播把「内容」降级成了「服务」

作者: Alex Xiang


本文完全由 WorkBuddy 独立收集资料、调试代码并完成文章写作。配套口播视频同样由 WorkBuddy 生成。

扫码注册 WorkBuddy 即可获取 2000 积分

我是 Alex Xiang,前百度/微博工程师,现在专注于 AI 工程与工具产品。更多文章欢迎关注微信公众号「字与码」。

一页速览

先给结论,再走证据链。下文每一节都在回答这四张卡里的任一格。

  • 实时因子 RTF:≈0.6 — 5 秒片段约 3 秒生成 fal H3 Max 官方口径

一句话定性:H3 Max 真正跨过的不是画质门槛,而是「生成快过播放」这条流水线门槛。一旦 RTF<1,视频就从「你拍好、我点开」的资产,变成「边生成、边播、边被改」的服务。而服务意味着:没有存档,没有回放,没有版权的稳定形态。

本文的四层论证

  • 第一层 · 机制:三种「实时」不是一种实时——生成式延迟的单位是「段」,渲染式延迟的单位是「帧」。这是后面所有差异的总开关。
  • 第二层 · 对仗:游戏 / XR 是「世界状态的函数」,生成式直播是「分布的采样」。前者能倒回、能存档、能 6DoF;后者三者全无。
  • 第三层 · 优势:生成式的胜负手不是交互性(那一项它输给游戏),而是零资产密度——不需要建模、不需要场地、不需要演员。
  • 第四层 · 影响:视频资产化属性崩塌、治理责任前移到媒体层、成本曲线形状决定商业形态——以及记忆,才是下一个真正的战场。

背景:这事儿到底发生了什么

先交代清楚谁、在哪、用什么规则,否则后面所有「所以呢」都是空中楼阁。 MiniMax 在 2026 年 7 月底放出 H3(海螺 3.0)视频模型,33B 稠密 Transformer,开放权重,支持 5–15 秒、24fps、最高 2K、原生音视频同步输出;9 月 1 日起同一批基础权重又通过 vLLM-Omni 与 FastVideo 的 FastH3 蒸馏适配器,跑上了自托管路径。Fal 拿这批权重做了 post-training,再针对自家推理引擎调校,推出 H3 Max——官方称相对 H3 官方端点约 35× 提速。 工程上真正值得看的是它后来出的 MiniMax H3 Max Director(fal 端点 minimax/h3-max/director)。它把模型从「发你一个 mp3」改造成「一个你能中途插嘴的会话」:

参数值含义
传输WebRTC 会话(视频+音频轨)不是「提交任务拿文件」,是长连接
切片长度10 秒 / chunk一次吐 10 秒,不是 15 秒长镜头
续播时长8.5 秒允许落后于播放进度约 1.5 秒
续播上下文39 帧模型「记得」的上文极短
记忆段数1–50(默认 12)可回溯的 prior segment prompts
分辨率 / 画幅480p / 768p;16:9 / 9:16 / 1:1会话期内锁定,中途不可改
帧率 / 音频24fps / 32kHz音视频同轨合成,非后期对轨
定价$0.08 每秒(60 秒起)会话默认上限 2 分钟
关键约束它实际的后果
前后置帧固定会话开始时锁死首帧图、分辨率、记忆量、seed。改不了——所以「让主角先笑一下再开始」这种活儿只能在建模期做
prompt_version 单调递增新指令只作用于尚未生成的切片。已经推出去的画面不可撤销、不可篡改
会话 2 分钟上限默认长度;更长需申请。这意味着「无限直播」是平台工程问题,不是模型问题

那批「跑起来」的实例

  • 2023 Twitch《Nothing, Forever》:无限循环的伪《宋飞正传》情景喜剧,低模人物 + 生成对白。它的关键限制是——只有台词是生成的,画面永远是静态的。后来因一段冒犯性笑话被关,重制版去掉了角色名字以规避权利问题

拆解:三种「实时」,不是一种实时

讨论「AI 视频直播 vs 游戏」之前,得先把度量单位对齐——二者的延迟压根不是同一个量级的东西。

先把 RTF(实时因子)摆上桌

RTF = 生成耗时 ÷ 内容播放时长。小于 1 才谈得上「实时」,因为只有小于 1,下一段才可能在观众察觉空档前备好。当前各家口径(含厂商自报,均未经独立复现):

图 1 各方案生成耗时对比(厂商/团队自报,未独立复现)。fal H3 Max 是唯一一个「不动一卡 GPU 就能买到的实时档」。

方案生成耗时RTF获取方式解锁的能力
Official MiniMax H3分钟级>1API 付费参考级画质,无延迟控制权
fal H3 Max≈6s / 5s 内容≈0.6API 付费客户在环的直播迭代
FastH3 + vLLM-Omni8.7s / 10.1s≈0.86自托管 8×B300流式渲染,完整模型自主
VDN-H311.2s / 14.4s≈0.78自托管 8×B200Apache-2.0,可改可卖

但 RTF<1 只是入场券。公开实测里,5 秒视频从提交 prompt 到拿到文件约 7 秒——因为中间还有任务调度、排队、1 秒轮询、编码、存储分发。要撑住单流无缝直播,排队、编码、传输、内容审核任何一环把总延迟顶回 5 秒以上,RTF 就白算。所以真做产品必须上预生成、并行任务、剧情分支缓存和播放缓冲——3 秒是商业化的起点,不是工程问题的终点。

再拆一层:延迟的单位是「帧」还是「段」

这是后文所有差异的源头。游戏 16ms 出一帧,你感觉不到延迟,因为画面本来就只存在 16 毫秒;H3 Max 造一个 10 秒切片要 3 秒,你感觉得到延迟,因为切片是一个可以被抓取、被替换、被审视的单位。

图 2 闭环单位是「10 秒段」而不是「16 毫秒帧」。所有一致性问题,都从这一格开始。

关键推论:在这样一个闭环里,模型对「十分钟前发生了什么」的记忆上限是 12 段 prompt / 39 帧续播上下文(Director 文档值)。这不是「忘了」,这是结构上就没打算记。下面第二节的「角色会变脸」,根源就在这行数字上。

它和游戏 / XR 到底差在哪

这是被问得最多、也最容易被答错的一个问题:常见回答是「AI 直播就是低配版游戏」——错。二者根本不是同一个物种。

先摆出两条完全不同的「输入 → 画面」链路

图 3 左边是「算出来的」,右边是「抽出来的」。这才是二者最根本的分界线。

逐项对仗

维度游戏 / AR / VR生成式 AI 视频直播谁赢
画面来源渲染:状态的函数采样:分布的一次抽取游戏(可预测)
反馈闭环16ms / 帧约 10 秒 / 段游戏(差 600 倍)
空间自由度6DoF,视角随头动固定取景,镜头由模型决定游戏
角色一致性同一 skinned mesh,物理恒等每段独立采样,接缝换脸游戏
物理 / 因果有解算,可推演仅感知似的连贯,无真因果游戏
可存档 / 回放存档点 + rollback 一体已推流不可撤回; Director 不可改已生成块游戏
资产密度高:每物建模、绑定、LOD、打光近零:只有算力产出画面生成式
启动成本美术 / 场景 / 关卡,周到月一个 prompt,秒级生成式
边际成本复制近乎零,固定成本前置线性:每多看一秒都付费游戏
非同质供给有限状态空间,重玩趋同每次观看都不同生成式
身份位置你是主体,世界围着你转你是观众 + 投票的导演游戏(更本体)

所以准确的说法是:AI 视频直播不是「跑不快的游戏」,它是第三种物种——反应式媒体(reactive media)。游戏的产物是世界,直播的产物是现场。你没法走进一个直播,但你可以让直播改主意。

顺带把 XR 的误解也清一下

有人会问:那把它塞进 VR 头显呢?答案是方向对,但格子错位。XR 的成立条件从来不是「画面在实时变」,而是沉浸 + 空间 + 本体感觉:位置追踪、视差、空间音频、手部存在感,以及最要命的一条——你敢不敢在里面迈步。生成式视频给不出这些:它的取景权在模型手里,你是被框住的观众,不是空间里的主体。真要把 XR 和生成式合流,需要的是 world model(Genie 那一路)——能维持一致状态、遵守物理、接受视角变化,而不是「抽一段新像素」。

生成式视频直播

  • 强在反应成本趋零:改一次画面不需要任何人工
  • 强在供给非同质:第二次打开永远不是第一次
  • 弱在主体性:你只能选,不能进
  • 弱在连续性:换脸、丢背景是结构性的

游戏 / XR

  • 强在状态正确性:物理、因果、角色恒等
  • 强在主体位置:你是坐标原点
  • 弱在资产密度:修改一次内容要重做资源管线
  • 弱在内容新鲜度:状态空间有限,重玩趋同

它真正占优的地方:不是交互,是「零资产密度」

把上表的 11 行按胜负归类后会发现:生成式在「能不能交互」上完败,却在一个没人讨论的维度上完胜。 游戏工业化这二十年,本质是在解决同一件事:如何让机器稳定地、可交互地、持续地产出画面。为此付出的代价是资产密度——一个物体要建模、绑定骨骼、做 LOD、烘光照、填碰撞体。这条流水线贵、慢、难改,但也正因如此,它换来了状态正确性和主体性。 生成式把这层资产整个删掉了。画面不再来自资产库,来自算力。这条路径的涨跌都很极端: +1零资产启动 决定性优势秒级

  • 不需要建模、不需要场地、不需要演员、不需要剪辑
  • 内容可用性从「周」级压到「秒」级——改一句话就是改一个世界
  • 试点成本从「做个 demo 包」降到「开个会话」 代价:没有资产,就没有「已经存在并被反复打磨过的东西」。画面永远是新的,也永远是从零开始的。 +2非同质供给 决定性优势长尾
  • 游戏里你打第 100 次同一关,看到的是同一批设计
  • 生成式第二次打开必然不同——这正是 Infinite Slop 的核心卖点 代价:不可复现意味着做不了存档、做不了回放、做不了证据链。 −1反馈闭环 劣势差 600×
  • 游戏 16ms,生成式约 10 秒
  • 「实时改变」听起来对称,实际一个是帧、一个是段 但注意:生成式赢在改的代价不是改的速度——它不需要重做资源。 −2成本曲线形状 劣势线性
  • 游戏:固定成本高、复制边际成本≈0
  • 生成式:固定成本≈0、每多播一秒都在烧线 这条形状直接决定了商业模式,见第 06 节。 我的判断:「AI 视频直播 vs 游戏」这场对比,问错了重心。真正值得比的是「改一个画面的成本」:游戏里改一次关卡,要动资源管线、要回归测试、要重新打包;生成式里改一次,要花 3 秒和几毛钱。当改的成本低到接近零,产品的形状就会从「做内容」翻到「调参数」。

场景地图:谁能活,谁活不了

按两个轴切一刀:横轴是「对状态连续性的要求」,纵轴是「对实时性的要求」。越靠左下越现在就能用,越靠右上越要等记忆与一致性。

图 4 四象限里,真正当期可做的是 A 和 B;C 是生成式在「离线生产」侧的既有位置;D 是所有人都在喊、但被 39 帧记忆卡住的那一格。

场景象限可行性为什么
直播间动态背景 / 赛事视觉A现在可用不要求连贯,最省内存的活儿
观众投票决定走向的秀场B现在可用一致性崩了也当风格, fal.live 已跑通形态
广告创意 A/B 与快速改稿B / C最现实的付费点把「改一次」从小时级压到 3 秒
教学:提问即生成演示B可试点不要求跨分钟的状态记忆,只要求当下响应
数字人客服 / 导购B可试点每句话独立成段,反而绕开了连续性难题
互动叙事 / 角色陪伴D待记忆成熟卡在 12 段 prompt 记忆与接缝换脸
VR 可进入的生成式世界D需另一技术要 world model,不只要更快
24/7 无人直播变现B经济不成立成本曲线决定,见第 06 节

四个深度影响

前面都是机制,这一节是本文真正想说的部分。

① 视频从「资产」降级为「服务」——三个属性同时失效

生成一份视频,过去它同时是:可存档(存在硬盘上,随时能再打开)、可复现(同样的素材同样的参数,出同样的片)、可确权(一个可指认的文件)。RTF<1 之后这三条一起塌:流是边生成边丢弃的、采样本身非确定性、画面每 10 秒换一次身份。 后果不在版权法,在日常:作品集概念失效。你没法交出一个「我的作品」——除非你截屏;也没法做「回放」——除非你另录。视频从这里开始,更接近水电而不是照片。 一个容易被忽略的连带效应:「可存档」失效会反向惩罚内容方。过去一个 IP 的价值能沉淀成文件、能被复刻、能被引用;现在每帧都是一次性的。这会逼着创作者把价值重新压回人格(主播的脸、声音、语气)而不是内容——因为只有人格能被认出来,只有认得出的人才值得付钱。

② 治理责任前移到了「媒体层」——这是 prompt injection 长在了视频上

普通生成模型里,用户 prompt 是输入;直播场景下,观众 prompt 是操控信号,而且直接接在一个有公共输出的通道上。这在性质上不同于任何过去的审核问题:你不是在审「生成了什么」,你是在审「谁有权决定下一秒演什么」。 证据已经在现场:Fal 那个 Twitch 频道 570 万次观看后被移除,转到 Kick 再被封,双方都没给理由。最可能的解释是聊天不断索取受版权保护的卡通角色——一个典型的「观众自发把媒体推向权利边界」过程。于是 Fal 自建 fal.live。这轮迁移的本质是:平台把无处安放的治理责任,变成了自己的基础设施成本。 我的判断:这不是「需要更严格的审核」,而是架构问题。在「观众 text → 媒体层 steering signal」这条链上,任何以关键词过滤为中心的治理都会失败——因为它的输入端是开放的自然语言。真正的解法只能是把治理做成会话层的准入与分区(谁在什么时候有指挥权、指令如何被加权、冲突时听谁的),而不是在最后一步筛查像素。

③ 成本曲线决定商业形态:24/7 是伪命题,事件驱动才是真命题

把单价乘一遍就知道这事儿的经济学约束有多硬(两个口径都列,别混):

口径单价一天 24h一个月一年
fal Director 官方(768p)$0.08 / 秒$6,912≈ $20.7 万≈ $252 万
成本拆分口径(480p,$0.05/s)$0.05 / 秒$4,320≈ $12.96 万≈ $158 万

所以 Infinite Slop 能跑 24 小时,不是因为模式成立,而是因为 Fal 在替它出算力钱。一旦要自己付账,24/7 无间断生成就立刻不成立:

  • 成本随观看时长线性增长,而广告收入随观看人数增长、存在天花板——两条线永远不平行
  • 于是合理形态是事件驱动:高峰时段限量开、按次收费、按时长订阅、或把成本转嫁成「观众自己出 prompt」的参与感
  • 推论:「无限直播」在商业上是修辞,不是产品。真正会被买单的是「每次打开都不一样」——一次性的、有起止的、按次计费的体验

④ 下一场竞争的战场是「记忆」,不是画质

把 Director 的参数表摊开看,决定体验上限的恰恰不是 480p 还是 768p,而是那两个数字:39 帧续播上下文和12 段 prompt 记忆。它们划出了一道硬天花板——模型能「接得上」的只有 1.6 秒,能「想得起」的只有 12 条指令。 已有的接缝病症全部由此而来,且都不可靠调参解决:片段间角色脸会变、相邻两镜背景会丢失、聊天指令有明显滞后、352–416p 区间表现最好、分辨率一高就忽略镜头指令。换个角度说:这条链路现在最缺的不是画质、不是提速,是一个能跨 30 分钟维持同一套状态的东西。 综合判断(12 个月):生成式视频会明确裂成两种媒体形态——高质离线生产(允许长渲染、允许逐帧修)与实时互动广播(只需跑在播放前面 + 反应得够诱人)。两者共用底座,但工程目标相反。这个分叉一旦成立,竞争焦点就会从「谁的片子更好看」迁移到记忆设计、prompt 治理、多模态控制、单位成本——也就是游戏产业那套系统工程。谁把这套做成平台,谁就接过 Unity 当年的那个位置。

口径冲突:几个数字别混着用

同一件事在不同来源里数字不一样。这里全部并列,不替读者挑一个——方法不同导致的口径差,硬选「更权威的那个」才是真正的不诚实。

口径项A 来源B 来源差异原因
提速倍数35×(Fal 官方,相对 H3 官方端点)50×(@levelsio 转述)基准端点不同;Fal 未公布正式延迟/吞吐基准
单价$0.08/秒(Director 768p,60 秒起)$0.05/秒(480p 成本拆分)分辨率不同 + 一个是价目一个是成本估算
「3 秒出片」模型侧生成 5 秒内容 ≈ 3 秒(RTF≈0.6)端到端约 7 秒(含排队/编码/1 秒轮询)推理时延 vs 全链路时延,用户感知的是后者
观众规模5.7M 次观看(Twitch 频道)37k 并发/首 24h(Infinite Slop)观看总量 vs 并发峰值,两个量纲
未验证项「15 秒生成 13 秒」在 MiniMax 一手材料里未获验证;3.7 万观众数、35×/50× 提速均未经独立复现。精确延迟与并发量应以实测为准

关于评测口径:H3 Max 在 Artificial Analysis 带音频的视频榜 I2V 约 1202 Elo(第一)、T2V 约 1235 Elo(第三,次于 Wan 3.0 与 Gemini Omni Flash),在 Design Arena I2V 榜以 1341 居首(基准 H3 为 1333)。Elo 衡量的是「多数人更喜欢谁」,替代不了角色一致性、物理合理性、文字准确性与品牌合规的专项测试——对直播形态而言,后者才是主战场。

原文与资料

以下链接均于 2026-10-03 实测可访问。 为本文分析所依据的一手材料。

  • DOC What is MiniMax H3 Max Director & How To Use It fal 官方文档,一手参数来源:WebRTC 会话、10 秒切片、8.5 秒续播、39 帧上下文、记忆 1–50 段、定价 $0.08/秒、会话 2 分钟。本文第 01、02 节的数据几乎全部出自此处。 fal.ai/learn/tools/what-is-minimax-h3-max-director

  • API MiniMax H3 Max Director · API 端点页 接口的原始契约(AsyncAPI 描述的 WebRTC 视频/音频轨)。要接入必须从这里读,学习页会略掉部分字段。 fal.ai/models/minimax/h3-max/director

  • NEWS Fal H3 Max 以约 35× 提速实现实时视频生成 梳理了「post-training + 自研推理引擎」这条改造路径,以及 Ethan Mollick 独立实测、Twitch → fal.live 的迁移过程。本文第 01 节时间线的主要依据。 latent.space(经 tpsreport.news 转述) · 原文转载见 tpsreport.news/news/fal-h3-max-live-real-time-video-generation

  • CASE 基于《瑞克和莫蒂》「次元电视」做的无限 AI 直播,已在 Twitch 和 Kick 被封 最完整的一手事故报告:成本拆分($0.05/秒 → $4,320/天)、封号经过、以及接缝换脸/背景丢失/高分辨率失效等全部已知限制。想判断「这技术现在到底什么毛病」必读这一篇。 thatfeed.com/2026/09/07/1924/...

  • SPEC MiniMax H3(Hailuo 3.0)技术解读:开放权重 / FastH3 / 实时服务 H3-Base 的 33B 稠密结构、两个未开放的模块(H3-Context-IR、H3-Regenerate-2K)、FastH3 四步蒸馏与 vLLM-Omni 的 8×B300 基准(10.1s→8.7s)。本文第 02 节自托管路径数据出自此处。 orcarouter.ai/blog/minimax-h3-hailuo-3-explained

  • RTF AI 视频生成已经快过播放:你的流水线里到底变了什么 把 RTF 拆成一张可比较的表(官方 H3 / fal H3 Max / FastH3 / VDN-H3),并给出「人类审核成为新瓶颈」「速度修不了前期」这两条反直觉但重要的结论。本文第 02 节对比表的格式参考了它的口径。 mintec.co/blog/video-ia-generacion-tiempo-real-2026

建议的阅读顺序:先看 fal 官方文档(搞清楚交付单元是会话不是文件)→ 再看那篇被封杀报道(知道现状全是毛病)→ 最后读 H3 技术解读(判断自托管值不值)。不要先读营销向的总结,那批文章的 RTF 数字大多没交代口径。 资料来源:fal 官方文档、MiniMax 模型侧公开材料、开发者实测与二手报道,整理于 2026-10-03。 本文为技术观察与独立判断,其中提速倍数、成本估算、并发量均为厂商或团队自报,未经独立复现;引用前请回到一手来源核对。

打开原图 ↗