我用 WorkBuddy 拍了一部仙侠短剧:27 秒、6 个镜头、人工干预 5 分钟
原创 · 约 48 分钟阅读 · 阅读 --

我用 WorkBuddy 拍了一部仙侠短剧:27 秒、6 个镜头、人工干预 5 分钟

作者: Alex Xiang


古董级程序员,前百度/微博工程师,现在关注 AI 工程化与开发者工具。
微信公众号「字与码」,记录技术思考与行业观察。
本文同步发布于 zicode.com

赠送的积分快过期了,与其让它烂在账户里,不如拿来干一件一直想干没干的事:试着拍一部短剧。结果比我想象的能打——成片 27 秒,6 个镜头,1080P,带环境音和中文字幕,而我真正动手的只有两件事:选仙侠题材,确认开拍。剩下的,AI 自己跑完了。

01先看结论

项目结果
成片规格27 秒 / 6 镜头 / 1080P / 24fps / 环境音 / 中文字幕
人工干预约 5 分钟(选题材 1 次、确认规模 1 次,其余全自动)
端到端耗时约 50 分钟(绝大部分是等模型生成)
积分消耗约 400–700 积分(视频 6 段 + 图片 18 张)
折合人民币约 7–12 元(按标准版折算);本次用赠送积分,等于免费
返工次数3 张关键帧重做,6 段视频全部一次过

成片在这里(WorkBuddy 空间分享链接):https://www.workbuddy.cn/space/d/aFbk6RY0wFUNXTZ5cvNdtS?ext2=copy_link

02起因:积分要过期了

WorkBuddy 赠送的积分有有效期,眼看到期,我盘点了一下能拿来干什么。日常写代码、改文档用不掉多少,反倒是视频生成这种「平时舍不得跑」的重活儿,最适合拿赠款开刀。

所以这次的定位很明确:不是要做一部多牛的片子,而是验证一件事——在 2026 年,一个人不做任何前期准备,能不能在几十分钟内产出一段「能看」的叙事短片。

03我的原始指令,一字不改

整件事从两个问题开始,我原文贴出来:

「你能生成视频吗?」

「你能做短剧吗?生成多个 5s 的视频,之间是有联系的,视频需要连贯,内容需要一致」

第二句是关键。它把难度从「生成几段好看的画面」抬到了「生成一部有内在逻辑的片子」——连贯性和一致性,这才是短剧真正的门槛。

04AI 的回答,以及它主动承认的三个短板

先说能力:

  • 文生视频 / 图生视频:文字描述直接出片,或给一张首帧图让它动起来
  • 首尾帧插值:同时给首帧和尾帧,模型在两帧之间补出运动
  • 规格:单段 5 秒、720P/1080P、16:9 / 9:16 / 1:1、可带音频
  • 耗时与成本:1–3 分钟一段,50–100 积分/段

然后是三个「必须诚实说的限制」,我认为这段比能力清单更有价值:

1. 没有角色 ID 锁定。模型不认识「同一个人」,脸部细节一定会漂移。规避办法是中远景、背影、剪影、遮挡,别怼脸拍长镜头。

2. 5 秒硬上限。一镜只能装一个动作,复合动作必崩。

3. 口型对白做不了。建议走默片 + 字幕 + 环境音的形式。

这三条直接决定了后面的所有设计:主角大量用背影和远景、每镜只做一件事、全片无对白。不是风格选择,是被能力边界逼出来的最优解。

05核心方法:一致性是怎么做住的

AI 短剧生成流水线

连贯性不是靠运气,是靠流程设计出来的。三件东西:

① 角色/场景设定卡——先写死一段描述词(年龄、发型、服装、配色、光线、焦段、色调),每个镜头的 prompt 都原样带上它。这是最低成本的一致性锚点。

② 首尾帧锚定——最关键的一步。先为每个镜头出关键帧图,生成视频时同时给首帧和尾帧,模型在两帧之间插值;镜头 N 的尾帧在构图和光线上向镜头 N+1 的首帧靠拢。这样镜头之间是「接力」,而不是各自随机发挥。

③ 后期统一——ffmpeg 拼接 + 0.6 秒叠化转场 + 统一调色 + 字幕,把残余的色差磨平。

执行上还有两个实操经验:

  • 定妆图先行:先生成 1 张角色定妆图 + 1 张场景定妆图,后面所有关键帧都以这两张作为图生图的参考图。这招效果出奇地好——少年的脸、马尾、青发带、灰蓝布袍,跨 6 个镜头保持了稳定。
  • 无人镜头千万别挂角色参考图:远景空镜和剑光镜头如果带角色图做参考,模型必给你塞个人进去。这次就有 2 张因此跑偏,只能只挂场景图 + “absolutely no people” 重做。

0612 张关键帧总览

12 张关键帧拼图

每个镜头首尾各一张,共 12 张。先看这张总览确认跨镜一致性,再进视频生成——这一步能挡掉大量返工。

07完整分镜脚本

《雪夜叩山门》。大雪封山第十日,少年背着裹布长剑独自上山,跌倒、爬起,山门剑光冲天,天亮了。

#景别画面内容字幕
1大远景风雪山影,山道一点灯火缓缓移动大雪封山,第十日
2中远景少年背影在齐膝深雪中跋涉,风掀起衣角他说,山上有剑
3中景侧滑倒跪地,手撑雪,喘息成白雾,剑滑落跌倒了,就爬起来
4远景山门灯火次第亮起,青色剑光冲天而起山门开,剑光起
5中近景侧脸抬起,青色剑光映在瞳孔,雪落睫毛那一年,他十七岁
6远景起身走向山门,雪停,天际一线晨光雪停了

08Prompt 全文公开

1)角色设定卡(全片复用的锚点)

CHARACTER
17 岁,清瘦,黑发高束马尾 + 深青色发带,肤色偏白,眉眼倔强
上装:洗得发白的靛青色粗布长袍
外罩:灰褐色旧短氅,边角磨损
腰间:深褐色布带;足:黑色布鞋
道具:背后斜背长剑,剑身用灰白粗布层层包裹,十字结系紧

WORLD
深夜 → 黎明;雪山山道 → 山门石阶 → 山门牌坊
光源对比:冷蓝月色 vs 山门暖黄灯火 vs 青色剑光

STYLE(所有镜头固定后缀)
cinematic 35mm anamorphic lens, shallow depth of field,
cold blue moonlit snow, warm amber lantern light contrast,
volumetric falling snow, muted desaturated palette, film grain,
Chinese xianxia ink-wash aesthetic, photorealistic,
no text, no watermark

2)角色定妆图(ImageGen,1536×1024)

Chinese xianxia character design reference, a 17-year-old thin
teenage boy, black hair tied in a high ponytail with a dark teal
hair ribbon, pale skin, stubborn determined eyes, snowflakes on
his shoulders. Outfit: faded indigo-blue coarse hemp long robe,
worn grey-brown short cloak with frayed edges, dark brown cloth
sash, black cloth shoes. Prop: a long sword wrapped in layers of
grey-white cloth slung diagonally across his back, cross knot.
Full body standing in falling snow, three-quarter view.
Cinematic 35mm anamorphic, cold blue moonlit snow, muted
desaturated palette, film grain, ink-wash aesthetic, no text

3)关键帧(ImageGen 图生图,参考图 = 角色定妆图 + 场景定妆图,input_fidelity=high)

以镜头 3 首帧为例:
"Medium side view at night of the same teenage boy fallen onto
one knee in deep snow, one hand braced against the frozen ground,
head lowered, breath forming white mist, the cloth-wrapped sword
slipped down against his back, blizzard wind dragging snow
around him, exhausted but unbroken, cold blue moonlight,
cinematic 35mm anamorphic, shallow depth of field, ink-wash
aesthetic, muted desaturated, film grain, photorealistic,
no text, no watermark"

无人镜头(1/4/6)务必:只挂场景图 + "absolutely no people,
no characters",否则必被带出人物。

4)视频生成(VideoGen,image=首帧 + last_image=尾帧,1080P,enable_audio)

镜头 4(高潮):
"The amber lanterns of the ancient stone mountain gate flare
bright in the blizzard night, then a brilliant teal-cyan sword
beam of light erupts from inside the gate arch and shoots up into
the storm clouds, the teal glow illuminating every falling
snowflake, camera slowly tilts up following the light, epic
awe-inspiring climax, cinematic 35mm film look"

镜头 6(收尾):
"Wide serene final shot at dawn: the teenage boy with a
cloth-wrapped sword on his back stands up and walks slowly up the
snow-buried stone steps toward the ancient mountain gate, the
snow thinning and stopping, pale golden dawn light breaking over
the mountain ridges, gate lanterns glowing warm, slow gentle
crane up, peaceful cinematic ending, 35mm film look"

09后期:ffmpeg 才是把碎片变成片子的地方

生成只是素材,成片靠合成。核心命令结构:

# 1) 每段标准化到 1920x1080 / 24fps / 5.0s
-vf scale=1920:1080:force_original_aspect_ratio=increase,crop=1920:1080,setsar=1,fps=24

# 2) 链式叠化:视频 xfade + 音频 acrossfade
filter_complex:
[0:v][1:v]xfade=transition=fade:duration=0.6:offset=4.4[v1];
[0:a][1:a]acrossfade=d=0.6[a1];
[v1][2:v]xfade=transition=fade:duration=0.6:offset=8.8[v2]; ...
# offset 公式:offset_i = 5.0 - 0.6 + i * (5.0 - 0.6)

# 3) 中文字幕(微软雅黑 + 淡入淡出 + 时间窗)
drawtext=fontfile='C\:/Windows/Fonts/msyh.ttc':text='山门开,剑光起':
fontsize=52:fontcolor=white:box=1:boxcolor=black@0.35:
x=(w-text_w)/2:y=h-170:
alpha='if(lt(t,13.7+0.5),(t-13.7)/0.5,...)':enable='between(t,13.7,17.5)'

# 4) 全局淡入淡出 + H.264 输出
fade=t=in:st=0:d=0.8, fade=t=out:st=26.1:d=0.9
-c:v libx264 -crf 18 -pix_fmt yuv420p -c:a aac -movflags +faststart

字幕时间窗要避开 0.6 秒转场期(两段画面混合时压字很难看),所以每镜字幕起点 = 该镜转场结束后 +0.5 秒。

10成片抽帧

成片六镜头抽帧

t=2 / 6.5 / 11 / 15.5 / 20 / 25 秒抽帧。字幕、色调、镜头衔接均正常,第 4 镜的青色剑光是全片高光。

11成本账:花了多少,将来要花多少

本次消耗(按工具标注单价估算,精确值以账户后台为准):

项目数量单价(积分)小计
视频生成6 段 × 5 秒50–100300–600
图片生成18 张5–1090–180
合计约 390–780

WorkBuddy 套餐与折合单价(官网公开价):

套餐月费月积分元/积分
体验版免费5000
标准版¥7040000.0175
高级版¥14090000.0156
旗舰版¥700500000.0140

也就是说:这部片子按标准版折合约 7–14 元人民币,旗舰版约 5.5–11 元。而这次用的是赠送积分,实际支出为零。换个说法——500 积分的免费额度,刚好够拍这样一部短剧。

12有没有更好的模型?价格又如何

先说清楚底层模型:WorkBuddy 的 ImageGen / VideoGen 是平台封装的多模态能力,工具层没有暴露具体模型名和版本。从产出特征看——支持 image-to-image、支持首尾帧插值、单段 5 秒、1080P/24fps、自带音频——落在国产主流视频大模型的能力区间,但确切型号平台未披露,我不做猜测。

如果直接调用市面 API 做同样 30 秒的片子,成本是这样(2026 年 7–8 月公开报价):

模型单价/秒30 秒成片备注
可灵 2.5 Turbo¥0.30≈ ¥9国产性价比档
可灵 3.0 Turbo¥0.80≈ ¥24
Seedance 2.5¥1.51≈ ¥45支持 30 秒单段
Runway Gen-4.5$0.12≈ ¥26运镜可控性最好
Veo 3.1 Standard$0.40≈ ¥85画质天花板
Haiper 2.x$0.033≈ ¥7地板价

但这里有个几乎所有价格表都不会告诉你的陷阱:真实成本 = 标价 × 重试次数。行业经验是「8:1」——一条能用的成片背后平均有 8 次废片。按这个系数,30 秒成片在 Veo 3.1 Standard 上要 680 元,在 Runway 上要 200 元。

反过来,这次 WorkBuddy 只重做了 3 张图、6 段视频一次过,重试系数接近 1.2。原因很简单:先用便宜的图把构图、光线、角色锁死,再拿去生成贵的视频。这一步预演把废片率压下来了——省钱的关键不是选便宜的模型,是减少重跑。

一个重要提醒:OpenAI 已确认 Sora API 将于 2026 年 9 月 24 日彻底关停(就在本文发布后两周)。任何需要长期维护的视频工作流,现在都不要建在 Sora 上。

13WorkBuddy 生态里现成的插件、专家和 Skill

这次我是用通用能力手搓的。但查了一遍生态,其实有成体系的现成方案:

连接器(Connector)

  • Flova AI——剧本/短片/短剧/漫剧/广告/TVC 全流程,覆盖文生图、文生视频、图生视频、分镜、修改、审阅、导出。做短剧最对口。
  • DramaBuddy 漫剧助手——给一部小说或创意,自动生成剧本、角色与分镜视频。对写小说的人简直是量身定做。
  • 可灵 AI——快手官方,文生图/图生图/文生视频/图生视频,支持单镜头与多镜头,可查剩余额度。
  • 芒果灵创 CLI——30+ 模型,还能管理剧本、美术设定、分镜故事板和音色库。
  • 其他:Picset(Seedance 2.0 系)、ai-hive(100+ 模型聚合)、VibeKnow(文档转带旁白成片)。

专家(Expert)

  • 内容创作专家团——多模态生产团队,覆盖创意策划、情绪板、广告方向、文案、视频生成、图片设计、精修合成。
  • 画令令——专攻 AI 图像提示词工程,适合打磨视觉一致性。
  • 斗音音 / 爆款炼金师——短视频选题与爆款结构,解决「拍完了没人看」的问题。

Skill:这次跑通的完整流水线,我已经沉淀成用户级技能 ai-short-drama(含分镜模板、设定卡写法、ffmpeg 合成脚本、踩坑清单)。下次直接说「再拍一集」就能复用。

14我的评价:这事到底值不值得做

说三点判断,不吹不黑。

1. 真正的价值不是成片质量,是「决策成本归零」。27 秒的仙侠短片,质量当然比不上任何一支专业团队的作品。但它的意义在于:以前要验证一个视觉创意,你得找参考图、画分镜、跟人解释半天;现在你花 5 分钟就能把脑子里的画面变成一段能播的东西给人看。把「描述一个想法」和「看到这个想法」之间的时间差压缩到分钟级,这才是质变。

2. 一致性不是模型能力,是工程纪律。这次最反直觉的发现:角色稳定性居然能做得不错,靠的不是模型有多强,而是「设定卡复用 + 定妆图参考 + 首尾帧锚定」这套工程方法。这套方法论换个模型同样成立。换句话说,这活儿拼的是流程设计,不是抽卡运气。谁把分镜和参考图管好,谁就能出片。

3. 它适合什么、不适合什么,边界很清楚。适合:视觉预演、概念片、小说推文短视频、文章动态封面、自媒体素材。不适合:需要稳定角色 IP 的连续剧、带对白的剧情、商业交付级画质。把它当成「超级动态分镜」而不是「电影工业替代品」,期待就合理了。

结论:用 WorkBuddy 做短剧,价值不在「省了多少钱」,而在「让拍片这件事从项目变成了一次对话」。对个人创作者来说,最实际的落点有两个——做小说的动态推文,做技术文章的动态封面。这两件事的共同点是:不需要角色完美复刻,不需要长镜头,30 秒足够,而 AI 恰好全都能给。

对我自己而言,这次最大的收获不是那段视频,而是确认了一件事:当生成成本降到接近零,创作瓶颈就从「做不出来」变成了「想不清楚」。剩下的,是人的问题了。

附:本次产出的全部文件

  • 成片 xueye_koushanmen.mp4(27 秒 / 1080P)
  • 分镜脚本 shotlist.md(含设定卡、分镜表、风险清单)
  • 定妆图 2 张 + 关键帧 12 张(含 16:9 裁切版)
  • 原始片段 6 段、ffmpeg 合成脚本 compose.py
  • 可复用技能 ai-short-drama
打开原图 ↗