过去两年 AI 圈最出圈的能力就是生视频。Sora 那几段演示片一放出来,评论区刷的都是同一句话:剪辑师要失业了。
我们要做的是一支 60 秒的 RAG 科普片,讲清楚"大模型为什么会胡说八道,怎么靠检索救回来"。片子里要画流程图,要标出相似度 0.93 这种数字,12 条字幕一条都不能错。同一份稿子做出了两版成片,全是代码一帧一帧渲出来的,6 分钟机器时间,一秒视频的钱没付。
这篇讲四件事:生视频为什么这么火、提示词直出为什么不适合这种片子、写代码出片具体怎么做、两个工具各自的门道。
AI 生视频为什么火,大家想拿它做什么
Sora 之前,AI 视频是"能看"的水平:几秒钟的画面抖来抖去,人物手指都数不对。Sora 的演示片把这事拉到了"像真的",紧接着 Veo、Seedance、可灵全都跟上,人人都能生成一段像模像样的镜头。
大家想拿它干的活早就想好了:短视频缺几秒空镜,翻素材库不如现生成;电商要批量出商品广告,搭棚请摄影太贵;科普稿子想配画面,总不能让观众一直看 PPT。还有人真拿它拍短剧——36氪 10 月初的报道里有个数字很吓人:Seedance 在短剧行业的渗透率约 95%,光这一个模型一个月就给火山引擎带来超 10 亿元收入。
省钱是明摆着的。一条几秒的片子,机器几十秒就生成好了,不用租场地搭棚,改一版也不用把人叫回片场。对天天要出片的人来说,这几乎是白捡的产能。
但片子和片子不一样。做氛围片,画面里最好别有字,观众记住情绪就赢了;做科普、做教程,观众是来记东西的,一个数字错了整条片子就废了。这两类活儿看着都叫"做视频",其实考的是两种完全不同的能力。
第一种做法:提示词直接生成
一句话丢进去等 AI 吐片,这条路今天确实能走。只是拿它做我们这种片子,钱是一道坎,写不准是另一道。
先算钱。国外两家:Sora 2 按秒收钱,720p 一档 $0.10/秒,单条最长 20 秒;要 1080p 就跳到 $0.50/秒。Google 的 Veo 3.1 走 Vertex AI,一秒 $0.10–0.60,单条最多 8 秒,最便宜的一档 8 秒也要 $0.80。
国内看字节的 Seedance。Seedance 2.5 单条能直出 30 秒,火山方舟价格页给出的典型价是 720P 5 秒 7.56 元,相当于约 1.51 元/秒,mini 版搞限时活动时到过 0.2 元/秒。(以上都是 2026 年中的公开口径,价格以各家官方页面为准。)
凑 60 秒科普片要多少钱,心里就有数了:Seedance 720P 两段 30 秒约 90 元,Sora 720P 三段 20 秒是 $6,Veo 最便宜一档八段 8 秒约 $6.4。这还是一条过的价,重抽几次,账单接着涨。
另一道坎是写不准。每一段都是单独抽的:前一段的字和后一段对不上,节奏接不起来;中间想改一个数字,那段只能整段重抽,抽成什么样全看运气。
文字和数字更别指望。科普片要在画面上写"相似度 0.93""Top-3""检索 → 重排 → 生成",让像素模型一笔一画写准这些,目前还没法当真。所以拿它做片头、做空镜挺好,拿它讲知识点,又贵又悬。
第二种做法:写代码、画图、渲染
换个思路:别让 AI 想画面,让它和我们一起把画面算出来。
片子是这么来的——一份分镜 JSON,6 幕 × 10 秒,12 条字幕写在里面 → 渲染器一帧一帧画 → ffmpeg 封成 mp4 → TTS 念稿 → 混到一起。
听着麻烦,改起来最省事。字幕里有个字错了,改一行重跑;觉得节奏拖了,改时间轴重跑。固定随机种子之后,同一帧渲一百遍都是一模一样的像素,审片说"第 3 秒那个框不对",我回到第 3 秒改就行,不用赌运气。
配音也是算出来的:12 段稿子,每段卡进一个 5 秒槽,TTS 逐段念完拼成正好 60 秒。念超了的那段压到 1.089 倍速,念短了的补静音,两版片子共用这一条音轨。
同一件事,我们用两个工具各做了一遍。下面细说这两个工具。
方案一:Remotion,用 React 写视频
Remotion 是个开源框架,干的事一句话:用 React 组件写视频。你写一个 1800 帧的 Composition,每个组件看着当前帧号决定这一帧画什么,写完丢给渲染器就出 mp4。前端那套东西,组件复用、props 传参、Studio 里拖进度条预览,全能用上,官网上有完整的文档和例子。
我们这版的工程长这样:script.json 是分镜单源,6 幕 × 10 秒加字幕全在里面,src/subtitles.ts 跟它同源;RagExplainer.tsx 管顶栏、字幕条、进度条和场景调度;scenes/scenes.tsx 里是 S1–S6 六个场景。风格是深色 Keynote/3B1B,网格打底,毛玻璃卡片往上一摆,青到紫的渐变收尾。改文案只动 JSON,改长相只动组件,互不干扰,这就是分镜单源的好处。
渲染时碰上件事挺有意思:机器上没装 Chrome,Remotion 官方渲染器起不来。我懒得搭环境,直接写了个 render_fallback.py,照着组件逻辑用 Python + PIL 一帧帧画。分镜一样、进度映射一样、配色一样,换个底层照样出片——所谓视频即代码,这次我是真信了。渲下来逐帧 217 毫秒,整支片子 6 分半跑完;验收拿 2 秒窗口量画面变化,六幕落在 0.87%–1.81%,每幕都有东西在动。
钱的事顺带说清:Remotion 对个人和 3 人及以下的公司免费,4 人以上才要买 Company License,按人 $25/席/月,按渲染 $0.01 一次、每月最低 $100。自己写自己看的,一分不用花。
方案二:huashu-art-motion,白板手绘风格
huashu-art-motion 是个白板手绘动画 skill,上游 MIT 协议。它的语法分三层:Y3 白板-RSA 是主力,管手怎么动、什么时候停、字幕为什么晚半秒;Y2 Vox 管红线和荧光笔这种标记;Y5 动态文字管关键词弹出来。看着像"手写",其实每一步都是参数。
用法也对味:语法、配色、节拍、转场全塞在一份 spec JSON 里,想换风格就改参数,渲染代码一行不用动;SKILL-MAPPING.md 把每条语法卡对到具体实现,差哪条一查就知道。官方引擎要 uv 加 Playwright,我们的 render.py 是它的确定性子集:纸纤维、手绘抖动、逐笔揭示、笔尖跟随、关键词弹出、相机运动(板上平移、甩镜、收尾拉远),种子固定,重复渲染逐像素一致。
六幕的手部动作是这样排的:
| 幕 | 板面 | 手的动作 |
|---|---|---|
| S1 0–10s | 错答打红叉 → RAG 定义揭开 | 慢写标题、画叉、之字形揭开定义卡 |
| S2 10–20s | 文档→切片→向量→入库四格 | 逐格画出,橙色连线引向下一板 |
| S3 20–30s | 问题向量 + 相似度条形图 | 画 5 格条,Top-3 描橙框 |
| S4 30–40s | 重排列表 + Prompt 拼条 | 重排箭头加拼条,红线穿过 |
| S5 40–50s | 打字机回答 + 引用红圈 | 逐字写回答,圈出 [1][2] |
| S6 50–60s | 七节点长卷 + "开卷考试"印 | 拉远揭示全图,盖章落点 |
渲下来逐帧 181 毫秒,比 Remotion 版还快两成;画面变化量 1.95%–3.36%,差不多是前者的两倍,那只手基本没停过。字幕是荧光笔带,压在画面下方,跟板面元素不打架。
两版对比:数据与实际观感
| 维度 | Remotion 版 | 白板版 |
|---|---|---|
| 风格气质 | 深色科技 Keynote 风 | 纸纹白板手绘风 |
| 教学适配 | 像课堂 PPT,结构清楚 | 艺术感强,讲清楚稍弱 |
| 小屏可读 | 正文 24–40px | 正文 30–56px |
| 版面利用 | 内容集中在上半屏 | 16:9 用得更满 |
| 整片渲染 | 约 6 分半 | 约 5 分半 |
| 改起来 | React 生态 + Studio 预览 | spec 子集,上游升级要人肉同步 |
| 许可 | 4 人以上公司付费 | MIT |
数据各有胜负,气质完全不同。Remotion 那版像课堂 PPT:卡片一块一块摆好,标题、正文、图表各就各位,讲知识就得是这个样子,观众一眼知道先看哪、后看哪。白板版走的是艺术路线:手写字、笔尖、盖章,艺术感很足,看着过瘾;可真要"讲清楚",反而不如 PPT 式来得直接。白板版的字大一号,手机上看得清,这是它实在的优点。
可真要改,Remotion 那版顺手多了,React 生态、Studio 预览、改节奏有标准路子。白板版的渲染器是照着 spec 写的子集,上游哪天升级,得我自己盯着同步。
所以建议就两句:讲课讲知识,用 Remotion 那版;发出去抓眼球,发白板版。以后要做成系列,拿 Remotion 当底座,把白板版的大字和满幅构图抄过去。
这条路线真正解决的问题
回到开头那句"剪辑师要失业了"。省事是真的:不用租场地,改版不用把人叫回片场。只是省的到底是哪一桩,得分清楚:省掉拍的功夫,和省掉改的功夫。一次性要个氛围,前者够了;要做系列内容、要反复改、要保证每个数字都对,只能靠后者。
说到底,代码出片好在哪?视频变成了能改的东西。分镜、渲染、验收都在自己手里,错了改哪儿算哪儿,不用整段重抽碰运气。我们那两版 60 秒的片子就是这么一路改出来的。