AI 自动剪辑视频之(二)
上一篇讲了我怎么把整条流水线搭起来。这一篇专门掰扯画面。
做短视频,文案好写,配音好办,字幕更是个纯技术活。真正卡人的永远是画面。你手上没有素材,又不想出门拍,剩下的办法就两种,要么让 AI 画一张图再让它动起来,要么让 AI 直接生成一段视频。
这一篇讲前一种。
一、先说个容易误会的事
很多人一听“免费”,就以为免费档也能出图。
不是的。我流水线里那个免费档用的是本地占位图,说白了就是一张纯色渐变,上面把提示词的文字写上去,长得跟 PPT 的空白页差不多。它的用处只有一个,让你看清节奏和字幕断句对不对,真发出去可是万万不能的。
真能看的图得花钱,走火山方舟的 Seedream,好消息是这个便宜到可以忽略,一张才几分钱,一条十秒的片子拢共两三张图,几毛钱就下来了。你拿一杯奶茶的钱能生一百多张,随便试。
所以“图片生成视频”底下其实藏着两个东西:不要钱的那种发不出去,能发的那种要钱,但那点钱真不叫钱。
二、图有了,怎么让它动起来
图是静的,视频得动,中间这一步有两条路,价钱差着两个数量级。
第一条是本地推拉摇移,也就是老法子的“肯·伯恩斯效果”。
原理很土,把一张图放大一点,再让取景框慢慢往里推、往外拉、往左移、往右移,一秒三十帧地渲出来,看着就像镜头真在动。这一步纯本地算,一分钱不花,画面也绝不会变形,因为它压根没生成任何新东西,只是在裁一张图而已。
缺点也明显,它动的是镜头,不是画面里的东西,人不会眨眼,水不会流,旗子也不会飘。口播类的内容其实够用,你听的是那几句话,画面只要不难看就行。但你要做赛车飞驰、要做人物动作,这个法子表现不出来。
第二条是把图喂给 Seedance,让它真的动起来。
这就是大家常说的图生视频了,你给一张图,它拿这张图当第一帧,往后生成几秒钟真实的运动。人会转头,光会变,尘土会扬起来。效果和上一条不在一个层次。
代价是按秒计费。Seedance 最短出五秒,两个镜头就按十秒算,一条十秒的片子十几块。生图那点钱可以忽略,这个不能。
三、图生视频比文生视频强在哪
这里有个反直觉的地方,值得单说。
你可能会想,既然 Seedance 能直接文生视频,那我干嘛还多花一步去生图呢,直接一句话让它出视频不就完了。
问题出在连贯性上。
文生视频每一镜都是模型独立想象的。你第一镜写“赛车过弯”,第二镜写“赛车冲线”,它就给你两台车,涂装不一样,机位不一样,连光线也对不上,观众一看就出戏了。
图生视频就不一样了,你先把每一镜的图生出来,图跟图之间互相参照,人物、配色、风格都能对上,然后每张图各自变成一段视频,动的是图里的东西,图定死了,视频自然就统一了。
先定画面再定运动,比一次性想象整段视频靠谱得多。 这是我这一天里最有用的一条心得。
四、同一个人怎么保证不变脸
顺着上面这条往下,就到了角色一致性。
片子里有出镜的人,最常见的翻车就是第一镜三十岁第二镜五十岁,衣服换了发型也跟着换了。我的解法是在脚本里加一个字段,叫 character,一句话把人固定住:
三十岁左右的中国男性,短发,深色连帽卫衣,安静专注
跑的时候流水线会先单独生一张角色参考图,存成 _ref.png,之后每一镜生图都带着这张图去,同时把这句描述也拼进提示词里做双保险。这样三个镜头里就是同一个人了。手上要是已经有现成的人物照片,那更简单,直接写 reference_image 指过去,优先级比 character 还高。
有一条我给自己划了红线:涉及真实人物,绝不用这个字段去生成他的脸。
前两天我做那条讲张雪机车的片子,张雪是真人,真实存在的企业家。我可以讲他公司拿了 WSBK 分站冠军,那是公开报道过的事实,但我不能让 AI 编一张他的脸放进视频里,更不能编他说过的话。那条片子我全走的不露脸镜头,赛车、压弯、终点线,事实按公开报道来,一个字不多编。
这不是什么技术上做不到,是我自己不干。
五、提示词怎么写才不翻车
写了一天下来,几条实在的:
画面提示词要写具体的东西,别写概念。 “科技感”“未来感”“充满希望”这类词模型接不住,它压根不知道该画什么。你得写主体、环境、光线、色调、构图:“深夜书桌前,人物侧脸被屏幕微光照亮,暖色调,竖构图”,这样它才有的画。
运镜提示词一个动作就够了。 推近、拉远、左移、右移,挑一个写死,你要写成“镜头先推近再环绕最后拉远”,出来的东西一定糊,动作越复杂变形越厉害。
竖屏的主体往画面中上部放。 底下那块得留给字幕,主体放中间偏上,字幕压上去才不挡脸。这个在提示词里直接说,模型听得懂。
不要在提示词里要求出现文字。 生图模型写中文字基本都是鬼画符,需要文字就后期加,字幕、标题都走剪辑那一步。
六、这三档到底怎么选
我自己的用法是分档跑,一档一档往上加钱。
文案还在改的时候,全程用免费的占位图加本地推拉摇移,改一百遍也是零成本,只看节奏和字幕。文案定了,换成 Seedream 真生图,还是本地运镜,几毛钱,这一步专看画风对不对、色调统不统一。画风也满意了,最后才开 Seedance 让它真动起来,十几块,出正式版。
这个顺序千万别倒过来。 你要是一上来就开生视频,改一次文案烧一次钱,几十块就这么飘走了。
我在流水线里也把这个规矩写死了,缓存记的是生成参数,你改了口播、改了提示词、换了音色,只有那一镜重做,别的照旧复用。所以往上加钱的时候,前面几档的成果不会白费。
七、下一篇讲什么
这一篇讲的都是“让 AI 画”。但还有一条路我一个字没提,就是根本不用 AI 画,直接拿现成的视频素材来剪。
那条路有它自己的门道,也有它自己的坑,尤其是素材从哪儿来这件事,中间有个特别常见的误解——很多人以为大模型能帮你上网找素材,其实它只会造,不会找。这个下一篇细说。
最后说句题外的。我现在做片子,第一反应已经不是“让 AI 画一张”,而是“我手机里有没有现成的”。AI 画得再好,也不如你自己拍的那张菜市场照片有味道,还不要钱。