>>No.69359782
做ai漫剧的话,总体流程就是跑多个4-15s的视频,然后通过剪辑等手段将他们剪辑成一个连贯的视频。对于单个15s,主要就是三个步骤:
1、确定自己这4-15s要做哪段剧情
2、出资产图
3、出视频提示词
然后就可以生成了。
这三步都各有各的重要,尤其是资产图,经常被人忽略,资产图如果跑的很拉跨,比如油腻、噪点多、太多无效信息,提示词再好也救不过来。目前我自己比较喜欢的人物资产图格式是1:1画幅,左半边一个大头照+右半边一个正面全身照;业内可能比较常见的还是大头照+三视图。
秒数需要多少秒就做多少秒就可以了,只要内容量能匹配上。一开始可以拿豆包练手,因为它跑视频是免费的。
做视频比较大的难题一般就只有站位和一致性。其他的分镜啊、画面质感啊都挺好做的,也可以通过审美力大转飞去挽救,但是怎么让下一个视频跟之前的视频可以连贯起来是做视频最大的难题。
> 关于参考图的类型
比如说,我要跑一个少年少女在街头相遇的视频,为了能保持下一次15s也能有一致的连续性,我们就需要使用全能参考模式,传入至少三张参考图:男主人物图,女主人物图,和场景图。这就是最基本的全能参考,分镜等全靠提示词写。
然后有时候,我们的这个视频必须要和上一个视频的尾帧接起来,我们就需要截取视频的首帧作为参考图,在提示词中指定这张图为首帧;我个人不太推荐直接使用首尾帧生成,直接在全能参考指定图x为首帧还可以继续传其他的参考图。尾帧同理。这种是首尾帧。
有的时候,我们也会需要一个全景站位图,来让文字无法精准描述站位的时候,使视频可以理解;有时候也可以拿色卡作为参考图,作为视频质感的铆钉;这种就是用来辅助的参考图。其中站位参考图会用的比较多。
> 关于参考图怎么生成(生图)
不同的生图模型有自己不同的提示词好球区,例如我自己最喜欢用的生图模型是z image turbo,我做人物资产的提示词就是:
> 生成画幅1:1的写真人像,画面严格对半分,左半部分是肩部以上的头部大头照,右半部分是从头到脚的全身正面主视图,纯白色背景;双短马尾、娇小年轻女性balabala。
这部分无论是出提示词还是跑图都用豆包就可以了,比如你这么问豆包:
> 给我一个能生成xxxx人设的中文生图提示词,自然语言描述即可
就差不多了。
> 关于视频提示词(生视频)
这应该是最有发挥空间的部分。不同的视频模型有不同的最佳实践,目前最主流的还是seedance,这是seedance的提示词官方文档:https://www.volcengine.com/docs/82379/2222480?lang=zh。如果你要使用其他的视频模型,其实原理都是差不多的,主要就是有画面感,描述画面中可见的内容就可以了。对于seedance,提示词不需要写的天花乱坠或者写的太多。人类可以轻松看懂,有画面感的,那么seedance就也可以做的很好。这部分可能遇到的一个问题叫提示词污染,肥哥有空可以搜一下。
基本格式就是:
限制词(比如真人画风)
分镜1
分镜2...
限制词(比如无bgm无字幕)
这样。一般不会给每个分镜限定秒数,让视频模型自由发挥就可以了。当然是一般情况,如果需要严格控制,那可以:
限制词(比如真人画风)
分镜1 0-2s
分镜2 2-4s...
限制词(比如无bgm无字幕)
这样。
至于具体的模板的话,这个就很百花齐放了,这部分我个人比较推荐狗站的work fisher这个博主,主要是分享开源工作流的,不过也有分享seedance的一些提示词模板,我感觉还是好用的。
> 关于怎么确定自己要做多少秒,要做哪部分的剧情
一般按照信息边界/切镜/台词字数来决定。例如,我们有一个剧情是A愤怒的甩了B一巴掌,二人争吵,然后B哭泣然后夺门而出。假如我们要做成两段,比较好的切分应该是A甩B巴掌,争吵,可以做个12s;然后B夺门而出,估摸着可以做个8s。我们就不能做成A甩B巴掌,争吵,B夺门而出的一瞬间然后卡,做个15s;B继续夺门而出做个4s。我个人比较喜欢通过切镜来让视频连起来所以会喜欢这样切分。
关于台词,一般来讲语速2-4/s比较好,不能超过5字/s。保持正常、统一的语速会让观感好很多。
> 关于出来的片和剪辑
ai漫剧一个很重要的特征就是不可控,有时候剧情都得因为抽出来的视频去改。生成了一个不完美的视频的时候必须得强迫自己找到可能有用的那一部分,不能有一点不满意就全部重跑或者完全不要这个片段了。肥哥有剪辑功底的话,这部分应该就不难。
基本就是这些啦。我自己做的常规漫剧不多,一直都是在做小说改,红果都没看过,所有视频是老老实实照着小说写的去做的,所以关于情绪调动或者钩子等剧情上的东西就不太能有什么参考性了。萌新初上手就多做多思考就可以了,先做一个60分的成片出来比啥都重要,慢慢摸清楚怎么驯服seedance就会好起来了。
还有什么问题肥哥也可以问我(`ε´ )