无标题无名氏No.68499883 只看PO
2026-04-17(五)00:11:28 ID:ihZXS6M 回应
今天做了啥?今天学了啥?时间都去哪了?明天要干啥?
( ゚∀。)领着去掉五险一金只有1500的试用期工资,在初创公司当牛做马的记录串
公司性质:ai影视,目前负责搓工作流、做内部网站、做各种妙妙小工具;跑视频;带仨学生。
上班时间:目前为止一个月
无标题无名氏No.69343538
2026-08-29(六)13:14:06 ID: ihZXS6M (PO主)
>>No.69343273
8g显存就可以了,内存应该32g,我现在是12g显存,就已经够用了
无标题无名氏No.69358429
2026-08-31(一)18:42:47 ID: ihZXS6M (PO主)
居然还有外国友人在等(|||゚д゚)
这两集我感觉我拉了一坨大的,下定决心只跑量捞钱,都不敢看评论区了。现在也还是只敢偷瞄。
公司那边……他们在做解说漫的测试,做的很困难。从上到下每个人都养了自己的模板,无论是老板还是员工,哪怕我已经分享过好几种不同渠道的验证过的模板和效果,分享和汇报好几次,但是无一人使用。是我还不够主动吗?还是工作流不够直观好用?但是最原子的system prompt我也发了呀?结果这几个月他们真的一点进步都没有,无论是质感还是一致性,还是对ai生成内容的不完美预期。我还是再打磨打磨吧,能一次性流水线出一集了,我再向上报告,现在半自动的模式看起来他们并不喜欢用。
平台那边在按部就班的推进,本地化ok了,但是本地接模型差台机子测试,但是也不好把我电脑带过去……应该可以带过去,不然确实没法继续了。ok。然后今晚跑第四集,同时去完成移动云那边素材库的api。话说那边的价格基准还没有定下来……算了,先接素材库吧,了解了解他们这种素材库的结构也算开阔眼界了。
无标题无名氏No.69359697
2026-08-31(一)21:41:08 ID: ihZXS6M (PO主)
>>No.69358429
啊Σ( ゚д゚)组长还真在用了,不过风格怎么跟在我手上差这么多?还是不够完善。
无标题无名氏No.69359718
2026-08-31(一)21:44:40 ID: ihZXS6M (PO主)
可能这就是审美不同了吧。话说sd生成的也太油了( ゚∀。)还是雨夜属于这些模型的坏球区?
无标题无名氏No.69359782
2026-08-31(一)21:51:51 ID: NREbkYo
一路看下来了,肥哥强强(*´∀`),我也是在刚毕业在小县城的初创企业工作,属于文员吧杂七杂八的做文件或者拍摄剪辑都要统筹,对ai的了解只限于让克劳德做ppt和让gpt指导我做完全不了解的工作,但是九十月份老板好像要我去从0负责ai漫剧的业务,心底慌的一批,我该怎么开始学呢(;´Д`)
无标题无名氏No.69359822
2026-08-31(一)21:57:47 ID: ihZXS6M (PO主)
>>No.69359782
噢噢,太好了,这个我应该能稍微给肥哥解答!(*゚∇゚)
待我组织一下语言
无标题无名氏No.69360518
2026-08-31(一)23:21:05 ID: ihZXS6M (PO主)
>>No.69359782
做ai漫剧的话,总体流程就是跑多个4-15s的视频,然后通过剪辑等手段将他们剪辑成一个连贯的视频。对于单个15s,主要就是三个步骤:
1、确定自己这4-15s要做哪段剧情
2、出资产图
3、出视频提示词
然后就可以生成了。
这三步都各有各的重要,尤其是资产图,经常被人忽略,资产图如果跑的很拉跨,比如油腻、噪点多、太多无效信息,提示词再好也救不过来。目前我自己比较喜欢的人物资产图格式是1:1画幅,左半边一个大头照+右半边一个正面全身照;业内可能比较常见的还是大头照+三视图。
秒数需要多少秒就做多少秒就可以了,只要内容量能匹配上。一开始可以拿豆包练手,因为它跑视频是免费的。
做视频比较大的难题一般就只有站位和一致性。其他的分镜啊、画面质感啊都挺好做的,也可以通过审美力大转飞去挽救,但是怎么让下一个视频跟之前的视频可以连贯起来是做视频最大的难题。
> 关于参考图的类型
比如说,我要跑一个少年少女在街头相遇的视频,为了能保持下一次15s也能有一致的连续性,我们就需要使用全能参考模式,传入至少三张参考图:男主人物图,女主人物图,和场景图。这就是最基本的全能参考,分镜等全靠提示词写。
然后有时候,我们的这个视频必须要和上一个视频的尾帧接起来,我们就需要截取视频的首帧作为参考图,在提示词中指定这张图为首帧;我个人不太推荐直接使用首尾帧生成,直接在全能参考指定图x为首帧还可以继续传其他的参考图。尾帧同理。这种是首尾帧。
有的时候,我们也会需要一个全景站位图,来让文字无法精准描述站位的时候,使视频可以理解;有时候也可以拿色卡作为参考图,作为视频质感的铆钉;这种就是用来辅助的参考图。其中站位参考图会用的比较多。
> 关于参考图怎么生成(生图)
不同的生图模型有自己不同的提示词好球区,例如我自己最喜欢用的生图模型是z image turbo,我做人物资产的提示词就是:
> 生成画幅1:1的写真人像,画面严格对半分,左半部分是肩部以上的头部大头照,右半部分是从头到脚的全身正面主视图,纯白色背景;双短马尾、娇小年轻女性balabala。
这部分无论是出提示词还是跑图都用豆包就可以了,比如你这么问豆包:
> 给我一个能生成xxxx人设的中文生图提示词,自然语言描述即可
就差不多了。
> 关于视频提示词(生视频)
这应该是最有发挥空间的部分。不同的视频模型有不同的最佳实践,目前最主流的还是seedance,这是seedance的提示词官方文档:https://www.volcengine.com/docs/82379/2222480?lang=zh。如果你要使用其他的视频模型,其实原理都是差不多的,主要就是有画面感,描述画面中可见的内容就可以了。对于seedance,提示词不需要写的天花乱坠或者写的太多。人类可以轻松看懂,有画面感的,那么seedance就也可以做的很好。这部分可能遇到的一个问题叫提示词污染,肥哥有空可以搜一下。
基本格式就是:
限制词(比如真人画风)
分镜1
分镜2...
限制词(比如无bgm无字幕)
这样。一般不会给每个分镜限定秒数,让视频模型自由发挥就可以了。当然是一般情况,如果需要严格控制,那可以:
限制词(比如真人画风)
分镜1 0-2s
分镜2 2-4s...
限制词(比如无bgm无字幕)
这样。
至于具体的模板的话,这个就很百花齐放了,这部分我个人比较推荐狗站的work fisher这个博主,主要是分享开源工作流的,不过也有分享seedance的一些提示词模板,我感觉还是好用的。
> 关于怎么确定自己要做多少秒,要做哪部分的剧情
一般按照信息边界/切镜/台词字数来决定。例如,我们有一个剧情是A愤怒的甩了B一巴掌,二人争吵,然后B哭泣然后夺门而出。假如我们要做成两段,比较好的切分应该是A甩B巴掌,争吵,可以做个12s;然后B夺门而出,估摸着可以做个8s。我们就不能做成A甩B巴掌,争吵,B夺门而出的一瞬间然后卡,做个15s;B继续夺门而出做个4s。我个人比较喜欢通过切镜来让视频连起来所以会喜欢这样切分。
关于台词,一般来讲语速2-4/s比较好,不能超过5字/s。保持正常、统一的语速会让观感好很多。
> 关于出来的片和剪辑
ai漫剧一个很重要的特征就是不可控,有时候剧情都得因为抽出来的视频去改。生成了一个不完美的视频的时候必须得强迫自己找到可能有用的那一部分,不能有一点不满意就全部重跑或者完全不要这个片段了。肥哥有剪辑功底的话,这部分应该就不难。
基本就是这些啦。我自己做的常规漫剧不多,一直都是在做小说改,红果都没看过,所有视频是老老实实照着小说写的去做的,所以关于情绪调动或者钩子等剧情上的东西就不太能有什么参考性了。萌新初上手就多做多思考就可以了,先做一个60分的成片出来比啥都重要,慢慢摸清楚怎么驯服seedance就会好起来了。
还有什么问题肥哥也可以问我(`ε´ )