Phyrex
Phyrex|2026年08月25日 16:51
X 上的大神还是很多的,在大神的指导下,我已经从 RTX PRO 6000 Blackwell Max-Q 96GB X 4 换成了 标准版,而且确实因为现在内存上涨导致了 Max-Q 和 标准版的价格是一样的,但却是标准版的机器配置起来要难很多,只是跑双卡还行,但是跑四卡就很难搞定了。 另外我仔细研究了一下“黄果”,大概逆向出来了黄果的做法,我用一个 8 分钟的视频做的拆解,在不包含片头片尾的情况下,一共大概 117 个镜头,镜头中位长度约 3.2 秒,约 72% 的镜头不超过 5 秒,约 92% 的镜头不超过 8 秒,约 95% 的镜头不超过 10 秒。 通过分析知道 24fps 转 30fps 的痕迹,部分镜头平均每 5 帧就会出现一帧和上一帧高度接近的重复帧,符合 24fps 素材通过重复帧转成 30fps 的特征,而且不同镜头的重复帧位置并不完全一样,说明这些镜头很可能分别生成、分别处理,最后才被放到 30fps 的剪辑时间线上。 这就说明底层很有可能使用的是 Wan 2.2,但 Wan 2.2 官方输出就是 24fps,再结合镜头长度、人物漂移、衣服变化、场景结构变化和图生视频特征,Wan 2.1、Wan 2.2 或者基于 Wan 微调的模型,所以用 Wan 就可以了。 黄果大概率没有一个可以直接生成 8 分钟成人视频的模型。制作方式应该是先用大语言模型写剧本和拆分镜头,再通过角色 LoRA 或参考图固定人物,用图片模型逐个生成高质量关键帧,然后交给 Wan 这类 I2V 模型生成 3 到 8 秒的视频。 对话镜头再单独做口型和表情驱动,成人镜头使用专门微调过的模型或 LoRA,复杂双人动作可能还会加入参考视频、姿态或 Video-to-Video。最后统一做超分、去闪烁、24fps 转 30fps、配音、字幕、系统界面和剪辑。 其中的成人镜头很有可能不是用 Wan 生成的,或者说纯粹的成人镜头不是用的 Wan ,因为成人部分的单帧质量很高,长时间动作质量一般。单独截取某一帧时,人物皮肤、灯光、身体比例和构图可以非常精细。但连续播放时会看到很多 BUG 。 我判断成人镜头很可能经过三层处理,首先是成人图片关键帧使用经过成人数据训练的图片 checkpoint 或 LoRA,先生成姿势、人物和场景相对正确的静态画面。然后是成人视频微调,用 Wan 系或类似视频模型的成人 LoRA、低秩微调或全量微调,让模型能够理解原版权重中较弱的成人动作。 最后是动作参考,部分双人或多人互动可能输入了动作参考视频、姿态序列或深度信息。画面是生成的,但运动轨迹可能来自真人素材或其他视频。 所以最可能的完整制作流水线是: LLM 编写剧情 1. 自动拆分镜头与台词 2. 建立男女角色设定图 3. 为主要角色训练 LoRA 或建立参考图库 4. 建立场景模板 5. 图片模型逐镜头生成关键帧 6. 人工筛选、修手、修脸、修文字 7. 普通镜头使用 Wan I2V 或 TI2V 8. 对话镜头使用 Wan S2V 或后期 Lip-sync 9. 成人镜头使用成人向 Wan 微调或 LoRA 10. 部分复杂动作输入真人运动参考 11. 超分、去闪烁和 24→30fps 12. TTS、配乐、效果音和混音 13. 字幕、UI、广告和水印 14. 剪辑成 8 分钟完整短剧 欢迎大家讨论。 @Gate Crypto、美股、港股、韩股、黄金、CFD、预测市场一站交易(Phyrex)
+2
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读