MiniMax发布全模态生成模型H3,一个模型包办图片、视频和声音
律动BlockBeats|2026年07月31日 02:35
MiniMax 发布全模态生成模型 H3。它能同时理解文字、图片、视频和声音,再按一条自然语言指令生成或编辑视频。用户可以让 H3 照着一段视频学镜头运动,使用另一张图中的人物,再参考第三段音频的声音。过去需要分别调用的动作迁移、人物参考、声音参考和视频编辑,现在可以放进同一次任务。H3 最长可生成 15 秒视频,支持 2K 分辨率和原生双声道声音。官方 API 的 2K 价格为每秒 0.13 美元,生成一段 15 秒视频约需 1.95 美元;768P 每秒 0.09 美元。一次任务最多可输入 9 张图片、3 段视频和 3 段音频,总数不能超过 12 个文件。MiniMax 计划未来几天开放模型权重。官方尚未公布与 Seedance、Veo 等模型的统一评测。[原文链接](动察 Beating)
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接