MiniMax H3 的提示词生态在社区里已经积累了大量高完成度的实战案例,从整座城市被油画笔触实时画出,到山崩地裂拼出巨型片头字,再到一镜到底的后期级特效,收藏数动辄过百,说明这套提示词写法已经形成可复用的方法论 [1][9][15]。围绕它的编写工具、参数规格和实测表现也逐渐清晰,下面从几个方面展开。
先看社区里流传的具体提示词案例。用户 @aimikoda 用 MiniMax H3 做了一条"城市像油画一样被画笔当场建出来"的视频,提示词把城市名和引文抽成变量,替换即可通用,核心是让厚涂颜料像活物一样流动、堆积、自行建构街道桥梁与塔楼,并用暖金主光加冷紫补光营造黄昏质感 [1]。@CharaspowerAI 则把镜头拉到史诗尺度,让巨型山崖崩裂、巨石缓慢旋转碰撞,最终拼出"DOMINION"字样再随风崩解为尘埃 [9]。面向东方奇幻路线,@PixelAigc 把建筑透视、空气透视和人物比例全部写进提示词,让 H3 直出 2K 巨构画面,基本不用后期 [14]。一镜到底方向,@ponyodong 的提示词把手绘动画与实拍运动锁死,洗衣店变身夜空涂鸦,实拍叠手绘不漂不移 [15];同一作者的沿海列车片头提示词则给出分层运镜加胶片色调的关键词组合 [12]。这些案例的共同点是运镜、材质、光影都写得极其具体,而不是笼统描述风格。
针对官方手册里很多案例提示词不完整的问题,社区也给出了补全路径:用官方开源的 skill,配合 H3-Prompt-Writing,就能生成完整可用的提示词 [3]。此外有一款名为 h3-prompt-writing 的开源工具,专门把灵感拆解成模型可执行的规范提示词 [13]。来自 @IamEmily2050 的分享提供了一个多素材参考生成视频的通用提示词编写模板,适合需要同时喂入图片、视频、音频的框架化写作 [10];X 平台用户 ivanfioravanti 则公开了逐阶段生成提示词,完整还原专业数字绘画的角色创作全过程 [2]。这些工具和模板的存在,意味着写 H3 提示词已经不必从零开始。
从实测效果看,H3 对提示词的还原度相当高。有开发者测试纯文本生成的视频,完整还原了全部细节,连画面节奏都完全符合要求 [4]。在效率层面,广告机构通常需要数周完成的九幕广告分镜,H3 用单个提示词即可生成 [5]。也有用户在 H3 上生成了 motion-graphics 预告片,并把它视为 Seedance 的廉价替代方案 [11];还有博主分享了用 H3 分段生成再拼接成 45 秒日式文艺短片的完整流程与提示词 [20],以及高端旅行科技品牌宣传视频的提示词 [18]。特效方向同样有专门写法,创作者 @ponyodong 分享的提示词可以绑定手绘图层与实拍运动逻辑,无需逐帧手动抠图 [8]。
要写好提示词,先得了解模型本身的规格。H3 支持 2K 分辨率、24 帧每秒、5 到 15 秒的片段,单次生成可以输入 9 张参考图、3 段视频、3 段音频片段,外加文字描述,文本、图像、视频、音频共用同一个上下文 [16]。它最大的特点是能在同一个前向过程里同时生成视频和原生立体声音频,音频还能反过来驱动画面生成,测试者称这种音频驱动视频的模式此前从未在开源权重里见过 [16]。技术上,H3 放弃了 Hailuo-02 架构,改用分离理解和生成工作负载的训练架构,端到端训练吞吐量提升近 30% [19]。标注管道方面,大多数源材料需要约 100K token 的推理,蒸馏后平均只剩约 4K token [19]。该模型已于 8 月 3 日将权重放到 HuggingFace 上 [16],MiniMax 计划开源权重,但具体时间取决于法律法规,当时尚不清楚许可证类型与是否允许商用 [19]。
模型选择上,同一提示词在不同模型下的表现差异值得关注。有博主做过 MiniMax H3 与 Seedance 2.0 的同题对比实测,帮助创作者选择合适的模型 [6];随后又有博主用同一提示词分别生成,对比 H3 与 Seedance 2.5 的效果 [7]。日本用户 @onofumi_AI 对比了 H3 与微调后的 H3 Max,结果是速度极快而画质差别不大 [17]。需要注意的是,权重开放不等于体验顺畅,在消费级 GPU 上跑迭代速度很慢,每次失败的生成都要搭进实打实的时间和电费,运动一致性比预期好,但复杂的镜头移动和较长片段仍要多次尝试才能得到满意结果 [16]。因此一种省时的工作方式正在成形:先在托管平台(如免费自托管 H3 的 APOB AI)上测出哪组提示词和参考图能出干净结果,再回到本地硬件做完全控制或自定义的运行 [16]。