用户5333用户5333
用户284用户284
用户4944用户4944三大能力 | 阐释 |
原生多模态理解与生成 | 支持文字、图片、音频、视频等多种输入,理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图,并将多种参考信息自然融合,完成从素材理解到完整视听内容生成的一体化创作。 |
多模态精准编辑与控制 | 支持对人物、物体、场景、声音与节奏进行多维度编辑,并具备精细化指令遵循能力。创作者可以在已有内容基础上持续修改和迭代,更准确地落实对画面、声音与内容细节的调整需求。 |
商用级多场景内容生成 | 面向影视、广告、品牌、电商与游戏等真实商业内容场景。它兼顾文字字幕、品牌信息、创意特效、产品展示、UI/UX动态演示、游戏视觉及风格化表达,帮助创作者和内容团队更快完成创意验证、视觉提案与内容制作。 |
核心维度 | MiniMax-H3 | |
模型 | MiniMax-H3 | |
输出时长 | 4-15秒 | |
输出宽高比 | 首/尾帧模式下,遵循用户输入图片的原始长宽比 文生视频模式下,遵循用户指定21:9、16:9、4:3、1:1、3:4、9:16范围内的长宽比 全能参考模式下,遵循用户指定21:9、16:9、4:3、1:1、3:4、9:16范围内的长宽比或者选择自动模式由H3自行判断输出宽高比 | |
分辨率 | 768p模式(已开放) • 当输出宽高比在16:9~9:16之间时,输出为短边768像素;否则输出分辨率总面积约为1M像素,例如21:9时宽高为1536×672 • 768p生成的结果可以升级至1440p 1440p模式(官方推荐版👍) • 当输出宽高比在16:9~9:16之间时,输出为短边1440像素;否则输出分辨率总面积约为3.7M像素,例如21:9时宽高为2976×1248 | |
输出帧率 | 24 FPS | |
输出声音 | 所有结果全部带声音输出,原生双声道 | |
输入条件 | | |
首/尾帧入口 | • 图片:0、1、2张;宽高范围 [256, 5760];宽高比5:2~2:5范围内 • 无图片输入时为文生视频模式 | |
全能参考入口 | • 图片: ≤ 9 张;宽高范围:[256, 5760] • 视频 :≤ 3 段;单段时长[2, 15]秒;总时长≤ 15秒;宽高范围:[256, 5760];宽高比: 5:2~2:5范围内 • 音频 :≤ 3段,且必须配图片或视频输入,不能单独输入;单段时长:[2, 15]秒;总时长≤ 15秒 • 混合输入的总上限是 12 个文件 • 无图片、视频、音频输入时为文生视频模式 | |
输入格式支持 | 视频:H.264/AVC、H.265/HEVC;视频内音频:AAC、MP3 图片:JPG、JPEG、PNG、WEBP、HEIC、HEIF 音频:WAV、MP3 | |
传入大小限制 | 视频单个50MB;图片单个30MB;音频单个15MB(加起来的不限制,限制都在单个素材上);API 请求体 64MB(推荐使用url传入素材) | |
提示词字数上限 | 不超过7000字符 | |
语言支持与本地化表达 | 支持多语言提示词输入与输出 TTS (文本转语音)精准覆盖 11 种语言,包括中文、英语、日语、韩语、法语、德语、西班牙语等 更多语言可衍生探索,如阿拉伯语、泰语、印尼语、印地语等40多种语言 适合海外品牌传播、多语种广告、跨语言短片和本地化产品介绍等场景 | |