带原生立体声音频的 AI 视频生成器
学习在生成 MiniMax H3 原生立体声视频时,如何指导环境音、音效、对白和音乐。
最近更新: 2026-08-05
同时导演画面和声音
MiniMax H3 可以在生成场景画面的同时生成原生立体声音频。声音指令应当服务于画面,建议描述重要声音的来源、距离、强度和出现时机,而不是罗列大量互不相关的音效。
四种常用声音层
- 环境音: 风声、室内底噪、车辆、雨声、人群或森林昆虫。
- 动作音效: 脚步、布料、机械、碰撞、开门或水声。
- 人声: 一句简短对白、低语、广播或背景交谈。
- 音乐方向: 克制的打击乐、远处弦乐、电子脉冲,或者明确不要音乐。
并不需要同时使用四层声音。两个清楚的声音层通常比拥挤的声轨更容易控制。
示例
安静室内
日出前,面包师打开一间小店,中景固定镜头,暖色实景灯光,轻微冰箱嗡鸣声,纸袋摩擦声,不要音乐。
动作场景
摩托车在潮湿隧道中加速,低机位跟拍,头顶灯光重复掠过,发动机声从左侧移向中央,伴随轮胎水花与深沉隧道混响。
对白时刻
宇航员透过起雾的头盔面罩向外看,面部特写,镜头缓慢推进,无线电静电声,她轻声说“我看见那些灯了”,克制的低频合成器音色。
改善声音指令的方法
- 让每个主要声音都与画面中可见的事物关联。
- 使用“附近、远处、身后、正在接近”等距离描述。
- 短视频中的对白应保持简短。
- 如果希望突出环境与音效,可以明确写“不要音乐”。
- 发布前分别使用耳机和扬声器检查。
不同生成结果的音频仍可能存在差异。未经允许,不要把生成对白冒充真实人物;音乐和人声的使用也需要符合适用权利和平台规则。
MiniMax H3 Video 为独立运营服务,与 MiniMax 不存在隶属或官方背书关系。