返回首页

带原生立体声音频的 AI 视频生成器

学习在生成 MiniMax H3 原生立体声视频时,如何指导环境音、音效、对白和音乐。

最近更新: 2026-08-05

同时导演画面和声音

MiniMax H3 可以在生成场景画面的同时生成原生立体声音频。声音指令应当服务于画面,建议描述重要声音的来源、距离、强度和出现时机,而不是罗列大量互不相关的音效。

四种常用声音层

  1. 环境音: 风声、室内底噪、车辆、雨声、人群或森林昆虫。
  2. 动作音效: 脚步、布料、机械、碰撞、开门或水声。
  3. 人声: 一句简短对白、低语、广播或背景交谈。
  4. 音乐方向: 克制的打击乐、远处弦乐、电子脉冲,或者明确不要音乐。

并不需要同时使用四层声音。两个清楚的声音层通常比拥挤的声轨更容易控制。

示例

安静室内

日出前,面包师打开一间小店,中景固定镜头,暖色实景灯光,轻微冰箱嗡鸣声,纸袋摩擦声,不要音乐。

动作场景

摩托车在潮湿隧道中加速,低机位跟拍,头顶灯光重复掠过,发动机声从左侧移向中央,伴随轮胎水花与深沉隧道混响。

对白时刻

宇航员透过起雾的头盔面罩向外看,面部特写,镜头缓慢推进,无线电静电声,她轻声说“我看见那些灯了”,克制的低频合成器音色。

改善声音指令的方法

  • 让每个主要声音都与画面中可见的事物关联。
  • 使用“附近、远处、身后、正在接近”等距离描述。
  • 短视频中的对白应保持简短。
  • 如果希望突出环境与音效,可以明确写“不要音乐”。
  • 发布前分别使用耳机和扬声器检查。

不同生成结果的音频仍可能存在差异。未经允许,不要把生成对白冒充真实人物;音乐和人声的使用也需要符合适用权利和平台规则。

MiniMax H3 Video 为独立运营服务,与 MiniMax 不存在隶属或官方背书关系。