MiniMax H3
欢迎回来
登录账号,继续创作。
登录
注册
使用 Google 继续
或使用邮箱
邮箱
访问密码
邀请码
邮箱验证码
发送验证码
登录
设置密码
邀请码
完成注册
MiniMax H3 · 工作台
余额
—
兑换码充值
兑换
今日消费
—
累计消费
—
累计生成
—
消费记录
充值记录
预览中 · 改动不会保存
登录
首页
工作台
视频生成
音频生成
物品建模
MiniMax H3
创作空间
· 从灵感到成片
开始创作
H3 STUDIO
AI FILMMAKING
MiniMax H3
让每一个灵感,成为下一幕。
开启创作
影像,始于想象。
新建画布创作
你的下一部作品,从这里开始
MiniMax H3
视频创作
图片生成
自由想象
音频创作
配音 / 配乐
物品建模
照片 → 三维模型
导演台
故事成片
逐帧拉片
参考图生视频
最近项目
查看全部
正在加载项目…
重新加载
新建项目
东方奇幻
古风短片
城市叙事
电影感
人物故事
角色创作
灵感广场
H3 Show
本地精选
全部
电影叙事
东方奇幻
生活片段
角色设定
没有找到相关灵感
H3
正在连接项目…
连接中
重试
生成历史
导出成片
片段
0
全部
视频
音频
已完成
生成中
失败
收藏
批量操作
加载更多
100%
故事脚本
角色三视图
参考图生视频
音频参考生视频
还没有片段
创建片段
素材管理
100%
分镜
0 镜
清空
生成中预览
先出草稿
保持人物长相
重画更多细节
首尾帧
锚点
加锚点
生成
视频
图片
音频
1 个候选
2 个候选
4 个候选
运镜
固定镜头
缓慢推近
缓慢拉远
水平摇镜
跟随主体
环绕主体
升降镜头
1:1 方形
2:3 竖版
3:2 横版
1 张
2 张
4 张
配音
音效
配乐
5 秒
10 秒
30 秒
60 秒
120 秒
不用技能
创作工具
视频生成
MiniMax H3
打开工作台
创作
生成记录
新建视频
VIDEO
画面描述
?
0 字
东方奇幻
城市电影
生活片段
生成设置
模型
画质
精修方式
保持人物长相(推荐)
重画更多细节(人脸可能变)
时长
秒
清晰度
画幅
参考素材
可选
生成方式
参考图片 / 视频 / 声音
首帧和尾帧
参考图
?
0 / 9
人物、场景长什么样
参考视频
?
0 / 3
学动作和镜头运动
参考声音
?
0 / 3
学说话的音色
首尾帧
?
首帧必填 · 尾帧可留空
对口型 / 固定画面
?
0 / 8
让人物唱指定的歌,或指定某一刻的画面
高级设置
复用运动(种子)
?
种子已锁定
生成中预览
?
先出草稿,满意再变清晰
?
生成视频
生成记录
0
最近 40 条
全部
进行中
已完成
未完成
记录加载失败
重试
正在创作
空闲
还没有任务
正在载入生成记录
开始创作
东方奇幻
城市电影
创作工具
音频生成
配音
打开工作台
创作
生成记录
声音创作
AUDIO
配音
音效
配乐
配音文本
?
0 字
故事旁白
开场介绍
音色来源
我的音色库
文字描述音色
音色
?
正在读取音色…
克隆音色
这个音色
缺参考音频的转写
, 直接合成会失败。把参考音频里说的话一字不差填进去就能用(不用重新传音频)。
这个音色的参考转写
?
保存转写
音色描述
新音色的名字
参考音频
0 / 1
参考音频的转写
克隆并加入音色表
高级设置
语速
文件格式
WAV
MP3
生成配音
下载
音效描述
?
雨夜街道
山间清晨
配音效的视频
0 / 1
可选,给了会跟着画面动作对上
时长(秒)
得到
带音效的视频
只要音效
高级设置
精细度(步数)
贴合描述的程度
种子
生成音效
音乐风格
?
电影配乐
轻柔钢琴
歌词
不写就是纯音乐
时长(秒)
高级设置
精细度(步数)
贴合描述的程度
种子
生成配乐
生成记录
0
最近 40 条
全部
进行中
已完成
未完成
全部声音
配音
音效
配乐
记录加载失败
重试
正在创作
空闲
还没有任务
正在载入生成记录
开始创作
故事旁白
环境音效
电影配乐
创作工具
物品建模
TRELLIS.2 · DGX
照片建模
场景工作室
打开工作台
创作
生成记录
照片变模型
3D OBJECT
产品照片
?
0 / 8
一张就能出模;多角度更完整
物品名称(可不填)
精度
1024 · 标准
512 · 快
1536 · 精细(慢几倍)
按原图精修贴图
自动(多图开、单图关)
开
关
种子
开始建模
首次约 3 分钟(要先加载 4B 模型),之后每个约 1–2 分钟;和视频排同一条队列,前面有视频在跑要等。
生成记录
0
最近 40 条
全部
进行中
已完成
未完成
记录加载失败
重试
正在建模
空闲
正在载入生成记录
开始创作
放同一个物件的 1–8 张照片:
正面为主,多角度更完整
(三张以上会做多视角投票融合,背面不再靠脑补)。 背景干净、物体占满画面效果最好;服务端会自动抠图。出来的是带 PBR 贴图的 GLB,可直接下载进 Blender / 三维软件, 卡片上点
3D
能在页面里转着看,「转台」是渲染好的旋转短片。
建模跑在 DGX 上(TRELLIS.2-4B),和视频排同一条队列、按模型分组整批跑:前面有视频在跑要等它们先出片。
写清楚
画面里有什么、在做什么、镜头怎么动
,还可以写台词和环境声——声音会一起生成。
用了参考素材时,可以在句子里写
<Picture 1>
、
<Video 1>
、
<Audio 1>
来指明是哪一个。
小技巧:
远景别写细小动作
,画面里太小的东西动不起来;
给了参考图就少写外貌
,写多了反而不像参考图。
保持人物长相
:只做轻微精修,人和构图不会变。
重画更多细节
:画面变化更大,人脸可能不像原来。
能选的时长范围由模型决定,越长生成越慢。
实际时长会有一点点出入(比如填 7 秒可能出 7.3 秒),这是正常的。
能选的清晰度由模型决定,列表里有的都能用。
横屏选 16:9,手机竖屏选 9:16。
用首尾帧生成时,首帧图片会被拉伸成这个比例,最好先把图片裁成一样的比例,不然人会变形。
每条视频都有一个「种子」编号,同样的种子 + 同样的设置,会得到
几乎一样的动作和镜头
。
想保留某条视频的动作、只改几个字:在结果卡片上点「种子」,它会自动填到这里,改好提示词再生成。
换了时长、清晰度、画幅或参考素材,动作就不一样了。
参考图片 / 视频 / 声音
:让成片参考人物长相、动作或音色。
首帧和尾帧
:给出开头(和结尾)的画面,中间怎么变由提示词决定。
两种方式只能选一种,另一边传过的素材会保留,但这次不会用到。
最多 9 张。想让人物像某个人,直接放一张清晰的脸部照片,比在提示词里描述管用得多。
最多 3 段,每段 2–15 秒。成片会学它的
动作和镜头运动
。
视频自带的声音默认不用;需要时点「♪」打开,生成会慢一些。
最多 3 段。成片会学它的
音色
,但不会原样放进成片,内容和节奏都会重新生成。
想让人物唱一首指定的歌,请用下面的「对口型 / 固定画面」。
画面会从首帧慢慢变到尾帧,中间怎么变写在提示词里。尾帧可以不放。
这种方式不能同时用参考素材。首帧会被拉伸到你选的画幅,最好先裁成一样的比例。
放一首歌
:人物会跟着唱,口型能对上。这是做唱歌、对口型的正确方法。
放一张图
:指定视频某一刻必须是这个画面。注意它影响很大,会带着整条视频往这张图的风格走, 所以要和参考图是同一个人、同一个场景。
位置按帧算,每秒 24 帧(第 48 帧 = 第 2 秒),填负数表示从结尾倒数。
打开后,生成过程中卡片上会显示一小段动图,提前看出动作对不对。生成会稍微慢一点点。
打开后,会先很快出一条
草稿
:构图、动作、声音都和正片一样,只是细节模糊。
看过觉得可以,再点「变清晰」出正片,不用重新生成。
不点就没有正片
。
输入文字,选一个音色,马上就能出配音,不用排队。
没法指定配音的精确时长,想卡时间可以调「高级设置」里的语速。
这里要填
参考音频里说的原话,一字不差
。填错了声音会不像,填空会直接失败。
点「克隆音色」,上传一段 3 秒左右的清晰人声,写上它说的原话,就能多出一个音色。
录音越干净越好,背景音乐和杂音会被一起学进去。加好马上就能用。
给了视频
:音效会跟画面里的动作对上,比如脚步、开门、碰撞,描述可以不写。
没给视频
:按描述生成音效,这时描述必须写。
音效和视频排同一个队,前面有视频在生成时要等一会儿。
音乐风格
用英文标签效果最好,比如 cinematic, piano, calm。
歌词不写就是纯音乐,做背景音乐一般都这样。生成很快,可以多试几次挑喜欢的。
删除记录
取消
删除