MiniMax H3 프롬프트는 짧은 제작 설계로 쓰는 것이 좋습니다. 모드를 고르고 각 레퍼런스의 역할, 시간 변화, 반드시 유지할 요소를 명확히 적습니다.
요약: H3를 시간 기반 제작 brief로 작성하기
- H3는 텍스트, 이미지, 비디오, 오디오를 통합합니다.
- 먼저 생성 모드를 선택합니다.
- 각 미디어에 하나의 역할을 줍니다.
- 시작, 변화, 카메라, 사운드, 결말을 씁니다.
- Vogue AI 생성은 API 연결 후 제공됩니다.
MiniMax H3가 비디오 프롬프트를 바꾸는 점
프롬프트는 한 장면의 외형 설명이 아니라 여러 미디어를 같은 맥락에서 지휘하는 레이어가 됩니다.

H3 생성 모드부터 선택하기
공식 API는 text-to-video, first/last frame, reference generation을 제공하며 조합 규칙이 정해져 있습니다.
| 모드 | 입력 | 적합한 작업 | 첫 위험 |
|---|---|---|---|
| 텍스트로 비디오 | 프롬프트 | 콘셉트, 소셜 광고, 분위기, 움직임 연구 | 주제가 불명확하면 장면이 쉽게 흔들립니다. |
| 첫 / 마지막 프레임 | 프롬프트 + 이미지 1~2장 | 정지 이미지 애니메이션 또는 마지막 구도 제어 | 변화 규칙이 모호하면 입력 프레임과 충돌합니다. |
| Omni Reference | 프롬프트 + 이미지, 비디오, 오디오 | 인물, 제품, 움직임, 카메라, 음성, 리듬 제어 | 역할이 없는 파일은 서로 충돌하는 지시를 만듭니다. |
| 비디오 편집 | 프롬프트 + 레퍼런스 비디오 | 움직임 전이 또는 부분 재생성 | 동시에 너무 많이 바꾸면 연속성이 약해집니다. |
제작 작업별 시나리오 매트릭스
| 제작 작업 | 프롬프트 구조 | 레퍼런스 계획 | 첫 확인 항목 |
|---|---|---|---|
| 제품 광고 | 시작 → 공개 → 증명 디테일 → 최종 컷 | 제품 이미지 + 필요 시 움직임이나 음악 | 형태, 라벨 영역, 손, 실루엣 |
| 단편 영화 | 인물 잠금 → 시간별 컷 → 연기 → 소리 | 인물 + 장소 + 필요 시 음성이나 카메라 | 인물, 시선, 대사 타이밍, 연속성 |
| 뮤직비디오 | 시각 설정 → 비트 변화 → 연기자 잠금 → 결말 | 음원 + 인물 이미지 또는 비디오 | 음화 관계, 리듬, 입 모양, 의상 |
| UGC 광고 | 행동 → 한 가지 장점 → 사용 → 끝 화면 | 정확도가 중요하면 제품과 제작자 | 피부, 제품 접촉, 손가락, 가짜 글자 |
복사 가능한 MiniMax H3 awesome prompts
X의 공개 H3 사례에서 구조를 추출해 일반 제작용으로 새롭게 쓴 템플릿입니다.

- 패션 캠페인: 12초, 16:9의 사실적인 럭셔리 패션 영상을 만든다. 무지갯빛 드레스를 입은 모델이 해 질 무렵 미니멀한 사막 런웨이를 걷는다. 항공 와이드, 측면 트래킹, 절제된 오빗, 원단 클로즈업, 최종 히어로 컷 순서로 진행한다. 얼굴, 의상 구조, 원단 무게를 유지하고 깜박임, 신체 왜곡, 여분의 팔다리, 의상 변화, 글자를 금지한다.
- 세로형 UGC: 밝은 욕실에서 촬영한 9:16 스킨케어 영상을 만든다. 제작자가 세럼을 보여 주고 한 가지 장점을 말한 뒤 볼에 바르고 자연스럽게 반응한다. 피부 질감, 시선, 손동작, 아침빛, 병 모양을 유지한다. 뷰티 필터 피부, 여분의 손가락, 떠 있는 제품, 자동 자막, 워터마크를 금지한다.
- 이미지 기반 코미디: 입력 이미지를 정확한 첫 프레임으로 사용한다. 실물 로봇 수트와 35mm 질감으로 15초짜리 1980년대 가족 코미디를 만든다. 모두 위를 본 뒤 축하하고 로봇 하나가 어설프게 춤춘다. 인물, 의상, 글자, 구도를 유지한다. CGI 광택, 새 인물, 현대 의상은 금지한다.
H3 프롬프트 구조
모드, 미디어 역할, 타임라인, 카메라, 사운드, 일관성 잠금, 네거티브 제약을 순서대로 정리합니다.
- 모드: 텍스트로 비디오, 첫/마지막 프레임, Omni Reference.
- 미디어 역할: 각 이미지, 비디오, 오디오가 무엇을 제어하는지.
- 타임라인: 시작 상태에서 마지막 상태까지 무엇이 바뀌는지.
- 카메라: 프레이밍, 움직임, 컷 논리, 안정성.
- 사운드: 대사, 환경음, 효과음, 음악, 침묵.
- 잠금: 인물, 제품 형태, 의상, 공간 방향, 글자.
- 네거티브 제약: 결과를 사용할 수 없게 만드는 실패만 적기.
예시: 12초 제품 영상 만들기
제품 형상을 먼저 보호한 뒤 인물 동작, 카메라, 사운드를 추가합니다.
원본 제작 요청
은색 오버이어 헤드폰을 위한 12초 제품 영상을 만든다. 제품 형태는 정확해야 하고 한 번의 사람 상호작용이 필요하며, 마지막 프레임에는 브랜드 문구를 위한 여백을 남긴다.
프롬프트 버전 1
- 레퍼런스 이미지 1을 헤드폰 디자인과 소재의 정확한 기준으로 사용한다. 짙은 흑연색 스튜디오에서 12초 프리미엄 제품 영상을 제작한다. 0~3초: 금속 이어컵을 고정 매크로로 촬영하며 부드러운 빛이 지나간다. 3~7초: 손이 헤드폰을 들고, 힌지 형태와 쿠션 두께를 유지한다. 7~10초: 모델이 헤드폰을 쓰는 옆모습, 손 접촉과 머리카락 움직임은 자연스럽게. 10~12초: 받침대 위 3/4 히어로 컷, 왼쪽은 비워 둔다. 사운드는 가벼운 금속 접촉, 쿠션 압축, 낮은 실내음, 절제된 베이스 한 음. 제품 변형, 여분의 손가락, 가짜 글자, 소재 변화, 카메라 흔들림은 금지한다.
첫 결과 이후 수정 순서
전체를 다시 쓰지 말고 형상, 정체성, 움직임, 편집 리듬, 사운드 순으로 첫 실패를 고칩니다.
- 제품이 바뀌면 레퍼런스 역할을 강화하고 불필요한 스타일 표현을 뺀다.
- 동작이 약하면 형용사를 더하지 말고 하나의 원인과 결과를 쓴다.
- 편집이 혼란스러우면 컷 수를 줄이고 핵심 동작에 시간을 더 준다.
- 오디오가 평범하면 각 중요한 소리를 같은 컷의 보이는 동작에 연결한다.
MiniMax H3 실수와 수정법
| 문제 | 먼저 수정 | 피하기 |
|---|---|---|
| 레퍼런스 충돌 | 각 미디어에 하나의 명확한 역할을 준다. | 모든 파일을 주 레퍼런스라고 부르기. |
| 인물 또는 제품 드리프트 | 잠금 조건을 첫 문장으로 옮긴다. | 영화적 형용사를 더하기. |
| 컷이 너무 많음 | 비트를 줄이고 시간을 명확히 한다. | 매초에 광고 전체를 넣기. |
| 사운드가 화면을 돕지 않음 | 보이는 동작과 소리를 연결하고 침묵을 활용한다. | 관련 없는 음악, 음성, 효과를 나열하기. |
| 생성 글자가 읽히지 않음 | 여백을 남기고 후반에 글자를 넣는다. | 여러 로고를 완벽히 생성하도록 요구하기. |
| 움직임이 무작위 | 시작, 변화, 원인, 마지막 상태를 쓴다. | 시각 스타일만 설명하기. |
Vogue AI에서의 H3 흐름
Vogue AI는 인물, 제품, style frame, 시작 이미지를 준비할 수 있습니다. H3 생성은 API와 QA 완료 후 추가됩니다.
생성 전 체크리스트
- 모드와 미디어가 맞는다.
- 각 미디어 역할이 하나다.
- 변화와 결말이 분명하다.
- 카메라와 소리가 핵심 동작을 돕는다.
- 인물과 제품이 잠겨 있다.
- 네거티브 목록이 짧다.
FAQ
MiniMax H3란?
생성, 레퍼런스 기반 제작, 편집을 위한 범용 멀티모달 비디오 모델입니다.
무엇을 입력할 수 있나요?
공식 제한 안에서 텍스트, 이미지, 비디오, 오디오를 사용할 수 있습니다.
사운드도 생성하나요?
네. MiniMax는 네이티브 스테레오 출력을 안내합니다.
최대 길이는?
공식 문서 기준 최대 15초입니다.
정확한 timecode가 필요한가요?
대사, 음향, 전환 타이밍이 중요할 때 유용합니다.
Vogue AI에서 지금 생성할 수 있나요?
아직 아닙니다. 페이지와 prompts는 준비됐지만 API가 연결되지 않았습니다.
weights가 공개됐나요?
공개 계획은 발표됐지만 실제 weights와 license를 확인해야 합니다.