MiniMax H3 공식 출시: 2K 출력 및 네이티브 스테레오 사운드를 지원하는 범용 멀티모달 비디오 모델
MiniMax가 범용 멀티모달 비디오 생성 모델인 MiniMax H3를 공식 출시했습니다. 이 모델은 통합된 생성 프레임워크에서 텍스트, 이미지, 비디오, 오디오를 이해할 수 있습니다.

MiniMax H3 출시: 2K 출력과 네이티브 스테레오 오디오를 지원하는 범용 멀티모달 비디오 모델
서론
MiniMax가 MiniMax H3를 공식 출시했습니다. 이 제품은 텍스트, 이미지, 비디오, 오디오를 동일한 생성 워크플로우 내에서 이해할 수 있는 범용 멀티모달 비디오 생성 모델입니다.
이번 출시는 텍스트-비디오, 이미지-비디오, 참조 비디오 생성, 오디오 동기화 및 편집을 더 이상 독립적인 작업으로 간주하지 않음을 의미합니다. 대신 H3는 여러 유형의 컨텍스트를 동시에 수신하고 자연어 지침을 사용하여 이러한 참조 콘텐츠 간의 상호 작용 방식을 설명할 수 있도록 설계되었습니다.
MiniMax에 따르면 H3는 네이티브 스테레오 오디오 비디오 출력을 지원하며, 최대 15초 길이의 클립을 생성하고 현재 API를 통해 2K 해상도 출력을 제공합니다.
이 회사는 해당 모델을 광고, 브랜딩, 이커머스, 제품 디자인, UI/UX 및 게임을 포함한 상업적 콘텐츠 제작 영역에 포지셔닝했습니다.

이번 출시에서는 생성 비용도 크게 강조되었습니다. MiniMax는 H3가 멀티모달 참조 및 고해상도 출력 기능을 유지하면서도 초당 생성 비용이 많은 주류 비디오 생성 시스템보다 낮다고 밝혔습니다.
H3: 전용 비디오 작업에서 통합 멀티모달 생성으로
초기 비디오 모델은 종종 독립적인 워크플로우를 중심으로 구성되었습니다.
제작자는 텍스트-비디오에 한 가지 모델이나 인터페이스를, 이미지 애니메이션에 다른 것을 선택하고, 참조 비디오 편집이나 오디오 동기화에는 또 다른 프로세스를 사용해야 했습니다.
H3는 이러한 사용 사례를 공유 멀티모달 컨텍스트로 통합하려고 시도합니다.
MiniMax의 현재 API 문서는 세 가지 주요 생성 모드를 설명합니다:
| 생성 모드 | 입력 | 일반적인 용도 |
|---|---|---|
| 텍스트-비디오 | 텍스트 프롬프트 | 텍스트 설명에 따라 새로운 비디오 생성 |
| 첫/마지막 프레임 이미지-비디오 | 프롬프트 + 첫 프레임 및/또는 마지막 프레임 | 이미지에 움직임을 부여하거나 비디오 클립의 시작과 끝을 제어 |
| 참조 생성 | 프롬프트 + 이미지, 비디오 및/또는 오디오 | 주체, 동작, 카메라 스타일, 사운드 또는 편집 리듬 유지 |
따라서 이 모델은 단순히 문장을 비디오로 변환하는 데 국한되지 않습니다.
참조 미디어를 생성 컨텍스트의 일부로 활용할 수도 있습니다.
참조 생성의 경우 MiniMax API는 다음 조합을 지원합니다:
- 최대 9개의 참조 이미지
- 최대 3개의 참조 비디오
- 최대 3개의 참조 오디오
- 총 최대 12개의 미디어 파일
참조 비디오의 총 길이는 15초까지 가능하며, 오디오에는 최소한 하나의 이미지 또는 비디오 참조가 함께 제공되어야 합니다.
이러한 구조를 통해 제작자는 각 모달리티를 개별 단계로 수동 처리할 필요 없이 다양한 입력 간의 관계를 설명할 수 있습니다.
자연어, 모달리티를 연결하는 다리로
AIBase 정보 소식통은 H3의 핵심 개념 중 하나를 컨텍스트 전모달 표현(Contextual Omni Representation) 으로 설명합니다.
그 개념은 자연어를 다양한 유형의 미디어를 연결하는 매개체로 사용하는 것입니다.
사용자는 여러 참조 자료를 동시에 제공하고 일상적인 언어로 참조 자료 간의 예상 관계를 설명할 수 있습니다.
예를 들어, 워크플로우는 개념적으로 H3에 다음을 요구할 수 있습니다:
- 특정 참조 비디오의 카메라 움직임 방식을 그대로 사용
- 특정 참조 이미지에 등장하는 인물 유지
- 특정 오디오 참조의 리듬이나 사운드 따르기
- 이러한 모든 제약 조건을 새로 생성된 장면에 동시에 적용
이는 단순한 텍스트-비디오 프롬프트와는 본질적으로 다릅니다.
모델은 각 미디어 입력에 포함된 내용을 이해해야 할 뿐만 아니라, 각 입력이 최종 생성에서 어떤 역할을 해야 하는지도 이해해야 합니다.
MiniMax의 공개 API는 다음과 같은 역할 기반 멀티모달 입력을 통해 이러한 설계를 반영합니다:
first_frame(첫 프레임)last_frame(마지막 프레임)reference_image(참조 이미지)reference_video(참조 비디오)reference_audio(참조 오디오)
사용자는 여전히 텍스트 프롬프트를 제공해야 하지만, 이때 프롬프트는 여러 미디어 소스 위에 있는 명령 계층 역할을 할 수 있습니다.
H3, 네이티브 스테레오 오디오 및 최대 15초 2K 출력 지원
MiniMax는 H3가 후속 단계에서 별도의 오디오 생성 프로세스를 사용할 필요 없이 네이티브 스테레오 오디오가 포함된 비디오를 직접 생성할 수 있다고 밝혔습니다.
현재 개발자 문서에 나열된 정보는 다음과 같습니다:
- 모델 이름:
MiniMax-H3 - 출력 해상도: 2K
- 출력 길이: 최대 15초
- 일반적인 화면비: 지원
- 적응형 화면비: 적절한 참조 워크플로우에 적용 가능
API 참조는 현재 4초에서 15초 사이의 정수 길이를 허용하며, 고급 개발자 가이드에서는 일반적인 출력 범위를 5초에서 15초로 설명합니다.
API 기반 개발 시 이 문서상의 미세한 차이는 주목할 만합니다: 개발자는 자신의 계정과 SDK에 해당하는 현재 엔드포인트 패턴을 따라야 합니다.
순수 텍스트 생성의 경우 화면비를 명시적으로 지정해야 합니다.
현재 API 참조에서 지원되는 화면비는 다음과 같습니다:
- 21:9
- 16:9
- 4:3
- 1:1
- 3:4
- 9:16
참조 워크플로우는 적응형 크기도 사용할 수 있습니다.
초기 테스트, 상업적 콘텐츠 제작에 초점
MiniMax는 초기 테스트에서 여러 실제 응용 분야에서 뛰어난 성능을 보여주었다고 밝혔습니다.
해당 분야는 다음과 같습니다:
- 지침 준수
- 브랜드 및 텍스트 표현
- 비디오-투-비디오 모션 전달
- 멀티모달 생성
- 제어된 편집
- 상업적 크리에이티브 제작
이 회사는 특히 다음 응용 시나리오를 강조했습니다:
- 광고
- 브랜드 구축
- 이커머스
- 제품 디자인
- UI/UX(사용자 인터페이스/사용자 경험)
- 게임
이러한 성능 설명은 MiniMax 자체 및 관련 출시 보도에서 비롯된 것이며, 독립적인 공개 벤치마크 테스트에서 나온 것이 아닙니다.
이 구분은 중요합니다.
비디오 생성 품질은 단일 점수로 간단히 요약하기 어렵습니다. 어떤 모델은 모션 전달에서 뛰어날 수 있지만, 정밀한 얼굴 디테일, 타이포그래피, 장기적인 신원 일관성 또는 복잡한 다중 객체 상호 작용에서는 상대적으로 약할 수 있습니다.
따라서 H3가 프로덕션에 적합한지 평가하는 가장 확실한 방법은 팀이 실제로 제작해야 하는 콘텐츠로 테스트하는 것입니다.
H3, 새로운 멀티모달 기술 아키텍처 채택
AIBase의 보도와 MiniMax의 출시 자료는 H3의 기반이 되는 여러 기술을 설명합니다:
- 컨텍스트 전모달 표현(Contextual Omni Representation)
- H3-VAE
- H3-Omni Transformer(전모달 트랜스포머)
- 컨텍스트 내 재생성(In-Context Regeneration)
공개 API 문서는 현재 H3를 사용하는 방법에 더 중점을 두고 있으며, 전체 기술 세부 사항을 공개하지는 않습니다.
이러한 구성 요소에 대한 관련 연구 논문은 아직 공개되지 않았으므로, 자세한 아키텍처 설명은 추가적인 재현 가능한 세부 사항을 제공하는 기술 보고서가 나오기 전까지는 MiniMax의 제품 설명으로 간주해야 합니다.
컨텍스트 전모달 표현
이 구성 요소는 텍스트, 이미지, 비디오 및 오디오를 공유 컨텍스트에서 공동으로 표현하도록 설계되었습니다.
그 역할은 H3가 여러 참조 소스와 자연어 지침 간의 연관성을 이해하도록 돕는 것입니다.
H3-VAE
H3-VAE는 모델의 비디오 표현 및 생성 스택의 일부로 설명됩니다.
비디오 VAE는 일반적으로 고차원 비디오 정보를 생성 및 디코딩에 더 관리하기 쉬운 잠재 표현으로 압축합니다.
본 문서 작성 시점에 검토된 문서에서 MiniMax는 H3-VAE의 정확한 설계를 독립적으로 설명할 수 있을 만큼 충분한 공개 기술 세부 사항을 공개하지 않았습니다.
H3-Omni Transformer
H3-Omni Transformer는 통합 멀티모달 생성을 담당하는 모델 구성 요소로 포지셔닝됩니다.
그 명칭은 모델의 더 넓은 목표를 반영합니다: 별도의 전문가 모델 간 전환 대신 하나의 시스템이 여러 미디어 유형의 추론을 처리할 수 있어야 한다는 것입니다.
컨텍스트 내 재생성
MiniMax는 또한 컨텍스트 내 재생성을 H3 기술 스택의 일부로 나열합니다.
그 예상 역할은 멀티모달 컨텍스트에 이미 존재하는 정보를 활용하여 생성 품질을 개선하는 것입니다.
다른 아키텍처 이름과 마찬가지로, 자세한 훈련 절차와 제거 실험 결과는 출시 당시 공개 API 문서에 제공되지 않았습니다.
H3 가격은 영상 길이 기준
AIBase 기사는 H3의 가성비를 강조했습니다.
MiniMax의 현재 공식 종량제 가격은 더 명확한 수치 기준을 제공합니다.
| 해상도 | 공식 API 표시 가격 |
|---|---|
| 2K | 초당 생성 $0.13 |
| 768P | 초당 생성 $0.09 |
입력 참조 자료에는 별도의 과금 규칙이 적용됩니다.
MiniMax는 현재 다음과 같이 명시하고 있습니다:
- 오디오 참조: 무료
- 처음 5장의 이미지 참조: 무료
- 추가 이미지 참조: 장당 $0.04
- 비디오 참조: 입력 비디오 길이와 목표 출력 해상도에 따라 과금
MiniMax는 초당 기준으로 H3가 2K 해상도에서 주류 경쟁 모델 비용의 3분의 1 미만, 768P 해상도에서 주류 720P 대안 가격의 절반 미만이라고 밝혔습니다.
이러한 상대적 비교는 공급업체의 주장입니다. 결과는 포함된 경쟁 모델, 요금제, 해상도 및 과금 방식에 크게 좌우되기 때문입니다.
예산을 계획할 때 개발자는 먼저 공개된 H3 API 요금을 기준으로 삼고, 실제로 사용 중인 대안과 정확히 비교해야 합니다.
AI 비디오에서 초당 비용이 중요한 이유
비디오 생성 비용은 출력 길이에 따라 선형적으로 증가하므로 비용이 빠르게 높아질 수 있습니다.
이는 반복적인 시행착오의 경제성을 변화시킵니다.
크리에이터가 한 번에 완벽한 영상을 생성하는 경우는 드뭅니다.
전체 제작 프로세스에는 다음이 포함될 수 있습니다:
- 여러 번의 프롬프트 실험
- 여러 번의 캐릭터 일관성 시도
- 카메라 움직임 변화
- 다양한 화면 비율
- 브랜드 또는 제품 수정
- 최종 고해상도 생성
초당 생성 비용이 약간만 줄어들어도, 팀이 수십 또는 수백 개의 대체 버전을 만들 때 누적 절감 효과는 상당합니다.
이것은 다음 시나리오에서 특히 중요합니다—
광고 및 전자상거래 분야에서 하나의 마케팅 캠페인에는 다음이 필요할 수 있습니다:
- 여러 제품
- 여러 시장
- 다른 언어
- 가로 및 세로 형식
- 여러 크리에이티브 변형
따라서 H3의 가격 포지셔닝은 단일 최종 비디오의 비용뿐만 아니라 반복의 경제성에 초점을 맞추고 있습니다.
참조 생성은 H3의 가장 중요한 기능 중 하나
현재 MiniMax API는 이미지, 비디오, 오디오가 혼합된 참조 생성을 지원합니다.
이를 통해 다음과 같은 워크플로우가 가능합니다:
- 이미지에서 제품 또는 캐릭터 일관성 유지
- 참조 비디오의 움직임 따르기
- 다른 비디오 클립의 카메라 동작 차용
- 참조 오디오 트랙을 사용한 시간 제어 또는 더빙
- 단일 요청에서 여러 형식의 참조 자료 결합
MiniMax는 H3가 생성 출력 전반에 걸쳐 참조 대상 또는 자료의 특징을 보존할 수 있다고 밝혔습니다.
이것은 상업 작업에 특히 중요합니다.
일반적인 텍스트 프롬프트는 시각적으로 매력적인 비디오 클립을 생성할 수 있지만 다음을 변경할 수 있습니다:
- 로고
- 제품 비율
- 의상
- 캐릭터 정체성
- 포장
- 브랜드 색상
참조 기반 워크플로우는 이러한 변수에 대해 더 많은 제어를 제공합니다.
그러나 완벽한 정체성 보존을 보장하지는 않으므로 팀은 각 생성 자료를 배포 전에 검토해야 합니다.
첫 프레임 및 마지막 프레임 제어로 또 다른 제작 워크플로우 추가
H3는 첫 프레임, 마지막 프레임 또는 둘 다를 사용한 생성을 지원합니다.
크리에이터가 샷이 어떻게 시작하거나 끝나야 하는지 이미 알고 있을 때 유용합니다.
일반적인 용도는 다음과 같습니다:
- 제품 정지 이미지에 움직임 부여
- 두 이미지 사이의 전환 만들기
- 한 샷의 시작을 다른 샷의 끝과 일치시키기
- 변환의 최종 상태 제어
- 더 예측 가능한 편집 시퀀스 구축
MiniMax API는 첫 프레임/마지막 프레임 생성과 참조 생성을 두 가지 별개의 모드로 취급합니다.
하나의 요청에서 동일한 작업에 first_frame 또는 last_frame 역할과 reference_image, reference_video 또는 reference_audio 역할을 혼합할 수 없습니다.
이 제한은 API를 통합하는 개발자에게 매우 중요합니다.
MiniMax, H3 모델 가중치 공개 계획
이 발표에서 가장 주목할 만한 부분 중 하나는 MiniMax가 H3 모델 가중치를 공개할 계획이라는 점입니다.
회사는 가중치가 적용 가능한 법규를 준수하여 향후 며칠 내에 공개될 예정이라고 밝혔습니다.
MiniMax는 가중치 공개가 다음에 도움이 된다고 생각합니다:
- 오픈 모델 생태계 확장
- 맞춤형 버전 지원
- 다양한 하드웨어에 대한 적응 가속화
- 단일 호스팅 서비스에 대한 의존도 감소
- 연구 및 배포 실험 장려
또한 회사는 H3가 설계 초기부터 하드웨어 호환성을 고려했으며, 더 넓은 범위의 AI 하드웨어 호환성을 포함한다고 밝혔습니다.
이 글을 작성하는 시점에서 MiniMax의 공식 GitHub 및 Hugging Face 조직 페이지는 공개적으로 접근 가능하지만, 여기서 검토한 공식 H3 API 문서에는 확인된 공개 H3 가중치 저장소가 링크되어 있지 않습니다.
따라서 개발자는 승인되지 않은 미러에서 가중치를 다운로드하지 말고 MiniMax의 공식 공개 링크를 기다려야 합니다.
"최초 오픈 가중치 중국어 비디오 모델" 주장에 대한 정정
AIBase
이 기사는 H3의 공개 계획이 중국 비디오 생성 기반 모델이 처음으로 커뮤니티에 가중치를 공개하는 것이라고 밝혔습니다.
넓은 의미에서 이 주장은 역사적으로 정확하지 않습니다.
알리바바는 2025년 2월 Wan2.1 비디오 생성 모델의 가중치와 추론 코드를 공개했으며, 이후 Wan2.1 변형 모델도 공개적으로 배포되었습니다.
H3의 더 타당한 차별점은 범용 통합 멀티모달 비디오 아키텍처입니다. 텍스트, 이미지, 비디오 및 오디오 참조와 네이티브 오디오-비디오 출력을 포함하며, 최초로 가중치를 공개한 중국 비디오 모델이라는 점이 아닙니다.
오픈 가중치는 하드웨어 적응에 도움
인프라를 더 많이 제어하려는 조직이 있는 시장에서는 오픈 모델 가중치가 필수적입니다.
호스팅 API는 시작하기 쉽지만, 오픈 가중치를 통해 다음이 가능합니다:
- 프라이빗 인프라에 배포
- 로컬 하드웨어에 맞춘 커널 최적화
- 모델 양자화
- 전용 추론 런타임 구축
- 라이선스가 허용하는 범위 내에서 미세 조정 또는 구성 요소 적응
- 국산 가속기와 통합
- 민감한 데이터를 통제된 환경에 유지
H3가 실제로 자체 호스팅될 수 있는지 여부는 원본 기사에 아직 공개되지 않은 정보에 따라 달라집니다:
- 파라미터 수
- VRAM 요구 사항
- 추론 정밀도
- 병렬화 요구 사항
- 최소 하드웨어 구성
- 라이선스 조건
- 훈련 또는 미세 조정 지원
공식 가중치와 기술 문서가 공개되기 전까지, 소비자용 GPU 호환성 또는 자체 호스팅 비용에 대한 주장은 추측에 불과합니다.
MiniMax, H3에 여전히 개선 여지가 있음을 인정
MiniMax는 또한 이 모델이 H 시리즈의 최종 종착점이 아니라고 밝혔습니다.
회사는 다음 방향을 지적했습니다:
- 정밀한 이미지 디테일
- 전체 모델 규모
- 추가 기능 확장
MiniMax는 H 시리즈 모델을 계속 확장하고 궁극적으로 H와 M 모델 패밀리의 기능을 통합할 계획이라고 밝혔습니다.
H 패밀리는 현재 멀티모달 생성, 특히 비디오에 중점을 둡니다.
M 패밀리는 MiniMax의 언어 및 에이전트 모델을 포함합니다.
미래의 융합은 하나의 모델 패밀리가 다음을 모두 처리할 수 있는 시스템을 가리킬 수 있습니다:
- 언어 추론
- 에이전트 실행
- 이미지 이해
- 비디오 이해
- 오디오
- 비디오 제작
- 편집
이것은 여전히 미래 지향적인 방향이며, 현재 출시된 통합 제품이 아닙니다.
H3가 비디오 생성 워크플로우에 가져온 변화
H3의 가장 중요한 기여는 단순히 더 높은 해상도가 아닙니다.
더 큰 변화는 이전에는 서로 분리되어 있던 여러 창작 작업이 이제 하나의 컨텍스트에서 완료될 수 있다는 점입니다.
크리에이터는 다음에서:
이 문장에 따라 비디오를 생성하세요.
다음으로 나아갈 수 있습니다:
이 사람을 사용하고, 이 비디오의 동작을 따르며, 이 시각적 정체성을 유지하고,
이 오디오에서 리듬 신호를 가져와 이 프롬프트에 따라 새 장면을 만드세요.
이것은 비디오 모델의 역할을 변화시킵니다.
더 이상 단일 용도 생성기가 아니라 멀티모달 창의적 엔진에 가깝습니다.
비즈니스 팀에게 그 가치는 H3가 참조 일관성을 얼마나 잘 유지하고, 복잡한 지침을 따르며, 브랜드 메시지를 렌더링하고, 경제적 효율성을 유지하는지에 따라 달라질 것입니다.
수 세대를 거쳐 전승되었습니다.
자주 묻는 질문
MiniMax H3란 무엇인가요?
MiniMax H3는 MiniMax가 출시한 범용 멀티모달 비디오 생성 모델입니다. 텍스트, 이미지, 비디오 및 오디오를 컨텍스트로 받아들이며, 텍스트-비디오, 이미지-비디오, 참조 자료 기반 생성 및 제어된 비디오 제작을 지원합니다.
MiniMax H3는 어떤 해상도를 지원하나요?
MiniMax의 현재 API 문서는 2K를 H3의 주요 출력 해상도로 명시하고 있습니다. 가격 페이지에는 768P 과금 등급도 나열되어 있습니다.
MiniMax H3 비디오는 최대 얼마나 길 수 있나요?
공식 H3 문서는 최대 15초의 비디오 출력을 지원합니다. API 참조는 현재 4초에서 15초 사이의 정수 길이 값을 허용합니다.
MiniMax H3가 오디오를 생성할 수 있나요?
네. MiniMax는 H3가 네이티브 스테레오 오디오 및 비디오 출력을 지원한다고 설명하므로, 오디오는 별도의 후반 제작 모델에 항상 의존할 필요 없이 비디오 워크플로우의 일부로 생성될 수 있습니다.
MiniMax H3 API 비용은 얼마인가요?
MiniMax는 현재 H3를 2K 해상도 기준 초당 $0.13, 768P 해상도 기준 초당 $0.09로 책정하고 있습니다. 공개된 과금 규칙에 따르면 참조 비디오 및 추가 이미지는 입력素材 비용을 증가시킬 수 있습니다.
H3는 참조 이미지, 비디오, 오디오를 동시에 사용할 수 있나요?
네. 공식 API는 동일한 참조 생성 워크플로우에서 참조 이미지, 비디오, 오디오를 지원하지만, 파일 수, 길이, 크기 및 입력 조합 제한이 적용됩니다.
MiniMax H3는 오픈소스인가요?
MiniMax는 향후 며칠 내에 H3 모델 가중치를 공개할 계획이라고 발표했으며, 적용 가능한 규정을 준수해야 합니다. 이 글을 작성하는 시점에 공식 API는 이미 출시되었지만, 이번에 확인한 공식 문서에서는 공개 H3 가중치 저장소에 대한 링크가 확인되지 않았습니다.
H3가 중국 최초의 오픈소스 가중치 비디오 모델인가요?
아니요, 넓은 역사적 의미에서 그렇지 않습니다. 알리바바는 2025년에 Wan2.1 비디오 생성 모델 가중치를 공개했습니다. H3가 더 주목할 만한 점은 범용 비디오 모델에서 멀티모달 참조와 네이티브 오디오-비디오 생성 기능을 결합했다는 것입니다.
관련 도구
- MiniMax H3 API: H3 텍스트-비디오, 이미지-비디오 및 참조 생성 워크플로우에 대한 공식 문서.
- MiniMax 개방형 플랫폼: API 키, 모델 액세스, 과금 및 개발자 리소스를 제공하는 MiniMax 개발자 플랫폼.
- MiniMax GitHub: 공개 코드 및 모델 관련 프로젝트를 위한 공식 GitHub 조직.
- MiniMax Hugging Face: 공개 모델 리소스를 위한 MiniMax 공식 Hugging Face 조직.
- Wan2.1: 오픈소스 가중치 비디오 모델의 역사적 배경으로 참조할 수 있는 알리바바의 오픈소스 비디오 생성 모델 시리즈.
관련 링크
- MiniMax 공식 웹사이트: 현재 H3를 새 비디오 생성 모델로 소개하는 MiniMax 공식 웹사이트.
- MiniMax H3 비디오 생성 가이드: 공식 모델 사양, 지원 모드, 입력 제한 및 워크플로우 문서.
- [MiniMax H3 API 참조](https://platform.minimax.
io/docs/api-reference/video-generation-v2-create): H3 비디오 생성 작업을 만들기 위한 공식 V2 엔드포인트 사양.
- MiniMax API 요금: H3 및 참조 미디어 과금 규칙에 대한 현재 공식 종량제 가격.
- MiniMax 공식 GitHub: 공개된 코드 및 모델 리소스를 확인하기 위한 공식 조직.
- 알리바바: Wan 2.1 오픈소스 비디오 모델: 중국 오픈소스 가중치 비디오 모델이 H3 이전에 이미 존재했다는 공식 역사적 확인.
- Wan 2.1 GitHub 저장소: 알리바바 초기 오픈소스 비디오 생성 제품군의 공개 추론 코드 및 가중치.
요약
MiniMax H3는 텍스트, 이미지, 비디오, 오디오를 하나의 범용 비디오 생성 워크플로우에 통합합니다. 최대 15초 2K 출력, 네이티브 스테레오 오디오, 첫 프레임/마지막 프레임 제어, 그리고 여러 미디어 유형을 사용한 참조 생성을 지원합니다.
상업적 판매 포인트는 두 가지에 집중되어 있습니다: 제어 능력과 비용. MiniMax에 따르면 H3는 명령 준수, 브랜드 표현, 동작 전이에서 우수한 성능을 보여주며, 공식 API는 현재 2K 생성 기준 초당 0.13달러, 768P 기준 초당 0.09달러로 책정되어 있습니다.
MiniMax는 또한 모델 가중치를 공개할 계획이지만, 게시 시점에 검토한 공식 문서에서는 확인된 H3 가중치 저장소에 대한 링크가 아직 연결되지 않았습니다.
H3의 가장 중요한 변화는 단순히 2K 비디오가 아니라, 텍스트, 이미지, 비디오, 오디오가 어떻게 함께 작동해야 하는지를 이해하는 통합 멀티모달 생성 시스템으로 나아가는 것입니다.