MiniMax Music 3.0 — 오픈웨이트 음악 생성 (5분 완곡)
개요
가사+음악 설명으로 최대 5분 완전한 곡 생성 (32kHz 스테레오). Hybrid-LM (8B Global LLM = Qwen3-8B 기반 + 0.6B Local) + Flow Matching 2.4B + Flow-VAE
메모
⭐ EU/한국 라이선스 제외 없음 — Community License, 연매출 $2,000만 미만 무료 상업 (UI 표시 의무). GB10 실구동 성공 (8/15): Comfy-Org safetensors 3종(텍스트 인코더 pruned int8 9.2GB + DiT int8 2.5GB + VAE 217MB ≈ 12GB) + ComfyUI master 업데이트(코어 노드) + comfy-kitchen 0.2.31 + systemd 서비스화. 실측: 30초 곡 90초 / 60초 곡 150초 (euler 50스텝 cfg 1.0, 44.1kHz 스테레오 320k). 워크플로우: `[로컬] (CLIPLoader type=minimax 필수!). ⚠️ GGUF는 로더 미지원으로 보류 (ChrisColeTech 3종 다운로드 완료·보관 — comfyui-gguf-loader 배포 대기). LoRA: pyros-projects/music3-tuner (QLoRA — 토크나이저 미공개라 distill 우회 필요, 첫 실음 LoRA 아직)
조사 상세
MiniMax Music 3.0 — 오픈웨이트 음악 생성 모델
개요
2026-08-14 HF 오픈웨이트 릴리즈. 가사(선택) + 음악 설명으로 최대 5분 완전한 곡(인트로~아웃트로)을 한 번에 생성. 32kHz 16-bit 스테레오 WAV (GGUF 커뮤니티 버전은 44.1kHz). EU/한국 라이선스 제외 없음 — 한국에서 사용 가능! ⭐
아키텍처 (Hybrid-LM)
- 8B Global LLM (Qwen3-8B 초기화 — 블로그는 Qwen3.5-8B 표기) — 코드북-0 세맨틱 토큰 프레임별 예측, 장기 구조·전개 담당
- 0.6B Local LLM (무작위 초기화) — 프레임 내 음향 코드북(1~7) 예측, 미세 음향 디테일
- Flow Matching (2.4B) + Flow-VAE (123M) — 연속 은닉 상태 융합 → 32kHz 스테레오 합성 (이산 토크나이저 디코더 불필요)
- 토크나이저: 8계층 RVQ — 세맨틱 코드북 16,384엔트리 + 음향 7개×1,024엔트리
- 모델 크기: 공식 릴리즈 ~57.4GB (decode-only, dav.pth = 연속 Flow-VAE)
핵심 기능
- 구조 태그:
[Intro] [Verse] [Pre-Chorus] [Chorus] [Bridge] [Instrumental] [Solo] [Outro]— 가사에 태그만 붙여도 섹션 전개 - Structured Caption 3단 구성 권장: Global Metadata(장르·BPM·키·감정 전개) / Vocal Details(음색·퍼포먼스·하모니) / Arrangement(악기·그루브·공간감)
- 제약: CUDA 필수, non-streaming만, 프롬프트 5,000 토큰, 오디오 9,000 프레임(≈6분) 한도
라이선스 (⭐ 한국 OK)
- Community License: 연매출 $2,000만 미만 = 무료 상업 사용 (UI에 "MiniMax-Music3" 표시 의무), 초과 시 [이메일] 서면 승인
- H3와 달리 지역 제외 없음 (music3-tuner README에서도 "no EU exclusion" 명시)
- 파생: Qwen3-8B(Apache 2.0) · DiT-2B(Stable Audio, MIT) · VAE(DAC, MIT)
✅ GB10 테스트 완료 (2026-08-15) — 실제 구동 성공!
상태: 🟢 테스트 완료 — safetensors 조합으로 정상 동작
다운로드 파일 (Comfy-Org/MiniMax-Music-3 repack — ComfyUI 공식 지원)
| 파일 | 크기 | 위치 |
|---|---|---|
minimax_music3_text_encoder_pruned_int8_convrot.safetensors | 9.2GB | `[로컬] |
minimax_music3_dit_int8_convrot.safetensors | 2.5GB | `[로컬] |
minimax_music3_dav.safetensors | 217MB | `[로컬] |
- ⚠️ 합계 ~12GB (텍스트 인코더가 DiT보다 큼 — "2.5GB면 충분"이라는 SNS 정보는 DiT 단독 크기)
- GGUF 대신 safetensors를 쓴 이유: 8/15 시점 ComfyUI-GGUF(city96)가
minimax_music3아키텍처 미지원 (CLIPLoaderGGUF에서 ValueError). GGUF용 "comfyui-gguf-loader"는 아직 미배포. GGUF 3종(텍스트 인코더 Q8 8.88GB + DiT Q8 2.70GB + VAE)은 로더 지원 시 전환용으로 보관 중
워크플로우 파일
- 파일명: `[로컬] (UI 워크플로우 — Workflow 브라우저에서 로드)
- 사용법: 노드 구성은 아래 8개 — 파일만 로드하면 끝
1. CLIPLoader — 텍스트 인코더 int8, type=minimax (⚠️ type 선택 필수!)
2. UNETLoader — DiT int8
3. VAELoader — DAV safetensors
4. MiniMaxMusic3TextEncode — caption(3단 구조) + lyrics(섹션 태그) + seed + max_duration
5. EmptyMiniMaxMusic3LatentAudio — seconds (TextEncode의 max_duration과 동일 값)
6. KSampler — euler / normal / 50 steps / cfg 1.0 (Flow Matching이라 cfg 1.0 고정)
7. VAEDecodeAudio — LATENT → AUDIO
8. SaveAudioAdvanced — mp3 320k
- 캡션 팁: 보컬을 명시적으로 서술("warm female vocal, close and breathy")하지 않으면 보컬이 표류함
SaveAudioAdvancedAPI 제출 시 quality는format.quality키로 전달 (API 프롬프트 기준)
테스트 결과 (GB10 실측)
| 곡 | 길이 | 생성 시간 | 설정 |
|---|---|---|---|
| Acoustic Pop (seed 7) | 30초 | 90초 ⚡ | 50 steps, euler, cfg 1.0 |
| Lo-fi Hip-Hop (seed 42) | 60초 | 150초 ⚡ | 50 steps, euler, cfg 1.0 |
- 출력: 44.1kHz 스테레오 MP3 320k (ComfyUI 출력은 44.1kHz — HF 원본은 32kHz)
- 보컬+가사+섹션 태그 정상 반영, 품질 우수
- 생성 시간은 선형 스케일 (30초→90초, 60초→150초 — 1초 곡당 ~2.5초)
ComfyUI 세팅 (2026-08-15 변경)
- ComfyUI master 업데이트 필수: Music3 코어 노드(
MiniMaxMusic3TextEncode,EmptyMiniMaxMusic3LatentAudio)는 최신 커밋efd4e951(Implement Minimax Music 3) 이후에만 존재 — 8/15 기준 21커밋 뒤처진 v0.32.0에서는 없음 - comfy-kitchen==0.2.31 필수: 구버전(0.2.30)에서
flash_attention_decode_is_availableAttributeError 발생 - ComfyUI systemd 서비스화:
comfyui.service유닛 (etc·systemd·system 경로) — Hermes 백그라운드 cgroup 메모리 제한(OOM 킬) 회피 + 재부팅 자동 시작. (2026-08-16:--use-sage-attention전역 플래그 제거 — 워크플로우 내 patch sage attention 노드로만 적용) - 모델 로드 메모리: 텍스트 인코더 ~8.7GB + DiT 2.5GB + VAE — Qwen(35B)과 동시 실행은 메모리 주의
GGUF (커뮤니티 — ChrisColeTech) — 로더 미지원으로 보류
- 레포:
ChrisColeTech/minimax-music3-GGUF(2026-08-15, 릴리즈 다음날 등장!) - 구성: text encoder pruned (F16·Q6_K·Q8_0, Q8=8.88GB) + DiT (F16·Q6_K·Q8_0, Q8=2.70GB) + Audio VAE (217MB) — 전부 로컬 다운로드 완료·보관 중
- 실측(레포 샘플): RTX 5090 32GB — 2:29 곡 Q8_0 기준 7.3분, peak 9.7GiB / 1:01 곡 5분
- ⚠️ 업데이트된 GGUF Loader 필요: ComfyUI Manager "remote" 채널의
comfyui-gguf-loader— 8/15 시점 아직 공개 전. 배포되면 텍스트 인코더는CLIPLoaderGGUF로, DiT는UnetLoaderGGUF로 로드 - 워크플로우:
workflow_examples/minimax_music3.json제공 (MiniMaxMusic3ModelsLoader 노드 필요)
LoRA (커뮤니티 — pyros-projects)
- 레포:
pyros-projects/music3-tuner— Hybrid-LM LoRA 트레이너 (8B global + 0.6B depth 디코더), NF4 QLoRA + peft - ⚠️ 공식은 audio→codes 토크나이저를 미공개 → 자체 생성 (음악,코드) 쌍으로 인코더를 distill하는 우회 필요
- 상태: DAV Flow-VAE 포트·AR 샘플러·합성·QLoRA 루프 완성, 첫 실음 LoRA는 인코더 AR-loss 개선 대기 중
- A40 실측: 30초 트랙 합성 ~10초, AR 샘플링 near-realtime
GB10 적용성
- 메모리 충분: safetensors 조합 ~12GB (텍스트 인코더 9.2GB + DiT 2.5GB + VAE 0.2GB) — GB10 128GB 통합 메모리 여유
- 실사용 확인 완료: 30~60초 곡 생성 정상, 생성 시간 1초 곡당 ~2.5초 (GB10 실측)
- 음악 STT/자작곡 파이프라인과 병행 가능: faster-whisper(음악 STT)는 vad_filter=False 필수 (기존 메모리 규칙)
- Qwen(ai-llama-server)과 동시 실행은 메모리 주의 (텍스트 인코더 8.7GB 로드)