Knowledge 목록으로

MiniMax Music 3.0 — 오픈웨이트 음악 생성 (5분 완곡)

적용 완료🎨 이미지 · 영상 · 음악2026년 8월 14일4
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록

개요

가사+음악 설명으로 최대 5분 완전한 곡 생성 (32kHz 스테레오). Hybrid-LM (8B Global LLM = Qwen3-8B 기반 + 0.6B Local) + Flow Matching 2.4B + Flow-VAE

메모

EU/한국 라이선스 제외 없음 — Community License, 연매출 $2,000만 미만 무료 상업 (UI 표시 의무). GB10 실구동 성공 (8/15): Comfy-Org safetensors 3종(텍스트 인코더 pruned int8 9.2GB + DiT int8 2.5GB + VAE 217MB ≈ 12GB) + ComfyUI master 업데이트(코어 노드) + comfy-kitchen 0.2.31 + systemd 서비스화. 실측: 30초 곡 90초 / 60초 곡 150초 (euler 50스텝 cfg 1.0, 44.1kHz 스테레오 320k). 워크플로우: `[로컬] (CLIPLoader type=minimax 필수!). ⚠️ GGUF는 로더 미지원으로 보류 (ChrisColeTech 3종 다운로드 완료·보관 — comfyui-gguf-loader 배포 대기). LoRA: pyros-projects/music3-tuner (QLoRA — 토크나이저 미공개라 distill 우회 필요, 첫 실음 LoRA 아직)

조사 상세

MiniMax Music 3.0 — 오픈웨이트 음악 생성 모델

개요

2026-08-14 HF 오픈웨이트 릴리즈. 가사(선택) + 음악 설명으로 최대 5분 완전한 곡(인트로~아웃트로)을 한 번에 생성. 32kHz 16-bit 스테레오 WAV (GGUF 커뮤니티 버전은 44.1kHz). EU/한국 라이선스 제외 없음 — 한국에서 사용 가능! ⭐

아키텍처 (Hybrid-LM)

  • 8B Global LLM (Qwen3-8B 초기화 — 블로그는 Qwen3.5-8B 표기) — 코드북-0 세맨틱 토큰 프레임별 예측, 장기 구조·전개 담당
  • 0.6B Local LLM (무작위 초기화) — 프레임 내 음향 코드북(1~7) 예측, 미세 음향 디테일
  • Flow Matching (2.4B) + Flow-VAE (123M) — 연속 은닉 상태 융합 → 32kHz 스테레오 합성 (이산 토크나이저 디코더 불필요)
  • 토크나이저: 8계층 RVQ — 세맨틱 코드북 16,384엔트리 + 음향 7개×1,024엔트리
  • 모델 크기: 공식 릴리즈 ~57.4GB (decode-only, dav.pth = 연속 Flow-VAE)

핵심 기능

  • 구조 태그: [Intro] [Verse] [Pre-Chorus] [Chorus] [Bridge] [Instrumental] [Solo] [Outro] — 가사에 태그만 붙여도 섹션 전개
  • Structured Caption 3단 구성 권장: Global Metadata(장르·BPM·키·감정 전개) / Vocal Details(음색·퍼포먼스·하모니) / Arrangement(악기·그루브·공간감)
  • 제약: CUDA 필수, non-streaming만, 프롬프트 5,000 토큰, 오디오 9,000 프레임(≈6분) 한도

라이선스 (⭐ 한국 OK)

  • Community License: 연매출 $2,000만 미만 = 무료 상업 사용 (UI에 "MiniMax-Music3" 표시 의무), 초과 시 [이메일] 서면 승인
  • H3와 달리 지역 제외 없음 (music3-tuner README에서도 "no EU exclusion" 명시)
  • 파생: Qwen3-8B(Apache 2.0) · DiT-2B(Stable Audio, MIT) · VAE(DAC, MIT)

✅ GB10 테스트 완료 (2026-08-15) — 실제 구동 성공!

상태: 🟢 테스트 완료 — safetensors 조합으로 정상 동작

다운로드 파일 (Comfy-Org/MiniMax-Music-3 repack — ComfyUI 공식 지원)

파일크기위치
minimax_music3_text_encoder_pruned_int8_convrot.safetensors9.2GB`[로컬]
minimax_music3_dit_int8_convrot.safetensors2.5GB`[로컬]
minimax_music3_dav.safetensors217MB`[로컬]
  • ⚠️ 합계 ~12GB (텍스트 인코더가 DiT보다 큼 — "2.5GB면 충분"이라는 SNS 정보는 DiT 단독 크기)
  • GGUF 대신 safetensors를 쓴 이유: 8/15 시점 ComfyUI-GGUF(city96)가 minimax_music3 아키텍처 미지원 (CLIPLoaderGGUF에서 ValueError). GGUF용 "comfyui-gguf-loader"는 아직 미배포. GGUF 3종(텍스트 인코더 Q8 8.88GB + DiT Q8 2.70GB + VAE)은 로더 지원 시 전환용으로 보관 중

워크플로우 파일

  • 파일명: `[로컬] (UI 워크플로우 — Workflow 브라우저에서 로드)
  • 사용법: 노드 구성은 아래 8개 — 파일만 로드하면 끝

1. CLIPLoader — 텍스트 인코더 int8, type=minimax (⚠️ type 선택 필수!)

2. UNETLoader — DiT int8

3. VAELoader — DAV safetensors

4. MiniMaxMusic3TextEncode — caption(3단 구조) + lyrics(섹션 태그) + seed + max_duration

5. EmptyMiniMaxMusic3LatentAudio — seconds (TextEncode의 max_duration과 동일 값)

6. KSamplereuler / normal / 50 steps / cfg 1.0 (Flow Matching이라 cfg 1.0 고정)

7. VAEDecodeAudio — LATENT → AUDIO

8. SaveAudioAdvanced — mp3 320k

  • 캡션 팁: 보컬을 명시적으로 서술("warm female vocal, close and breathy")하지 않으면 보컬이 표류함
  • SaveAudioAdvanced API 제출 시 quality는 format.quality 키로 전달 (API 프롬프트 기준)

테스트 결과 (GB10 실측)

길이생성 시간설정
Acoustic Pop (seed 7)30초90초50 steps, euler, cfg 1.0
Lo-fi Hip-Hop (seed 42)60초150초50 steps, euler, cfg 1.0
  • 출력: 44.1kHz 스테레오 MP3 320k (ComfyUI 출력은 44.1kHz — HF 원본은 32kHz)
  • 보컬+가사+섹션 태그 정상 반영, 품질 우수
  • 생성 시간은 선형 스케일 (30초→90초, 60초→150초 — 1초 곡당 ~2.5초)

ComfyUI 세팅 (2026-08-15 변경)

  • ComfyUI master 업데이트 필수: Music3 코어 노드(MiniMaxMusic3TextEncode, EmptyMiniMaxMusic3LatentAudio)는 최신 커밋 efd4e951(Implement Minimax Music 3) 이후에만 존재 — 8/15 기준 21커밋 뒤처진 v0.32.0에서는 없음
  • comfy-kitchen==0.2.31 필수: 구버전(0.2.30)에서 flash_attention_decode_is_available AttributeError 발생
  • ComfyUI systemd 서비스화: comfyui.service 유닛 (etc·systemd·system 경로) — Hermes 백그라운드 cgroup 메모리 제한(OOM 킬) 회피 + 재부팅 자동 시작. (2026-08-16: --use-sage-attention 전역 플래그 제거 — 워크플로우 내 patch sage attention 노드로만 적용)
  • 모델 로드 메모리: 텍스트 인코더 ~8.7GB + DiT 2.5GB + VAE — Qwen(35B)과 동시 실행은 메모리 주의

GGUF (커뮤니티 — ChrisColeTech) — 로더 미지원으로 보류

  • 레포: ChrisColeTech/minimax-music3-GGUF (2026-08-15, 릴리즈 다음날 등장!)
  • 구성: text encoder pruned (F16·Q6_K·Q8_0, Q8=8.88GB) + DiT (F16·Q6_K·Q8_0, Q8=2.70GB) + Audio VAE (217MB) — 전부 로컬 다운로드 완료·보관 중
  • 실측(레포 샘플): RTX 5090 32GB — 2:29 곡 Q8_0 기준 7.3분, peak 9.7GiB / 1:01 곡 5분
  • ⚠️ 업데이트된 GGUF Loader 필요: ComfyUI Manager "remote" 채널의 comfyui-gguf-loader — 8/15 시점 아직 공개 전. 배포되면 텍스트 인코더는 CLIPLoaderGGUF로, DiT는 UnetLoaderGGUF로 로드
  • 워크플로우: workflow_examples/minimax_music3.json 제공 (MiniMaxMusic3ModelsLoader 노드 필요)

LoRA (커뮤니티 — pyros-projects)

  • 레포: pyros-projects/music3-tunerHybrid-LM LoRA 트레이너 (8B global + 0.6B depth 디코더), NF4 QLoRA + peft
  • ⚠️ 공식은 audio→codes 토크나이저를 미공개 → 자체 생성 (음악,코드) 쌍으로 인코더를 distill하는 우회 필요
  • 상태: DAV Flow-VAE 포트·AR 샘플러·합성·QLoRA 루프 완성, 첫 실음 LoRA는 인코더 AR-loss 개선 대기 중
  • A40 실측: 30초 트랙 합성 ~10초, AR 샘플링 near-realtime

GB10 적용성

  • 메모리 충분: safetensors 조합 ~12GB (텍스트 인코더 9.2GB + DiT 2.5GB + VAE 0.2GB) — GB10 128GB 통합 메모리 여유
  • 실사용 확인 완료: 30~60초 곡 생성 정상, 생성 시간 1초 곡당 ~2.5초 (GB10 실측)
  • 음악 STT/자작곡 파이프라인과 병행 가능: faster-whisper(음악 STT)는 vad_filter=False 필수 (기존 메모리 규칙)
  • Qwen(ai-llama-server)과 동시 실행은 메모리 주의 (텍스트 인코더 8.7GB 로드)