Higgs TTS 3 4B
📦 보류🎙️ TTS 엔진2026년 7월 27일약 3분
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록
개요
감정/스타일 43태그, 한국어 ★★★★★, 8.7GB
메모
weights만 설치. SGLang-Omni Docker 필요로 정지 상태
조사 상세
DGX Spark 로컬 TTS 엔진 — 설치 현황
DGX Spark GB10 (130.6GB unified memory, CUDA 13.0)에 설치된 모든 TTS 엔진의 종합 현황.
한눈에 보기
| 엔진 | 경로 | 용량 | 한국어 | 설치 | 생성 테스트 |
|---|---|---|---|---|---|
| Qwen3-TTS 1.7B | `[로컬] | ~3.5GB | ★★★★ | ✅ | ✅ (운영중) |
| Supertone 3 | `[로컬] | 137MB | ★★★★ | ✅ | ❌ |
| OmniVoice 0.6B | `[로컬] | 5.2GB | ★★★★ | ✅ | ❌ |
| NVIDIA MagpieTTS 357M | `[로컬] | 2GB | ★★★ | ✅ | ❌ |
| Higgs TTS 3 4B | `[로컬] | 8.7GB | ★★★★★ | ✅ (weights only) | ❌ |
| MOSS-TTS 8B | `[로컬] | 16GB | ★★★★ | ✅ | ❌ |
| MOSS-TTS-Local 1.7B | `[로컬] | 5.8GB | ★★★★ | ✅ | ❌ |
| MOSS-TTS-Realtime 2B | `[로컬] | 4.4GB | ★★★★ | ✅ | ❌ |
| MOSS-TTSD v1.0 8B | `[로컬] | 16GB | ★★★★ | ✅ | ❌ |
| MOSS-TTS-GGUF Q4 | HF (gated) | ~5GB | ★★★★ | ❌ 승인필요 | ❌ |
| 총계 | — | ~59GB | — | 9/10 설치 | 1개 운영중 |
엔진별 상세
🟢 Qwen3-TTS 1.7B (현재 실운영 중)
- 모델:
Qwen/Qwen3-TTS-12Hz-1.7B-Base - 모드: CustomVoice (Sohee), VoiceDesign, Voice Clone
- 샘플레이트: 12Hz
- 사용처: StockPulse YouTube Shorts (
04_generate_tts.py), AI 오목 - 특징: atempo 1.3x 적용, 영어→한글 발음 변환표 사용
- 상세 페이지 참고
🟢 MOSS-TTS Family (설치 완료, 테스트 전)
MOSS-TTS는 MOSI.AI + OpenMOSS Team, Apache 2.0 라이선스, 20개 언어(한국어 포함).
MOSS-TTS 8B Delay (플래그십)
- 경로: `[로컬] (16GB, 8.49B params)
- 용도: 고품질 음성합성, zero-shot voice clone, 초장문 안정 생성
- 로드 검증: MossTTSDelayModel, sdpa attention, device_map='cuda' ✅
- 로딩 시간: ~1.5분
MOSS-TTS-Local 1.7B (경량형)
- 경로: `[로컬] (5.8GB)
- 용도: 빠른 실험/연구용
- 벤치마크: SIM 73.28%로 Qwen3-TTS 1.7B(71.45%) 상회
MOSS-TTS-Realtime 2B (실시간)
- 경로: `[로컬] (4.4GB, 단일 safetensors 4.66GB)
- 용도: 실시간 스트리밍, TTFB 180ms, 음성 에이전트용
- 파일 구조:
modeling_mossttsrealtime.py,streaming_mossttsrealtime.py등
MOSS-TTSD v1.0 8B (대화 생성)
- 경로: `[로컬] (16GB)
- 용도: 다중 화자 대화 생성, 감정 표현, 극장문 대화
- 아키텍처: MOSS-TTS Delay 기반 (MossTTSDelayModel과 동일 구조)
🔴 MOSS-TTS-GGUF (미설치)
- 레포:
OpenMOSS-Team/MOSS-TTS-GGUF(gated, 승인 필요) - 파일 목록: MOSS_TTS_F16.gguf, MOSS_TTS_Q4_K_M.gguf, MOSS_TTS_Q8_0.gguf, MOSS_TTS_Q5_K_M.gguf, MOSS_TTS_Q6_K.gguf, embeddings/
- 설치 방법: HF에서 승인 받은 후 `hf download OpenMOSS-Team/MOSS-TTS-GGUF --local-dir [로컬]
🟡 기타 설치된 엔진
- Supertone 3 (137MB): 한국 기업, ONNX 경량, pip 설치 완료
- OmniVoice 0.6B (5.2GB): 646언어 제로샷 클로닝
- NVIDIA MagpieTTS 357M (2GB): 12언어, 상업 라이선스
- Higgs TTS 3 4B (weights 8.7GB): 감정/스타일 43태그, SGLang-Omni Docker 필요
용도별 추천
| 목적 | 추천 엔진 | 이유 |
|---|---|---|
| 🎬 유튜브 나레이션 | Qwen3-TTS (운영중) | Sohee + instruct 톤 제어 |
| 📚 초장문/팟캐스트 | MOSS-TTS 8B | 음색 유지 1시간 안정 |
| 🗣️ 보이스 클로닝 | MOSS-TTS 8B / OmniVoice | 제로샷 클로닝 |
| ⚡ 실시간 대화형 | MOSS-TTS-Realtime 2B / Supertone 3 | TTFB 180ms |
| 🎭 감정 표현 대화 | MOSS-TTSD v1.0 8B | 다중 화자, 감정 |
| 🌐 다국어 콘텐츠 | MOSS-TTS 8B | 20개 언어 |
테스트 방법 (Quick Start)
conda activate moss-tts
python -c "
from transformers import AutoModel, AutoProcessor
import torch, soundfile as sf
# MOSS-TTS 8B
model = AutoModel.from_pretrained(
'[로컬],
trust_remote_code=True,
attn_implementation='sdpa',
torch_dtype=torch.bfloat16,
device_map='cuda',
)
processor = AutoProcessor.from_pretrained(
'[로컬],
trust_remote_code=True,
)
# 한국어 생성 (간단 테스트)
messages = [{'role': 'user', 'content': '안녕하세요, 오늘 시장 상황을 분석해드리겠습니다.'}]
wavs, sr = model.generate(
processor.apply_chat_template(messages),
audio_temperature=1.7,
audio_top_p=0.8,
audio_top_k=25,
)
sf.write('test_moss.wav', wavs[0].cpu().numpy(), sr)
"