MOSS-TTS Family (8B / 1.7B / Realtime 2B / TTSD 8B)
⏳ 적용 대기🎙️ TTS 엔진2026년 7월 26일약 3분
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록
개요
OpenMOSS, Apache 2.0, 20개 언어(한국어 포함), zero-shot voice clone, 초장문 안정
메모
4개 모델 설치 완료 (~42GB), 생성 테스트 안 함. Qwen3-TTS와 A/B 비교 예정
조사 상세
MOSS-TTS Family
개요
- 개발: MOSI.AI + OpenMOSS Team
- 라이선스: ✅ Apache 2.0
- 아키텍처: Autoregressive discrete-token TTS (Delay / Local 2종)
- 언어: 20개 — 한국어 포함 🇰🇷 (중국어[경로] 등)
- 논문: arxiv:2603.18090
- GitHub: OpenMOSS/MOSS-TTS
- Hugging Face: OpenMOSS-Team/MOSS-TTS
모델 라인업
| 모델 | 크기 | 용도 |
|---|---|---|
| MOSS-TTS | 8B 🏆 | 플래그십 — 고품질 음성합성, zero-shot voice clone, 초장문 안정적 생성 |
| MOSS-TTS-Local-Transformer | 1.7B / 3B / 5B | 경량형 — 빠른 실험/연구용 |
| MOSS-TTSD | 8B | 대화 생성 특화 — 다중 화자, 감정 표현, 극장문 대화 |
| MOSS-TTS-Realtime | 2B | 실시간 스트리밍 — TTFB 180ms, 음성 에이전트용 |
| MOSS-TTS-Nano | 100M | 초경량 |
| MOSS-VoiceGenerator | 1.7B | 텍스트로 음색/스타일 디자인 |
| MOSS-SoundEffect | 8B | 환경음향 효과 생성 |
| MOSS-TTS-GGUF | 8B Q4/Q8 | GGUF 양자화 버전 — llama.cpp 호환 |
핵심 기능
- Zero-shot Voice Cloning — 참조 음성 1개로 목소리 복제
- 초장문 안정적 생성 — 한 시간 내레이션도 음색 유지
- 토큰 단위 길이 제어 — 1초 ≈ 12.5 tokens 정밀 제어
- 다국어 + 코드스위칭 — 한국어 포함 20개 언어, 중간 언어 전환
- Pinyin/IPA 발음 제어 — 발음 세밀 조정 가능
Seed-TTS-eval 벤치마크
| 모델 | Open Source | EN WER↓ | EN SIM↑ | ZH SIM↑ |
|---|---|---|---|---|
| MOSS-TTS-Delay 8B | ✅ | 1.84 | 70.86 | 76.98 |
| MOSS-TTS-Local 1.7B | ✅ | 1.93 | 73.28 | 79.62 |
| Qwen3-TTS 1.7B | ✅ | 1.50 | 71.45 | 76.72 |
| Qwen3-TTS 0.6B | ✅ | 1.68 | 70.39 | 76.40 |
| CosyVoice2 0.5B | ✅ | 3.09 | 65.9 | 75.7 |
| F5-TTS 0.3B | ✅ | 2.00 | 67.0 | 76.0 |
| GLM-TTS-RL 1.5B | ✅ | 1.91 | 68.1 | 76.4 |
DGX Spark 구동 가능성
| 모델 | BF16 크기 | 구동 가능 |
|---|---|---|
| MOSS-TTS 8B Delay | ~16GB | ✅ 무리없음 (Flash Attention 2 권장) |
| MOSS-TTS-Local 1.7B | ~3.4GB | ✅ 매우 가벼움 |
| MOSS-TTS-GGUF Q4 | ~5GB | ✅ llama.cpp로 바로 실행 |
| MOSS-TTS-Realtime 2B | ~4GB | ✅ |
설치 및 사용
# 환경 설정
conda create -n moss-tts python=3.12 -y
conda activate moss-tts
git clone https://github.com/OpenMOSS/MOSS-TTS.git
cd MOSS-TTS
pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e .
# Flash Attention 2 (선택)
pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e ".[flash-attn]"
from transformers import AutoModel, AutoProcessor
import torch
model = AutoModel.from_pretrained(
"OpenMOSS-Team/MOSS-TTS",
trust_remote_code=True,
torch_dtype=torch.bfloat16,
device_map="cuda",
)
processor = AutoProcessor.from_pretrained(
"OpenMOSS-Team/MOSS-TTS",
trust_remote_code=True,
)
# 단순 생성
messages = [
{"role": "user", "content": {"text": "안녕하세요, 오늘 날씨가 참 좋네요."}}
]
output = model.generate(
processor.apply_chat_template(messages),
max_new_tokens=1000,
)
# output.audio_codes → waveform 디코딩
# Voice Clone (참조 음성 + 텍스트)
messages = [
{
"role": "user",
"content": {
"text": "안녕하세요, 오늘 날씨가 참 좋네요.",
"reference": ["[경로]"],
}
}
]