Knowledge 목록으로

MOSS-TTS Family (8B / 1.7B / Realtime 2B / TTSD 8B)

적용 대기🎙️ TTS 엔진2026년 7월 26일3
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록

개요

OpenMOSS, Apache 2.0, 20개 언어(한국어 포함), zero-shot voice clone, 초장문 안정

메모

4개 모델 설치 완료 (~42GB), 생성 테스트 안 함. Qwen3-TTS와 A/B 비교 예정

조사 상세

MOSS-TTS Family

개요

  • 개발: MOSI.AI + OpenMOSS Team
  • 라이선스: ✅ Apache 2.0
  • 아키텍처: Autoregressive discrete-token TTS (Delay / Local 2종)
  • 언어: 20개 — 한국어 포함 🇰🇷 (중국어[경로] 등)
  • 논문: arxiv:2603.18090
  • GitHub: OpenMOSS/MOSS-TTS
  • Hugging Face: OpenMOSS-Team/MOSS-TTS

모델 라인업

모델크기용도
MOSS-TTS8B 🏆플래그십 — 고품질 음성합성, zero-shot voice clone, 초장문 안정적 생성
MOSS-TTS-Local-Transformer1.7B / 3B / 5B경량형 — 빠른 실험/연구용
MOSS-TTSD8B대화 생성 특화 — 다중 화자, 감정 표현, 극장문 대화
MOSS-TTS-Realtime2B실시간 스트리밍 — TTFB 180ms, 음성 에이전트용
MOSS-TTS-Nano100M초경량
MOSS-VoiceGenerator1.7B텍스트로 음색/스타일 디자인
MOSS-SoundEffect8B환경음향 효과 생성
MOSS-TTS-GGUF8B Q4/Q8GGUF 양자화 버전 — llama.cpp 호환

핵심 기능

  1. Zero-shot Voice Cloning — 참조 음성 1개로 목소리 복제
  2. 초장문 안정적 생성 — 한 시간 내레이션도 음색 유지
  3. 토큰 단위 길이 제어 — 1초 ≈ 12.5 tokens 정밀 제어
  4. 다국어 + 코드스위칭 — 한국어 포함 20개 언어, 중간 언어 전환
  5. Pinyin/IPA 발음 제어 — 발음 세밀 조정 가능

Seed-TTS-eval 벤치마크

모델Open SourceEN WER↓EN SIM↑ZH SIM↑
MOSS-TTS-Delay 8B1.8470.8676.98
MOSS-TTS-Local 1.7B1.9373.2879.62
Qwen3-TTS 1.7B1.5071.4576.72
Qwen3-TTS 0.6B1.6870.3976.40
CosyVoice2 0.5B3.0965.975.7
F5-TTS 0.3B2.0067.076.0
GLM-TTS-RL 1.5B1.9168.176.4

DGX Spark 구동 가능성

모델BF16 크기구동 가능
MOSS-TTS 8B Delay~16GB✅ 무리없음 (Flash Attention 2 권장)
MOSS-TTS-Local 1.7B~3.4GB✅ 매우 가벼움
MOSS-TTS-GGUF Q4~5GB✅ llama.cpp로 바로 실행
MOSS-TTS-Realtime 2B~4GB

설치 및 사용

# 환경 설정
conda create -n moss-tts python=3.12 -y
conda activate moss-tts

git clone https://github.com/OpenMOSS/MOSS-TTS.git
cd MOSS-TTS
pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e .

# Flash Attention 2 (선택)
pip install --extra-index-url https://download.pytorch.org/whl/cu128 -e ".[flash-attn]"
from transformers import AutoModel, AutoProcessor
import torch

model = AutoModel.from_pretrained(
 "OpenMOSS-Team/MOSS-TTS",
 trust_remote_code=True,
 torch_dtype=torch.bfloat16,
 device_map="cuda",
)
processor = AutoProcessor.from_pretrained(
 "OpenMOSS-Team/MOSS-TTS",
 trust_remote_code=True,
)

# 단순 생성
messages = [
 {"role": "user", "content": {"text": "안녕하세요, 오늘 날씨가 참 좋네요."}}
]
output = model.generate(
 processor.apply_chat_template(messages),
 max_new_tokens=1000,
)
# output.audio_codes → waveform 디코딩

# Voice Clone (참조 음성 + 텍스트)
messages = [
 {
 "role": "user",
 "content": {
 "text": "안녕하세요, 오늘 날씨가 참 좋네요.",
 "reference": ["[경로]"],
 }
 }
]