Knowledge 목록으로

OmniVoice 0.6B

적용 대기🎙️ TTS 엔진2026년 7월 27일3
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록

개요

646언어 제로샷 클로닝, 5.2GB

메모

설치 완료, 테스트 안 함

조사 상세

DGX Spark 로컬 TTS 엔진 — 설치 현황

DGX Spark GB10 (130.6GB unified memory, CUDA 13.0)에 설치된 모든 TTS 엔진의 종합 현황.

한눈에 보기

엔진경로용량한국어설치생성 테스트
Qwen3-TTS 1.7B`[로컬]~3.5GB★★★★✅ (운영중)
Supertone 3`[로컬]137MB★★★★
OmniVoice 0.6B`[로컬]5.2GB★★★★
NVIDIA MagpieTTS 357M`[로컬]2GB★★★
Higgs TTS 3 4B`[로컬]8.7GB★★★★★✅ (weights only)
MOSS-TTS 8B`[로컬]16GB★★★★
MOSS-TTS-Local 1.7B`[로컬]5.8GB★★★★
MOSS-TTS-Realtime 2B`[로컬]4.4GB★★★★
MOSS-TTSD v1.0 8B`[로컬]16GB★★★★
MOSS-TTS-GGUF Q4HF (gated)~5GB★★★★❌ 승인필요
총계~59GB9/10 설치1개 운영중

엔진별 상세

🟢 Qwen3-TTS 1.7B (현재 실운영 중)

  • 모델: Qwen/Qwen3-TTS-12Hz-1.7B-Base
  • 모드: CustomVoice (Sohee), VoiceDesign, Voice Clone
  • 샘플레이트: 12Hz
  • 사용처: StockPulse YouTube Shorts (04_generate_tts.py), AI 오목
  • 특징: atempo 1.3x 적용, 영어→한글 발음 변환표 사용
  • 상세 페이지 참고

🟢 MOSS-TTS Family (설치 완료, 테스트 전)

MOSS-TTS는 MOSI.AI + OpenMOSS Team, Apache 2.0 라이선스, 20개 언어(한국어 포함).

MOSS-TTS 8B Delay (플래그십)

  • 경로: `[로컬] (16GB, 8.49B params)
  • 용도: 고품질 음성합성, zero-shot voice clone, 초장문 안정 생성
  • 로드 검증: MossTTSDelayModel, sdpa attention, device_map='cuda' ✅
  • 로딩 시간: ~1.5분

MOSS-TTS-Local 1.7B (경량형)

  • 경로: `[로컬] (5.8GB)
  • 용도: 빠른 실험/연구용
  • 벤치마크: SIM 73.28%로 Qwen3-TTS 1.7B(71.45%) 상회

MOSS-TTS-Realtime 2B (실시간)

  • 경로: `[로컬] (4.4GB, 단일 safetensors 4.66GB)
  • 용도: 실시간 스트리밍, TTFB 180ms, 음성 에이전트용
  • 파일 구조: modeling_mossttsrealtime.py, streaming_mossttsrealtime.py

MOSS-TTSD v1.0 8B (대화 생성)

  • 경로: `[로컬] (16GB)
  • 용도: 다중 화자 대화 생성, 감정 표현, 극장문 대화
  • 아키텍처: MOSS-TTS Delay 기반 (MossTTSDelayModel과 동일 구조)

🔴 MOSS-TTS-GGUF (미설치)

  • 레포: OpenMOSS-Team/MOSS-TTS-GGUF (gated, 승인 필요)
  • 파일 목록: MOSS_TTS_F16.gguf, MOSS_TTS_Q4_K_M.gguf, MOSS_TTS_Q8_0.gguf, MOSS_TTS_Q5_K_M.gguf, MOSS_TTS_Q6_K.gguf, embeddings/
  • 설치 방법: HF에서 승인 받은 후 `hf download OpenMOSS-Team/MOSS-TTS-GGUF --local-dir [로컬]

🟡 기타 설치된 엔진

  • Supertone 3 (137MB): 한국 기업, ONNX 경량, pip 설치 완료
  • OmniVoice 0.6B (5.2GB): 646언어 제로샷 클로닝
  • NVIDIA MagpieTTS 357M (2GB): 12언어, 상업 라이선스
  • Higgs TTS 3 4B (weights 8.7GB): 감정/스타일 43태그, SGLang-Omni Docker 필요

용도별 추천

목적추천 엔진이유
🎬 유튜브 나레이션Qwen3-TTS (운영중)Sohee + instruct 톤 제어
📚 초장문/팟캐스트MOSS-TTS 8B음색 유지 1시간 안정
🗣️ 보이스 클로닝MOSS-TTS 8B / OmniVoice제로샷 클로닝
⚡ 실시간 대화형MOSS-TTS-Realtime 2B / Supertone 3TTFB 180ms
🎭 감정 표현 대화MOSS-TTSD v1.0 8B다중 화자, 감정
🌐 다국어 콘텐츠MOSS-TTS 8B20개 언어

테스트 방법 (Quick Start)

conda activate moss-tts
python -c "
from transformers import AutoModel, AutoProcessor
import torch, soundfile as sf

# MOSS-TTS 8B
model = AutoModel.from_pretrained(
 '[로컬],
 trust_remote_code=True,
 attn_implementation='sdpa',
 torch_dtype=torch.bfloat16,
 device_map='cuda',
)
processor = AutoProcessor.from_pretrained(
 '[로컬],
 trust_remote_code=True,
)

# 한국어 생성 (간단 테스트)
messages = [{'role': 'user', 'content': '안녕하세요, 오늘 시장 상황을 분석해드리겠습니다.'}]
wavs, sr = model.generate(
 processor.apply_chat_template(messages),
 audio_temperature=1.7,
 audio_top_p=0.8,
 audio_top_k=25,
)
sf.write('test_moss.wav', wavs[0].cpu().numpy(), sr)
"