VibeVoice 1.5B / 7B (Microsoft)
🔍 조사 완료🎙️ TTS 엔진2026년 8월 6일약 2분
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록
후속 적용
개요
최대 90분 생성, 4화자 대화, MIT
메모
실측 완료 — 한국어는 Qwen3-TTS 유지 결정, 영어/중국어 다중화자 콘텐츠에 활용 예정
조사 상세
VibeVoice (Microsoft)
개요
- 개발: Microsoft (2025-08 오픈소스)
- 라이선스: ✅ MIT (상업 사용 자유)
- 특징: 최대 90분 연속 생성, 4명 화자 대화, 감정 표현, 교차언어, 노래 합성
- 아키텍처: 7.5Hz 연속 음성 토크나이저(3200x 압축) + Qwen2.5 LLM + diffusion 헤드
- 논문: arxiv:2508.19205
- 공식 GitHub: microsoft/VibeVoice (52k★) — ⚠️ TTS 코드 제거됨 (ASR 중심으로 개편)
- 커뮤니티 포크: vibevoice-community/VibeVoice — TTS 코드 보존 버전
모델 라인업
| 모델 | 컨텍스트 | 생성 길이 | 화자 | 비고 |
|---|---|---|---|---|
| VibeVoice-1.5B | 64K | ~90분 | 최대 4 | 주력 — GB10 RTF 0.62x |
| VibeVoice-7B (Large) | 32K | ~45분 | 최대 4 | 공식 배포 "Disabled" → 커뮤니티 우회 (RTF 1.89x) |
| VibeVoice-Realtime-0.5B | 8K | 실시간 | 1 | TTFB ~300ms, 한국어 포함 9개 추가 언어 (미설치) |
설치 상태 (2026-08-07, GB10)
[로컬] # 모델 2종 (커뮤니티 우회 버전)
├── vibevoice-1.5b/ # 5.1GB (3 shards) — vibevoice/VibeVoice-1.5B
├── vibevoice-7b/ # 18GB (10 shards) — vibevoice/VibeVoice-7B
├── outputs/ outputs_7b/ outputs_en_2p/ ... # 테스트 결과물
[로컬] # 전용 venv (torch 2.11.0+cu130)
[로컬] # 커뮤니티 포크 코드
사용법
cd [로컬]
[로컬] demo/inference_from_file.py \
--model_path [로컬] \
--txt_path demo[경로] \
--speaker_names Alice Frank --seed 42
- 텍스트 형식:
Speaker N:접두사 필수 (없으면 에러) - 보이스:
demo/voices/*.wav프롬프트 음성 복제 (파일명 부분일치 매칭) - 상세: local-tts 스킬 +
references/vibevoice-voice-prompts.md
실측 결과 (2026-08-07, GB10, 1.5B)
| 테스트 | 오디오 | 생성 | RTF |
|---|---|---|---|
| 한국어 2화자 (영어 프롬프트) | 33.3s | 20.5s | 0.62x |
| 한국어 2화자 (7B) | 39.6s | 74.9s | 1.89x |
| 한국어 2화자 (한국어 실제 녹음 프롬프트) | 33.7s | 20.5s | 0.61x |
| 영어 2화자 대화 | 34.1s | 20.7s | 0.61x |
한국어 한계 (⚠️ 중요)
- 한국어는 교차언어 지원 수준 — 실제 한국어 여/남 녹음을 프롬프트로 넣어도 출력이 거의 동일 (음색 반영 약함)
- 사장님 판정: "똑같다", "한국어는 qwen이 제대로" → 한국어는 Qwen3-TTS 유지
- 영어는 음색 반영 우수 — 남녀 대화 자연스러움 (사장님: "영어는 좋다")
결론 / 활용 방침
- 🇰🇷 한국어: Qwen3-TTS (Sohee) 체제 유지
- 🇬🇧 영어/중국어 다중 화자 콘텐츠 (팟캐스트·대화형): VibeVoice 1.5B 사용 ✅ (컨텐츠 제작 시 활용 예정)
- edge-tts 사용 금지 (사장님 거부) — 보이스 프롬프트 소스 상세는 local-tts 스킬 참조