Knowledge 목록으로

VibeVoice 1.5B / 7B (Microsoft)

🔍 조사 완료🎙️ TTS 엔진2026년 8월 6일2
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록
후속 적용

개요

최대 90분 생성, 4화자 대화, MIT

메모

실측 완료 — 한국어는 Qwen3-TTS 유지 결정, 영어/중국어 다중화자 콘텐츠에 활용 예정

조사 상세

VibeVoice (Microsoft)

개요

  • 개발: Microsoft (2025-08 오픈소스)
  • 라이선스: ✅ MIT (상업 사용 자유)
  • 특징: 최대 90분 연속 생성, 4명 화자 대화, 감정 표현, 교차언어, 노래 합성
  • 아키텍처: 7.5Hz 연속 음성 토크나이저(3200x 압축) + Qwen2.5 LLM + diffusion 헤드
  • 논문: arxiv:2508.19205
  • 공식 GitHub: microsoft/VibeVoice (52k★) — ⚠️ TTS 코드 제거됨 (ASR 중심으로 개편)
  • 커뮤니티 포크: vibevoice-community/VibeVoice — TTS 코드 보존 버전

모델 라인업

모델컨텍스트생성 길이화자비고
VibeVoice-1.5B64K~90분최대 4주력 — GB10 RTF 0.62x
VibeVoice-7B (Large)32K~45분최대 4공식 배포 "Disabled" → 커뮤니티 우회 (RTF 1.89x)
VibeVoice-Realtime-0.5B8K실시간1TTFB ~300ms, 한국어 포함 9개 추가 언어 (미설치)

설치 상태 (2026-08-07, GB10)

[로컬] # 모델 2종 (커뮤니티 우회 버전)
├── vibevoice-1.5b/ # 5.1GB (3 shards) — vibevoice/VibeVoice-1.5B
├── vibevoice-7b/ # 18GB (10 shards) — vibevoice/VibeVoice-7B
├── outputs/ outputs_7b/ outputs_en_2p/ ... # 테스트 결과물
[로컬] # 전용 venv (torch 2.11.0+cu130)
[로컬] # 커뮤니티 포크 코드

사용법

cd [로컬]
[로컬] demo/inference_from_file.py \
 --model_path [로컬] \
 --txt_path demo[경로] \
 --speaker_names Alice Frank --seed 42
  • 텍스트 형식: Speaker N: 접두사 필수 (없으면 에러)
  • 보이스: demo/voices/*.wav 프롬프트 음성 복제 (파일명 부분일치 매칭)
  • 상세: local-tts 스킬 + references/vibevoice-voice-prompts.md

실측 결과 (2026-08-07, GB10, 1.5B)

테스트오디오생성RTF
한국어 2화자 (영어 프롬프트)33.3s20.5s0.62x
한국어 2화자 (7B)39.6s74.9s1.89x
한국어 2화자 (한국어 실제 녹음 프롬프트)33.7s20.5s0.61x
영어 2화자 대화34.1s20.7s0.61x

한국어 한계 (⚠️ 중요)

  • 한국어는 교차언어 지원 수준 — 실제 한국어 여/남 녹음을 프롬프트로 넣어도 출력이 거의 동일 (음색 반영 약함)
  • 사장님 판정: "똑같다", "한국어는 qwen이 제대로" → 한국어는 Qwen3-TTS 유지
  • 영어는 음색 반영 우수 — 남녀 대화 자연스러움 (사장님: "영어는 좋다")

결론 / 활용 방침

  • 🇰🇷 한국어: Qwen3-TTS (Sohee) 체제 유지
  • 🇬🇧 영어/중국어 다중 화자 콘텐츠 (팟캐스트·대화형): VibeVoice 1.5B 사용 ✅ (컨텐츠 제작 시 활용 예정)
  • edge-tts 사용 금지 (사장님 거부) — 보이스 프롬프트 소스 상세는 local-tts 스킬 참조