Local LLM Benchmark — Qwen3.8-27B Ridge 3.7bpw 실측 리포트
실험 개요
Local LLM Benchmark는 DGX Spark GB10(128GB 통합 메모리, Blackwell sm_120)에서 27B급 GGUF 양자화 모델의 현실적 성능을 실측하는 실험이다. 단순 벤치마크 숫자가 아니라, 실제 서빙 부하(4슬롯 동시)와 생성 품질(단일 프롬프트 → 산출물)까지 종합적으로 판단한다.
핵심 결과 요약
- Target: Qwen3.8-27B Ridge 3.7bpw GGUF
- Environment: DGX Spark GB10, llama.cpp custom build b10453-1, 4슬롯 동시, 131,072 컨텍스트, Flash Attention ON, KV q8_0
- Method: 프리필·디코드·MTP 수락률을 측정하고, 자체 한국 주식 대시보드 프롬프트를 1회 생성한 뒤 9개 기능을 검증했다.
- Result: 프리필 492~500 t/s, 디코드 평균 약 29 t/s, MTP 수락률 평균 약 88%, 대시보드 기능 테스트 9/9 통과
- Limitations: 단일 모델과 단일 대시보드 프롬프트를 사용한 실측이므로 전체 모델 순위나 일반적인 코드 품질을 의미하지 않는다.
실험 환경
- 하드웨어: NVIDIA DGX Spark GB10
- GPU 메모리: 128GB 통합 (Blackwell sm_120)
- 서버: llama.cpp (custom build, b10453-1)
- 컨텍스트: 131,072 토큰
- 슬롯: 4개 동시
- Flash Attention: ON
- KV 캐시: q8_0
- GPU 레이어: 999 (전부 오프로드)
사용 모델
Qwen3.8-27B-Ridge-3.7bpw
- 양자화: Ridge 3.7bpw (고밀도 GGUF)
- 파일 크기: 약 12GB
- MTP 내장: 예 (별도 draft 모델 불필요)
- 멀티모달: mmproj-BF16.gguf (비전 지원)
- thinking: OFF (nothink)
- MTP 스펙 디코딩: 활성화
--spec-type draft-mtp--spec-draft-n-max 6--spec-draft-p-min 0.75- 샘플링: temp 0.6, top-p 0.95, top-k 20
벤치마크 결과
토큰 생성 속도 (실측)
| 항목 | 수치 |
|---|---|
| 프리필 (Prefill) | 492~500 t/s |
| 디코드 (Decode) 평균 | ~29 t/s |
| 디코드 피크 | 33 t/s |
| 디코드 최저 | ~16 t/s (초장문 생성 시) |
| MTP 수락률 | 87~100% (평균 ~88%) |
| MTP 평균 수락 길이 | 5.27~7.00 |
프리필 상세 (대용량 프롬프트)
| 토큰 수 | 속도 |
|---|---|
| 4,096 | 713 t/s |
| 8,192 | 650 t/s |
| 12,288 | 617 t/s |
| 14,972 | 500 t/s |
프리필은 소량 토큰에서 700+ t/s를 기록하며, 15K 토큰에서도 500 t/s를 유지한다. GB10의 넉넉한 메모리 대역폭이 프리필 성능의 핵심이다.
디코드 상세 (연속 생성)
장문 생성(7,296 토큰)에서 평균 29.09 t/s를 기록했으며, 3초 이동 평균(tg_3s)은 20~37 t/s 사이에서 변동했다. 초반에 31~33 t/s로 시작해 중반 이후 안정적으로 28~30 t/s를 유지하는 패턴을 보인다.
연속 생성 기록 (task 81, 총 7,296 토큰):
| 구간 | 토큰 수 | 속도 |
|---|---|---|
| 0~1,000 | 1,031 | 30.32 t/s |
| 1,000~2,000 | 958 | 30.79 t/s |
| 2,000~3,000 | 1,050 | 30.69 t/s |
| 3,000~4,000 | 908 | 29.35 t/s |
| 4,000~5,000 | 1,007 | 28.56 t/s |
| 5,000~6,000 | 1,028 | 28.87 t/s |
| 6,000~7,000 | 1,000 | 29.11 t/s |
MTP 수락률 분석
MTP(Multi-Token Prediction) 스펙 디코딩은 한 번에 여러 토큰을 예측해 디코딩 속도를 높이는 기법이다. Ridge 모델은 MTP 헤드가 내장되어 있어 별도 draft 모델 없이 스펙 디코딩이 가능하다.
| 요청 유형 | 수락률 | 평균 수락 길이 |
|---|---|---|
| 대용량 코드 생성 | 96.5% | 5.67 |
| 중간 코드 생성 | 83~96% | 5.2~6.2 |
| 텍스트 생성 | 77~94% | 3.2~5.5 |
| 코드 수정/연속 | 84~100% | 4.2~7.0 |
수락률이 높을수록 draft 토큰이 실제 출력으로 채택되므로, 디코드 속도가 향상된다. 코드 생성에서 가장 높은 수락률(96.5%)을 보이며, 텍스트 생성에서 약간 낮은 경향이 있다.
테스트 프롬프트: 한국 주식 대시보드
이 실험에서는 자체 벤치마크 프롬프트 24종 중 "한국 주식 대시보드" 프롬프트로 실제 생성 품질을 검증했다.
프롬프트 요구사항
- 8개 종목 (삼성전자, SK하이닉스, LG에너지솔루션, NAVER, 카카오, 현대차, 기아, 셀트리온)
- 현재가, 등락률, 7일 스파크라인
- KOSPI/KOSDAQ 지수 요약 헤더
- 검색 필터
- 클릭 시 상세 모달 (시가[경로] + 30일 캔버스 차트)
- KO/EN 이중언어 토글
- 외부 CDN 금지, 단일 HTML 파일
- 자체 테스트 루프 포함
생성 결과
1회 생성으로 완성. 수정·재시도 없이 단일 프롬프트로 503줄짜리 완성된 대시보드가 생성되었다.
기능 구현:
- 다크 테마, 반응형 레이아웃 (모바일 375px 지원)
- 결정적 시드(mulberry32)로 재현 가능한 가상 시계열
- SVG 스파크라인 (카드당 7일)
- Canvas 30일 캔버스 차트 (모달)
- I18N 객체 (ko/en) +
setLang()즉시 재렌더 - 카드 호버/애니메이션, 모달 전환 애니메이션
테스트 결과 (9/9 통과)
| 항목 | 결과 |
|---|---|
| 페이지 로드, console error | 0건 ✅ |
| 8개 종목 카드 렌더링 | ✅ |
| KOSPI/KOSDAQ 요약 카드 | ✅ |
| 카드 클릭 → 모달 표시 | ✅ (1회 버그 수정 후) |
| 캔버스 차트 렌더링 | ✅ |
| 검색 필터 (KO/EN) | ✅ |
| KO/EN 토글 즉시 전환 | ✅ |
| 한글 깨짐 (U+FFFD) | 0건 ✅ |
| 모바일 375px 레이아웃 | ✅ |
발견 버그 1건: 모달 오버레이의 hidden 속성이 CSS display:flex에 의해 무시됨 → .modal-overlay[hidden] { display: none; } 추가로 해결.
데모
- Stock Dashboard: /stock-dashboard-qwen3.8.html — 단일 HTML, 외부 의존성 없음
- Ragdoll Playground: /ragdoll-playground-qwen3.8.html — 같은 모델로 생성한 물리 시뮬레이터
실행 스크립트
# Ridge nothink (테스트에 사용된 설정)
./run_qwen38_27b_ridge_nothink.sh
# 포트: 9507
# 모델: Qwen3.8-27B-Ridge-3.7bpw.gguf
# 옵션: --spec-type draft-mtp --spec-draft-n-max 6 --spec-draft-p-min 0.75
결론
Qwen3.8-27B Ridge 3.7bpw는 GB10에서 안정적으로 동작하며, MTP 스펙 디코딩으로 디코드 29 t/s, 프리필 500+ t/s를 기록한다. 단일 프롬프트로 500줄짜리 인터랙티브 대시보드를 1회 생성할 수 있는 수준이며, 코드 생성 품질도 양호하다. 12GB 모델로 131K 컨텍스트 + 비전(mmproj)까지 지원하므로, 로컬 AI 데스크톱 환경으로 충분한 성능을 보여준다.
관련 Knowledge
같은 Local LLM Benchmark Project에서 Qwen3.8-27B NVFP4 MTP를 GB10에서 검증한 Knowledge 글도 함께 참고할 수 있다: Qwen3.8-27B NVFP4 MTP GGUF — GB10 로컬 테스트