Local LLM Benchmark — Qwen3.8-27B Ridge 3.7bpw 실측 리포트

2026년 8월 18일6
작성 DevSnack Lab직접 실행·측정·판단 기록
진행중📊 벤치마크 / 도구Qwen3.8RidgeDGX Spark

실험 개요


Local LLM Benchmark는 DGX Spark GB10(128GB 통합 메모리, Blackwell sm_120)에서 27B급 GGUF 양자화 모델의 현실적 성능을 실측하는 실험이다. 단순 벤치마크 숫자가 아니라, 실제 서빙 부하(4슬롯 동시)와 생성 품질(단일 프롬프트 → 산출물)까지 종합적으로 판단한다.

핵심 결과 요약

  • Target: Qwen3.8-27B Ridge 3.7bpw GGUF
  • Environment: DGX Spark GB10, llama.cpp custom build b10453-1, 4슬롯 동시, 131,072 컨텍스트, Flash Attention ON, KV q8_0
  • Method: 프리필·디코드·MTP 수락률을 측정하고, 자체 한국 주식 대시보드 프롬프트를 1회 생성한 뒤 9개 기능을 검증했다.
  • Result: 프리필 492~500 t/s, 디코드 평균 약 29 t/s, MTP 수락률 평균 약 88%, 대시보드 기능 테스트 9/9 통과
  • Limitations: 단일 모델과 단일 대시보드 프롬프트를 사용한 실측이므로 전체 모델 순위나 일반적인 코드 품질을 의미하지 않는다.

실험 환경


  • 하드웨어: NVIDIA DGX Spark GB10
  • GPU 메모리: 128GB 통합 (Blackwell sm_120)
  • 서버: llama.cpp (custom build, b10453-1)
  • 컨텍스트: 131,072 토큰
  • 슬롯: 4개 동시
  • Flash Attention: ON
  • KV 캐시: q8_0
  • GPU 레이어: 999 (전부 오프로드)

사용 모델


Qwen3.8-27B-Ridge-3.7bpw


  • 양자화: Ridge 3.7bpw (고밀도 GGUF)
  • 파일 크기: 약 12GB
  • MTP 내장: 예 (별도 draft 모델 불필요)
  • 멀티모달: mmproj-BF16.gguf (비전 지원)
  • thinking: OFF (nothink)
  • MTP 스펙 디코딩: 활성화
  • --spec-type draft-mtp
  • --spec-draft-n-max 6
  • --spec-draft-p-min 0.75
  • 샘플링: temp 0.6, top-p 0.95, top-k 20

벤치마크 결과


토큰 생성 속도 (실측)


항목수치
프리필 (Prefill)492~500 t/s
디코드 (Decode) 평균~29 t/s
디코드 피크33 t/s
디코드 최저~16 t/s (초장문 생성 시)
MTP 수락률87~100% (평균 ~88%)
MTP 평균 수락 길이5.27~7.00

프리필 상세 (대용량 프롬프트)


토큰 수속도
4,096713 t/s
8,192650 t/s
12,288617 t/s
14,972500 t/s

프리필은 소량 토큰에서 700+ t/s를 기록하며, 15K 토큰에서도 500 t/s를 유지한다. GB10의 넉넉한 메모리 대역폭이 프리필 성능의 핵심이다.


디코드 상세 (연속 생성)


장문 생성(7,296 토큰)에서 평균 29.09 t/s를 기록했으며, 3초 이동 평균(tg_3s)은 20~37 t/s 사이에서 변동했다. 초반에 31~33 t/s로 시작해 중반 이후 안정적으로 28~30 t/s를 유지하는 패턴을 보인다.


연속 생성 기록 (task 81, 총 7,296 토큰):


구간토큰 수속도
0~1,0001,03130.32 t/s
1,000~2,00095830.79 t/s
2,000~3,0001,05030.69 t/s
3,000~4,00090829.35 t/s
4,000~5,0001,00728.56 t/s
5,000~6,0001,02828.87 t/s
6,000~7,0001,00029.11 t/s

MTP 수락률 분석


MTP(Multi-Token Prediction) 스펙 디코딩은 한 번에 여러 토큰을 예측해 디코딩 속도를 높이는 기법이다. Ridge 모델은 MTP 헤드가 내장되어 있어 별도 draft 모델 없이 스펙 디코딩이 가능하다.


요청 유형수락률평균 수락 길이
대용량 코드 생성96.5%5.67
중간 코드 생성83~96%5.2~6.2
텍스트 생성77~94%3.2~5.5
코드 수정/연속84~100%4.2~7.0

수락률이 높을수록 draft 토큰이 실제 출력으로 채택되므로, 디코드 속도가 향상된다. 코드 생성에서 가장 높은 수락률(96.5%)을 보이며, 텍스트 생성에서 약간 낮은 경향이 있다.


테스트 프롬프트: 한국 주식 대시보드


이 실험에서는 자체 벤치마크 프롬프트 24종 중 "한국 주식 대시보드" 프롬프트로 실제 생성 품질을 검증했다.


프롬프트 요구사항


  • 8개 종목 (삼성전자, SK하이닉스, LG에너지솔루션, NAVER, 카카오, 현대차, 기아, 셀트리온)
  • 현재가, 등락률, 7일 스파크라인
  • KOSPI/KOSDAQ 지수 요약 헤더
  • 검색 필터
  • 클릭 시 상세 모달 (시가[경로] + 30일 캔버스 차트)
  • KO/EN 이중언어 토글
  • 외부 CDN 금지, 단일 HTML 파일
  • 자체 테스트 루프 포함

생성 결과


1회 생성으로 완성. 수정·재시도 없이 단일 프롬프트로 503줄짜리 완성된 대시보드가 생성되었다.


기능 구현:

  • 다크 테마, 반응형 레이아웃 (모바일 375px 지원)
  • 결정적 시드(mulberry32)로 재현 가능한 가상 시계열
  • SVG 스파크라인 (카드당 7일)
  • Canvas 30일 캔버스 차트 (모달)
  • I18N 객체 (ko/en) + setLang() 즉시 재렌더
  • 카드 호버/애니메이션, 모달 전환 애니메이션

테스트 결과 (9/9 통과)


항목결과
페이지 로드, console error0건 ✅
8개 종목 카드 렌더링
KOSPI/KOSDAQ 요약 카드
카드 클릭 → 모달 표시✅ (1회 버그 수정 후)
캔버스 차트 렌더링
검색 필터 (KO/EN)
KO/EN 토글 즉시 전환
한글 깨짐 (U+FFFD)0건 ✅
모바일 375px 레이아웃

발견 버그 1건: 모달 오버레이의 hidden 속성이 CSS display:flex에 의해 무시됨 → .modal-overlay[hidden] { display: none; } 추가로 해결.


데모



실행 스크립트



# Ridge nothink (테스트에 사용된 설정)
./run_qwen38_27b_ridge_nothink.sh
# 포트: 9507
# 모델: Qwen3.8-27B-Ridge-3.7bpw.gguf
# 옵션: --spec-type draft-mtp --spec-draft-n-max 6 --spec-draft-p-min 0.75

결론


Qwen3.8-27B Ridge 3.7bpw는 GB10에서 안정적으로 동작하며, MTP 스펙 디코딩으로 디코드 29 t/s, 프리필 500+ t/s를 기록한다. 단일 프롬프트로 500줄짜리 인터랙티브 대시보드를 1회 생성할 수 있는 수준이며, 코드 생성 품질도 양호하다. 12GB 모델로 131K 컨텍스트 + 비전(mmproj)까지 지원하므로, 로컬 AI 데스크톱 환경으로 충분한 성능을 보여준다.

관련 Knowledge

같은 Local LLM Benchmark Project에서 Qwen3.8-27B NVFP4 MTP를 GB10에서 검증한 Knowledge 글도 함께 참고할 수 있다: Qwen3.8-27B NVFP4 MTP GGUF — GB10 로컬 테스트