Knowledge 목록으로

Qwen3.8-27B NVFP4 MTP GGUF — GB10 로컬 테스트

🔍 조사 완료🤖 LLM / 모델2026년 8월 17일4
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록
후속 실험

핵심 요약

esatapedico NVFP4 MTP 티어 7종 (27B dense, MTP 헤드 내장, mmproj 비전 지원). HIGH/VERY-HIGH GB10 실측 + 실사용 데모(ragdoll-playground-qwen3.8.html)

GB10 실측 요약

GB10 실측 완료 — ① 세팅 --spec-type draft-mtp --spec-draft-n-max 6 --spec-draft-p-min 0.75 + ctx 131072 + flash-attn + KV q8_0 + mlock ② 성능: 프리필 680~930 t/s, 디코드 17~19.5 t/s 지속, MTP 수락률 93.1% (소스 기반 장문), n-max 4 대비 디코드 +50% ③ 장기 서빙 실측 (8/18): 4슬롯 동시 부하 + mmproj 비전 포함 상태에서 장문 생성 18~22 t/s 유지 (전체 12.6~23.4 t/s, 초장문 8,287토큰 18.5 t/s, 수락률 평균 ~94%) ④ thinking ON/OFF 구성 각각 검증, HIGH/VERY-HIGH 둘 다 16~20GB로 메모리 여유. 런타임 주의: 시스템 기본 설치 경로의 구버전 바이너리 심볼 불일치, --no-mmap/--mlock deprecated → --load-mode mlock 통합. 실행 스크립트 4종은 모델 디렉토리에 보관

상세 조사

개요

  • 모델: Qwen3.8-27B — 27B dense, 네이티브 비전·언어(VLM), Gated DeltaNet + Gated Attention 하이브리드, 262,144 네이티브 컨텍스트, MTP 스펙 디코딩 헤드 내장 (Apache-2.0)
  • 배포: esatapedico/Qwen3.8-27B-NVFP4-MTP-GGUFunsloth/Qwen3.8-27B-NVFP4 전량 변환 (Apache-2.0 파생)
  • 양자화: NVFP4 — Blackwell 네이티브 4비트 (GGML 타입 40, sm_120). 소스의 NVFP4 MLP 텐서를 재양자화 없이 보존
  • 티어 7종: ORIG(33GB) / VERY-LOW / LOW / MEDIUM / HIGH / VERY-HIGH / HIGHEST(23GB) — 공통 448-tensor 바이트 동일 NVFP4 백본(전체 어텐션+MLP) + 티어별 lm_head·token_embd·MTP 헤드 정밀도만 다름
  • MTP가 GGUF에 내장 (blk.64.nextn.*) — 별도 드래프터 파일 불필요. llama.cpp --spec-type draft-mtp로 활성화
  • 비전 지원: mmproj-BF16.gguf (931MB) 페어링 시 이미지·영상 입력 가능

GB10 실측 테스트

테스트 구성

  • 하드웨어: NVIDIA GB10 (DGX Spark, 128GB 통합 메모리)
  • 런타임: llama.cpp build 10454 (sm121a GB10 전용 옵션 빌드, CUDA 12.1)
  • 테스트 모델: HIGH (15.9GB — lm_head BF16·token_embd Q6_K·MTP IQ4_XS) / VERY-HIGH (19.7GB — lm_head·token_embd·MTP 전부 BF16)
  • 서버 설정 (OpenAI 호환 API, 포트 9505/9506):

- --spec-type draft-mtp --spec-draft-n-max 6 --spec-draft-p-min 0.75

- --ctx-size 131072 --flash-attn --cache-type-k q8_0 --cache-type-v q8_0

- --load-mode mlock -ngl 999 --jinja

- 샘플링: --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0

- thinking ON / OFF (--reasoning off) 두 가지 구성 모두 검증

실측 속도 (대략)

항목
프리필14,327토큰 프롬프트 680~930 t/s
디코드17~19.5 t/s 지속 유지 (순간 피크 24~25 t/s)
MTP 수락률 (소스 기반 장문 생성)93.1% (81/87), 평균 드래프트 길이 4.24
MTP 수락률 (짧은 프롬프트)100% (7/7), 평균 드래프트 길이 4.50

설정 변경 효과 (동일 모델 HIGH nothink): --spec-draft-n-max 6 + --spec-draft-p-min 0.75 적용 후

설정수락률평균 드래프트 길이디코드
n-max 4 (p-min 없음)36.7%2.4712.2 t/s
n-max 6 + p-min 0.7593.1%4.2417.5 t/s

→ 디코드 속도 약 +50%. 소스 재작성·요약·코드처럼 예측 가능한 장문일수록 MTP 효과가 커짐.

장기 서빙 실측 (2026-08-18 추가 — 4슬롯 동시 부하, ~30분 연속)

같은 HIGH nothink 구성(포트 9505, n-max 6 + p-min 0.75)으로 4슬롯 동시 요청 + mmproj 비전 포함 + 연속 서빙 상태에서 수집. 기존 단일 테스트보다 실제 사용 조건에 가까움:

항목
디코드 (전체 작업)12.6~23.4 t/s (작업 50건+, 중앙 ~19 t/s)
디코드 (장문 500+ 토큰 생성)18.5~22.8 t/s (평균 ~20 t/s)
디코드 (초장문 8,287 토큰)18.5 t/s — 수락률 86.1%로 장기 생성에서 소폭 하락
MTP 수락률 (평균)~94% (73~100% 분포, 대부분 90%+)
평균 드래프트 길이3.4~6.9 (대부분 5~6.5, n-max 6 설정치 부근)
프리필 (부하 상태)606~930 t/s (14,327 토큰 682 t/s, 8,306 토큰 606 t/s)
동시 처리4슬롯 kv_unified — 병렬 요청 수용 (짧은 요청 경합 시 디코드 12~13 t/s까지 하락)
  • 부하 경합: 짧은 생성(100~300 토큰) + 다른 슬롯 프리필이 겹치면 디코드가 12~13 t/s로 일시 하락하나, 장문 생성은 대부분 18~22 t/s 유지
  • 수락률이 낮아지는 패턴(73~80%): 예측 어려운 무작위성 높은 생성 구간 — 드래프트 길이가 3.5~4로 줄며 속도 하락

참고 수치 (다른 하드웨어 — 직접 비교 불가)

  • 제작자 실측 (듀얼 RTX 5070 Ti + 5060 Ti 16GB, 180K 반복 페이로드): 디코드 15.4~18.5 t/s, 수락률 72.6~75.1%
  • 커뮤니티 실측 (RTX 5090 단일, gist): 평균 111.9~148.3 t/s, 수락률 44~49.5% — LOW 티어(Q5_0 lm_head)가 처리량 1위, BF16 lm_head 계열은 품질 우선
  • 프리필은 컨텍스트가 길수록 저하되므로 서로 다른 컨텍스트 수치는 정량 비교 불가

실사용 데모 — Ragdoll Playground (Qwen3.8-27B 단일 생성)

  • 결과물: Ragdoll Playground 데모 실행하기 (브라우저에서 직접 실행 가능)
  • 프롬프트 출처: Token Chaser — MiMo-v2.5 vs Qwen3.6 27B 비교 영상의 "Ragdoll Physics Simulator" 테스트 프롬프트
  • 작성 방식: 단일 프롬프트 1회로 생성 (수정·재시도 없이 한 번에 나온 결과물) — 단일 파일 HTML·CSS·JS 래그돌 물리 시뮬레이터, 외부 라이브러리 없음
  • 환경: Qwen3.8-27B NVFP4 MTP HIGH (nothink), 포트 9505 (위 GB10 서버 구성과 동일)
  • 기능: 래그돌 낙하·바운스·드래그, 플레이그라운드(바닥·플랫폼·벽·범퍼), 중력·바운스·슬로모션·안티그래비티 컨트롤, 공·박스·범퍼 스폰, 리셋 버튼
  • 검증: 민감정보 0건 (경로·IP·실명·키 없음), 모델 태그 "qwen3.8" UI 표시 확인

GB10 적용성 평가

  • 메모리: 27B dense NVFP4 16~20GB + mmproj + 131K KV q8_0 — 128GB 통합 메모리에 여유 있음
  • 속도: 단일 요청 17~20 t/s, 동시 4슬롯 부하에서도 장문 생성 18~22 t/s 유지 (경합 시 12~13 t/s까지 일시 하락) — 긴 문서 처리·에이전트 보조 모델로 실사용 가능 수준
  • 핵심 포인트: NVFP4가 GB10(Blackwell sm_120) 네이티브 → 로컬에서 밀도 높은 양자화를 그대로 활용. MTP 헤드 내장 덕분에 별도 드래프터 없이 스펙 디코딩
  • 용도 제안: thinking OFF는 빠른 즉답·툴콜링 보조, thinking ON은 심층 추론·분석. 비전 mmproj 포함 시 이미지 이해도 가능
  • 런타임 주의: 시스템 기본 설치 경로의 구버전 바이너리는 새 라이브러리와 심볼 불일치 — 항상 빌드 디렉토리의 바이너리 사용. --no-mmap/--mlock은 deprecated → --load-mode mlock 사용

결론

  • GB10에서 27B급 dense 모델의 현실적 로컬 라인으로 Qwen3.8-27B NVFP4 MTP는 유효한 선택
  • 소스 기반 장문 생성에서는 MTP 조정(n-max 6 + p-min 0.75)으로 수락률·속도 모두 개선 확인
  • HIGH vs VERY-HIGH는 속도 차이 미미(동일 NVFP4 백본), 품질 차이(lm_head/임베딩 정밀도)는 BF16이 우위 — 메모리 여유 있으면 VERY-HIGH 권장

관련 Benchmark

같은 Project의 Qwen3.8-27B Ridge 측정 결과는 Local LLM Benchmark 실측 리포트에서 확인할 수 있다.

Sources / 출처