llama-throughput-lab / draftbench
🔍 조사 완료📊 벤치마크 · 도구2026년 7월 30일약 3분
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록
개요
스루풋 테스트 / 스펙큘레이티브 디코딩 최적화
메모
"적용 검토 가능"까지 확인, 미적용
조사 상세
alexziskind1 LLM 벤치마크 툴셋
개요
GitHub 사용자 alexziskind1이 운영하는 LLM 벤치마크/로컬 AI 툴 모음. llama.cpp 기반 로컬 추론 벤치마크에 특화되어 있으며, 같은 로컬 하드웨어에서 바로 활용 가능한 도구가 많음.
주요 벤치마크 툴
llama-benchy (⭐5)
- llama-bench 스타일 측정을 모든 OpenAI 호환 엔드포인트(vLLM, SGLang, llama-server 등)에 적용
- 탄생 배경: llama-bench는 llama.cpp 전용, vLLM 벤치 도구는 컨텍스트 깊이별 pp 측정 불가 + TTFT가 실제 첫 토큰이 아닌 첫 데이터 청크 기준
- 기능: 컨텍스트 깊이별 pp/tg 속도, TTFR[경로], MTP 청크 처리, Gutenberg 도서 기반 실제 문장 프롬프트(스펙 디코딩 측정 정확도↑), --concurrency, Markdown[경로] 출력, warmup 후 코히어런스 테스트
- 설치:
uvx llama-benchy --base-url <엔드포인트> --model <모델>
llama-benchy-viz-tui (⭐6) + llama-benchy-viz-web (⭐4)
- llama-benchy --emit-progress JSONL 스트림을 실시간 대시보드로 렌더링
- TUI 4모드: live-single / live-race(2~4모델 동시 비교) / static-single / static-race
- 파이프 연결:
llama-benchy --emit-progress - ... | llama-benchy-viz-tui - 아키텍처: ingest[경로] 4계층 (웹 렌더러 확장 가능)
llama-throughput-lab (⭐440)
- llama.cpp server 스루풋 테스트/스윕 dialog 런처
- 테스트: 단일경로, 스윕: 스레드[경로]
- GGUF 모델 자동 탐지(./models, [로컬], LM Studio 캐시), llama-server 자동 탐지
draftbench (⭐171)
- 스펙큘레이티브 디코딩 드래프트 모델 최적화: 타겟 × 드래프트 전 조합 자동 테스트
- 벤치 결과: 느린 타겟(72B Q8_0 @6 tok/s) +80% 속도향상, 빠른 타겟(72B Q4_K_M) +12%, 스윗스팟 3B Q4_K_M
- Qwen2.5 계열 GGUF, Plotly.js 인터랙티브 차트
machine_tests (⭐95)
- 하드웨어/LLM 종합 테스트 모음. 핵심은
ml/auto_prompter(LLM Performance Tester):
- 프롬프트 파일 → tok/s 측정, 통계 테스트(신뢰구간, 이상치, CV), CSV 저장
- config_dgxspark.json 포함 — DGX Spark (GB10, 128GB, vLLM + Qwen3-Coder-30B-A3B bf16) 대상 설정 존재
- 결과 폴더에 dgx_spark 실측 데이터 존재 (gpt_oss_20b fp4 TRT-LLM, qwen3_coder_30b bf16 vLLM)
- 기타: battery 드레인, benchmarksgame, diskcopy, STREAM 메모리, llama_bencher, mlx_bencher, lmstudio_model_enum_test, dotnet 빌드 벤치
apple-fm-bench (⭐8)
- macOS 27+ 내장 fm CLI 전용. 표준 벤치 툴이 fm serve에서 ~600K tok/s 가짜 수치를 내는 문제 해결
- pp = TTFT-프롬프트 길이 기울기, decode = 실질 생성 구간 타이밍, 토큰 수는 fm token-count
agents 다중 테스트 관련
"agents 다중 테스트"로 직접 명명된 벤치마크 툴은 레포에서 확인되지 않음 (2026-07-31 기준). 가장 가까운 관련 내용:
- codeneedle (⭐303) — Positional Recall Benchmark. 108K 토큰 실제 코드 파일을 컨텍스트에 넣고 특정 함수의 첫 20줄을 그대로 재현시키는 장문맥 위치 기억력 테스트. NIAH(바늘 건초더미)의 변형 — 반복 보일러플레이트 코드로 표면 유사성 차단. Gemma 1K sliding-window 주의 collapse vs Qwen gated DeltaNet 유지 같은 아키텍처 취약점 노출. llama.cpp 서버 + 8bit KV 캐시 + 온도 0, 프롬프트 캐싱으로 16개 쿼리 공정 비교. run-missing.py 오케스트레이터: 모델 × 코퍼스 조합을 순차 실행, 로컬 모델은 LM Studio load/unload 자동 처리 (128K 컨텍스트, --dry-run 지원)
- mlx_nanocode (⭐5) — MLX 기반 최소 Claude Code 대안. read[경로] 툴 에이전트 루프
- model-shelf (⭐125) — AI 에이전트/스크립트용 로컬 퍼스트 모델 리졸버 (GGUF[경로])
- mlx-jaccl-cluster (⭐219) — Thunderbolt RDMA 기반 멀티 Mac MLX 클러스터 + OpenAI 호환 서버 + 분산 tok/s 벤치
- parallax (⭐7) — GradientHQ 분산 추론 포크 (SGLang/MLX 백엔드)
DGX Spark 활용 관점
- llama-throughput-lab: 스레드/동시성 스윕이 기존 멀티퀀트 벤치 파이프라인과 겹침
- draftbench: 스펙 디코딩 조합 탐색에 유용
- auto_prompter: DGX Spark 전용 config 이미 존재 — vLLM + Qwen3-Coder-30B-A3B bf16 설정 즉시 사용 가능
로컬 설치 (2026-07-31)
- 설치 위치: `[로컬] — 4개 레포 git clone (llama-benchy, llama-benchy-viz-tui, llama-benchy-viz-web, llama-throughput-lab)
- 설치 완료: llama-benchy 0.1.dev1 / viz-tui / viz-web (각각
.venv+uv pip install -e .) - 한방 실행 스크립트: `[로컬]
- 모드: quick(스모크) / full(깊이 스윕+prefix caching) / tui(라이브 대시보드) / web(웹 대시보드) / race(2~4모델 동시 비교) / throughput(llama-throughput-lab 직접)
- 결과 저장: `[로컬] (JSON + 타임스탬프)
- mock 서버(8001)로 quick/tui 모드 실검증 완료
- 상세 사용법: `[로컬]
- llama-throughput-lab 런처용
dialog(1.3) + 라운드로빈용nginx(1.24) 설치 완료 (2026-07-31), venv 생성 완료 (표준 라이브러리만 사용) - llama-server: `[로컬]