Knowledge 목록으로

llama-throughput-lab / draftbench

🔍 조사 완료📊 벤치마크 · 도구2026년 7월 30일3
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록

개요

스루풋 테스트 / 스펙큘레이티브 디코딩 최적화

메모

"적용 검토 가능"까지 확인, 미적용

조사 상세

alexziskind1 LLM 벤치마크 툴셋

개요

GitHub 사용자 alexziskind1이 운영하는 LLM 벤치마크/로컬 AI 툴 모음. llama.cpp 기반 로컬 추론 벤치마크에 특화되어 있으며, 같은 로컬 하드웨어에서 바로 활용 가능한 도구가 많음.

주요 벤치마크 툴

llama-benchy (⭐5)

  • llama-bench 스타일 측정을 모든 OpenAI 호환 엔드포인트(vLLM, SGLang, llama-server 등)에 적용
  • 탄생 배경: llama-bench는 llama.cpp 전용, vLLM 벤치 도구는 컨텍스트 깊이별 pp 측정 불가 + TTFT가 실제 첫 토큰이 아닌 첫 데이터 청크 기준
  • 기능: 컨텍스트 깊이별 pp/tg 속도, TTFR[경로], MTP 청크 처리, Gutenberg 도서 기반 실제 문장 프롬프트(스펙 디코딩 측정 정확도↑), --concurrency, Markdown[경로] 출력, warmup 후 코히어런스 테스트
  • 설치: uvx llama-benchy --base-url <엔드포인트> --model <모델>

llama-benchy-viz-tui (⭐6) + llama-benchy-viz-web (⭐4)

  • llama-benchy --emit-progress JSONL 스트림을 실시간 대시보드로 렌더링
  • TUI 4모드: live-single / live-race(2~4모델 동시 비교) / static-single / static-race
  • 파이프 연결: llama-benchy --emit-progress - ... | llama-benchy-viz-tui
  • 아키텍처: ingest[경로] 4계층 (웹 렌더러 확장 가능)

llama-throughput-lab (⭐440)

  • llama.cpp server 스루풋 테스트/스윕 dialog 런처
  • 테스트: 단일경로, 스윕: 스레드[경로]
  • GGUF 모델 자동 탐지(./models, [로컬], LM Studio 캐시), llama-server 자동 탐지

draftbench (⭐171)

  • 스펙큘레이티브 디코딩 드래프트 모델 최적화: 타겟 × 드래프트 전 조합 자동 테스트
  • 벤치 결과: 느린 타겟(72B Q8_0 @6 tok/s) +80% 속도향상, 빠른 타겟(72B Q4_K_M) +12%, 스윗스팟 3B Q4_K_M
  • Qwen2.5 계열 GGUF, Plotly.js 인터랙티브 차트

machine_tests (⭐95)

  • 하드웨어/LLM 종합 테스트 모음. 핵심은 ml/auto_prompter (LLM Performance Tester):

- 프롬프트 파일 → tok/s 측정, 통계 테스트(신뢰구간, 이상치, CV), CSV 저장

- config_dgxspark.json 포함 — DGX Spark (GB10, 128GB, vLLM + Qwen3-Coder-30B-A3B bf16) 대상 설정 존재

- 결과 폴더에 dgx_spark 실측 데이터 존재 (gpt_oss_20b fp4 TRT-LLM, qwen3_coder_30b bf16 vLLM)

  • 기타: battery 드레인, benchmarksgame, diskcopy, STREAM 메모리, llama_bencher, mlx_bencher, lmstudio_model_enum_test, dotnet 빌드 벤치

apple-fm-bench (⭐8)

  • macOS 27+ 내장 fm CLI 전용. 표준 벤치 툴이 fm serve에서 ~600K tok/s 가짜 수치를 내는 문제 해결
  • pp = TTFT-프롬프트 길이 기울기, decode = 실질 생성 구간 타이밍, 토큰 수는 fm token-count

agents 다중 테스트 관련

"agents 다중 테스트"로 직접 명명된 벤치마크 툴은 레포에서 확인되지 않음 (2026-07-31 기준). 가장 가까운 관련 내용:

  • codeneedle (⭐303) — Positional Recall Benchmark. 108K 토큰 실제 코드 파일을 컨텍스트에 넣고 특정 함수의 첫 20줄을 그대로 재현시키는 장문맥 위치 기억력 테스트. NIAH(바늘 건초더미)의 변형 — 반복 보일러플레이트 코드로 표면 유사성 차단. Gemma 1K sliding-window 주의 collapse vs Qwen gated DeltaNet 유지 같은 아키텍처 취약점 노출. llama.cpp 서버 + 8bit KV 캐시 + 온도 0, 프롬프트 캐싱으로 16개 쿼리 공정 비교. run-missing.py 오케스트레이터: 모델 × 코퍼스 조합을 순차 실행, 로컬 모델은 LM Studio load/unload 자동 처리 (128K 컨텍스트, --dry-run 지원)
  • mlx_nanocode (⭐5) — MLX 기반 최소 Claude Code 대안. read[경로] 툴 에이전트 루프
  • model-shelf (⭐125) — AI 에이전트/스크립트용 로컬 퍼스트 모델 리졸버 (GGUF[경로])
  • mlx-jaccl-cluster (⭐219) — Thunderbolt RDMA 기반 멀티 Mac MLX 클러스터 + OpenAI 호환 서버 + 분산 tok/s 벤치
  • parallax (⭐7) — GradientHQ 분산 추론 포크 (SGLang/MLX 백엔드)

DGX Spark 활용 관점

  • llama-throughput-lab: 스레드/동시성 스윕이 기존 멀티퀀트 벤치 파이프라인과 겹침
  • draftbench: 스펙 디코딩 조합 탐색에 유용
  • auto_prompter: DGX Spark 전용 config 이미 존재 — vLLM + Qwen3-Coder-30B-A3B bf16 설정 즉시 사용 가능

로컬 설치 (2026-07-31)

  • 설치 위치: `[로컬] — 4개 레포 git clone (llama-benchy, llama-benchy-viz-tui, llama-benchy-viz-web, llama-throughput-lab)
  • 설치 완료: llama-benchy 0.1.dev1 / viz-tui / viz-web (각각 .venv + uv pip install -e .)
  • 한방 실행 스크립트: `[로컬]

- 모드: quick(스모크) / full(깊이 스윕+prefix caching) / tui(라이브 대시보드) / web(웹 대시보드) / race(2~4모델 동시 비교) / throughput(llama-throughput-lab 직접)

- 결과 저장: `[로컬] (JSON + 타임스탬프)

- mock 서버(8001)로 quick/tui 모드 실검증 완료

  • 상세 사용법: `[로컬]
  • llama-throughput-lab 런처용 dialog(1.3) + 라운드로빈용 nginx(1.24) 설치 완료 (2026-07-31), venv 생성 완료 (표준 라이브러리만 사용)
  • llama-server: `[로컬]