Public Benchmark Release 2026-09-18

DGX Spark GB10 — Local LLM Benchmark

Gemma4, Laguna S 2.1, Laguna XS 2.1, Ling 3.0 Flash, N2 Mini, N2.5 Mini, North Mini, Occamy 1.0, Ornith 1.5, Qwen3.6 35B-A3B, Qwen3.8 Flash Next의 여러 GGUF·quantization·MTP variant를 llama.cpp에서 실행하고, 속도부터 내부·외부 툴 사용과 에이전트 작업까지 8개 항목으로 비교했습니다.

표준 suite 밖의 개별 측정과 심층 분석은 Custom Benchmarks에서 확인할 수 있습니다 →

테스트한 모델군

Model comparison matrix

정렬
Model / VariantPerformanceServerKnowledgeCodingTool-callExternal tool-evalAgent-singleAgent-multi
Gemma4
NVFP4 · NVFP4
non-MTP
PP 2609.5 t/sTG 37.4 t/s
c1 36.1 t/sc8 175.4 t/s
98%98/100
33.3%4/12
73.3%11/15
100%12/12
70%7/10
Gemma4
Q4_0 · Q4_0
non-MTP
PP 2516.3 t/sTG 51.7 t/s
c1 49.7 t/sc8 193.0 t/s
98%98/100
25%3/12
80%12/15
100%12/12
70%7/10
Laguna S 2.1
APEX-I Balanced · NVFP4
non-MTP
PP 702.2 t/sTG 27.6 t/s
c1 26.8 t/sc8 72.9 t/s
88%88/100
91.7%11/12
86.7%13/15
86 / 10069/69 scored
50%6/12
70%7/10
Laguna XS 2.1
Q4_K_M · Q4_K_M
non-MTP
PP 1915.7 t/sTG 84.2 t/s
c1 79.2 t/sc8 283.0 t/s
85%85/100
100%12/12
86.7%13/15
86 / 10069/69 scored
50%6/12
90%9/10
Laguna XS 2.1
Q5_K_M · Q5_K_M
non-MTP
PP 1838.1 t/sTG 76.8 t/s
c1 72.3 t/sc8 283.9 t/s
88%88/100
100%12/12
86.7%13/15
88 / 10069/69 scored
50%6/12
90%9/10
Laguna XS 2.1
Q6_K_L · Q6_K_L
non-MTP
PP 1675.3 t/sTG 68.2 t/s
c1 64.6 t/sc8 203.3 t/s
88%88/100
100%12/12
86.7%13/15
88 / 10069/69 scored
41.7%5/12
90%9/10
Laguna XS 2.1
Q8_0 · Q8_0
non-MTP
PP 1705.0 t/sTG 65.1 t/s
c1 62.1 t/sc8 177.6 t/s
84%84/100
100%12/12
86.7%13/15
87 / 10069/69 scored
41.7%5/12
90%9/10
Ling 3.0 Flash
Heretic MXFP4 · MXFP4_MOE
MTP
PP 1022.0 t/sTG 28.8 t/s
c1 41.0 t/sc8 101.7 t/s
99%99/100
100%12/12
80%12/15
91.7%11/12
80%8/10
N2 Mini
Q5_K_M · Q5_K_M
non-MTP
PP 1732.2 t/sTG 64.1 t/s
c1 60.5 t/sc8 171.0 t/s
92%92/100
75%9/12
53.3%8/15
82 / 10065/69 scored
50%6/12
60%6/10
N2 Mini
Q6_K · Q6_K
non-MTP
PP 1565.1 t/sTG 58.7 t/s
c1 55.4 t/sc8 157.4 t/s
93%93/100
66.7%8/12
53.3%8/15
82 / 10065/69 scored
66.7%8/12
90%9/10
N2 Mini
UD-Q4 · UD-Q4
non-MTP
PP 1808.5 t/sTG 63.8 t/s
c1 60.0 t/sc8 180.4 t/s
91%91/100
83.3%10/12
60%9/15
85 / 10065/69 scored
58.3%7/12
50%5/10
N2 Mini
UD-Q5XL · UD-Q5XL
non-MTP
PP 1691.7 t/sTG 59.4 t/s
c1 56.5 t/sc8 162.9 t/s
93%93/100
75%9/12
60%9/15
85 / 10065/69 scored
75%9/12
70%7/10
N2.5 Mini
Q4_K_M · Q4_K_M
non-MTP
PP 1862.0 t/sTG 81.9 t/s
c1 76.2 t/sc8 164.9 t/s
93%93/100
91.7%11/12
66.7%10/15
88 / 10065/69 scored
66.7%8/12
90%9/10
N2.5 Mini
Q5_K_M · Q5_K_M
non-MTP
PP 1794.0 t/sTG 74.4 t/s
c1 70.5 t/sc8 165.5 t/s
94%94/100
91.7%11/12
80%12/15
90 / 10065/69 scored
58.3%7/12
100%10/10
N2.5 Mini
Q6_K · Q6_K
non-MTP
PP 1587.2 t/sTG 67.5 t/s
c1 64.0 t/sc8 142.4 t/s
95%95/100
91.7%11/12
80%12/15
91 / 10065/69 scored
66.7%8/12
100%10/10
N2.5 Mini
Q8_0 · Q8_0
non-MTP
PP 1619.9 t/sTG 44.2 t/s
c1 56.0 t/sc8 126.6 t/s
94%94/100
91.7%11/12
80%12/15
90 / 10065/69 scored
66.7%8/12
90%9/10
North Mini
MXFP4 · MXFP4
non-MTP
PP 2454.9 t/sTG 68.8 t/s
c1 69.2 t/sc8 269.9 t/s
88%88/100
91.7%11/12
80%12/15
83.3%10/12
70%7/10
North Mini
UD-Q4 · UD-Q4
non-MTP
PP 2299.1 t/sTG 71.7 t/s
c1 68.5 t/sc8 299.8 t/s
90%90/100
100%12/12
60%9/15
91.7%11/12
70%7/10
North Mini
UD-Q5 · UD-Q5
non-MTP
PP 2127.3 t/sTG 66.0 t/s
c1 63.4 t/sc8 272.3 t/s
93%93/100
91.7%11/12
80%12/15
91.7%11/12
70%7/10
North Mini
UD-Q6 · UD-Q6
non-MTP
PP 1969.3 t/sTG 60.8 t/s
c1 58.3 t/sc8 250.7 t/s
92%92/100
91.7%11/12
73.3%11/15
91.7%11/12
80%8/10
Occamy 1.0
Q4_K_M · Q4_K_M
non-MTP
PP 1953.5 t/sTG 80.6 t/s
c1 76.3 t/sc8 202.6 t/s
94%94/100
100%12/12
73.3%11/15
87 / 10065/69 scored
66.7%8/12
60%6/10
Occamy 1.0
Q5_K_M · Q5_K_M
non-MTP
PP 1854.7 t/sTG 73.7 t/s
c1 68.8 t/sc8 192.5 t/s
95%95/100
91.7%11/12
73.3%11/15
85 / 10065/69 scored
75%9/12
90%9/10
Occamy 1.0
Q6_K · Q6_K
non-MTP
PP 1659.0 t/sTG 66.8 t/s
c1 63.6 t/sc8 161.2 t/s
96%96/100
100%12/12
73.3%11/15
86 / 10065/69 scored
66.7%8/12
100%10/10
Occamy 1.0
Q8_0 · Q8_0
non-MTP
PP 1734.0 t/sTG 58.8 t/s
c1 56.6 t/sc8 152.1 t/s
96%96/100
91.7%11/12
73.3%11/15
86 / 10065/69 scored
75%9/12
90%9/10
Ornith 1.5
Q5_K_M · Q5_K_M
MTP
PP 1634.9 t/sTG 64.5 t/s
c1 68.3 t/sc8 164.1 t/s
92%92/100
75%9/12
73.3%11/15
66.7%8/12
80%8/10
Ornith 1.5
Q6_K · Q6_K
MTP
PP 1432.1 t/sTG 57.9 t/s
c1 62.4 t/sc8 154.5 t/s
94%94/100
75%9/12
73.3%11/15
83.3%10/12
80%8/10
Ornith 1.5
Q8_0 · Q8_0
MTP
PP 1726.7 t/sTG 57.8 t/s
c1 60.3 t/sc8 158.1 t/s
93%93/100
83.3%10/12
73.3%11/15
75%9/12
90%9/10
Qwen3.6 35B-A3B
APEX · APEX
non-MTP
PP 1829.5 t/sTG 68.5 t/s
c1 64.4 t/sc8 195.3 t/s
95%95/100
83.3%10/12
73.3%11/15
75%9/12
90%9/10
Qwen3.6 35B-A3B
HQ · NVFP4 MTP HQ
MTP
PP 2091.6 t/sTG 68.7 t/s
c1 87.1 t/sc8 201.8 t/s
94%94/100
83.3%10/12
73.3%11/15
91.7%11/12
80%8/10
Qwen3.6 35B-A3B
Q8 · Q8
non-MTP
PP 1779.2 t/sTG 58.7 t/s
c1 55.1 t/sc8 182.6 t/s
95%95/100
91.7%11/12
66.7%10/15
75%9/12
90%9/10
Qwen3.6 35B-A3B
TURBO · TURBO
MTP
PP 2241.2 t/sTG 77.2 t/s
c1 87.0 t/sc8 217.3 t/s
94%94/100
91.7%11/12
73.3%11/15
58.3%7/12
80%8/10
Qwen3.8 Flash Next
UD-IQ4_XS · UD-IQ4_XS
non-MTP
PP 280.1 t/sTG 25.8 t/s
c1 26.8 t/sc8 93.7 t/s
98%98/100
83.3%10/12
66.7%10/15
33.3%4/12
40%4/10

각 항목은 무엇을 보나요? Suite guide

Performance

모델이 얼마나 빠르게 프롬프트를 읽고 답변을 생성하는지 봅니다. llama-bench를 이용해 prompt processing(PP)과 text generation(TG)을 측정합니다.

  • PP: 512 / 2K / 8K / 32K tokens
  • TG: 512 tokens
  • 단위: tokens/s
  • 정답률이나 지능이 아니라 같은 GB10에서의 순수 실행 속도에 가까운 microbenchmark입니다.

Server-performance

llama-server에 실제로 여러 요청이 동시에 들어왔을 때 얼마나 잘 처리하는지 봅니다.

  • Concurrency 1, 2, 4, 8
  • aggregate throughput · per-request throughput
  • p50 / p95 latency · failure rate
  • Performance가 모델 자체의 순수 속도에 가깝다면, Server-performance는 API 서버처럼 사용할 때의 처리 능력에 더 가깝습니다.

Knowledge

일반 지식, 한국, 수학, 과학, 논리 문제를 얼마나 정확하게 푸는지 봅니다. 총 100문제를 5개 분야로 나눴습니다.

  • General · Korea · Math · Science · Logic
  • 각 분야 20문제, easy / medium / hard 포함
  • LLM judge 없이 multiple choice / numeric / exact match deterministic scoring
  • MMLU를 대체하려는 목적이 아니라, 같은 조건에서 로컬 모델의 기본 정확도 차이를 보기 위한 고정 dataset입니다.

Coding

모델이 실제로 실행 가능한 Python 코드를 만들 수 있는지 봅니다. 생성한 코드를 파일로 저장한 뒤 pytest를 실행합니다.

  • 12개의 작은 함수 구현 문제
  • prime 판정 · 문자열 처리 · 리스트 중복 제거
  • 빈도 계산 · clamp · chunk 처리
  • 설명을 잘하는지보다 실제로 테스트를 통과하는 코드를 생성했는지에 초점을 둡니다. 대규모 repository 수정 benchmark는 아닙니다.

Tool-call

필요한 도구를 골라 올바른 방식으로 호출할 수 있는지 봅니다. 고정된 tool simulator 안에서 도구 선택부터 최종 완료까지 확인합니다.

  • single tool · tool selection · multi-step tool use · recovery · no-tool
  • tool 선택 · argument · 실행 성공 · 최종 task completion
  • OpenCode, Claude Code, Codex 같은 특정 agent framework 전체 성능을 의미하지 않습니다.

External tool-eval-bench

외부 tool-eval-bench의 표준 시나리오를 같은 llama.cpp 계열 환경에서 실행해, 더 긴 tool-use trace와 안전 경계를 확인합니다.

  • 표준 69개 시나리오 · deterministic mock tool
  • 도구 선택 · 인자 · multi-step chain · recovery · safety · structured output
  • 현재 N2/N2.5 Mini 8개, Occamy 1.0 4개, Laguna S 2.1 1개, Laguna XS 2.1 4개 variant를 측정했으며, 내부 Tool-call v1.1과 다른 protocol입니다.

Agent-single

하나의 agent가 여러 단계를 이어서 최종 작업을 끝낼 수 있는지 봅니다. 조회, 계산, 파일 사용, 최종 답변이 이어지는 작업을 평가합니다.

  • 중간 tool call 실패 뒤 회복하면 최종 성공으로 인정
  • 실패한 호출 자체는 별도 metric으로 기록
  • 첫 시도의 완벽함보다 작업을 끝까지 완료하는 능력에 가깝습니다.

Agent-multi

역할을 나누고 결과를 handoff하면서 여러 단계의 작업을 완료할 수 있는지 봅니다. 현재 evaluator에서는 Researcher와 Calculator 역할을 사용합니다.

  • task completion · role participation · handoff success
  • required dependency · tool execution · final answer
  • 실제 조직처럼 협업하는 여러 독립 AI 직원 전체가 아니라, 이번 release에서 정의한 role/tool handoff protocol 안의 결과입니다.

이 결과를 볼 때 참고할 점 Limitations

  • 이 benchmark는 DGX Spark GB10 + llama.cpp + 공개된 고정 recipe에서 나온 결과입니다. 다른 GPU, runtime, prompt format에서는 결과가 달라질 수 있습니다.
  • 같은 기반 모델이라도 quantization에 따라 속도와 evaluator 결과가 달라질 수 있어, 기반 모델명과 실제 variant·quantization을 함께 표시했습니다.
  • Tool-call과 Agent 계열은 고정된 synthetic protocol을 사용하므로 OpenCode, Claude Code, Codex 같은 실제 개발 환경의 체감과 정확히 같지는 않을 수 있습니다.
  • External tool-eval-bench는 내부 Tool-call v1.1과 다른 69-scenario protocol입니다. 각 run의 실제 채점 분모를 표시하며, 기존 N2/N2.5 Mini와 Occamy 1.0 run은 grammar 오류 4건을 제외한 65개, Laguna S 2.1과 Laguna XS 2.1은 각각 69개를 채점했습니다.
  • External tool-eval-bench는 현재 N2/N2.5 Mini 8개, Occamy 1.0 4개, Laguna S 2.1 1개, Laguna XS 2.1 4개 variant에서 측정되었으며, 나머지 모델의 빈 칸은 0점이 아니라 아직 측정하지 않은 상태입니다.
  • Knowledge 100문제는 모델의 모든 지식을 대표하는 절대적인 지능 점수가 아니라, 같은 조건에서 모델 간 차이를 비교하기 위한 고정 dataset입니다.
  • 서로 다른 8개 suite를 억지로 합친 종합 점수는 만들지 않았습니다. 필요한 작업에 맞춰 항목별로 비교하는 것이 더 유용합니다.

데이터 다운로드와 재현성

사람이 보는 비교표와 같은 release를 machine-readable JSON으로도 공개합니다. JSON을 이용하면 모델별 비교, quantization 비교, suite별 ranking, 별도 chart와 후속 분석을 직접 만들 수 있습니다.

이번 공개 데이터는 특정 시점의 immutable release snapshot입니다. 같은 release ID의 수치를 나중에 조용히 수정하지 않고, 변경이 필요하면 새로운 revision 또는 release로 발행합니다.

한 줄로 정리하면

이 페이지는 “어떤 LLM이 세상에서 가장 좋은가”를 정하기 위한 leaderboard가 아닙니다.

DGX Spark GB10에서 실제 GGUF 모델들을 같은 조건으로 돌렸을 때, 각각 어떤 속도와 작업 성향을 보였는지 기록한 공개 benchmark입니다.

빠른 모델, 코딩을 잘하는 모델, tool 사용이 좋은 모델, agent task completion이 좋은 모델이 서로 다를 수 있습니다. 필요한 작업에 맞춰 원하는 항목을 직접 비교해보시면 됩니다.