DGX Spark GB10 — Local LLM Benchmark
Gemma4, Laguna S 2.1, Laguna XS 2.1, Ling 3.0 Flash, N2 Mini, N2.5 Mini, North Mini, Occamy 1.0, Ornith 1.5, Qwen3.6 35B-A3B, Qwen3.8 Flash Next의 여러 GGUF·quantization·MTP variant를 llama.cpp에서 실행하고, 속도부터 내부·외부 툴 사용과 에이전트 작업까지 8개 항목으로 비교했습니다.
표준 suite 밖의 개별 측정과 심층 분석은 Custom Benchmarks에서 확인할 수 있습니다 →
테스트한 모델군
Model comparison matrix
| Model / Variant | Performance | Server | Knowledge | Coding | Tool-call | External tool-eval | Agent-single | Agent-multi |
|---|---|---|---|---|---|---|---|---|
| Gemma4 NVFP4 · NVFP4 non-MTP | PP 2609.5 t/sTG 37.4 t/s | c1 36.1 t/sc8 175.4 t/s | 98%98/100 | 33.3%4/12 | 73.3%11/15 | — | 100%12/12 | 70%7/10 |
| Gemma4 Q4_0 · Q4_0 non-MTP | PP 2516.3 t/sTG 51.7 t/s | c1 49.7 t/sc8 193.0 t/s | 98%98/100 | 25%3/12 | 80%12/15 | — | 100%12/12 | 70%7/10 |
| Laguna S 2.1 APEX-I Balanced · NVFP4 non-MTP | PP 702.2 t/sTG 27.6 t/s | c1 26.8 t/sc8 72.9 t/s | 88%88/100 | 91.7%11/12 | 86.7%13/15 | 86 / 10069/69 scored | 50%6/12 | 70%7/10 |
| Laguna XS 2.1 Q4_K_M · Q4_K_M non-MTP | PP 1915.7 t/sTG 84.2 t/s | c1 79.2 t/sc8 283.0 t/s | 85%85/100 | 100%12/12 | 86.7%13/15 | 86 / 10069/69 scored | 50%6/12 | 90%9/10 |
| Laguna XS 2.1 Q5_K_M · Q5_K_M non-MTP | PP 1838.1 t/sTG 76.8 t/s | c1 72.3 t/sc8 283.9 t/s | 88%88/100 | 100%12/12 | 86.7%13/15 | 88 / 10069/69 scored | 50%6/12 | 90%9/10 |
| Laguna XS 2.1 Q6_K_L · Q6_K_L non-MTP | PP 1675.3 t/sTG 68.2 t/s | c1 64.6 t/sc8 203.3 t/s | 88%88/100 | 100%12/12 | 86.7%13/15 | 88 / 10069/69 scored | 41.7%5/12 | 90%9/10 |
| Laguna XS 2.1 Q8_0 · Q8_0 non-MTP | PP 1705.0 t/sTG 65.1 t/s | c1 62.1 t/sc8 177.6 t/s | 84%84/100 | 100%12/12 | 86.7%13/15 | 87 / 10069/69 scored | 41.7%5/12 | 90%9/10 |
| Ling 3.0 Flash Heretic MXFP4 · MXFP4_MOE MTP | PP 1022.0 t/sTG 28.8 t/s | c1 41.0 t/sc8 101.7 t/s | 99%99/100 | 100%12/12 | 80%12/15 | — | 91.7%11/12 | 80%8/10 |
| N2 Mini Q5_K_M · Q5_K_M non-MTP | PP 1732.2 t/sTG 64.1 t/s | c1 60.5 t/sc8 171.0 t/s | 92%92/100 | 75%9/12 | 53.3%8/15 | 82 / 10065/69 scored | 50%6/12 | 60%6/10 |
| N2 Mini Q6_K · Q6_K non-MTP | PP 1565.1 t/sTG 58.7 t/s | c1 55.4 t/sc8 157.4 t/s | 93%93/100 | 66.7%8/12 | 53.3%8/15 | 82 / 10065/69 scored | 66.7%8/12 | 90%9/10 |
| N2 Mini UD-Q4 · UD-Q4 non-MTP | PP 1808.5 t/sTG 63.8 t/s | c1 60.0 t/sc8 180.4 t/s | 91%91/100 | 83.3%10/12 | 60%9/15 | 85 / 10065/69 scored | 58.3%7/12 | 50%5/10 |
| N2 Mini UD-Q5XL · UD-Q5XL non-MTP | PP 1691.7 t/sTG 59.4 t/s | c1 56.5 t/sc8 162.9 t/s | 93%93/100 | 75%9/12 | 60%9/15 | 85 / 10065/69 scored | 75%9/12 | 70%7/10 |
| N2.5 Mini Q4_K_M · Q4_K_M non-MTP | PP 1862.0 t/sTG 81.9 t/s | c1 76.2 t/sc8 164.9 t/s | 93%93/100 | 91.7%11/12 | 66.7%10/15 | 88 / 10065/69 scored | 66.7%8/12 | 90%9/10 |
| N2.5 Mini Q5_K_M · Q5_K_M non-MTP | PP 1794.0 t/sTG 74.4 t/s | c1 70.5 t/sc8 165.5 t/s | 94%94/100 | 91.7%11/12 | 80%12/15 | 90 / 10065/69 scored | 58.3%7/12 | 100%10/10 |
| N2.5 Mini Q6_K · Q6_K non-MTP | PP 1587.2 t/sTG 67.5 t/s | c1 64.0 t/sc8 142.4 t/s | 95%95/100 | 91.7%11/12 | 80%12/15 | 91 / 10065/69 scored | 66.7%8/12 | 100%10/10 |
| N2.5 Mini Q8_0 · Q8_0 non-MTP | PP 1619.9 t/sTG 44.2 t/s | c1 56.0 t/sc8 126.6 t/s | 94%94/100 | 91.7%11/12 | 80%12/15 | 90 / 10065/69 scored | 66.7%8/12 | 90%9/10 |
| North Mini MXFP4 · MXFP4 non-MTP | PP 2454.9 t/sTG 68.8 t/s | c1 69.2 t/sc8 269.9 t/s | 88%88/100 | 91.7%11/12 | 80%12/15 | — | 83.3%10/12 | 70%7/10 |
| North Mini UD-Q4 · UD-Q4 non-MTP | PP 2299.1 t/sTG 71.7 t/s | c1 68.5 t/sc8 299.8 t/s | 90%90/100 | 100%12/12 | 60%9/15 | — | 91.7%11/12 | 70%7/10 |
| North Mini UD-Q5 · UD-Q5 non-MTP | PP 2127.3 t/sTG 66.0 t/s | c1 63.4 t/sc8 272.3 t/s | 93%93/100 | 91.7%11/12 | 80%12/15 | — | 91.7%11/12 | 70%7/10 |
| North Mini UD-Q6 · UD-Q6 non-MTP | PP 1969.3 t/sTG 60.8 t/s | c1 58.3 t/sc8 250.7 t/s | 92%92/100 | 91.7%11/12 | 73.3%11/15 | — | 91.7%11/12 | 80%8/10 |
| Occamy 1.0 Q4_K_M · Q4_K_M non-MTP | PP 1953.5 t/sTG 80.6 t/s | c1 76.3 t/sc8 202.6 t/s | 94%94/100 | 100%12/12 | 73.3%11/15 | 87 / 10065/69 scored | 66.7%8/12 | 60%6/10 |
| Occamy 1.0 Q5_K_M · Q5_K_M non-MTP | PP 1854.7 t/sTG 73.7 t/s | c1 68.8 t/sc8 192.5 t/s | 95%95/100 | 91.7%11/12 | 73.3%11/15 | 85 / 10065/69 scored | 75%9/12 | 90%9/10 |
| Occamy 1.0 Q6_K · Q6_K non-MTP | PP 1659.0 t/sTG 66.8 t/s | c1 63.6 t/sc8 161.2 t/s | 96%96/100 | 100%12/12 | 73.3%11/15 | 86 / 10065/69 scored | 66.7%8/12 | 100%10/10 |
| Occamy 1.0 Q8_0 · Q8_0 non-MTP | PP 1734.0 t/sTG 58.8 t/s | c1 56.6 t/sc8 152.1 t/s | 96%96/100 | 91.7%11/12 | 73.3%11/15 | 86 / 10065/69 scored | 75%9/12 | 90%9/10 |
| Ornith 1.5 Q5_K_M · Q5_K_M MTP | PP 1634.9 t/sTG 64.5 t/s | c1 68.3 t/sc8 164.1 t/s | 92%92/100 | 75%9/12 | 73.3%11/15 | — | 66.7%8/12 | 80%8/10 |
| Ornith 1.5 Q6_K · Q6_K MTP | PP 1432.1 t/sTG 57.9 t/s | c1 62.4 t/sc8 154.5 t/s | 94%94/100 | 75%9/12 | 73.3%11/15 | — | 83.3%10/12 | 80%8/10 |
| Ornith 1.5 Q8_0 · Q8_0 MTP | PP 1726.7 t/sTG 57.8 t/s | c1 60.3 t/sc8 158.1 t/s | 93%93/100 | 83.3%10/12 | 73.3%11/15 | — | 75%9/12 | 90%9/10 |
| Qwen3.6 35B-A3B APEX · APEX non-MTP | PP 1829.5 t/sTG 68.5 t/s | c1 64.4 t/sc8 195.3 t/s | 95%95/100 | 83.3%10/12 | 73.3%11/15 | — | 75%9/12 | 90%9/10 |
| Qwen3.6 35B-A3B HQ · NVFP4 MTP HQ MTP | PP 2091.6 t/sTG 68.7 t/s | c1 87.1 t/sc8 201.8 t/s | 94%94/100 | 83.3%10/12 | 73.3%11/15 | — | 91.7%11/12 | 80%8/10 |
| Qwen3.6 35B-A3B Q8 · Q8 non-MTP | PP 1779.2 t/sTG 58.7 t/s | c1 55.1 t/sc8 182.6 t/s | 95%95/100 | 91.7%11/12 | 66.7%10/15 | — | 75%9/12 | 90%9/10 |
| Qwen3.6 35B-A3B TURBO · TURBO MTP | PP 2241.2 t/sTG 77.2 t/s | c1 87.0 t/sc8 217.3 t/s | 94%94/100 | 91.7%11/12 | 73.3%11/15 | — | 58.3%7/12 | 80%8/10 |
| Qwen3.8 Flash Next UD-IQ4_XS · UD-IQ4_XS non-MTP | PP 280.1 t/sTG 25.8 t/s | c1 26.8 t/sc8 93.7 t/s | 98%98/100 | 83.3%10/12 | 66.7%10/15 | — | 33.3%4/12 | 40%4/10 |
각 항목은 무엇을 보나요? Suite guide
Performance
모델이 얼마나 빠르게 프롬프트를 읽고 답변을 생성하는지 봅니다. llama-bench를 이용해 prompt processing(PP)과 text generation(TG)을 측정합니다.
- PP: 512 / 2K / 8K / 32K tokens
- TG: 512 tokens
- 단위: tokens/s
- 정답률이나 지능이 아니라 같은 GB10에서의 순수 실행 속도에 가까운 microbenchmark입니다.
Server-performance
llama-server에 실제로 여러 요청이 동시에 들어왔을 때 얼마나 잘 처리하는지 봅니다.
- Concurrency 1, 2, 4, 8
- aggregate throughput · per-request throughput
- p50 / p95 latency · failure rate
- Performance가 모델 자체의 순수 속도에 가깝다면, Server-performance는 API 서버처럼 사용할 때의 처리 능력에 더 가깝습니다.
Knowledge
일반 지식, 한국, 수학, 과학, 논리 문제를 얼마나 정확하게 푸는지 봅니다. 총 100문제를 5개 분야로 나눴습니다.
- General · Korea · Math · Science · Logic
- 각 분야 20문제, easy / medium / hard 포함
- LLM judge 없이 multiple choice / numeric / exact match deterministic scoring
- MMLU를 대체하려는 목적이 아니라, 같은 조건에서 로컬 모델의 기본 정확도 차이를 보기 위한 고정 dataset입니다.
Coding
모델이 실제로 실행 가능한 Python 코드를 만들 수 있는지 봅니다. 생성한 코드를 파일로 저장한 뒤 pytest를 실행합니다.
- 12개의 작은 함수 구현 문제
- prime 판정 · 문자열 처리 · 리스트 중복 제거
- 빈도 계산 · clamp · chunk 처리
- 설명을 잘하는지보다 실제로 테스트를 통과하는 코드를 생성했는지에 초점을 둡니다. 대규모 repository 수정 benchmark는 아닙니다.
Tool-call
필요한 도구를 골라 올바른 방식으로 호출할 수 있는지 봅니다. 고정된 tool simulator 안에서 도구 선택부터 최종 완료까지 확인합니다.
- single tool · tool selection · multi-step tool use · recovery · no-tool
- tool 선택 · argument · 실행 성공 · 최종 task completion
- OpenCode, Claude Code, Codex 같은 특정 agent framework 전체 성능을 의미하지 않습니다.
External tool-eval-bench
외부 tool-eval-bench의 표준 시나리오를 같은 llama.cpp 계열 환경에서 실행해, 더 긴 tool-use trace와 안전 경계를 확인합니다.
- 표준 69개 시나리오 · deterministic mock tool
- 도구 선택 · 인자 · multi-step chain · recovery · safety · structured output
- 현재 N2/N2.5 Mini 8개, Occamy 1.0 4개, Laguna S 2.1 1개, Laguna XS 2.1 4개 variant를 측정했으며, 내부 Tool-call v1.1과 다른 protocol입니다.
Agent-single
하나의 agent가 여러 단계를 이어서 최종 작업을 끝낼 수 있는지 봅니다. 조회, 계산, 파일 사용, 최종 답변이 이어지는 작업을 평가합니다.
- 중간 tool call 실패 뒤 회복하면 최종 성공으로 인정
- 실패한 호출 자체는 별도 metric으로 기록
- 첫 시도의 완벽함보다 작업을 끝까지 완료하는 능력에 가깝습니다.
Agent-multi
역할을 나누고 결과를 handoff하면서 여러 단계의 작업을 완료할 수 있는지 봅니다. 현재 evaluator에서는 Researcher와 Calculator 역할을 사용합니다.
- task completion · role participation · handoff success
- required dependency · tool execution · final answer
- 실제 조직처럼 협업하는 여러 독립 AI 직원 전체가 아니라, 이번 release에서 정의한 role/tool handoff protocol 안의 결과입니다.
이 결과를 볼 때 참고할 점 Limitations
- 이 benchmark는 DGX Spark GB10 + llama.cpp + 공개된 고정 recipe에서 나온 결과입니다. 다른 GPU, runtime, prompt format에서는 결과가 달라질 수 있습니다.
- 같은 기반 모델이라도 quantization에 따라 속도와 evaluator 결과가 달라질 수 있어, 기반 모델명과 실제 variant·quantization을 함께 표시했습니다.
- Tool-call과 Agent 계열은 고정된 synthetic protocol을 사용하므로 OpenCode, Claude Code, Codex 같은 실제 개발 환경의 체감과 정확히 같지는 않을 수 있습니다.
- External tool-eval-bench는 내부 Tool-call v1.1과 다른 69-scenario protocol입니다. 각 run의 실제 채점 분모를 표시하며, 기존 N2/N2.5 Mini와 Occamy 1.0 run은 grammar 오류 4건을 제외한 65개, Laguna S 2.1과 Laguna XS 2.1은 각각 69개를 채점했습니다.
- External tool-eval-bench는 현재 N2/N2.5 Mini 8개, Occamy 1.0 4개, Laguna S 2.1 1개, Laguna XS 2.1 4개 variant에서 측정되었으며, 나머지 모델의 빈 칸은 0점이 아니라 아직 측정하지 않은 상태입니다.
- Knowledge 100문제는 모델의 모든 지식을 대표하는 절대적인 지능 점수가 아니라, 같은 조건에서 모델 간 차이를 비교하기 위한 고정 dataset입니다.
- 서로 다른 8개 suite를 억지로 합친 종합 점수는 만들지 않았습니다. 필요한 작업에 맞춰 항목별로 비교하는 것이 더 유용합니다.
데이터 다운로드와 재현성
사람이 보는 비교표와 같은 release를 machine-readable JSON으로도 공개합니다. JSON을 이용하면 모델별 비교, quantization 비교, suite별 ranking, 별도 chart와 후속 분석을 직접 만들 수 있습니다.
이번 공개 데이터는 특정 시점의 immutable release snapshot입니다. 같은 release ID의 수치를 나중에 조용히 수정하지 않고, 변경이 필요하면 새로운 revision 또는 release로 발행합니다.
한 줄로 정리하면
이 페이지는 “어떤 LLM이 세상에서 가장 좋은가”를 정하기 위한 leaderboard가 아닙니다.
DGX Spark GB10에서 실제 GGUF 모델들을 같은 조건으로 돌렸을 때, 각각 어떤 속도와 작업 성향을 보였는지 기록한 공개 benchmark입니다.
빠른 모델, 코딩을 잘하는 모델, tool 사용이 좋은 모델, agent task completion이 좋은 모델이 서로 다를 수 있습니다. 필요한 작업에 맞춰 원하는 항목을 직접 비교해보시면 됩니다.