Benchmarks로 돌아가기
Custom Measurements

Custom Benchmarks

표준 8-suite Benchmark에 포함하지 않는 특정 모델·사용 사례·serving·품질·심층 분석 측정과 DevSnack 원문입니다. 각 결과는 고유한 protocol을 사용하므로 표준 Benchmark와 직접 순위를 비교하지 않습니다.

Custom Benchmark를 보는 방법

아래 결과는 표준 8-suite matrix에 넣기 어려운 특정 모델·사용 사례·serving·품질 측정입니다. 각 글의 고유한 조건과 목적을 확인하고, 표준 Benchmark와는 별도의 결과로 해석해 주세요.

LLM

모델·양자화·실사용 성능

12custom

Inference

prefill·decode·speculative decoding

12custom

Hardware

장비와 메모리 환경

11custom

Custom Benchmark Results

표준 suite 밖에서 특정 모델이나 사용 사례를 깊게 살펴본 개별 결과입니다.

Laguna XS 2.1

7-suite Full-cycle · 4 variants

1 custom result
Custom Benchmark ResultexperimentLaguna XS 2.17-suite Full-cycle · 4 variants

Laguna XS 2.1 — canonical 7-suite Benchmark

Target

Laguna XS 2.1 · Q4_K_M / Q5_K_M / Q6_K_L / Q8_0

Environment

NVIDIA DGX Spark GB10 · llama.cpp b10930-56381e407 · non-MTP

Method / Protocol
Performance·Server-performance·Knowledge v1.2·Coding·Tool-call v1.1·Agent-single·Agent-multi 및 별도 external tool-eval-bench를 네 variant에서 동일 조건으로 실행; quality suite는 no-think·budget 0 조건
Result
Q4/Q5/Q6/Q8의 Knowledge는 85/100, 88/100, 88/100, 84/100; Coding은 모두 12/12; Tool-call은 모두 13/15; Agent-single은 6/12, 6/12, 5/12, 5/12; Agent-multi는 모두 9/10; external tool-eval은 86/100, 88/100, 88/100, 87/100
Interpretation
속도 우선이면 Q4_K_M, 품질과 속도의 균형이면 Q5_K_M 또는 Q6_K_L을 우선 후보로 볼 수 있음. Agent-single의 required-step 유지와 external safety 경고는 별도 검증 계층이 필요함

Baseline: Knowledge는 current v1.2·100문항을 사용하며, 모든 variant에 동일 dataset·recipe를 적용

Limitations: 모델당 full-cycle 1회이며 internal suite와 external tool-eval-bench는 서로 다른 protocol임; 네 external run 모두 safety gate를 통과하지 못했으므로 최종 점수는 완전한 안전성 평가가 아님

Laguna S 2.1

7-suite Full-cycle

1 custom result
Custom Benchmark ResultexperimentLaguna S 2.17-suite Full-cycle

Laguna S 2.1 APEX-I Balanced — canonical 7-suite Benchmark

Target

Laguna S 2.1 Uncensored APEX-I Balanced · NVFP4

Environment

NVIDIA DGX Spark GB10 · llama.cpp b10930-56381e407 · non-MTP

Method / Protocol
Performance·Server-performance·Knowledge v1.2·Coding·Tool-call v1.1·Agent-single·Agent-multi를 동일 모델에서 순차 실행; quality suite는 no-think·budget 0 조건
Result
PP 762.48/757.70/756.94/702.17 tok/s, TG 27.55 tok/s; server 180/180 성공; Knowledge 88/100; Coding 11/12; Tool-call 13/15; Agent-single 6/12; Agent-multi 7/10
Interpretation
GB10에서 기본 지식·코딩·도구 실행은 실용적인 수준이나, 장기 agent workflow는 추가 policy와 검증 계층이 필요함

Baseline: Knowledge는 current Standard v1.2·100문항을 사용하며, 이전 legacy v1·25문항 결과는 historical custom record로 구분

Limitations: 이전 Knowledge v1·25문항은 current Standard v1.2·100문항과 직접 비교하지 않음; 모델당 1회 full-cycle이며 별도 external tool-eval-bench safety gate는 실패함

Ornith-1.5

Quality + Real-use Speed

1 custom result
Custom Benchmark ResultbenchmarkOrnith-1.5Quality + Real-use Speed

Ornith-1.5 서버 품질·실사용 속도 Benchmark — Q5/Q6/Q8 비교

Target

Ornith-1.5-35B-A3B-MTP Q5_K_M / Q6_K / Q8_0

Environment

DGX Spark GB10 · 121GiB unified memory · llama-server · 64K context

Method / Protocol
모델당 서버를 한 번 로드하고 실제 Science·History production 품질 prompt를 스트리밍 실행; 별도 synthetic speed lane 없이 prompt/generation tok/s·TTFT·MTP acceptance를 함께 측정
Result
Q5는 64.6 tok/s·5회 내 품질 2/2, Q6은 59.8 tok/s·2/2, Q8은 54.4 tok/s·0/2; 세 모델 모두 OOM·인프라 오류 없음
Interpretation
실제 긴 대본 요청에서 품질과 속도를 함께 보면 Q5_K_M이 가장 실용적인 첫 후보였고, Q6_K은 품질 우선 후보로 남았다. Q8_0은 현재 structured output 계약과 맞지 않았다.

Baseline: 동일한 production validator와 최대 5회 재생성 조건을 모든 모델에 적용

Limitations: 모델당 두 fixture·반복 1회, reasoning on/off·MTP off·coding/tool call·사람의 의미 품질 평가는 포함하지 않음

Qwen3.6

Quality / Reliability

1 custom result
Custom Benchmark ResultbenchmarkQwen3.6Quality / Reliability

Qwen3.6 YouTube Script Reliability Benchmark — 실제 자동화 대본 생성 재현성 측정

Target

Qwen3.6-35B-A3B variants · YouTube Shorts script stage

Environment

DGX Spark GB10 · 121GiB unified memory · llama.cpp llama-cli · 64K context

Method / Protocol
HQ 기준선과 외장 미디어의 6개 모델을 Science·History fixture당 1회씩 측정; production prompt/validator, 최대 5회 재생성, 각 시도는 llama-cli --single-turn
Result
추가 6종 품질 벤치: 12회 fixture 실행에서 1차 통과 2/12 (16.7%), 5회 내 최종 통과 9/12 (75%), 평균 3.1회; 기존 HQ 기준선 4회는 1차 50%, 최종 75%
Interpretation
재시도 포함 production 품질 게이트에서는 NVFP4 TURBO가 가장 적은 시도로 안정적이었고, UD-Q6_K_XL은 두 프로필 모두 5회 안에 수렴하지 못했으며 Q8_0은 크기에 비해 첫 시도 통과가 없었음

Baseline: 실제 production 기준 대본 2개 모두 validator 통과

Limitations: 고정 fixture 2개와 모델당 1회 반복, 단일 모델 계열·양자화·MTP 설정이며 사람의 의미 품질 평가와 downstream 이미지/영상 품질은 포함하지 않음

Qwen3.8

Serving / Speed

1 custom result
Custom Benchmark ResultbenchmarkQwen3.8Serving / Speed

Local LLM Benchmark — Qwen3.8-27B Ridge 3.7bpw 실측 리포트

Target

Qwen3.8-27B Ridge 3.7bpw

Environment

NVIDIA DGX Spark GB10 · 128GB unified memory

Method / Protocol
HIGH / VERY-HIGH, thinking ON / OFF, MTP n-max 6·p-min 0.75, 단일 실행과 4-slot 장기 서빙 측정
Result
단일 실행 prefill 680~930 t/s, decode 17~19.5 t/s, MTP acceptance 93.1%; 4-slot 장문 서빙 18~22 t/s, 평균 acceptance 약 94%
Interpretation
GB10에서 27B급 로컬 모델을 단순 속도뿐 아니라 동시 서빙과 실제 산출물까지 포함해 판단할 수 있는 측정 결과

Baseline: 동일 환경의 독립 baseline 모델 비교는 이 리포트에 기록되어 있지 않음

Limitations: 모델·양자화·프롬프트·동시성 조건이 제한되어 있으며, 독립 baseline과 품질 평가 데이터는 추가되어야 함

Individual Benchmark Articles

특정 모델과 사용 사례를 다룬 개별 DevSnack benchmark 원문입니다.

DevSnack source article2026. 6. 30.

Ornith-1.0-35B: 5인 팀이 만든 Agentic Coding 모델, 9개 GGUF 전량 벤치마크

Ornith-1.0-35B: 5인 팀이 만든 Agentic Coding 모델, 9개 GGUF 전량 벤치마크 2026년 6월 25일, HuggingFace에 Ornith-1.0 이라는 모델이 올라왔다. DeepReinforce AI라는 곳에서 만들었는데, 팀 규모가 5명 이라고 한다. MIT 라이선스. Qwen 3.5-35B-A3B를 베이스로 RL post-training 으로 agentic coding 능력을 강화했다고 한다. 요즘 나오는 모델들 트렌드가 다 그렇지만, 이걸 보자마자 든 생각: "DGX Spark에 한 번 올려볼까?

DevSnack source article2026. 6. 14.

DGX Spark GB10에서 North Mini Code 1.0 GGUF 벤치마크: 9개 양자화 완전 비교

NVIDIA DGX Spark GB10에서 North Mini Code 1.0 GGUF 벤치마크: 9개 양자화 완전 비교 CohereLabs 기반 MoE 모델, DGX Spark GB10에서 어떤 양자화가 가장 잘 돌아갈까? 9개 GGUF 양자화의 실제 측정 데이터로 분석했다. ▲ North Code CohereLabs에서 North-Mini-Code-1.0 이라는 새로운 코딩 특화 MoE 모델이 나왔다. Unsloth가 16개 샤드로 구성된 safetensors를 9종류의 GGUF 양자화로 변환해 공개했다. DGX Spark GB

DevSnack source article2026. 6. 12.

Nex-N2-mini UD 버전 벤치마크: bartowski와 비교했을 때 어떤가요?

Nex-N2-mini UD 버전 벤치마크: bartowski와 비교했을 때 어떤가요? Nex AGI의 Nex-N2-mini 모델이 bartowski 컨버전 버전으로 널리 쓰이고 있는데, 최근 s Jakek 이 UD (Ultra-Dense) 컨벤션으로 새로 컨버전한 버전이 Hugging Face( sjakek/Nex-N2-mini-GGUF )에 올라왔습니다. 같은 모델이지만 양자화 컨벤션과 메타데이터 구조가 달라 실제 성능과 메모리 사용량에서 차이가 날 수 있습니다. 🧪 ▲ Ud Comparison 직접 비교해보고 느낀 점 사실 이

DevSnack source article2026. 6. 12.

NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교

NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교 Nex AGI의 새로운 Agentic 모델, DGX Spark GB10에서 어떤 양자화가 가장 잘 돌아갈까? 6개 GGUF 양자화의 실제 측정 데이터로 분석했다. Nex AGI에서 Nex-N2-mini 라는 새로운 GGUF 모델 패밀리가 나왔다. Qwen3.5-35B-A3B-Base를 기반으로 MoE 구조에 "Agentic Thinking" 프레임워크를 붙인 에이전트 특화 모델이다. Bartowski가 16개 샤드로 구성된 s

DevSnack source article2026. 6. 10.

NVIDIA DGX Spark GB10에서 GGUF 모델 벤치마크: 4개 모델 완전 비교

NVIDIA DGX Spark GB10에서 GGUF 모델 벤치마크: 4개 모델 완전 비교 DGX Spark GB10에서 어떤 로컬 LLM을, 어떤 옵션으로 돌려야 할까? 4개 모델, 224개 조합의 실제 측정 데이터로 분석했다. 새로운 GGUF 모델이 나와서 DGX Spark GB10에서 성능을 측정해봤다. 자동화 프로그램(llama-bench, build 9533, commit c4a278d68)으로 스레드, 배치 크기, KV 캐시 등 여러 조합을 바꿔가며 총 224개 를 테스트했다. Gemma 4, LFM 2.5, 그리고 커뮤니

DevSnack source article2026. 5. 6.

Gemma 4 MTP Drafter 실전 적용기 — DGX Spark에서 3배 빨라진 31B

핵심 결과 모델 프레임워크 Baseline + MTP γ=4 속도 향상 Gemma 4 26B-A4B (FP8) vLLM 37.3 tok/s 62.9 tok/s 1.69x Gemma 4 31B Dense (NVFP4) vLLM 6.5 tok/s 18.8 tok/s 2.89x Gemma 4 26B-A4B (Q8_0) llama.cpp 45.4 tok/s (MTP 미지원) — Gemma 4 31B Dense (Q6_K_XL) llama.cpp 6.8 tok/s (MTP 미지원) — Gemma 4 31B Dense (NVFP4-turbo)

DevSnack source article2026. 4. 26.

DGX Spark 실전기: Qwen3.6을 llama.cpp에서 vLLM + DFlash로 갈아타기

TL;DR — llama.cpp로 Qwen3.6을 잘 쓰고 있었는데, vLLM + NVFP4 + DFlash 조합이 정말 2배 빠를까? DGX Spark에서 직접 설치하고, 삽질하고, 측정했습니다. 결론부터 말하면 — 빠릅니다. 88~104 tok/s. 📑 목차 발단: 숫자가 너무 좋아서 의심스러웠다 현재 환경: llama.cpp 기준선 vLLM + NVFP4 + DFlash 설치: 실전 과정 첫 번째 삽질: 오토튜닝으로 시스템 마비 안정적인 설정: 실사용을 위한 docker-compose.yml 핵심 트릭: 모델 이름으로 Thin

Related Knowledge