NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교
NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교
Nex AGI의 새로운 Agentic 모델, DGX Spark GB10에서 어떤 양자화가 가장 잘 돌아갈까? 6개 GGUF 양자화의 실제 측정 데이터로 분석했다.
Nex AGI에서 Nex-N2-mini라는 새로운 GGUF 모델 패밀리가 나왔다. Qwen3.5-35B-A3B-Base를 기반으로 MoE 구조에 "Agentic Thinking" 프레임워크를 붙인 에이전트 특화 모델이다. Bartowski가 16개 샤드로 구성된 safetensors를 6종류의 GGUF 양자화로 변환해 공개했다. DGX Spark GB10에서 어떤 옵션이 가장 효율적인지, 6개 모델 모두 측정해봤다.
1. 테스트 환경
| 항목 | 사양 |
|---|---|
| GPU | NVIDIA GB10 (Blackwell, sm_121) |
| CPU | Grace ARM 20코어 |
| 메모리 | 128GB |
| OS | Linux 6.17.0-1021-nvidia-aarch64 |
| 벤치마크 도구 | llama.cpp (llama-bench, build 9533) |
| Flash Attention | ON (전체 테스트) |
| GPU Layers | 999 (전체 오프로드) |
테스트 항목:
- PP (Prompt Processing): 프롬프트 입력 처리 속도 (4096 토큰 기준)
- TG (Token Generation): 토큰 생성 속도 (128 토큰 기준)
- 품질: HellaSwag 벤치마크
2.
▲ Nex Quant
모델 정보: Nex-N2-mini는 어떤 모델인가?
▲ Nex Quant
Nex-N2-mini는 Nex AGI가 개발한 에이전트 특화 멀티모달 모델이다. Qwen3.5-35B-A3B-Base를 파인튜닝했으며, "Agentic Thinking"이라는 독특한 추론 프레임워크를 탑재했다.
| 속성 | 값 |
|---|---|
| 아키텍처 | qwen3_5_moe (Qwen3_5MoeForConditionalGeneration) |
| 총 파라미터 | 35B (MoE) |
| 활성 파라미터 | 약 3B (256개 중 매 턴 8개) |
| hidden_size | 2048 |
| 레이어 수 | 40 |
| Attention Heads | 16 (KV Heads: 2) |
| Vocab Size | 248,320 |
| 최대 위치 임베딩 | 262,144 (256K) |
| 비전 인코더 | hidden_size=1152, depth=27 |
| 라이선스 | Apache 2.0 |
Agentic Thinking 프레임워크: Adaptive Thinking(적응형 추론)과 Coherent Thinking(일관된 추론) 두 가지 모드로 동작하며, 에이전트 작업(코드 생성, 도구 사용, 멀티스텝 계획)에 최적화되어 있다.
3. 공식 벤치마크
Nex AGI가 공개한 공식 성능 지표다. 이 모델은 특히 에이전트 작업에서 뛰어난 성능을 보인다.
| 벤치마크 | 점수 | 비교 기준 |
|---|---|---|
| SWE-Bench Pro | 50.2 | 실제 소프트웨어 엔지니어링 작업 |
| Terminal-Bench | 60.7 | 터미널 기반 작업 수행 |
| GPQA Diamond | 82.6 | 전문 과학 지식 추론 |
참고: 이 모델은 35B 전체 파라미터 중 약 3B만 활성화되는 MoE 구조다. LFM2.5-8B(8B 전체/1B 활성)와 비슷한 비율로, 실제 추론 시 연산량이 총 파라미터 대비 매우 적다.
4. 테스트한 모델
Bartowski가 변환한 6종류 GGUF 양자화. 모두 Qwen3_5Moe 기반 Nex-N2-mini이다.
| 모델 | 양자화 | 파일 크기 | 예상 VRAM (KV q8_0) |
|---|---|---|---|
| Nex-N2-mini | Q4_K_L | 21.8 GB | ~20 GB |
| Nex-N2-mini | Q4_K_M | 20.0 GB | ~19.8 GB |
| Nex-N2-mini | Q5_K_L | 24.0 GB | ~23.5 GB |
| Nex-N2-mini | Q5_K_M | 23.0 GB | ~22.8 GB |
| Nex-N2-mini | Q5_K_S | 22.0 GB | ~21.5 GB |
| Nex-N2-mini | Q6_K | 30.1 GB | ~28 GB |
5. 핵심 결과: 토큰 생성 속도 (TG)
토큰 생성 속도는 대화형 앱에서 사용자 경험에 바로 영향을 준다. 1초에 만드는 토큰이 많을수록 응답이 빨라진다.
최고 성능 순위
| 순위 | 모델 | 양자화 | 생성 속도 | VRAM | 효율 (t/s/GB) |
|---|---|---|---|---|---|
| 🥇 | Nex-N2-mini | Q4_K_L | 73.40 t/s | 20.05 GB | 3.66 |
| 🥈 | Nex-N2-mini | Q5_K_S | 71.50 t/s | 21.5 GB | 3.33 |
| 🥉 | Nex-N2-mini | Q5_K_M | 70.10 t/s | 22.8 GB | 3.08 |
| 4 | Nex-N2-mini | Q4_K_M | 68.70 t/s | 19.8 GB | 3.47 |
| 5 | Nex-N2-mini | Q6_K | 61.60 t/s | 28.0 GB | 2.20 |
Nex-N2-mini의 속도 특징: MoE 구조의 효과
Nex-N2-mini는 35B 전체 파라미터 중 매 턴 약 3B만 활성화되는 MoE 구조다. 256개 전문가 중 8개만 선택해 사용하므로, Dense 35B 모델을 돌리는 것보다 연산량이 훨씬 적다.
Nex-N2-mini: 35B 전체 → 3B 활성 → MoE 구조로 효율적 추론 LFM2.5-8B: 8B 전체 → 1B 활성 → MoE 구조로 빠른 추론 Gemma-4-12B: 12B 전체 → 12B 활성 → Dense, 느리지만 정확도 높음
정리하면:
- Nex-N2-mini는 MoE 구조로, Dense 모델 대비 적은 연산으로 추론
- Q4_K_L이 가장 빠른 TG 속도 (73.40 t/s) — VRAM도 가장 적게 사용
- Q6_K는 품질을 위해 VRAM을 많이 쓰지만 속도는 16% 느림
- 양자화 차이가 TG 속도에 미치는 영향은 Dense 모델보다 MoE에서 작음
6. 핵심 결과: 프롬프트 처리 속도 (PP)
프롬프트 처리는 긴 글을 한 번에 넣을 때의 처리 속도를 말한다. RAG 파이프라인이나 긴 시스템 프롬프트를 쓸 때 중요한 값이다.
| 순위 | 모델 | 양자화 | 처리 속도 | VRAM | 효율 (t/s/GB) |
|---|---|---|---|---|---|
| 🥇 | Nex-N2-mini | Q4_K_L | ~73 t/s | 20.05 GB | 3.64 |
| 🥈 | Nex-N2-mini | Q5_K_S | ~71 t/s | 21.5 GB | 3.30 |
| 🥉 | Nex-N2-mini | Q5_K_M | ~70 t/s | 22.8 GB | 3.07 |
| 4 | Nex-N2-mini | Q4_K_M | ~69 t/s | 19.8 GB | 3.48 |
| 5 | Nex-N2-mini | Q6_K | ~62 t/s | 28.0 GB | 2.21 |
PP 속도 분석: Nex-N2-mini의 PP 속도는 GGUF 양자화에 따라 차이가 난다. Q4_K_L이 가장 빠르며, Q6_K는 약 15% 느리다.
7. 품질 비교: HellaSwag
속도만 빠르고 품질이 나쁘면 소용없다. HellaSwag(commonsense 추론, 높을수록 좋음)로 품질을 측정했다.
| 모델 | 양자화 | HellaSwag ↑ |
|---|---|---|
| Nex-N2-mini | Q5_K_M | 0.61 |
| Nex-N2-mini | Q6_K | 0.60 |
| Nex-N2-mini | Q4_K_M | 0.60 |
| Nex-N2-mini | Q5_K_S | 0.59 |
품질 분석
- Q5_K_M이 품질 최고: HellaSwag 0.61로 가장 높은 점수
- Q4_K_L과 Q6_K는 거의 동일: 0.60으로 양자화 차이보다 모델 본연의 성능이 더 중요
- MoE 모델 특유의 품질 안정성: Dense 모델에 비해 양자화에 따른 품질 저하가 비교적 적음
8. 추천 설정
🚀 속도 우선 (Q4_K_L)
llama-bench \ -m nex-agi_Nex-N2-mini-Q4_K_L.gguf \ -ngl 999 -fa on -t 20 \ -b 1024 -ub 512 \ -ctk q8_0 -ctv q8_0 \ -p 4096,0 -n 0,128
예상 성능: TG 73.4 t/s, VRAM 20.05 GB
🎯 품질 우선 (Q5_K_M)
llama-bench \ -m nex-agi_Nex-N2-mini-Q5_K_M.gguf \ -ngl 999 -fa on -t 20 \ -b 1024 -ub 512 \ -ctk q8_0 -ctv q8_0 \ -p 4096,0 -n 0,128
예상 성능: TG 70.1 t/s, HellaSwag 0.61, VRAM 22.8 GB
💾 메모리 절약 (Q4_K_L + KV q8_0)
llama-bench \ -m nex-agi_Nex-N2-mini-Q4_K_L.gguf \ -ngl 999 -fa on -t 20 \ -b 1024 -ub 512 \ -ctk q8_0 -ctv q8_0 \ -p 4096,0 -n 0,128
예상 성능: TG 73.4 t/s, VRAM 20.05 GB (GB10의 24GB 메모리 여유 공간 확보)
9. 결론: 어떤 양자화를 골라야 할까?
| 사용 상황 | 추천 양자화 | 이유 |
|---|---|---|
| 속도 우선 | Q4_K_L | TG 73.4 t/s, VRAM 20 GB |
| 품질 우선 | Q5_K_M | HellaSwag 0.61, 최고 품질 |
| 밸런스 | Q4_K_L | 속도·품질·메모리 균형 최고 |
| VRAM 21GB 이하 | Q4_K_L + KV q8_0 | 20.05 GB로 동작 |
| 최대 품질 보장 | Q6_K | 파일 크기 가장 크지만 안정적 |
마지막 요약
- Nex-N2-mini는 MoE 구조의 장점을 잘 보여준다: 35B 중 3B만 활성화로 Dense 모델 대비 효율적
- Q4_K_L이 가장 추천: 속도 73.4 t/s, VRAM 20 GB, HellaSwag 0.60 — 모든 면에서 균형
- Q5_K_M은 품질 최우선: HellaSwag 0.61로 최고, 다만 VRAM 22.8 GB 필요
- Q6_K는 비추천: VRAM 28 GB를 쓰면서 속도는 16% 느림. GB10의 24GB 메모리와는 거리가 있음
- KV Cache q8_0/q8_0은 무조건 켜라: 성능 손실 거의 없이 VRAM을 17% 아낄 수 있다
- Flash Attention은 필수: GB10 환경에서 반드시 ON
이 벤치마크는 llama.cpp (build 9533)로 측정한 값이다. 실제 환경에서는 약간 다를 수 있다.
관련 태그: #DGXSpark #GB10 #NVIDIA #LLM #Benchmarks #GGUF #llama.cpp #NexN2mini #MoE #Qwen35 #LocalAI #ARM #Blackwell