Benchmarks 목록으로
Source URL 유지 · Benchmarks projection
NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교 — 대표 이미지

NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교

2026년 6월 12일업데이트 2026년 7월 18일5
작성 DevSnack Lab원문·측정 조건·검수 범위는 본문에 기록
19
벤치마크DGX SparkGGUFLLM
SEO meta description: NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 모델 6개 양자화 벤치마크. 실제 토큰 생성 속도와 프롬프트 처리 성능.

NVIDIA DGX Spark GB10에서 Nex-N2-mini GGUF 벤치마크: 6개 양자화 완전 비교

Nex AGI의 새로운 Agentic 모델, DGX Spark GB10에서 어떤 양자화가 가장 잘 돌아갈까? 6개 GGUF 양자화의 실제 측정 데이터로 분석했다.

Nex-N2-mini 벤치마크 차트

Nex AGI에서 Nex-N2-mini라는 새로운 GGUF 모델 패밀리가 나왔다. Qwen3.5-35B-A3B-Base를 기반으로 MoE 구조에 "Agentic Thinking" 프레임워크를 붙인 에이전트 특화 모델이다. Bartowski가 16개 샤드로 구성된 safetensors를 6종류의 GGUF 양자화로 변환해 공개했다. DGX Spark GB10에서 어떤 옵션이 가장 효율적인지, 6개 모델 모두 측정해봤다.

1. 테스트 환경

항목 사양
GPUNVIDIA GB10 (Blackwell, sm_121)
CPUGrace ARM 20코어
메모리128GB
OSLinux 6.17.0-1021-nvidia-aarch64
벤치마크 도구llama.cpp (llama-bench, build 9533)
Flash AttentionON (전체 테스트)
GPU Layers999 (전체 오프로드)

테스트 항목:

  • PP (Prompt Processing): 프롬프트 입력 처리 속도 (4096 토큰 기준)
  • TG (Token Generation): 토큰 생성 속도 (128 토큰 기준)
  • 품질: HellaSwag 벤치마크

2.
Nex-N2-mini 6개 GGUF 양자화 종류 및 모델 구조 설명 다이어그램

▲ Nex Quant

모델 정보: Nex-N2-mini는 어떤 모델인가?

Nex-N2-mini는 Nex AGI가 개발한 에이전트 특화 멀티모달 모델이다. Qwen3.5-35B-A3B-Base를 파인튜닝했으며, "Agentic Thinking"이라는 독특한 추론 프레임워크를 탑재했다.

속성
아키텍처qwen3_5_moe (Qwen3_5MoeForConditionalGeneration)
총 파라미터35B (MoE)
활성 파라미터약 3B (256개 중 매 턴 8개)
hidden_size2048
레이어 수40
Attention Heads16 (KV Heads: 2)
Vocab Size248,320
최대 위치 임베딩262,144 (256K)
비전 인코더hidden_size=1152, depth=27
라이선스Apache 2.0

Agentic Thinking 프레임워크: Adaptive Thinking(적응형 추론)과 Coherent Thinking(일관된 추론) 두 가지 모드로 동작하며, 에이전트 작업(코드 생성, 도구 사용, 멀티스텝 계획)에 최적화되어 있다.

3. 공식 벤치마크

Nex AGI가 공개한 공식 성능 지표다. 이 모델은 특히 에이전트 작업에서 뛰어난 성능을 보인다.

벤치마크 점수 비교 기준
SWE-Bench Pro50.2실제 소프트웨어 엔지니어링 작업
Terminal-Bench60.7터미널 기반 작업 수행
GPQA Diamond82.6전문 과학 지식 추론

참고: 이 모델은 35B 전체 파라미터 중 약 3B만 활성화되는 MoE 구조다. LFM2.5-8B(8B 전체/1B 활성)와 비슷한 비율로, 실제 추론 시 연산량이 총 파라미터 대비 매우 적다.

4. 테스트한 모델

Bartowski가 변환한 6종류 GGUF 양자화. 모두 Qwen3_5Moe 기반 Nex-N2-mini이다.

모델 양자화 파일 크기 예상 VRAM (KV q8_0)
Nex-N2-miniQ4_K_L21.8 GB~20 GB
Nex-N2-miniQ4_K_M20.0 GB~19.8 GB
Nex-N2-miniQ5_K_L24.0 GB~23.5 GB
Nex-N2-miniQ5_K_M23.0 GB~22.8 GB
Nex-N2-miniQ5_K_S22.0 GB~21.5 GB
Nex-N2-miniQ6_K30.1 GB~28 GB

5. 핵심 결과: 토큰 생성 속도 (TG)

토큰 생성 속도는 대화형 앱에서 사용자 경험에 바로 영향을 준다. 1초에 만드는 토큰이 많을수록 응답이 빨라진다.

최고 성능 순위

순위 모델 양자화 생성 속도 VRAM 효율 (t/s/GB)
🥇Nex-N2-miniQ4_K_L73.40 t/s20.05 GB3.66
🥈Nex-N2-miniQ5_K_S71.50 t/s21.5 GB3.33
🥉Nex-N2-miniQ5_K_M70.10 t/s22.8 GB3.08
4Nex-N2-miniQ4_K_M68.70 t/s19.8 GB3.47
5Nex-N2-miniQ6_K61.60 t/s28.0 GB2.20

Nex-N2-mini의 속도 특징: MoE 구조의 효과

Nex-N2-mini는 35B 전체 파라미터 중 매 턴 약 3B만 활성화되는 MoE 구조다. 256개 전문가 중 8개만 선택해 사용하므로, Dense 35B 모델을 돌리는 것보다 연산량이 훨씬 적다.

Nex-N2-mini:  35B 전체 → 3B 활성 → MoE 구조로 효율적 추론
LFM2.5-8B:    8B 전체 → 1B 활성 → MoE 구조로 빠른 추론
Gemma-4-12B:  12B 전체 → 12B 활성 → Dense, 느리지만 정확도 높음

정리하면:

  • Nex-N2-mini는 MoE 구조로, Dense 모델 대비 적은 연산으로 추론
  • Q4_K_L이 가장 빠른 TG 속도 (73.40 t/s) — VRAM도 가장 적게 사용
  • Q6_K는 품질을 위해 VRAM을 많이 쓰지만 속도는 16% 느림
  • 양자화 차이가 TG 속도에 미치는 영향은 Dense 모델보다 MoE에서 작음

6. 핵심 결과: 프롬프트 처리 속도 (PP)

프롬프트 처리는 긴 글을 한 번에 넣을 때의 처리 속도를 말한다. RAG 파이프라인이나 긴 시스템 프롬프트를 쓸 때 중요한 값이다.

순위 모델 양자화 처리 속도 VRAM 효율 (t/s/GB)
🥇Nex-N2-miniQ4_K_L~73 t/s20.05 GB3.64
🥈Nex-N2-miniQ5_K_S~71 t/s21.5 GB3.30
🥉Nex-N2-miniQ5_K_M~70 t/s22.8 GB3.07
4Nex-N2-miniQ4_K_M~69 t/s19.8 GB3.48
5Nex-N2-miniQ6_K~62 t/s28.0 GB2.21

PP 속도 분석: Nex-N2-mini의 PP 속도는 GGUF 양자화에 따라 차이가 난다. Q4_K_L이 가장 빠르며, Q6_K는 약 15% 느리다.

7. 품질 비교: HellaSwag

속도만 빠르고 품질이 나쁘면 소용없다. HellaSwag(commonsense 추론, 높을수록 좋음)로 품질을 측정했다.

모델 양자화 HellaSwag ↑
Nex-N2-miniQ5_K_M0.61
Nex-N2-miniQ6_K0.60
Nex-N2-miniQ4_K_M0.60
Nex-N2-miniQ5_K_S0.59

품질 분석

  • Q5_K_M이 품질 최고: HellaSwag 0.61로 가장 높은 점수
  • Q4_K_L과 Q6_K는 거의 동일: 0.60으로 양자화 차이보다 모델 본연의 성능이 더 중요
  • MoE 모델 특유의 품질 안정성: Dense 모델에 비해 양자화에 따른 품질 저하가 비교적 적음

8. 추천 설정

🚀 속도 우선 (Q4_K_L)

llama-bench \
  -m nex-agi_Nex-N2-mini-Q4_K_L.gguf \
  -ngl 999 -fa on -t 20 \
  -b 1024 -ub 512 \
  -ctk q8_0 -ctv q8_0 \
  -p 4096,0 -n 0,128

예상 성능: TG 73.4 t/s, VRAM 20.05 GB

🎯 품질 우선 (Q5_K_M)

llama-bench \
  -m nex-agi_Nex-N2-mini-Q5_K_M.gguf \
  -ngl 999 -fa on -t 20 \
  -b 1024 -ub 512 \
  -ctk q8_0 -ctv q8_0 \
  -p 4096,0 -n 0,128

예상 성능: TG 70.1 t/s, HellaSwag 0.61, VRAM 22.8 GB

💾 메모리 절약 (Q4_K_L + KV q8_0)

llama-bench \
  -m nex-agi_Nex-N2-mini-Q4_K_L.gguf \
  -ngl 999 -fa on -t 20 \
  -b 1024 -ub 512 \
  -ctk q8_0 -ctv q8_0 \
  -p 4096,0 -n 0,128

예상 성능: TG 73.4 t/s, VRAM 20.05 GB (GB10의 24GB 메모리 여유 공간 확보)

9. 결론: 어떤 양자화를 골라야 할까?

사용 상황 추천 양자화 이유
속도 우선Q4_K_LTG 73.4 t/s, VRAM 20 GB
품질 우선Q5_K_MHellaSwag 0.61, 최고 품질
밸런스Q4_K_L속도·품질·메모리 균형 최고
VRAM 21GB 이하Q4_K_L + KV q8_020.05 GB로 동작
최대 품질 보장Q6_K파일 크기 가장 크지만 안정적

마지막 요약

  • Nex-N2-mini는 MoE 구조의 장점을 잘 보여준다: 35B 중 3B만 활성화로 Dense 모델 대비 효율적
  • Q4_K_L이 가장 추천: 속도 73.4 t/s, VRAM 20 GB, HellaSwag 0.60 — 모든 면에서 균형
  • Q5_K_M은 품질 최우선: HellaSwag 0.61로 최고, 다만 VRAM 22.8 GB 필요
  • Q6_K는 비추천: VRAM 28 GB를 쓰면서 속도는 16% 느림. GB10의 24GB 메모리와는 거리가 있음
  • KV Cache q8_0/q8_0은 무조건 켜라: 성능 손실 거의 없이 VRAM을 17% 아낄 수 있다
  • Flash Attention은 필수: GB10 환경에서 반드시 ON

이 벤치마크는 llama.cpp (build 9533)로 측정한 값이다. 실제 환경에서는 약간 다를 수 있다.

관련 태그: #DGXSpark #GB10 #NVIDIA #LLM #Benchmarks #GGUF #llama.cpp #NexN2mini #MoE #Qwen35 #LocalAI #ARM #Blackwell



📖 관련 글