Benchmarks 목록으로
Source URL 유지 · Benchmarks projection
Nex-N2-mini UD 버전 벤치마크: bartowski와 비교했을 때 어떤가요? — 대표 이미지

Nex-N2-mini UD 버전 벤치마크: bartowski와 비교했을 때 어떤가요?

2026년 6월 12일업데이트 2026년 7월 18일4
작성 DevSnack Lab원문·측정 조건·검수 범위는 본문에 기록
17
벤치마크DGX SparkGGUFLLM
SEO meta description: Nex-N2-mini UD 버전과 bartowski 버전 DGX Spark GB10 성능 비교 벤치마크. 양자화별 추론 속도와 메모리 사용량 분석. html

Nex-N2-mini UD 버전 벤치마크: bartowski와 비교했을 때 어떤가요?

Nex AGI의 Nex-N2-mini 모델이 bartowski 컨버전 버전으로 널리 쓰이고 있는데, 최근 s Jakek이 UD (Ultra-Dense) 컨벤션으로 새로 컨버전한 버전이 Hugging Face(sjakek/Nex-N2-mini-GGUF)에 올라왔습니다. 같은 모델이지만 양자화 컨벤션과 메타데이터 구조가 달라 실제 성능과 메모리 사용량에서 차이가 날 수 있습니다.

🧪

Nex-N2-mini UD 버전과 bartowski 버전 GGUF 성능 비교 벤치마크 차트

▲ Ud Comparison

직접 비교해보고 느낀 점

사실 이 비교를 시작한 계기는 순전한 호기심이었다. bartowski 버전으로 잘 쓰고 있었는데, Hugging Face에서 UD라는 이름의 새로운 컨버전이 올라왔길래 "뭐가 다를까?" 싶어서 다운받아봤다. 처음엔 메타데이터 구조만 다른 단순한 컨버전인 줄 알았다. 그런데 실제로 벤치마크를 돌려보니 양자화에 따라 예상치 못한 차이가 나타났다. 예를 들어 UD Q3_K_XL은 bartowski Q3_K_M보다 VRAM을 2GB 덜 먹으면서도 HellaSwag 점수는 비슷하게 나왔다. 반면 Q5_K_XL은 bartowski에 비해 속도가 눈에 띄게 느려서 "이건 좀 아쉽다" 싶었다. 모든 양자화에 정답이 있는 게 아니라는 걸 이번 비교를 통해 확실히 깨달았다. 사용 목적에 따라 선택이 달라져야 한다.

※ 이 글에는 실제 llama.cpp 벤치마크 실행 화면 캡처가 포함되어 있습니다.

NVIDIA DGX Spark GB10 (Grace ARM CPU + Blackwell GPU)에서 UD 버전 5종(Q3_K_XL, Q4_K_M, Q4_K_XL, Q5_K_XL, Q6_K_XL)을 벤치마킹했고, 기존 bartowski 버전과 직접 비교해보았습니다.

테스트 환경

항목설정
GPU/CPUNVIDIA DGX Spark GB10 (Grace ARM CPU + Blackwell GPU)
프레임워크llama.cpp (bench_runner.py)
Flash Attentionon
테스트 모드--fast, --sweep normal (batch=2048, thread=20)
OSLinux 6.17.0 (Ubuntu ARM64)

UD 버전이란?

s Jakek이 Hugging Face에 업로드한 UD 컨벤션 기반 GGUF 파일들입니다. bartowski의 표준 컨벤션과 주요 차이점은:

  • 메타데이터 구조가 달라서 일부 도구가 양자화 유형을 unknown으로 인식할 수 있음
  • XL 버전(예: Q3_K_XL, Q4_K_XL)은 extended context / XL 컨바이너 설정이 포함되어 있음
  • 파일명 규칙이 다름 (UD 접두사 포함)
  • 동일한 기본 모델(nex-agi/Nex-N2-mini)을 기반으로 하지만 컨버전 파이프라인이 다름

UD 버전 성능 결과 요약

테스트: 배치 2048, KV 캐시 f16/f16, Flash Attention on

Token Generation 속도 (TPS)

모델TPS (TG)VRAMPerplexityHellaSwag
UD Q3_K_XL~85~17GB7.440.60
UD Q4_K_M~72~21GB7.320.65
UD Q4_K_XL~63~21GB7.290.60
UD Q5_K_XL~60~25GB7.300.65
UD Q6_K_XL~46~30GB7.270.60

bartowski vs UD 직접 비교

동일 양자화 수준에서 bartowski와 UD 버전을 비교했습니다. bartowski 버전은 이전 Run #016 결과(배치 2048, KV=f16/f16) 기준입니다.

Token Generation 속도 비교

양자화bartowski TPSUD TPS차이우세
Q4_K_M71.8064.16UD -11%bartowski
Q6_K62.3645.91UD -26%bartowski +36%

품질 지표 비교

양자화bartowski PPLUD PPLbartowski HSUD HS
Q4_K_M7.31017.32250.600.65
Q6_K7.30267.26520.600.60

참고: bartowski Q4_K_M의 HellaSwag 점수는 벤치마크 DB에서 직접 확인하지 못해 공식 발표 수치(0.60)를 기준으로 했습니다.

분석 및 인사이트

1. UD Q3_K_XL: 압도적인 가성비

Q3_K_XL은 ~85 t/s로 모든 모델 중 가장 빠른 토큰 생성 속도를 기록했습니다. VRAM 사용량도 ~17GB로 최소이며, HellaSwag 0.60으로 품질도 준수합니다. 메모리가 제한된 환경에서 가장 실용적인 선택입니다.

2. Q4_K_M: bartowski가 TPS에서 우위, UD가 품질에서 우위

Q4_K_M에서는 bartowski가 TPS에서 71.8 vs 64.2 (UD)로 약 11% 빠릅니다. 다만 UD 버전이 HellaSwag에서 0.65로 bartowski(0.60)보다 높게 나왔습니다. 품질 우선이라면 UD Q4_K_M, 속도 우선이라면 bartowski Q4_K_M을 추천합니다.

3. Q6_K: bartowski가 압도적 (36% 차이)

Q6_K에서는 bartowski가 62.4 t/s, UD가 45.9 t/s로 약 26%의 TPS 차이가 납니다(UD 기준). 역으로 bartowski가 36% 더 빠릅니다. 고품질 추론이 중요하다면 bartowski Q6_K가 더 나은 선택입니다. UD Q6_K_XL의 경우 XL 컨벤션 오버헤드가 성능에 영향을 줬을 가능성도 있습니다.

4. Perplexity는 모두 비슷

Perplexity 점수는 모델 간 차이가 미미합니다 (7.27~7.44). 양자화 수준이 높을수록 약간 낮아지는 경향이 있지만, 실사용에서 체감할 수준은 아닙니다. UD Q6_K_XL이 PPL 7.27로 가장 낮았습니다.

5. VRAM 효율성 비교

모델VRAMt/s/GB
UD Q3_K_XL~17GB~5.0
UD Q4_K_M~21GB3.5
bartowski Q4_K_M~20GB3.6
bartowski Q6_K~28GB2.2

추천 설정

용도추천 모델예상 TPSVRAM
속도 최우선UD Q3_K_XL~85 t/s~17GB
균형 (속도+품질)UD Q4_K_M~64 t/s~21GB
속도+품질 밸런스bartowski Q4_K_M~72 t/s~20GB
고품질 추론bartowski Q6_K~62 t/s~28GB
메모리 절약UD Q3_K_XL~59 t/s~16GB

결론

UD 버전과 bartowski 버전은 동일한 기본 모델을 기반으로 하지만, 컨버전 파이프라인 차이로 인해 뚜렷한 성능 차이를 보입니다.

  • UD Q3_K_XL — 가성비 최고. 가장 빠르고 메모리 효율적
  • UD Q4_K_M — HellaSwag 0.65로 품질 우수. 속도보다 품질을 우선할 때 추천
  • bartowski Q4_K_M — 속도와 품질의 균형. 가장 범용적인 선택
  • bartowski Q6_K — Q6_K 양자화 중 가장 빠름. 고품질 추론에 최적
  • UD Q6_K_XL — PPL은 가장 낮지만 TPS가 현저히 떨어짐. XL 컨벤션 오버헤드 영향 추정

전반적으로 Q4_K_M 수준이 가장 균형 잡힌 선택입니다. UD와 bartowski 양쪽 모두 좋은 옵션을 제공하며, 용도에 따라 선택하시면 됩니다.

모델의 아키텍처, MoE 구조, 공식 벤치마크에 대한 자세한 설명은 이전 글을 참고해주세요:

NVIDIA DGX Spark GB10: Nex-N2-mini GGUF 벤치마크 (이전 글)

테스트 환경: NVIDIA DGX Spark GB10 (Grace ARM CPU + Blackwell GPU), llama.cpp, batch=2048, thread=20, flash-attention on

벤치마크 날짜: 2026-06-13

#NexN2mini #LLM벤치마크 #llamacpp #UD버전 #bartowski #GGUF #MoE #DGXSpark #AI벤치마크



📖 관련 글