Knowledge 목록으로
Source URL 유지 · Knowledge projection
DGX Spark GB10에서 돌릴 수 있는 최적화 모델 총정리 (2026년 4월 기준) — 대표 이미지

DGX Spark GB10에서 돌릴 수 있는 최적화 모델 총정리 (2026년 4월 기준)

2026년 4월 27일업데이트 2026년 7월 18일6
작성 DevSnack Lab원문·측정 조건·검수 범위는 본문에 기록
23
AI 모델DGX SparkLLMNVFP4
SEO meta description: 허깅페이스 GB10 태그 모델 100여개 전수 조사. Nemotron, Gemma 4 NVFP4, Qwen3.6-35B DFlash 등 DGX Spark 최적화 LLM 총정리.

NVIDIA DGX Spark를 손에 넣었는데, 어떤 모델을 올려야 할지 막막하셨나요? 허깅페이스에 올라온 GB10 최적화 모델들을 샅샅이 뒤져서 정리했습니다.

DGX Spark, 왜 특별한가

NVIDIA DGX Spark는 Grace Blackwell GB10 수퍼칩을 탑재한 데스크탑 AI 워크스테이션입니다. 겉보기엔 소형 폼팩터의 조용한 박스지만, 속을 들여다보면 이야기가 달라집니다.

128GB 통합 메모리221GB/s 대역폭, 그리고 SM 12.1 Blackwell 아키텍처가 들어가 있습니다. 가장 중요한 건 NVFP4 네이티브 텐서코어 지원입니다. FP4(E2M1) 형식으로 가중치와 활성화를 모두 4비트로 내려도 하드웨어가 직접 연산을 처리하기 때문에, 소프트웨어 디퀀타이징 없이 순수한 처리량 향상을 얻을 수 있습니다. BF16 대비 메모리 사용량은 약 3~4배 줄어들고, MoE 모델처럼 메모리 대역폭에 병목이 걸리는 경우 처리 속도가 2배 이상 빨라집니다.

💡 듀얼 노드 구성: 2대의 DGX Spark를 ConnectX-7(200Gbps)으로 연결하면 256GB 메모리 풀도 구성할 수 있어서, 235B급 모델도 로컬에서 돌릴 수 있는 길이 열립니다.

문제는 이 하드웨어에 맞는 모델을 찾는 일입니다. 허깅페이스에서 gb10dgx-spark 태그로 검색하면 합산 100개가 넘는 모델이 나오는데, 이 글에서 그 전체 지형도를 한눈에 그려보겠습니다.

NVIDIA 공식 모델: 기본기부터 탄탄하게 OFFICIAL

NVIDIA가 직접 공개한 GB10 타겟 모델은 세 가지입니다. DGX Spark 사용자라면 가장 먼저 시도해볼 선택지들입니다.

Nemotron-3-Nano-30B-A3B-NVFP4

Nemotron Nano는 DGX Spark의 "레퍼런스 모델"이라 할 수 있습니다. 총 30B 파라미터에 토큰당 활성 파라미터는 3.5B뿐인 MoE 모델로, Mamba-2와 Attention 레이어를 혼합한 하이브리드 아키텍처입니다. 128개 라우팅 전문가에 1개 공유 전문가, 토큰당 6개 전문가가 활성화됩니다.

NVFP4 양자화는 Post-Training Quantization에 Quantization-Aware Distillation(QAD)까지 적용해 정확도를 최대한 보존했습니다. 결과적으로 BF16 대비 AIME25에서 89.1→86.7, MMLU-Pro에서 78.3→77.4 수준의 품질 하락만 발생합니다. 추론(thinking) 모드를 on/off 전환할 수 있어서, 간단한 질문에는 빠른 응답을, 복잡한 문제에는 단계별 추론을 선택적으로 사용할 수 있습니다. 최대 컨텍스트는 1M 토큰, 지원 언어는 영어를 포함해 6개 언어입니다.

2026년 1월 28일 공개되었으며, vLLM, TRT-LLM, SGLang 모두 지원합니다. DGX Spark 공식 플레이북에서도 이 모델을 첫 번째 예제로 다루고 있어서, 환경 설정부터 테스트까지의 경로가 가장 잘 정비되어 있습니다.

Nemotron-3-Super-120B-A12B-NVFP4

Nemotron Super는 Nano의 상위 모델입니다. 총 120B에 활성 12B, LatentMoE 아키텍처에 Multi-Token Prediction(MTP)까지 내장되어 있습니다. 특이한 점은 처음부터 NVFP4 정밀도로 학습된 모델이라는 것입니다. 사후 양자화가 아니라 학습 과정 자체에서 FP4를 사용했기 때문에, 양자화로 인한 품질 손실이 구조적으로 최소화되어 있습니다.

벤치마크를 보면 NVFP4 버전이 BF16과 거의 동등한 성능을 보입니다. MMLU-Pro 83.33(BF16: 83.73), GPQA 79.42(BF16: 79.23 — 오히려 높음), HMMT Feb25 95.36(BF16: 94.73 — 역시 더 높음). 학습 시 양자화가 적용되면서 일종의 정규화 효과가 발생한 것으로 보입니다.

최대 1M 토큰 컨텍스트를 지원하고, MTP를 통한 네이티브 추론 가속이 가능합니다. DGX Spark 단일 노드(128GB)에서 구동 가능하며, 에이전트 워크플로와 대량 처리(IT 티켓 자동화 등)에 최적화되어 있습니다. 2026년 3월 11일 공개.

Llama-3.3-70B-Instruct-NVFP4

Meta의 Llama 3.3 70B를 NVIDIA TensorRT Model Optimizer로 NVFP4 양자화한 모델입니다. Dense 모델이라 MoE 대비 토큰당 연산량은 크지만, NVFP4 덕분에 약 25GB 수준으로 압축되어 GB10의 128GB 메모리에 여유 있게 올라갑니다. MMLU 81.1(BF16: 83.3), GSM8K 92.6(BF16: 95.3)으로 합리적인 품질 유지를 보여줍니다. 다만 현재 TensorRT-LLM 전용이라 vLLM/SGLang에서의 호환성은 확인이 필요합니다.

커뮤니티 NVFP4 모델: 진짜 재미는 여기서 COMMUNITY

NVIDIA 공식 모델 외에, 커뮤니티에서 다양한 오픈소스 모델을 GB10 타겟으로 NVFP4 양자화해서 올려놓고 있습니다. 여기서 진짜 다양한 선택지가 열립니다.

AEON-7 / Qwen3.6-35B-A3B-heretic-NVFP4 — 현재 가장 완성도 높은 패키지

이 모델은 단순 양자화를 넘어서, DGX Spark 프로덕션 환경까지 검증된 턴키 패키지를 제공합니다. Qwen 3.6 35B-A3B(35B 총 파라미터, 토큰당 3B 활성)의 abliterated(검열 해제) 버전을 llmcompressor로 NVFP4 양자화한 것인데, 주목할 점은 DFlash 스펙큘러티브 디코딩과의 결합입니다.

별도의 경량 드래프터 모델(z-lab/Qwen3.6-35B-A3B-DFlash)이 타겟 모델의 다음 토큰을 미리 예측하고, 타겟 모델이 이를 검증하는 방식으로 동작합니다. 그리디 워크로드에서 토큰 수용률 62~78%, 평균 2.7~4.4개 토큰이 한 번에 수용됩니다. 결과적으로 싱글 스트림에서 200토큰 출력 기준 중앙값 83.9 tok/s, DFlash 정상 상태(500~1000토큰 출력)에서 115~118 tok/s를 달성합니다.

동시 접속 테스트에서도 128 동시 요청에서 총 313.6 tok/s, 1,200건 이상의 요청에서 에러 0건이라는 안정성을 입증했습니다. Docker Compose 파일, 벤치마크 스크립트, SM121 대응 8개 패치까지 GitHub에 공개되어 있어서, DGX Spark에서 "그냥 돌리면 되는" 수준의 패키지입니다.

아키텍처 자체도 흥미로운데, 40개 레이어 중 30개가 Gated DeltaNet(선형 어텐션), 10개가 Gated Attention이며, 256개 라우팅 전문가에 1개 공유 전문가, top-8 라우팅입니다. 비전 인코더(27블록 ViT)도 BF16으로 보존되어 멀티모달 입력이 가능합니다.

bg-digitalservices / Gemma-4-26B-A4B-it-NVFP4 — 다운로드 1위, 검증된 성능

허깅페이스 GB10 모델 중 다운로드 수 1위(248K)입니다. Google의 Gemma 4 26B-A4B-it(25.2B 총 파라미터, 3.8B 활성, 128 전문가 top-8)을 NVFP4 W4A4로 양자화한 모델입니다.

흥미로운 기술적 도전이 있었는데, Gemma 4의 MoE 레이어는 전문가 가중치를 [128, dim, dim] 형태의 3D 텐서로 저장합니다. NVIDIA ModelOpt는 nn.Linear만 양자화하기 때문에 전문가 파라미터(모델의 91%)를 그냥 건너뛰어 버리는 문제가 있었습니다. 제작자는 3D 텐서를 128×3개의 개별 Linear 레이어로 분해하는 커스텀 ModelOpt 플러그인을 작성해서 이 문제를 해결했습니다.

벤치마크 결과, BF16 대비 품질 보존률 97.6%(GSM8K 95%, IFEval 98~99%), 디스크 크기 49GB→16.5GB(3배 압축), 처리 속도 23.3→48.2 tok/s(2.07배 향상), TTFT 97→53ms(1.83배 향상)를 기록했습니다. MoE 추론이 메모리 대역폭 병목이기 때문에, 4배 작은 가중치가 거의 직접적으로 2배 처리량으로 이어지는 것입니다.

MiniMax 계열 — 172B/139B 초대형 모델을 단일 노드에

MiniMax-M2.7은 원래 256개 전문가, 172B 파라미터의 대형 MoE 모델입니다. 이것을 GB10 단일 노드에 올리기 위한 두 가지 경로가 허깅페이스에 존재합니다.

scottgl/MiniMax-M2.7-REAP-172B-A10B-NVFP4-GB10은 REAP 프루닝으로 256→192 전문가로 줄인 뒤 NVFP4로 양자화한 것으로, 약 92GB(19개 샤드)로 GB10의 128GB에 수용됩니다. MoE 전문가는 기존 catplusplus 체크포인트에서 rename만 했고(수치 변화 <1e-8), Attention Q/K/V/O는 새로 NVFP4 양자화, lm_head는 FP8로 양자화했습니다.

dervig/m51Lab-MiniMax-M2.7-REAP-139B-A10B-NVFP4-GB10은 더 공격적으로 40% 프루닝(256→154 전문가)해서 139B까지 줄인 뒤 NVFP4 W4A4로 양자화한 버전입니다. 약 80GB로, KV 캐시 여유분 ~48GB를 확보할 수 있습니다. 다만 W4A4의 활성화 양자화로 인해 FP8이나 W4A16 대비 1~3%의 추가 품질 하락이 있습니다.

Qwen3.5-27B-NVFP4-Opus-GB10 — 추론 특화 양자화

Qwen3.5-27B(Dense 하이브리드, 64레이어 중 3/4이 선형 어텐션)를 추론 특화 데이터셋으로 캘리브레이션한 NVFP4 양자화입니다. Claude Opus 추론 데이터셋과 Qwen3.5 추론 데이터셋을 섞어 512샘플로 캘리브레이션했습니다. 약 18GB로 압축되어 GB10에서 64K 컨텍스트와 멀티유저 배칭까지 여유롭게 가능합니다. Qwen3.5의 선형 어텐션 레이어 특성상 vLLM에서 --language-model-only, --mamba-cache-mode align 플래그가 필요합니다.

Uncensored / Abliterated 변종들 UNCENSORED

AEON-7과 YuYu1015를 중심으로 다양한 검열 해제 NVFP4 모델이 올라와 있습니다. Heretic 도구를 사용한 abliteration이 대부분이며, 보안 연구나 레드팀 테스트 등 정당한 용도가 있지만, 사용자 책임 하에 적절한 세이프가드와 함께 사용해야 합니다.

AEON-7 시리즈에서는 Gemma 4 31B DECKARD-HERETIC, Gemma 4 26B-A4B Uncensored, SuperGemma4 26B 멀티모달, Gemma 4 E4B(6B 경량) 등이 NVFP4로 제공됩니다. YuYu1015 시리즈에서는 Qwen3 30B-A3B Thinking, Qwen3.5 9B/4B Claude Opus 스타일, Qwopus3.5 27B 등이 NVFP4로 제공되며, 최근에는 Qwen3.6 35B-A3B의 abliterated NVFP4와 INT4 AutoRound 변종도 추가되었습니다.

vLLM 인프라: SM12.1의 함정과 해결

⚠️ 주의: 표준 vLLM 빌드는 SM 12.x용 FP4 커널을 컴파일하지 않습니다. 여러 CUTLASS 커널이 SM120에서 실패합니다.

DGX Spark에서 모델을 돌리려면 vLLM이나 SGLang 같은 서빙 엔진이 필요한데, 여기서 SM 12.1 호환성 문제가 발생합니다.

커뮤니티에서 이 문제를 해결한 Docker 이미지들이 허깅페이스에 올라와 있습니다. nologik/vllm-dgx-sparkTORCH_CUDA_ARCH_LIST="12.1f"로 빌드하고, CUDA 13.0 + PyTorch cu130을 지원하며, VLLM_FLASHINFER_MOE_BACKEND=latency 설정으로 SM120 커널 실패를 우회합니다. Nemotron Nano 기준으로 Eager 모드 ~42 tok/s에서 CUDA Graphs 활성화 시 ~66-67 tok/s로 약 60%의 속도 향상을 보여줍니다.

💡 핵심 팁: GB10에서 NVFP4 MoE를 돌릴 때 현재 유일하게 작동하는 백엔드는 Marlin입니다. FlashInfer CUTLASS, TRTLLM 등 다른 MoE 백엔드는 전문가 수×중간 차원 형상 검증에서 거부되기 때문에, VLLM_TEST_FORCE_FP8_MARLIN=1이나 --moe-backend marlin 설정이 사실상 필수입니다. AEON-7의 144-config 조사에서 이 사실이 체계적으로 확인되었고, 현재 커뮤니티의 표준 관행으로 자리잡았습니다.

인기도 순위

허깅페이스 다운로드 수 기준으로 상위 모델들을 정리하면 다음과 같습니다.

순위 모델 다운로드
1 bg-digitalservices/Gemma-4-26B-A4B-it-NVFP4 248K
2 nvidia/Llama-3.3-70B-Instruct-NVFP4 163K
3 AEON-7/Qwen3.6-35B-A3B-heretic-NVFP4 18.9K
4 AEON-7/Gemma-4-26B-A4B-it-Uncensored-NVFP4 13.1K
5 cybermotaz/nemotron3-nano-nvfp4-w4a16 10.8K
6 natfii/Qwen3.5-27B-NVFP4-Opus-GB10 7.47K
7 aeyeops/gemma-4-26b-a4b-it-nvfp4 7.45K
8 scottgl/MiniMax-M2.7-REAP-172B-A10B-NVFP4-GB10 4.21K

Gemma 4가 압도적인 인기를 보이는 이유는 명확합니다. 16.5GB라는 가벼운 크기에 MoE 효율성, 멀티모달(텍스트/이미지/비디오) 지원, 그리고 양자화 품질 보존률 97.6%라는 실용적 완성도가 결합되어 있기 때문입니다.

용도별 추천 정리

🟢 처음 시작하는 경우:
nvidia/Nemotron-3-Nano-30B-A3B-NVFP4가 가장 안전한 선택입니다. 공식 지원, 공식 플레이북, 공식 Docker 이미지가 모두 갖춰져 있습니다.
🟢 범용 고성능이 필요한 경우:
AEON-7/Qwen3.6-35B-A3B-heretic-NVFP4 + DFlash 조합이 현재 GB10에서 달성 가능한 최고 수준의 싱글 스트림 성능(83~118 tok/s)을 제공합니다.
🟢 가벼운 멀티모달이 필요한 경우:
bg-digitalservices/Gemma-4-26B-A4B-it-NVFP4가 16.5GB로 텍스트/이미지/비디오를 모두 처리하면서 48 tok/s를 제공합니다.
🟢 최대 규모 모델을 로컬에서 돌리고 싶은 경우:
scottgl/MiniMax-M2.7-REAP-172B-A10B-NVFP4-GB10이 172B 모델을 단일 GB10에서 구동하는 현재 유일한 경로입니다.
🟢 에이전트 / 장문 맥락 특화:
nvidia/Nemotron-3-Super-120B-A12B-NVFP4가 1M 컨텍스트, MTP 가속, 에이전트 최적화를 모두 갖추고 있습니다.

다음 글 예고

이번 글에서는 GB10 최적화 모델의 전체 지형도를 그려봤습니다. 다음 글에서는 여기서 가장 주목할 만한 두 계열, Qwen3.6 + DFlashMiniMax REAP 172B를 DGX Spark에 직접 설치하고 실제 벤치마크를 돌려보면서, 설치 과정에서의 삽질 기록과 실측 성능 데이터를 공유할 예정입니다.

2026년 4월 25일 작성. 허깅페이스 gb10(29개 모델) 및 dgx-spark(83개 모델) 태그 기준.



📖 관련 글