RTX 5090 전용 NInfer를 DGX Spark GB10에 포팅해봤다 — 27B는 졌고, 35B MoE는 달랐다
NInfer라는 흥미로운 프로젝트를 발견했다. Qwen3.5 계열 Dense/MoE 모델을 위한 C++/CUDA 추론 엔진인데, 범용성을 넓게 가져가는 llama.cpp나 vLLM과는 방향이 다르다. 지원 GPU와 모델을 좁히는 대신 CUDA Graph, 전용 quantization, MTP/DFlash, paged KV cache 같은 최적화를 적극적으로 사용한다. 문제는 지원 대상이 사실상 RTX 5090 하나라는 점이었다. 빌드 타깃은 sm_120a , 내부에도 5090의 170 SM을 전제로 한 튜닝이 들어가 있었다. 내가

