Laguna XS 2.1 — canonical 7-suite Benchmark
Laguna XS 2.1 · Q4_K_M / Q5_K_M / Q6_K_L / Q8_0
NVIDIA DGX Spark GB10 · llama.cpp b10930-56381e407 · non-MTP
- Method / Protocol
- Performance·Server-performance·Knowledge v1.2·Coding·Tool-call v1.1·Agent-single·Agent-multi 및 별도 external tool-eval-bench를 네 variant에서 동일 조건으로 실행; quality suite는 no-think·budget 0 조건
- Result
- Q4/Q5/Q6/Q8의 Knowledge는 85/100, 88/100, 88/100, 84/100; Coding은 모두 12/12; Tool-call은 모두 13/15; Agent-single은 6/12, 6/12, 5/12, 5/12; Agent-multi는 모두 9/10; external tool-eval은 86/100, 88/100, 88/100, 87/100
- Interpretation
- 속도 우선이면 Q4_K_M, 품질과 속도의 균형이면 Q5_K_M 또는 Q6_K_L을 우선 후보로 볼 수 있음. Agent-single의 required-step 유지와 external safety 경고는 별도 검증 계층이 필요함
Baseline: Knowledge는 current v1.2·100문항을 사용하며, 모든 variant에 동일 dataset·recipe를 적용
Limitations: 모델당 full-cycle 1회이며 internal suite와 external tool-eval-bench는 서로 다른 protocol임; 네 external run 모두 safety gate를 통과하지 못했으므로 최종 점수는 완전한 안전성 평가가 아님