통합 Benchmark 구조로 전환
서로 다른 측정 조건을 분리하고, 현재 결과를 Standard·Custom Benchmarks에서 관리하는 구조로 이동
DGX Spark GB10에서 로컬 LLM의 초기 실행 가능성을 확인한 완료 실험. 현재 측정 결과는 Standard·Custom Benchmarks에서 관리한다.
초기 실행 가능성을 확인한 뒤 현재 결과를 Standard·Custom Benchmarks로 분리한 종료 실험입니다.
초기에는 GB10에서 로컬 LLM을 실제로 실행하고, 속도·서빙·실사용 산출물을 빠르게 확인했다. 이후 조건이 서로 다른 측정을 하나의 실험 기록에 계속 덧붙이지 않도록, 모델·variant·quantization·작업별 결과를 Standard·Custom Benchmarks로 분리해 운영하는 방식으로 전환했다.
GB10에서 로컬 LLM을 실제로 실행할 수 있는지, 그리고 단순 속도 측정을 넘어 서빙과 결과물까지 이어지는지 확인했습니다.
후속 측정은 이 역사 페이지에 누적하지 않고, 재현 가능한 비교 결과와 개별 심층 측정을 별도 Benchmark surface로 관리합니다.
현재 YouTube production contract와 반복 생성 비용을 함께 고려하면 Q5는 속도·용량·통과율의 균형이 좋고, Q6은 재시도 수렴성이 좋았습니다. Q8은 현재 조건에서 우위가 확인되지 않았습니다.
Evidence
Scope
DGX Spark GB10, Science·History 두 fixture, 모델당 1회 반복, 현재 structured output contract
Confidence · limited
Qwen3.8 단일 Decode
17~19.5 t/s
초기 MTP 실측
Qwen3.8 4-slot
18~22 t/s
장문 서빙 평균
MTP acceptance
93.1% / 약 94%
단일 실행 / 4-slot 평균
Ornith Q5/Q6/Q8
64.6 / 59.8 / 54.4 tok/s
품질 통과 2/2 · 2/2 · 0/2
Qwen3.6 quality
9/12
5회 내 최종 통과
서로 다른 측정 조건을 분리하고, 현재 결과를 Standard·Custom Benchmarks에서 관리하는 구조로 이동
순수 rhetorical/hypothetical hook의 fact_refs 규칙 충돌을 production과 Benchmark에 반영
Q5/Q6/Q8을 실제 긴 품질 prompt에서 측정하고 속도·품질·재시도 수렴성을 비교
6종 파생 모델을 같은 Science·History fixture로 비교해 12회 실행에서 5회 내 최종 통과 9/12, 평균 3.1회를 기록
Canvas bitmap·HTML DOM overlay·html2canvas snapshot을 단일 HTML로 공개
Qwen3.8-27B Ridge 3.7bpw로 KOSPI/KOSDAQ 대시보드를 생성하고 worklog·llama_log까지 기록
단일 실행 prefill 680~930 t/s·decode 17~19.5 t/s, 4-slot 장문 서빙 18~22 t/s와 MTP acceptance 평균 약 94%를 확인
로컬 모델의 실행 속도·서빙·실사용 산출물을 확인해 후속 Benchmark의 출발점을 마련