Labs 대시보드
Local AI완료된 초기 실험

Local LLM Benchmark

Completed현재 단계: 실험 완료· 2026.08.18 시작
진행률100%

DGX Spark GB10에서 로컬 LLM의 초기 실행 가능성을 확인한 완료 실험. 현재 측정 결과는 Standard·Custom Benchmarks에서 관리한다.

초기 실행 가능성을 확인한 뒤 현재 결과를 Standard·Custom Benchmarks로 분리한 종료 실험입니다.

작성 DevSnack Lab직접 실행·측정·판단 기록

초기 실험의 의미

초기에는 GB10에서 로컬 LLM을 실제로 실행하고, 속도·서빙·실사용 산출물을 빠르게 확인했다. 이후 조건이 서로 다른 측정을 하나의 실험 기록에 계속 덧붙이지 않도록, 모델·variant·quantization·작업별 결과를 Standard·Custom Benchmarks로 분리해 운영하는 방식으로 전환했다.

무엇을 확인했나

GB10에서 로컬 LLM을 실제로 실행할 수 있는지, 그리고 단순 속도 측정을 넘어 서빙과 결과물까지 이어지는지 확인했습니다.

현재 결과는 어디에 있나

후속 측정은 이 역사 페이지에 누적하지 않고, 재현 가능한 비교 결과와 개별 심층 측정을 별도 Benchmark surface로 관리합니다.

Verified Project Finding

현재 YouTube production contract와 반복 생성 비용을 함께 고려하면 Q5는 속도·용량·통과율의 균형이 좋고, Q6은 재시도 수렴성이 좋았습니다. Q8은 현재 조건에서 우위가 확인되지 않았습니다.

Evidence

  • Ornith Q5/Q6/Q8 서버 품질·속도 측정
  • Q5 2/2·64.6 tok/s, Q6 2/2·59.8 tok/s, Q8 0/2·54.4 tok/s

Scope

DGX Spark GB10, Science·History 두 fixture, 모델당 1회 반복, 현재 structured output contract

Confidence · limited

핵심 결과

Qwen3.8 단일 Decode

17~19.5 t/s

초기 MTP 실측

Qwen3.8 4-slot

18~22 t/s

장문 서빙 평균

MTP acceptance

93.1% / 약 94%

단일 실행 / 4-slot 평균

Ornith Q5/Q6/Q8

64.6 / 59.8 / 54.4 tok/s

품질 통과 2/2 · 2/2 · 0/2

Qwen3.6 quality

9/12

5회 내 최종 통과

주요 실험 기록

통합 Benchmark 구조로 전환

서로 다른 측정 조건을 분리하고, 현재 결과를 Standard·Custom Benchmarks에서 관리하는 구조로 이동

2026.08.24완료

Production contract calibration

순수 rhetorical/hypothetical hook의 fact_refs 규칙 충돌을 production과 Benchmark에 반영

2026.08.24완료

Ornith-1.5 서버 품질·실사용 속도

Q5/Q6/Q8을 실제 긴 품질 prompt에서 측정하고 속도·품질·재시도 수렴성을 비교

2026.08.24완료원문

Qwen3.6 YouTube 대본 품질 비교

6종 파생 모델을 같은 Science·History fixture로 비교해 12회 실행에서 5회 내 최종 통과 9/12, 평균 3.1회를 기록

2026.08.24완료원문

HTML in Canvas 데모

Canvas bitmap·HTML DOM overlay·html2canvas snapshot을 단일 HTML로 공개

2026.08.20완료원문

실사용 산출물 — Stock Dashboard

Qwen3.8-27B Ridge 3.7bpw로 KOSPI/KOSDAQ 대시보드를 생성하고 worklog·llama_log까지 기록

2026.08.19완료원문

단일 테스트·장기 서빙 실측

단일 실행 prefill 680~930 t/s·decode 17~19.5 t/s, 4-slot 장문 서빙 18~22 t/s와 MTP acceptance 평균 약 94%를 확인

2026.08.18완료

GB10에서 로컬 LLM 실행 가능성 확인

로컬 모델의 실행 속도·서빙·실사용 산출물을 확인해 후속 Benchmark의 출발점을 마련

2026.08.18완료