Knowledge 목록으로

TokenChaser 벤치마크 프롬프트 팩 + 자체 설계 Self Bench Pack — GB10 로컬 LLM 테스트

🔄 진행 중🤖 LLM / 모델2026년 8월 17일4
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록

개요

tokenchaser.net 27개 Lab Note에서 수집한 84개 벤치마크 프롬프트 (단일 HTML UI 35 / 게임 26 / VPS 20 / 점진적 확장 3) + 이를 참고해 자체 설계한 Self Bench Pack 24개 (한영 이중언어 출력 요구)

메모

①수집 팩 정제 완료 (MODEL_NAME 토큰, 리눅스 경로, VPS 시크릿 마스킹) ②자체 설계 완료 (8/18): `[로컬] — ui 9 / game 8 / service 4 (VPS→로컬 변형) / progressive 3, 공통 요구사항: KO+EN 이중언어 토글·한글 폰트·UTF-8·이중언어 안내 섹션 + Self-Test & Verification Loop(스스로 생성→테스트→수정, 에이전트용) ③오픈코드 에이전트 실행기 구축: run_agent_bench.py + check_html.py + 격리 config(opencode-bench.json, 플러그인 프리셋의 원격 API 서브에이전트 차단, 8080 로컬 전용) ④블로그 Lab 반영 완료 (8/18): [경로] 프롬프트 24종 라이브러리(설명·검색·필터·복사) 추가 ⑤다음 단계: 전체 24종 에이전트 실행 → 이중언어/자기검증 점수화 → Lab 결과 반영 (상세: "실행 예정" 섹션)

조사 상세

TokenChaser 벤치마크 프롬프트 팩 — GB10 참고용 수집 자료

tokenchaser.net의 27개 Lab Note(로컬 GPU LLM 벤치마크 영상)에서 벤치마크 프롬프트 84개를 수집·분류한 자료. 자체 벤치마크 프롬프트를 작성할 때 참고하기 위해 수집했다.

데이터

  • 원본: 27개 페이지, 84개 프롬프트 (중복 없음, 유니크 84)
  • 출처: https://tokenchaser.net/videos — "Local MODELS / REAL GPUs" 컨셉의 로컬 LLM 실전 비교 영상 시리즈
  • 수집: 2026-08-18, HTML prompt-block 구조 파싱 (curl + 정규식, API 없이 가능)

파일 위치 (llm-bench 디렉토리)

  • tokenchaser_bench_pack.json — 정제 팩 (카테고리 분류 + 로컬 치환)
  • tokenchaser_raw_84.json — 원본 그대로 보존
  • run_bench.py — 벤치 러너 (OpenAI 호환 API)
  • 결과 저장: results/<모델명>/ 하위 (생성 HTML + 메타 md)

카테고리 분포

카테고리개수설명
ui35단일 HTML UI/앱 (데스크톱, 대시보드, iPhone, 웹사이트 등)
game26단일 HTML 게임 (레이싱, 탑다운, 좀비, 타워디펜스, 테트리스 등)
vps20VPS/서버 배포 (SSH·Nginx·포트80, 서버/클라이언트 분리 작업 포함)
progressive3점진적 확장 (Phase 1→2→3, "Do not rebuild from scratch")

로컬 치환 규칙 (적용 완료)

  • MODEL_NAME — 파일명/UI에 표기할 모델명 토큰 (실행 시 모델명 값으로 치환)
  • Windows 작업 경로 → llm-bench 디렉토리 (리눅스 경로)
  • 가상 모델명 (Qwen3.7-30B-Open, Qwopus 등) → YOUR_MODEL
  • VPS 패스워드 → [보안상 마스킹], 로컬 IP → [LOCAL_IP] — 타겟/시크릿 제거

사용법 (참고용 확인)

수집한 프롬프트의 구조·패턴을 파악하는 용도로만 사용한다.

# 목록/필터 (구조 파악용)
python3 run_bench.py --list
python3 run_bench.py --cat ui

# 프롬프트만 출력 (패턴 분석용)
python3 run_bench.py -p tc-ui-01 --print-only

활용 예정 (자체 벤치마크 프롬프트 작성)

수집한 프롬프트를 참고해 우리 환경(GB10 로컬 LLM)에 맞는 자체 벤치마크 프롬프트를 작성 예정:

  • 측정 목표: 지시사항 준수율 / UI 완성도 / 기능 동작 여부 / 버그 수 / 확장 단계 유지력 / 창의성
  • 설계 방향: 수집 프롬프트의 구조·요구사항 패턴을 참고해 자체 프롬프트로 새로 작성
  • 비교 대상: 같은 자체 프롬프트를 Qwen3.8-27B HIGH/VERY-HIGH, thinking ON/OFF, 차기 후보 모델에 순차 적용
  • 속도 측정: 생성 완료 후 t/s 자동 기록 (프리필/디코드 수치는 llama-server 로그와 교차 확인)

자체 벤치마크 프롬프트 팩 — Self Bench Pack (2026-08-18 설계 완료)

수집 84개의 구조·개념만 참고해 자체 설계한 24개 프롬프트 (원문 복사 없음). 핵심 확장 ①: 모든 산출물이 한국어+영어 이중언어 출력을 요구한다. 핵심 확장 ②: 전 프롬프트에 Self-Test & Verification Loop 지시 내장 — 오픈코드 에이전트가 생성→자체 테스트(헤드리스 브라우저/로컬 서버)→검증→수정을 최대 5회 반복하고 한국어 검증 보고서(REPORT.md)를 제출한다 (단발 생성 아님, 2026-08-18 운영 검토).

  • 파일: [로컬] + build_self_pack.py` (재생성 스크립트)
  • 카테고리: ui 9 / game 8 / service 4 (VPS 개념을 로컬 배포로 변형) / progressive 3 (한국어 학습 플랫폼 Phase 1→2→3)
  • 공통 바이링궐 요구사항: ①모든 UI 텍스트 KO+EN ②기본 언어 한국어 + KO/EN 토글 버튼(즉시 전환) ③반쪽 번역 금지 ④한글 폰트 스택 + UTF-8 (깨짐 금지) ⑤날짜·단위·문구 로컬라이즈 ⑥산출물 마지막에 '## 이중언어 안내 / Bilingual Note' KO/EN 각 2-3문장
  • 공통 자기검증 지시 (Self-Test & Verification Loop): 산출물 생성 → 헤드리스 브라우저(Playwright/Chrome)나 로컬 서버로 직접 실행 → 콘솔 에러 0건·기능 동작·이중언어 토글·한글 렌더링·외부 CDN 없음·반응형 체크 → 버그 수정 후 재테스트 (최대 5회) → 최종 결과물 + 한국어 검증 보고서 제출
  • 공통 퀄리티 바: 모던 디자인 + 애니메이션, 반응형, 외부 CDN/라이브러리 없음(순수 자체 포함), placeholder 금지
  • 평가 축 (meta.scoring_axes): bilingual_coverage / korean_rendering / instruction_compliance / ui_quality / functionality / self_verification / progressive_retention

에이전트 실행 (오픈코드 CLI + 로컬 백본)

  • 실행기: run_agent_bench.py — 각 프롬프트를 opencode run --auto -m llama.cpp/qwen3.5-35b로 실행 (백본: 8080 로컬 LLM)
  • 검증 헬퍼: check_html.py — 헤드리스 Chrome(Playwright)으로 HTML 로드 오류/콘솔 에러/이중언어 토글/한글 렌더링/외부 리소스/모바일 오버플로 자동 보고
  • 작업 디렉토리: [로컬]<id>/ — 최종 index.html + REPORT.md + 세션 로그
python3 run_agent_bench.py --list # 24개 목록
python3 run_agent_bench.py -p self-ui-01 # 단일 실행
python3 run_agent_bench.py --cat game # 카테고리 순차 실행
python3 run_agent_bench.py --all # 전체 순차 실행 (수 시간 소요)

실행 예정 (다음 단계)

  • [ ] 3. 검증 실행: Self Bench Pack을 오픈코드 에이전트(8080 qwen3.5-35b 백본)로 실행 → 이중언어 커버리지·한글 렌더링·자기검증 충실도 점수화 (2026-08-18 베타 2회 실행 확인 — 루프 동작 검증됨, 전체 실행은 보류)
  • [ ] 4. Lab 연계: 결과를 Local LLM Benchmark 실험 타임라인·결과에 반영

블로그 Lab 반영 (2026-08-18 완료)

  • [경로] 실험 상세 페이지에 Self Bench Pack 프롬프트 라이브러리 추가 (커밋 25f5747)

- 24개 프롬프트 목록 + 개별 한국어 설명(평가 포인트) + 카테고리 필터(전체[경로]) + 실시간 검색(제목·설명·전문) + 복사 버튼(전문 클립보드 복사) + 전문 펼치기/접기

- 데이터 소스: src[경로] (빌더 스크립트 build_bench_prompts_ts.py로 self_bench_pack.json에서 재생성)

- 실험 progress 35%→40%, timeline에 "Self Bench Pack 자체 설계" 완료 반영

- 검증: tsc 통과, playwright로 검색(주식→1개)·필터(Game→8개)·전문 펼치기·클립보드 복사(2,710자) 확인

Research LNB 개선 — 카테고리 세부 페이지 + 서브메뉴 (2026-08-18 완료, 커밋 1288249)

운영 검토: "버셀 블로그 리서치도 lnb 구조 개선하자. 그냥 누르고 들어가면 지금처럼 전체 보이고, 세부 카테고리로 들어가면 그것만 보이도록"

  • 구조: /research = 전체 유지 (카테고리별 그룹) → [경로]/[cat] = 해당 카테고리만 플랫 리스트 (llm[경로])
  • 공용 컴포넌트: src[경로] (ResearchList — category prop 분기) + RESEARCH_CATEGORIES 상수 export
  • 상단 카테고리 탭: 전체(카운트) + 5개 카테고리 탭 — 클릭 시 해당 카테고리 경로로 이동, active 하이라이트. 전체 그룹 헤더에 "카테고리만 보기 →" 링크 추가
  • 사이드바(side-nav.tsx): Research를 단독+서브메뉴로 변경 — 전체 + 🤖LLM/🎙️TTS/🎨미디어/📊벤치마크/🖥️하드웨어 (Demos 패턴)
  • 모바일 탭바(mobile-tab-bar.tsx): Research 탭에 서브메뉴 팝오버 추가 (전체 + 5종)
  • 검증: tsc 통과 → playwright: /research 전체 그룹 표시 / category/tts 8건만 표시 / 잘못된 카테고리 404 / 모바일 팝오버 6항목·오버플로 0

작업 위치: llm-bench 디렉토리 (tokenchaser_bench_pack.json / self_bench_pack.json / run_bench.py 존재, --pack self로 팩 전환)