TokenChaser 벤치마크 프롬프트 팩 + 자체 설계 Self Bench Pack — GB10 로컬 LLM 테스트
개요
tokenchaser.net 27개 Lab Note에서 수집한 84개 벤치마크 프롬프트 (단일 HTML UI 35 / 게임 26 / VPS 20 / 점진적 확장 3) + 이를 참고해 자체 설계한 Self Bench Pack 24개 (한영 이중언어 출력 요구)
메모
①수집 팩 정제 완료 (MODEL_NAME 토큰, 리눅스 경로, VPS 시크릿 마스킹) ②자체 설계 완료 (8/18): `[로컬] — ui 9 / game 8 / service 4 (VPS→로컬 변형) / progressive 3, 공통 요구사항: KO+EN 이중언어 토글·한글 폰트·UTF-8·이중언어 안내 섹션 + Self-Test & Verification Loop(스스로 생성→테스트→수정, 에이전트용) ③오픈코드 에이전트 실행기 구축: run_agent_bench.py + check_html.py + 격리 config(opencode-bench.json, 플러그인 프리셋의 원격 API 서브에이전트 차단, 8080 로컬 전용) ④블로그 Lab 반영 완료 (8/18): [경로] 프롬프트 24종 라이브러리(설명·검색·필터·복사) 추가 ⑤다음 단계: 전체 24종 에이전트 실행 → 이중언어/자기검증 점수화 → Lab 결과 반영 (상세: "실행 예정" 섹션)
조사 상세
TokenChaser 벤치마크 프롬프트 팩 — GB10 참고용 수집 자료
tokenchaser.net의 27개 Lab Note(로컬 GPU LLM 벤치마크 영상)에서 벤치마크 프롬프트 84개를 수집·분류한 자료. 자체 벤치마크 프롬프트를 작성할 때 참고하기 위해 수집했다.
데이터
- 원본: 27개 페이지, 84개 프롬프트 (중복 없음, 유니크 84)
- 출처: https://tokenchaser.net/videos — "Local MODELS / REAL GPUs" 컨셉의 로컬 LLM 실전 비교 영상 시리즈
- 수집: 2026-08-18, HTML prompt-block 구조 파싱 (curl + 정규식, API 없이 가능)
파일 위치 (llm-bench 디렉토리)
tokenchaser_bench_pack.json— 정제 팩 (카테고리 분류 + 로컬 치환)tokenchaser_raw_84.json— 원본 그대로 보존run_bench.py— 벤치 러너 (OpenAI 호환 API)- 결과 저장:
results/<모델명>/하위 (생성 HTML + 메타 md)
카테고리 분포
| 카테고리 | 개수 | 설명 |
|---|---|---|
ui | 35 | 단일 HTML UI/앱 (데스크톱, 대시보드, iPhone, 웹사이트 등) |
game | 26 | 단일 HTML 게임 (레이싱, 탑다운, 좀비, 타워디펜스, 테트리스 등) |
vps | 20 | VPS/서버 배포 (SSH·Nginx·포트80, 서버/클라이언트 분리 작업 포함) |
progressive | 3 | 점진적 확장 (Phase 1→2→3, "Do not rebuild from scratch") |
로컬 치환 규칙 (적용 완료)
MODEL_NAME— 파일명/UI에 표기할 모델명 토큰 (실행 시 모델명 값으로 치환)- Windows 작업 경로 → llm-bench 디렉토리 (리눅스 경로)
- 가상 모델명 (Qwen3.7-30B-Open, Qwopus 등) →
YOUR_MODEL - VPS 패스워드 →
[보안상 마스킹], 로컬 IP →[LOCAL_IP]— 타겟/시크릿 제거
사용법 (참고용 확인)
수집한 프롬프트의 구조·패턴을 파악하는 용도로만 사용한다.
# 목록/필터 (구조 파악용)
python3 run_bench.py --list
python3 run_bench.py --cat ui
# 프롬프트만 출력 (패턴 분석용)
python3 run_bench.py -p tc-ui-01 --print-only
활용 예정 (자체 벤치마크 프롬프트 작성)
수집한 프롬프트를 참고해 우리 환경(GB10 로컬 LLM)에 맞는 자체 벤치마크 프롬프트를 작성 예정:
- 측정 목표: 지시사항 준수율 / UI 완성도 / 기능 동작 여부 / 버그 수 / 확장 단계 유지력 / 창의성
- 설계 방향: 수집 프롬프트의 구조·요구사항 패턴을 참고해 자체 프롬프트로 새로 작성
- 비교 대상: 같은 자체 프롬프트를 Qwen3.8-27B HIGH/VERY-HIGH, thinking ON/OFF, 차기 후보 모델에 순차 적용
- 속도 측정: 생성 완료 후 t/s 자동 기록 (프리필/디코드 수치는 llama-server 로그와 교차 확인)
자체 벤치마크 프롬프트 팩 — Self Bench Pack (2026-08-18 설계 완료)
수집 84개의 구조·개념만 참고해 자체 설계한 24개 프롬프트 (원문 복사 없음). 핵심 확장 ①: 모든 산출물이 한국어+영어 이중언어 출력을 요구한다. 핵심 확장 ②: 전 프롬프트에 Self-Test & Verification Loop 지시 내장 — 오픈코드 에이전트가 생성→자체 테스트(헤드리스 브라우저/로컬 서버)→검증→수정을 최대 5회 반복하고 한국어 검증 보고서(REPORT.md)를 제출한다 (단발 생성 아님, 2026-08-18 운영 검토).
- 파일:
[로컬] +build_self_pack.py` (재생성 스크립트) - 카테고리:
ui9 /game8 /service4 (VPS 개념을 로컬 배포로 변형) /progressive3 (한국어 학습 플랫폼 Phase 1→2→3) - 공통 바이링궐 요구사항: ①모든 UI 텍스트 KO+EN ②기본 언어 한국어 + KO/EN 토글 버튼(즉시 전환) ③반쪽 번역 금지 ④한글 폰트 스택 + UTF-8 (깨짐 금지) ⑤날짜·단위·문구 로컬라이즈 ⑥산출물 마지막에 '## 이중언어 안내 / Bilingual Note' KO/EN 각 2-3문장
- 공통 자기검증 지시 (Self-Test & Verification Loop): 산출물 생성 → 헤드리스 브라우저(Playwright/Chrome)나 로컬 서버로 직접 실행 → 콘솔 에러 0건·기능 동작·이중언어 토글·한글 렌더링·외부 CDN 없음·반응형 체크 → 버그 수정 후 재테스트 (최대 5회) → 최종 결과물 + 한국어 검증 보고서 제출
- 공통 퀄리티 바: 모던 디자인 + 애니메이션, 반응형, 외부 CDN/라이브러리 없음(순수 자체 포함), placeholder 금지
- 평가 축 (meta.scoring_axes): bilingual_coverage / korean_rendering / instruction_compliance / ui_quality / functionality / self_verification / progressive_retention
에이전트 실행 (오픈코드 CLI + 로컬 백본)
- 실행기:
run_agent_bench.py— 각 프롬프트를opencode run --auto -m llama.cpp/qwen3.5-35b로 실행 (백본: 8080 로컬 LLM) - 검증 헬퍼:
check_html.py— 헤드리스 Chrome(Playwright)으로 HTML 로드 오류/콘솔 에러/이중언어 토글/한글 렌더링/외부 리소스/모바일 오버플로 자동 보고 - 작업 디렉토리:
[로컬]<id>/— 최종 index.html + REPORT.md + 세션 로그
python3 run_agent_bench.py --list # 24개 목록
python3 run_agent_bench.py -p self-ui-01 # 단일 실행
python3 run_agent_bench.py --cat game # 카테고리 순차 실행
python3 run_agent_bench.py --all # 전체 순차 실행 (수 시간 소요)
실행 예정 (다음 단계)
- [ ] 3. 검증 실행: Self Bench Pack을 오픈코드 에이전트(8080 qwen3.5-35b 백본)로 실행 → 이중언어 커버리지·한글 렌더링·자기검증 충실도 점수화 (2026-08-18 베타 2회 실행 확인 — 루프 동작 검증됨, 전체 실행은 보류)
- [ ] 4. Lab 연계: 결과를 Local LLM Benchmark 실험 타임라인·결과에 반영
블로그 Lab 반영 (2026-08-18 완료)
- [경로] 실험 상세 페이지에 Self Bench Pack 프롬프트 라이브러리 추가 (커밋 25f5747)
- 24개 프롬프트 목록 + 개별 한국어 설명(평가 포인트) + 카테고리 필터(전체[경로]) + 실시간 검색(제목·설명·전문) + 복사 버튼(전문 클립보드 복사) + 전문 펼치기/접기
- 데이터 소스: src[경로] (빌더 스크립트 build_bench_prompts_ts.py로 self_bench_pack.json에서 재생성)
- 실험 progress 35%→40%, timeline에 "Self Bench Pack 자체 설계" 완료 반영
- 검증: tsc 통과, playwright로 검색(주식→1개)·필터(Game→8개)·전문 펼치기·클립보드 복사(2,710자) 확인
Research LNB 개선 — 카테고리 세부 페이지 + 서브메뉴 (2026-08-18 완료, 커밋 1288249)
운영 검토: "버셀 블로그 리서치도 lnb 구조 개선하자. 그냥 누르고 들어가면 지금처럼 전체 보이고, 세부 카테고리로 들어가면 그것만 보이도록"
- 구조:
/research= 전체 유지 (카테고리별 그룹) →[경로]/[cat]= 해당 카테고리만 플랫 리스트 (llm[경로]) - 공용 컴포넌트:
src[경로](ResearchList — category prop 분기) + RESEARCH_CATEGORIES 상수 export - 상단 카테고리 탭: 전체(카운트) + 5개 카테고리 탭 — 클릭 시 해당 카테고리 경로로 이동, active 하이라이트. 전체 그룹 헤더에 "카테고리만 보기 →" 링크 추가
- 사이드바(side-nav.tsx): Research를 단독+서브메뉴로 변경 — 전체 + 🤖LLM/🎙️TTS/🎨미디어/📊벤치마크/🖥️하드웨어 (Demos 패턴)
- 모바일 탭바(mobile-tab-bar.tsx): Research 탭에 서브메뉴 팝오버 추가 (전체 + 5종)
- 검증: tsc 통과 → playwright: /research 전체 그룹 표시 / category/tts 8건만 표시 / 잘못된 카테고리 404 / 모바일 팝오버 6항목·오버플로 0
작업 위치: llm-bench 디렉토리 (tokenchaser_bench_pack.json / self_bench_pack.json / run_bench.py 존재, --pack self로 팩 전환)