Knowledge 목록으로

PixelGPT 24×24 픽셀아트 LoRA 학습

적용 대기🎨 이미지 · 영상 · 음악2026년 7월 30일2
작성 DevSnack Lab직접 조사·실행 범위는 본문 결과와 한계에 기록

개요

20K 픽셀아트 데이터셋 + SD1.5 LoRA 학습

메모

준비 100% 완료 (데이터 16,492장 전처리, config, 베이스 모델). 학습 실행 승인 대기

조사 상세

PixelGPT 24×24 — 20K + 픽셀아트 LoRA 학습

개요

  • 데이터셋: unstonio/pixelgpt-24x24-20k (Hugging Face, CC BY 4.0)
  • 24×24 네이티브 픽셀아트 스프라이트 20,000개 + 영어 캡션 + 2단계 시맨틱 분류 라벨 (19 family / 133 category)
  • 생성: 2026-07-25, 마지막 업데이트 2026-07-30. 다운로드 3,412 / 좋아요 37
  • 용량: 총 ~9.2MB (train 8.2MB, val/test 각 0.5MB)
  • 스플릿: train 18,000 / val 1,000 / test 1,000 (카테고리 층화, 중복 그룹 같은 스플릿 유지 — 평가 누수 방지)

데이터 규칙 (README 명시)

  • 모든 스프라이트: 네이티브 24×24, 최대 5색, 원본 캡션, 분류 라벨
  • 분류: sentence-transformers/all-MiniLM-L6-v2로 자동 분류 (+직접 매핑 보너스) → 일부 오류 가능성
  • 재균형: 카테고리당 제곱근 할당 + family 상한 (동물 1,978 ~ 탈것 449)
  • 라이선스 CC BY 4.0 — 학습/상업 사용 가능 (저작자 표기 필요)

검증 결과 (2026-07-31, train 전체 스캔)

  • 해상도 100% 24×24, 5색 초과 0건 (2,000개 샘플 검사)
  • 캡션 길이 6~67자 (중앙값 20자)
  • classification_score 중앙값 0.400, 0.2 미만 2.3%
  • quality_score 중앙값 0.509 (스케일 정의 미공개 — 해석 주의)
  • sha256 중복 0건
  • 필드: image, caption, family, category, tags, taxonomy_version, original_index, original_leaf_axis_id, classification_score, classification_margin, quality_score, palette, tile_bg, sha256

게임용 이미지 활용 전략

24×24 네이티브 데이터를 그대로 쓸 수는 없고(베이스 모델 해상도 문제), 다음 파이프라인으로 사용:

  1. 스프라이트를 NEAREST로 512×512 업스케일 (SD 1.5 학습 해상도)
  2. SD 1.5 베이스 + kohya sd-scripts로 픽셀아트 LoRA 학습
  3. ComfyUI / sd-webui-forge-neo에서 LoRA 로드 → 1024px 생성 → NEAREST 다운스케일로 게임 스프라이트[경로] 제작
  4. 캐릭터 시트: 1장에 여러 포즈 생성 후 잘라 쓰기, 타일셋은 img2img 정렬 활용

학습 준비 현황 (2026-07-31) — ⏸ 학습 대기 중

운영 검토로 학습은 보류. 준비만 완료된 상태.
  • 툴: [로컬] (kohya-ss) + .venv` 설치 완료 (accelerate 1.6.0 / transformers 4.54.1 / diffusers 0.32.1, 시스템 torch 2.9.0+cu130 공유)
  • 베이스: v1-5-pruned-emaonly.safetensors (SD 1.5, 4.0GB) — ComfyUI checkpoint 디렉토리에 다운로드 완료, 텐서 검증 완료 (UNet 686 / CLIP 197 / VAE 248)
  • 데이터셋: `[로컬] — 전처리 완료 (train 16,492 / val 921, 512×512 NEAREST 업스케일, 총 140MB)
  • 캡션: "pixelart24, " 트리거 워드 프리픽스 추가 (keep_tokens=1)
  • 설정: `[로컬] — network_dim 32 / alpha 16, lr 1e-4 cosine, batch 8, fp16, gradient checkpointing, cache_latents, 5 epochs
  • 샘플: [경로] (데이터 미리보기 60장, /tmp라 휘발)
  • 학습 실행 명령 (승인 시):

`cd [로컬] && ./.venv[경로] launch --num_cpu_threads_per_process 4 train_network.py --config_file [로컬]