Lab Board
진행 중인 실험과 완료된 Project를 상태와 주제별로 찾아봅니다. 개별 실험의 상세 기록은 각 Project 페이지에서 확인할 수 있습니다.
Experiments
AI 모델·에이전트·자동화의 가설을 검증하는 실험
AI 완전 자율 블로그 운영 실험
AI가 주제 선택부터 조사·작성·검증·발행까지 스스로 결정하는 독립 블로그 운영 실험
Project Finding
Agent Field Notes의 run contract는 편집 사이클 상태와 저장소 candidate 상태를 명시적으로 분리해야 하며, validator 정규화가 그 경계를 보장합니다.
StockPulse V1 Fixed
AI의 KOSPI·KOSDAQ 예측을 실제 장 마감 결과와 비교하고, 평가와 다음 개선 방향을 기록하는 실험
StockPulse v1 자기개선 실험
일일 KOSPI 예측을 저장하고 실제 결과를 평가한 뒤 LLM·ML 개선을 시도하는 자동화 루프를 구축한 v1 실험. v1은 자동화 루프의 운영 가능성을 확인했지만, 어떤 개선 전략이 실제 정확도 향상으로 이어지는지는 충분히 규명하지 못했다.
Project Finding
StockPulse v1은 예측→실제 결과 평가→LLM·ML 비교→개선 시도 루프를 실제 운영했지만, 개선 전략이 정확도를 높였다는 효과는 충분히 규명하지 못했습니다. v1은 종료하고 Daily publication은 GitHub Pages로 분리했습니다.
AI Omok Project
AI 오목 엔진 개발 및 자율 개선 실험
Project Finding
현재 오목 실험 조건에서는 LLM 단독 구조보다 ThreatAnalyzer와 탐색 엔진을 결합한 구조가 더 오래 방어했지만, AI가 만든 Minimax 엔진은 Rapfi에 5:0으로 패배했고 자율 개선 루프도 승률을 높이지 못했습니다.
AI Tech v1 자동화 뉴스 실험
AI를 활용한 자동화 파이프라인으로 매일 AI 기술·산업 기사를 작성하고, 생성 결과를 독자 관점에서 평가한 v1 실험
Project Finding
AI 기반 daily 기사 자동화는 실제 운영 가능했지만, 일부 결과에서 사실과 다른 내용과 과장된 표현이 확인되어 v1을 완료 처리했습니다. v2는 source·evidence·quality gate 중심으로 재설계합니다.
Hermes Memory Experiment
기억을 더 많이 저장하는 대신, 항상 알고 있어야 하는 기억부터 정리하면 AI 에이전트의 기억 경험이 달라지는지 검증하는 장기 실험
Project Finding
Phase 1에서 USER.md와 MEMORY.md의 역할을 분리하는 구현은 완료했지만, 실제 기억 경험이 개선됐다는 결론은 새 세션 평가 전까지 확정하지 않습니다.
Luna Agentic Game Development Lab
Hermes Agent와 GPT-5.6 Luna가 로컬 LLM worker·Godot·Forgejo를 연결해 실제 AI 개발팀의 PR·review·merge 루프를 수행할 수 있는지 검증하는 장기 실험
Project Finding
첫 번째 Godot task는 독립 branch·Forgejo PR·Luna review·protected merge·post-merge smoke까지 통과했지만, 더 어려운 task와 장기 운영까지 가능하다는 결론은 아직 검증되지 않았습니다.
Creative Tests
이미지·영상·게임 등 생성형 AI의 가능성을 시험하는 실험
이세계 인스타 여신 마법사 — GPT Image 2 + LTX 2.5
GPT Image 2 캐릭터 기준 시트와 LTX 2.5 native audio I2V를 결합해 같은 인물이 서울에서 이세계의 마법사로 이어지는 60초 프롤로그 숏 무비를 만드는 실험
Project Finding
GPT Image 2 기준 시트를 모든 장면에 참조해도 개별 프레임의 해부학적 품질과 장면 간 얼굴 identity는 별개였고, 최종 영상에서 다른 얼굴로 변하는 현상을 확인했습니다.
AI Game Assets — GPT Image vs LTX 2.5
같은 2D 픽셀 캐릭터를 GPT Image 직접 스프라이트와 LTX 2.5 I2V 프레임으로 각각 만들고 게임 에셋으로 쓸 수 있는지 비교하는 실험
Benchmark Project
Local LLM 초기 실험은 현재 Standard·Custom Benchmark로 분리해 운영합니다.