LLM 추론 성능 향상 기법: '코드 검증-모델 생성' 하네스 패턴 실험기
모델 추론 단계마다 코드 검증을 끼워 넣어 환각을 방지하고 정확도를 높이는 검증된 파이프라인 구조 공유.
요약
최근 Reddit의 한 개발자가 4B 파라미터 모델을 대상으로 '코드 검증, 모델 생성(code verifies, model generates)' 패턴을 1개월간 23회 테스트했다. 이 패턴은 모델이 한 번에 추론하는 대신, 각 추론 단계마다 파이썬 코드를 개입시켜 팩트 체크와 산술 연산을 수행하도록 설계되었다. 테스트 결과, 동일 가중치의 모델과 비교해 6-0으로 승리했고, 별도의 추론 모델을 상대로도 5-2의 성적을 기록했다. 하지만 저자는 테스트 과정에서 발생한 실패 모드(failure modes)가 성과보다 더 중요한 통찰을 제공한다고 강조했다. 그는 모델이 추출한 사실과 옵션을 코드 기반으로 검증하고, 산술 연산을 코드에 위임하는 방식의 구체적인 구현 레포지토리를 공개하며 후속 개선 방향을 제시했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I spent a month testing "code verifies, model generates" as a harness pattern on a 4B model — 23 pre-registered runs, ~$207. It beat the same weights 6–0 and a reasoning model 5–2, then my own holdout killed the headline. Full repo + what I'd build differently.
원문 보기 ↗