LLM 성능 극대화하는 '하네스 엔지니어링': 컨텍스트 관리 및 응답 최적화 기법
모델 재학습 없이도 컨텍스트 관리와 메모리 유지를 통해 동일 비용 대비 성능을 3배 향상시키는 구체적인 워크플로우.
요약
OpenAI는 모델 자체의 재학습 없이 '하네스(harness)' 엔지니어링 개선만으로 성능을 3배 향상하는 방법을 공개했다. 하네스는 모델에게 정보를 전달하고 호출 간 문맥을 유지·관리하는 일련의 코드 체계를 의미한다. 실제로 53K 토큰 환경에서 기존 하네스를 사용했을 때는 13.3%의 성공률을 보였으나, 개선된 하네스를 적용하자 성공률이 38.3%로 크게 상승했다. 구체적인 방법으로는 Responses API에서 'previous_response_id'를 전달해 메모리를 유지하고, context_management 옵션에 'compaction' 기능을 설정해 문맥을 효과적으로 요약하는 방식이 제시되었다. 이는 모델에게 작업 노트를 지속적으로 제공하고, 데스크가 찼을 때 정보를 무작위로 버리는 대신 중요 정보를 압축함으로써 추론 능력을 극대화한 사례다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @undefinedKi: OpenAI just published the trick that makes any model three times stronger on the same token budget Harness engineering. The harnes
원문 보기 ↗