참고팁Reddit
에이전트의 '지식 축적' 성능 검증: AgentLore 실험 결과
반복 작업 시 에이전트가 이전 지식을 유지·활용하게 만드는 방법론 공유. 오픈소스 활용.
요약
AI 코딩 에이전트의 지식 축적 효과를 검증하기 위해 100회에 걸친 벤치마크 테스트가 진행되었다. 'AgentLore' 프로젝트를 개발한 작성자는 에이전트가 이전 시도에서 얻은 엔지니어링 지식을 저장하고 후속 세션에서 이를 활용해 문제 해결 성공률을 높일 수 있는지 확인하고자 했다. 테스트 과제는 텍스트를 3D 출력 가능한 STL 파일로 변환하는 'text2stl' CLI 구현으로, CLI 동작과 메쉬 지오메트리 등 13개 항목의 통과 여부를 평가했다. 이를 위해 로컬 양자화 모델인 'Qwen3.5-35B-A3B'가 사용되었으며, 각 턴당 40회의 실행 예산이 책정되었다. 전체 실험은 10개 시리즈로 구성되어 각 시리즈당 10회의 독립적인 실행을 거치는 방식으로 설계되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I ran 100 coding-agent benchmark runs to test whether accumulated knowledge helps — how would you improve the methodology?
원문 보기 ↗