참고Reddit
GPT-5.6 Luna vs GPT-6 Astra 코드 리뷰 성능 벤치마크
Luna가 Astra 대비 비용 효율성 측면에서 코드 리뷰 작업에 강점을 보임. 실무 PR 기반 벤치마크 데이터 확인 필요.
요약
Cal.com, Sentry, Discourse, Keycloak, Grafana 등 5개 프로젝트의 실제 PR 50개를 대상으로 GPT-5.6 Luna와 GPT-6 Astra의 코드 리뷰 벤치마크 결과가 공개되었습니다. 성능 측면에서 Astra는 92개의 버그를 발견하여 Luna(69개)보다 높은 검출력을 보였습니다. 반면 Luna는 Astra 대비 비용이 3.6%에 불과하면서도 확인된 버그의 75%를 잡아내는 뛰어난 가성비를 입증했습니다. 연구진은 버그 클래스, 정밀도, 지연 시간, 리뷰당 평균 출력 토큰 등을 기준으로 상세 결과를 분석했습니다. 향후 Astra와 Fable 5.1 모델 간의 벤치마크도 진행할 예정입니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 GPT-5.6 Luna vs GPT-6 Astra: 50-PR code review benchmark
원문 보기 ↗