피트니스 앱 개발기: 4종 LLM의 칼로리 측정 및 JSON 구조화 성능 비교
실제 서비스 API 호출 비용과 성능을 비교한 실무 데이터. 모델 선택 시 비용 효율과 정확도를 동시에 고려해야 함을 보여줌.
요약
피트니스 앱 개발자가 칼로리 추정 및 JSON 워크아웃 생성 기능을 위해 4종의 저가형 LLM(gpt-oss-120b, Claude Haiku 5.5, GPT-5.6 Luna, GPT-6 Luna)의 성능을 비교 테스트했다. 칼로리 추정 테스트 결과, Claude Haiku 5.5가 평균 오차 9.5%, 중앙값 오차 1.8%로 가장 높은 정확도를 기록하며 gpt-oss-120b 대비 우수한 성능을 보였다. 속도 면에서는 GPT-6 Luna가 3.4초의 응답 시간으로 가장 빨랐으나, Claude Haiku 5.5도 3.6초로 준수한 성능을 나타냈다. 비용은 gpt-oss-120b가 0.0042달러, Claude Haiku 5.5가 0.0045달러로 큰 차이가 없었다. 이번 실험을 통해 단순히 최신 모델이 항상 최고의 효율을 보장하지는 않으며, 특정 작업의 정확도와 응답 속도를 종합적으로 고려한 모델 선택이 중요하다는 점이 입증되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Newer and Cheaper isn't always better: 4 cheap LLMs compete on calorie estimation and JSON workout building for my fitness app
원문 보기 ↗