LLM API 실질 비용, 모델별로 최대 10배 차이 발생
추론(reasoning) 토큰 오버헤드가 비용에 미치는 영향 분석. 비용 최적화 설계 시 참고 자료.
요약
최근 진행된 10가지 실무 과업 기반 LLM 비용 분석 결과, OpenAI, Anthropic, Gemini, Kimi 등 주요 모델 간 실제 비용 격차가 최대 10.6배에 달하는 것으로 나타났다. 이는 모델별 공시 가격 차이가 약 2배인 것과 비교할 때 매우 큰 수치로, 출력값에는 표시되지 않지만 과금되는 추론(reasoning) 토큰이 비용 상승의 주원인으로 분석되었다. 특히 단순 분류 작업에서도 특정 모델은 단 한 단어를 출력하기 위해 197개의 보이지 않는 추론 토큰을 소모하는 사례가 확인되었다. 또한 'CostBench' 연구에 따르면 주요 모델들이 비용 최적화 계획을 수립하는 데 여전히 한계를 보이고 있으며, 실패한 에이전트 작업일수록 토큰 소모량이 급격히 늘어나는 경향이 있다. 실무자는 API 공시 가격뿐만 아니라 모델 내부의 보이지 않는 추론 및 토큰 오버헤드를 고려한 실제 운영 비용 최적화 전략이 필요하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Real task cost across GPT, Claude, Gemini and Kimi, 10.6x spread on models with only 2x price difference [R]
원문 보기 ↗