5주간 4차례 인하: 에이전트 구동 비용, 바닥으로 향하다
모델 추론 비용은 급락 중이나 웹 접근·지역별 콘텐츠 확보가 새 병목. 인프라 설계 재검토 필요.
요약
최근 5주 동안 AI 에이전트 구동 비용이 4차례 인하되며 운영 효율이 급격히 개선되고 있다. 7월 30일 OpenAI는 GPT-5.6 Luna의 입력 토큰당 가격을 80% 인하하여 100만 토큰당 0.20달러로 조정했다. 7월 31일에는 DeepSeek가 V4-Flash 베타 모델을 통해 에이전트 작업 성능을 향상시켰고, 8월 3일 알리바바는 2.4T 파라미터 규모의 Qwen3.8-Max를 100만 토큰당 2달러에 출시하며 가중치 공개 계획을 밝혔다. 8월 4일 Liquid AI는 스마트폰 환경에서 초당 30토큰 속도로 도구 호출이 가능한 2.6B 에이전트 모델을 선보였다. 이러한 변화로 AI 추론 비용은 거의 무료에 가까워졌으나, 모델 자체보다 실시간 웹 데이터에 대한 접근성이 향후 경쟁의 핵심이 될 전망이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @teneo_protocol: The cost of running an agent fell four separate times in five weeks. - 30 July: OpenAI cut GPT-5.6 Luna by 80%, to $0.20 per milli
원문 보기 ↗