Ollama 0.35(올라마 0.35)+, 프롬프트 캐싱 최적화 팁: 타임스탬프는 맨 뒤로
시스템 프롬프트 내 타임스탬프 위치를 뒤로 옮기기만 해도 KV 캐시 재사용률이 높아져 응답 속도가 크게 개선됨.
요약
Ollama 0.35 버전 이상부터 OpenAI 엔드포인트에서 prefill 토큰 처리 속도를 확인할 수 있게 되었으며, 0.40.3 버전에서는 캐시 활용도가 성능에 미치는 영향이 더욱 명확해졌다. KV 캐시는 프롬프트의 첫 토큰부터 공유된 접두사가 일치할 때만 유지되며, 중간에 단 하나의 토큰이라도 다를 경우 이후 내용은 모두 폐기되어 재계산된다. 실제로 qwen2.5:7b 모델을 사용하여 실험한 결과, 324개 토큰의 시스템 프롬프트에서 타임스탬프를 상단에 배치할 경우 캐시 재사용은 4토큰에 그치지만, 하단으로 옮기면 290토큰이 재사용되어 prefill 속도가 64.6ms에서 18.6ms로 개선되었다. 따라서 시스템 프롬프트 상단에 변동성 있는 타임스탬프를 넣는 것은 캐시 효율을 떨어뜨려 모든 턴마다 전체 프롬프트를 재평가하게 만드는 비용을 발생시킨다. 실무자는 프롬프트 설계 시 고정된 내용을 상단에 배치하여 캐시 히트율을 최적화해야 한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Ollama 0.35+ now reports a prefill tok/s on the OpenAI endpoint. On a warm cache it's off by the cache hit ratio (3875 vs 125 tok/s). Plus two other things I measured on 0.40.3.
원문 보기 ↗