텍스트를 이미지로 압축하여 컨텍스트 비용 절감하기: 'SnapCompact' 기법
텍스트를 고밀도 픽셀 폰트로 렌더링해 이미지로 입력하면 토큰 비용을 약 3분의 1로 절감 가능. 대량의 컨텍스트를 다루는 API 활용 시 유용한 최적화 기법.
요약
Stencil이 공개한 'SnapCompact' 기술은 LLM의 컨텍스트 윈도우 한계 문제를 해결하기 위해 텍스트를 요약하는 대신 이미지로 변환하여 처리한다. 이 기술은 텍스트를 6x10 픽셀 폰트의 밀도 높은 비트맵 이미지로 렌더링한 후 모델에 입력하는 방식을 사용한다. 예를 들어 1568x1568 크기의 PNG 파일은 약 40,000자의 텍스트를 담을 수 있으며, 이는 Anthropic 기준 3,279토큰으로 계산되어 일반 텍스트 토큰 비용인 약 10,000토큰보다 저렴하다. 실험 결과 문자당 40제곱픽셀 이상의 해상도에서 모델이 높은 정확도로 텍스트를 읽어내는 것을 확인했다. SnapCompact는 모델이 단순히 이미지를 보는 것이 아니라 텍스트를 직접 읽어내는 능력을 활용해 컨텍스트 효율을 최적화하는 새로운 접근법을 제시한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arpit_bhayani: When your context window fills up, instead of compacting the text, what if you convert it to an image? This is exactly what was do
원문 보기 ↗