컨텍스트 윈도우(Context Window)가 가득 찼을 때, 텍스트를 압축하는 대신 이미지로 변환한다면 어떨까요? Stencil이
요약
컨텍스트 윈도우 제한 문제를 해결하기 위해 텍스트를 이미지로 변환하는 Snapcompact 기술을 소개합니다. 텍스트를 픽셀 폰트 비트맵으로 렌더링하여 토큰 비용을 약 1/3 수준으로 절감하면서도 모델이 내용을 정확히 읽을 수 있게 합니다.
핵심 포인트
- 텍스트를 이미지로 변환하여 컨텍스트 압축 효율 극대화
- 일반 토큰 대비 약 1/3 수준의 비용 절감 효과
- 문자당 약 40 제곱 픽셀 크기가 성능 유지의 임계점
- 모델이 이미지를 단순 시각 정보가 아닌 텍스트로 인식하여 처리
컨텍스트 윈도우 (Context Window)가 가득 찼을 때, 텍스트를 압축 (Compacting)하는 대신 이미지로 변환한다면 어떨까요? 이것이 바로 Stencil이 Snapcompact라고 부르는 기술을 통해 수행한 방식입니다.
핵심 트릭은 간단합니다. 전체 컨텍스트를 조밀한 픽셀 폰트 비트맵 (Bitmap)으로 렌더링하여, 요약하여 없애는 대신 모델에게 이미지로 다시 전달하는 것입니다.
1568x1568 PNG 이미지는 6x10 픽셀 폰트로 렌더링된 약 40,000자의 텍스트를 담을 수 있으며, Anthropic은 이 이미지를 단 3,279 토큰 (Tokens)으로 청구합니다. 동일한 텍스트를 일반 토큰으로 처리할 경우 약 10,000 토큰이 소요됩니다. 모델은 입력 비용의 약 1/3 수준으로 이미지를 거의 그대로 읽어냅니다.
흥미롭게도 폰트 크기가 중요합니다. 그들은 크기를 다양하게 변화시켜 보았고, 문자당 40 제곱 픽셀 (sq. px) 부근에서 급격한 변화를 발견했습니다. 이 임계값(Threshold)보다 크면 전사 (Transcription) 성능이 완만하게 저하되지만, 이보다 작으면 모델이 아무것도 읽지 못합니다.
요약하자면, 이 SnapCompact 기술을 통해 우리는 텍스트를 이미지로 압축할 수 있다는 것을 알게 되었습니다. 왜냐하면 모델은 단순히 컨텍스트의 사진을 보는 것이 아니라, 그것을 읽고 있기 때문입니다.
도움이 되길 바랍니다.
-- tdd[.]cat에서 발견함
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Claude/Anthropic의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기