AI 경쟁의 판도가 어색해지다
요약
본 기사는 AI 모델 경쟁 구도의 변화를 분석하며, 서방 연구소들이 중국 연구소들의 기술 발전을 수용하는 추세에 주목합니다. 특히 DeepSeek이 KV 캐시 최적화에서 획기적인 성과(토큰당 890바이트)를 공개한 것이 핵심입니다. 이는 장문 컨텍스트 모델의 VRAM 비용을 크게 낮추어, 서방 기업들이 추론 마진 개선에 집중하게 만들고 있습니다.
핵심 포인트
- DeepSeek이 KV 캐시 최적화 기술(MLA, CSA2 등)을 대거 공개하며 업계를 선도함.
- KV 캐시 크기 감소는 장문 컨텍스트 모델의 VRAM 및 운영 비용 절감에 결정적임.
- 서방 기업들(Anthropic, OpenAI)은 중국 측의 최적화 성과를 수용하여 추론 마진 개선에 집중하고 있음.
- 최신 플래그십 모델들은 캐시 읽기 비용을 대폭 낮추는 방향으로 진화하고 있음.
요즘 뉴스 헤드라인을 읽으면, 서방 연구소들이 중국 연구소들에 의해 대규모로 압도당하고 있다고 생각해도 무방할 정도입니다.
증류(Distillation) 드라마
Anthropic이 중국 측이 모델들을 어떻게 증류하는지, 이것이 인류 자체에 위험이 된다는 등의 기사를 발표하지 않는 주가 없습니다.
이는 나중에 이러한 모델들이 법적, 규제적으로 제약을 받도록 기반을 마련하는 데 그들에게 이롭기 때문입니다.
하지만 무분별한 증류의 시대는 끝났다는 것이 분명합니다.
단지 끝난 정도가 아닙니다. 요즘 새로운 흐름은 중국 연구소들의 발전을 수용하고 있습니다. Anthropic이 경향적으로 사용하는 비방이 가득한 '도둑질'이라는 단어 대신 제가 이 용어를 사용한다고 주목해 주십시오.
그 이유는 서방 기업들과 달리, 중국 측은 자신들의 레시피를 거의 공짜로 풀어놓고 있기 때문입니다.
다른 게임의 양상
가장 최근에 아무런 인정 없이 복사된 것은 DeepSeek이 전 세계에 아낌없이 공유한 KV 캐시 최적화에서의 획기적인 발전입니다.
이는 코딩과 같이 긴 세션 컨텍스트를 사용하는 특정 사용 사례에서, DeepSeek-V1 대비 약 437배의 계수로 KV 캐시 크기를 떨어뜨린 놀라운 최적화입니다.
그들은 MLA 아키텍처를 처음 공개하여 캐시를 약 15배 압축했고, 이어서 'Compressed Sparse Attention'과 'Heavily Compressed Attention'을 발표했습니다. 가장 최근의 DeepSeek-V4.1-Flash는 CSA2, Cross-layer cache reuse, 인과적 인코더-디코더 아키텍처, FP4 캐싱을 통해 이를 더욱 발전시켜 글로벌 KV 캐시를 토큰당 890바이트까지 낮췄습니다.
이러한 것들이 왜 중요할까요? 장문 컨텍스트 모델을 서비스하는 데 있어 가장 큰 비용 중 하나는 이 캐시를 GPU 메모리에 담기 위해 필요한 VRAM입니다.
아래 그래프가 이 모든 것이 얼마나 엄청난 일인지를 보여줍니다:
캐시 자금 흐름 추적하기
이것과 같은 등급의 모델이 약 두 달 전만 해도 비용을 비교해 보십시오. 아래 제시된 모든 가격은 100만 토큰당입니다:
매우 조용한 감사 인사
이 모든 것은 서방 AI 기업들이 현재 추론(inference) 마진 측면에서 매우 긍정적이라는 것을 의미합니다.
고급 GPU 접근성 제한은 중국 연구소들로 하여금 성능 최적화를 최우선 목표로 삼게 했으며, 이는 결과물에서 나타납니다.
왜 이런 돌파구를 공짜로 공개하는지 모르겠지만, 그들이 방금 그렇게 했고, 이번에는 Anthropic과 OpenAI 모두 기본적으로 최고 수준이며 이러한 최적화 기술을 활용한 모델을 출시했습니다.
이들은 복제에 대해 약간 민망해하는 것 같습니다. 그래서 Claude Opus 5.5와 GPT-6.1 Sol 모두 큰 사전 공지 없이 조용히 출시되었습니다.
사용자 리뷰는 사용성 측면에서 매우 뛰어나며, 품질 또한 플래그십 모델(Claude Fable 5.1 및 GPT-6 Astra)과 비교했을 때 크게 떨어지지 않는 것으로 보입니다.
캐시 읽기 비용은 채택의 증거입니다. 이 비용이 급격히 하락했습니다: Opus 5.5는 Opus 5 대비 캐시 읽기 가격을 60% 절감했고, GPT-6.1 Sol은 GPT-5.6 Sol의 7월 말 가격 대비 80%를 절감했습니다.
따라서 중국 연구소들이 서방의 적자 기업들에게 생명줄을 던져준 것 같은데, 저는 그 이유를 전혀 알 수가 없습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기