AI 경쟁이 난처해졌다
요약
본 글은 AI 모델의 '증류(Distillation)' 과정을 둘러싼 지식재산권과 경제성을 비판적으로 분석합니다. 초기 학습에 막대한 비용이 드는 현 상황을 문제 삼으며, 오픈소스 생태계 구축의 중요성과 대규모 데이터셋 접근성 문제를 제기합니다. 궁극적으로 AI 기술 주도권을 둘러싼 국가 및 기업 간의 전략적 경쟁 구도를 논하고 있습니다.
핵심 포인트
- AI 모델 개발은 초기 학습 비용이 가장 큰 장벽이다.
- 지식재산권과 특허는 방법론을 보호하려는 경제적 장치다.
- 오픈소스 생태계 구축과 데이터 접근성 확보가 중요하다.
- LLM 기술 경쟁은 단순한 성능 경쟁을 넘어 국가 전략의 영역이다.
중국 연구소가 Anthropic 모델을 증류하는 게 왜 문제인가? Anthropic 모델도 결국 다른 사람들의 작업을 증류한 것 아닌가? 자신은 하면서 남에게는 하지 말라는 태도로 느껴짐.
Anthropic이 하는 작업에는 중국 연구소보다 훨씬 많은 자원이 필요함. 자신들이 95%의 작업을 했는데 중국 연구소가 나머지 5%만 하고 자기 것이라고 부르는 게 불만인 셈임.
학습에 쓰인 콘텐츠가 원래 작업의 95%이니 Anthropic도 마지막 5%만 했다고 볼 수는 있지만, 그건 좀 더 철학적인 논의임.
도덕과 윤리 위주로 논의하지만, 실제로는 경제성의 문제로 보임. Anthropic과 OpenAI는 인간의 산출물을 AI 모델로 증류하는 데 막대한 돈을 쓰고, 다른 곳은 훨씬 적은 돈으로 그 모델을 거의 동등한 모델로 증류함. 지식재산권이 존재하는 이유도 같음. 원자나 비트를 특정 방식으로 배열하는 방법을 누가 먼저 적었다고 내가 못 한다는 특허 제도는 터무니없거나 부도덕해 보일 수 있음. 하지만 방법을 알아내고 정리하는 비용이 복제 비용보다 훨씬 크다는 문제를 해결하려는 장치임.
최초 학습 비용이 증류 비용보다 훨씬 크기 때문임. 중국산 모방 제품도 마찬가지로, 신제품 설계에는 많은 돈과 연구개발 시간이 들지만 제품을 사서 역설계하고 재판매하는 비용은 거의 들지 않음.
원래 학습 데이터는 인터넷에서 무료로 구할 수 있었음. 내 생각에는 원작이 그렇게 가치 있었다면 애초에 인터넷에 무료로 올리지 말았어야 함.
AI 과학자 외에는 증류라는 말의 의미를 이해하지 못하기 때문임. 대부분 술밑이나 보드카 증류기처럼 전혀 관계없는 것을 떠올릴 것임. 핵심은 다른 무엇보다 그 단어 자체에 있음.
배운다는 걸 굳이 “증류한다”고 부르는 게 재미있음.
미국 AI 기업이 만들려는 폐쇄적 생태계를 우회할 길을 마련해 주는 중국 연구소에도 고마움을 느낌.
공개된 증류 데이터셋이 있는지 궁금함. BitTorrent로 배포되면 좋겠음. AI가 소수 민간기업에 독점되지 않고 누구나 접근할 수 있게 되는 것이 매우 중요하다고 봄.
권위주의 정권은 친구가 아니며, 자체 모델의 성능이 충분히 높아지는 순간 개방에서 물러날 것임.
증류 데이터셋도 궁금하지만, 실리콘밸리 스타트업들이 사용하는 TB 규모 학습 데이터셋이 공개되어 있는가? 아니면 모두 직접 수집 파이프라인을 만들어야 하는가?
취지에는 동의하고 싶지만, 최첨단 성능을 끌어올리는 데는 수억~수십억 달러가 들었고 앞으로도 그럴 것으로 예상됨. 오픈소스와 증류 모델은 훨씬 저렴하게 뒤따를 수 있지만, 이 막대한 비용을 고려하면 최첨단 개발까지 누구나 할 수 있게 되기는 상상하기 어려움.
OpenAI가 애초에 대규모 민간 투자를 받아야 했던 이유도 여기에 있음.
가장 설득력 있는 해석은 중국 공산당이 LLM의 범용 상품화를 목표로 한다는 것임. LLM은 궁극적으로 중국이 지배하는 제조업의 보완재가 될 것이고, 자기 사업의 보완재는 저렴하고 흔하게 만드는 편이 유리함.
폭넓은 오픈소스 공개도 선의가 아니라, 경쟁자를 늘리고 미국 연구소에 권력이 지나치게 집중되지 않도록 하는 중국 정부의 전략으로 봄. 그 과정에서 미국 연구소가 이익을 얻어도 마찬가지임.
연구소마다 전략이 다른데도 LLM 공개 결정을 공산당이 중앙에서 통제한다고 가정하므로 설득력이 떨어짐. Weibo는 소형 모델 연구를 공개하지만 최첨단 경쟁에는 참여하지 않는 듯하고, Bytedance와 iFlyTek은 대형 모델을 학습하면서도 연구 세부사항을 거의 공개하지 않고 가중치도 공개하지 않음. Alibaba와 Baidu는 사안별로 공개 여부를 결정함.
중국 LLM 기업이 모두 모델을 오픈소스로 공개해야 한다는 규칙은 없으며, 실제로 공개하지 않는 곳도 많음.
중국의 무료 모델을 너무 쉽게 칭찬하지만, 자유·오픈소스 소프트웨어에 대한 신념 때문에 공개하는 것은 아님. 중국이 앞서게 되면 곧바로 소스와 가중치를 닫을 것임.
중국은 어차피 끝없는 가격 인하 경쟁이 될 것으로 보고 잠재적 수익보다 소프트파워를 중시할 수도 있음.
역사적으로 그곳에 진짜 가치가 있지 않다고 판단했을 가능성도 있음. FAANG 기업들은 학습 데이터와 독점적인 특수목적 모델에 가치를 두고 알고리즘과 공개 가중치 모델을 내놓아 왔음. Google도 Transformer 구조와 BERT 가중치를 공개했지만, 수익을 내는 제품 뒤에서 작동할 것으로 추정되는 특수한 내부 모델은 공개적으로 거의 이야기하지 않음.
그 논리는 중국뿐 아니라 어느 정부에나 적용되지 않는가? 긍정적 외부효과를 만드는 복제하기 쉬운 제품이라면 모두 마찬가지임. 일부 미국인이 모든 것은 희소해야 한다는 사고방식 때문에 AI도 희소재로 보는 것일 뿐임.
중국 AI 모델의 성능이 뛰어나다는 사실이 정말 고마움. 인간이 매일 불필요하게 겪는 수많은 질병을 치료하고 싶고, 그러려면 지금보다 강력한 모델이 필요함. 중국은 발전 속도를 높이는 데 필요한 경쟁을 만들어 줌.
가능한 한 빨리 나아가자는 입장이 요즘 인기가 없다는 것은 알지만, 나는 종말 확률 10% 시나리오보다 우리가 할 수 있는 좋은 일에 훨씬 관심이 큼. 소아 뇌암 자선단체에서 봉사하며 네 살 아이가 또 죽는 모습을 보고 싶지 않음. 이를 막기 위해서라면 어떤 위험도 감수할 의향이 있음.
종말 확률 10%를 믿지 않는다는 뜻인가, 아니면 그 위험을 감수할 만하다는 뜻인가? 정말로 어떤 위험이든 감수한다는 것은 후자뿐임.
의학을 잘 몰라서 궁금한데, 직접 AI를 어떻게 쓰고 있으며 의료계 전반에서는 어떻게 활용하는가?
그런데 AI가 이란의 학교 아이들을 죽이는 데 쓰이는 것은 괜찮은가?
Qwen 3.8 27b를 5090에서 로컬로 2주 넘게 돌리고 있으며, 속도는 초당 170토큰임. Opus 4.6급 모델이며, 9개월 전의 최첨단 모델이 소비자용 하드웨어에서 돌아가는 셈임. 증류와 가지치기가 1년 뒤 어디까지 발전할지 모를 일임.
지금 5090이 9,000달러나 하는가?
나는 3.8을 계획 수립 외의 용도로는 거의 포기했음. 복잡한 코드이긴 했지만 기본적인 단위 테스트를 작성하게 했더니, 한 줄도 쓰기 전에 문제를 고민하고 코드베이스의 엉뚱한 부분을 반복 탐색하다 문맥 한도를 소진했음.
추론량을 줄이면 조금 나아졌지만, 그러면 Qwen Coder보다 별로 낫지 않았음.
Opus 4.6과 비교한 성능은 어떻게 평가하는가?
이 추세가 이어져서 1년 안에 Opus 5.5급 모델을 조금 더 큰 로컬 하드웨어에서 돌릴 수 있을 것으로 보는가?
지금까지 실제로 써 보니 어떤가?
중국 연구소가 적자에 빠진 서구 연구소에 구명줄을 던졌다는 해석과 달리, 의도한 것은 아니겠지만 서구 연구소에는 상당히 나쁜 일이라고 봄.
낙관론의 핵심은 연간 반복 매출이 1년도 안 돼 100억 달러에서 1,000억 달러로 커지고, 수조 달러 규모로 상장할 것이라는 이야기였음. 이후 5,000억 달러, 1조 달러로 성장한다는 전망이 추가 투자를 정당화했지만, 그 매출은 그저 추론이 비쌌기 때문에 발생한 것임.
상장 전에는 매출 성장 서사가 전부임. 매출이 1,000억 달러에서 500억 달러로 줄면 흑자가 되더라도 OpenAI와 Anthropic에는 매우 나쁘게 비치며, 성장 서사가 완전히 무너짐.
한계비용이 급락한다고 매출까지 줄어야 할 이유는 모르겠음. 실제로든 인식상으로든 최고의 모델을 보유하고, 기업 고객이 만족하는 보안과 지식재산 보호를 보장하며, 같은 보장을 제공하는 경쟁사가 가격을 깎지 않는다면 높은 매출과 이익률을 함께 유지할 수 있음. 경쟁사도 굳이 바닥을 향한 가격 경쟁을 벌일 이유가 있는가?
중국 공산당 이념이 이윤을 부정적인 의미의 지대로 보고, 서구 기업이 높은 이익률을 누리지 못하게 하려 한다는 해석도 접했음.
너무 비싸서 곧 망한다는 이야기와 추론이 너무 싸서 곧 망한다는 이야기를 오가는 것이 우스움. 나는 이런 이야기를 진지하게 받아들이지 않으며, 자본주의 작동 방식을 이해하지 못하거나 악의적으로 접근한다고 봄.
시장과 수요는 계속 변하며 일부 AI 기업은 당연히 실패할 것임. AltaVista와 Yahoo가 쇠퇴했다고 검색이 사라졌는가? Microsoft 휴대전화, Nokia, Motorola도 마찬가지임. OpenAI와 Anthropic은 추론 사업이 아니라 제품과 솔루션을 팔아야 함. 추론 자체는 범용 상품임.
성능 최적화는 서구 연구소뿐 아니라 더 강력하고 유용한 LLM을 로컬에서 돌리는 데도 도움이 됨. 로컬 LLM이 충분히 좋아지면 ChatGPT와 Claude 구독을 중단하는 사람이 생겨 매출에 타격을 줄 것임.
거의 모든 작업에 가장 빠르고 똑똑한 모델을 원함. 오래된 모델에 일을 시키는 경우는 극히 드물며, 더 새롭고 크고 똑똑한 모델이 더 잘 처리함.
따라서 아직 충분히 좋다는 수준과는 거리가 멀다고 봄. 지금 증기기관차로 출근하지 않는 것도 충분히 좋지 않기 때문임.
이런 전환이 본격화되지 못하는 유일한 이유는 데이터센터 증설이 현재와 미래의 GPU 공급을 독점하기 때문임.
성능 최적화는 로컬·공개 모델에는 이롭지만 OpenAI와 Anthropic에는 해롭다고 봄. 저렴하거나 공개된 대안 모델이 두 회사에 위협이기 때문임. 공개 모델의 확산과 두 회사의 재무적 성공은 근본적으로 충돌함.
그래서 공개·저가·고효율·중국 모델을 없애려고 온갖 수단을 동원하는 것임. 이 글도 40분 전에는 참여가 활발한 HN 최상단 글이었는데 지금은 5페이지에 묻혔으니, 참 정상적이고 정당한 일임.
추론이 수익을 내지 못했다는 것은 널리 퍼진 오해임. Kimi K3 기반 분석을 보면 OpenAI와 Anthropic의 이익률은 95%를 훨씬 넘는 것으로 추정됨. https://inferencex.semianalysis.com/run/kimi-k3-on-b200.
최근 몇 달 동안 OpenAI가 추론 효율에서 돌파구를 찾았다는 소식도 여러 번 봤음. 미국 선도 연구소에 자체 최적화가 없다거나, 이번 최적화를 DeepSeek에서 배웠다고 믿을 이유는 없음.
이미 자체 최적화가 있었더라도 DeepSeek 때문에 가격을 크게 내려야 했다면 이익률이 깎이는 것은 마찬가지임.
95% 이익률은 매우 비현실적임. Anthropic은 최근 매출 배분, 학습비 등 여러 비용을 제외한 조정 EBITDA 기준으로 매출총이익률이 80%라고 밝혔음. 추론 이익률이 정말 그렇게 높다면 비표준 지표를 내세우지 않을 것임.
싸움을 잘하는 자는 적을 움직이게 하고 적에게 끌려가지 않는 법임.
중국 연구소는 증류로 과도한 학습 비용을 피하는 방법을 찾아냈음. 그러면 최첨단 연구소는 망신과 뒤처짐을 피하려고 대부분의 비용을 부담하면서 더 빨리 더 좋은 모델을 만들어야 함. 중국 연구소는 이를 계속 증류하거나 다른 기법을 적용하면 되니, 최첨단 연구소로서는 곤혹스러운 외통수임.
안전장치가 승인되지 않은 사이버보안 작업을 막는다면서 동시에 중국 모델의 사이버보안 능력이 증류 덕분에 좋아진다고 믿으려면 상당한 이중사고가 필요하다는 게 정말 우스움.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기