오픈 웨이트 AI가 Kubernetes의 순간을 맞고 있음
요약
오픈 웨이트 AI 모델이 기술적 규제와 시장 가격 형성 측면에서 Kubernetes와 같은 중요한 위치를 차지하고 있습니다. 중국 모델 규제의 실효성 문제와 오픈 소스 모델이 제공하는 추론 비용의 기준점 역할을 분석합니다.
핵심 포인트
- 오픈 웨이트 모델은 기술적 규제가 어려우며 미국 기업의 준수 강제로 인한 시장 이동 가능성이 있음
- 공개 가중치 모델은 AI 추론 비용의 합리적인 기준선을 제공하여 시장 예측 가능성을 높임
- AI 모델 생태계가 Kubernetes처럼 기업 공동 기여를 통한 표준 모델로 발전할 가능성 제시
중국 모델 금지는 기술적으로 불가능해 보임. 가중치는 숫자일 뿐이라 미국산과 중국산을 구별할 수 없고, 출처 기반 금지는 쉽게 우회할 수 있기 때문임
결국 모든 공개 가중치 모델을 규제해야 하며, 실제로 주요 AI 연구소나 관계자들이 3~5개월마다 행정부에 오픈소스 모델 금지를 제안했다는 Axios 보도도 있음
DRM과 비슷한 라이선스 체계를 강제해 인증된 미국 모델만 자체 서버에서 실행하게 할 수는 있지만, 대형 연구소에 독점권을 주고 파생 모델 배포도 막게 됨. 해외에는 집행하기 어려워 결국 미국인만 제한받을 가능성이 큼
오픈소스 모델 금지는 소프트웨어가 그랬듯 빠르게 수정헌법 제1조와 충돌할 것임. 현대판 DeCSS 깃발은 “좋은 가중치는 {...weights go here...}라고 생각한다”는 문자 형태가 될 수 있음
대신 중국 기업이나 중국 기업이 소유한 사업자에 추론·AI 서비스 대금을 지급하는 행위는 금지할 수 있음
미국 정부가 중국 공개 모델 기업을 Entity List에 올리면 미국과 거래하는 모든 회사가 이들과 거래하지 못하게 됨. 모델의 출처를 완벽히 식별하기 어려워도 처벌이 강하므로 미국 기업은 명백한 중국 모델의 제공·사용은 물론 우회도 시도하지 않을 가능성이 큼
정부 기관이 Hugging Face의 모델 목록을 만들고 접근 제공을 금지하면 충분함. 무서운 법률 문구가 없어도 금지 목록만으로 미국 기업과 호스팅 사업자는 해당 모델을 서버에서 실행하지 않게 될 것임
미국 기업에는 준수를 강제해 Hugging Face에서 모델을 내리게 할 수 있지만, 해외에 대체 서비스가 생기면 모두 그쪽으로 이동할 것임. 결국 미국에 손해인 결과가 됨
모델도 소프트웨어이므로 FedRAMP 인증이 필요한 고보증 환경에서는 사용을 금지할 수 있음. 하지만 미국에는 Great Firewall이 없으므로 인터넷을 통한 반입 자체를 막는 것은 불가능함
AI 업계에서 가장 이상한 부분 중 하나가 토큰 가격 체계임. 2023년 초 GPT-4가 매우 비쌌다가 6개월 뒤 20달러로 상당한 추론량을 쓸 수 있게 된 이유가 불분명하고, 여러 연구소와 공급자의 가격은 수년간 뚜렷한 근거 없이 오르내렸음
공개 가중치 모델은 최소한 추론 비용의 기준선을 제공해 가격을 합리화하고 예측 가능성도 높여 줌. Kimi K3가 나와도 원한다면 K2를 계속 쓸 수 있으므로, 공개 모델의 경쟁 압력과 지속성이 사용자에게 유용함
가격은 가용 연산 자원과 경쟁 환경에서 시장이 감당할 수준으로 정해지며, 여러 가격대를 시험해야 발견할 수 있음. 공급자들이 다양한 요금제와 할인을 시험하는 동시에 수요도 변동 중임
안정된 성숙 시장에 익숙하면 혼란스럽겠지만 신생 시장의 가격 변동은 흔한 특징임
GPT-5 출시 뒤 GPT-4o 폐지에 큰 반발이 있었듯, 모델마다 고유한 특성이 있고 일부 용도에서는 이전 모델이 최신 모델보다 나을 수 있음. 연구소들이 LTS 릴리스를 제공할 의지가 없어 보인다는 점에서 구형 모델을 계속 실행할 수 있는 능력이 특히 중요함
FlashAttention의 영향이 매우 컸음
처방약은 비싸고 복제약은 저렴한 것처럼, 연구개발비 회수를 위한 인위적 가격 부풀리기일 수 있음
GPT-4 자체의 가격을 실제로 내렸는지는 의문임. API의 오래된 버전은 여전히 매우 비싸고, Turbo 등 새 모델이 나오며 가격이 내려갔을 뿐임
이름에 모두 gpt-4가 들어가도 내부 모델이 같다는 뜻은 아니며, 서비스 비용을 낮추려고 상당 부분을 변경했을 수 있음
Kubernetes 같은 위치에 도달하려면 학습 데이터가 공개된 AI 모델을 여러 기업이 공동 개발해야 할 것임. Linux에 기업들이 함께 기여하듯, AI 모델은 사업에 필요하지만 자체 개발은 너무 비싸므로 공개 모델을 사용하고 필요한 기능을 기여하는 방식이 합리적일 수 있음
OpenAI도 당시 기준으로 우수한 오픈소스 모델 두 개를 공개했음. 20B 모델은 집에서 텍스트 검토나 Bash 스크립트 초안 작성에 훌륭하지만, 120B는 소비자용 하드웨어에서 현실적인 초당 토큰 속도로 돌리기 어려움
다만 OpenAI가 이 모델들을 더 자주 갱신하면 좋겠음
Sam Altman은 GPT-3 출시 2년 반 뒤 이사회 이메일에서, 로컬로 실행되는 GPT-3급 모델을 만들면 다른 이들의 동급 모델 공개를 억제하고 신규 사업의 자금 조달을 어렵게 할 수 있다고 썼음
중국은 기술 수준을 끌어올리려고 공개 모델을 내놓지만, OpenAI와 Sam은 경쟁자를 억누르려는 목적으로 공개한다는 차이가 있음
OpenAI의 모델은 괜찮지만 출시 당시 Qwen3 Coder A3B 같은 대안보다 경쟁력이 높지 않았음. 스타트업이라면 한동안 후속작도 없던 OpenAI의 첫 모델보다 여러 차례 공개 가중치 업데이트를 제공한 Qwen3를 선택할 이유가 큼
미국 연구소의 최전선 모델을 원하는 스타트업에는 현재 출시 주기가 지속 불가능함. 미국이 이 시장을 완전히 넘겨주지 않으려면 OpenAI 등이 빠르게 속도를 높여야 함
중국이 하드웨어 생산을 확대하기 전까지는 자체 실행이 경제적이지 않지만, 공개 모델이 연구소에 압력을 가한다는 점은 긍정적임. 결국 휴대전화가 대부분의 작업에 충분한 모델을 실행할 수 있게 되면 Apple이 승리할 가능성이 큼
Model-on-Chip이 다가오고 있음. GPU는 범용 연산 장치라 모델 추론에 큰 병목이 있지만, 칩에 새긴 모델은 크게 갱신할 수 없더라도 성능 이득이 막대함
최첨단 반도체 공정도 필요하지 않아 비용을 대폭 낮출 수 있음
그렇게 되면 하이퍼스케일러와 Oracle에는 끝이나 다름없으니 그날이 기대됨
거품 이전 가격 기준으로 128GB Strix Halo는 1,400달러에 약 200W를 사용했고, 네 대를 묶으면 1조 매개변수 최전선 모델을 실행할 수 있음: https://www.amd.com/en/developer/resources/technical-article...
노드당 Claude Code 구독료 7개월치로 계산하면 28개월 만에 투자비를 회수하며, 5년 감가상각 기준으로는 클러스터 두 개를 거의 손익분기 비용에 마련해 동시 요청 흐름 두 개를 처리할 수 있음
차세대 하드웨어는 이미 발표됐고 무어의 법칙 두 주기 정도 뒤에 출시될 예정이며, 안정된 가격은 2024년 가치 기준 1,400달러 이하이면서 더 빠를 가능성이 큼
금융 거품이 꺼지고 연구소의 데이터센터용 하드웨어 구매가 멈추면 로컬 추론이 구독보다 저렴하고 매우 실용적으로 바뀔 것임. 그때 UNIX Surplus가 닷컴 붕괴 뒤처럼 추론 서버를 헐값에 팔지, 아니면 전력 요구량이 가정용으로 너무 특수할지가 궁금함
코딩 외 작업이라면 양자화 모델을 밤새 실행하는 것으로 대부분의 요구를 충족할 수 있음
집의 데스크톱에서 모델을 실행하고 휴대전화 앱으로 사용 중이며, 모델과 용도에 따라 초당 60~140토큰이 나옴. 음성 대화를 유지하기에도 충분히 빠름
정부가 특정 API 사업자에 영구적으로 종속되기보다 이식 가능하고 상호운용되는 시스템을 조달해 수요를 만들자는 방안에는 가치가 있음. 연방정부뿐 아니라 California, Colorado, Illinois, New York 같은 주정부도 시행할 수 있음
공개 가중치 모델로 에이전트형 코딩을 하는 실제 구성이 궁금함. 어떤 실행 도구와 모델을 쓰고 월 비용은 얼마인지, Claude Code와 Pro 같은 보조금형 요금제와 비교하면 어떤지 알고 싶음
공개 모델이 저렴하고 효율적이라는 말이 실제로도 맞는지 확인하고 싶음
예전에는 맞춤 실행 도구를 썼지만 도구들이 좋아져 구성을 크게 단순화했음. 기반 모델도 코드의 어려운 부분에서는 실패하므로 기회가 맞을 때만 활용함
Zed에서 로컬 모델 세 개를 사용함: RTX 3090 한 장의 llama.cpp에서 128K 문맥 Qwen 3.6 27B가 초당 약 50토큰, Titan V 한 장과 GTX 1080 Ti 두 장의 llama.cpp에서 전체 문맥 Qwen 3.6 35B-A3B가 약 30토큰, GPT-OSS 120B는 CPU에서 느리게 실행됨
Zed의 병렬 에이전트를 사용해 작업을 전환하고, 모델이 막히면 중단해 코드를 고침. 이 방식으로 집중을 유지하고 유지보수 가능한 코드를 만들면서 목표의 약 80% 까지 도달함
30년 경력이 있고 코드의 작동 원리를 반드시 이해하려 하므로, 제3자에게 코드 진행을 의존하지 않으면서 단기 이점 대부분을 얻고 있음. GTX 5060 Ti 16GB 두 장이면 널리 구할 수 있는 카드로 Qwen 3.6 35B-A3B에서 초당 약 100토큰이 가능할 것임
최신 클라우드 모델은 초안 토큰 등을 사용해 일반 코딩에는 우수하지만, 도메인 특화 작업에서는 성능이 저하됨. 초안 모델 크기가 기반 모델의 10~20%에 불과하고 최고급 Blackwell GPU도 초당 약 250토큰으로 제한되므로, 기반 수준의 성능 확장에는 MoE나 초안 모델이 필요함
하지만 내 용도는 분포 외(OOD) 문제나 학습 말뭉치에 예시가 적은 문제라 이런 최적화가 불리함. Lamborghini보다 미니밴이 필요한 상황에 가까움
Ryzen 5950X, 메모리 128GB, RTX 3060 12GB에서 자체 실행 도구와 qwen 3.6 35B unsloth 4 bit를 사용 중임
10K 문맥에서는 생성 초당 약 40토큰·프리필 약 500토큰, 100K 문맥에서는 생성 약 25토큰·프리필 약 400토큰이 나옴
먼저 GPT나 Claude로 상세한 단계별 계획을 만들고 Qwen이 따르게 하는 경우가 많음. 경제적인지는 확신하지 못하지만 하드웨어가 이미 있고 지붕의 태양광 덕분에 전력은 큰 문제가 아님
가장 큰 장점은 모든 처리가 완전히 로컬에서 이뤄지고, 실행 도구가 업로드나 원격 측정을 하지 않는다는 사실을 확신할 수 있다는 것임
Kimi K3와 OpenCode를 사용하며 API 종량제로 연속 사용 시 세션 1~2개가 시간당 약 1,000만 토큰과 약 5달러를 소비함
요금제의 제한과 운영 방식을 싫어해 구독형과 비교해 보지는 않았음. Fable, Opus, Gemini보다 눈에 띄게 느리지만 이들의 API 요금보다는 훨씬 저렴함
월 20달러짜리 Ollama Cloud 요금제로 GLM-5.2를 사용 중임. 같은 요금제에서 여러 API 키를 받아 OpenWebUI 서버와 OpenCode, Pi 개발 세션에 쓰고 있으며, 보통 2~4개 세션을 동시에 돌려도 한도에 걸리지 않음
직장에서는 Claude를 제공하는데, Opus 사용료가 업무 시간당 75달러라는 보고를 받았음
OpenCode에서 GLM 5.2 awq4를 사용했는데 회사가 선호하는 Sonnet 4.8보다 낫고 Opus 4.8보다는 조금 떨어졌으며, 개발팀이 필요로 하는 작업 대부분에 충분했음. Sonnet 5보다는 못하지만 토큰이 바닥나지 않음
반면 실행에 H200 네 장이 필요하고, 이 구성으로 문맥을 캐시할 수 있는 사용자는 약 세 명뿐임
Blackwell 장비가 도착하고 Kimi 3 가중치가 실제 공개되길 기대함. 개발자들이 급여의 상당 부분을 토큰에 쓰는 지점에서는 터무니없이 비싼 DGX 서버를 직접 구매해 랙에 설치하고 운영하는 편이 오히려 저렴해짐
중국 정부가 최고 모델의 학습과 공개를 지원해 OpenAI와 Anthropic에 공개 경쟁 압력을 준다는 해석은 믿기 어려움. 오히려 중국 정부가 승인한 정보 배포 방식에 맞도록 최첨단 모델을 강화학습하려는 수단처럼 보임
질문에 답하는 불투명한 시스템을 신뢰해야 한다면, 중국 정부가 승인하고 대규모 보조금을 지급한 모델보다 시장 압력을 받는 미국의 영리 상장기업 모델을 선택하겠음
중국이 다른 시장에서 하듯 제품을 덤핑해 경쟁자를 몰아내는 전략과 일치함. 토큰마다 큰 손실을 보고 있다면 적대자가 소비량을 악의적으로 늘려 비용을 키울 수도 있음
실물 덤핑은 수요가 유한하고 환경 비용이 크지만, 소프트웨어 수요는 사실상 무한하며 생산 비용과 비교한 환경 비용도 낮아서 AI 덤핑 역이용이 가능할 수 있음
중국 모델의 국가 지원 편향에 대응할 도구가 무엇인지 궁금함. 개인이 편향을 쉽게 보정할 수 있다면 영리한 전략처럼 보이지 않음
중국이 앞으로도 최전선 모델 가중치를 계속 Hugging Face에 올릴 것이라는 전제를 자연법칙처럼 받아들이고 있음. 하지만 중국의 Mythos 시점이 몇 달 앞으로 다가왔고, 여러 보도를 보면 중국 역시 비슷하게 대응할 가능성이 큼
중국이 Mythos 후속작을 Hugging Face에 올려 모두가 안전장치를 제거하도록 허용하리라고 믿기는 어려움. 상황은 OpenAI와 Anthropic의 예상대로도, 중국의 예상대로도 흘러가지 않았음
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기