Kolibri 출시: 주권형 오픈웨이트 모델
요약
Kolibri 출시와 관련하여 주권적 오픈웨이트 모델에 대한 논의가 이루어지고 있으나, 실제 성능 면에서는 Qwen3.8 27B 등 경쟁 모델 대비 열세라는 지적이 많습니다. 또한, '주권' 확보를 위한 기술적/법적 측면(데이터 접근성, 에이전트 스택 완성도)에 대한 근본적인 의문과 논쟁이 제기되고 있습니다.
핵심 포인트
- Kolibri의 독일어 점수는 Qwen3.8 27B보다 낮아 성능 경쟁력이 부족하다는 지적이 있음.
- 모델 호스팅 독립성만으로는 '주권'을 확보하기 어려우며, 에이전트 구성 요소 전체를 통제해야 함.
- 최신 LLM의 우위는 독점적인 학습 데이터에서 나오므로, 데이터 접근성이 핵심 경쟁력임.
- 저작권 침해에 대한 법적 경계가 모호하며, 스캔 자료나 Common Crawl 사용 등 논란이 지속되고 있음.
확장 사고를 켜도 답변이 만족스럽지 않음. Hugging Face 링크를 주고 명시된 요구량보다 적은 RAM에서 llama.cpp로 모델 자체를 실행하는 방법을 물었지만, 모른다는 답과 Hugging Face 탭을 직접 눌러 보라는 안내가 거의 전부였음. 그걸 대신 해 달라고 요청한 것임. 답변 중 자동 스크롤도 매우 불편함. 출처 목록이 거의 즉시 화면을 가득 채우고, 실제 답변은 작은 공간에서 계속 스크롤됨. 위로 올려 처음부터 읽으려 해도 다시 내려가므로 생성이 끝날 때까지 기다려야 함.
Kolibri 자체 벤치마크와 평가 도구에서도 독일어 점수는 Qwen3.8 27B가 79.9점으로 Kolibri의 70.8점을 앞섬.
Cohere 인수가 완료되어 지분 90%를 소유하고 운영도 전부 Toronto에서 하게 되면, 그래도 ‘주권’을 내세울 수 있을까?
그래도 미국과 중국으로부터는 독립적임. 거대 기업 AI의 핵심 문제는 접근 권한과 출력 내용을 통제한다는 데 있음.
산업 전체가 이런 병목에 의존하면 주권과 정반대가 됨. 독립적인 공급자가 여럿이면 적어도 그 위험을 완화할 수 있음.
Aleph Alpha가 새 모델에 들인 노력을 고려하면 놀라운 결과임. Qwen 팀이 방대한 독일어 데이터에 접근할 수 있는 것 같음. 그래도 유럽 내부에서 공개 모델을 만들려는 이런 노력은 매우 반가움.
주권을 내세우려면 먼저 실제로 쓰고 싶을 만큼 경쟁력 있는 모델이어야 함. 지금 그 범주에 드는 건 중국과 미국 LLM뿐이며, Mistral과 Cohere도 다른 나라에서 만들었다는 것 외에는 경쟁력이 부족함. 프랑스와 캐나다는 차라리 중국 LLM을 내려받는 편이 나으며, 접근이 차단돼도 가중치는 남음.
내가 가장 잘 아는 캐나다에서는 ‘주권’이 전략적 가치도 없는 열등한 제품을 인맥 있는 누군가에게 비싸게 사 주는 구실인 경우가 많음.
기존 독일어 문서를 LLM으로 백과사전·질의응답·본문 형식으로 다시 썼다면, 결국 그 LLM의 독일어 백과사전 문체를 학습하는 것 아닌가? 어떤 LLM을 썼는지, 그것을 어떻게 진정한 주권이라 할 수 있는지 궁금함.
주권 문제에 더 관심을 기울이는 건 반가움. 하지만 모델 자체 호스팅은 주권의 일부일 뿐임. 임베딩, 검색, 메모리 등 나머지 에이전트 구성 요소는 어떻게 해결할까? 모든 부분을 직접 통제하는 실용적인 100% 자주적 에이전트 스택을 구축한 사람이 있을까?
LLM 발표에서 ‘주권’을 언급하는 것 자체가 패배 선언처럼 느껴짐. 이 모델은 Qwen3.8 27B보다 성능이 떨어짐.
EU 모델의 성공을 바라지만, 지식재산권 안전성이라는 대목은 의심스러움. 나도 그렇지 않기를 바라지만, 2026년에 학습 데이터를 거리낌 없이 훔치지 않고 조금이라도 경쟁력 있는 모델을 만들 수 있을지 모르겠음.
최상위 연구소 대부분은 처음 훔친 데이터를 대량의 파생 합성 데이터로 세탁하는 단계에 도달한 듯함. 학습 데이터 도용을 꺼리는 쪽은 총싸움에 칼을 들고 나가는 셈이며, 명예롭더라도 패배는 불가피해 보임.
꼭 그렇지는 않음. 최초 판매 원칙을 통해 저작물을 합법적으로 학습에 쓰는 경로가 있음. 출판사들이 아직 학습 전용 대량 이용권 등을 제공하지 않는 듯하지만, 책을 분해해 스캔하는 방식은 여전히 완전히 합법적임.
다른 모델을 증류하는 것 역시 불법은 아니며, 서비스 약관 위반으로 문제 삼더라도 민사 사안임. 복제와 절도도 구분해야 함. 최근 대법원 판결의 표현처럼, 저작권 침해는 권리자의 물리적 지배나 사용권을 통째로 빼앗는 행위가 아니므로 일반적인 절도·횡령·사기와 단순히 동일시하기 어려움. 좋고 나쁨에 동의하지 않더라도 이 차이는 다룰 수 있다고 봄.
덧붙여 글 전체를 읽어 보니 스캔 자료가 아니라 Common Crawl을 쓰는 듯함. 출판물만 저작권 보호를 받는 것은 아니므로 Anna's Archive 못지않게 침해 소지가 있으며, 이 부분은 오히려 원래 논지를 뒷받침함.
그렇지는 않음. 경쟁력 있는 최신 모델의 우위는 독점적으로 확보한 학습 데이터에서 나옴. 데이터 라벨링과 강화학습 환경이 거대한 산업이 된 이유도 이것이며, OpenAI와 Anthropic은 필요한 데이터를 얻는 데 수십억 달러를 쓰고 있음. 연구 수준의 수학이나 고급 사이버보안 능력이 공개 데이터를 더 학습하는 것만으로 생긴다고 보는 걸까?
진정한 주권 확보 노력이라면 여기에 대규모로 투자할 수 있음. 중국을 무엇을 ‘훔쳤다’고 비난하든, 중국도 자체 데이터를 대량으로 생성하고 있을 것임. 미국 연구소 밖에서는 아마 가장 주도적으로 이런 일을 하는 국가일 것임.
지식재산권 문제는 이미 시효가 지난 것 아닐까? 다른 방식으로 충분한 데이터를 만들기 어려워 대부분의 모델이 다른 모델의 출력으로 학습할 가능성이 큼. AI 붐 이후 만들어진 GitHub 저장소 역시 지식재산권 문제가 있는 모델이 생성했을 수 있어 출처를 알기 어려움.
이제 ‘깨끗한’ 데이터만으로 학습하기는 섞인 달걀을 되돌리는 것과 같음.
적어도 벤치마크상 78B A3B인 이 모델은 Qwen3.6 35B A3B 정도의 성능이라 아주 나쁘지는 않음. 손실이 크지 않은 양자화를 적용하면 RAM 96GB 정도에서 무난히 실행 가능해 보임.
다만 Qwen3.6 35B A3B는 코딩에 그리 유용하지 않음. 최소 Qwen3.8 27B 정도는 원할 텐데, 이를 비교적 무난하게 실행하려면 시스템 RAM이 아니라 VRAM이 최소 32GB 필요함.
따라서 취미 사용자에게 경쟁력 있는 모델은 아니며, 코딩용으로 선택하려면 다른 대안이 상당히 부족해야 할 것임. 그래도 규제 산업에서 추가 하드웨어 비용을 감수한다면 아주 나쁜 선택은 아님. 정보 추출이나 Jev 같은 분류기 용도로는 괜찮을 듯함. llama-server로 거의 모든 GGUF 모델을 분류기로 만들 수 있으며, 예제 코드는 pi.dev codemode를 참고하면 됨. 아직 본격적인 경쟁자는 아니지만 최소한의 신뢰성은 갖춘 듯함.
맞춤형 토크나이저가 실제 사용에서도 더 나은지 궁금함. 예시는 흥미로워 보임.
여전히 출처 표시 없이 내 지식재산을 훔침. 외국의 도용 대신 국가가 승인한 주권적 도용이 생긴 셈임.
커뮤니티 주도 LLM 배포판을 만들 수 있을지 궁금함. 분산 학습을 함께 실행하고, 정기적으로 출시하며, 가중치와 자유·오픈소스 코드를 모두 공개하는 형태임. 공개 학습 데이터만으로도 웹 검색·정보 종합·코딩 등 대부분의 용도에 충분한 모델을 만들 수 있지 않을까? LLM의 Debian 같은 전환점까지 얼마나 남았는지 궁금함.
4비트·8비트 양자화는 고려하지 않고 고사양 소프트웨어를 권장하면서도, 저렴한 하드웨어에서 좋은 처리량을 낼 수 있는 A3B를 사용한 점이 흥미로움. Qwen3.8-Flash-Next의 방식을 따를 수 있다면 VRAM 요구량을 크게 줄이는 이점을 누릴 수 있을 것임.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기