독일의 새로운 주권 AI 모델 Kolibri 소개
요약
Aleph Alpha가 개발한 오픈 웨이트 LLM Kolibri를 소개합니다. 이 모델은 781억 개의 파라미터를 가지지만, MoE 구조 덕분에 토큰당 약 35억 개만 사용하며 효율적입니다. 독일 및 유럽 법률 하에 구축되어 '주권(sovereign)'성을 강조하며, 데이터 주권과 지적 재산권 안전성을 제공합니다.
핵심 포인트
- Kolibri는 MoE 구조로 총 파라미터 대비 낮은 계산량을 자랑함.
- 독일/유럽 인프라 기반으로 개발되어 높은 '주권'을 확보함.
- 데이터가 외부로 나가지 않는 온프레미스 배포에 최적화됨.
- 오픈 웨이트(Apache 2.0) 모델로, 투명성과 접근성이 높음.
Kolibri는 Aleph Alpha가 개발한 오픈 웨이트(open-weight) 대규모 언어 모델(LLM)로, 독일어와 영어 두 가지 언어를 지원합니다. 이 모델은 780억 개의 파라미터를 가진 전문가 혼합(mixture of experts) 구조이지만, 토큰을 읽거나 쓸 때 약 35억 개의 파라미터만 사용한다는 특징이 있습니다. 이 모델은 2026년 10월 3일에 Apache 2.0 라이선스로 공개되었으며, 가중치(weights)는 Hugging Face에 올라와 있고 독일과 핀란드의 인프라를 기반으로 처음부터 학습되었습니다. (Kolibri는 독일어로 '벌새'를 의미하며, 이 모델의 핵심 특징이 가볍다는 점에서 귀엽습니다.)
저는 독일에 거주하고 있으며, 2024년 뉴욕 SmashingConf에서 제가 근무지를 이야기할 때 미국에서 들었던 말을 청중에게 전했습니다. 저는
| Kolibri 1 |
|
|---|---|
| Parameters | 총 781억 개, 토큰당 34.6억 개 (4.4%) |
| ... |
Aleph Alpha는 Kolibri를 주권(sovereign) 모델이라고 부르며, 그들의 출시 게시물에는 이 의미가 두 가지로 담겨 있습니다. 첫 번째는 구축 방식입니다: “이 팀들은 독일에서 모델을 구축하고, 유럽 및 독일 법률 하에 독일과 핀란드의 인프라 위에서 훈련시켰으며, 외국 통제가 없습니다.” 두 번째는 고객이 얻게 되는 것입니다: “배포의 완전한 자유와 지적 재산권 안전성을 갖추고 있어, 규정 준수가 내재된 속성으로 따라옵니다.” 간단히 말해, 한 부처나 자동차 공급업체는 자체 서버에서 이 모델을 운영할 수 있으며, 데이터가 건물 밖으로 나가는 일이 없고, 아무도 그들 아래에서 모델을 변경하거나 끌 수 없습니다. Aleph Alpha는 또한 유럽연합의 범용 인공지능(General-Purpose AI, GPAI) 행동 강령에 서명했습니다.
주권적이라는 것이 외부로부터 아무것도 들어가지 않았다는 의미는 아니며, 모델 카드 자체에서도 이를 명시하고 있습니다: 영어 웹 텍스트는 Google의 Gemma 4를 사용하여 재구성되었고, 독일어는 Mistral-NeMo를 사용했으며, Qwen3-32B에서 레이블링된 데이터가 품질 필터에 사용되었습니다. 이후 그들은 정치적 편향을 위해 훈련 데이터를 필터링했는데, 이는 자체적으로 중국 오픈 모델들을 통해 측정한 것입니다.
Kolibri 작동 방식
Kolibri는 서로 쌓아 올린 6가지 아이디어로 구성되어 있으며, 각 요소는 독일을 더 저렴하고, 길게, 또는 더 정직하게 만드는 역할을 합니다.
1. 384개의 전문가(experts)와 토큰당 6개 활용
일반적인 (밀집형, dense) 모델에서는 모든 토큰이 모든 파라미터를 거칩니다. 하지만 전문가 혼합(Mixture of Experts, MoE) 방식에서는 각 레이어가 '전문가'라고 불리는 작은 서브 네트워크들의 군집과, 토큰마다 이들 중 일부를 선택하는 라우터로 구성됩니다. Kolibri는 50개의 레이어를 가지고 있으며, 각 레이어에는 384개의 전문가와 모든 토큰이 거치는 1개의 공유 전문가가 있습니다. 그리고 그 라우터는 각 토큰을 384개 중 6개에게 보냅니다. 이것이 어떻게 총 781억 개의 파라미터가 토큰당 실제 작업량 34.6억 개로 변환되는 방식입니다.
2024년에 저는 ‘왜 소형 언어 모델(Small Language Models)이 미래인가’라는 제목의 강연을 했고, ‘매개변수(parameters)가 적고 오류가 발생할 여지가 적으며, 계산량이 덜 필요한 소형 언어 모델’을 주장했습니다. 제가 사용한 비유는 전 세계 모든 의학 서적을 읽은 의사 대 혈액학 전문의였습니다. 만약 빈혈 증상으로 첫 번째 의사를 찾아간다면, ‘너무 많이 알기 때문에 제대로 진단하지 못할 수도 있다’는 식입니다. 전문가 혼합 모델(Mixture of Experts, MoE)은 한 병원에 수많은 전문의들을 배치하는 것과 같고, 라우터(router)는 각 토큰을 올바른 전문의에게 보내주는 접수원 역할을 합니다.
하지만 이 비유에는 두 가지 오류가 있습니다. 전문가들은 ‘독일법’처럼 깔끔하게 정리된 주제들이 아닙니다. 연구자들이 MoE 모델 내부를 들여다보면, 사람이 선택할 만한 주제(subjects)보다는 구두점이나 고유명사 같은 토큰 패턴에 대한 전문가들을 주로 발견합니다. 또한 병원은 6명의 전문의만 보더라도 모든 384명의 전문의를 상주시켜야 하므로, Kolibri는 35억 매개변수 모델처럼 계산하지만 780억 매개변수 모델의 메모리를 필요로 합니다. 모델 카드에 명확하게 나와 있습니다. “전체 모델은 어느 순간 일부만 활성화되더라도 메모리에 유지되어야 한다.”
2. 긴 독일어 단어를 읽는 토크나이저
모델은 글자나 단어를 읽지 않고, 토큰(tokens)을 읽습니다. 토큰이란 고정된 어휘집(vocabulary)에서 뽑아내는 텍스트의 조각입니다. 토크나이저는 학습될 때 이 과정을 거칩니다. 독일어는 단어들을 길게 합성하는 경향이 있고, 주로 영어로 학습한 토크나이저는 이를 여러 조각으로 잘라버립니다. 여기 GPT-4o와 GPT-5가 사용하는 토크나이저(o200k_base, OpenAI의 tiktoken을 통해)와 Kolibri가 분리한 독일 연방 헌법 재판소의 이름 비교입니다:
o200k_base (GPT-5): Bund | es | ver | fass | ungs | gericht 6 토큰
Kolibri: Bundes | verfassungsgericht 2 토큰
Kolibri의 토크나이저는 128,000개의 토큰을 사용하며, Aleph Alpha가 UniBPE라고 부르는 새로운 알고리즘으로 학습되었습니다. 이 알고리즘은 바이트 쌍 인코딩(BPE)의 하향식 병합 방식을 유지하면서 각 병합에 다른 점수 규칙(Unigram objective)을 적용하여 독일어가 단어를 구성하는 방식에 맞게 작동합니다. 보고서에 따르면, Kolibri는 측정된 9개의 토크나이저 중 가장 좋은 성능을 보이는 GPT-5의 토크나이저보다 독일어 텍스트를 처리할 때 11.2% 적은 토큰을 필요로 한다고 합니다.
저는 이를 직접 확인하고 싶어서, 독일 연방 공화국 기본법(독일 헌법, 매우 독일적인 법률 텍스트 185KB) 전체와 그 공식 영어 번역본에 대해 6개의 토크나이저를 실행해 보았습니다:
| 토크나이저 | 독일어 토큰 수 | Kolibri 대비 증가율 | 영어 토큰 수 | Kolibri 대비 증가율 |
|---|---|---|---|---|
| Kolibri 1 | 35,190 | 39,875 | - | - |
o200k_base (GPT-4o, GPT-5, GPT-OSS) | 41,482 | 17.9% | 39,737 | -0.3% |
| Qwen3.5 35B-A3B | 42,907 | 21.9% | 41,650 | 4.5% |
| Mistral Small 4 | 43,478 | 23.6% | 41,301 | 3.6% |
| Gemma 4 | 43,850 | 24.6% | 41,564 | 4.2% |
독일 법률 텍스트의 경우, Kolibri는 GPT-5 토크나이저보다 15% 적은 토큰을 필요로 했으며, 이는 Aleph Alpha 자체 보고서 수치인 11.2%보다도 높은 수치였고, 영어에서는 그와 동일했습니다. 정말 대단합니다. 토큰 수가 적다는 것은 같은 독일어 텍스트를 읽거나 쓰는 데 필요한 단계가 적다는 의미이며, 같은 컨텍스트 창에 더 많은 독일어를 담을 수 있다는 뜻입니다. (저는 Hugging Face의 tokenizers 라이브러리를 사용하여 각 토크나이저별로 계산했으며, o200k_base만은 tiktoken으로 계산했습니다.)
3. 대부분의 레이어는 주변 정보만 확인합니다
Kolibri의 50개 레이어 중 40개가 슬라이딩-윈도우 어텐션(sliding-window attention)을 사용합니다. 즉, 각 토큰은 자신 앞의 512개 토큰만을 참조합니다. 매 5번째 레이어는 그 앞의 모든 것을 참조합니다. 이는 긴 계약서를 읽으면서 주로 현재 문장에만 집중하다가도 몇 페이지마다 멈춰서 전체 내용을 생각하는 것과 같은 방식이며, 이것이 100만 토큰 컨텍스트를 저렴하게 유지할 수 있게 하는 비결입니다.
여기에는 영리한 세부 사항도 있습니다. 슬라이딩 윈도우 레이어만 토큰의 위치를 알고(회전 위치 임베딩을 통해), 전체 어텐션 레이어는 알지 못하기 때문에, 컨텍스트가 학습된 262,144 토큰을 초과하더라도 추가적인 위치 트릭 없이 작동합니다. Aleph Alpha는 이를 최대 1,048,576까지 검증했습니다.
제가 진행한 'AI를 활용하여 가치를 발견하는 방법(Unlocking Value with AI)' 강연에서 저는 유한 컨텍스트를 환각(hallucination)과 지식 차단 시점(knowledge cutoff)에 이은 생성형 AI의 '빅 3' 문제 중 하나로 언급했습니다. 그리고 Kolibri는 이 세 가지 문제를 모두 해결합니다. RULER 장문 컨텍스트 테스트에서 100만 토큰 규모로, Kolibri의 기본 모델은 Qwen3.5 35B-A3B의 기본 모델이 기록한 57.5에 비해 63.2를 기록했습니다.
4. 독일어로 사고합니다
추론(Reasoning) 모델은 답변하기 전에 생각하며, 심지어 독일어 프롬프트에서도 주로 영어로 생각하는 경향이 있습니다. Aleph Alpha는 지난 9월 24일에 이 내용을 게시하면서 '눈물의 계곡을 지나며(Through the Valley of Tears)'라는 제목으로 작성했습니다. 그들은 약 80만 개의 독일어 추론 예시를 생성했고, 약간의 독일어 추론 데이터가 아예 없는 것보다 나쁘지 않다는 것을 발견했습니다. 모델의 독일어 수학 점수는 독일어로 생각하는 과정이 계속 순환하며 끝나지 않았기 때문에 70.2점에서 48.3점으로 떨어졌고, 더 많은 독일어 데이터를 통해 (67.3점까지) 올라갔습니다.
Kolibri는 훨씬 더 많은 양을 확보했습니다. 독일어 프롬프트에서 독일어로 추론하며, 약 30억 개의 활성 파라미터를 가진 모델 중 독일어 수학 점수가 가장 높습니다. 미국 초청 수학 경시대회(American Invitational Mathematics Examination, AIME) 2025의 경우 독일어로 87.5점을 기록하여, 다음으로 좋은 성적을 거둔 NVIDIA의 Nemotron 3 Nano가 기록한 84.4점보다 높았습니다.
5.
이 모델은 세 명의 플레이어가 참여하는 게임과 같습니다. Arthur가 이 모델이며, 그는 일부 지원 문서가 가려진 질문을 받습니다. Merlin은 정답을 찾기 쉽게 하도록 일부를 숨기고, Arthur는 그런 질문에 답하도록 훈련됩니다. Morgana는 답변이 의존하는 증거를 숨기고, Arthur는 모른다고 말하도록 훈련됩니다. Arthur는 자신이 누구와 마주하고 있는지(2명 중) 결코 알 수 없으므로, 이길 수 있는 유일한 방법은 눈앞의 증거가 답변을 뒷받침하는지 실제로 확인하는 것입니다.
이는 결과로 나타납니다. Artificial Analysis의 Omniscience 테스트에서 Kolibri는 답을 모를 때 꾸며내기보다 '모른다'고 말하거나(또는 부분적인 답변을 제공) 44%의 확률로 그렇게 했습니다. Qwen3.5 35B-A3B는 이 비율이 11.1%였고, GPT-OSS 120B는 23.7%였습니다. Aleph Alpha가 비교한 모든 Mixture-of-experts(MoE) 모델 중에서는 Qwen3.6 35B-A3B만이 56.7%로 더 나은 성능을 보였습니다.
6. 난이도를 직접 설정할 수 있습니다
모든 요청에 대해 reasoning_effort를 none, low, medium, 또는 high로 설정할 수 있어, 빠른 조회는 즉시 답변하고 어려운 질문은 같은 모델의 동일 서버에서 오랜 시간 생각하게 합니다.
Kolibri가 강한 영역
이것들은 Aleph Alpha가 모든 모델을 자체 제작자가 추천하는 샘플링 설정을 사용하여 동일한 환경으로 실행하여 평가했을 때, Kolibri가 크기 면에서 오픈 모델들을 앞서는 행들입니다:
| 항목 | Kolibri | 활성 파라미터 약 3B를 가진 가장 가까운 모델 |
|---|---|---|
| 전반적인 점수(영어) | 75.5 | 74.7 (Qwen3.5 35B-A3B) |
| ... | ||
| 수학 부분이 단연 두드러집니다: AIME 2025와 2026 영어에서 Kolibri는 활성 파라미터가 120억 개인 모델들을 포함하여 비교된 모든 MoE 모델을 능가하며, 오직 밀집(dense)한 Qwen3.8 27B만이 더 높은 점수를 기록했습니다. 회사 문서 항목은 반도체, 독일 공공 부문, 항공우주, 자동차 공급업체 및 산업 구동 장치 등 고객과 유사한 작업에서 Aleph Alpha가 만든 5가지 테스트로, 모델이 학습 과정에서 본 적 없는 문서와 질문을 기반으로 실행되었습니다. |
Kolibri가 약한 영역
Aleph Alpha는 모델 카드에서 가장 약한 성능을 보이는 항목들을 가장 좋은 것들 옆에 배치했습니다. 여기 그 내용이 있습니다:
기억력이 부족합니다. 문서를 참고하지 않는 폐쇄형 시험(Retrieval-Augmented Generation Benchmark의 질문)에서는 12개 모델 중 가장 낮은 점수인 51.0을 기록했으며, Omniscience 질문에 대해서는 Qwen3.5 35B-A3B가 22.2%를 기록한 것에 비해 단지 14.8%만 정답을 맞혔습니다. 모르는 것을 안다고 말하는 것은 좋지만, 동시에 아는 것도 적다는 의미입니다: 프롬프트에 문서를 첨부할 때는 괜찮지만, 상식적인 질문(trivia oracle)으로는 부족합니다.다중 턴 도구 호출 성능이 약합니다. Berkeley Function Calling Leaderboard의 다중 턴 테스트에서 39.8점을 기록하여 GLM-4.7 Flash의 58.2점과 Qwen3.5 35B-A3B의 54.0점에 미치지 못했습니다.최고의 코딩 에이전트는 아닙니다. Terminal-Bench 2.1에서는 Qwen3.5 35B-A3B가 기록한 39.7점 대비 27.7점을, SWE-bench Verified에서는 Qwen3.6 35B-A3B가 기록한 73.8점 대비 66.4점을 기록했습니다.긴 컨텍스트에서 중간에 성능이 떨어집니다. RULER 테스트의 128,000 토큰 구간에서 Qwen3.5의 기본 모델은 89.9점을 기록했지만 Kolibri는 67.9점을 기록했습니다. Kolibri가 앞서나가는 경우는 매우 긴 컨텍스트 끝부분뿐입니다.메모리 용량. 78 GB의 가중치(weights)를 사용한다는 것은 데이터 센터 GPU 한두 개가 필요하며, 35억이라는 숫자가 암시하는 노트북으로는 절대 불가능하다는 의미입니다.인프라 구축이 새롭습니다. Aleph Alpha의 vLLM 플러그인을 필요로 하며, 이 플러그인은 한 번에 하나의 vLLM 버전(현재 0.29)만 지원합니다. 또한 출시 당일에는 어떤 호스팅 제공업체도 이를 서비스하고 있지 않습니다.언어 지원이 2개뿐입니다. 이것은 의도된 것입니다: 모델 카드에서는 이를
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기