Aleph Alpha, 독일 통일 기념일에 Kolibri-1 전체 오픈 소스 가중치 공개
요약
Aleph Alpha가 독일 통일 기념일을 맞아 MoE 기반의 대규모 언어 모델 Kolibri-1의 전체 오픈 소스 가중치를 공개했습니다. 이 모델은 영어와 독일어를 모두 지원하며, 78.1B 매개변수 규모에 달합니다. 또한, Hugging Face와 Microsoft는 ThinkingBox 프레임워크를 공동 발표하여 에이전트 개발 환경을 제공했습니다.
핵심 포인트
- Kolibri-1: MoE 기반의 대규모 언어 모델 (78.1B)
- 영어/독일어 지원 및 262144까지 컨텍스트 학습
- 로컬 추론 가능하며, vLLM 사용 권장
- ThinkingBox 프레임워크 공개로 에이전트 개발 환경 제공
독일 Aleph Alpha가 10월 3일 독일 통일 기념일을 맞아 Kolibri-1의 전체 오픈 소스 가중치를 공개했습니다. Hugging Face 모델 카드는 Aleph-Alpha/Kolibri-1이며, 프로토콜은 Apache-2.0입니다. 로컬에서 다운로드하여 vLLM으로 추론할 수 있습니다. 이는 영어와 독일어를 모두 지원하는 MoE (Mixture of Experts) 추론 모델로, 총 매개변수는 약 78.1B에 달하며, 토큰당 약 3.46B가 활성화됩니다. 50개의 모든 레이어가 MoE이며, 각 레이어는 384개의 전문가를 가지고 있고, 라우팅은 top-6을 선택한 후 1개의 공유 전문가를 추가합니다. 어텐션(Attention)은 4:1 비율로 교차하며, 대부분의 레이어는 512 토큰 슬라이딩 창만 보고, 5개 레이어마다 한 번씩 전체 컨텍스트를 처리합니다. 컨텍스트 길이는 네이티브하게 262144까지 학습되었고, 외삽 검증은 1048576까지 이루어졌습니다. 공식적으로는 지연 시간이나 처리량에 민감하거나 복잡한 작업의 경우 서비스 창을 262144 이내로 유지할 것을 권장합니다. 가중치는 FP8 기준으로 약 78 GB이며, 모델 카드는 최소 하드웨어 사양으로 2×A100 80GB, 2×H100, 1×H200 또는 1×B200을 요구하며, 2×H100 이상을 추천합니다. 사전 학습은 약 20T 토큰에 걸쳐 이루어졌으며, 모델 카드의 구성 비율은 영어 약 62.5%, 독일어 23.9%, 코드는 13.6%입니다. 그 외에도 중간 학습(mid-training)이 약 3.44T, 장문 컨텍스트 적응이 약 201B 진행되었습니다. 클러스터는 B200 768개로 구성되었으며, 사전 학습 실측 기간은 약 21일입니다. 어휘 크기는 128000이며, 공식적으로 독일어 복합어를 처리하기 위해 UniBPE를 사용합니다. 동일한 파이프라인에는 아직 공개되지 않은 Kolibri Origin도 있으며, 이는 총 매개변수 약 30.6B, 토큰당 활성화 약 3.27B, 최대 학습 길이가 65536입니다. 추론 노력(reasoning effort)은 none, low, medium, high로 조정 가능하며, Hermes 스타일의 tool calling을 지원합니다. 공식 발표에 따르면 (자체 구축한 harness를 사용하고 최고 reasoning effort 기준), LiveCodeBench v6는 약 85.9, SWE-Bench Verified는 약 66.4, TerminalBench 2.1은 약 27.7, HumanEval+는 약 92.7, AIME 2026은 약 96.0, GPQA Diamond는 약 84.3이며, 전반적인 영어와 독일어 점수는 각각 약 75.5 및 70.8입니다. 이 수치들은 제조사 자체 평가 값입니다. 지식 마감일은 영어와 독일어 모두 2026년 6월 18일까지입니다. 본 게시물에 따르면 학습은 독일과 핀란드의 인프라 위에서 완료되었으며, EU AI 법안 및 GDPR 기준에 따른 공급망 설명이 포함되어 있습니다. 로컬 경로를 설정하려면 먼저 pip install 'aleph-alpha-inference>=1'을 실행하거나 이미지를 pull 해야 하며(https://t.co/FxgQBX89GM), 이후 vllm serve Aleph-Alpha/Kolibri-1을 실행하고 --kv-cache-dtype fp8, --reasoning-parser kolibri1, --tool-call-parser kolibri1 및 --enable-auto-tool-choice 옵션을 열어야 합니다. 샘플링 온도는 temperature=1.0, top_p=0.97, top_k=128을 권장합니다. 본 게시물은 https://t.co/K716tPbTqa 이고, 가중치는 https://t.co/OdS0kxoyso 입니다.
Microsoft와 Hugging Face는 10월 3일 ThinkingBox 프레임워크와 ThinkingBox-Bench를 공동 발표했습니다. 이 시스템은 비즈니스 백엔드를 수정하는 에이전트(agent)에게 점수를 매겨, 최종 단말 데이터베이스 상태와 부작용을 확인하고, 각 작업을 깨끗한 백엔드에서 독립적으로 20회 재실행합니다. 보고서는 pass@1, pass@20, 그리고 실제로 20회 모두 통과한 작업 수를 제시합니다. 이 벤치마크는 총 507개의 상태 기반 워크플로우로 구성되어 있으며, 도메인별로는 리테일(retail) 98개, 자동차 보험(auto insurance) 100개, 여행(travel) 104개, 신규 은행(new bank) 104개, 컨설팅(consulting) 101개로 나뉩니다. 이 중 477개는 상태 판정만으로 이루어져 있고, 나머지 30개에는 응답 측 루브릭(rubric)이 추가되었습니다. 이는 사용자가 주문 번호, 선호도 또는 생년월일과 같은 개인 정보를 가지고 있으며, 질문을 받았을 때만 공개되는 상황을 시뮬레이션합니다. 공식 블로그의 가중치 pass@1 총점 순위는 Claude Opus 5.5가 약 67.16점으로 가장 높았고, Claude Opus 5가 약 66.50점, GPT-5.4가 약 65.36점, GPT-5.6 Sol이 약 61.91점, GPT-6 Astra가 약 58.31점 순이었습니다. 오픈 소스 모델 중에서는 Kimi-K3가 약 57.37점으로 가장 높았습니다. 일관성 측면에서 Kimi-K3는 최소 한 번이라도 해결한 비율이 476/507(약 93.89%)이었으나, 20회 모두 통과한 작업은 68개(약 13.41%)에 불과했습니다. Opus 5와 Opus 5.5의 경우 20회 모두 통과한 작업이 각각 241개(약 47.53%)였습니다. 실패 원인 중 약 79.9%는 도구 사용(tool usage) 문제로 분류되었습니다. 공통 집합 제거 분석 결과, 총 121,680회의 유효 실험 중 79,853회는 실행 가능 검사(executable check)를 통과하지 못했습니다. 이 중 약 67.24%는 깔끔하게 종료되었으나, 상태 도구 수정 및 변경 후에도 최종 도구 오류가 없었음에도 불구하고, 상태 확인에서 필드 값 오류가 약 77.61%, 과도한 부작용(excessive side effects)이 약 43.30%, 필수 부작용 누락이 약 25.36%로 감지되었습니다. 공식 블로그에 나열된 모델들 중 리테일 도메인의 평균 pass@1은 약 59.52%, 자동차 보험 도메인은 약 33.83%였습니다. 프레임워크 코드는 MIT 라이선스, 벤치마크 데이터는 CDLA-Permissive-2.0을 사용하며, OpenEnv 환경은 BSD-3-Clause입니다. 논문은 arXiv 2608.19741에 게재되었습니다. GitHub 저장소 microsoft/thinkingbox를 스캔했을 때 약 85개의 별이 있었습니다. 직접 실행하려면 Linux 또는 WSL, Python 3.11+, uv, Docker가 필요하며, OpenEnv와 microsoft/thinkingbox-data를 클론한 후 thinkingbox-bench-v1.0으로 이동하고, uv tool install thinkingbox를 사용하여 설치한 다음, Typesense 및 MCP를 구동하여 thinkingbox-eval을 실행해야 합니다. 블로그 게시물은 https://t.co/hulM3mZ96o, 저장소는 https://t.co/6lqbTrtkBp, 데이터셋은 https://t.co/JQonFcoX49입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X AI 사용법/팁의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기