
Soofi S 30B-A3B: 영어 및 독일어 벤치마크에서 정상을 차지한 독일 오픈 모델
요약
독일 컨소시엄이 출시한 Soofi S 30B-A3B는 영어와 독일어 벤치마크에서 뛰어난 성능을 보이는 오픈 MoE 모델입니다. 31.6B 파라미터 중 3.2B만 활성화하여 효율성을 극대화했으며, 긴 컨텍스트에서도 높은 처리량을 유지합니다.
핵심 포인트
- MoE 구조를 통해 31.6B 파라미터 중 3.2B만 활성화하여 효율성 확보
- 영어 및 독일어 벤치마크에서 OLMo 3 및 Apertus 70B 능가
- Mamba-2와 Attention 레이어 결합으로 긴 컨텍스트 메모리 병목 제거
- 27조 개의 토큰을 활용한 3단계 학습 과정 거침
- 4K에서 256K 토큰 범위에서 일정한 처리량 유지
독일 컨소시엄이 Soofi S 30B-A3B를 출시했습니다. 이 오픈 MoE (Mixture-of-Experts) 모델은 31.6B(316억 개)의 파라미터 중 3.2B(32억 개)만 활성화하면서도 영어 및 독일어 벤치마크에서 OLMo 3 및 Apertus 70B를 능가합니다.
독일 컨소시엄은 영어와 독일어 벤치마크 모두에서 OLMo 3 32B 및 Apertus 70B를 앞서는 오픈 모델인 Soofi S 30B-A3B를 출시했습니다. 31.6B 파라미터를 가진 이 MoE (Mixture-of-Experts) 모델은 토큰당 3.2B 파라미터만 활성화하며, 뮌헨에 위치한 Deutsche Telekom의 Industrial AI Cloud에서 전적으로 학습되었습니다.
주요 사실
- 총 31.6B 파라미터, 토큰당 3.2B 활성화.
- 3단계 학습 과정을 통해 27조 개의 토큰 처리.
- 40K 컨텍스트(Context)에서 14-24B 밀집(Dense) 모델 대비 GPU당 8배 빠른 토큰/초 속도.
- 4K에서 256K 토큰까지 처리량(Throughput)이 일정하게 유지됨.
- Deutsche Telekom의 뮌헨 AI 클라우드에서 학습됨.
아키텍처 및 효율성 향상
Soofi S는 Nvidia의 Nemotron 3 Nano 아키텍처를 수정 없이 채택하여, Mamba-2 레이어와 표준 어텐션(Attention) 레이어를 결합했습니다. 모델의 52개 레이어 중 6개 레이어만이 KV 캐시(KV cache)를 유지하며, 이는 긴 컨텍스트 길이에서 기존 트랜스포머(Transformer)를 느리게 만드는 메모리 병목 현상을 제거합니다. 32개의 병렬 요청이 있는 40,000 토큰 컨텍스트에서, Soofi S는 14~24B 파라미터 범위의 밀집(Dense) 모델보다 GPU당 초당 약 8배 더 많은 토큰을 생성합니다 (The Decoder에 따르면). 처리량(Throughput)은 4,000에서 256,000 토큰 사이에서 거의 일정하게 유지되는데, 이는 측정된 모델 중 Alibaba의 Qwen3.5 35B-A3B만이 공유하는 특성입니다.
학습 데이터 및 벤치마크 결과
컨소시엄은 세 단계에 걸쳐 약 27조 개의 토큰 (tokens)을 처리했습니다. 첫 번째 단계에서는 웹, 코드, 수학 및 도메인 특화 텍스트 (domain-specific texts)의 광범위한 혼합물로부터 약 20조 개의 토큰을 사용했습니다. 약 6조 개의 토큰으로 구성된 두 번째 단계는 더 높은 품질의 소스에서 가져왔으며, 세 번째의 더 짧은 단계는 최대 256,000 토큰에 달하는 매우 긴 문서로 학습하여 컨텍스트 윈도우 (context window)를 확장했습니다. 학습 혼합물 (training mix)은 의도적으로 독일어 텍스트에 가중치를 두었으며, 컨소시엄은 이것이 Soofi S가 독일어 벤치마크 (benchmarks)에서 높은 점수를 기록한 이유라고 설명합니다. 이 모델은 또한 완전한 오픈 모델 (fully open models) 중에서 영어 및 프로그래밍 작업에서도 선두를 달리고 있습니다.
유럽 AI 주권에 대한 의의
Soofi S는 뮌헨에 위치한 Deutsche Telekom의 Industrial AI Cloud에서 전적으로 학습된 최초의 대규모 언어 모델 (large language models) 중 하나로, 유럽 AI 인프라 독립의 이정표를 세웠습니다. 이 모델은 명시되지 않은 라이선스 하에 오픈 소스 (open-source)로 공개되었습니다. 컨소시엄은 정확한 라이선스 조건을 공개하지 않았습니다. KI Bundesverband (독일 AI 협회)가 프로젝트를 조정했으며, 여기에는 독일 전역의 여러 연구 기관이 참여했습니다.
주목할 점
향후 90일 동안 Hugging Face에서 하위 미세 조정 변체 (downstream fine-tuned variants)가 출시되는지, 그리고 유럽 기업들이 독일어 애플리케이션 (applications)을 위해 Soofi S를 채택하는지 지켜봐야 합니다. 또한, 보고된 비교 대상에 포함되지 않았던 GPT-4o 또는 Claude 3.5와 같은 폐쇄형 모델 (closed models)과 비교한 벤치마크 수치를 컨소시엄이 공개하는지도 추적해야 합니다.
출처: the-decoder.com
원래 게재된 곳: gentic.news
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기
