
독일 AI 컨소시엄, 영어와 독일어 벤치마크에서 최고 성능을 기록한 오픈 30B 모델 Soofi S 출시
요약
독일 AI 컨소시엄이 독일어와 영어 벤치마크에서 뛰어난 성능을 보이는 오픈 소스 30B 모델 Soofi S를 출시했습니다. 이 모델은 효율적인 하이브리드 아키텍처를 사용하여 긴 입력값에서도 빠른 처리 속도를 유지합니다.
핵심 포인트
- 독일어 및 영어, 프로그래밍 벤치마크에서 기존 오픈 모델 능가
- 31.6B 파라미터 중 3.2B만 활성화하는 효율적 하이브리드 구조
- Chinchilla 스케일링 법칙을 상회하는 대규모 토큰 학습 적용
- MoE 아키텍처 특성에 따른 과잉 학습 논란에 대한 기술적 반박
독일 AI 컨소시엄, 영어와 독일어 벤치마크에서 최고 성능을 기록한 오픈 30B 모델 Soofi S 출시

핵심 포인트
- 독일 연구 컨소시엄이 Deutsche Telekom의 AI 클라우드 인프라에서 전적으로 학습된 오픈 소스 언어 모델(Language Model)인 Soofi S를 출시했습니다.
- 이 모델은 토큰당 31.6B(316억 개)의 파라미터 중 3.2B(32억 개)만 활성화하는 자원 효율적인 하이브리드 아키텍처(Hybrid Architecture)를 사용하여, 매우 긴 입력값에서도 처리 속도를 일정하게 유지합니다.
- 독일어 학습 데이터에 강력하게 집중함으로써, Soofi S는 독일어, 영어 및 프로그래밍 작업 벤치마크에서 Olmo 3 32B 및 Apertus 70B와 같은 다른 완전 오픈 모델들을 능가합니다.
업데이트 –
- 과잉 학습(Overtraining) 의혹에 대한 성명 추가
**2026년 7월 15일 업데이트: **
출시 이후, 비평가들은 Soofi S가 고전적인 Chinchilla 스케일링 법칙(Scaling Laws) 기준으로 볼 때 심하게 "과잉 학습(Overtraining)"되었다고 주장했습니다. Google DeepMind는 2022년에 고정된 컴퓨팅 예산 내에서 모델 크기와 학습 데이터의 균형을 맞추는 방법을 설명하는 해당 법칙을 발표했습니다. 그들이 식별한 최적의 지점은 파라미터당 약 20개의 토큰이었습니다. Soofi S는 이 비율을 훨씬 뛰어넘습니다. 약 27조 개의 토큰과 30B(300억 개)의 파라미터를 가진 이 모델은 수백 대 일의 비율에 도달합니다. 토큰당 활성화되는 3.2B(32억 개)의 파라미터만을 고려하면, 그 비율은 수천 대 일로 급증합니다.
프로젝트의 기술 리더십 중 한 명인 Michael Fromm은 이러한 비판에 반박합니다. 그는 해당 규칙들이 Mixture-of-Experts (MoE) 아키텍처에 단순히 적용되지는 않는다고 주장합니다. Fromm은 "기존의 밀집 모델(Dense Models)에서 사용되던 스케일링 법칙이 MoE 아키텍처에는 더 이상 적용되지 않는다는 새로운 연구 결과가 있다"라고 말했습니다. 그 이유는 MoE 모델이 구축되는 방식에 있습니다. 개별 전문가(Experts)들은 동일한 문서를 보는 것에서 이득을 얻기 때문에, 대규모 고품질 데이터셋 내의 반복된 데이터는 밀집 모델에서 발생하는 문제보다 덜 문제가 됩니다. 비교 사례로, Fromm은 최대 25조 개의 토큰으로 자체 모델을 학습시킨 Nvidia를 언급했습니다.
**2026년 7월 13일 원문 기사: **
Soofi S는 뮌헨에 위치한 Deutsche Telekom의 Industrial AI Cloud에서 전적으로 학습된 최초의 대규모 언어 모델 (LLM) 중 하나입니다. 이 오픈 30B 모델은 효율적인 하이브리드 아키텍처 (hybrid architecture)를 사용하며, 독일어에 의도적으로 가중치를 둔 학습 믹스 (training mix)를 활용합니다.
KI Bundesverband (독일 AI 협회)가 조율하는 독일 연구 컨소시엄이 Soofi S 30B-A3B를 출시했습니다. 사전 학습 보고서(pretraining report)에 따르면, 이 오픈 언어 모델은 완전 오픈 모델 중에서 영어 및 독일어 벤치마크 (benchmarks)에서 가장 높은 점수를 기록하며, OLMo 3 32B 및 Apertus 70B와 같은 이전의 선두 모델들을 능가했습니다.

긴 컨텍스트를 위해 구축된 효율적인 아키텍처
Soofi S는 전문가 혼합 (Mixture-of-Experts, MoE) 모델입니다. 총 316억 개의 파라미터 (parameters)를 포함하고 있지만, 토큰 하나를 생성할 때마다 약 32억 개의 파라미터만 활성화합니다. 이로 인해 연산 비용 (compute cost)은 기존의 30B 모델보다 3B 모델에 더 가깝습니다. 컨소시엄은 Mamba-2 레이어와 표준 어텐션 (attention) 레이어를 결합한 하이브리드 설계인 Nvidia의 Nemotron 3 Nano 아키텍처를 수정 없이 채택했습니다.
전형적인 트랜스포머 (transformers) 모델과의 핵심적인 차이점은 메모리 동작 방식입니다. 기존 모델에서는 어텐션 연산을 위해 이전 토큰을 저장하는 KV 캐시 (KV cache)가 컨텍스트 길이 (context length)에 따라 선형적으로 증가합니다. 입력값이 길어지고 병렬 요청이 많아지면 해당 캐시를 다시 불러오는 과정이 병목 현상 (bottleneck)이 됩니다. Soofi S의 52개 레이어 중 단 6개만이 이러한 캐시를 유지합니다.
실질적인 이점은 생성 처리량 (generation throughput)에서 나타납니다. 32개의 병렬 요청과 40,000 토큰의 컨텍스트 길이에서, Soofi S는 140억에서 240억 파라미터 범위의 밀집 모델 (dense models)보다 GPU당 초당 약 8배 더 많은 토큰을 생성합니다. 기존 모델은 컨텍스트가 길어짐에 따라 처리량이 크게 감소하는 반면, Soofi S는 4,000에서 256,000 토큰 사이에서 거의 일정하게 유지됩니다. 측정 결과에서 이와 유사한 동작을 보이는 유일한 모델은 동일하게 하이브리드 아키텍처를 사용하는 Alibaba의 Qwen3.5 35B-A3B입니다.
독일어를 중심으로 구축된 학습 믹스
컨소시엄은 총 약 27조 개의 토큰을 세 단계에 걸쳐 처리했습니다. 첫 번째 단계에서 모델은 웹, 코드, 수학 및 도메인 특화 텍스트(domain-specific texts)의 광범위한 혼합물에서 추출한 약 20조 개의 토큰으로부터 언어의 기초를 학습합니다. 이어지는 두 번째 단계에서는 이전에 학습된 패턴을 정교화하기 위해 설계된 약 6조 개의 고품질 소스 토큰을 사용합니다. 마지막으로 더 짧은 세 번째 단계에서는 최대 100만 토큰에 달하는 매우 긴 문서로 학습하여 컨텍스트 윈도우(context window)를 확장합니다.

독일에 대한 의도적인 집중이 핵심입니다. 첫 번째 단계에서 독일어는 학습 믹스(training mix)의 7.2%를 차지하며, 두 번째 단계에서는 그 비중이 15.3%로 높아집니다. Nvidia의 Nemotron 레퍼런스 레시피(reference recipe)에서는 모든 비영어권 언어를 합쳐도 약 5%에 불과합니다.
데이터 소스의 경우, 컨소시엄은 HPLT의 독일어 웹 텍스트, 오픈 라이선스인 독일어 Commons 코퍼스(corpus), FinePDFs 및 FineWiki의 독일어 부분, 그리고 916개의 독일 출판물에서 추출한 1억 9,300만 개의 신문 기사를 포함하는 상업 라이선스 Genios 코퍼스를 결합합니다. 기계 번역(Machine-translated) 및 합성 생성(synthetically generated)된 독일어 텍스트가 이 믹스를 완성합니다.
독일어와 영어 모두에서 오픈 모델 최고 점수 기록
보고서에 따르면, 16개의 다른 오픈 모델과 비교 평가한 결과 Soofi S는 독일어와 영어 모두의 종합 점수에서 모든 완전 오픈 모델(fully open models) 중 선두를 차지했습니다. 여기에는 Allen Institute for AI의 OLMo 3 32B와 ETH Zurich 및 EPFL의 Apertus 70B가 포함됩니다. 모든 유럽 주권 베이스라인(European sovereign baseline) 모델과 비교했을 때, 이 모델은 해당 스위트(suite) 내의 모든 독일어 벤치마크에서 앞서 나갔으며, 때로는 두 자릿수 차이의 격차를 보이기도 했습니다.

코드 벤치마크(code benchmarks)에서 Soofi S는 HumanEval에서 73.8%, MBPP에서 70.2%, 그리고 독일어 MBPP 변형 모델에서 84.2%를 기록하며 오픈 소스 동급 모델 중 최고의 결과를 보여주었습니다. 독일 특화 지역 지식 테스트인 INCLUDE-DE에서는 Soofi S가 61.2점을 기록하며 더 큰 규모인 Qwen3.5 35B-A3B와 함께 공동 1위를 차지했습니다. Nemotron 베이스라인과 비교했을 때, 독일어 데이터 레시피(data recipe)는 영어 성능을 희생하지 않으면서도 언어 숙련도를 15.1포인트, 과학 테스트인 GPQA-Diamond를 9.6포인트 향상시켰습니다.

Soofi S는 독일어 경시 수학(competition math)에서는 성능이 다소 떨어지는데, Minerva MATH-DE에서 56점을 기록하며 Qwen3.5 35B-A3B(76.5)와 Gemma 3 27B(65.6)에 크게 뒤처졌습니다. 또한 NaturalQuestions의 개방형 사실 검색(open factual retrieval)에서도 뒤처지는 모습을 보였습니다. 후자의 경우, 활성 파라미터(active parameters)가 30억 개(3 billion)에 불과하여 밀집형(dense) 27B 모델보다 세상에 대한 지식(world knowledge)을 적게 저장할 수 있다는 점과 관련이 있을 것으로 보입니다.

RULER 롱 컨텍스트(long-context) 테스트에서도 특정 약점이 드러났습니다. 모델이 긴 텍스트에서 빈번하게 등장하는 단어를 추출해야 할 때, Soofi S의 적중률(hit rate)은 컨텍스트가 32,000 토큰을 넘어서면 약 3%로 떨어지는 반면, 비교 대상인 Nemotron 모델은 여전히 60~64%를 유지합니다. 저자들은 이를 그들의 롱 컨텍스트 학습 데이터에 많은 긴 문서가 포함되어 있지만, 추출 작업(extraction tasks)을 위해 설계된 합성 데이터(synthetic data)가 부족하기 때문이라고 분석했습니다. 나머지 12개의 RULER 작업에서는 두 모델 모두 비슷한 성능을 보였습니다.
주권 인프라와 문서화된 개방성
학습은 3월에서 5월 사이에 뮌헨에 위치한 Deutsche Telekom의 Industrial AI Cloud에서 최대 512개의 Nvidia B200 GPU를 사용하여 진행되었으며, 총 약 253,000 GPU-시간이 소요되었습니다. 보고서에 따르면, 이 시설은 전적으로 재생 에너지로 운영되며, Eisbach 운하의 물로 냉각되고, 폐열은 주변 Tucherpark 지역에 공급됩니다. Soofi S는 이 인프라에서 진행된 최초의 주요 학습 사례 중 하나였습니다.
Soofi의 배후에는 독일 AI 협회(German AI Association)가 조정하고, 유럽 IPCEI-CIS 프로그램의 일환으로 독일 연방 경제 및 에너지부(German Federal Ministry for Economic Affairs and Energy)의 자금 지원을 받는 독일 연구 기관 및 기업 컨소시엄이 있습니다.
참여 기관에는 Fraunhofer Institutes IAIS 및 IIS, 독일 인공지능 연구 센터 (DFKI), TU Darmstadt, Würzburg 대학교, L3S 연구 센터, Berlin University of Applied Sciences, 그리고 AI 기업인 Ellamind와 Merantix Momentum이 포함됩니다. 이 프로젝트의 목표는 주권적 인프라 (sovereign infrastructure)에서 실행될 수 있고 산업용 애플리케이션에서 테스트 가능한 개방형 유럽 AI 모델 제품군을 구축하는 것입니다.
연구진은 모델 가중치 (model weights)와 함께 선택된 중간 체크포인트 (intermediate checkpoints), 전체 학습 및 평가 코드, 그리고 원시 토큰 수 (raw token counts), 에포크 (epoch) 수, 소스별 실질적 기여도를 나열한 상세 데이터 인벤토리를 공개합니다. 검토되었으나 제외된 소스들도 문서화되어 있습니다. 팀에 따르면, 이는 Soofi S가 Open Source Initiative의 오픈 소스 AI 정의 (Open Source AI Definition) 1.0을 충족함을 의미합니다.
모든 개별 학습 토큰을 자유롭게 배포할 수 있도록 요구하는 더 엄격한 유럽 오픈 데이터 정의 제안은 충족되지 않았는데, 이는 상업적 라이선스가 적용되는 Genios 데이터의 비중이 1.3%를 차지하기 때문입니다. 보고서에 따르면 학습 믹스의 약 99%는 독립적으로 재구성될 수 있습니다. 모델 출시를 위한 정확한 라이선스는 아직 확정되지 않았습니다.
기술 리더인 Michael Fromm이 작성했듯이, Soofi S는 많은 언어를 다루는 EuroLLM 또는 Teuken과 같은 광범위한 다국어 유럽 주권 프로젝트와 성능이 가장 뛰어난 국제 오픈 웨이트 (open-weight) 모델들 사이의 위치를 점하고 있습니다. 프로젝트 웹사이트에 따르면, 컨소시엄은 기술 문서, 코드 생성 및 에이전트 기반 시스템 (agent-based systems)과 관련된 애플리케이션에서 모델을 테스트하기 위해 다음 단계의 산업 파트너를 찾고 있습니다.
과장 없는 AI 뉴스 – 사람이 큐레이션함
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Posts의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기