
1T 모델의 성능에 근접하면서 단 5.1B 파라미터만 활성화하는 124B 모델
요약
InclusionAI가 124B 규모의 MoE 모델인 Ling-3.0-flash를 공개했습니다. 이 모델은 단 5.1B의 파라미터만 활성화하면서도 1T 규모 모델에 근접하는 성능을 보여주며, 하이브리드 선형 어텐션 구조를 통해 긴 컨텍스트 처리에 최적화되었습니다.
핵심 포인트
- 총 124B 파라미터 중 5.1B만 활성화하는 효율적인 MoE 구조
- 하이브리드 선형 어텐션(KDA 및 MLA 레이어)을 통한 장기 기억 최적화
- 256K 네이티브 컨텍스트 지원 및 1M 확장 목표
- AI 에이전트의 도구 조율 및 워크플로우 완결에 특화된 설계
🤩 1T(1조) 규모의 형제 모델 성능에 근접하면서도 단 5.1B 파라미터만 활성화하는 124B 모델이 등장했습니다.
로컬에서 실행하기에 Sonnet-4.6만큼이나 뛰어난 성능을 보여줍니다.
발표 전부터 베일에 싸여 있던 미스터리 모델이 공식 공개되었습니다.
@TheInclusionAI가 프로덕션 규모의 AI 에이전트(AI agents)를 위해 구축된 하이브리드 추론 MoE(Mixture of Experts), Ling-3.0-flash를 공식 출시했습니다.
주요 통계:
🧠 총 파라미터(total parameters) 124B
⚡ 토큰당 활성 파라미터(active parameters) 단 5.1B
📚 256K 네이티브 컨텍스트(native context)
🔭 1M 컨텍스트 확장을 목표로 설계
InclusionAI에 따르면, Ling-3.0-flash는 총 파라미터는 약 1/8, 활성 파라미터는 약 1/12 수준임에도 불구하고 제시된 대부분의 벤치마크에서 1조 파라미터 규모의 플래그십 모델과 대등하거나 이를 능가하는 성능을 보여줍니다.
Ling-3의 차별점은 무엇인가요?
🧬 하이브리드 선형 어텐션 (Hybrid linear attention)
Ling은 다음과 같이 구성됩니다:
🔹 효율적인 장기 기억(long-range memory)을 위한 5개의 KDA 레이어
🔹 정밀한 어텐션(attention)을 위한 1개의 MLA 레이어
목표는 모든 레이어에서 풀 어텐션(full-attention) 비용을 지불하지 않고도 긴 컨텍스트(long-context) 에이전트 성능을 유지하는 것입니다.
InclusionAI는 Ling-3.0-flash의 성능을 다음과 같은 사례로 입증했습니다:
🏙️ Blender MCP를 통한 완전한 3D 도시 구축 및 렌더링
🔬 5인 규모의 과학 연구 팀 에이전트 조율
📊 Word 제안서 편집 및 Excel 재무 데이터 검증
🎨 외부 이미지 없이 전체 디자인 시스템 생성
🎹 Web Audio를 활용한 인터랙티브 브라우저 신시사이저 구축
📱 하나의 소스를 X, Instagram, LinkedIn 콘텐츠로 변환
📅 OpenClaw를 통해 메시지를 읽고, 가용 시간을 확인하며, 캘린더 업데이트
이 모델은 목표를 수신하고, 도구를 조율하며, 워크플로우를 완결하도록 설계되었습니다.
지금 바로 체험해 보세요
🆓 OpenRouter에서 이용 가능
📅 2026년 8월 3일까지 무료 제공
🔌 모델 ID:
inclusionai/ling-3.0-flash
API는 활성화되었으나, InclusionAI는 아직 다운로드 가능한 가중치(weights), 라이선스 또는 소비자용 로컬 배포 경로를 확인해주지 않았습니다.
로컬 환경을 선호하는 사용자(Localmaxxers)들은 오늘 에이전트 동작을 테스트해 볼 수는 있지만, 아직 LM Studio나 llama.cpp에 로드할 수는 없습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: MCP의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기