INTELLECT-3.1, 106B MoE 규모의 오픈 소스 RL 추론 모델을 선보이다
요약
PrimeIntellect가 1,060억 개의 파라미터를 가진 MoE 구조의 오픈 소스 추론 모델 INTELLECT-3.1을 공개했습니다. 강화학습(RL)을 통해 수학, 코딩, 에이전트 작업에 최적화되었으며, 높은 계산 효율성과 검증 가능한 보상 시스템을 특징으로 합니다.
핵심 포인트
- 106B 규모의 MoE 아키텍처로 계산 효율성 확보
- 강화학습(RL)을 통한 수학 및 소프트웨어 엔지니어링 성능 최적화
- 도구 사용 및 에이전트적 작업 계획 능력 강화
- MIT 라이선스의 완전한 오픈 소스 모델
- vLLM을 통한 서빙 지원 및 높은 하드웨어 요구 사양
개요
INTELLECT-3.1은 PrimeIntellect가 기본 INTELLECT-3 모델의 연속 학습(continued training)을 통해 구축한 1,060억(106 billion) 개의 파라미터를 가진 Mixture-of-Experts (MoE) 추론 모델입니다. 이 모델은 prime-rl 프레임워크와 verifiers 라이브러리를 사용하여 수학, 코딩, 소프트웨어 엔지니어링 및 에이전트(agentic) 작업에 대한 추가적인 강화학습 (Reinforcement Learning, RL) 최적화를 수행했습니다. 이 모델은 MIT 라이선스 하에 제공되는 텍스트-투-텍스트 (text-to-text) 생성 모델로, 완전한 오픈 소스이며 허용 범위가 넓은 라이선스를 따릅니다. 아키텍처는 희소 MoE (sparse MoE) 설계를 사용하여 1,000억(100B+) 개 이상의 파라미터 규모를 달성하면서도, 동일한 능력을 가진 밀집 (dense) 모델에 비해 계산 효율성을 유지합니다. 이 모델은 검증 가능한 보상 (verifiable rewards)을 사용하는 대규모 강화학습 (RL)을 통해 훈련되었으며, 이는 표준적인 지도 미세 조정 (Supervised Fine-Tuning, SFT) 모델과 차별화되는 점으로, 추론 집약적 작업 및 도구 사용 (tool-use) 작업에서의 성능 향상을 목표로 합니다. 이 모델을 실행하려면 transformers 라이브러리가 필요하며, 권장되는 추론 프레임워크인 vLLM을 통해 서빙할 수 있습니다.
최적의 사용 사례
수학적 문제 해결 및 검증. INTELLECT-3.1은 검증 가능한 정답 보상 (verifiable ground truth rewards)을 가진 수학적 작업에 대해 명시적인 강화학습 (RL) 훈련을 받았습니다. 이를 통해 단계별 추론과 정확성이 중요한 미적분학, 선형 대수학, 정수론 및 응용 수학 문제의 솔루션을 생성하는 데 적합합니다. 모델은 솔루션을 생성하고 공식적인 정의에 따라 자신의 작업 내용을 스스로 검증할 수 있습니다.
소프트웨어 엔지니어링 및 코드 생성. 이 모델은 코딩 및 소프트웨어 엔지니어링 작업에 특화되어 훈련되었으므로, 범용 모델보다 복잡한 다중 파일 코드베이스, 알고리즘 설계 및 구현 수준의 추론을 더 잘 처리합니다. 프로덕션 품질의 코드 생성, 기존 시스템의 버그 수정, 소프트웨어 아키텍처 설계, 그리고 코드의 정확성에 대한 추론에 이 모델을 사용하십시오.
에이전트적 작업 계획 및 실행 (Agentic task planning and execution). 강화학습 (RL) 훈련에는 에이전트적 작업이 포함되어 있어, 이 모델은 도구 호출 (tool calls) 시퀀스를 계획하고, 상태 변화에 대해 추론하며, 오류로부터 복구해야 하는 자율 에이전트 (autonomous agents)를 구축하는 데 적합합니다. 이 모델은 vLLM에서 qwen3_coder 도구 호출 (tool calling) 및 deepseek_r1 추론 파싱 (reasoning parsing)을 지원하여 복잡한 다단계 워크플로우를 가능하게 합니다.
도구 사용을 통한 복잡한 추론 (Complex reasoning with tool use). MoE 아키텍처와 추론 중심의 훈련을 통해 이 모델은 확장된 사고 사슬 (chains of thought), 도구 통합, 그리고 동적 의사결정을 요구하는 문제들을 처리할 수 있습니다. 이는 모델이 어떤 도구를 호출할지, 그리고 그 출력값들을 어떻게 통합할지 추론해야 하는 연구 보조, 데이터 분석 워크플로우, 과학적 문제 해결 분야에서 효과적으로 작동합니다.
한계점 (Limitations)
상당한 추론 하드웨어 요구 사양. 1,060억 개의 파라미터를 가진 이 모델은 텐서 병렬성 (tensor parallelism)을 이용한 서빙을 위해 2개의 H200 GPU가 필요하며, 이는 엣지 배포 (edge deployment), 소규모 데이터 센터 또는 소비자용 하드웨어에서는 실용적이지 않습니다. 문서에 추론 지연 시간 (inference latency) 및 처리량 (throughput)이 명시되지 않았으므로, 벤치마킹 없이는 실제 프로덕션 성능 특성을 알 수 없습니다.
제한적인 공개 평가 및 벤치마크 데이터. README에는 MMLU, GSM8K 또는 코드 데이터셋과 같은 표준 벤치마크에 대한 성능 수치가 제공되지 않아, RL 훈련이 실제로 추론 성능을 향상시켰는지 또는 다른 대안들과 정량적으로 어떻게 비교되는지 확인하는 것이 불가능합니다. 기술 보고서 (technical report)가 존재하지만, 특정 벤치마크 결과는 주요 문서에 요약되어 있지 않습니다.
MoE 아키텍처로 인한 배포 및 최적화의 복잡성. 희소 전문가 혼합 (Sparse mixture-of-experts) 모델은 특화된 추론 최적화가 필요하며, 작은 배치 크기(batch size)에서는 밀집 모델 (dense models)에 비해 하드웨어 활용도가 낮을 수 있습니다. vLLM 지원은 가능하지만, 일부 추론 프레임워크는 최적화된 MoE 지원을 갖추고 있지 않을 수 있습니다.
파인튜닝 (Fine-tuning) 가이드가 제공되지 않음. 모델과 학습 프레임워크는 오픈 소스이지만, README에는 사용자가 이 모델을 파인튜닝할 수 있는지, 이를 위해 어떤 리소스가 필요한지, 또는 어떤 프레임워크가 106B MoE 모델의 파인튜닝을 완전히 지원하는지에 대한 설명이 없습니다.
컨텍스트 윈도우 (Context window) 및 입출력 길이 제한이 명시되지 않음. 문서에는 최대 컨텍스트 길이(maximum context length)가 명시되어 있지 않으며, 이는 긴 문서 처리나 다회차 대화 (multi-turn conversations)가 필요한 애플리케이션에서 매우 중요한 요소입니다.
낮은 다운로드 수로 인한 초기 도입 단계. 다운로드 수가 19회에 불과하다는 것은 이 모델이 실질적인 사용 피드백이 제한적인 새로운 모델 출시임을 나타냅니다. 커뮤니티의 경험 보고, 알려진 문제 (known issues), 그리고 통합 관련 이슈가 부족합니다.
비교 분석
INTELLECT-3.1
vs INTELLECT-3**.** INTELLECT-3.1은 수학, 코딩, 에이전트 작업 (agentic tasks)에 대한 추가적인 강화학습 (RL) 학습이 적용된 INTELLECT-3의 개선 버전입니다. 추론 능력 향상과 도구 사용 (tool-use) 능력이 구체적으로 필요한 경우 INTELLECT-3.1을 선택하십시오. 더 낮은 추론 지연 시간 (inference latency)이 필요하거나 최신 3.1 버전을 언급하지 않는 이전 문서를 사용하는 경우에만 기본 INTELLECT-3를 사용하십시오.
INTELLECT-3.1
vs INTELLECT-2**.** INTELLECT-2는 약 1/3 크기인 320억 파라미터 (32 billion parameter) 모델로, prime-rl 프레임워크를 사용하여 RL로 학습되었습니다. INTELLECT-3.1은 훨씬 더 큰 모델 용량을 제공하며 더 높은 추론 품질을 제공해야 하지만, 3~4배 더 많은 GPU 리소스를 요구합니다. 리소스 제약이 없는 배포 환경에서 최대의 추론 능력을 원한다면 INTELLECT-3.1을 선택하십시오. 여러 대의 H200에 접근할 수 없어 더 빠른 추론과 낮은 인프라 비용이 필요한 경우에는 INTELLECT-2를 선택하십시오.
INTELLECT-3.1
vs INTELLECT-1-Instruct**.** INTELLECT-1-Instruct는 1조 개의 토큰(tokens)으로 학습된 100억(10 billion) 파라미터 모델입니다. INTELLECT-3.1은 이보다 10배 이상 더 크며, 추론(reasoning) 작업을 위해 강화학습 (RL)으로 특화 학습되었고, 더 어려운 추론 문제들을 목표로 합니다. 복잡한 추론 및 도구 사용 (tool use)에는 INTELLECT-3.1을 선택하십시오. 소규모 배포, 모바일 통합, 또는 추론 속도가 주요 제약 사항인 경우에는 INTELLECT-1-Instruct를 선택하십시오.
INTELLECT-3.1
vs INTELLECT-1**.** INTELLECT-1은 지시어 튜닝 (instruction tuning)이나 강화학습 (RL) 학습이 이루어지지 않은 100억(10 billion) 파라미터 베이스 모델 (base model)입니다. INTELLECT-3.1은 명시적인 강화학습 (RL) 최적화를 통해 추론 및 도구 사용에 특화되어 있습니다. 즉시 사용 가능한 성능이 필요한 모든 애플리케이션에서는 베이스 모델인 INTELLECT-1 대신 항상 INTELLECT-3.1을 사용하십시오.
INTELLECT-3.1
vs DeepSeek-V3**.** DeepSeek-V3는 선도적인 비추론 (non-reasoning) 모델로 설명되며, INTELLECT-3.1의 MoE 구조보다 더 밀집형 (denser)이고 범용적 (general-purpose)일 가능성이 높습니다. DeepSeek-V3는 더 나은 일반 언어 이해와 더 넓은 작업 범위를 제공할 수 있습니다. 강화학습 (RL) 학습이 이점을 제공하는 추론 중심 작업 및 도구 통합에는 INTELLECT-3.1을 선택하십시오. 균형 잡힌 일반 언어 능력과 밀집형 구조 (dense architecture)를 통한 잠재적으로 더 나은 추론 효율성을 원한다면 DeepSeek-V3를 선택하십시오.
기술 사양 (Technical specifications)
아키텍처 및 파라미터 (Architecture and Parameters). INTELLECT-3.1은 총 1,060억(106 billion) 개의 파라미터를 가진 전문가 혼합 (Mixture-of-Experts, MoE) 아키텍처를 사용합니다 (활성 파라미터는 120억(A12B) 개로, 토큰당 파라미터의 일부만 활성화되는 희소 활성화 (sparse activation)를 나타냅니다). 이 모델은 INTELLECT-3의 연속 학습 (continued training)으로 구축되었으며, 이는 기본 아키텍처를 유지하면서 추가적인 강화학습 (RL) 미세 조정 (fine-tuning)을 받았음을 의미합니다.
훈련 및 최적화 (Training and Optimization). 이 모델은 분산 비동기 강화학습 (distributed asynchronous reinforcement learning) 프레임워크인 prime-rl을 사용하여 훈련되었습니다. 훈련에는 수학, 코딩, 소프트웨어 엔지니어링 및 에이전트 작업 (agentic task) 환경에서의 검증 가능한 보상 신호 (verifiable reward signals)가 사용되었습니다. 모든 훈련 및 평가 환경은 Environments Hub에서 확인할 수 있습니다. 훈련 프레임워크와 환경은 MIT 및 Apache 2.0 라이선스 하에 오픈 소스로 공개되어 있습니다.
추론 및 서빙 (Inference and Serving). 모델은 다음과 같은 사양으로 vLLM을 통해 서빙됩니다:
-
텐서 병렬성 (tensor parallelism, tensor-parallel-size 2)을 갖춘 2x H200 GPU 필요
-
qwen3_coder 파서를 통한 도구 호출 (tool calling) 지원
-
deepseek_r1 파서를 통한 추론 파싱 (reasoning parsing) 지원
-
참조 구성 (reference configuration)에서 자동 도구 선택 (Auto-tool-choice) 활성화
프레임워크 및 라이브러리 지원 (Framework and Library Support). 이 모델은 transformers 라이브러리와 호환되며 vLLM 추론 서빙에 최적화되어 있습니다. 모델은 Hugging Face에 표준 형식으로 호스팅됩니다.
오픈 소스 및 라이선스 (Open Source and License). 모델, 훈련 프레임워크 (prime-rl, verifiers) 및 환경은 완전 허용형 라이선스 (MIT 및 Apache 2.0)로 출시되어 제한 없이 상업적 및 연구적 용도로 사용할 수 있습니다.
명시되지 않은 기술적 세부 사항 (Technical Details Not Specified). 문서에는 다음 사항이 제공되지 않습니다: 최대 컨텍스트 창 길이 (maximum context window length), 추론 지연 시간 (inference latency), 초당 토큰 처리량 (throughput in tokens per second), 작업 범주 이외의 훈련 데이터셋 세부 정보, 훈련 단계 수 (number of training steps), 사용된 총 연산량 (total compute used) 또는 양자화 옵션 (quantization options).
모델 입력 및 출력
입력 (Inputs)
-
임의 길이의 텍스트 프롬프트 (최대 컨텍스트 창은 문서에 명시되지 않음)
-
에이전트 작업을 위한 선택적 도구/함수 정의 (optional tool/function definitions)
-
추론 동작을 안내하기 위한 선택적 시스템 프롬프트 (optional system prompts)
출력 (Outputs)
-
생성된 텍스트 연속물 및 추론 체인 (reasoning chains)
-
구조화된 형식의 도구/함수 호출 (qwen3_coder 호환)
-
deepseek_r1 파서 형식과 호환되는 추론 흔적 (reasoning traces)
시작하기 (Getting started)
from transformers import AutoTokenizer, AutoModelForCausalLM
# 모델 및 토크나이저 로드
tokenizer = AutoTokenizer.from_pretrained("PrimeIntellect/INTELLECT-3.1")
...
프로덕션 서빙(production serving)을 위해서는 vLLM을 사용하세요:
vllm serve PrimeIntellect/INTELLECT-3.1 \
--tensor-parallel-size 2 \
--enable-auto-tool-choice \
...
자주 묻는 질문 (Frequently asked questions)
Q: INTELLECT-3.1을 상업적으로 사용할 수 있나요?
A: 네. 이 모델은 MIT 라이선스 하에 출시되었으며, 이는 완전히 허용적인(permissive) 라이선스로 제한 없이 상업적 이용, 수정 및 배포를 허용합니다. 어떤 목적으로든 프로덕션 애플리케이션에서 이 모델을 사용할 수 있습니다.
Q: INTELLECT-3.1을 실행하려면 어떤 하드웨어가 필요한가요?
A: 권장되는 서빙 설정은 텐서 병렬화(tensor parallelism)가 활성화된 2x H200 GPU입니다. 모델 규모가 너무 커서 (106B 파라미터) 소비자용 하드웨어나 단일 GPU 시스템에서는 실행할 수 없습니다. 양자화(Quantization) 옵션은 문서화되어 있지 않습니다.
Q: 코드 생성 측면에서 INTELLECT-3.1은 INTELLECT-2와 비교해 어떤가요?
A: INTELLECT-3.1은 3배 더 크며 (106B vs 32B), 코딩 작업에 특화된 추가적인 강화학습 (RL) 훈련을 받았으므로 더 높은 품질의 코드 솔루션을 생성할 것입니다. 하지만 INTELLECT-3.1은 훨씬 더 많은 GPU 리소스를 요구하며 토큰당 속도가 더 느릴 것입니다. 프로덕션급 코드 생성이 필요하고 하드웨어를 갖추고 있다면 INTELLECT-3.1을 선택하세요. 지연 시간(latency)이나 비용이 주요 제약 사항이라면 INTELLECT-2를 선택하세요.
Q: INTELLECT-3.1은 도구 호출 (tool calling) 및 함수 사용을 지원하나요?
A: 네. vLLM 서빙에는 --enable-auto-tool-choice 및 --tool-call-parser qwen3_coder가 포함되어 있어, 모델이 구조화된 도구 호출을 생성할 수 있도록 지원합니다. 이는 에이전트 워크플로우 (agentic workflows) 및 다단계 추론 (multi-step reasoning)을 위해 설계되었습니다.
Q: INTELLECT-3와 INTELLECT-3.1의 차이점은 무엇인가요?
A: INTELLECT-3.1은 수학, 코딩, 소프트웨어 엔지니어링 및 에이전트 작업 (agentic tasks)에 대한 추가적인 강화학습 (RL)을 적용하여 INTELLECT-3를 지속 학습 (continued training)시킨 모델입니다. 추론 능력의 향상이 필요하다면 INTELLECT-3.1을 사용하십시오. 기본 모델인 INTELLECT-3도 존재하지만, 새로운 프로젝트에는 INTELLECT-3.1을 우선적으로 사용하는 것이 좋습니다.
Q: INTELLECT-3.1을 파인튜닝 (fine-tune)할 수 있나요?
A: 모델과 prime-rl 학습 프레임워크는 오픈 소스이지만, 문서에는 파인튜닝 (fine-tuning)에 대한 가이드가 제공되지 않습니다. 표준 트랜스포머 (transformer) 라이브러리를 사용하여 파인튜닝할 수 있을 것으로 보이나, MoE 파인튜닝을 위한 구체적인 요구 사항이나 권장 하이퍼파라미터 (hyperparameters)는 문서화되어 있지 않습니다.
Q: INTELLECT-3.1은 에이전트 작업 (agentic tasks)을 어떻게 처리하나요?
A: 이 모델은 에이전트 작업 (agentic tasks)에 대해 명시적인 RL 학습을 받았으며, vLLM의 도구 호출 (tool-calling) 인프라와 통합됩니다. 모델은 도구 호출 (tool calls) 시퀀스를 생성하고, 상태 변화에 대해 추론하며, 도구 출력 결과에 따라 행동을 조정할 수 있습니다. 이는 자율 에이전트 (autonomous agent) 애플리케이션에 적합하게 만듭니다.
Q: INTELLECT-3.1은 활발하게 유지 관리되고 있나요?
A: 이 모델은 2025년에 PrimeIntellect에 의해 출시되었으며, 해당 팀은 prime-rl 프레임워크와 verifiers 라이브러리를 유지 관리하고 있습니다. 팀은 커뮤니티 참여를 위해 Discord 서버와 X 계정을 제공합니다. 최근 출시되었고 학습 도구 주변의 생태계가 활발하다는 점을 고려할 때 유지 관리는 활발해 보이지만, 장기적인 지원 약속은 명시되지 않았습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기