Nanbeige4.2-3B: 컴팩트한 모드에서 에이전트 역량 해제하기
요약
3B 파라미터 규모의 컴팩트한 범용 에이전트 모델인 Nanbeige4.2-3B를 소개합니다. 루프 트랜스포머 구조와 고도화된 RL 파이프라인을 통해 수학, 코딩, 도구 사용 등 다양한 에이전트 작업에서 대형 모델을 능가하는 성능을 보여줍니다.
핵심 포인트
- 3B 규모의 컴팩트한 모델로 강력한 에이전트 역량 보유
- Looped Transformer 구조를 사용하여 파라미터 효율성 극대화
- 혼합 모드 RLHF 및 에이전트 RL을 통한 추론 품질 개선
- Qwen3.5-9B 및 Gemma4-12B 등 더 큰 모델 대비 우수한 성능
우리는 3B의 비임베딩 파라미터(non-embedding parameters)를 가진 컴팩트한 범용 에이전트 모델인 Nanbeige4.2-3B를 선보입니다. 이 모델은 수학, 코딩, 과학 분야에서 매우 경쟁력 있는 추론(reasoning) 능력을 유지하면서도 코드 에이전트(code-agent), 오피스 에이전트(office-agent), 그리고 복잡한 도구 사용(tool-use) 작업 전반에 걸쳐 강력한 성능을 제공합니다. Nanbeige4.2-3B는 파라미터를 추가하지 않고도 용량을 늘리기 위해 레이어 스택(layer stack)을 재사용하는 루프 트랜스포머(Looped Transformer)를 사용하여 28T 토큰으로 처음부터 사전 학습(pretrained from scratch)되었습니다. SFT(Supervised Fine-Tuning) 데이터 및 궤적(trajectory) 구축을 위해, 우리는 실제 배포와 대규모 합성을 통해 실행 가능한 환경, 작업 자산, 그리고 에이전트 스캐폴드(agentic scaffolds)의 다양성을 확장했습니다. 우리의 RL(강화학습) 파이프라인은 모델의 전반적인 품질을 개선하고 실패 사례를 줄이기 위해 'Think' 및 'Non-Think' 응답에 대해 혼합 모드 RLHF(Reinforcement Learning from Human Feedback)를 적용하며, 정확도와 추론 효율성의 균형을 맞추기 위해 길이 제어 추론 RL(length-controlled reasoning RL)을, 그리고 장기적 학습(long-horizon training)을 안정화하기 위해 결과 및 과정 보상(outcome and process rewards)을 사용하는 에이전트 RL(agentic RL)을 적용합니다. 광범위한 평가 결과, Nanbeige4.2-3B는 추론 및 정렬(alignment) 작업에서 경쟁력을 유지하는 동시에 다양한 에이전트 벤치마크에서 Qwen3.5-9B 및 Gemma4-12B를 포함한 더 큰 모델들을 능가함을 보여줍니다. OpenClaw를 통한 성능 또한 컴팩트한 로컬 개인 비서로서의 활용 가능성을 뒷받침합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기