RSI, 이번에는 샤오미가 주도
요약
샤오미가 MiMo-V2.6을 통해 AI 역량 확장을 목표로 대규모 강화학습(RL) 노력을 공개하고 있습니다. 이 모델은 코딩, 일반 추론, 시각 작업 등 광범위한 영역에 RL을 적용하며, 최대 100만 토큰의 컨텍스트 길이를 자랑합니다.
핵심 포인트
- 샤오미는 MiMo-V2.6으로 AI 역량 확장을 추진 중입니다.
- RL을 코딩, 추론, 시각 등 전반에 걸쳐 적용하고 있습니다.
- 최대 100만 토큰의 컨텍스트 길이를 확보했습니다.
샤오미는 자체 개선을 목표로 AI를 공개적으로 확장하고 있습니다.
샤오미의 MiMo-V2.6은 현재까지 가장 큰 강화학습(RL) 규모의 노력으로, 코딩, 일반 추론, 시각 작업, 자동화, 사이버 보안 전반에 걸쳐 RL을 추진합니다.
보고된 바에 따르면 훈련 과정에서는 한 RL 단계당 약 1,568개의 샘플과 27억~37억 개의 토큰이 처리되며, 컨텍스트 길이는 최대 100만 토큰에 달합니다. 샤오미는 단순히 특정 벤치마크로 훈련하는 대신, 여러 복잡한 환경과 강력한 에이전트 평가자(agentic graders)를 사용하여 장기 지평 추론을 개선하고 모델을 더욱 효율적인 솔루션으로 이끌고 있습니다.
훈련 전반에 걸쳐 여러 벤치마크에서 성능이 계속 상승하는 것은, 대규모 RL이 여전히 모델 역량을 향상시킬 상당한 여지가 있음을 시사합니다.
그리고 샤오미는 이러한 방향을 명확하게 모델 자체 개선을 위한 강화학습 확장으로 규정하고 있습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기