Frontis-MA1: 머신러닝 엔지니어링에서의 재귀적 자기 개선을 향한 AI4AI 모델 학습
요약
AI가 머신러닝 엔지니어링(MLE) 프로세스를 스스로 개선하는 재귀적 자기 개선(RSI) 연구를 위한 오픈 풀스택 시스템 OpenMLE를 소개합니다. Frontis-MA1(35B) 모델은 메타 진화 에이전트로서 학습과 진화를 단일 루프 내에서 결합하여 벤치마크 성능을 크게 향상시켰습니다.
핵심 포인트
- 재귀적 자기 개선(RSI)을 위한 오픈 풀스택 시스템 OpenMLE 공개
- Frontis-MA1(35B) 모델의 메타 진화 에이전트 성능 입증
- MLE-Bench Lite 테스트에서 베이스 모델 대비 성능 대폭 향상
- 학습과 진화를 결합한 단일 루프 구조 및 오픈소스 코드 제공
재귀적 자기 개선 (Recursive self-improvement, RSI)은 AI를 구축하는 프로세스를 개선하는 AI 시스템 (즉, AI4AI)을 필요로 합니다. 머신러닝 엔지니어링 (Machine Learning Engineering, MLE)은 이러한 능력을 연구하기 위한 구체적이고 실행 가능한 테스트베드를 제공합니다. 우리는 MLE에서의 RSI 연구를 위한 오픈 풀스택 시스템인 OpenMLE를 소개합니다. 이는 실행 피드백을 포함하는 검증 가능한 작업 환경 (OpenMLE-Gym), 연산자 학습 (OpenMLE-RL), 그리고 장기적 탐색 (OpenMLE-Evo)을 아우릅니다. 이 스택 위에서 우리는 MLE를 위한 메타 진화 에이전트로서 Frontis-MA1 (35B)을 사후 학습 (Post-training) 시켰으며, 네 가지 원자적 프로그램 진화 연산자 (Draft, Improve, Debug, Crossover)를 중심으로 사후 학습과 추론을 정렬했습니다. 이 동일한 연산자들은 모든 평가 벤치마크에 대해 중복 제거된 데이터를 사용하여 실행 기반의 지도 미세 조정 (SFT) 및 강화학습 (RL)을 통해 학습되며, 이후 장기적 탐색으로 구성되어 학습과 진화를 단일 루프 내에서 결합합니다. 12 GB VRAM으로 제한된 단일 RTX 4090 환경에서 작업당 12시간의 예산으로 진행된 MLE-Bench Lite 테스트 결과, Frontis-MA1 (35B)은 OpenMLE-Evo를 통해 베이스 모델 대비 Medal Average를 39.39%에서 60.61%로 향상시켰으며, OpenMLE-Evo-Max (벤치마크 독립적 경험 사전 지식 및 비동기 탐색 적용)를 통해 71.21%에 도달하여 GPT-5.5 + Codex를 능가하고 GPT-5.6 Sol 및 2.8T Kimi K3에 근접했습니다. 별도의 NatureBench Lite 테스트에서도 두 구성 요소 모두 전이 성능을 보였습니다. 프레임워크를 고정한 상태에서 학습된 모델로 교체했을 때 Match-SOTA가 50%에서 70%로 상승했으며, 모델을 고정한 상태에서 OpenMLE-Evo로 교체했을 때 20%에서 50%로 상승했습니다. 우리는 RSI를 향한 실행 가능한 AI4AI에 대한 재현 가능한 연구를 가능하게 하기 위해 모델 가중치와 전체 OpenMLE 스택을 공개합니다. 코드: https://github.com/FrontisAI/OpenRSI
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.CL (NLP)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기