
매우 흥미로운 소식: Prime Intellect가 장기 실행 AI 세션을 프로그래밍 문제로 전환하는 오픈 소스 코딩 하네스(coding
요약
Prime Intellect가 장기 실행 AI 세션을 위한 오픈 소스 코딩 하네스인 Prime Agent를 출시했습니다. IPython 커널을 활용해 모델이 도구 호출, 서브 에이전트 실행, 상태 저장을 수행하며 복잡한 문제를 해결하도록 돕습니다.
핵심 포인트
- IPython 커널을 기반으로 한 지속적인 실행 환경 제공
- 서브 에이전트 위임 및 컨텍스트 관리를 통한 성능 향상
- ARC-AGI-3 벤치마크에서 인간 전문가 수준의 성능 달성
- Rust 기반 에뮬레이터 구축 등 고난도 프로그래밍 작업 수행 가능
매우 흥미로운 소식: Prime Intellect가 장기 실행 AI 세션을 프로그래밍 문제로 전환하는 오픈 소스 코딩 하네스 (coding harness)인 Prime Agent를 출시했습니다.
이 도구의 유일한 도구는 지속적인 IPython 커널 (IPython kernel)입니다. 모델은 프로그래밍 방식으로 자신의 기록을 검색하고, 도구를 호출하며, 지속적인 서브 에이전트 (sub-agents)를 실행하고, 활성 컨텍스트 (active context) 외부의 유용한 상태를 저장할 수 있습니다.
Prime Intellect: "RLM은 컨텍스트 (context)를 변수로 취급하고, 서브 에이전트 위임 (subagent delegation)을 REPL 내부의 함수 호출 (function calls)로 취급합니다."
그들은 롱 컨텍스트 (long-context) 및 롱 호라이즌 (long-horizon) 작업 전반에서 강력한 성능 향상을 보고했습니다. Opus 5를 사용하여, Prime Agent는 ARC-AGI-3에서 95.5%를 기록하며 벤치마크에 보고된 인간 전문가 기준선인 95.4%를 근소하게 상회했습니다.
또한 프리뷰 벤치마크에서 Rust를 사용하여 작동 가능한 SEGA Genesis 및 Game Boy Color 에뮬레이터를 처음부터 구축했습니다 :D
AI 자동 생성 콘텐츠
본 콘텐츠는 X 토픽: Benchmark의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기