microsoft/FrogNano-4B-2609 · Hugging Face
요약
Microsoft가 낮은 GPU 사양 환경에서도 사용할 수 있도록 설계된 에이전트 모델 FrogNano-4B를 공개했습니다. 이 모델은 Qwen3.5-4B에서 파생되었으며, SWE task 환경에서 강화학습(RL)을 통해 리포지토리 엔지니어링 작업에 특화되어 학습되었습니다.
핵심 포인트
- GPU 사양이 낮은 환경에서도 사용 가능한 4B 에이전트 모델입니다.
- SWE task 환경의 합성 데이터로 RL 학습을 거쳤습니다.
- 리포지토리 탐색, 디버깅, 코드 편집 등 엔지니어링 작업에 특화되었습니다.
- Leaf harness와 통합되어 구조화된 도구 호출을 생성합니다.
GPU 사양이 낮은 환경을 위한 Microsoft의 에이전트 모델
https://huggingface.co/bartowski/FrogNano-4B-2609-GGUF
FrogNano는 범용으로 언어, 추론, 코딩, 에이전트 및 멀티모달 작업을 위해 설계된 Qwen/Qwen3.5-4B에서 파생되었습니다. FrogNano는 Qwen3.5-4B의 밀집 32개 레이어 하이브리드 Gated DeltaNet과 게이트 어텐션 아키텍처를 계승하지만, 추가적인 사후 학습은 텍스트 전용이며 리포지토리 수준 소프트웨어 엔지니어링에 중점을 두었습니다. 이 모델은 TaskPilot을 사용하여 진화하는 정책에 맞춰 생성 및 보정된 약 1,500개의 합성 SWE(SWE task) 환경에서 강화학습 (RL)을 통해 추가로 학습되었습니다. 학습에는 다섯 가지 도구의 Leaf harness와 완전한 다중 턴 코딩 궤적에 대한 실행 가능한 테스트 기반 보상이 사용됩니다.
추가적인 사후 학습은 작고 간결한 4B 모델에서 장기 범위 리포지토리 탐색, 디버깅, 코드 편집, 테스트 실행 및 패치 생성 능력을 향상시키는 것을 목표로 합니다. 행동 증류(behavioral distillation) 기반 접근 방식과 달리, FrogNano는 더 강력한 모델의 해결 궤적, 액션, 추론 흔적 또는 패치 타겟으로 학습하지 않습니다. 이러한 전문화는 또한 한계와 위험을 초래합니다: 성능은 Leaf harness와 테스트 품질에 민감하며, 학습 데이터는 Python 위주이고 주로 영어이며, 사용하거나 배포하기 전에 인간의 검토, 회귀 테스트 및 보안 검증이 필요함에도 불구하고 생성된 패치는 부정확하거나 안전하지 않을 수 있습니다. Leaf harness와 통합될 때, FrogNano는 리포지토리 변경을 제안할 수 있는 구조화된 도구 호출을 생성합니다. Leaf는 격리된 리포지토리 환경 내에서 승인된 도구 호출을 실행하여 후보 패치를 생성하며, FrogNano 자체가 변경 사항을 배포하지는 않습니다.
제출자 /u/jacek2023
[링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기