Mellum2.1-12B-A2.5B를 PI Coding Agent에서 테스트한 결과 - 놀라울 정도로 사용 가능하지만, 원샷 프로젝트에는
요약
Mellum2.1-12B-A2.5B 모델을 로컬 환경에서 테스트한 결과, 원샷 프로젝트에서는 기대에 미치지 못했지만 에이전트 행동과 도구 호출 기능은 매우 우수했습니다. 특히 코드베이스 탐색 및 수정 작업이나 화면 녹화본 처리 등 작은 개발 작업을 수행하는 데 유용함을 입증했습니다.
핵심 포인트
- 원샷 프로젝트보다는 에이전트적 행동에 강점을 보임.
- 도구 호출(Tool calling) 기능과 자체 오류 수정 능력이 뛰어남.
- 코드베이스 탐색 및 특정 값 변경 같은 개발 작업에 활용 가능함.
- 로컬 환경에서 131K 컨텍스트를 사용 시 초당 약 40 t/s의 속도를 기록함.
저는 Pi와 llama-server를 사용하여 Mellum2.1-12B-A2.5B (Q8) 모델을 로컬에서 테스트했습니다. 다섯 가지 테스트 모두 원샷(one-shot) 방식이었습니다. 결과는 상당히 엇갈렸습니다: - Pelican SVG, Browser OS, Minecraft: 성능이 좋지 않았습니다. - Bouncing Hexagon: 물리 엔진은 괜찮았지만, 놀랍게도 터미널에서 실행되도록 만들었습니다. - Flappy Bird: 완료했지만, 시각 자료가 매우 기초적이었고 게임 난이도가 너무 높았습니다. Pelican SVG Browser OS Minecraft Flappy Bird Bouncing Hexagon 좋습니다. 이런 것들이 멋지하게 보이지 않을 수도 있지만, 제 말을 들어보세요. 이 모델은 실제로 꽤 좋습니다. 에이전트(agentic) 행동이 좋습니다. 도구 호출(Tool calling) 기능이 정말 좋고, 종종 스스로 편집 실수를 감지하고 수정합니다. 한 번은 도구를 호출하는 데 실패해서 완전히 멈추기도 했습니다. 기존 게임 프로젝트에서도 사용해 보았습니다. 코드베이스를 탐색하여 개들의 점프 높이를 3배로 성공적으로 변경했습니다. 또 다른 좋은 놀라움이 있었습니다: 테스트 녹화를한 후, 모델에게 화면 녹화본을 GIF로 변환하고 특정 폴더에 정리하도록 요청했습니다. 아무 문제 없이 전체 과정을 처리했습니다. 다만, 익숙하지 않은 워크플로우에서는 가끔 어려움을 겪기도 합니다. 8GB VRAM과 32GB RAM을 가진 노트북에서 131K 컨텍스트를 사용하여 실행했을 때, 초당 약 40 t/s의 속도를 얻었습니다. 대신 Qwen3.6 35B-A3B를 사용하지 않는 이유에 대해 질문할 수도 있습니다. 이 모델은 더 큰 컨텍스트에서 느려지며, 제 노트북이 너무 뜨거워져서 실제로 뚜껑 센서를 태웠습니다. 제 노트북으로는 겨우 감당할 수 있는 수준입니다. 전반적으로, 원샷 창작물로 저를 압도하는 모델은 아니지만, 작은 개발 작업을 위해 정기적으로 사용할 수 있을 것 같은 모델임은 분명합니다. model jetBrains에 감사드립니다. submitted by /u/SoAp9035 [link] [comments]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기