엔지니어/개발자가 Gemma4-31B, Qwen3.8-27B, 6.1-Sol로 소프트웨어 엔지니어링 작업을 수행하며 관찰한 내용
요약
개발자가 Gemma4, Qwen3.8, 그리고 GPT 6.1-Sol 등 여러 LLM을 사용하여 소프트웨어 엔지니어링 작업을 수행한 경험을 공유합니다. 저장소 분석에서는 Gemma4가 효율성을 보였고, 신규 프로젝트 작성 시에는 Qwen3.8이 '끈기'를, GPT 6.1-Sol은 압도적인 완성도를 보여주었습니다.
핵심 포인트
- Gemma4는 서버 호출 횟수 등 효율성 측면에서 강점을 보였습니다.
- Qwen3.8은 사소한 오류가 많았으나 꾸준함(끈기)을 바탕으로 실용적 결과물을 만들었습니다.
- GPT 6.1-Sol은 사용자 맥락 이해와 완성도 면에서 가장 뛰어난 성능을 보여주었습니다.
제 경험상 말씀드리자면, 저는 교육 배경은 기계 공학이고 지난 약 20년간 실제로는 소프트웨어 엔지니어로 일해 왔습니다. 로컬 모델을 가지고 노는 것은 최근의 취미가 되었습니다. 오늘 저는 제가 하는 '실제' 작업과 유사하다고 생각하는 몇 가지 테스트를 진행하기로 결정하고, 여러 모델 조합과 하네스(harnesses)들을 사용해 보았습니다. 너무 공식적으로 만들려는 건 아니지만, 접근 방식은 다음과 같았습니다.
모델: Gemma4-31B 대 Qwen3.8-27B (동일한 양자화 수준인 Unsloth의 Q4 적용)
하네스: Codex CLI 대 OpenCode CLI
작업 유형: '이 코드를 설명해 줘'와 '새로운 것을 만들자'
GPT 6.1-Sol은 나중에 등장할 예정입니다.
하네스의 차이는 현재로서는 크게 결정적이지 않았기 때문에 이 부분에 대해서는 말을 아끼겠습니다.
저장소 검사 및 분석 (Repository Inspection & Analysis)
제가 매우 익숙한 참조 저장소를 사용하여, 프롬프트는 사실상 '읽기 전용으로 다음 라이브러리에 대해 설명해 줘. 핵심 추상화 요소(core abstractions)가 무엇인지, 소비자 관점에서 상황 X, Y, Z에서 내가 인지해야 할 점은 무엇이며, 접근 방식의 전반적인 강점과 약점은 무엇인지 알려줘. 분량은 900단어 이내로 유지해.'였습니다.
Qwen과 Gemma 모두 동등하게 좋은 분석과 답변을 내놓았으며, 약간씩 다른 관점을 보였습니다. 주목할 점은 Gemma4가 Qwen보다 훨씬 효율적으로 작동했다는 것입니다. 명시된 작업에 더 집중했으며(하네스에 따라 약 20~30회 대비 약 10회 호출), 서버 호출 횟수가 훨씬 적었습니다. Qwen은 좀 더 호기심이 많아 구체적인 요청을 넘어서 깊게 파고들려는 주도성을 보였고, 약간 더 완벽한 그림의 평가를 구성했습니다. 하지만 다시 말하지만, 결국 두 응답 모두 동등하게 좋았습니다. 저는 효율성 측면에서 Gemma4에 조금 더 높은 점수를 주고 싶습니다.
새로운 프로젝트 작성 (Authoring a New Project)
저는 개념이 간결하고, 레거시 코드베이스나 상당한 외부 종속성에 의존하지 않으며, 제가 손으로 작업하기에 약 1~2일 정도 걸릴 만한 애플리케이션을 생각했습니다. 일반적인 개념, 몇 가지 다른 역할에서의 사용자 경험, 설계 제약 조건 및 미래 대비가 필요한 내용을 다루는 프롬프트로 약 8개 단락을 작성했습니다.
C# 언어와 재사용 가능한 백엔드 및 WPF 프런트엔드를 갖춘 경우, 더 명확한 차이가 나타났습니다. Gemma4는 다시 한번 매우 효율적으로 보였습니다. 계획 수립이 매우 빠르고 실행도 빨랐습니다. 최종 결과물에 B-를 주고 싶습니다. 사용 가능한 솔루션으로 수렴하기 위해서는 몇 번의 피드백 반복이 분명 필요했지만, 나쁘지 않았습니다! 두 번의 수정 과정을 거치고는 충분한 평가라고 생각하여 옆으로 치워두었습니다. Qwen3.8은 Gemma4만큼 '똑똑'해 보이지는 않지만 훨씬 더 '끈기'가 있습니다. 진행하면서 누락된 using statement나 여러 가지 사소한 실수 등 작은 오류들이 많았습니다. 마치 스스로 발에 걸려 넘어지면서도, 더 높은 목표를 겨냥하고 그것을 고수하는 느낌이었습니다. 확실히 훨씬 오래 걸렸습니다. 첫 번째 결과물은 Gemma의 것보다 한 단계 나았고, 제가 실질적으로 사용할 수 있는 수준까지 도달하는 데는 단 1번의 수정만 필요했습니다. B+를 주고 싶습니다. 견고한 결과물이며 Gemma보다 선택하기 쉬웠습니다. Qwen3.8이 작동하면서 방의 전등을 깜빡이고 어둡게 만들 때, 재미 삼아 ChatGPT 데스크톱 앱을 실행하고 6.1-Sol을 가져와 동일한 프롬프트를 주었습니다. 결과는요? A+였습니다. 완전히 다른 차원의 기능성과 완성도입니다. 상호작용에 대한 사용자 맥락을 정말로 이해하는 느낌이었습니다. '자, 이제 끝났다 - 배포해도 된다'라는 느낌의 원샷 솔루션이었습니다. 제가 평가하던 두 개의 오픈 웨이트 모델 간의 차이를 보는 것은 확실히 흥미로웠습니다. 그리고 소비자급 하드웨어에 대해서는 결과가 매우 실용적이라고 생각했습니다. 다만 분명 최첨단 연구실 수준과는 같은 대화 단계는 아닌 것 같습니다. 재미있는 후속 작업으로는 이들을 실제 개발 지옥, 즉 오래된 레거시 코드베이스를 다루는 작업에 투입하는 것이 될 것 같습니다. 이에 대한 벤치마크가 있어야 합니다! 아마도 오래된 Doom이나 Command & Conquer 소스 코드를 가져와 테스트하는 것이 미래의 시험이 될 수 있을 것입니다. 제출자: /u/therealjerseytom [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/LocalLLaMA의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기