코딩 에이전트는 왜 이렇게 멍청할까?
요약
코딩 에이전트의 현재 한계점과 비효율성을 분석하며, 단순히 LLM에 외부 도구를 연결하는 수준을 넘어선 개선 방향을 제시합니다. 특히 세션 관리, 문맥 유지, 그리고 계획 수립 과정에서의 인간적 개입 및 조언자 역할의 중요성을 강조합니다.
핵심 포인트
- 코딩 에이전트는 병렬화나 메시지 교환 등에서 토큰 효율성 문제가 발생할 수 있습니다.
- 에이전트가 스스로 작업 적합 모델을 판단하거나, 감독 에이전트가 개입하는 기능이 필요합니다.
- 파일 기반 메모는 문맥 손실과 잘못된 습관 축적의 위험이 있어 개선이 시급합니다.
- 사용자 관점에서의 검토 및 계획 수립 과정에 도움을 받는 것이 만족도를 높일 수 있습니다.
전반적으로 공감하지만, 일부는 Claude에만 해당하는 한계이거나 그럴듯한 이유가 있는 동작임. 예를 들어 에이전트 실행 환경이 작업을 자동으로 병렬화하지 않는 건 세션 한도에 걸리기 쉽고, 메시지 교환·조율·충돌 해결에 순차 실행보다 더 많은 토큰을 쓰기 때문일 수 있음.
작업에 적합한 모델인지 스스로 판단하는 기능은 대체로 없지만, 쓸 만한 대안은 있음. Claude에는 하위 작업에 맞는 모델을 쓰라고 지시하면 어느 정도 작동하고, Oh-my-pi에서는 느린 작업·소형 모델용 작업·검토·기본 작업 등 역할별 모델을 지정하면 일관되게 사용함. 더 똑똑한 모델이 다른 하위 에이전트를 지켜보다 필요할 때 개입하는 조언자 에이전트도 직접 지원함.
그럴듯한 설명이지만 여전히 직관적이지는 않음. 하나의 세션과 문맥에서 작업 10개를 처리하는 쪽이, 감독 에이전트가 범위를 좁힌 하위 에이전트 10개에 위임하는 것보다 토큰을 더 쓰지 않을까?
토큰 효율을 떠나서, 나처럼 사용량 한도에 자주 걸리지 않고 토큰을 더 쓰더라도 실제 실행 시간을 줄이고 싶은 사용자도 많을 것 같음.
“직원이 사소한 세부 사항에 대한 내 답을 기다리느라 근무 시간 내내 아무것도 안 했다고 하면 바로 해고하겠다”는 대목에서 문제의 뿌리를 찾은 것 같음.
코딩 에이전트에 바라는 기능 목록은 사실상 70년간의 컴퓨터 과학·설계·제품 개발 역량에 초인적 지능과 인간 수준의 절제력까지 합친 것임. 그걸 모두 갖췄다면 컴퓨터 과학의 거의 모든 문제를 해결했을 텐데, 오픈 소스이기까지 바라니 말임.
차라리 스스로 복제하는 휴머노이드 로봇을 만드는 쪽이 실현에 더 가까워 보임.
구체적으로 어떤 항목을 말하는 건가? 모델은 이미 할 수 있는데 에이전트가 활용하지 못하는 기능들임.
모델과 에이전트 양쪽의 문제임. 모델에는 문맥 한도가 있으므로, 문맥을 효율적으로 비우면서 장기간 연속성을 유지하는 방법이 나오기 전까지는 매번 LLM을 갓 태어난 아기처럼 대해야 함. 방대한 지식은 갖췄지만, AGENTS.md 같은 조악한 보조 수단 없이는 자신이 놓인 환경을 전혀 모르는 존재임.
지금 에이전트의 발목을 가장 크게 잡는 부분임. 파일에 메모를 남기게 할 수는 있지만, 파일 기반 메모에도 단점이 많음. 모든 내용을 기록하지 못해 세션을 재시작할 때마다 문맥이 대거 사라지고, 메모 자체의 품질도 낮아 다음 세션에서 핵심을 놓치기 쉬움. 잘못된 기록 방식을 한번 쓰면 후속 세션도 “기존 관례를 지키려고” 그대로 따라 하면서 오류와 나쁜 습관이 쌓임.
파일이 커질수록 새 세션의 문맥 창도 처음부터 더 많이 차서 실제 작업 공간이 줄어듦. 20만 토큰도 매우 작은 편이고, 10만 토큰을 넘으면 작은 모델은 문맥 활용 능력이 떨어지기 시작함. 큰 모델도 문맥을 압축하면서 흐름을 놓치며, 100만 토큰 문맥 창을 쓰면 비용이 크게 불어남. 결국 같은 말을 끝없이 반복하다가 진이 빠지게 됨.
나는 에이전트에게 프로젝트 문서부터 수정하게 하거나 직접 초안을 고치는 경우가 많음. 사용자 관점에서 어떻게 보일지 먼저 확인하고, 만족스러워지면 계획을 세운 뒤 코드를 작성함.
나도 계획의 세부 사항을 끝까지 읽는 일은 드물지만, 사람이 그렇듯 에이전트도 스스로 계획을 세우는 과정에서 도움을 받을 수 있다고 봄.
최첨단 모델 연구소들은 에이전트 실행 환경을 그저 LLM과 bash를 연결하는 어댑터로 보는 듯함. 실행 환경이 도울 만한 일은 모두 다음 모델에 강화학습으로 익히게 하려 하므로, 이들에게서 영리한 실행 환경 기능을 기대하기는 어려워 보임.
여기서 “에이전트”를 전부 도구나 코드 생성기로 바꾸면 인지 부조화가 상당 부분 사라짐. 내 경험으로도 그렇게 생각하며 쓰는 편이 좌절은 줄고 만족도는 훨씬 높아짐.
어느 부분이 틀렸다는 건가? Claude Code의 샌드박스는 기본적으로 꺼져 있음. 활성화해도 내가 이해하기로는 여전히 gives itself read access to your whole system 방식으로 시스템 전체 읽기 권한을 가지며, 읽지 못하게 할 경로를 하나하나 지정해야 함. 지금 문서를 읽고 있는데도 “현재 디렉터리만 읽을 수 있게 하라”는 설정을 어떻게 해야 할지 이해하기 어려움.
핵심은 Claude Code와 Codex가 기본 설정에서 안전하지 않다는 것임. 작업에 필요한 최소 권한만 쓰도록 설계하는 대신, 접근을 제한하려면 사용자가 상당한 수고를 들이게 함.
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기