
Codex 5.6 Sol이 Fable을 넘어섰다고 느낀 이유
요약
Codex 5.6 Sol이 단순 코드 생성을 넘어 실무 프로젝트의 전체 루프를 완수하는 에이전트로서 Fable보다 뛰어난 성능을 보인 사례를 분석합니다. Sol은 공유 메모리와 목표 지향적 접근을 통해 환경 구성, 테스트, 배포 및 롤백까지 스스로 수행하며 결과에 책임을 집니다.
핵심 포인트
- 단순 코드 생성을 넘어 목표(Goal)를 완수하는 에이전트의 중요성
- 공유 메모리를 통한 문맥 유지 및 실무 환경(배포, 데이터 등)의 자율적 파악
- 수정, 테스트, 배포, 롤백을 포함한 전체 작업 루프의 자동화
- 도구(Tool)에서 조직 단위의 에이전트로 진화하는 AI의 방향성
최근, AI에게 "코드를 작성해줘"라고 부탁하는 일이 줄었습니다.
대신 "이 상태까지 만들어줘"라고 부탁하고 있습니다.
이 차이는 요리 레시피를 써달라고 하는 것과, 실제로 식탁에 요리를 차려내는 것만큼이나 큽니다. 레시피가 정확하더라도 재료가 부족하고, 불이 붙지 않고, 접시에 담기지 않는다면 저녁 식사가 될 수 없습니다.
이번 주, Fable과 Codex 5.6 Sol을 두 개의 실무 프로젝트에서 비교했습니다.
첫 번째는 1toAll이라는 콘텐츠 전송 Agent를 11agents로 통합하여 서버에 공개하는 작업입니다.
두 개의 리포지토리(Repository), 프로젝트별 워크스페이스, 로그인, 영속 데이터(Persistent data), Cloudflare, 배포(Deploy)가 얽혀 있습니다.
Claude와 밤새 작업했습니다. 개별적인 수정은 그럴듯했고 설명도 명쾌했습니다. 하지만 전체는 작동하지 않았습니다. 설정을 고치면 로그인이 깨지고, 새 버전을 보내도 서버는 이전 release 상태 그대로였습니다. 매번 "조금만 더 하면 된다"는 느낌이었습니다.
Sol은 공유 메모리(Shared memory)와 인계 사항, 이력을 읽고 현장을 재구성했습니다. 어떤 코드를 어느 리포지토리가 보유할지, 왜 실무 데이터를 release로 덮어쓸 수 없는지, Cloudflare가 인증에 어떻게 영향을 미치는지, 실제로 무엇이 가동 중인지를 확인했습니다.
그리고 수정, 테스트, 배포를 계속하여, 실무의 release SHA가 새로운 commit과 일치하는 지점까지 지켜보았습니다.
"남은 부분은 인간이 해주세요"라는 말이 없었습니다.
두 번째는 모델 라우팅(Model routing) 기반인 Flatkey의 공식 사이트입니다.
겉보기에는 완성되어 있었습니다. 하지만 검색은 작동하지 않았고, 모델과 언어는 전환되지 않았으며, 일부 버튼은 장식에 불과했습니다. 등록 동선, API 정보, key prefix, 가격, SLA에도 오래된 정보가 남아 있었습니다.
200(OK) 응답이 오는 것과 제품을 사용할 수 있는 것은 별개입니다.
Sol에게 전달한 것은 세세한 수정 목록이 아니라, "안전하게 공개할 수 있는 상태로 만든다"는 goal(목표)였습니다.
실제 제품, 문서, 실무 구성과 대조하며 잘못된 조작이나 오래된 정보를 수정했습니다. 갑자기 실무로 내보내지 않고, canary 환경에서 검색, 모델 선택, 언어, 요금, 코드 예시, 링크를 포함한 20가지 조작 테스트를 실행했습니다. 나아가 12개의 실무 경로, redirect, analytics, 주요 모델을 확인한 후 traffic을 전환하고, rollback(롤백) 설정도 남겼습니다.
Flatkey를 여기서 언급하는 것은 광고를 위해서가 아닙니다. 모델 라우팅이 실제 기반이 된다면 사이트, 문서, 가격, runtime(런타임)의 동작이 일치해야 하기 때문입니다.
코드 생성은 이제 최소 조건이 되었다고 생각합니다.
실무의 일은 목표를 이해하고, 현실의 문맥을 복원하며, 여러 시스템을 변경하고, 새로운 문제를 발견하여 수정하고, 테스트하고, 공개하며, 최종 상태를 확인하는 루프(Loop)입니다.
도중에 멈춘다면 그때까지의 가치가 제로가 될 수도 있습니다.
Fable은 지금도 강력한 generator(생성기)입니다. 빠르게 페이지를 만들고 정확한 코드도 작성할 수 있습니다. 다만, 저의 프로젝트에서는 인간이 배경을 보완하고, 태스크를 나누고, 누락을 지적하며, 최종 검수를 수행해야 했습니다.
Sol은 결과에 책임을 지는 Agent에 가까워지고 있습니다.
공유 메모리를 통해 처음부터 다시 시작하지 않습니다.
goal을 놓지 않습니다.
화면, 권한, 데이터, deploy(배포), 실무 환경을 스스로 확인합니다.
실패 시의 rollback까지 "완료"에 포함합니다.
이것은 20%의 효율 차이가 아닙니다.
일을 도와줄 수 있느냐, 아니면 일 그 자체를 맡길 수 있느냐의 차이입니다.
Agent는 도구(Tool)에서 조직 단위로 변해갈 것이라고 생각합니다.
인간은 "왜 하는가", "어디까지를 완성이라고 부르는가", "넘어서는 안 될 선은 무엇인가"에 판단을 집중합니다. 공유 메모리, 자동 검증, 배포, Flatkey와 같은 모델 기반, rollback이 그 사이를 잇는 조직의 OS가 될 것입니다.
다음 경쟁은 누가 가장 깔끔한 레시피를 쓰느냐가 아닙니다.
모호하더라도 진짜 goal을 받아들여, 번거로운 세부 사항을 통과하고, 식탁까지 요리를 운반할 수 있느냐입니다.
저는 그 모습을 보고 싶습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기