12시간 동안 스스로 구축한 4,518줄 분량의 도구와 앱 로딩 시간은 여전히 35초에 머문 사례 (GPT-6.1 솔로 케이스 리포트)
요약
솔로 개발자가 12시간 이상을 들여 내부 보고 앱의 로딩 속도 개선을 시도했으나, 실제 측정 가능한 성능 개선은 이루어지지 않았습니다. 이 과정에서 자체 빌드 분석 도구를 구축하고 여러 서브 에이전트를 활용했지만, 결국 통합된 수정이나 시간 단축 효과를 입증하지 못했습니다.
핵심 포인트
- AI 기반 개발 작업의 어려움과 한계점을 보여줌.
- 장기적인 '노력(mahat)'만으로는 실제 성능 개선을 보장하기 어려움.
- 복잡한 시스템 유지보수에는 통합 및 검증 과정이 필수적임.
설정. 솔로 개발자, Linux/WSL2, Codex CLI 0.159.3, gpt-6.1-sol을 추론 노력(reasoning effort) '높음'으로 사용. 과제: 기존 내부 보고 앱이 로드하는 데 약 35초가 걸림 (대략 로딩 표시기가 나타날 때까지 20초, 보고서가 완전히 렌더링될 때까지 추가로 약 15초 소요되며, 이는 private Tailscale 연결을 통해 전송됨). 목표: 로딩 속도를 높이고 실제 측정으로 개선 사항을 검증하는 것. 내가 기대했던 것. 실제 로드 단계를 측정하고, 가장 큰 병목 지점을 찾아내며, 구현 서브 에이전트(implementation subagent)를 통해 수정하고, 검증한 후 완료. 전형적인 유지보수 작업이며, 이 에이전트들이 마케팅되는 바로 그 종류의 장기 과제임. 실제로 일어난 일은 12시간 이상에 걸쳐: 실제 로드 단계는 측정되지 않았음. 대신 자체 JavaScript '빌드 분석(build analysis)' 도구를 구축함: 4,518줄의 코드와 8,183줄짜리 테스트 파일로 구성되어, 몇 가지 측정만으로 파악할 수 있는 문제를 분석하는 데 사용됨. 실행 초기에 상태 초기화 버그(state-initialization bug)를 도입했고, 이를 스스로 추적해야 했음. 자신의 구현 서브 에이전트를 작업 도중에 반복적으로 중단시킴. 한때는 서브 에이전트에게 20분간의 방해받지 않는 실행 시간을 명시적으로 요구해야 했음. 분석, 검토 및 확인의 끝없는 주기가 이어짐. 일부 부분적인 수정은 개별적으로 통과되었지만, 아무것도 통합되지 않았고 전체 로드 시간은 처음부터 다시 측정되지 않음. 마침내 그것에게 막다른 골목에 다다랐는지 물었을 때, 목표를 상실했다고 인정함. 그 후의 자체 평가는 테스트 증거를 과대평가했음. 나는 이 메모를 독립적으로 검토받았고, 판결은 다음과 같았음. 결과. 통합된 수정 없음. 측정된 개선 사항 없음. 리포지토리(repo)에 상당한 복잡성만 추가됨. 12시간 이상의 컴퓨팅 자원은 단 한 번도 평가되지 않았음. 이 일 때문에 월 $200 구독을 취소했음: 분풀이 때문이 아니라, 지속적인 'mahat' (노력/투입 시간)에 대해 그 구독료를 지불하기 때문임. 공정성 참고 사항. 부분적 수정들은 직접적으로 대면하여 다루어졌음. 이것은 하나의 문서화된 타임라인 및 실행 상태임: https://github.com/openai/codex/issues/502 댓글에서 질문에 답변드리겠습니다.
제출자: u/Ok_Introduction_3008 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/ChatGPTCoding (top/week)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기