
가장 큰 AI 인프라 버그는 모델이 아닙니다
요약
AI 프로젝트의 가장 큰 문제는 모델 성능이 아니라 프롬프트 관리의 부재입니다. 프롬프트를 코드처럼 관리하고 체계적인 폴더 구조를 도입하여 재현성과 디버깅 가능성을 확보해야 합니다.
핵심 포인트
- 프롬프트를 Git을 통해 버전 관리하고 파일로 저장해야 함
- 데이터, 에이전트, 평가(evals)를 분리한 폴더 구조 권장
- 평가(evaluations) 프로세스 없이는 시스템이라 부를 수 없음
- 체계적인 구조는 재현성, 디버깅, 인수인계 능력을 향상시킴
가장 큰 AI 인프라 (infrastructure) 버그는 당신의 모델이 아닙니다.
그것은 바로 프롬프트 (prompt)가 어디에 있는지 아무도 모른다는 사실입니다.
저는 프로덕션 (production) 프롬프트가 4개월 전 Slack DM 안에 들어있는 AI 저장소 (repos)들을 열어본 적이 있습니다.
Git에 있는 것도 아닙니다.
저장소 (repo)에 있는 것도 아닙니다.
문서화조차 되어 있지 않았습니다.
누군가는 수정을 배포하기 위해 말 그대로 채팅 기록을 검색해야만 했습니다.
놀랍게도 정말 많은 AI 프로젝트들이 그런 방식으로 운영되고 있습니다.
해결책은 또 다른 프레임워크 (framework)가 아닙니다.
그것은 지루한 폴더 구조입니다.
ai-project/
├── prompts/
├── data/
├── agents/
└── evals/
prompts/
모든 시스템 프롬프트 (system prompt)
모든 태스크 프롬프트 (task prompt)
모든 툴 프롬프트 (tool prompt)
실제 파일로 존재
Git에서 버전 관리 (Versioned)
만약 당신의 프롬프트가 코드가 아니라면, 그것은 사라지기를 기다리는 조직의 기억일 뿐입니다.
data/
raw/와 processed/를 분리하세요
품질 저하 (quality regression)가 발생할 때마다 던지는 첫 번째 질문은
"입력값(inputs)에서 무엇이 바뀌었는가?"입니다.
명확한 경계가 없다면 당신은 절대 알 수 없습니다.
agents/
설정 (configs) 유지
기술 (Skills)
도구 (Tools)
권한 (Permissions)
행동을 정의하는 모든 것은 여기에 속해야 합니다.
그렇지 않으면 모든 에이전트 (agent)는 서서히 암묵적 지식 (tribal knowledge)이 되어버립니다.
evals/
이것은 거의 모든 사람이 건너뛰는 폴더입니다.
테스트 (Tests)
트레이스 (Traces)
스코어카드 (Scorecards)
평가 (evaluations) 없이는 AI 시스템을 가졌다고 할 수 없습니다.
그저 어쩌다 한 번 작동했던 데모 (demo)를 가지고 있을 뿐입니다.
이 폴더들 중 그 어떤 것도 GPT, Claude, Gemini 또는 그 어떤 모델을 개선하지 않습니다.
그것들은 훨씬 더 가치 있는 것을 개선합니다.
재현성 (Reproducibility).
디버깅 (Debugging).
인수인계 (Handoffs).
컴플라이언스 (Compliance).
6개월 후의 당신은 약간 더 나은 프롬프트보다 이 구조에 훨씬 더 감사하게 될 것입니다.
AI 팀들은 보통 모델이 약해서 실패하지 않습니다.
시스템이 실제로 어떻게 작동하는지 아무도 설명할 수 없기 때문에 실패합니다.
프롬프트를 코드처럼 다루는 것 (Prompts as code)은 오늘날 당연해 보입니다.
하지만 5년 후에도 이것만으로 충분할지는 확신할 수 없습니다.
프롬프트 레이어 (prompt layer)가 결국 저장소 (repo) 외부의 독자적인 엔지니어링 분야가 될까요?
아니면 Git이 계속해서 신뢰할 수 있는 단일 원천 (source of truth)으로 남을까요?
AI 자동 생성 콘텐츠
본 콘텐츠는 X @nainsidwiv50980 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기