최고의 AI 팀은 평가(evals) 없이 제품을 출시한다는 주장에 대한 반론
요약
AI 에이전트 제품 개발 시 정량적 지표에만 의존하는 대신, 실제 프로덕션 데이터를 기반으로 한 정성적 분석과 체계적인 평가(evals) 워크플로우를 구축해야 함을 강조합니다.
핵심 포인트
- 합성 데이터가 아닌 실제 프로덕션 트레이스를 직접 분석할 것
- 실패 사례를 평이한 문장으로 기록하여 실패 모드를 분류할 것
- 5점 척도 대신 이진 방식(True/False)의 판별기를 사용할 것
- 판별기의 성능을 인간의 라벨과 대조하여 검증할 것
위의 스레드는 최고의 AI 팀들이 평가(evals) 없이 제품을 출시한다고 말하고 있습니다. 하지만 실제로 그 팀들을 교육하는 두 사람은 그와 정반대의 내용을 기록으로 남겼으며, 그 워크플로우(workflow)를 첨부했습니다.
그는 Airbnb와 GitHub에서 머신러닝 엔지니어(machine learning engineer)로 20년을 보냈으며, GitHub에서는 OpenAI가 사용한 초기 LLM 연구에 데이터를 제공한 코드 검색 프로젝트를 이끌었습니다.
그녀는 버클리(Berkeley) 박사 학위와 최우수 논문상(Best Paper award)을 보유하고 있으며, 2027년에 카네기 멜런(Carnegie Mellon)의 교수로 부임할 예정입니다.
두 사람은 OpenAI, Anthropic, Google을 포함한 500개 이상의 기업에서 4,000명 이상의 엔지니어와 프로덕트 매니저(product manager)를 교육했습니다.
그는 현재 35개 이상의 AI 제품에 걸쳐 이 프로세스를 실행해 왔습니다.
이 방법은 공개되어 있으며 무료입니다. 첫 번째 단계는 30분이 소요되지만 거의 아무도 하지 않습니다.
그는 2003년에 머신러닝(machine learning)을 시작하여 은행에서 신용 리스크 모델을 구축했습니다. 당시에는 아무도 그 용어를 사용하지 않았고 직함은 통계학자(statistician)였습니다.
그것이 바로 그가 지금 가르치는 내용의 핵심이며, 아홉 단어로 요약하면 다음과 같습니다:
"나는 데이터 과학(data science)을 AI로 되돌리기 위해 노력하고 있다"
여기에 질병이 있으며, 당신은 그 모습에서 자신을 발견하게 될 것입니다.
당신의 에이전트(agent)가 오작동합니다. 그래서 당신은 관측성 도구(observability tool)를 열고, 대시보드(dashboard)를 연결하며, 플랫폼 메뉴에서 몇 가지 지표(metrics)를 선택한 뒤, 유용성과 관련성을 1점에서 5점 사이의 척도로 추적하기 시작합니다.
당신은 단 하나의 실패 사례도 살펴보지 않은 채 측정 시스템을 구축했습니다. 그 시스템이 생성하는 모든 숫자는 일반적(generic)입니다. 왜냐하면 도구가 제공한 것이 바로 일반적인 것이기 때문입니다.
순서가 뒤바뀌었습니다. 해결책은 오후 한나절이면 충분합니다.
1단계. 30개의 실제 트레이스(traces)를 여세요. 합성된 것(synthetic)도, 데모도 아닌, 실제 프로덕션 출력물이어야 합니다. 그것들을 읽으세요.
2단계, 코딩을 시작하세요. 각 실패 사례에 대해 무엇이 잘못되었는지 평이한 문장 하나로 작성하세요. "사용자에게 화장실을 확인하겠다고 말한 뒤 결코 확인하지 않았다." 아직 카테고리(categories)도, 분류 체계(taxonomy)도 필요 없습니다. 그저 관찰(observation)만 하세요.
3단계, 축 코딩 (axial coding). 이제 그 문장들을 소수의 실패 모드 (failure modes) 세트로 그룹화하고, 각 모드가 얼마나 자주 나타나는지 세어보세요. 이 순간부터 작업은 단순한 느낌 (vibes)을 벗어나게 됩니다. 당신은 더 이상 에이전트 (agent)를 막연히 개선하는 것이 아닙니다. 에이전트가 틀리는 세 번째로 흔한 문제를 정밀 타격하는 것입니다.
4단계. 이제서야 판별기 (judge)를 작성하되, 이진 방식 (binary)으로 만드세요. '이 특정한 실패가 발생했는가, 참(true) 또는 거짓(false)'으로 결정합니다. 5점 척도를 사용하지 마세요. 5점 척도는 불일치를 드러내는 대신 숨겨버리기 때문입니다.
5단계, 그리고 이것은 모두가 건너뛰는 단계입니다. 판별기 (judge)를 인간의 라벨 (human labels)과 대조하여 검증하세요. 혼동 행렬 (confusion matrix)을 구축하십시오. 판별기가 실제 실패를 얼마나 잘 잡아내는지, 그리고 깨끗한 출력물을 얼마나 자주 잘못 표시하는지 세어보세요. 측정되지 않은 판별기는 첫 번째 모델 위에 올라앉은, 검증되지 않은 두 번째 모델일 뿐입니다.
이제 이 결과를 지난 2주간의 작업과 비교해 보세요.
프롬프트 (prompt)를 수정했고, 점수가 움직였으며, 제품을 출시했습니다. 하지만 당신은 실패 사례들을 읽지 않았기에, 당신이 어떤 실패를 해결하고 있었는지 결코 알지 못했습니다. 따라서 그 수정은 특별한 목적 없이 이루어진 것이었습니다.
에이전트 프레임워크 (agent framework)는 무엇이 고장 났는지 알려주지 않습니다.
30개의 트레이스 (traces)가 알려줄 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 X AI 사용법/팁의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기