백만 번 중 한 번 발생하는 충돌을 해결한 Fable 5
요약
이 글은 기존 AI 모델들이 해결하지 못했던 복잡하고 미묘한 버그와 문제를 해결하는 새로운 접근 방식을 제시합니다. 특히, 코드베이스 전체를 분석하거나(Cross-Codebase Change Map), 장시간 실행되는 에이전트 작업의 실패 지점을 정확히 파악하는 등 실제 엔지니어링 시나리오에 초점을 맞춘 9가지 고급 프롬프트 기법을 소개합니다.
핵심 포인트
- 단순한 증상 패치를 넘어 근본 원인을 발굴하는 접근 방식 제시
- 여러 코드베이스와 서비스를 아우르는 복잡한 변경 사항 매핑 능력 강조
- 장시간 실행되는 에이전트 작업의 실패 지점(요약)을 정확히 파악하는 방법론 공유
- 실제 산업 사례(금융, 결제 인프라, 계약서 검토 등) 기반의 구체적인 프롬프트 예시 제공
백만 번 중 단 한 번 발생했던 충돌에 대한 이야기입니다.
4~5년 동안, Millennium의 누구도 그 원인을 설명할 수 없었습니다. 그들이 던진 모든 모델은 실패했습니다. 심지어 Fable 5까지도요.
Fable 5는 외부 공급업체의 라이브러리를 분해(disassembled)하여 코어 덤프(core dump)와 대조했고, 결국 다른 사람의 코드 안에 숨겨져 있던 버그를 찾아냈습니다.
이것이 바로 대부분의 사람들이 이메일을 다시 작성하는 데 사용하는 모델입니다.
실제로는 무엇을 하도록 설계되었는지에 대한 9가지 빈칸 채우기 프롬프트(fill-in-the-blank prompts)가 있습니다. 모두 아래에 나와 있습니다.
- 근본 원인 발굴기 (The Root Cause Excavator)
Millennium의 버그는 이 모델이 나오기 전까지 수년간 설명되지 않았는데, 그 이유는 이전 모든 모델들이 증상만 패치했기 때문입니다. 이 프롬프트가 그 출구를 막습니다.
"당신은 거래 회사(trading firm)의 신뢰성 팀에서 12년을 보낸 스태프 엔지니어인데, 백만 번 중 한 번 발생하는 충돌이 있었습니다"
- 교차 코드베이스 변경 지도 (The Cross-Codebase Change Map)
Plaid는 세 개의 코드베이스에 걸쳐 여덟 개 이상의 서비스를 건드리는 변경 사항을 전달했습니다. 그것은 전체 흐름을 개별 함수(functions), 테이블(tables), 행(rows)까지 매핑했습니다.
"당신은 결제 인프라 회사(payments infrastructure company)의 프린시펄 엔지니어이며, 마지막으로"
- 비감독 실행 요약 (The Unattended Run Brief)
Shopify의 메모에 따르면, 이 시스템은 자체 기록을 유지하고, 우선순위를 재조정하며, 중단된 지점부터 다시 시작합니다. 장시간 실행이 모델에서 실패하는 것이 아니라, 요약(brief)에서 실패하는 것입니다.
"당신은 에이전트 작업(agent jobs)을 밤새 실행하는 ML 인프라 리드인데, 실행이 멈추는 것을 배웠습니다"
- 레드라인 책상 (The Redline Desk)
Crosby의 계약서 검토(redlining) 벤치마크 점수는 5.1을 사용하면서 47.9점에서 57.0점으로 올랐습니다. 이 중 대부분은 첫 번째 시도 품질(first-turn quality), 즉 실제로 보내는 차례에서 나온 것입니다.
"당신은 4,000개의 공급업체 계약서에 레드라인을 표시해 본 상업 계약 변호사이며, 어떤 조항이"
- 1차 자료 분석가 (The Primary Source Analyst)
Samaya는 이 시스템이 2차 커버리지를 건너뛰고 경영진이 인용한 정확한 수치(figures)를 위해 실적 발표 녹취록(earnings call transcript)으로 바로 이동하는 것을 지켜보았습니다. 방대한 서류(dense filings)에 대한 비전이 여기서 진정한 업그레이드입니다.
"당신은 편집자에게 훈련받았고, 반환된"
- 파트너 검토 자료 (The Partner Review Deck)
Hebbia는 이 모델이 테스트해 본 어떤 모델보다 최고의 덱을 만들어냈다고 말했습니다. Rogo는 복잡한 데이터를 은행가 수준의 시각 자료로 변환하는 데서 얻은 이점을 언급했습니다.
"당신은 슬라이드 하나에 두 가지 아이디어가 담겨서 반송되는 회사에서 편집자입니다."
제 자료를 다음으로 바꿔주세요.
- 취약점 스윕 (The Vulnerability Sweep)
5.1 버전에서 새로 추가된 기능: Anthropic은 이제 모델이 소프트웨어의 취약점을 식별할 수 있도록 허용하지만, 이를 위한 익스플로잇(exploit)을 개발할 수는 없습니다. Claude Code에서의 사이버 오탐지율(false positives)이 약 60% 감소했습니다. 이 프롬프트는 그 유용한 경계선에 있습니다.
"당신은 애플리케이션..."
- 스타일 가이드 강제 적용기 (The Style Guide Enforcer)
Canva 팀은 5.1 버전에서 가장 뛰어난 점이 글쓰기 능력이며, 이 기능이 Fable 5보다 그들의 글쓰기 지침을 더 잘 따른다고 말했습니다. 그러니 그 지침을 알려주세요.
"당신은 우리 스타일 가이드를 소유하고 있으며, 심지어 자신조차도 이를 무시하는 작업물을 거부하는 편집자입니다."
- 확신에 찬 오답 필터 (The Confident Wrong Answer Filter)
AWS는 5.1 버전 업그레이드가 모호한 작업물에 대한 더 나은 판단력과 적은 '확신에 찬 오답(confident wrong answers)'을 제공한다고 설명합니다. 질문에서 이를 증명해 보세요.
"당신은 그럴듯하게 들리지만 사실이 아닌 답변을 잡아내는 것이 유일한 임무인 검토자입니다."
제 다음 질문에 답해주세요.
이미 포기했던 버그에 대한 첫 번째 프롬프트부터 시작하세요.
차이가 가장 빠르게 드러나는 부분이 바로 그곳입니다.
여기에 있는 모든 것은 제가 실제로 실행하는 것입니다.
귀하의 에이전트가 가진 55,957 토큰짜리 프롬프트는 모델에 24,340 토큰으로 도달합니다. 67번째 항목의 FATAL 라인은 바이트 단위로 도착합니다.
이것이 바로 컨텍스트 압축(context compression)의 어려운 부분입니다. 토큰을 자르는 것은 쉽습니다. 하지만 중요한 단 한 줄도 자르지 않는 것이 어렵습니다.
이를 헤드룸(Headroom)이라고 부릅니다. 압축은 귀하의...
AI 자동 생성 콘텐츠
본 콘텐츠는 X @nainsidwiv50980 (자동 발견)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기