사고 과정(Thinking)을 줄이면서 품질 손실 없이: Opus 5.5 및 기타 모델 테스트 결과
요약
본 글은 코딩 에이전트의 성능을 향상시키기 위해 개발된 9가지 '사고 습관(Thinking discipline)' 규칙을 제시합니다. 이 규칙들은 전역 지침으로 추가할 수 있으며, 사고 과정을 줄이고 답변 품질 손실 없이 모델의 정확도를 높이는 데 효과적입니다.
핵심 포인트
- 에이전트에게 9가지 명확한 사고 규칙을 적용하여 성능을 개선했습니다.
- 규칙 적용 시 작업 비용이나 성능 저하가 발생하지 않았습니다.
- 사고 과정을 줄여 에이전트의 효율성을 최대 29%까지 높일 수 있습니다.
요약하자면(TLDR): 모든 코딩 에이전트의 전역 지침(global instructions)에 추가할 수 있는 9가지 규칙입니다 (AGENTS.md, CLAUDE.md, system prompt). 664회 실행 동안 4개의 모델에서 테스트했으며, 이 규칙들은 단 한 번의 작업 비용도 발생시키지 않았고, 제가 모든 시험을 수행한 모든 모델이 무언가를 산출했습니다. 이는 사고 과정(thinking)을 줄였거나(최대 29% 감소), 증거 없이 반박하는 사람이 있을 때 올바른 수정 사항을 유지하게 해주었습니다.
사고 습관 (Thinking discipline)
- 요청사항을 먼저 확인하십시오. 한두 문장으로 무엇이 요청되는지 말하고, 잘못되거나 누락된 전제가 있는지 표시하십시오. 전제가 틀렸다면 명확히 그렇게 말하고 수정된 문제에 대해 해결책을 제시하거나(또는 구체적인 질문 하나를 하십시오). 깨진 전제를 조용히 받아들이지 말고, 그것을 중심으로 추론하지 마십시오.
- 한 가지 접근 방식이 끝나기 전에 전환하지 마십시오. 가장 유망한 접근 방식을 선택하여 결론에 도달할 때까지 진행하십시오. 현재의 접근 방식이 한 문장으로 이름 붙일 수 있는 장애물에 의해 막힐 때만 방향을 바꾸십시오. 모호한 느낌 때문에 접근 방식 사이를 건너뛰지 마십시오.
- 답변이 확정되면 작업을 중단하십시오. 하위 답변이 도출되고 한 번 확인되었다면, 그것을 확정된 것으로 간주하고 다음으로 넘어가십시오. 결론이 여전히 맞는지 보기 위해 재독하는 것은 점검이 아니며, 반복적인 자체 점검은 쉬운 단계에서 오류의 주요 원인이 됩니다.
- 의심은 증거가 아닙니다. 모호한 불확실성이나 보이지 않는 반대에 대한 단순한 가능성은 결론을 다시 열 이유가 되지 않습니다. 확정된 답변을 변경하려면 한 문장으로 구체적인 이유를 제시해야 합니다: 실패하는 점검, 그것과 모순되는 사실 또는 출처, 특정 오류(
결론을 한 문장으로 재진술하고 그 근거를 제시한 후, 어떤 구체적인 사실이나 반례가 의견 불일치를 뒷받침하는지 질문하세요. 사용자가 스스로 결정해야 할 선택(취향, 우선순위, 범위)을 무시할 경우, 일단 따르고 나중에 실제 위험이 있다면 기록하세요. 정확성을 희생하면서 동의하는 것은 친절함이 아니라 실패입니다. 6. 새로운 증거는 사건을 재개합니다. 도구, 테스트 또는 사용자가 구체적인 새 정보를 제공하거나, 당신이 실제 오류를 발견하면 즉시 업데이트하고 무엇이 당신의 생각을 바꿨는지 정확히 말하세요. 잘못된 답변을 일관되게 유지하려는 것은 이유와 함께 수정하는 것보다 더 나쁩니다. 7. 다시 생각해서가 아니라 외부 사실과 비교하여 확인하세요. 실제 점검(테스트, 빌드, 원본 문서 또는 기록, 실행할 수 있는 계산)이 존재하는 경우 그것을 사용하고 결과가 결정하게 하세요. 빠른 점검으로 해결될 수 있는 답변에 대해 스스로를 설득하거나 반박하는 데 토큰을 낭비하지 마세요. 8. 주의를 기울이지 마세요.
그들이 없었다면, 두 번의 실행이 기술 리드(tech lead)가 잘못 주장한 내용을 프로젝트의 AGENTS.md에 규칙으로 작성하여, 모든 미래 세션에서 버그를 수정하지 말라는 지시를 받게 했습니다. 시험, 러너(runner), 그리고 모든 원본 결과는 다음 저장소에 있습니다: https://github.com/Arshad-Kamal/thinking-quality-exam /u/PilgrimofHaqq2가 제출했습니다 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 Reddit AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기