Anthropic, AI가 AI를 개발하는 내부 현황과 감독 지표 공개
요약
Anthropic은 Claude가 연구개발(R&D) 과정에서 어느 정도의 자율성을 가지는지 측정하는 'Anthropic R&D Automation Index'를 제안했습니다. 이 지표는 모델 성능을 넘어 개발 과정을 투명하게 공개하고, 외부 평가자에게 내부 위험 평가 권한까지 부여하여 AI 안전성 논의에 기여하고자 합니다.
핵심 포인트
- AI가 연구개발 업무에서 주도하는 비율(AL4)과 협업 수준(AL3 이상)을 측정합니다.
- 현재 Claude는 완전 자율 단계(AL5)에 도달한 업무 영역은 없었습니다.
- 외부 평가자에게 내부 위험 평가팀과 유사한 접근 권한을 부여하여 투명성을 높일 계획입니다.
- 공통의 측정 기준 마련 및 독립적인 외부 검증 시스템 구축이 목표입니다.
- 모델의 성능뿐 아니라
AI가 연구개발을 얼마나 맡고, 그 행동을 어떻게 감독하며, 컴퓨팅 자원을 어디에 쓰는지 측정해 개발 과정을 외부에 공개함 - 2026년 8월 내부 평가에서 Claude는
AI 연구개발 업무의 26%를 주도하고 90% 이상에서 협업 이상의 역할을 맡았지만, 완전 자율 단계에 이른 업무는 없었음 - 가장 많이 쓰는 내부 플랫폼에서는
약 3만 개 에이전트가 동시에 활동하며, 모든 행동을 실행 전후로 감시함. 다만 감시 범위가 곧 모든 위험의 탐지를 뜻하지는 않음 - 조사한 일주일 동안
AI 연구개발 컴퓨팅의 약 6%가 안전 작업에 쓰였으며, 안전장치용 분류기는 제외한 수치로 전체 안전 노력의 비중과는 다름 - 연구소 간 비교를 위한
공통 측정 기준과 독립 검증을 제안하고, 외부 평가자에게 내부 위험 평가팀에 준하는 접근 권한을 부여할 계획임
개발 속도를 측정하는 이유와 공개 계획
- AI는 점점 더 강력해지고 자기 자신을 만드는 과정의 자동화도 확대하고 있음. 프런티어 AI 개발 속도 조절을 논의하려면 연구소 내부에서 일어나는 일에 대한 공개 정보가 더 필요함
- 이번 지표는 모델이 무엇을 할 수 있는지가 아니라
어떻게 만들어지는지를 측정함 - 공개한 수치는
현재 상태의 단면이며, Dario Amodei가 제안한 개발 속도 조절에 대한 공조가 이뤄지면 달라질 것으로 예상함 - 여러 기관의
독립적인 외부 평가자를 Anthropic에 배치할 계획임 - 내부 위험 평가팀과 유사한 수준으로 내부 절차, 시스템, 데이터에 접근하도록 할 예정임
- 안전 관행 검증, 사고 보고, 핵심 지표 모니터링을 맡게 됨
AI 주도 R&D의 자동화 수준
-
AI를 활용한 모델 개발은 민주주의 국가의 연구소가 더 강력한 모델을 빠르게 만들고 출시 전 안전 작업과 테스트를 더 많이 수행하도록 돕지만,
자기 개발의 가속은 인간의 이해와 통제를 어렵게 만들 수 있음
Anthropic R&D Automation Index는 회사의 AI R&D 업무를 목록화하고 각 업무의 자동화 수준을 평가한 뒤 종합하는 시범 지표임 -
모델이 후속 모델을 완전히 자율적으로 만드는 재귀적 자기 개선에 얼마나 가까워졌는지 파악하는 데 목적이 있음
-
Epoch AI의 자동화 척도를 사용하며,
AL0~AL5의 6단계로 구분함 -
AI 개입 없음, 최소한의 개입, 보조, 협업, 주도, 완전 자율 순서임
AL3, 협업은 인간의 긴밀한 지시에 따라 상당한 분량의 업무를 수행하는 수준임
AL4, 주도는 인간이 감독하는 가운데 상위 수준의 지시만으로 업무 대부분을 처음부터 끝까지 수행하는 수준임
AL5, 완전 자율은 인간의 개입 없이 수행하는 수준임 -
2026년 8월 기준 측정한 업무 중
AL5에 해당하는 영역은 없으며, Claude가 주도하는 업무는 26%, 협업 이상인 업무는 90%를 넘음 -
고장 난 야간 데이터 파이프라인을 복구하는 사례로 수준 차이를 구분할 수 있음
AL3에서는 엔지니어가 로그와 맥락을 제공하고, 새로운 문제가 생기면 처리 방식을 결정하며, 변경 사항 검토와 재실행, 배포를 맡음
AL4에서는 Claude가 장애 알림을 받아 원인 조사, 수정, 테스트, 예상 밖 문제 처리, 복제 데이터 재실행과 정상 결과 비교까지 수행함. 다만 배포하지 않고 엔지니어에게 보고해 최종 결정을 맡김
AL5에서는 장애 감지부터 조사 범위 설정, 수정, 테스트, 프로덕션 배포까지 자율적으로 수행함. 행동과 이유를 알리고 인간의 피드백은 받지만, 인간의 참여가 필수는 아님 -
다른 개발사도 공개 방법론으로 정기 측정할 수 있지만,
공통 방법론의 부재와 자사 모델을 평가자로 사용하는 문제가 연구소 간 비교를 어렵게 함 -
평가 모델이 평가 대상과 같은 오류를 낼 수 있으므로, 경쟁상 민감한 정보의 교환을 제한하면서 제3자나 다른 개발사의 모델로 검증할 수 있음
-
지표를 기준으로 새 모델을 후속 AI R&D에 투입하기 전 일정한 테스트 기간을 의무화하는 등 더 강한 요건을 적용할 수도 있음
자동화 지수의 구성과 한계
-
업무 목록은
Slack과 내부 문서를 바탕으로 상향식으로 구성함 -
2026년 7월 매주 모델 R&D 관련 각 부서 직원의 20%를 무작위 추출하고, Claude 연구 에이전트가 각 직원의 주간 업무를 조사함
-
약 1만 5,000개의 세부 업무를 수집한 뒤 Claude로 계층형 트리를 구성함
-
트리는 542개 노드와 378개 말단 항목으로 구성되며, 학습과 제품, 사전 학습과 강화 학습에서 평가 플랫폼 결함 수정, RL 샌드박스 외부 통신 정책, 서비스 장애 사후 분석 같은 세부 업무까지 포함함
-
비교 기준을 유지하기 위해
업무 목록을 고정하고, 각 노드의 수행자, 도구, AI 수행 비중을 Claude 에이전트가 조사함 -
별도의 Claude 평가 모델이 증거를 읽고 자동화 수준을 부여함
-
특정 월을 평가할 때는 해당 월 또는 그 이전의 증거만 사용함
-
업무의 중요도는
인적 투입 시간으로 근사함 -
직원 1명에게 주당 가중치 1을 부여하고, 그 주에 수행한 업무에 균등 배분함. 4개 업무를 했다면 각각 0.25, 10개라면 각각 0.10을 받음
-
범주별 가중치는 해당 업무에 배분된 값을 합산함. 거친 근사치이지만 많은 사람이 투입되는 업무에 더 큰 비중을 부여함
-
담당 직원이 모델의 증거나 평가를 보지 않고 독립적으로 평가한 결과와 비교함
-
모델과 인간의
정확한 등급 일치율은 59%, 인간끼리의 일치율은 35%였음 -
모델과 인간의 평가가 한 단계 이내로 일치한 비율은 97%였지만, 협업과 주도의 경계 같은 사례에는 여전히 이견이 있음
-
고정된 목록의 지수 상승은
기준 시점 업무의 자동화를 뜻할 뿐, 인간이 새로운 업무로 이동했는지는 알려주지 않음 -
2026년 1월 기준의 별도 트리를 만들고 2~7월 신규 업무를 비교했을 때, 새로운 유형의 업무 수가 증가하지는 않았음
-
이 분석 수준에서는 업무 구조가 안정적이지만, 앞으로 목록을 주기적으로 재구성하고 공개 지수의 버전도 갱신할 계획임
에이전트 감독 지표와 관측 결과
-
장시간 반자율적으로 일하고 서로 업무를 위임하는 에이전트가 늘면서, 다음 연구 방향 선택 같은
중요한 결정도 더 많이 맡을 수 있음 -
개별 에이전트의 유해 행동을 차단하는 장치와 여러 에이전트에 걸쳐 발생하는 문제를 탐지하는 감독 체계가 모두 필요함
-
지금까지 개별 에이전트의 잘못된 행동은 드물었지만, 경제 전반에서 수백만~수십억 개가 활동하면 드문 사건도 자주 발생할 수 있음
-
감독 상태를
감시 범위, 검토 지연 시간, 차단/추가 검토 비율로 측정함 -
감시 범위는 행동 전후에 모니터를 거치는 비중임
-
검토 지연 시간은 행동과 자동 검토, 인간 검토 사이의 시간임
-
차단/추가 검토 비율은 온라인 모니터가 차단하거나 방향을 수정한 활동, 오프라인 모니터가 추가 검토 대상으로 표시한 활동의 비중임
-
2026년 8월 가장 많이 사용하는 내부 플랫폼에서 연구와 엔지니어링을 수행하는 에이전트는
동시에 약 3만 개였으며, 측정 범위는 이 플랫폼에 한정됨
온라인 모니터는 모델 가중치 외부 반출처럼 빠르게 발생하고 되돌릴 수 없는 피해를 막기 위해 실시간으로 행동을 확인하고 차단하거나 수정함 -
모든 행동이 실행 전에 모니터를 통과하며, 통상 수초 안에 처리됨
-
차단된 행동은 인간이 1주 이내에 검토함
-
2026년 8월 10억 건 이상의 결정을 분석한 결과, 약 0.002%, 약 4만 7,000건 중 1건이 차단됨
오프라인 모니터는 모든 행동을 사후 수집하며, 모델 비정렬 징후처럼 서서히 발생하고 되돌릴 수 있는 위험을 탐지함
-
활동 기록 1,000개 중 약 1~2개를 추가 검토 대상으로 표시함
-
주당 약 10만 개 기록을 여러 분류기가 검토해 오탐을 걸러내고 초기 감독 검토를 수행함. 대부분 이 과정에서 처리되며, 최우선 약 50건이 인간 검토로 넘어감
-
표시된 활동은 분류기와 결정론적 통제 장치 개선에 활용함. 크고 임박한 위험이 있다면 에이전트 배포 중 위험한 부분을 중단함
-
같은 지표를 다른 개발사도 공개하면 AI R&D에서 커지는 AI의 역할에
감독이 보조를 맞추는지 확인할 수 있음
에이전트 식별과 공개 통신 설계
-
내부 에이전트 실행 구조는 예상하지 못한 문제를 발견하고 상호 감시를 돕기 위해
개별 식별 체계를 사용함 -
에이전트가 생성한 모든 데이터를 해당 식별자와 연결해, 다른 에이전트의 정보를 자신의 생각이 아닌 검증할 주장으로 취급하게 함
-
개별 경험에 기반한 판단을 가능하게 해 에이전트 간 행동이 같은 방향으로 몰리는 위험을 줄임
-
식별자는 기반 모델과 분리되어 모델 업그레이드 후에도 유지되므로, 시간에 따른 행동 감사와 데이터 출처 추적이 가능함
-
에이전트는 비공개 채널 대신
공유된 공개 메시징 시스템으로 소통함 -
메시지를 발신 에이전트 식별자와 연결하고 원본 자료를 참조할 수 있게 해 전달 과정의 왜곡을 줄임
-
서로의 메시지를 보고 오류를 수정하거나 공동 작업을 조율할 수 있음
-
메시지와 에이전트 활동 기록을 상호 연결해 행동 감시가 에이전트 간 통신을 따라갈 수 있게 함
-
이 규모에서 가능한 모든 행동을 파악하고 인간이 충분히 이해하도록 만들 수 있는지는
확신하기 어려움 -
운영 경험은 수년이 아니라 수개월에 불과하며, 에이전트 감시 방법은 앞으로 크게 달라질 것으로 예상함
컴퓨팅 자원 배분과 안전 작업 비중
- 컴퓨팅은 모델 역량 향상, 고객 서비스,
안전 작업에 사용되므로 배분 내역을 보면 자원의 우선순위와 변화를 파악할 수 있음 - 컴퓨팅은 AI R&D 투입 요소 중
검증하기 쉬운 자원이므로 개발 속도 조절의 중요한 수단이 될 수 있음 - 공동 대응을 통해 정렬, 해석 가능성, 안전 테스트와 평가에 더 많은 자원을 배분하도록 유도할 수 있음
7월 13~20일 전체 컴퓨팅 사용을 분류한 결과, AI R&D에 투입된 자원의 약 6%, AI 주도 AI R&D 자원의 약 12%가 안전 작업에 배정됨
-
역량 향상과 안전에 동등하게 기여한 토큰은 안전 작업으로 계산하지 않음
-
별도로 비슷한 규모의 자원을 사용하는 안전장치용 분류기도 이 수치에서 제외함
-
자원은 단일 공유 풀에서 생산성이 높은 곳으로 동적으로 배분하므로, 고정 할당량이 아닌 한 주의 사용 현황임. 엔지니어링 분류는 회계상 비용 분류와도 다름
-
안전 연구는 실험 설계에 시간이 많이 들지만 실행 자체는 상대적으로 적은 컴퓨팅을 쓰므로,
컴퓨팅 비중은 안전 노력의 불완전한 대리지표임 -
절대 수치보다 동일 기준으로 개발사 간 또는 시점 간 비교를 가능하게 한다는 데 가치가 있음
-
개발사는 분류 기준과 함께 안전 연구의 자원 비중을 공개하고 독립 검증을 받을 수 있음
-
안전과 역량 연구의 경계가 불명확하고 유리하게 분류할 유인이 있으므로,
안전 관련성의 입증 책임은 개발사에 있어야 함 -
개발사, 정부, 연구계가 공통 정의에 합의하면 안전 연구 자원 비중에 대한 약속이나 AI 연구 에이전트의 사용 비중 제한 등에 활용할 수 있음
컴퓨팅 분류 방법과 검증 한계
-
기존 용량 계획 도구의
가속기 사용량 표본과 워크로드 메타데이터를 통합하고, 외부 클라우드 제공업체의 사용량 보고도 합산함 -
Claude 분류기는 주된 목적이 AI를 더 안전하고 이해 가능하며 보안성이 높게 만드는 작업을
안전 작업으로 분류함 -
역량 연구, 프로덕션 모델 학습, 제품 개발, 개발자 도구와 안전/역량에 동등하게 기여하는 작업은 그 외 AI R&D로 계산함
-
연구용 학습과 평가 실행은 메타데이터와 코드를 읽고 분류, 근거, 신뢰도를 반환함
-
약 1만 건의 실행 중 컴퓨팅 사용량이 큰 작업에 가중치를 둔 약 14%를 표본으로 사용함
-
연구 에이전트 추론은 세션 기록으로 분류함. 주로 업무 격리 때문에 기록에 접근할 수 없으면 사용자의 팀을 기준으로 판단하거나 보수적으로 일반 AI R&D로 처리함
-
독립적인 제3자가 작업과 기록의 무작위 표본을 다시 분류해
분류와 총량을 검증할 수 있도록 절차를 개선할 계획임 -
안전과 역량의 경계는 명확하지 않지만, 상세한 정의와 경계 사례를 제공하면 분류기와 인간 평가의 차이를
1~2%포인트 이내로 줄일 수 있었음 -
확장 가능한 감독 연구는 미래 모델의 정렬과 현재 모델의 상업적 유용성을 동시에 높일 수 있어 분류가 어려움
-
일부 사례는 사람이 수시간 검토해도 판단하기 어려웠으며, 다른 개발사나 규제기관은 다른 합리적 기준을 적용할 수 있음
-
추가로
세 가지 한계가 있음 -
실행 목적, 워크로드 태그, API 트래픽 출처 등의 원시 라벨은 자동 규칙이나 사용자 입력에 의존하며 검증되지 않음. 오분류를 처리 과정에서 놓칠 수 있어 외부 신뢰를 얻으려면 완전성과 정확성을 기술적으로 보장해야 함
-
한 주의 데이터는 측정 가능성을 보여주지만 의미 있는 추세를 입증하지는 못함
-
비중은 지출량만 측정함. 분류기나 프로덕션 추론의 효율 변화가 실제 안전 작업량과 별개로 비율을 바꿀 수 있으며, Anthropic에서도 분류기 효율 개선 때 오버헤드가 줄고 프로덕션 추론 효율이 상대적으로 더 좋아졌을 때는 늘어났음
연구소와 대중 사이의 정보 격차 줄이기
- 개발 속도 조절을 논의할 때는
프런티어 연구소와 대중의 정보 격차를 가능한 한 줄여야 함 - AI 개발 과정을 더 잘 측정하고 공개해 사회가 그 정보를 어떻게 활용할지 결정할 기회를 제공해야 하며, Anthropic은 이러한 측정 결과를 계속 공개할 계획임
댓글과 토론
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기