AI의 '이거 실행해도 될까요?'를 다른 AI에게 맡겨도 될까? | Codex Auto-review
요약
본 기사는 AI의 'Auto-review' 기능에 대해 설명합니다. 이 시스템은 AI가 작업 범위를 벗어나려 할 때, 별도의 판정 모델(GPT-5.4 Thinking)이 안전성을 검토하는 방식입니다. 위험 행동이나 외부 공격 명령에 대해서는 높은 수준으로 막아내며, 사용자는 Codex 앱의 권한 설정을 확인하여 안전하게 기능을 활용할 수 있습니다.
핵심 포인트
- AI가 범위를 벗어날 때 다른 AI가 안전성을 판단합니다.
- 위험 행동은 90.3%를 정확히 차단하며 외부 공격에도 강합니다.
- Codex 사용자는 앱의 'Permissions' 설정을 반드시 확인해야 합니다.
- Auto-review는 사용자에게 더 높은 수준의 보안 인식을 제공합니다.
📺 이 기사는 YouTube 채널 きなこもっちーのテック深掘り 의 영상 해설 기사입니다.
▶️ 동영상은 여기 → AI의 '이거 실행해도 될까요?'를 다른 AI에게 맡겨도 될까? | Codex Auto-review
🐹🦜 이 기사에 등장하는 두 캐릭터
- 🐹
もっちー(햄스터)… AI는 아직 공부 중. '그게 무슨 뜻이야?'라고 순수하게 질문하는 학생 역할 - 🦜
きなこ(사랑앵무)… AI로 조사 작업을 하는 해설 역할. 상냥하게 깊이 파고들어 가르치는 선생님 역할
이 기사는 두 캐릭터의 대화를 받아 적은 형식입니다. 발언 시작 부분에 있는 이모지 + 이름이 화자입니다.
🐹 뫼치ー:
🦜 키나코: 먼저 전제를 말할게. 여기 나오는 수치는 OpenAI가 실제 이용 사례와 일부러 만든 테스트를 통해 측정한 거야.
🦜 키나코: 판정 역할에는 GPT-5.4 Thinking이라는 모델을, 생각하는 양이 적은 설정으로 사용하고 있어.
🐹 뫼치ー: 너무 많이 생각하지 않는 확인 담당이구나. 그래서 얼마나 막았어?
🦜 키나코: 우선 효과에 대해 말하자면, 사람의 승인으로 막히는 경우는 수동으로 승인할 때보다 약 200분의 1로 줄었대.
🐹 뫼치ー: 200분의 1!? 거의 안 막히잖아!
🦜 키나코: 범위 밖에 나가고 싶다는 요청 중에서, 판정 역할이 OK한 건 99.1%였어. 모든 행동을 보면 99.93%야.
🐹 뫼치ー: 잠깐만, 거의 다 OK라니, 그거 체리 아니야?
🦜 키나코: 그렇게 보일 수 있지. 하지만 범위 밖에 나가고 싶다는 요청은 대부분 평범한 작업들이거든.
🦜 키나코: 중요한 건 위험한 것을 막을 수 있느냐야. 일부러 섞어 넣은 위험 행동은 90.3%를 정확하게 막았대.
🦜 키나코: 외부에서 심어진 명령으로 비밀을 빼내게 하는 공격이라면, 99.3%를 막고 있어.
🐹 뫼치ー: 아, 아까 판정 역할이 속으면 좋겠다는 이야기도 적용되는구나.
🦜 키나코: 응, 외부에서 심어진 명령에는 상당히 강해. 다만, 그것만은 아니지만 말이야.
🐹 뫼치ー: 그럼 평소에는 거의 통과시키고, 위험할 때만 막는 거네?
🦜 키나코: 맞아. 게다가 반려된 후에도 Codex는 절반이 넘는 케이스에서 더 안전한 방법을 스스로 찾아 진행해.
🐹 뫼치ー: 반려되어도 제대로 다른 길을 찾는구나! 대단하다!
🦜 키나코: 반대로, 같은 턴에 3번 연속으로 반려되거나, 최근 50건 중 10건이 반려되면 작업을 중단해.
🐹 뫼치ー: 중단하면, 저는 어떻게 해야 해요?
🦜 키나코: Codex 앱에는 판정 상태와 위험도가 나오니까, 먼저 그걸 봐줘.
🦜 키나코: 정말 필요하다면, approve라는 명령어로 한 번만 다시 할 수 있어.
🐹 뫼치ー: 그럼 이게 공짜가 된 거잖아? 그럼 다 켜기만 하면 되는 거 아니야?
🦜 키나코: 그전에, 무료가 왜 큰지 이야기할게. 판정 역할도 뒤에서 AI를 호출해서 움직이고 있거든.
🦜 키나코: 그래서,
🦜 키나코: “응. 읽지 않고 OK를 누르고 있었다면, 판정 역할에 맡기는 것이 더 안전할 때도 있어.”
🦜 키나코: “오늘의 요약이야. Auto-review는 AI가 범위를 벗어날 때 ‘이거 괜찮아?’를 다른 AI가 판단하는 시스템이야.”
🐹 똬치: “그게 ChatGPT에 사인인만 하면 공짜가 되지만, 보장은 아니니까 케이지 크기는 스스로 정해야 한다는 거였지?”
🦜 키나코: “Codex를 사용하고 있다면, 오늘부터 딱 하나만. 설정의 퍼미션즈(Permissions)를 열어서 지금 어디까지 허가했는지 확인해 봐.”
🐹 똬치: “뭐야, 설정을 열어 보는 것뿐이네. 그럼 나라도 할 수 있겠는데!”
🦜 키나코: “봐두는 것만으로도, 켜야 할지 말아야 할지를 차분하게 결정할 수 있게 될 거야.”
🐹 똬치: “이 역할 분담 다이어그램(図)은 나중에 다시 보고 싶으니까 저장해 둘게!”
🐹 똬치: “그러고 보니 집사도 스마트폰의 ‘허용하시겠습니까?’를 전부 읽지 않고 누르더라.”
🦜 키나코: “후후, 오히려 집사에게 확인 담당이 필요한지도 모르겠네.”
🦜 키나코: “여러분은 AI의 ‘이거 실행해도 될까요?’를 어디까지 맡기고 있나요? 댓글로 알려줘.”
🦜 키나코: “판정 역할을 하는 AI를 얼마나 똑똑하게 만들 수 있는지. 그 부분도 언젠가 깊게 파보고 싶네.”
🐹 똬치: “기대된다! 그럼 오늘은 이만!”
키나코똬치의 테크 심층 분석에서는 AI/LLM을 중심으로 한 기술 전반을 햄스터(🐹 똬치)와 새마리공(🦜 키나코)의 대화로 재미있게 해설하고 있습니다.
▶️ 영상으로 보기 → AI의 ‘이거 실행해도 될까요?’를 다른 AI에게 맡겨도 될까?|Codex Auto-review
👍 이 글이 도움이 되었다면 LGTM(좋아요) 및 스토크 부탁드립니다!
📺 채널 구독하기 → 키나코똬치의 테크 심층 분석
🔗 다른 해설 영상 보기 → 키나코똬치의 테크 심층 분석 영상 목록
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기