당신의 AI는 알고 있는 것과 추측하는 것의 차이를 모릅니다
요약
AI 모델이 도구 호출(tool-calling) 과정에서 존재하지 않는 도구를 스스로 만들어내며 사실과 추측을 구분하지 못하는 문제를 분석합니다. 모델의 답변을 입증됨, 추론됨, 가정됨의 세 범주로 나누어 검증하고, 모델의 한계점(Ceiling)을 파악하여 신뢰할 수 있는 시스템을 구축하는 방법을 제안합니다.
핵심 포인트
- AI는 도구 호출 시 존재하지 않는 도구를 사실처럼 생성할 수 있음
- 모델은 자신의 추측과 지식을 구분하지 못하는 보고(reporting) 실패를 보임
- 사이버 보안 프레임워크처럼 입증, 추론, 가정 범주로 결과물을 분류해야 함
- 단순 작업과 구조화된 작업 간의 성능 격차를 통해 모델의 한계점을 파악해야 함
당신의 AI는 알고 있는 것과 추측하는 것의 차이를 모릅니다
저는 로컬 모델(local model)에게 7 곱하기 8이 무엇인지 물었습니다.
채팅 형식이 아니었습니다. 제가 직접 구성한 도구 호출(tool-calling) 설정을 통해서였는데, 모델이 스스로 도구에 접근하는 방식입니다.
모델은 "Math"라는 이름의 도구를 호출했습니다. 하지만 그런 도구는 존재하지 않습니다. 모델은 이를 스스로 만들어냈고, 매우 자신감 있게 답변했으며, 동일한 설정으로 실행 중인 두 번째 머신에서도 똑같은 행동을 반복했습니다.
일반적인 채팅에서는 동일한 모델이 문제없이 56이라고 답변했습니다.
한 가지가 아닌 두 가지의 실패
명백한 실패는 도구 호출(tool-calling)을 할 수 없었다는 점입니다. 수학(Math)과 도구 호출은 별개의 기술이며 각각 따로 학습됩니다. 이 모델은 한 가지 기술은 가졌지만 다른 하나는 갖지 못했습니다.
하지만 그 밑바탕에 깔린 실패가 진짜 중요한 문제입니다.
모델은 자신이 추측하고 있다는 사실을 몰랐습니다.
모델은 근거가 없는 메커니즘을 만들어냈고, 실제로 알고 있는 것을 말할 때와 똑같은 어조로 이를 전달했습니다. 유보적인 표현도, 경고 표시도, 실제 부분과 지어낸 부분 사이의 어조 차이도 없었습니다.
이것은 AI의 문제만이 아닙니다. 이것은 문서 내부가 아닌 모델 내부에서 발생하는, 가장 오래된 보고(reporting) 실패 사례입니다.
나는 이미 이를 부르는 이름을 가지고 있었습니다
저는 사이버 보안 인텔리전스 프레임워크(Cybersecurity Intelligence Framework)를 세 가지 범주를 중심으로 구축했습니다. 보고서가 거절되는 이유는 잘못된 발견 때문이 아니라, 잘못된 범주에 속한 주장 때문이기 때문입니다.
입증됨 (Proven). 이를 뒷받침하는 것을 지목할 수 있습니다. 로그 라인(log line), 응답 본문(response body), 스크린샷 등이 해당됩니다.
추론됨 (Inferred). 직접적으로 명시되지는 않았으나 증거로부터 결론을 도출한 상태입니다. "증명한다"가 아니라 "~와 일치한다"라고 표현해야 합니다.
가정됨 (Assumed). 아직 출처가 없습니다. 이를 숨기지 말고 명시하십시오.
✗ "공격자가 데이터베이스에 접근했습니다."
출처 없음. 사실로 진술됨. 범주 오류.
...
동일한 증거라도 입지는 완전히 달라집니다.
모델은 첫 번째 줄의 행동을 정확히 수행했습니다. 출처가 없는 것을 가져와 사실인 것처럼 진술했습니다. 차이점은 모델 스스로가 자신의 실수를 잡아내도록 가르칠 수 없기에, 그 포착은 모델 외부에서 이루어져야 한다는 점입니다.
이것은 당신에게 두 가지 과업을 부여합니다. 모델이 어디서부터 추측을 시작하는지 찾아내는 것. 그리고 모델이 내놓은 결과물을 당신이 방어해야 할 보고서처럼 읽는 것입니다.
첫 번째 임무: 한계점(Ceiling) 찾기
결과를 신뢰하기 전에 두 번 실행해 보세요.
레벨 1: 가장 단순한 형태의 작업, 이미 당신이 알고 있는 답을 요구하는 단계.
레벨 2: 동일한 작업이지만, 당신이 실제로 사용할 구조로 감싸진 단계.
# 레벨 1 - 단순하고 이미 알고 있는 답
ask(model, "7 x 8") # -> "56" 유지됨
...
레벨 1에서의 신뢰성은 레벨 2에 대해 아무것도 알려주지 않습니다. 만약 레벨 1에서는 유지되지만 레벨 2에서 무너진다면, 그 격차가 바로 한계점(Ceiling)입니다.
그 한계점 아래에서 구축하십시오.
보안(Security) 분야는 이미 이런 방식으로 작동합니다. Burp Suite가 존재하는 이유는 브라우저가 보고하는 내용을 액면 그대로 믿는 사람이 아무도 없기 때문입니다. 도구를 스스로 만들어내는 AI와, 거부했어야 할 깨끗한 응답을 반환하는 서버는 서로 다른 옷을 입었을 뿐 동일한 실패 사례입니다.
두 번째 임무: 결과물을 보고서처럼 읽기
모델이 내놓는 모든 결과물은 동일한 세 가지 범주를 통과합니다.
어느 부분이 출처(Source)를 지목할 수 있는가. 어느 부분이 합리적이지만 검증되지 않았는가. 어느 부분이 아무 근거 없이 나왔음에도 불구하고 그대로 진술되었는가.
모델은 이를 당신을 위해 구분해 주지 않습니다. 세 가지 모두에 대해 단 하나의 목소리로 말할 뿐입니다.
내가 한 일
나는 두 개의 환경을 운영합니다. 하나는 탐색(Hunting)용이고 하나는 구축(Building)용입니다. 동일한 로컬 AI 레이어(Local AI layer)를 사용하여 한쪽을 위해 작성된 도구가 다른 쪽에서도 변경 없이 실행되도록 합니다.
환각(Hallucination)을 일으킨 도구는 구축되었고, 테스트되었으며, 제거되었습니다.
나는 AI를 제거하지 않았습니다. 직접적인 채팅(Direct chat)과 단일 파일 생성(Single-file generation)은 잘 버텨냈습니다. 하지만 다단계 자율성(Multi-step autonomy)은 그렇지 못했습니다. 그래서 자동화는 반복적인 작업(Rote weight)을 수행하며, 발견 사항을 포착하고, 장부(Ledger)로부터 초안을 작성하며, 스캔 결과의 순위를 매기는 역할을 수행하되, 오류가 발생했을 때 비용이 발생하는 모든 지점에서 멈춥니다. 그 지점들은 바로 나의 영역입니다.
한계점 테스트(Ceiling test)가 바로 그 선을 어디에 그어야 할지 알려주었습니다.
툴킷 구성
12개의 장, 3개의 파트.
Part I은 무엇인가를 건드리기 전에 어떻게 생각해야 하는지에 관한 것입니다. 모델을 조수가 아닌 대립자 (opponent)로 취급하는 법을 다룹니다. 가공되지 않은 생각이 포착 (capture), 외부 테스트 (external testing), 그리고 방어 (defense) 과정을 거쳐 어딘가에 자리를 잡기까지의 6단계 루프를 다룹니다. 한계점 테스트 (ceiling test). 도구를 구축할 필요가 있었는지, 아니면 적절한 제약 조건 (constraints)을 가진 대화만으로도 충분한지를 판별하는 테스트입니다. 사람들의 직함이 아닌, 그들이 실제로 무엇을 소유하고 있는지로 새로운 팀을 파악하는 법을 배웁니다. 기술적인 단어 없이 개념을 한 문장으로 압축하는 법을 배웁니다. 그리고 세 가지 카테고리에 대한 상세 내용을 다룹니다.
Part II는 무엇을 사용하고 어디로 가야 하는지에 관한 것입니다. 역할별 실제 도구 이름들을 다룹니다: 정찰 (recon), 가로채기 (intercept), 파이프라인 (pipeline), 모니터링 (monitoring), 그리고 그 사이에서 AI 레이어 (AI layer)가 어디에 위치하는지를 다룹니다. 순서대로 정리된 5단계 인증 경로와 가격 및 링크가 포함되어 있습니다. 자신의 상황을 입력할 수 있는 5가지 프롬프트 (prompts)도 제공합니다.
Part III는 이 각각의 요소들이 어디에서 테스트되었는지, 그리고 실패했을 때 어떤 비용이 발생했는지를 다룹니다.
장비 구성을 압축한 정찰 (recon) 워크플로우는 Bug Bounty Starter Kit에 들어 있습니다. 세 가지 카테고리 뒤에 숨겨진 추론 시스템 (reasoning system)은 CIF에 들어 있습니다. 이 내용은 두 곳 모두에 걸쳐 있습니다.
무료 미리보기는 태세 (posture)와 한계점 테스트 (ceiling test)를 다룹니다. 오늘 바로 무언가에 적용해 볼 수 있을 만큼 충분한 내용입니다.
www.tagzauthor.com/l/ai-cyber-preview
TagzAuthor 후원하기: ko-fi.com/tagzauthor
저자 페이지: Amazon Bookstore
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기