Greg Kroah-Hartman, LLM 시대의 보안 [영상]
요약
이 글은 LLM 개발사들이 발표하는 보안 취약점 보고서의 과장된 홍보 방식과 그 신뢰성에 의문을 제기합니다. 실제 버그 수정 작업은 발견 자체보다 코드를 이해하고 검증하는 데 핵심적인 노력이 필요하며, 많은 보고서는 사소하거나 이미 알려진 내용으로 가득 차 있음을 지적합니다.
핵심 포인트
- LLM 개발사의 보안 발표는 과장된 홍보 장치일 수 있다.
- 실제 취약점 발견보다 코드를 이해하고 검증하는 것이 중요하다.
- 많은 '버그' 보고서는 사소하거나 이미 수정된 내용이다.
- AI가 생성한 오탐(False Positive) 보고서의 신뢰성에 경고한다.
OpenAI나 Anthropic에서 자신들이 만드는 것이 세상을 파괴할 수도 있다고 진심으로 믿는다면, 이런 일은 대중을 설득하는 데 전혀 도움이 되지 않음. 위험해서 일부에게만 공개한다면서 Linux 버그 79개를 손쉽게 찾았다고 대대적으로 홍보했지만, GKH에 따르면 대부분은 버그가 아니었고 나머지도 거의 사소하거나 심각하지 않아 전부 고치는 데 1시간이면 충분했음.
모델이 위험하지 않거나 뛰어나지 않다는 증거는 아니지만, 이번 발표와 앞으로의 발표까지 의심하기 너무 쉬워짐.
수정 시간과 심각도가 무슨 관계인지 모르겠음. 심각한 버그도 한 줄로 고치는 경우가 많고, 어쩌면 대부분이 그럴 수도 있음. 진짜 작업은 그 한 줄을 찾아내고 이해하는 데 들어감. Mythos가 찾은 버그 중 심각한 것이 없었다는 이야기라면 별개의 논점임.
인상적이고 무척 편리한 기술이지만, 아직 Claude가 세상을 끝장내는 모습은 상상하기 어려움.
이런 일을 보면 다른 이들이 자기 모델 사용 경험에 대해 하는 말도 의심하게 됨. OAI가 거짓말하는 것인지, 아니면 LLM의 주장을 무비판적으로 받아들이다 현실 감각까지 잃는 AI 정신증의 일부인지 궁금함.
Kernel Recipes 2026의 Mythos 슬라이드에서 눈에 띈 내용을 옮기면, 취약점 79개의 내역은 다음과 같음.
24개는 “뭔가 충돌했다”는 말뿐이고 세부 정보가 없었으며, 14개는 버그가 아니고, 3개는 완전히 지어낸 데이터였음. 15개는 최신 릴리스에서 이미 수정됐는데, 다른 개발자가 고친 것이 11개, Anthropic이 고친 것이 4개임.
수정이 필요한 20개는 악성 파일시스템 이미지를 가정한 7개, 네트워크 스택 중간에 악성 패킷을 주입할 수 있다고 가정한 2개, NOMMU 관련 2개, 신뢰할 수 없는 장치와 관련된 SCTP 네트워킹 문제 6개, 사소한 IPv6 네트워크 문제 2개, 로컬 악성 사용자와 관련된 GPU 드라이버 문제 1개로 나뉨.
GKH는 이를 ‘진짜’ 버그 수정 10개라고 불렀음. 해당 분야 전문가에게 확인하면 무너질 보도자료를 무비판적으로 되풀이하는 거대한 과장 홍보 장치가 이 회사들 주변에 있는 듯함.
자원봉사로 보안을 관리하는 몇몇 오픈소스 저장소에서도 같은 일을 겪고 있음. 아주 큰 저장소는 아니지만 보안 연구자들의 관심을 받을 정도의 규모임. 쉽게 찾을 수 있는 실제 취약점은 대부분 몇 년 전에 사람이 이미 찾아냈고, 자동 검사 결과의 대다수는 전문가가 몇 시간씩 이해하고 시험한 뒤 폐기해야 하는 장황한 헛소리임. Claude가 만든 오탐 보고서는 자기 발견이 타당하다고 끝까지 확신해서 읽기 몹시 괴로움. 터무니없는 상황을 시연하는 긴 개념 증명 코드가 딸려오기도 함. 선의로 보고서를 제출한 기여자가 반려 이유를 이해할 기술적 역량이 없으면, 시간을 쪼개 봉사하는 입장에서 특히 답답함.
합계도 76개라서 영상에서 그걸 놀렸음. “LLM은 숫자도 못 센다”는 건 내 말이 아니라 그의 말이지만, 나도 동의하는 편임.
어쩌면 Anthropic의 개발 실력이 형편없어서, 무지 탓에 자기 모델을 두려워하는 것일 수도 있음.
내가 관리하던 시스템에 실제 영향이 있는지 보려고 직장의 검사 도구가 내놓은 CVE를 살펴볼 때도, AI 없이 이미 엉터리와 오탐이 많았음. 다만 Anthropic 발표 당시 논문을 훑어보며 버그 개수 자체는 별로 중요하지 않다고 생각하면서도, NFS 버그와 커널 버그에는 꽤 놀랐던 터라 위 목록에서 어디에 해당하는지 찾아봄.
기억 속에서 NFS 문제 두 개가 섞여 있었음. Linux의 CVE-2026-31402는 인증 없이 네트워크로 메모리를 읽을 수 있는 NFS 힙 오버플로인데, 몇 달 전 Mythos가 아니라 Claude Code가 발견해서 79개 목록에 없는 것으로 보임. 이것은 스택 중간에 악성 패킷을 주입한다는 가정보다 강력한 원격 공격으로 보임.
인증 없이 원격 루트 권한을 얻을 수 있는 NFS 스택 버퍼 오버플로 CVE-2026-4747은 Mythos가 찾았지만, Linux가 아니라 FreeBSD 문제여서 목록에 없었음. 생각해 보니 Mythos가 Linux에서 결정적인 취약점을 찾은 것은 아니었다는 기억과도 맞아떨어짐. OpenBSD에서도 27년 된 TCP SACK 처리의 스택 정수 오버플로를 찾아냈고, 원격 충돌과 서비스 거부가 가능했음.
Mythos에 과장이 있는 것은 분명하지만, GKH가 관리하는 Linux보다 BSD 코드에서 더 성과를 냈다고 해서 주목할 가치가 없었던 것은 아님. 특히 공격 기법은 갈수록 발전한다는 점을 고려해야 함.
영상 3분 19초에서 Greg KH는 Mythos가 CVE 79개를 ‘발견’한 방법을 밝혔음. 지난 수십 년간 커널 개발자들이 만든 패치를 패턴 매칭하고, 같은 수정이 다른 곳에도 빠짐없이 적용됐는지 확인한 것임. 그런데 Anthropic은 원래 취약점을 수정한 커널 개발자들을 출처로 밝히지 않았음. 원작에 대한 출처 표기에서는 OpenAI와 같은 문제가 있음.
매일 에이전트로 구현 코드를 생성하지만, 이런 현실적인 보안 분석을 보면 소프트웨어 시스템의 지속 가능성에는 사람, 특히 코드 검토자가 여전히 핵심이라는 확신이 더 강해짐.
“봇은 멍청하고, 사용자를 기쁘게 해주려 한다”는 대목도 인상적임. LLM은 기여자 사이의 기술적 협업을 상당히 망쳐 놓았음. 토론에 “하지만 내 Claude는 이렇게 말했는데…”가 등장할 때마다 짜증이 남.
Greg KH처럼 현장을 잘 알고 허튼소리하지 않는 전문가에게 들을 수 있어 좋음. Microsoft나 Apple이 LLM으로 무엇을 찾아 고쳤다고 주장하는 것과 달리, Linux 커널은 직접 검증할 수 있음.
지금 Mythos가 대단하지 않더라도, 코드 구조·코딩 표준·위협 모델·좋고 나쁜 코드 패턴·검증 도구 등 Linux 커널에 특화된 정보로 학습한 모델이 버그 발견과 분석, 수정을 훨씬 빠르고 정확하게 하고 이전에 불가능했던 발견까지 해내는 것은 충분히 상상할 수 있음. LLM은 사람보다 끈질기게 탐색할 수 있으므로 정확도를 뒷받침해 주면 소비한 전력만큼의 가치를 낼 수 있음. 분류·검토 데이터로 학습한 별도 모델이 첫 모델의 발견을 검증하는 것도 좋겠음.
Microsoft가 내부에서 Mythos와 함께 별도로 학습한 모델들을 이런 식으로 쓰는 것 같음. 관련 영상을 본 적은 있지만 정확한 출처는 기억나지 않음.
결국 전부 합쳐 커널 개발 작업 1시간에 불과했다고도 했음.
Sam Altman은 GPT-3가 너무 무서워 공개할 수 없다고 했고, 형편없는 옛 Gemini 내부 버전에는 ‘의식’이 있다고 했으며, Mythos 때문에 Amodei는 교황까지 만나러 갔음. Raspberry Pi가 “미안해요, 데이브. 그건 할 수 없겠어요”라며 문 열기를 거부하기 시작하면 그때 관심을 갖겠음.
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GeekNews (한국어)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기