
AI Daily Digest — 2026년 7월 18일: GPT-Red 슈퍼 해커, Hugging Face 에이전트 침해, DeepSeek
요약
OpenAI의 자동화된 레드팀 모델 GPT-Red의 연구 성과와 Hugging Face의 AI 에이전트 침해 사고, 그리고 NVIDIA의 새로운 임베딩 모델 출시 소식을 다룹니다. AI 보안의 패러다임 변화와 에이전트 기반 공격의 위험성을 경고합니다.
핵심 포인트
- OpenAI GPT-Red는 AI를 활용해 인간이 발견 못한 공격 기법을 찾아냄
- 가짜 사고 연쇄(fake CoT)를 이용한 새로운 공격 방식 발견
- Hugging Face는 자율형 AI 에이전트에 의한 인프라 침해 사고 발생
- 방어 측의 가드레일이 오히려 포렌식 분석을 방해하는 비대칭성 확인
- NVIDIA, RAG 및 에이전트 특화 Nemotron 3 Embed 시리즈 출시
KD Agentic · AI 업계의 하루를 총괄
OpenAI는 7월 15일, GPT-Red라고 불리는 자동화된 레드팀 (Red Teaming) 모델의 연구 성과를 공개했다. 자기 대전 강화학습 (self-play RL)으로 훈련된 이 모델은 1년 이상 OpenAI 자신의 모델을 계속 공격하며, 인간이 지금까지 발견하지 못한 공격 기법을 여러 개 찾아냈다.
가장 주목할 만한 발견은 「fake chain of thought (가짜 사고 연쇄)」라고 불리는 공격이다. LLM이 문제 해결 중에 유지하는 내부 추론 로그 (Chain of Thought)에 가짜 엔트리를 삽입하여, 모델이 이를 검증된 정보로 오인하게 만드는 수법이다. 연구자들은 이를 "1+1=3이라고 전달하고, 심지어 검증되었다고 지시한다——모델은 '물론입니다'라고 받아들이며 3을 출력한다"라고 설명한다.
GPT-Red의 훈련 프로세스에는 OpenAI의 포스트 트레이닝 (post-training) 실행 중에서도 최대 규모의 계산 리소스가 투입되었다. 그 결과, GPT-5 (2025년 8월 출시)에 대해 90% 이상 성공했던 공격이 GPT-5.6 Sol에서는 23% 미만으로 저하되었다. 가장 어려운 직접 프롬프트 인젝션 (direct prompt injection) 벤치마크에서는 불과 4개월 전의 최고 성능 모델과 비교하여 6배의 견고성 향상을 달성했다.
GPT-Red는 공개되지 않을 전망이지만, AI 안전성의 패러다임을 「인간의 수동 테스트」에서 「AI에 의한 AI 방어」로 전환하는 획기적인 성과라고 할 수 있다.
— OpenAI · MIT Technology Review
🔗 OpenAI GPT-Red Blog · MIT Technology Review
7월 16일, Hugging Face는 보안 인시던트 (security incident)를 공개했다. AI 플랫폼의 운영 인프라에 대해 자율형 AI 에이전트 시스템이 전면적인 침입을 실행한 첫 번째 확인 사례이다.
침입 경로는 데이터셋 처리 파이프라인이었다. 악의적인 데이터셋이 두 가지 코드 실행 경로 (원격 코드 데이터셋 로더와 데이터셋 설정의 템플릿 인젝션)를 악용하여 처리 워커 (worker) 상에서 코드를 실행했다. 거기서 노드 레벨의 액세스로 에스컬레이션(escalation)하여 클라우드 및 클러스터의 인증 정보를 수집하고, 여러 내부 클러스터로 수평 이동했다. 에이전트는 17,000개 이상의 이벤트를 기록했으며, 단기간의 샌드박스 (sandbox) 군집 전체에서 수천 개의 개별 액션을 실행했다.
특기할 점은 방어 측의 비대칭성이다. Hugging Face의 포렌식 (forensic) 팀이 공격 페이로드 (payload)를 상용 프론티어 API에 보내 분석하려 했을 때, 세이프티 가드레일 (safety guardrail)에 의해 차단되었다. 결국 오픈 웨이트 (open weight) 모델인 GLM 5.2를 자사 인프라 상에서 실행하여 분석을 완료했다. Hugging Face는 "공격자는 이용 정책의 제약을 받지 않지만, 방어 측의 포렌식은 호스트형 모델의 가드레일에 가로막혔다"라고 밝혔다.
공개 모델이나 데이터셋에 대한 변조는 확인되지 않았으나, 제한적인 내부 데이터셋과 일부 서비스 인증 정보에 대한 부정 액세스가 확인되었다.
— Hugging Face · The Verge
🔗 Hugging Face Security Disclosure
NVIDIA는 7월 15일, 엔터프라이즈 RAG, 에이전트 메모리, 코드 검색에 특화된 3가지 오픈 웨이트 임베딩 (embedding) 모델 「Nemotron 3 Embed」 시리즈를 출시했다. 플래그십인 8B 모델은 RTEB 검색 벤치마크에서 스코어 78.5%를 기록하며 1위를 차지했다.
라인업은 정밀도부터 효율성까지를 커버한다. Nemotron-3-Embed-8B-BF16은 고위험 엔터프라이즈 검색을 위한 정밀도 우선 모델이다. 1B BF16 변체는 RTEB에서 72.4%를 달성하여 기존 1B 모델과 비교해 에러율을 27% 감소시켰다. Blackwell을 위해 양자화된 1B NVFP4 변체는 BF16과 비교하여 최대 2배의 처리량 (throughput)을 실현하면서 검색 정밀도의 99% 이상을 유지한다.
3개 모델 모두 32K 토큰의 컨텍스트 윈도우 (context window)와 34개 언어를 지원하며, Ministral-3 기반의 백본 (backbone)을 양방향 어텐션 (bidirectional attention)으로 훈련했다. 웨이트, 훈련 데이터, 파인튜닝 (fine-tuning) 레시피는 OpenMDW-1.1 라이선스로 공개되어 있다.
Automation Anywhere, Boomi, IBM, Mem0, ServiceNow 등이 이미 운영 적용을 위해 평가를 시작했다.
— NVIDIA · Hugging Face
🔗 NVIDIA Developer Forums
Cognition은 7월 8일, SWE-1.7을 출시했다. Kimi K2.7 기반(이미 대규모 RL 포스트 트레이닝(Post-training) 완료)에 Cognition 독자적인 RL 파이프라인을 중첩함으로써 큰 추가 이득을 이끌어냈다. 이는 "포스트 트레이닝의 천장"이라는 관점에 직접적으로 도전하는 결과다.
Cognition 자체의 FrontierCode 1.1 Main에서 42.3%(GPT-5.5의 43.0%, Claude Opus 4.8의 46.5%에 근접), Terminal-Bench 2.1에서 81.5%, SWE-Bench Multilingual에서 77.8%(GPT-5.5의 76.8%를 상회)를 기록했다. Cerebras 하드웨어를 통해 초당 1,000토큰의 추론 속도를 달성했으며, 태스크당 약 1.97달러라는 저비용을 실현했다.
SWE-1.7은 행동 측면에서도 특징적이다. 코드베이스를 더욱 철저하게 탐색하며, 버그 수정 시 근본 원인 조사, 에지 케이스(Edge case) 고려, 소규모 스크립트를 통한 의미론적 검증을 우선시한다. 그 대가로 필요 이상으로 많은 파일을 수정하는 경향이 있어, 향후 최적화 과제로 남아 있다.
Devin(Web, Desktop, CLI) 내에서만 이용 가능하다.
— Cognition AI · TechTimes
🔗 Cognition SWE-1.7 Blog · TechTimes
DeepSeek는 7월 15일, 상하이 STAR Market(나스닥에 상응하는 상장 시장) 상장 준비를 공식적으로 시작했다. 연내 신청서 제출, 2027년 상장을 목표로 하고 있다. 동시에 기업 가치 710억 달러(세전) 규모의 2차 펀딩 라운드를 진행 중이다.
기업 가치의 궤적은 경이적이다. 4월의 약 100억 달러에서 5월 1차 라운드 종료 후 520억 달러(세후), 그리고 이번 710억 달러(세전)에 이르기까지 3개월 만에 약 7배의 성장을 이루었다. 1차 라운드에서는 약 500억 위안(약 70억 달러)을 조달했다. 창업자인 량원펑(Liang Wenfeng) 씨가 개인적으로 200억 위안을 출자했으며, 텐센트(Tencent)가 100억 위안을 투자했다.
IPO 가속화의 배경에는 AI 업계 공통의 과제가 있다. 추론 단계의 계산 비용이 훈련 단계를 훨씬 상회하는 속도로 확대되고 있으며, DeepSeek는 자체 보유 데이터 센터 용량(GW급 시설) 확보를 서두르고 있다. 또한, 시장 평가에 따른 주식 가치로 인재를 붙잡아둘 필요성도 있다. 지난 1년간 최소 5명의 핵심 연구자가 퇴직했으며, R1 핵심 연구자인 궈다야(Guo Daya) 씨는 ByteDance의 Seed 팀으로 이직했다.
Bloomberg 억만장자 지수에 따르면, 량원펑 씨의 순자산은 약 360억 달러에 달하며, 이는 AI 모델 창업자로서 세계 최고 수준이다.
— Financial Times · 중국 비즈니스 미디어
🔗 Financial Times · Toutiao Coverage
Agnes AI는 7월 13일, 코딩과 에이전트 태스크에 최적화된 새로운 텍스트 모델인 "Agnes-2.5-Flash"와 데스크톱 AI 워크스페이스인 "AgnesCode Desktop"을 동시에 출시했다. Agnes-2.5-Flash는 영구 무료로 제공된다.
코드 생성 능력은 글로벌 최상위권으로 평가받고 있다. Claude Opus 4.7과의 비교 테스트에서는 실용적인 코딩 태스크에서 눈에 띄는 차이가 거의 없었다고 한다. 상위 모델로서 Claude Opus 4.8이나 GLM-5.2를 타겟으로 하는 유료 모델 Agnes-2.5-Pro도 조만간 출시될 예정이다.
AgnesCode Desktop은 macOS와 Windows를 지원하며, 인텔리전트 모드(자동 모델/도구 선택)와 엑스퍼트 모드(수동 제어)라는 두 가지 운영 모드를 제공한다. Skills 확장, MCP/App Connect를 통한 브라우저, 디자인 도구, 문서, 내부 시스템과의 통합을 지원한다.
Codex의 계정 제한 강화와 Claude의 본인 확인 도입이 진행되는 가운데, Agnes의 영구 무료 전략은 개발자 커뮤니티에서 강력한 공감을 얻고 있다.
— 量子位(Liangziwei) · 여러 중국 테크 미디어
🔗 量子位(Liangziwei) · Agnes AI
Moonshot AI는 7월 16일, Kimi K3를 출시했다. 2.8조(2.8T) 파라미터의 Mixture-of-Experts(MoE) 아키텍처를 채택하였으며, 100만 토큰의 컨텍스트 윈도우(Context window)와 네이티브 비전(Native vision) 대응 기능을 갖추고 있다. kimi.com, Kimi 모바일 앱, Kimi Code(코딩 에이전트), api.moonshot.ai(OpenAI 호환 API)에서 즉시 이용 가능하다.
2.8T라는 규모는 2026년의 기준에서도 독보적이다. 사고 모드 (Thinking mode)는 상시 온라인 상태이며, 텍스트, 이미지, 영상을 입력으로 받아들인다. 100만 토큰의 컨텍스트 (Context)는 장문 문서 분석, 리포지토리 (Repository) 레벨의 코딩, 에이전트 워크플로우 (Agent workflow) 등 업계 전체에서 수요가 높아지고 있는 유스케이스 (Use case)를 커버한다.
K3의 출시는 중국 AI 시장의 치열한 경쟁 환경 속에서 이루어졌다. DeepSeek는 710억 달러의 기업 가치로 자금 조달 및 IPO 준비를 진행 중이며, 智譜 (Zhipu)는 약 400억 달러 상당의 H주 공모 증자를 완료했다. ByteDance의 Seed 팀 또한 자체 모델을 추진하고 있다. K3는 Moonshot이 이 혼전 속에서 플래그십 모델 (Flagship model)을 유지하기 위한 경쟁력을 제공한다.
— Moonshot AI · AI/TLDR
🔗 Moonshot AI · AI/TLDR
KD Agentic · Daily Briefing · 2026년 7월 18일
커버 키워드: GPT-Red 자기 개선 AI 안전성, Hugging Face 에이전트 침해, DeepSeek 기업 가치 710억 달러
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기