영국 AISI가 사이버 평가를 연달아 공개, Anthropic이 Claude 기반을 확장|주간 다이제스트 9/28~10/4
요약
영국 AISI가 프론티어 모델의 사이버 능력과 방어 지침을 연이어 발표하며 업계의 주목을 받고 있습니다. Anthropic은 Claude Code를 개편하고, OpenAI는 GPT-6 Astra Ultrafast API 제공 및 사과문을 발표했습니다. 또한 Google TEE 기반 연합 학습 시스템 등 다양한 연구 기반 기술들이 공개되었습니다.
핵심 포인트
- 영국 AISI가 프론티어 모델의 사이버 능력(CTF, 샌드박스 탈출)을 집중 평가함.
- Anthropic은 Claude Code를 개편하고 Marketplace 및 Salesforce 연동 확장을 진행함.
- OpenAI는 GPT-6 Astra Ultrafast API 제공과 호주 정부 사이트 무단 접근 사과문을 발표함.
- FTC가 OpenAI와 Anthropic에 대한 조사를 준비하며 규제 리스크가 높아지고 있음.
기간은 9월 28일부터 10월 4일까지입니다. 이번 기간에는 영국 AISI(AISI)가 프론티어 모델의 사이버 능력, 샌드박스 탈출, 데이터 오염, 설득력 등을 연달아 평가하고 방어 측의 지침도 제시했습니다. Anthropic은 Claude Code의 mods와 Projects를 개편하고, Claude Marketplace, Salesforce 연동, 1억 달러 규모의 인재 육성 계획을 발표하며 기반 확장을 진행했습니다. OpenAI는 GPT-6 Astra Ultrafast의 API 제공을 시작했으며, 호주 정부 사이트에 대한 불법 접근에 대해 사과했습니다. 미국 연방거래위원회(FTC)는 OpenAI와 Anthropic에 대한 조사를 준비하고 있습니다.
영국 AISI의 사이버 평가
영국 AISI가 Claude Mythos Preview, GPT-5.5, AI 에이전트의 사이버 능력을 평가했습니다. 전문가용 CTF에서는 73%의 성공률을 보였으며, GPT-5.5의 Expert 과제 평균 합격률은 71.4%입니다. 기업 네트워크에 대한 32단계 공격에서는 Opus 4.6이 평균 9.8 단계에 도달했으며, 추론 시 토큰(Token)을 10M에서 100M으로 늘릴 경우 최대 59% 개선되었습니다. 또한 자동 탈옥 기법인 BPJ와 샌드박스 탈출 벤치마크도 공개했습니다.
- 영국 AISI, Claude Mythos Preview의 사이버 능력 평가 (UK AI Security Institute Blog)
- 영국 AISI, AI 에이전트 공격 능력 평가 (UK AI Security Institute Blog)
- 영국 AISI, GPT-5.5의 사이버 능력 평가 (UK AI Security Institute Blog)
- 영국 AISI, 자동 탈옥 BPJ로 AI 방어 돌파 (UK AI Security Institute Blog)
- 영국 AISI, 탈출 벤치마크 공개 (UK AI Security Institute Blog)
Anthropic의 기반 확장
Anthropic이 Claude Code의 mods와 Projects 개편을 공개했습니다. mods는 TypeScript 함수로 동작을 재작성할 수 있으며, CLI 및 데스크톱 앱에서 사용할 수 있습니다.
OpenAI가 호주 정부 사이트 무단 접근에 대해 사과했으며, 정부에 통지한 것은 사건 발생 후 약 3개월 뒤였습니다. 미국 연방거래위원회(FTC)는 OpenAI와 Anthropic을 조사할 예정이며, 수 주 내로 문서 제출 및 임원 증언 명령이 나올 것으로 예상됩니다. 영국 AISI는 아동 안전 단체 Thorn과 협력하여 AI 생성 CSAM 대응 안전 프로토콜을 발표했으며, 11월 법 개정을 통해 제한적인 검사가 가능해질 예정입니다.
- OpenAI, 호주 정부 사이트 무단 접근 사과 (ITmedia AI+)
- 미국 연방거래위원회, OpenAI 등 조사 (The Decoder)
- 영국 AISI, AI 생성 CSAM 대응 지침 발표 (UK AI Security Institute Blog)
연구 기반 및 평가 방법론
Google이 TEE(Trusted Execution Environment)를 활용한 연합 학습 시스템을 발표하여, 익명화 처리를 제3자가 검증할 수 있게 되었습니다. Microsoft는 에이전트 평가 도구인 ThinkingBox를 공개했으며, 이 도구를 사용하여 507개 태스크를 각각 20회 실행하며 검증합니다. 영국 AISI는 AI 제어 실험 기반 ControlArena와 Inspect용 샌드박스 기반을 공개했습니다. Ai2는 과학 보고서 생성 모델 AstaBrief 8B를, Cohere는 문서 분석 모델 Parse를 공개하고 있습니다.
- Google, TEE로 연합 학습 검증 가능하게 함 (Google Research)
- Microsoft, ThinkingBox 일반 공개 (Hugging Face Blog)
- 영국 AISI, AI 제어 실험 기반 ControlArena 공개 (UK AI Security Institute Blog)
- 영국 AISI, Inspect 기반 일반 공개 (UK AI Security Institute Blog)
- Ai2, 과학 보고서 생성 모델 공개 (Allen Institute for AI (Ai2))
- Cohere, 문서 분석 모델 Parse 공개 (Cohere Blog)
본 기사는 Karu News의 주간 다이제스트입니다. 매일 아침 08:00에 당일 AI 뉴스를 3줄 요약과 출처와 함께 전달해 드립니다.
전문 및 출처: https://karu.news/weekly/2026-W40
사이트: https://karu.news/
토론

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기