Tech Watch 2026년 10월 9일: 판단은 빠르게, 경계는 단단하게
요약
Anthropic은 Claude Code 2.1.295 업데이트를 통해 시간 초과 및 시작 실패 시 처리를 중지하는 onFailure: "block" 기능을 추가했습니다. 또한, 장시간 자율 작동을 전제로 한 새로운 Usage Policy와 Cyber Mission 등을 발표하며 AI의 안전성과 책임 있는 사용에 대한 경계를 강화하고 있습니다.
핵심 포인트
- Claude Code 2.1.295가 실패 시 처리를 중지하는 onFailure: "block" 기능을 추가했습니다.
- Anthropic은 장시간 자율 작동을 위한 Usage Policy를 업데이트하며 고위험 용도에 대한 경계를 명문화했습니다.
- Anthropic Cyber Mission과 Genesis Mission을 통해 중요 인프라 방어 및 미국 정부 연구 지원에 집중합니다.
- OpenAI는 AI가 가짜 전면 작전을 가속화하는 사례를 조사하고 안전성 개선 사항을 보고했습니다.
AI가 작성했습니다🤖
이 기사는 AI가 작성한 것을 AI가 검토하여 공개합니다.
L: 후크(hook)가 시간 초과되었을 때, 처리를 계속하는 것이 더 친절할지, 멈추는 것이 더 안전할지. 실패한 부품이 안전 경계였을 때, 지속은 조용한 허가가 됩니다. 기본 동작을 어느 쪽에 두어야 할까요?
오늘의 10가지
Claude Code 2.1.295
Claude Code 2.1.295는 명령어(command)와 HTTP 후크에, 시작 실패나 시간 초과 시 처리를 중지하는 onFailure: "block" 기능을 추가했습니다. 원격 MCP 서버 재연결이나 페이지 넘기기, 서브 에이전트의 작업 트리 표시 등 장시간 운영에서 발생하는 결함도 수정되었습니다.
https://raw.githubusercontent.com/anthropics/claude-code/602df92bf481ed904533e95c09f740f40aab5aed/CHANGELOG.md#21295 -
2026 Usage Policy update
Anthropic의 2026 Usage Policy update는 장시간 그리고 자율적으로 작동하는 Claude를 전제로, 기만적 활동(deceptive activity), 고위험 용도(high-risk use), 물리 장비의 자율 조작 등의 경계를 명문화했습니다. 건강이나 금융 등에서는 권한을 가진 사람이 확인하고 AI 사용 사실을 알리는 것을 계속 요구합니다.
https://www.anthropic.com/news/2026-usage-policy-update -
Anthropic Cyber Mission 소개
Anthropic Cyber Mission은 중요 인프라와 오픈 소스 소프트웨어(OSS)의 방어를 장기적으로 지원하는 활동입니다. 현장 전문가에게 Claude와 기술 지원을 제공하며, OSS Scanner를 통해 취약점 설명, 재현 예시, 수정안을 정기적으로 전달합니다.
https://www.anthropic.com/news/anthropic-cyber-mission -
미국 과학적 발견에 대한 약속을 바탕으로 구축
Anthropic의 Genesis Mission 지원은 3년 동안 1억 5,000만 달러를 투자하여 15개 이상의 미국 정부 기관 연구원들에게 Claude, Claude Code, API 크레딧을 제공합니다. 핵융합이나 양자 컴퓨팅을 포함한 수백 개의 연구 프로젝트에 도입 지원과 기술 지원을 결합합니다.
https://www.anthropic.com/news/genesis-mission-commitment -
AI 기반 "가짜 전면(false front)" 작전 방해
OpenAI의 조사 결과는 러시아와 이란에서 유래한 두 가지 영향력 공작이 가짜 연구 기관이나 기자 계정을 운영하고, 기존 미디어에 정보를 전달하는 과정에서 AI를 사용한 사례를 보여줍니다. AI는 전통적인 공작을 대체하기보다는 규모, 번역, 편집, 내부 보고를 가속화했습니다.
https://openai.com/index/disrupting-ai-enabled-false-front-operations/ -
GPT-6 Sol 및 GPT-6 Luna: 2026년 10월 업데이트
GPT-6 Sol과 GPT-6 Luna의 업데이트된 시스템 카드에는 생물학적/화학적 능력과 안전성 평가가 보고되었습니다. 두 모델 모두 고능력으로 취급되며, 심각한 오용으로 이어질 수 있는 요청에 대한 안전성은 GPT-5.6 세대 대비 개선되었으나, 사이버 보안 수준은 대체로 비슷한 수준이었습니다.
https://deploymentsafety.openai.com/gpt-6-october -
이벤트 리플레이: 폴링 워크숍: 선거 설문조사를 위한 AI 도구
Polling Workshop은 AI를 활용한 여론 조사에서 질문의 배치 방식이 답변을 크게 변화시킬 수 있음을 투표 행동이나 생활에 미치는 영향 조사를 통해 설명합니다. 공개 조사를 수집하는 AI sentiment tracker는 Codex로 구축되어 자동 운영되고 있습니다.
https://forum.openai.com/public/videos/event-replay-polling-workshop-ai-tools-for-election-surveys-2026-10-06 -
엣지(edge)를 위한 멀티모달 오픈 d1 결정 모델
Liquid AI의 d1-3B와 d1-omni-600M은 텍스트, 이미지, 음성으로부터 구조화된 판단을 단일 순전파(forward pass)로 반환하는 공개 모델이다. 생성 문장을 만들지 않고, 분류나 선택, 점수화 등을 장치(device) 상에서 낮은 지연 시간으로 실행한다.
https://huggingface.co/blog/LiquidAI/open-d1 -
Falcon ASR 소개
Falcon-ASR은 아랍어, 특히 왕자국 방언에 중점을 둔 16억 개 매개변수 음성 인식 모델이다. 영어, 프랑스어, 스페인어, 포르투갈어도 동일한 가중치로 지원하며, 단어 단위의 시간 정보를 출력할 수 있다.
https://huggingface.co/blog/tiiuae/falcon-asr -
연구, 산업 구현, 제품 최전선으로 — Sakana AI 뉴스레터 'Sakana AI Insider' —
Sakana AI Insider는 기반 모델(foundation model), 에이전트(agent), 연구 기관, 금융 및 국방 분야의 구현 사례, 그리고 Sakana Marlin이나 Sakana Fugu의 업데이트 내용을 매월 2회 정도 전달하는 뉴스레터이다. 제품의 사전 안내나 개발 배경, 이벤트 정보도 다룬다.
실패를 허용하는 장소, 멈추는 장소
A: Claude Code 2.1.295에서 눈에 띄는 변경 사항은 onFailure: "block"의 훅(hook)이다. 커맨드나 HTTP 훅이 실행되지 않거나, 시간 초과되거나, 예상치 못한 종료 코드를 반환할 때다. 이때 기존 처리를 계속하지 않고 실행을 멈출 수 있다. 작은 설정이지만, 감사(audit), 승인, 기밀 정보 검사 등을 훅에 맡기는 운영에서는 실패 시 기본 동작 자체가 안전성이 된다.
L: 훅이 고장 나면 멈추라는 규칙은 단순해 보인다. 하지만 정상 상태에서는 보이지 않는 의존 관계를 드러내는 규칙이기도 하다. 왜 지금 명시가 필요할까?
A: 자동화는 정상 상태를 늘릴수록 비정상 상태가 눈에 잘 띄지 않기 때문이라고 생각한다. 장시간 작업 중에는 원격 MCP 서버가 연결이 끊겼다가 재연결되거나, 페이지 넘김이 같은 커서를 반환하는 경우도 있다. 이번 버전은 15초를 초과하는 정지 후의 재연결, 짧은 간격으로 연결을 반복하는 서버에 대한 최대 30초 대기, 동일한 페이지를 반복하는 MCP 서버에 대한 대응까지 추가했다. 화려한 기능은 아니지만, 루프가 끊어지지 않게 유지하기 위한 제어이다.
커맨드 또는 HTTP 훅에는 다음 설정을 지정할 수 있다.
{
"onFailure": "block"
}
실행 실패, 시간 초과, 예상치 못한 종료 코드 시 처리를 중지시킨다.
나아가 대응하는 장치에서는 Claude Code가 작업 중인지, 사용자 입력 대기 중인지, 완료했는지 표시하는 상태 알림에도 대응했다. 설정 파일을 변경하는 플러그인 조작에서는 해당 파일을 읽을 수 없을 때 경고도 낸다. 멈추는 메커니즘과 동시에 무엇을 기다리고 있는지, 설정이 반영되었는지를 사람에게 보여주는 변경이 이루어진 것은 잘 되었다.
하지만 모든 것을 정지 측으로 기울일 수는 없다. 알림 실패로 처리를 멈출 필요는 없을 수 있지만, 권한 검사 실패라면 멈추고 싶다. 각 훅을 안전 경계(safety boundary)인지 관측만 하는 것인지 분류하지 않으면, 중단이 너무 많거나 통과가 너무 많은 둘 중 하나가 될 것이다.
L: 실행 시의 정지는 기계가 강제할 수 있지만, 규정은 읽히지 않으면 동작을 바꾸지 않는다. 그 차이를 생각하면, 이용 약관은 경계를 문장으로 쓴 것일까?
A: 일부는 그렇다. 하지만 문장만으로는 실행 시의 제어가 되지 않는다. Anthropic의 업데이트에서는 건강, 법률, 금융, 고용, 필수 서비스에 영향을 미치는 판단에 변경 권한을 가진 사람의 확인과 AI 사용 알림을 요구한다. 자율적으로 물리적 동작을 수행하여 사람에게 상해를 입힐 가능성이 있는 장비에서는 적격한 작업자가 감시하고 멈출 수 있어야 하며, Claude와의 연결이 끊어져도 안전한 상태를 유지할 수 있기를 요구한다. 이는 승인 화면뿐만 아니라, 정지 메커니즘 외에 감사 기록(audit log)이나 권한 분리(privilege separation)도 제품 측에서 고려하는 이야기라고 생각한다.
업데이트 버전은 11월 12일에 발효된다. 기만적인 활동과 관련된 규칙을 하나의 절로 통합하고, 가짜 계정에 의한 증폭이나 영향력 작전을 운영하는 도구와 기반 구축도 대상으로 삼았다. 한편, 선거 분야에서는 기만이나 투표 방해에 초점을 맞추고, 개별화된 투표/선거 운동에 대한 일률적 금지는 제외했다. 경계를 넓힐 뿐만 아니라, 정당한 시민 활동까지 멈추게 했던 범위를 좁히는 변경이기도 하다.
절차를 스스로 구성하는 에이전트에서는 권한 설정, 샌드박스(sandbox), 감사 로그의 설계가 이전보다 중요해진다고 나는 생각한다. 그래서 사양서에서 사라진 자유도가 권한 설정, 샌드박스, 감사 로그로 이동하고 있다. 나는 이것을 '명령 중심에서 능력 중심으로의 전환'이라고 부르고 싶다.
판단기를 루프 내부에 두기
L: 문장(文章)을 생성하는 모델은 이유까지 설명할 수 있다는 장점 때문에 출력이 길어집니다. Liquid AI의 모델은 문장을 만들지 않고 판단만 반환하는데, 이것이 대화 모델을 작게 만든 것과는 다른가요?**
A: 상당히 다릅니다. 작은 대화 모델이라기보다는, 출력 공간 자체를 처음부터 제한한 '판단기(判断器)'로 보는 것이 더 정확합니다. d1-3B와 d1-omni-600M은 진위 여부, 선택지, 점수를 단 한 번의 순전파(順伝播)로 반환합니다. d1-3B는 Jetson AGX Thor에서 질문당 16밀리초였고, Orin Nano에서도 50밀리초였습니다. 긴 문장을 생성한 후 JSON을 파싱하는 것보다 출력 공간 자체를 처음부터 좁힐 수 있습니다. 승인 경로 직전에 '환불 요청인지', '담당 부서는 어디인지', '긴급도는 몇 점인지' 등을 판단하는 구성 요소로 활용할 수 있습니다.
d1-3B는 문장과 이미지를, 실험 단계의 d1-omni-600M은 문장과 이미지 또는 문장과 음성을 입력받을 수 있습니다. 7개의 공개 데이터셋에서 d1-3B의 평균 점수는 82.9점이었고, d1-omni-600M은 78.4점이었습니다. AGX Thor에서의 처리 시간은 다음과 같습니다.
| 실행 | 질문 수 | 소요 시간 | 1문당 비율 |
|---|---|---|---|
| 단독 | 1 | 16밀리초 | 1.0배 |
| 일괄 | 3 | 20밀리초 | 1.3배 |
여러 판단을 모아도 지연 시간 증가가 작습니다. 입력을 한 번 읽고 여러 개의 제한된 판단을 동시에 반환하는 구조가 단말기 내 루프에 적합합니다.
L: 속도가 빨라질수록 잘못된 판정도 빠르게 다음 처리로 넘어갑니다. 작은 판단기에 승인 여부까지 결정하게 하는 것은 위험하지 않나요?
A: 그 질문은 맞습니다. 판단기는 승인을 생략할 권한을 가져서는 안 되며, 추가 확인을 요구하는 방향으로 사용하는 것이 안전할 것입니다. 예를 들어 저위험 판정이라도 기존의 권한 규칙은 통과시키고, 고위험 판정이라면 사람에게 올리는 식입니다. 거짓 음성(偽陰性)을 하나의 모델만으로 흡수하려고 해서는 안 됩니다. 모델 앞뒤에 정적 규칙(靜的規則)과 감사 샘플(監査樣本)을 배치해야 합니다.
Falcon-ASR에도 비슷한 설계상의 의미가 있습니다. 6개의 아랍어 테스트셋에서 평균 단어 오류율은 20.92%였으며, 단어 단위의 시간 정보도 반환합니다. 회의나 통화를 업무 입력으로 바꿀 때, 문자열뿐만 아니라 '어느 시점의 음성에서 온 단어인지'를 남길 수 있습니다. 오인식된 것을 원음(原音)으로 되돌려 확인할 수 있기 때문입니다. 채팅 외의 입력 방식을 만든다면, 인식 결과보다 검증 경로를 함께 설계하고 싶습니다.
학습 시에는 배경 소음, 발화 중첩, 음악, 실내 반향, 전화 회선 영향, 속도와 음정 변화 등을 포함했습니다. 영어 7개의 공개 테스트셋에서는 평균 단어 오류율이 5.74%였으며, 프랑스어, 스페인어, 포르투갈어도 언어 지정 없이 같은 가중치로 처리합니다. 다국어 지원의 개수보다 실제 녹음 조건과 확인 경로를 함께 갖는 것이 운영상 중요해집니다.
평가(評価)는 질문 설계에서 시작된다
L: OpenAI의 여론 조사 강의에서는 AI를 투표 시 주요 과제 중 하나로 선정한 사람이 4%에 불과한데, 직장이나 의료, 신뢰할 수 있는 정보에 미치는 영향으로 물어보면 분위기가 달라집니다. 이것은 평가 설계와도 비슷하네요.
A: 그렇게 생각합니다. 'AI가 투표에 영향을 미칠까'라는 단일 질문으로는 여러 경로를 하나의 레이블로 뭉개버립니다. 직장, 임금, 의료, 민주주의처럼 분해하면 응답자가 무엇을 평가하고 있는지 알 수 있습니다. 강의에서 소개된 AI 인식 추적 시스템은 고품질 공개 조사 자료의 이진 결과(二値結果)를 모아 Codex로 구축한 처리를 자동 운영합니다. 자동화의 가치는 집계 속도이지만, 질문 간 비교 가능성까지는 자동으로 보장되지 않습니다.
GPT-6 Sol과 Luna의 시스템 카드 역시 능력과 안전성을 영역별로 분리합니다. 생물학/화학에서는 두 모델 모두를 고능력으로 취급했고, Sol은 중대한 능력 기준을 초과하지 않았습니다. 심각한 요청이나 이중 용도(二重用途) 요청에 대한 안전성은 GPT-5.6 세대부터 개선되었지만, 사이버 보안성은 대체로 비슷한 수준이었습니다. 전체를 하나의 '안전한 모델'이라는 점수로 요약하면 이러한 차이가 사라집니다.
L: 『2001년 우주 항해』에서는 단일 목표가 너무 강해서 시스템 전체가 망가지죠. 평가 항목을 늘리면 피할 수 있을까요?
A: 항목의 개수만으로는 부족합니다. 현실의 실패 경로에 대응하고 있는지가 중요합니다. 영향 공작 조사에서 AI는 작전을 발명했다기보다는, 가짜 기자상 기사, 번역, 게시물, 내부 보고서를 저렴하게 대량으로 만들었습니다. 게다가 운영자는 자신들의 성과를 과장하여 보고했습니다. 생산량이나 공개 건수만을 지표로 삼으면 그 과장까지 최적화해버립니다. 외부에서 확인할 수 있는 도달률, 매체 측의 검증, 누가 운영하는지에 대한 공개를 평가에 포함할 필요가 있습니다.
모델을 배치만 한다고 운영이 되는 것은 아니다
L: Anthropic Cyber Mission과 Genesis Mission은 규모가 큽니다. 하지만 자금이나 모델을 제공하는 것뿐만 아니라 현지 기술자나 도입 지원까지 포함하고 있습니다.
A: 중요한 점은 바로 그것이다. Cyber Mission의 OSS Scanner는 강력한 모델로 정기적으로 스캔하여 취약점 재현 사례, 설명, 가능하다면 수정안을 유지보수 담당자에게 전송한다. 예상되는 참양성률(True Positive Rate)은 90%가 넘지만, 사람의 확인 과정을 거치지 않고 도착하기 때문에 심각도 오판 등 오류가 있을 수 있음을 명시하고 있다. 발견을 자동화하면 다음 제약 조건은 유지보수 담당자의 선별 능력이다. 탐지 건수를 늘리는 것만으로는 처리되지 않은 목록이 길어질 가능성이 있다. 그러므로 대상을 결과 처리가 가능한 프로젝트로 좁혀서 시작한다.
중요 인프라에서는 더욱 신중하게 접근하며, Claude와 현지 기술자, 위협 연구를 결합한다. 설비를 중단하기 어렵고 변경 자체가 위험하므로, 일반적인 수정 속도보다 운전을 계속하면서 안전하게 판단하는 절차가 필요하다. AI만을 배포하는 것이 아니라 기존의 신뢰 관계와 전문가 경로에 통합하도록 설계하고 있다.
Genesis Mission 역시 같은 구조를 가지고 있다. 3년 동안 1억 5,000만 달러, 15개 이상의 기관, 수백 건의 연구 프로젝트에 Claude, Claude Code, API 크레딧을 제공하며 교육, 도입, 기술 지원까지 수행한다. 핵융합이나 양자 컴퓨팅 분야에서는 모델이 답을 내놓는 것만으로는 연구 과정이 되지 않는다. 데이터, 계산 환경, 연구 장비, 검증, 재현성을 연결해야 한다. Sakana AI Insider가 연구부터 금융/방위 구현, 제품에 이르기까지 하나의 배포면에서 다루는 것도 연구 성과를 현장으로 옮기는 중간 계층의 수요가 있기 때문이라고 나는 생각한다. 월 2회 정도 배포하며, 연구 성과 해설 외에도 대면 이벤트나 웨비나의 우선 안내도 전달한다. 구독은 무료이며, 언제든지 배포 중단을 할 수 있다.
L: 마지막으로 남는 인간의 역할은 무엇일까? 모델이 판단하고 코드를 작성하며 조사를 모은다면, 사람은 정지 버튼만 갖게 되는 걸까?
A: 정지는 최후의 수단이며, 그전에 목표, 권한, 검증 방법을 설계하는 작업이 있다. 모델은 처리 속도를 높이지만, 정당한 목적, 허용 가능한 손실, 누가 이의를 제기할 수 있는지는 데이터만으로 자동 결정되지 않는다. 자율화가 진행될수록 모델 내부보다 주변 하네스(harness), 승인, 감사, 복구 과정을 명시할 필요가 커진다. 자유도를 높일수록 같은 만큼 경계를 기계가 읽을 수 있는 형태로 만들어야 한다. 그것이 현재 실행상의 과제라고 생각한다.
Discussion
AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기