Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Google은 50개 이상의 관리형 MCP(Managed Container Platform) 서버를 GA 또는 프리뷰 단계로 출시하고 있으며, 앞으로도 더 많은 서버가 추가될 예정입니다. 이를 통해 AI 에이전트를 Google 관리형 MCP 엔드포인트로 지정하면 지역 설정 변경 없이 Google Cloud 보안 스택에 연결할 수 있습니다.
본 논문은 Computer Use Agents (CUAs)가 직면하는 하이브리드 액션 공간(GUI 액션과 도구 호출)의 불확실성을 해결하기 위해 ToolCUA라는 엔드투엔드 에이전트를 제안합니다. ToolCUA는 인터리브드 GUI-Tool 궤적 스케일링 파이프라인을 통해 다양한 학습 데이터를 확보하고, 워밍업 SFT와 단일 턴 RL을 결합하여 중요한 전환 시점의 의사결정을 개선합니다. 최종적으로 도구 효율성 보상을 이용한 Online Agentic RL을 통해 최적화된 ToolCUA는 OSWorld-MCP에서 높은 정확도를 달성하며 효과적인 GUI-Tool 오케스트레이션을 입증했습니다.

Palo Alto Networks의 Lee Klarich는 AI 기반 익스플로잇이 새로운 표준이 되기까지 남은 시간이 3~5개월 정도로 짧다고 경고하며, 기업들이 소프트웨어 방어력을 시급히 강화해야 한다고 강조했습니다. Anthropic의 Mythos와 OpenAI의 GPT-5.5-Cyber 같은 정교한 AI 모델의 등장은 사이버 공격의 위험 수위를 높이고 있습니다. 이러한 상황에 대응하여 업계는 가상 패치(virtual patching)를 포함한 새로운 방어 기술 혁신을 촉구하고 있으며, Palo Alto Networks 역시 관련 기능 세트를 곧 출시할 예정입니다.

파운데이션 모델의 성능 확장이 사전 학습을 넘어 사후 학습과 테스트 시간 컴퓨팅으로 진화함에 따라, 이를 뒷받침할 통합 인프라의 중요성이 커지고 있습니다. 본 글은 AWS 인프라와 오픈 소스 소프트웨어(OSS) 스택이 결합된 계층적 아키텍처를 통해 대규모 분산 학습 및 추론을 구현하는 핵심 빌딩 블록을 분석합니다.
Anthropic의 Claude 개발팀이 실제 사례를 통해 효과적인 프롬프팅 기법을 공개했습니다. 이들은 보험 양식 분석과 과실 결정이라는 작업을 예로 들어, 단순한 지시보다 구조화된 XML 태그 사용, 시스템 프롬프트 내 정적 컨텍스트 활용, 그리고 사람이 작업하는 순서에 따른 단계별 지침 제공이 중요함을 강조합니다. 이러한 체계적인 접근 방식을 통해 초기 버전 대비 프로덕션 수준의 정확하고 일관된 출력을 얻을 수 있습니다.
Google Threat Intelligence Group이 야생 환경에서 AI가 개발한 제로데이 익스플로잇을 사용하는 위협 행위자를 최초로 탐지했습니다. 이 발견은 공격자들이 광범위한 공격을 계획했음을 시사하며, Google의 선제적 대응(proactive counter-discovery) 덕분에 막을 수 있었습니다. 구체적인 내용은 AI 기반 위협에 대한 새로운 보고서에서 확인할 수 있습니다.

본 기사는 Claude 코드 편집기에서 사용할 수 있는 17가지의 핵심 키보드 단축키들을 소개하며, 사용 난이도와 중요도에 따라 S, A, B 세 가지 티어로 분류하여 설명합니다. 독자들은 기본 조작부터 고급 텍스트 편집 및 명령어 실행까지 단계별로 단축키를 익힐 수 있습니다.
Claude Code의 'Agent View'는 여러 개의 백그라운드 에이전트 세션을 한 화면에서 통합적으로 관리하고 모니터링할 수 있는 기능을 제공합니다. 이 뷰를 통해 사용자는 각 세션의 상태(작업 중, 대기, 완료, 실패 등)를 직관적인 아이콘과 색상으로 파악하며, 단일 인터페이스 내에서 프롬프트 디스패치, 최근 출력 확인(Peek), 완전한 상호작용 진입(Attach) 등을 효율적으로 수행할 수 있습니다. 또한, 세션 간의 파일 충돌을 자동으로 격리하고, 백그라운드 프로세스의 생존 및 재기동 메커니즘을 갖추어 에이전트 코딩 워크플로우의 복잡성을 크게 줄였습니다.
이 글은 Anthropic의 Claude Code용 인기 설정 모음인 'Everything Claude Code' (ECC)를 Gemini CLI 및 Antigravity 생태계로 마이그레이션한 'Everything-Gemini-Code' 프로젝트를 소개합니다. 작성자는 Gemini 사용 환경에 맞춰 ECC 기능을 구현했으며, 자체 개발한 EGC(Everything-Gemini-Code)는 기본 명령어의 한계를 보완하는 역할을 합니다.
미국과 중국이 AI 패권 경쟁을 심화시키면서 글로벌 사이버 보안에 대한 우려가 커지고 있습니다. 양국은 상대방이 자신들을 상대로 AI 도구를 무기화하거나 통제되지 않은 시스템(rogue systems)을 방출하는 것을 막는 데 이해관계를 가지고 있지만, 생산적인 규범 논의나 신뢰 구축에는 어려움이 예상됩니다. 트럼프 전 대통령의 중국 방문에서 AI 가드레일 논의가 기대되지만, 양국 모두 첨단 모델의 공격적 사이버 역량을 테스트하고 있어 자제하기는 쉽지 않은 상황입니다.
본 논문은 기상 데이터 기반의 희귀하고 영향력이 큰 사건(산불 등) 예측 문제를 다루며, 이를 롱테일 분포 문제로 정의합니다. 기존 모델들이 환경 변화나 극단적 사건에 취약한 문제를 해결하기 위해 '환경 적응형 선호도 최적화(EAPO)' 프레임워크를 제안했습니다. EAPO는 $k$-최근접 이웃 검색을 통해 지역적인 데이터셋을 구성하고, 지도 학습과 선호도 최적화를 결합하여 희귀 사건에 초점을 맞춘 하이브리드 미세 조정을 수행함으로써, 환경 변화가 있는 실제 산불 예측 작업에서 높은 견고성을 입증했습니다.
Claude Code 2.1.139 버전 업데이트에 새로운 명령어 `/goal`이 추가되어, 사용자가 완료 조건만 설정하면 Claude가 해당 조건을 충족할 때까지 스스로 작업을 반복하고 진행합니다. 이 기능은 매 턴마다 별도의 평가 모델을 사용하여 목표 달성 여부를 체크하며, 사용자 개입 없이도 복잡한 작업(예: 디버깅 및 테스트)을 자동으로 반복 수행하게 합니다.
본 연구는 아동 지향 언어(CDL)가 단어 학습, 특히 동사 의미 습득에 최적화되어 있는지 신경 언어 모델을 사용하여 계산적으로 조사했습니다. 그 결과, 구문 구조의 방해가 전반적인 학습을 저해하는 반면, CDL과 구어 ADL로 훈련된 모델이 더 높은 회복력을 보였습니다. 또한, 동사 의미 습득이 견고한 통사적 숙련도보다 먼저 나타나는 '의미 우선(semantic-first)' 궤적이 관찰되었으며, 이는 CDL만의 고유한 특성이라기보다는 광범위한 구어체 언어의 일반적인 속성을 반영할 수 있음을 시사합니다.
Anthropic이 AWS 사용자들을 위해 'The Claude Platform on AWS'를 일반 공개했습니다. 이 플랫폼은 기업들이 기존의 AWS 인증, 청구, 커밋먼트를 그대로 활용하면서 Claude API 기능을 온전히 사용할 수 있게 합니다. 이를 통해 기업들은 별도의 복잡한 절차 없이도 AWS 인프라 내에서 AI 에이전트 구축 및 운영을 용이하게 할 수 있습니다.
AI 펜테스팅 에이전트의 신뢰도가 높아지고 있지만, 기존의 벤치마크는 제한된 환경과 미리 정의된 목표(예: 플래그 획득)에만 초점을 맞추고 있어 실제 세계에서의 성능을 정확히 측정하는 데 한계가 있습니다. 본 논문은 이러한 문제를 해결하기 위해 평가의 초점을 단순한 과제 완료에서 '검증된 취약점 발견'으로 전환하는 실용적인 새로운 평가 프로토콜을 제시합니다.
개발자들의 대다수(71%)가 Claude 코드를 사용하고 있지만, 실제로는 그중 핵심적인 부분은 극히 일부(4%)에 불과합니다. 이 기사는 단순히 프롬프트 작성의 문제가 아니라, Plan 모드, 서브 에이전트, 스킬, 워크트리 같은 고급 기능들을 활용하는 것이 중요함을 강조합니다. 이러한 네 가지 기능을 사용하지 않는 개발자들의 비율은 96%에 달합니다.
본 기술 기사는 LLM이 여전히 어려움을 겪는 '인과 추론' 문제를 해결하기 위한 프레임워크 'CauSim'을 소개합니다. CauSim은 인과 시스템의 복잡성과 희소한 정답 데이터라는 근본적인 한계를 극복하고, 인과 추론을 확장 가능한 지도 학습 문제로 전환하는 것을 목표로 합니다. 이 프레임워크는 LLM에 의해 점진적으로 구축되는 '실행 가능한 구조적 인과 모델(SCMs)'이라는 복잡한 시뮬레이터를 구성하여 검증 가능성을 유지하며 시스템의 전역적인 복잡성까지 확장할 수 있게 합니다.
본 논문은 언어 에이전트가 수행하는 행동이 실제로 인과적 효과를 갖는지 검증하는 '인과 개입 검증기(CIVeX)'를 제안합니다. 기존의 안전장치들은 단순히 스키마나 출처만 확인할 뿐, 상태 변경에 따른 진정한 인과적 영향을 보장하지 못하기 때문에, CIVeX는 구조적 인과 쿼리를 사용하여 행동을 분석하고 EXECUTE, REJECT, EXPERIMENT, ABSTAIN 네 가지 판결 중 하나를 반환합니다. 실험 결과, CIVeX는 중간 및 적대적 교란 상황에서 오탐지 실행(false executions)을 '제로'로 달성하며, 기존의 LLM 기반 검증기들보다 훨씬 높은 신뢰성과 정확도를 입증했습니다.
Mamba와 같은 다음 단계 예측에 초점을 맞춘 상태 공간 모델이 Granger-인과 구조를 복구할 수 있다는 초기 주장이 여러 벤치마크 테스트를 거쳐 반증되었습니다. 연구진은 표준화된 합성 생성기, 다양한 개입 시나리오($do(X=c)$, 노이즈 등), 그리고 통제군을 포함하는 재사용 가능한 '반증 벤치마크' 프로토콜을 개발했습니다. 이 벤치마크를 통해, 단순한 선형 병목 구조가 동등하거나 더 나은 성능을 보였으며, 조정된 Lasso와 같은 고전적인 방법론이 Mamba의 예측 능력을 능가하는 것으로 나타났습니다.
본 논문은 평균 치료 효과를 넘어 분위수, 꼬리 위험 등 개입 결과 분포 전체를 추정해야 하는 '분포적 인과 추론' 문제를 다룹니다. 기존 GAN 기반 반사실 방법의 이론적 한계와 불안정한 밀도 기반 의존성을 극복하기 위해, 연구진은 GANICE(GAN for Interventional Conditional Estimation)라는 새로운 접근 방식을 제안했습니다. GANICE는 조건부 개입 분포를 명확한 인과 추정 목표로 설정하고, 확장된 Wasserstein 거리를 최소화하며 Minimax 최적성을 확보하여 기존 방법들보다 우수한 성능을 입증합니다.