AI Daily Digest — 2026년 8월 3일: Polaris가 Copilot을 장악하고, Grok 4.7 출시가 임박하며
요약
OpenAI가 ChatGPT를 악용해 다국어 메시지 생성 및 위조 문서를 제작하던 캄보디아 기반 사기 조직을 소탕했습니다. 이번 사례는 LLM이 번역과 조사 능력을 통해 범죄의 규모를 키우는 '힘의 증폭제'로 사용될 수 있음을 보여줍니다.
핵심 포인트
- 사기 조직이 ChatGPT를 다국어 번역 및 위조 문서 제작에 활용
- LLM이 범죄 운영의 효율성을 높이는 '힘의 증폭제' 역할 수행
- 텍스트 중심 탐지 시스템의 한계와 UI 기반 위조 위험성 증대
- OpenAI와 WhatsApp의 협력을 통한 악성 계정 차단 및 방어 강화
🤖💻 AI Daily Digest — 2026년 8월 3일
OpenAI, ChatGPT를 이용한 캄보디아 기반 사기 조직 소탕
OpenAI는 7월 31일, ChatGPT를 활용하여 여러 사기 노선(가짜 데이팅 페르소나, 암호화폐 및 현물 금 "투자" 계획, 허위 도박 보너스, 조작된 벌금 납부를 요구하는 법 집행 기관 사칭 등)을 운영해 온 캄보디아 기반의 사기 네트워크를 소탕했다고 밝혔습니다. 이번 조사는 WhatsApp이 공유한 보안 정보를 통해 시작되었으며, OpenAI는 해당 계정 클러스터가 반테아이 메안체이(Banteay Meanchey) 주의 포이펫(Poipet) 인근에서 활동했다고 밝혔습니다. 운영자들은 회사가 "ping, zing, sting"이라고 명명한 반복적인 3단계 패턴을 따랐습니다. 즉, 신뢰를 쌓고, 정서적 압박을 가한 뒤, 결제 스크린샷을 증거로 제시하며 입금을 유도하는 방식입니다.
이번 소탕 보고서는 AI 보조 조직 범죄의 운영 매뉴얼처럼 읽힙니다. 이 네트워크는 ChatGPT를 사용하여 여러 언어로 메시지를 생성 및 번역하고, 데이팅 프로필 자료를 조사하며, 위조 문서(여권, 법적 통지서, 주식 매수 확인서, 거래 플랫폼 인터페이스 등)를 제작하고, 심지어 내부 행정 업무(공지사항 초안 작성, 직원 통신 번역, 직원의 부채, 급여 공제 및 징계 벌금 기록 관리)까지 처리했습니다. OpenAI는 구금, 탈출 시도, 비자 만료 등을 언급하는 콘텐츠가 동남아시아 사기 캠프 내 인신매매 및 강제 범죄에 관한 공개 보고서 내용과 일치한다고 지적했습니다. 운영자들의 채팅에서 언급된 일부 피해자들은 각각 수천 달러의 손실을 입었습니다.
개발자(builders)들에게 이것이 주목할 만한 이유는 남용 표면(abuse surface)이 실제로 어디에 위치하는가 하는 점입니다. 힘의 증폭제(force multiplier)는 카피라이팅이 아니라 번역과 조사였습니다. 즉, LLM(대규모 언어 모델)을 통해 사기 집단이 여러 언어에 걸쳐 운영되고 관리 문서로 인력을 관리할 수 있었던 것입니다. 또한 위조 방식의 변화는 텍스트 전용 신호(text-only signals)를 기반으로 구축된 탐지 시스템이 현대적 사기의 운영 핵심을 놓치게 된다는 것을 의미하며, 이러한 사기는 생성된 문서와 가짜 플랫폼 UI(사용자 인터페이스) 내에서 점점 더 활발하게 이루어지고 있습니다. OpenAI는 관련 계정들을 차단하고, 파트너 및 당국과 지표(indicators)를 공유했으며, 재진입 방어(hardened re-entry)를 강화했습니다. 이것이 바로 이러한 네트워크의 속도를 실제로 늦추는 협력적 패턴입니다.
— OpenAI · WhatsApp
🔗 OpenAI — Disrupting Malicious Uses of AI: Criminal Scam Operation · Developers Digest Analysis · ITHome Coverage
Project Polaris가 GitHub Copilot의 기본 모델이 되다 — OpenAI와의 연결 고리가 끊기다
이 아키텍처는 프로그래밍 언어와 프레임워크별로 특화된 전문가 서브 모듈(expert sub-modules)을 갖춘 MoE(Mixture of Experts, 전문가 혼합) 구조입니다. 따라서 Rust 쿼리가 Python 전문가를 활성화하는 데 드는 연산 비용(compute tax)을 지불하지 않아도 됩니다. Microsoft는 Rust, Haskell, Zig와 같은 저자원 언어(low-resource languages)에서 가장 큰 성능 향상이 있었다고 보고했습니다. 이 회사는 Polaris가 HumanEval 및 MBPP에서 GPT-4 Turbo보다 성능이 뛰어나다고 주장합니다 (자체 보고 사항이며, SWE-Bench 수치는 공개되지 않았습니다). Pro 및 Pro+ 티어는 최대 100,000행에 달하는 다중 파일 컨텍스트(multi-file context)와 자율 테스트 생성(autonomous test generation)을 기본 기능으로 제공받습니다. 변하지 않는 것은 무엇인가: 바로 청구서입니다. 가격 변동이나 새로운 SKU(재고 유지 단위)는 없으며, 모델 교체는 기존 계약 하에서 내부적으로 이루어집니다.
이것은 제품 발표의 탈을 쓴 마진(margin) 결정입니다. OpenAI의 API를 통해 라우팅되는 모든 Copilot 완성(completion)은 Microsoft 자체 제품에 대한 토큰당 통행료였습니다. 수백만 명의 개발자가 하루 종일 완성물을 생성하는 엔터프라이즈 규모에서는 이것이 구조적인 저해 요인이었습니다. 모델과 실리콘(silicon)을 모두 소유함으로써 Microsoft는 두 가지 모두를 최적화할 수 있으며, Copilot을 OpenAI의 배포 채널에서 Microsoft 자체의 에이전트 플랫폼(agentic platform)으로 조용히 전환합니다. Claude Code 및 Cursor와의 경쟁 수학을 모델링하기가 더욱 어려워졌으며, 모든 프런티어 연구소(frontier lab)에 전달하는 메시지는 명확합니다. 소프트웨어 개발 분야에서 가장 큰 AI 배포 접점(distribution surface)은 더 이상 빌려온 두뇌(rented brains)로 구동되지 않는다는 것입니다.
— Microsoft · GitHub
🔗 Microsoft Build 2026 — Project Polaris · Crashbytes Analysis · GitHub
GitHub Copilot Workspace, Autopilot, Fleet 및 새로운 데스크톱 앱과 함께 GA 출시
GitHub Copilot Workspace가 Build 2026에서 베타를 종료하고 일반 가용성(GA, General Availability) 단계에 진입하며, 연구용 프리뷰(research preview)였던 것을 프로덕션(production) 단계의 약속으로 전환했습니다. Autopilot 모드는 전체 저장소(repository)를 가로질러 추론하고, 다중 파일 편집을 제안하며, 테스트를 실행하고, 결과를 해석하고, 반복(iterate)합니다. 이 모든 과정은 GitHub 이슈(issue)나 기능 설명의 범위 내에서 자율적으로 이루어집니다. Fleet 모드는 여러 개의 열린 이슈에 대해 Autopilot을 동시에 실행하며, 의존성 업그레이드(dependency upgrades), 스타일 마이그레이션(style migrations) 및 라이선스 준수 점검(license-compliance sweeps)에 적합하도록 설계되었습니다. 목표를 설명하면 테스트와 문서가 포함된 풀 리퀘스트(pull request)를 받는 에이전트 프로그래밍 모델(agentic programming model)은 이제 베타 실험이 아닌 지원되는 프로덕션 워크플로(production workflow)입니다.
함께 제공되는 GitHub Copilot 데스크톱 앱은 더욱 구조적인 움직임입니다. GitHub는 이를 "에이전트 네이티브 데스크톱 경험 (the agent-native desktop experience)"이라고 부릅니다. 이는 "My Work" 대시보드를 통해 모든 활성 에이전트를 한 번에 노출하는 독립적인 제어 평면 (control plane)입니다. 예를 들어, 한 에이전트는 기능 브랜치 (feature branch)의 버그를 수정하고, 다른 에이전트는 API 엔드포인트 (API endpoint)를 구현하며, 세 번째 에이전트는 PR 리뷰 피드백에 응답하는 등의 작업을 IDE 창 사이의 컨텍스트 스위칭 (context-switching) 없이 수행할 수 있습니다. 이번 달부터 엔터프라이즈 (Enterprise) 고객을 대상으로 출시되는 자율 에이전트 모드 (Autonomous Agent Mode)를 사용하면, Copilot이 단계별 인간의 확인 없이도 전체 기능 브랜치를 작성, 테스트 및 커밋할 수 있습니다. 인간은 최종 검토 및 병합 (review-and-merge) 단계에서만 개입하며, 이 단계는 어떤 코드라도 메인 (main) 브랜치에 도달하기 전에 반드시 거쳐야 하는 필수 과정으로 유지됩니다.
GitHub 자체의 프레임워크 (framing)는 이를 명확하게 설명합니다. 즉, 2027년 소프트웨어 엔지니어의 주요 활동은 코드를 직접 작성하는 것이 아니라, 에이전트가 수행한 작업을 검토하고 승인하는 것이 될 것이라는 베팅입니다. 샌드박싱 (Sandboxing)은 이에 대한 안전책입니다. 두 모드 모두 로컬 또는 GitHub Actions 샌드박스에서 실행되어, 에이전트의 오류가 커밋되어 프로덕션 (production)에 영향을 미치기 전에 그 피해 범위 (blast radius)를 제한합니다. 독립적인 리뷰어들이 지적한 미해결 과제는 리포지토리 컨텍스트 (repository context)를 통한 프롬프트 인젝션 (prompt-injection) 방어입니다. 이는 프로덕션 브랜치에 커밋하는 자율 코딩 에이전트를 겨냥한 주요 알려진 공격 벡터 (attack vector)입니다.
— GitHub · Microsoft
🔗 GitHub Blog · TechFastForward Analysis · Microsoft Build
xAI, 8월 중 Grok 4.6 및 2.1T 파라미터 규모의 Grok 4.7 출시 예정
Elon Musk는 7월 28일, xAI가 8월 7일경 Grok 4.6을 출시할 계획이라고 밝혔습니다. Grok 4.6은 지도 미세 조정 (Supervised Fine-tuning, SFT) 및 강화학습 (Reinforcement Learning, RL)이 대폭 개선된 1.5조 파라미터 규모의 모델이며, 그로부터 몇 주 뒤에는 더 큰 규모인 2.1조 파라미터 시스템인 Grok 4.7이 출시될 예정입니다. 이는 현재의 1.5T V9 파운데이션 모델 (Foundation Model) 대비 규모가 33% 이상 급증한 것이며, xAI가 Grok 4.5에서 Grok 4.7로 약 6주 만에 넘어가는 것을 의미합니다. 이는 전통적인 프론티어 연구소 (Frontier-lab)의 출시 일정보다 훨씬 빠른 메이저 버전 출시 주기입니다. xAI는 12월까지 매달 새로운 파운데이션 모델을 출시하는 것을 목표로 하고 있습니다.
이러한 배경에는 xAI가 지난 5월부터 퍼블릭 베타로 운영 중인 터미널 네이티브 코딩 에이전트(Terminal-native coding agent)인 Grok Build를 중심으로 구축한 일일 반복 엔진 (Daily-iteration engine)이 있습니다. Musk는 7월 8일, Grok Build와 V9 모델이 사용자 피드백을 바탕으로 매일 개선될 것이라고 발표했습니다. grok-build-0.1의 가격은 입력/출력 토큰 100만 개당 1달러/2달러로 책정되었으며, 초당 100개 이상의 토큰을 제공합니다. 현재 출시된 Grok 4.5는 Cursor의 코딩 플랫폼으로부터 얻은 보조 데이터로 학습되었으며, 최대 200,000개의 NVIDIA H100 GPU로 확장된 멤피스의 Colossus 클러스터에서 구축되었습니다.
모델 시장의 경제성을 지켜보는 이들에게 핵심은 바로 이 속도입니다. 매달 모델을 찍어내는 '모델 공장 (Model factory)'은 '프론티어 출시 (Frontier release)'의 의미를 변화시키며, xAI의 공격적인 토큰 가격 책정은 AI 툴링 (AI tooling) 섹터 전반의 마진을 계속해서 압박하고 있습니다. 솔직한 주의 사항을 덧붙이자면, "초기 학습 완료"는 초기 이정표일 뿐이며, 이 정도 규모의 모델은 공개 출시 전에 사후 학습 정렬 (Post-training alignment) 및 레드팀 테스트 (Red-teaming) 과정을 거쳐야 합니다. 따라서 8월은 목표일이며 보장된 날짜는 아닙니다. 그럼에도 불구하고, 6개월 동안 6개의 파운데이션 모델을 선보이는 이 주기 자체는 모델 개발이 일련의 고립된 출시가 아니라 연속적인 시퀀스라는 것에 대한 베팅입니다.
— xAI · Elon Musk
🔗 xAI · Aistify — Grok 4.6/4.7 Timeline · The Buildout — Colossus
Kimi K3 논문, 델타 어텐션 (Delta Attention)을 통한 3T 파라미터 오픈 모델로의 경로 제시
Kimi 팀은 8월 2일, 오픈 에코시스템(open-ecosystem)의 "이중 단절(double disconnect)" 문제, 즉 사전 학습(pretraining) 규모가 1T 파라미터 미만에 머물러 있는 점과 백만 토큰 컨텍스트(million-token contexts)에서의 어텐션(attention)에 따른 연산량 및 메모리의 이차적(quadratic) 증가 문제를 정면으로 다룬 Kimi K3 기술 논문(arXiv:2607.24653)을 공개했습니다. 이 논문의 핵심 통찰은 긴 텍스트 처리를 효율적인 순환(recurrence)과 선택적 검색(selective retrieval)의 하이브리드로 재정의한 것입니다. Kimi Delta Attention (KDA)은 중복되는 KV 캐시(KV caches)를 선형 복잡도(linear-complexity)의 상태 업데이트로 대체하며, 어텐션 잔차(Attention Residuals)는 계층 간 검색(cross-layer retrieval)을 가능하게 합니다. 이를 통해 모델은 104B 파라미터를 활성화하면서도 2.5배의 효율성 이득을 얻는 동시에, 백만 토큰 규모에서 네이티브 멀티모달 정렬(native multimodal alignment)을 달성합니다.
이 아키텍처는 매우 긴 체인(chains)에서 추론 깊이와 에이전트 실행(agentic execution)을 제한하는 하드웨어 효율성 병목 현상을 직접적으로 겨냥합니다. 논문은 에이전트 강화학습 (Agentic Reinforcement Learning, Agentic RL)을 모델 진화의 핵심 동력으로 설정합니다. 이는 프런티어 규모(frontier-scale)의 모델이 정적인 코퍼스(static corpora)가 아닌, 자체적인 작업 실행 루프(task execution loops)로부터 학습할 수 있게 하는 메커니즘입니다.
이 논문의 의의는 에코시스템 차원에 있습니다. KDA는 3T급 MoE 모델이 오픈 환경에서도 실현 가능하다는 증거를 제시하며, 오픈 웨이트(open-weight) 경쟁이 폐쇄형 연구소(closed labs)에 맞서 경쟁력을 유지할 수 있도록 합니다. 논문에 따르면 솔직한 잔여 격차는 HLE와 같은 최상위 과학적 추론 벤치마크에서 나타나는데, 오픈 모델은 여전히 GPT-5.6 Sol과 같은 폐쇄형 플래그십 모델에 뒤처져 있습니다. 하지만 그 격차는 좁혀지고 있으며, 어텐션 효율성(attention-efficiency) 플레이북은 논문이 발표되는 즉시 에코시스템 전체에 복리로 작용할 수 있는 바로 그러한 알고리즘적 진보입니다.
— Kimi 팀 · arXiv
🔗 Kimi K3 on arXiv · Moonshot AI · Paper Discussion
T-Rex, 로봇의 손에 실시간 촉각 지능을 부여하다 — 일급 신호(First-Class Signal)로서의 촉각
UC Berkeley, Stanford, NVIDIA의 다기관 팀(Fei-Fei Li, Jim Fan, Yuke Zhu 주도)은 T-Rex: Tactile-Reactive Dexterous Manipulation (arXiv:2606.17055)을 발표했습니다. 이 프레임워크는 촉각을 단순한 추가 센서 채널이 아닌 독립적인 제어 루프(control loop)로 취급합니다. 연구를 이끈 동기 부여가 된 발견은 직관에 반하는 것이었습니다. π0.5와 같은 사전 학습된 VLA (Vision-Language-Action) 모델을 촉각 신호에 단순히 조건화(conditioning)하면 오히려 성능이 저하된다는 점입니다. 시각(Vision)은 낮은 빈도로 한 번의 훑어봄을 통해 계획을 세우는 반면, 촉각 신호는 초당 수백 번의 미세 조정(micro-adjustments)을 통해 들어옵니다. 이 둘을 단순히 결합하면 타이밍 불일치(timing mismatch)가 발생하여 정책(policy)을 혼란스럽게 만듭니다.
T-Rex의 구성 요소는 세 부분으로 나뉩니다: 첫째, 두 개의 고정밀 데스처러스 핸드(dexterous hands)를 사용하여 200개 이상의 일상적인 물체와 22가지 접촉 프리미티브(contact primitives: 탭, 회전, 삽입, 꼬집기, 미끄러지기)를 통해 기록된 100시간 분량의 "촉각 백과사전(tactile encyclopedia)"; 둘째, 고주파 힘/토크(force/torque) 스트림을 수백 개의 이산적인 촉각 토큰(tactile tokens)으로 압축하는 시공간적 촉각 VQ-VAE (spatio-temporal tactile VQ-VAE)입니다. 이는 본질적으로 정책에 순수하게 반응적인 촉각이 아닌 예측 가능한 촉각을 제공하는 "촉각 이모지 사전(tactile emoji dictionary)" 역할을 합니다; 셋째, 세 개의 비동기 전문가(asynchronous experts)를 갖춘 Mixture-of-Transformers입니다. 여기에는 시각적 미래 예측을 위한 잠재 전문가(latent expert), 저주파 액션 디노이징(action denoising)을 위한 액션 전문가(action expert), 그리고 매 접촉 이벤트마다 무거운 시각 백본(vision backbone)을 다시 실행하지 않고도 캐시된 시각-언어 컨텍스트를 재사용하여 고주파로 국부적인 액션을 정교화하는 촉각 전문가(tactile expert)가 포함됩니다.
결과는 이전의 최첨단 (state of the art) 기술을 거의 두 배 가까이 뛰어넘었습니다. 접촉 밀도가 높은 12가지 작업에서 가장 강력한 베이스라인 (baseline)인 EgoScale의 35% 성공률과 대비하여 평균 65%의 성공률을 기록했으며, 책장 넘기기에서는 96%를 달성했고, 시각 전용 (vision-only) 모델들의 전형적인 실패 사례였던 컵 쌓기 해제 및 달걀 다루기에서도 강력한 성능을 보였습니다. 학습은 분리되어 진행됩니다. 먼저 대규모 인간 1인칭 시점 (egocentric) 비디오를 통해 광범위한 시각-운동 사전 지식 (visual-motor priors)을 제공한 다음, 100시간의 촉각 원형 (tactile-primitives) 데이터를 전용 중간 학습 (mid-training) 단계에서 주입하여 촉각 지능을 부여함으로써 촉각 규모 데이터의 만성적인 부족 문제를 우회합니다. 20자유도 (20-DoF) 촉각 핸드를 출하하는 휴머노이드 산업에 있어, 이는 장치의 모든 센서를 마침내 활용하는 정책 백본 (policy backbone)이 될 것입니다.
— Stanford · UC Berkeley · NVIDIA
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기