AI Daily Digest — 2026년 8월 1일: ARC-AGI-3 Harness Discovery, EU AI Gigafactories
요약
OpenAI가 ARC-AGI-3 벤치마크에서 모델 성능을 극대화하는 두 가지 Harness 설정법을 공개했습니다. 또한, EU가 AI 컴퓨팅 인프라 확충을 위해 100억 유로 규모의 AI 기가팩토리 구축 입찰을 시작했다는 소식을 전합니다.
핵심 포인트
- OpenAI, ARC-AGI-3 점수를 3배 높이는 추론 유지 및 컨텍스트 압축 설정 공개
- 벤치마크 성능은 모델뿐만 아니라 Harness와 설정의 조합에 따라 결정됨
- EU, 총 300억 유로 규모의 AI 기가팩토리 구축 프로젝트 입찰 시작
- AMD, NVIDIA, Qualcomm 등 주요 하드웨어 기업과 협력 추진
🤖💻 AI Daily Digest — 2026년 8월 1일
OpenAI, 두 가지 Harness 설정이 ARC-AGI-3 점수를 세 배로 높이는 방법 공개
OpenAI는 7월 29일, 에이전트가 익숙하지 않은 2D 퍼즐 게임을 탐색하고 시행착오를 통해 규칙을 추론하는 벤치마크인 ARC-AGI-3에서 GPT-5.6 Sol이 왜 약세를 보였는지 설명하는 드문 기술적 심층 분석(technical deep-dive)을 발표했습니다. 공식 평가 Harness (harness)를 사용했을 때, Sol은 단 7.8%의 점수를 기록했으며, GPT-5.5는 거의 플레이조차 할 수 없었습니다 (0.4%). 팀은 문제가 모델이 아니라 Harness (harness)에 있다는 것을 발견했습니다. 모든 게임 액션 이후에 모든 비공개 추론(private reasoning)이 폐기되었고, 히스토리가 늘어남에 따라 순환 절단 창(rolling truncation window)이 이전 액션들을 삭제했기 때문입니다. Sol은 사실상 매 움직임마다 각 게임을 매번 새로 파악해야 하는 상황이었습니다.
두 가지 Responses API 설정인 추론 유지(retained reasoning)와 컨텍스트 압축(context compaction)을 활성화함으로써, 출력 토큰을 약 6배 줄이면서도 공개 태스크 세트에서의 점수를 13.3%에서 38.3%로 세 배 높였습니다. 해당 Harness (harness)를 사용하면 GPT-5.6 Sol은 벤치마크의 6개 레벨을 모두 해결하지만, 공식 리더보드에서는 어떤 프론티어 모델(frontier model)도 첫 번째 레벨 이상의 레벨을 해결하지 못합니다. 인간 테스터들은 이 벤치마크가 사용하는 RHAE 지표에서 평균 약 48%를 기록합니다.
이 발견은 벤치마크 리더보드를 어떻게 읽어야 하는지에 대한 관점을 재정립합니다. 리더보드는 모델 단독이 아니라 모델 × Harness (harness) × 설정(settings)을 측정하는 것입니다. 장기 실행 에이전트(long-running agents)를 구축하는 누구에게나 교훈은 명확합니다. 만약 당신의 Harness (harness)가 도구 호출(tool calls) 사이의 사고 사슬(chain-of-thought)을 버린다면, 당신은 모델을 측정하는 것이 아니라 기억상실증에 걸린 모델을 측정하고 있는 것입니다.
— OpenAI · ARC Prize
🔗 OpenAI Blog — ARC-AGI-3 · ARC Prize · ARC-AGI-3 Games
EU, 7개의 AI Gigafactories를 위한 100억 유로 규모 입찰 시작
유럽 위원회(European Commission)는 7월 30일, EU 전역에 최대 7개의 AI 기가팩토리(AI gigafactories)를 구축하기 위한 공식 입찰 공고를 시작했습니다. 이 프로젝트는 EU 및 국가 공공 자금 100억 유로의 지원을 받으며, 민간 자본이 포함될 경우 총 목표액은 300억 유로 이상입니다. 이 이니셔티브는 EuroHPC 공동 사업(EuroHPC Joint Undertaking)을 통해 운영됩니다. 4개의 소규모 시설(각 최소 75,000개의 AI 칩 규모)은 최대 5억 유로까지 지원받을 수 있으며, 3개의 대규모 기가팩토리(각 최소 100,000개의 칩 규모)는 두 단계의 개발 과정을 거쳐 최대 10억 유로를 지원받을 수 있습니다.
각 기가팩토리는 유럽의 현재 최대 AI 데이터 센터보다 약 4배 더 많은 컴퓨팅(compute) 능력을 갖추어야 합니다. 위원회는 선정된 컨소시엄(consortia)의 하드웨어 접근성을 완화하기 위해 AMD, NVIDIA, Qualcomm과 의향서(letters of intent)를 체결했습니다. 입찰은 11월 12일에 마감되며, 선정 결과는 2027년 초에 발표될 예정이고, 건설은 같은 해에 시작될 계획입니다. 앞서 진행된 비구속적 의향서 제출(call for expressions of interest) 단계에서는 16개 회원국의 60개 사이트를 아우르는 76건의 제출이 있었으며, 이는 브뤼셀(Brussels) 측의 예상치를 훨씬 상회하는 수치였습니다.
이는 AI 컴퓨팅이 전력망이나 광대역 통신망과 동등한 핵심 인프라(critical infrastructure)라는 유럽의 가장 명시적인 선언입니다. 이는 미국 클라우드 및 칩 공급업체에 대한 의존도를 낮추기 위한 지난 6월의 법안 초안에 이어, 미국과 중국의 컴퓨팅에 대한 의존도에 직접적으로 대응하는 조치입니다. EU 이외의 엔티티(entities)는 기가팩토리 컨소시엄에 참여할 수 없으며, 과반수 소유주는 반드시 유럽 기업이어야 합니다.
— 유럽 위원회(European Commission) · Sifted
🔗 EC AI Gigafactories Call · ITPro Coverage · Brussels Signal
Cognition의 7월 공세: SWE-1.7, Security Swarm, 그리고 연방 차원의 추진
Cognition은 7월 한 달 동안 그 어떤 AI 연구소보다도 밀도 높은 제품 출시를 선보였습니다. 7월 8일, Cognition은 Kimi K2.7 베이스 모델을 강화학습 (Reinforcement Learning)을 통해 학습시킨 자체 프론티어 코딩 모델인 SWE-1.7을 출시했습니다. 여기에는 네 가지 주목할 만한 혁신이 포함되어 있습니다: 긴 강화학습 (RL) 실행을 안정화하기 위한 엔트로피 보존형 top-p 샘플링 (entropy-preserving top-p sampling), 결함 허용 (fault tolerance) 기능을 갖추고 3개 대륙에 걸쳐 진행된 멀티 클러스터 학습 (multi-cluster training), 자동 실행 테스트를 통해 작업을 필터링하는 데이터 품질 파이프라인 (data-quality pipeline), 그리고 모델이 자신의 작업 상태를 요약하여 원시 컨텍스트 창 (raw context window)을 넘어 작업 범위를 확장할 수 있게 하는 셀프 컴팩션 (self-compaction)입니다. SWE-1.7은 FrontierCode 1.1 Main에서 42.3%, Terminal-Bench 2.1에서 81.5%, SWE-Bench Multilingual에서 77.8%를 기록했으며, Cerebras를 통해 초당 약 1,000 토큰의 속도로 제공되며 Devin Pro 내에서 무료로 사용할 수 있습니다.
모델 출시와 더불어, Cognition은 Devin Security Swarm (7월 1일)을 출시했습니다. 이는 여러 에이전트가 서로 다른 코드 영역을 조사하고 파일 간의 추론을 통해 다단계 공격 체인을 찾아내는 에이전트 기반의 MapReduce 접근 방식입니다. 이 방식은 50개의 CVE 테스트 세트에서 실행당 90.23달러의 비용으로 실제 취약점의 72%를 발견했습니다. 또한, 회사는 FedRAMP High In-Process 상태를 달성했으며 (7월 13일), 미국 에너지부 (US Department of Energy)와 Genesis Mission에 참여하기 위한 양해각서 (MOU)를 체결하여 연방 시장을 겨냥한 자율 소프트웨어 엔지니어링의 입지를 다졌습니다. TierZero 인수 (7월 20일)를 통해 Devin의 영역을 사고 탐지 및 시스템 신뢰성 분야로 확장했습니다. Cognition은 현재 자사 코드의 90% 이상이 Devin에 의해 작성되고 있다고 밝혔습니다.
5월에 260억 달러의 기업 가치로 10억 달러 이상의 투자금을 유치하고, 연간 매출이 12개월 만에 3,700만 달러에서 4억 9,200만 달러로 급증한 가운데, Cognition의 전략은 승리하는 스택이 단일 모델이 아니라 '모델 + 에이전트 하네스 (agent harness) + 컴플라이언스 (compliance)'라는 것입니다. 회사의 내부 Fusion 아키텍처 연구에 따르면, Claude Fable 5가 리드 오케스트레이터 (lead orchestrator)로서 Opus 4.8을 능가하며 (FrontierCode 1.1 기준 60.7 대 54.6), 실행당 비용도 더 낮았습니다. 이는 오케스트레이션 설계가 원시 모델 성능만큼이나 점점 더 중요해지고 있다는 증거입니다.
— Cognition · 미국 에너지부 (US Department of Energy)
🔗 SWE-1.7 Announcement · FedRAMP High · DOE Genesis Mission
Figure 03가 BMW에 도착하다: 물리적 AI (Physical AI)가 시퀀싱 (Sequencing) 단계로 이동
Figure는 자사의 최신 휴머노이드(humanoid)인 Figure 03가 BMW 그룹 스파르탄버그(Spartanburg) 공장의 조립 및 물류 홀인 Hall 52에 도착했다고 발표했습니다. 이는 Figure 02가 수행했던 판금 픽 앤 플레이스 (pick-and-place, 2025년에 30,000대의 차량 조립을 지원함) 단계에서 시퀀싱 (sequencing) 활용 사례로 전환되었음을 의미합니다. 즉, 분류되지 않은 얇은 벽 형태의 부품들을 빈(bin)에서 집어 올려 조립 라인으로 향하는 카트에 정확한 순서대로 배치하는 작업입니다.
이 새로운 역량은 Figure의 픽셀 투 액션 (pixels-to-actions) 시각-언어-행동 (vision-language-action) 모델인 Helix 02에 의해 구동됩니다. 이 모델은 단일 네트워크 내에서 손, 팔, 몸통, 발을 조정하여, 부품을 잡으면서 동시에 이동하거나 캐스터 바퀴가 달린 무거운 카트를 끌기 위해 위치를 재조정하는 것과 같은 이동 조작 (loco-manipulation)을 가능하게 합니다. 하드웨어 업그레이드에는 손바닥 카메라와 촉각 센서, 음성 대 음성 (speech-to-speech) 상호작용을 위한 엔드 투 엔드 (end-to-end) 오디오, 지속적인 가동 시간을 위한 무선 충전, 그리고 인간과 로봇의 안전한 공존을 위한 소프트 컴포넌트 (soft components)가 포함됩니다. Figure 03의 무게는 61kg이며, 20kg의 페이로드 (payload)를 운반할 수 있고, 1회 충전 시 약 5시간 동안 작동하며, 최대 1.2m/s의 속도로 이동합니다.
시퀀싱 (sequencing)은 더 어려운 테스트입니다. 부품들이 수학적으로 완벽한 방향으로 도착하지 않기 때문에, 모든 상호작용에는 실시간 인지 (on-the-fly perception) 및 교정이 필요하며, 조작 (manipulation)이 이동 (locomotion)과 결합되어야 합니다. BMW는 이 휴머노이드를 고도로 디지털화된 공장인 iFACTORY, AIQX 품질 시스템, 그리고 가상 공장(virtual factory)으로부터 모든 컨텍스트 (context)를 제공받는 모바일 엣지 클라이언트 (mobile edge client)로 취급하고 있습니다. 또한 BMW는 멀티 벤더 (multi-vendor) 전략을 실행하며, 라이프치히(Leipzig)에서 Hexagon의 AEON 휴머노이드를 테스트하는 동시에 생산 분야의 물리적 AI (Physical AI)를 위한 새로운 역량 센터 (Center of Competence)를 운영하고 있습니다. 신호는 명확합니다. 물리적 AI (physical AI)가 단순한 시연 단계를 넘어 실제 제조 물류의 병목 작업 (bottleneck tasks) 단계로 이동하고 있습니다.
— Figure AI · BMW Group
🔗 BMW의 Figure F.03 · BMW 물류 관련 보도 · Figure AI
UniClawBench: 실제 환경 벤치마크에서 최첨단 모델조차 대부분의 작업에 실패함을 입증
HKU(홍콩대학교) Multimedia Lab과 Meituan의 연구진은 UniClawBench (arXiv:2607.08768)를 발표했습니다. 이 벤치마크는 샌드박스(sandboxed) 형태의 미러 사이트나 미리 구축된 웹사이트 복제본 대신, 실제 Docker 환경 내에서 AI 어시스턴트를 테스트합니다. 즉, 실제 브라우저, 실제 소프트웨어, 실제 파일을 사용합니다. 결과는 냉혹합니다. 가장 강력한 폐쇄형 모델(closed-source models)조차 작업 성공률이 50% 미만에 그쳤습니다.
더욱 놀라운 발견은 모델의 선택보다 프레임워크(framework)의 선택이 성능에 더 큰 영향을 미친다는 점입니다. 동일한 모델을 서로 다른 에이전트 쉘(agent shells)로 감싸는 것이 모델 자체를 완전히 교체하는 것보다 결과에 더 큰 변화를 줍니다. 이 벤치마크는 항공권 가격 확인, 파일 정리, 비디오 콘텐츠 해석 등 인간에게는 사소하지만, 에이전트가 실제 소프트웨어를 작동시켜야 할 때 얼마나 자주 실패하는지를 드러내는 일상적인 어시스턴트 작업들을 다룹니다.
UniClawBench는 실무자들이 의심해 온 사실을 검증합니다. 즉, 샌드박스 평가(sandbox evaluations)는 에이전트의 능력을 체계적으로 과장한다는 것입니다. 실제 환경은 정형화된 테스트 미러가 재현할 수 없는 비결정성(non-determinism), 깨진 페이지, 예상치 못한 상태(unexpected states)를 추가하기 때문입니다. 에이전트가 실제 운영 환경(production)으로 이동함에 따라, 실제 환경 평가(real-environment evaluation)는 배포의 결정적인 제약 조건이 될 것이며, "모델 대 쉘(model vs. shell)" 문제는 시스템 설계의 핵심이 될 것입니다.
— HKU Multimedia Lab · Meituan · arXiv
🔗 UniClawBench 논문 · TechWalker 보도
LLM-as-a-Verifier: 검증 스케일링(Verification Scaling)이 네 번째 축으로 부상
Stanford × Berkeley × NVIDIA Research 팀은 LLM-as-a-Verifier (arXiv:2607.05391)를 발표하며, 사전 학습 (pretraining), 사후 학습 (post-training), 테스트 시간 연산 (test-time compute)과 더불어 검증 스케일링 (verification scaling)을 역량 성장의 네 번째 축으로 제안했습니다. 이 방법론은 판사 모델 (judge model)에게 1~5점 사이의 거친 점수를 요청하는 대신, 점수 매기기 토큰 (scoring tokens)의 로짓 분포 (logit distribution)에 대한 기댓값을 취하여 연속적인 점수를 생성하며, 검증 연산 (verification compute)을 세 가지 축인 세분성 (granularity), 반복 평가 (repeated evaluation), 기준 분해 (criterion decomposition)를 따라 확장합니다.
결과는 네 가지 영역에서 SOTA (State-of-the-Art)를 기록했습니다: Terminal-Bench V2에서 86.5%, SWE-Bench Verified에서 78.2%, RoboRewardBench에서 87.4%, 그리고 MedAgentBench에서 73.3%를 달성했습니다. 또한 이 검증기 (verifier)는 에이전트의 진행 상태 표시줄 (agent progress bar) 역할을 수행하여 실행 중간에 완료 여부를 추적할 수 있으며, 가중치를 재학습하거나 보상 모델 (reward model)을 별도로 학습시키지 않고도 강화학습 (reinforcement learning)을 위한 조밀한 보상 신호 (dense reward signal)로 작동합니다.
생성 측면의 스케일링 법칙 (scaling laws)은 잘 정립되어 있지만, 검증 (verification)은 소외되었던 네 번째 축이었습니다. 에이전트 추적 (agent traces)이 길어지고 비용이 증가함에 따라, 적절한 궤적 (trajectory)을 선택하는 것은 이를 생성하는 것만큼이나 중요해졌습니다. 이는 팀들이 코딩, 로보틱스, 의료 애플리케이션 전반에서 재학습 없이도 에이전트의 신뢰성을 높일 수 있는 경로를 제공합니다.
— Stanford · NVIDIA Research · arXiv
🔗 LLM-as-a-Verifier Paper · GitHub · Project Site
词元无限 (CiYuan Infinite): 1년 만에 세 차례 펀딩 완료, InfCode가 SWE-Bench에서 GPT-5를 능가하다
베이징에 본사를 둔 기업용 AI 에이전트 인프라 스타트업 词元无限 (CiYuan Infinite)는 7월 27일 临芯投资 (Linxin Capital)이 주도하고 华控基金 (Huakong Fund)가 참여한 엔젤++ (angel++) 라운드를 발표했습니다. 이는 2025년 7월 설립 이후 1년 만에 세 번째 라운드이며, 총 투자액은 수억 위안(RMB)에 달합니다. CEO Yang Ping은 이전에 ByteDance에서 AI 기술 부문을 이끌었으며 회사의 첫 번째 소프트웨어 엔지니어링 연구소를 설립한 바 있습니다. 그녀의 멀티 에이전트 테스트 시스템은 ByteDance의 핵심 제품 라인 전반에 적용되었습니다.
이 스타트업의 코딩 에이전트인 InfCode는 2025년 12월 Multi-SWE-bench의 Java 리더보드 1위를 차지했으며, SWE-Bench Verified에서 79.4%의 Pass@1 점수를 기록했습니다. 이는 동일한 평가에서 GPT-5 및 Claude를 앞선 성적입니다. 일반 소비자용 코딩 어시스턴트와 달리, InfCode는 방대한 레거시 코드베이스 (legacy codebases) 이해, 보안 감사 (security audits) 통과, CI 파이프라인 (CI pipelines) 내 임베딩 등 프로덕션 등급의 엔터프라이즈 시스템을 목표로 하며, 계약 규모는 수천만 위안(RMB)에 달합니다. 이 회사는 중국 최초의 완전 자율형, 고보안, 자기 진화형 엔터프라이즈 AI 에이전트 인프라 플랫폼을 구축할 계획입니다.
간격이 점점 짧아지는 1년 내 세 차례의 펀딩 주기(funding cadence)는, C-end(소비자 대상) Cursor 스타일의 도구와는 다른 시장인 중국의 엔터프라이즈 AI 코딩 분야에 자본이 유입되고 있음을 시사합니다. 이들의 베팅은 엔터프라이즈 AI 에이전트가 구독 가격이 아닌, 통합의 깊이와 감사 가능성 (auditability)을 통해 승리할 것이라는 점에 있습니다.
— 词元无限 · 钛媒体
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기