AI Daily Digest, 2026년 10월 10일: Microsoft-Decision-1, Claude 대시보드, Arena 가치 31억
요약
Microsoft가 오직 선택과 확률 부여에 특화된 Decision-1 모델을 출시했습니다. 이 모델은 Alibaba의 Qwen3.5-9B를 기반으로 하며, 빠르고 안정적인 성능을 보여줍니다. 또한 Anthropic이 Claude를 BI/모션 도구로 전환하고, Arena 가치가 급등하는 등 다양한 AI 산업 동향을 다루고 있습니다.
핵심 포인트
- Microsoft Decision-1: 고정 옵션 중 선택 및 확률 부여에 특화된 모델 출시.
- Decision-1은 GPT-6 Sol 대비 35배 빠르고 Xbox 피드백 분류에서 비용 효율적임.
- Anthropic Claude는 BI/모션 도구로 활용 범위가 확장되고 있음.
- AI 에이전트 워크플로우의 지연 시간(latency) 문제가 핵심 병목으로 부각됨.
KD Agentic · AI Daily Digest, 2026년 10월 10일. 오늘 일곱 가지 소식이 있습니다: Microsoft가 전용 의사결정 모델을 출시하고, Anthropic이 Claude를 BI 및 모션 도구로 전환하며, JetBrains가 오픈 코딩 모델을 업그레이드하고, Kodiak이 미국에서 가장 바쁜 국경 통과 지점에 자율주행 트럭을 배치하며, Arena의 가치가 10개월 만에 거의 두 배가 되고, TypeSafe가 올해 최대 규모의 Series A 라운드를 마감했으며, Google은 무료 Gemini 사용자들을 단일 모델로 축소했습니다.
1. 선택만 하는 모델, Decision-1을 출시한 Microsoft
Microsoft CEO Satya Nadella는 금요일에 새로운 모델인 Microsoft-Decision-1을 발표했습니다. 이 모델은 오직 한 가지 기능만을 수행합니다: 주어진 고정된 옵션 세트에서 하나를 선택하고 그 선택에 보정된 확률을 부여하는 것입니다. Alibaba의 오픈 소스 Qwen3.5-9B를 기반으로 후처리(post-trained)되었으며, 단일 패스로 실행되고, 예/아니오 질문, 객관식, 그리고 AI 답변이나 에이전트 행동 평가를 포함한 루브릭에 따른 점수 부여를 지원합니다. 이 모델은 현재 Microsoft Foundry의 모델 카탈로그에서 라이브이며, OpenRouter 접근이 계획되어 있으며, Microsoft는 향후 버전들이 자체 MAI 모델과 OpenAI 모델로 재훈련될 것이라고 밝혔습니다.
벤치마크 주장들은 공격적이며, Microsoft는 이를 자체 테스트로 명시하는 데 신중합니다. 36개의 벤치마크와 거의 15만 개의 질문에 걸쳐 비교 세트에서 가장 높은 정확도를 보고하며, Quyet-1.0-Large보다 4.5배 빠르고 GPT-6 Sol보다는 약 35배 빠르다고 보고했습니다. 안정성 수치 역시 속도만큼 중요합니다: 요청을 재구성하거나 옵션 순서를 무작위로 섞는 것을 포함한 여덟 가지 종류의 교란(perturbations)에 걸쳐 판결이 평균적으로 단지 1.3%만 변경되었고, 옵션을 무작위로 섞어도 변화가 전혀 없었습니다. 가격은 입력 토큰 백만 개당 $0.042이며 출력은 무료로 제공되어, 지난 한 달 동안 형성된 의사 결정 모델(decision-model) 등급과 같은 범위에 속합니다.
내부 배포 예시는 Microsoft가 가치를 느끼는 지점을 보여줍니다. Xbox 연구팀은 Decision-1을 사용하여 10,000개 이상의 플레이어 피드백 항목을 분류했으며, GPT-6 Sol과 동등한 품질을 유지하면서도 14배 이상 빠르고 약 200배 저렴하게 작동했습니다. 또한 Copilot 팀은 이를 사용해 응답 품질 점수를 비교 가능한 모델보다 약 100배 빠른 속도로 측정합니다. 핵심 주장은 에이전트 워크플로우가 수십 개의 작은 판단(judgments)을 연결하는 과정이며, 단계당 추가 지연 시간이 100밀리초일 경우 20단계 흐름은 순수 대기 시간으로 2초를 소모한다는 것입니다. 라우팅(Routing), 의도 감지(intent detection), 중재(moderation), 레이블링(labeling), 에이전트의 다음 행동 선택 등이 명시된 목표이며, 이 카테고리에는 현재 Microsoft, TypeSafe의 Jev, Liquid AI의 d1, 그리고 OpenAI의 Decisions API가 공개 베타로 존재합니다.
— Microsoft · Satya Nadella · Seeking Alpha
2. Anthropic이 Claude를 BI 대시보드이자 애니메이션 스튜디오로 변모시키다
Anthropic은 목요일에 베타 버전으로 두 가지 새로운 기능을 출시했습니다. Claude Dashboards는 BigQuery, Snowflake, Databricks, Amazon Redshift, ClickHouse, Salesforce를 포함한 회사의 데이터 플랫폼에 연결되어 자연어 질문으로부터 자동으로 업데이트되는 모니터링 보드를 구축합니다. 모든 수치는 클릭하여 기본 쿼리를 검사할 수 있으며, Claude가 숫자가 어떻게 계산되었는지 설명할 수 있고, 각 차트는 데이터가 마지막으로 새로 고침된 시점을 보여줍니다. 이 보드는 Amplitude, Grafana, Hex, Mixpanel, PostHog에 푸시되어 심층 분석이 가능하며, Looker 및 Tableau 지원이 곧 추가될 예정이고, 모든 유료 요금제에서 사용할 수 있습니다.
Claude Motion은 비디오 관련 콘텐츠에 다른 접근 방식을 취합니다. 비디오 생성 모델을 호출하는 대신, Claude는 기존 텍스트, 차트, 도형, 이미지를 짧은 클립으로 애니메이션화하는 코드를 작성합니다. 분기 보고서가 전사원 회의용 30초 설명 영상이 될 수 있으며, 모든 요소가 코드 기반이기 때문에 MP4로 내보내기 전에 각 단어, 숫자, 지속 시간을 편집할 수 있습니다. 대화에서 /motion을 입력하여 사용할 수 있습니다. 이 기능은 현재 Team 및 Enterprise 요금제에 한정되어 있으며, Sora 스타일의 생성기와 실질적인 차이점은 Motion이 영상을 조작하는 것이 아니라 사용자가 이미 가지고 있는 콘텐츠를 제시한다는 점입니다.
출시와 함께 Docs, Slides, Design은 테스트 기간 동안 사용자들이 4,500만 개 이상의 문서, 슬라이드 및 디자인을 생성한 후 베타에서 일반 사용 가능(general availability)으로 전환되었습니다. 이 졸업 배치는 팀원 간의 동시 편집과 Claude와의 공동 작업, 관리자 제어 기능을 갖춘 조직 외부 공유, 레이아웃을 유지하는 PowerPoint 및 PDF 내보내기, 슬라이드를 편집 가능한 Google Slides로 변환, 모바일 편집, 기업용 CMEK 키 관리를 추가합니다. 팀을 위한 정리 사항: claude.ai/design의 독립형 Claude Design 사이트는 12월 14일에 폐쇄되며, 채팅 기록과 프로젝트 댓글은 마이그레이션되지 않습니다.
— Anthropic · IT之家
3. JetBrains, 강화학습(RL)을 통해 Mellum 업그레이드하여 에이전트 코딩 구현
JetBrains는 지난 금요일 오픈 코딩 모델 제품군 중 두 번째 버전인 Mellum 2.1을 출시했으며, 이 모델은 12B mixture-of-experts 아키텍처를 유지하고 활성 파라미터 2.5B와 Apache 2.0 라이선스를 적용했습니다. 주요 변경 사항은 학습 파이프라인에 있습니다. 강화학습(RL)이 짧은 마무리 단계에서 벗어나 포스트 트레이닝의 본체로 이동했으며, 이 과정에서 수학, 경쟁 프로그래밍, 과학, 도구 사용 및 소프트웨어 엔지니어링 전반에 걸쳐 새로운 데이터가 혼합되었습니다.
RL 단계 뒤에 있는 인프라가 더 흥미로운 세부 사항입니다. JetBrains는 자체 강화학습 환경 플랫폼을 구축하여 학습 과정 동안 수천 개의 환경에 걸친 수백만 개의 샌드박스를 구동했으며, 사전에 오픈 데이터셋을 필터링하여 오류 테스트, 검증 불가능한 답변, 그리고 부적절하게 보정된 작업 난이도를 제거했습니다. 그 결과 모델은 코드베이스를 탐색하고, 파일을 편집하며, 자신의 변경 사항을 확인할 수 있게 되었습니다. JetBrains에 따르면 가장 큰 개선점은 에이전트 코딩(agentic coding)에서 나타나며, Mellum 2.1은 실패한 테스트의 근본 원인을 식별하고, 수정안을 작성하며, 그 결과를 검증할 수 있습니다.
성능 면에서는 아키텍처가 Mellum 2와 유사하게 유지되어 속도는 변함이 없으며, 다중 토큰 예측(multi-token prediction) 기능은 단일 요청의 응답 지연 시간을 약 1.6배 감소시켰습니다. 동일한 평가 환경에서 높은 부하에서의 처리량은 Qwen3.5-9B보다 거의 두 배에 근접하며, 코딩, 경쟁 프로그래밍, 수학, 도구 호출 및 일반 지식 전반에 걸쳐 개선을 보였습니다. 이 모델은 로컬 또는 자체 호스팅 배포를 위해 Hugging Face에서 이용 가능하며, llama.cpp, Ollama, LM Studio용 GGUF 빌드와 vLLM 다중 토큰 예측 추측 디코딩(speculative decoding) 컴포넌트가 차후 계획되어 있습니다.
— JetBrains · IT时代网
4. Kodiak이 달라스-라레도 회랑에 자율주행 트럭 도입
Kodiak AI와 국경 간 운송업체인 Charger USA는 지난 10월 8일 공식 발표를 통해, Charger의 텍사스 주 달라스와 라레도 터미널 사이의 435마일 구간에서 자율주행 화물 서비스를 시작한다고 발표했습니다. Kodiak Driver가 장착된 트럭은 소비재 및 식음료 고객을 위한 냉장 및 건화물을 운송하며, 첫 배송은 9월 8일에 이루어졌습니다. 현재는 안전 운전자가 운전석에 탑승하고 있으며, Kodiak이 해당 구간의 안전성 입증(safety case)을 완료한 후에는 무인 운영을 계획하고 있습니다. 이는 미국에서 가장 많은 물동량을 처리하는 상업용 육상 국경 항구인 라레도를 서비스하는 Kodiak의 첫 노선입니다.
이번 노선 선택이 주목할 만합니다. 라레도 항만은 2025년에 3,500억 달러 이상의 국제 무역을 처리했으며, 이는 미국-멕시코 간 전체 무역량의 약 40%에 해당합니다. 이 회랑을 따라 이동하는 소비재 화물은 예측 가능한 운송 시간과 긴 운영 시간이 실제적인 가치를 가지는 정기적인 재고 보충 흐름(retail replenishment flows)을 형성하고 있습니다. Charger의 사장인 Andy Khera는 자체 운송 관리 시스템(transportation management system)과 Kodiak Driver를 결합한 것이 고객에게 용량 연속성(capacity continuity)을 제공하는 거의 완전 자동화된 생태계이며, 동시에 운전자들이 매일 밤 집으로 돌아갈 수 있게 한다고 강조했습니다.
Kodiak은 고객 소유 트럭에 시스템을 배치하는 Driver-as-a-Service 모델을 운영하고 있으며, Permian Basin 지역에서의 무인 상업 서비스는 2024년 12월부터 운전석에 아무도 탑승하지 않은 채 운영되어 왔습니다. 따라서 라레도 노선은 새로운 것을 시범 도입하기보다는 이미 입증된 구성을 확장하는 것입니다. 이 회사의 장거리 자율주행 준비 측정 지표(Autonomy Readiness Measure)는 안전성 입증의 어느 부분이 실질적으로 완료되었는지 추적하며, 9월 말 기준 96%에 도달했습니다. Kodiak은 2026년 말까지 무인 장거리 서비스를 시작할 계획입니다. 또한 Charger는 지난 7월 말 같은 노선에 대해 Aurora와 자율주행 트럭 운송 계약을 체결했으며, 이로 인해 해당 회랑은 두 개의 무인 시스템이 병렬로 운영되는 초기 테스트베드가 되었습니다.
— Kodiak AI · FreightWaves
🔗 Kodiak IR Press Release · FreightWaves
5. Arena, 10개월 만에 가치 31억 달러로 거의 두 배 증가
UC Berkeley의 LMArena 프로젝트에서 시작된 크라우드소싱 AI 리더보드인 Arena는 목요일에 Lightspeed Venture Partners와 Khosla Ventures가 공동 주도하고 Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst 및 기존 투자사 a16z와 Felicis가 참여하는 가운데, 가치 31억 달러(valuation)에서 2억 달러 규모의 Series B 투자를 유치했다고 발표했습니다. 이번 라운드는 1년 전 1억 5천만 달러 규모의 Series A (가치 17억 달러) 이후 10개월 만에 이루어진 것이며, 재평가는 수익을 반영합니다. Arena는 AI 평가(AI Evaluations)라는 유료 분석 제품을 연구소와 기업에 출시한 덕분에 연간 매출이 1월 3천만 달러에서 6월에는 1억 달러로 세 배 증가했습니다.
이러한 시기는 업계가 측정 방식에 대해 생각하는 방식의 변화를 반영합니다. 연구소들은 모델들이 정적인 벤치마크(benchmarks)를 속이는 것에 주목하고 있으며, 기업들은 리더보드 순위를 신뢰하기보다 자체 워크로드에 적합한 모델을 선택하는 데 도움을 원합니다. Arena 자체의 설명은 직설적입니다: AI는 평가할 수 있는 능력보다 빠르게 발전하고 있으며, 모델들이 테스트받고 있다는 것을 인식하면 정적인 테스트는 무너진다는 것입니다. 이 플랫폼은 5개월이 채 안 되는 기간 동안 총 3억 5천만 세션, 텍스트, 비전, 코드, 검색, 비디오, 이미지 전반에 걸쳐 6,200만 표를 기록했으며, 에이전트 평가 제품인 Agent Arena에서는 7백만 세션을 보고했습니다.
이 라운드에서는 Arena를 안전(safety) 비즈니스에 배치하는 새로운 제품군인 Alignment Index가 출시되었습니다. 이 지수는 에이전트가 사람을 대신해 행동할 때 중요해지는 무단 행동, 허위 귀속(false attribution), 기만적 완성(deceptive completion) 등의 실패 모드를 기준으로 모델의 점수를 매깁니다. 예비 수치에 따르면 OpenAI 모델이 상위 5개 자리를 차지했으며, Claude Opus 5.5와 Claude Fable은 각각 6위와 9위에 올랐습니다. Arena는 자신들이 평가하는 생태계로부터 자금을 지원받는 회사라는 점에서 명백한 긴장감이 존재하며, 이제 Arena는 자신이 측정하는 바로 그 연구소들에 판단(judgment)을 인프라로 판매하고 있습니다. 이는 누가 묻느냐에 따라 중립성 문제이거나 혹은 전체 비즈니스 모델일 수 있습니다.
— Arena · TechCrunch
🔗 TechCrunch · Arena
6. TypeSafe, 판단(judgment) 모델 레이어 구축에 8억 7천만 달러 유치
Jev 의사결정 모델의 개발사인 TypeSafe AI는 금요일에 Andreessen Horowitz가 주도하고 Sequoia Capital, 기존 투자사 DCVC, 엔젤 투자자들이 참여했으며 a16z의 Martin Casado가 이사회에 합류한 가운데 75억 달러의 기업 가치로 8억 7천만 달러를 유치했다고 확인했습니다. 이 회사는 자체적으로 특징적인 직설적인 블로그 게시물을 통해 소식을 전하며, 자금 조달 발표는 지루하다고 언급하고 대신 그 돈으로 무엇을 살 수 있는지 나열했습니다. 바로 더 많은 기계 네이티브 모델(machine-native models), 더 많은 인프라, 그리고 고객들이 요청해 온 엔터프라이즈 기능들입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기