AI DAILY — 10월 7일 수요일, BST 기준
요약
Anthropic이 저렴하고 빠른 소형 모델인 Claude Haiku 5.5를 출시했습니다. 이 모델은 분류, 라우팅 등 다양한 에이전트 작업에 최적화되었으며, 기존 대비 비용 효율성이 크게 개선되었습니다. 또한, Sonnet 5.5의 캐시 읽기 비용 절감과 Mythos 5.1의 사이버 검증 프로그램 진입 소식도 전해졌습니다.
핵심 포인트
- Claude Haiku 5.5 출시: 저렴하고 빠른 소형 모델로 에이전트 작업에 최적화됨.
- 비용 효율성 대폭 개선: Haiku 4.5 대비 가격표 기준 90% 절감 효과를 보임.
- 벤치마크 우위 입증: OSWorld, Terminal-Bench 등 여러 테스트에서 경쟁사 모델 대비 높은 성능을 기록함.
- Sonnet 5.5 비용 절감: 캐시 읽기 비용이 절반으로 줄어들어 에이전트 작업 비용 감소에 기여함.
이것은 평범한 수요일이 아니었다. 작은 모델 하나가 컴퓨터 사용 능력에서 작년의 중급 모델을 능가했고, ChatGPT는 답변을 그리기 시작했으며, 유럽은 트릴리언(trillion) 개의 파라미터를 미리 보여주었고, Apple은 LG에게 도어벨 제작을 맡겼다.
Anthropic 🟧
Claude Haiku 5.5가 출시되었다. 가장 저렴하고 빠른 소형 모델이다. 분류(classification), 라우팅(routing), 추출(extraction) 및 서브 에이전트(sub-agents)를 위해 구축되었다. 컨텍스트는 100만 토큰, 출력은 128k 토큰을 지원한다. Model id는 claude-haiku-5-5이다. Claude, Bedrock, Vertex, Foundry에서 사용할 수 있다. 컴퓨터 사용 및 브라우저 사용 기능은 Python 및 TypeScript SDK에서 베타 버전으로 제공된다.
토큰당 가격 (백만 토큰 기준): 100k 미만 / 100k 초과:
• 입력(Input) $0.10 / $0.50
• 출력(Output) $0.50 / $2.50
• 캐시 읽기(Cache reads) $0.01 / $0.05
• 캐시 쓰기(Cache writes) $0.125 / $0.625
Haiku 4.5는 입력 $1, 출력 $5였다. 실행 비용이 약 75% 저렴해졌다. 기존 Haiku 트래픽의 90%를 차지했던 100k 미만 프롬프트 기준으로 가격표가 90% 낮아졌다. 새로운 토크나이저는 동일한 텍스트를 Haiku 4.5보다 약 30% 더 많은 토큰으로 계산하므로, 실제 절감액은 가격표에 적힌 금액보다 약간 적다. 서비스 종료일은 2027년 10월 7일 이전이 아니다.
벤치마크 비교: Haiku 5.5 vs Haiku 4.5 vs GPT-6 Luna vs Sonnet 5.5:
• GDPval-AA v2.1 지식 작업(knowledge work): 1,620 vs 735 vs 1,437 vs 1,840. https://t.co/9frhsjHT4S GLM-5.3-Flash는 1,647로, 중국의 플래시 모델이 여전히 우위를 점한다.
• AA-Briefcase: 1,578 vs 614 vs 1,336 vs 1,824. GLM-5.3-Flash는 1,454로, Haiku가 이 분야에서 승리했다.
• OSWorld 2.1 컴퓨터 사용(computer use), 오프라인: 72.4% vs 15.7% vs 48.9% vs 83.9%.
• Terminal-Bench 4.0: 39.2% vs 0.0% vs 16.4% vs 70.6%.
• FrontierCode 1.1: 46.4% vs 점수 없음(not scored) vs 42.4% vs 52.1% (extra-high).
• 인류의 마지막 시험, 도구 미사용(Humanity’s Last Exam, no tools): 45.9% vs 10.2% vs 목록에 없음(not listed) vs 56.9%. 도구 사용 시: 57.4% vs 18.7% vs 64.5%.
• Chartography, 도구 미사용(Chartography, no tools): 46.4% vs 6.4% vs 29.1% vs 61.6%.
동일한 하락: Sonnet 5.5의 캐시 읽기 비용이 $0.20에서 $0.10으로 절감되었다. Sonnet을 사용하는 대부분의 에이전트 작업은 약 20% 저렴해졌다. Max와 Team 플랜 사용자는 에이전트 구축을 위한 월별 API 크레딧을 받는다.
Mythos 5.1이 Opus 5.5 및 Sonnet 5.5와 함께 3단계 사이버 검증 프로그램에 진입했습니다. 가중치는 동일하지만 제동장치가 다릅니다. 50개 과제 사이버 테스트에서 접근 권한 없음(no access) 상태에서는 첫 번째 프롬프트에서 모든 과제가 차단되었습니다. 디펜스 액세스(Defence Access)의 경우, 50개 중 46개가 차단되고 4개가 완료되었습니다. 레드팀 액세스(Red Team Access)는 차단 없이 50개 중 34개를 수행했으며, 이는 안전장치 해제 시 얻을 수 있는 67.6%와 일치합니다. Mythos 5.1은 $10에 시작하여 $50에 판매됩니다. Claude Security가 이 모델로 구동됩니다. Fable 5.1은 사이버 및 생물학적 제동장치가 활성화된 동일한 모델이며, 이 제동장치는 이제 무해한(benign) 생물학 관련 질문에서 85% 더 적게 작동합니다.
Claude for Google Workspace가 공개 베타에 진입했습니다. Docs, Sheets, Slides 내부에 Claude 사이드바가 추가됩니다. 스타트업을 위한 Claude는 자격 요건이 되는 팀에게 무료로 1년 동안 Claude Team과 $1,000 상당의 API 크레딧을 제공하며, 이는 최대 $45,000 상당의 파트너 스택에 더해지는 것입니다. Claude Code 2.1.292는 생성된 서브 에이전트(sub-agent)가 선택한 노력 수준으로 실행되도록 하여 사이드 에이전트의 비용을 제한할 수 있게 합니다. 또한 마켓플레이스 설치 플래그를 추가하고, 승인된 범위를 벗어나는 파일에 대한 노트북 및 PDF 읽기를 차단합니다.
OpenAI 🟩
GPT-6가 지능형 UI(Intelligent UI)와 함께 모두에게 제공됩니다. 오늘 유료 등급으로 이용 가능하며, 내일부터 무료로 이용할 수 있습니다. 또한 Pro, Business, Enterprise 사용자들은 Chat 탭에서 GPT-6 Sol을 사용할 수 있습니다. 무료 사용자는 GPT-6 Luna를 사용할 수 있습니다. 두 모델 모두 일상적인 채팅에 맞춰 조정되었으며, Astra 컴퓨터 사용 플래그십과는 다릅니다. 이 모델은 대화하는 동안 라이브 인터페이스(live interface)를 컴파일합니다: 버튼, 양식, 차트, 슬라이더, 좌석 배치도, 계산기 등입니다. 드래그할 수 있는 절감액 계산기가 있습니다. 탭하면 녹색으로 비상구 좌석이 표시되는 비행기 좌석 탐색기가 있습니다. 각 부분에 버튼이 있는 슬러그 다이어그램도 있습니다. 시각 자료는 낮출 수 있습니다. 주간 사용자 12억 명, 웹 및 모바일을 위해 구축되었습니다. 네이티브 컴포넌트 라이브러리와 토큰이 도착함에 따라 UI를 스트리밍하는 컴파일러가 포함되어 있습니다.
Decisions API가 gpt-6-luna에서 베타로 제공됩니다. 응답(Responses) API보다 약 10배 빠르며, 예/아니오, 선택지 또는 점수와 같은 유형화된 답변을 제공합니다. 입력은 비용이 발생하고 출력은 무료이며, 입력 토큰당 백만 개에 $0.10가 부과됩니다. Jev는 $0.042입니다. Luna는 이미지도 처리할 수 있습니다. 음성 기능이 위에 추가될 수 있는데, GPT-Live는 계속 말하는 동안 Decisions가 액션을 선택합니다.
미공개 내부 모델에 약 4,000개의 미해결 수학 문제가 주어졌습니다. OpenAI는 GitHub에 722개의 원고를 공개했습니다. 각 3시간 분량의 Pro 컴퓨팅이 소요되었습니다. 많은 증명들은 Lean으로 형식화되었습니다. Altman은 이를 발견의 새로운 시대라고 불렀습니다.
Google 🔴
Nano Banana 2.1이 Gemini 앱, AI Mode, AI Studio, Gemini API, Flow, Stitch, Ads 및 Gemini Enterprise 전반에 걸쳐 배포되고 있습니다. Gemini 3.6 Flash를 기반으로 구축되었습니다. Playground는 Google AI 플랜이나 API 키로 실제로 열어보는 곳입니다. 1K, 2K, 4K이며 기본값은 1K입니다. 최대 14개의 참조 이미지를 담을 수 있습니다. 4명의 캐릭터와 10개의 객체를 포함합니다. 사고 수준(Thinking levels): 최소(minimal), 중간(medium), 높음(high). 기본값은 중간입니다. Google 웹 검색 및 이미지 검색에 기반합니다. 1:4, 4:1, 1:8, 8:1 비율의 넓은 파노라마가 더 이상 2K와 4K에서 타일링되지 않습니다. 텍스트 및 인포그래픽 레이아웃이 다른 수정 사항입니다. 1K 이미지는 $0.0336로, 이전 $0.067보다 낮아졌습니다. 4K 이미지는 $0.0756으로, 이전 $0.151보다 낮아졌습니다. 이는 Nano Banana Pro의 저렴한 형제 모델이며 대체품이 아닙니다.
EmbeddingGemma 2가 출시되었습니다. 7억 4천만 개의 파라미터에 Apache 2.0 라이선스를 따릅니다. 텍스트, 코드, 이미지, 비디오 및 오디오를 하나의 768차원 공간으로 매핑합니다. 기기에서 실행하기에 충분히 작습니다. 채팅보다는 검색을 위해 구축되었습니다.
Google AI Edge가 Mac용 온디바이스 노트 필기 앱인 Foresight를 출시했습니다. 메모는 기기에 보관됩니다.
전력: Constellation과의 20년 계약입니다. 일리노이, 펜실베이니아, 뉴저지의 기존 원자로 11개 업그레이드를 포함하여 총 3,590메가와트이며, 신규 원자로는 890메가와트가 포함됩니다. $43억으로 보고되었습니다.
Apple ⬜
가정용 키트 제작을 위해 LG와 협력합니다. LG가 제품을 만들고 브랜딩하며 지원을 담당하고, Apple은 디자인과 엔지니어링을 담당합니다. FCC 및 UL 신고된 일곱 가지 기기는 다음과 같습니다: 메인 카메라와 아래를 향하는 두 번째 카메라가 있는 LG Video Doorbell Wired, AC/DC 보드 및 Thread 안테나. 플러드라이트 캠(Floodlight cam). 실내 플러그인 캠(Indoor plug-in cam). 실외 플러그인 캠(Outdoor plug-in cam). 스마트 데드볼트(Smart deadbolt). 온도 조절기(Thermostat). 온도 센서(Temperature sensor). Wi-Fi는 2.4GHz 및 5GHz, WPA2 및 WPA3를 지원하며, Bluetooth, Thread, Matter를 지원합니다. 이 잠금장치는 초광대역(ultra-wideband) 기능을 갖추고 있어 걸어 올라올 때 볼트를 당길 수 있습니다. 신고된 내용 중 어느 것에도 Apple이 언급되어 있지 않습니다. 오늘 사진이 유출되었습니다. Apple 자체 허브, 새로운 HomePod mini 및 Apple TV 박스는 10월 13일을 목표로 합니다. LG 장비는 그보다 몇 달 뒤입니다. LG는 규제 기관에 상세 사진을 내년 초까지 기밀로 유지해 줄 것을 요청했습니다.
Mistral 🟣
대형 모델인 Le Chonk은 공개 프리뷰(public preview)를 진행 중입니다. 이 모델은 1.05조 개의 파라미터를 가지며, 그중 약 490억 개가 활성 상태이고, 네이티브 멀티모달(natively multimodal)하며, Mistral의 유럽 데이터 센터에서 약 3,800개에서 4,000개의 Nvidia Grace Blackwell GPU를 사용하여 약 두 달 만에 처음부터 학습되었습니다. Pierre Stock에 따르면 이는 중국 경쟁사들이 유사한 모델에 사용하는 칩 수보다 2~3배 적은 양입니다. 가중치(Weights)는 10월 27일에 공개될 예정입니다. Mistral은 이 모델이 미국이나 유럽에서 구축된 어떤 오픈 모델보다 뛰어나다고 주장합니다. 이로 인해 Hacker News의 상위권을 차지했습니다.
Alibaba 🟠
Apsara에 있는 Eddie Wu가 Qwen 4.5와 Qwen 5를 5조~10조 개의 파라미터 목표치로 설정했습니다. 이는 2.4조 개인 Qwen3.8-Max보다 2배 이상 많은 수치입니다. 이 도약은 Zhenwu V900에 달려 있습니다. 대량 생산은 2027년 1분기까지 시작되지 않습니다. 같은 행사에서 발표된 Qwen 4는 아직 학습되지 않았고 공개 사양이 없습니다. 이는 Alibaba를 DeepSeek, Moonshot, ByteDance가 이미 로드맵에 올린 것과 같은 10조 파라미터급 모델로 만듭니다. 유출된 내용일 뿐, 출시 제품은 아닙니다.
Perplexity 🔷
pplx-embed-v2-late가 Hugging Face에 공개되었습니다. 두 개의 후기 상호작용 임베딩 모델(late-interaction embedding models)인 0.6B와 9B가 있습니다. ColBERT 스타일로, 토큰당 별도의 128차원 벡터를 사용합니다. 공유 공간을 활용하여 9B로 인덱싱된 코퍼스도 0.6B로 검색할 수 있습니다. 이 모델은 18B의 교사(teacher)로부터 토큰별로 증류되었습니다. 46개 언어에 걸쳐 1억 8,600만 개의 질의-문서 쌍(query-document pairs)으로 학습되었습니다. PDF, 슬라이드 및 스캔 이미지는 OCR 없이 이미지 형태로 입력할 수 있어 표와 그림이 유지됩니다. ViDoRe v3는 추가적인 질의 비용 없이 62.3%에서 63.5%로 향상되었습니다. 9B 모델은 발표된 검색 세트(retrieval sets)에서 최대 81.3%의 nDCG@10을 달성했습니다.
xAI ⚫
Grok Bot이 micro1의 PersonalAgentBench에 참여하여 Instinct, Muse, Gemini Spark와 같은 다른 에이전트들과 실제 생활 비서 작업(예: 예약, 이메일 작성, 회의 이동)에서 테스트되었습니다. 능력과 신뢰도는 같지 않았습니다. 에이전트들은 올바른 사실을 찾아내면서도 과도하게 정보를 공유하거나 지어내는 경향을 보였습니다. Opus 5.5가 Grok Bot에 탑재되었다는 확정된 내용은 없습니다. 별도의 47개 작업 대결(head-to-head)에서는 Grok이 Opus 5.5를 24대 17로 앞섰으며 무승부는 2회였습니다.
Hark 🟨
Brett Adcock의 신규 회사인 Hark가 설립된 지 1년도 채 되지 않아 모두에게 Hark Pro를 공개했습니다. 웹, iOS 및 Android에서 무료로 사용할 수 있으며, 사용량에 따라 월 $20(2배 사용) 또는 $100(10배 사용)으로 이용 가능합니다. 이 앱은 최신 모델을 추격하는 연구실이 아니라 컴퓨터 사용 보조 도구입니다. 전체 화면 홈, 제안된 작업 피드, 그리고 미니 대시보드 형태의 패널로 구성되어 있습니다. 배경 예술 작품은 날씨와 시간을 추적합니다. 이 앱은 이메일, 캘린더, 디스크, 카드 정보를 받아 식료품 구매, 차량 예약 또는 스프레드시트 작성을 수행할 수 있습니다. 하드웨어는 2027년을 목표로 합니다. 현재의 앱은 실제 기기가 존재하기 전에 운영체제(operating system)를 제시하는 형태입니다.
Sesame 🟤
이 음성 비서에는 새로운 음성 모델과 각 에이전트 전용 컴퓨터, 그리고 Google 앱 및 MCP에 연결되는 커넥터가 추가되었습니다. 다른 에이전트 박스와 비슷한 구조로, 비서당 독립적인 장치가 하나씩 존재하고 그곳에 도구들이 플러그인 방식으로 연결됩니다.
Microsoft 🟦
GitHub의 스택형 풀 리퀘스트(stacked pull requests) 기능이 일반 사용자에게 제공됩니다. 이달 말까지 Copilot for Windows는 작업에 따라 로컬 또는 클라우드를 선택할 수 있게 됩니다. Surface Laptop Ultra를 포함한 NVIDIA RTX Spark 장치에서는 이것이 로컬 코딩을 의미합니다. 사용되는 로컬 모델은 MAI Code 1.1 Flash로, 이는 코드 혼합 전문가(coding mixture-of-experts)이며 총 1370억 개 파라미터 중 68억 개가 활성화되어 있습니다. 해당 노트북에서 피크 메모리는 256k 컨텍스트 기준으로 75.5GB에 달합니다. 프롬프트 처리 속도는 64k 컨텍스트에서 초당 923.5 토큰, 128k 컨텍스트에서 초당 769.8 토큰을 기록했습니다.
Nvidia 💚
AI 공장용 적격 부품 목록(qualified-parts list)인 DSX Ready에 냉각수 카테고리가 추가되었습니다. 새로운 파트너들은 액체 냉각 사양을 충족해야 하므로, 빌더들이 추측할 필요 없이 CDU와 유체를 선택할 수 있게 되었습니다. 이 플랫폼 자체의 주장은 45°C에서 적격 액체 루프를 사용하면 동일 건물에 최대 40% 더 많은 GPU를 배치할 수 있으며, 사이트가 이를 염두에 두고 설계될 경우 와트당 성능이 1.3배에서 1.5배까지 향상된다는 것입니다.
또한 🟡로 이동합니다
Moonshot은 기업 가치 500억 달러 규모의 투자 유치 라운드를 마감하며, 이는 여름철 315억 달러 대비 상승한 수치입니다. Moonshot은 Bank of America와 함께 2027년 초까지 홍콩 IPO를 준비하고 있으며, 이를 통해 50억 달러를 모금할 계획입니다. 삼성전자는 AI 메모리 덕분에 3분기 영업이익을 106조 1천억 원(약 790억 달러)으로 예상하며, 이는 전년 대비 거의 9배에 달합니다. 새로운 슈퍼 PAC인 Guardrails Alliance는 AI를 기반으로 하는 중간선거 후보자들을 저지하는 데 120만 달러를 투입하고 있습니다. AI 스타트업들은 2026년에 다른 195개 AI 기업을 인수했습니다. OpenAI 단독으로도 10건의 인수를 진행했습니다.
저렴한 모델은 컴퓨터를 사용할 수 있고, 챗봇은 도구를 그릴 수 있습니다. 초인종에는 LG 로고가 붙어 있습니다. Qwen은 아직 존재하지 않는 칩에서 10조 개의 파라미터에 대해 이야기하고 있습니다.
내일 같은 시간에 만나요.
AI 자동 생성 콘텐츠
본 콘텐츠는 X AI 사용법/팁의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기