
AI Daily Digest — 2026년 8월 4일: Qwen 3.8-Max 등장, Mythos가 HAWK 공략, Fireworks
요약
Alibaba가 2.4조 파라미터 규모의 Qwen 3.8-Max를 발표하며 강력한 성능과 경쟁력 있는 가격을 제시했습니다. 또한 OpenAI는 실시간 스트리밍 대화가 가능한 GPT-Live의 엔지니어링 원리와 기술적 구현 방식을 공개했습니다.
핵심 포인트
- Qwen 3.8-Max는 2.4조 파라미터 MoE 모델로 높은 벤치마크 성능 기록
- Qwen 모델의 자율 루프를 통한 자기 진화 에이전트 구현 사례 확인
- Qwen 3.8-Max의 API 가격은 기존 플래그십 모델 대비 매우 저렴함
- OpenAI GPT-Live는 WebRTC 기반의 풀 듀플렉스 스트리밍 대화 지원
- GPT-Live의 추론 엔진을 Go로 재작성하여 실시간 성능 대폭 개선
Alibaba는 8월 3일, 자사의 최대 플래그십 모델인 Qwen 3.8-Max를 발표했다. 총 파라미터는 2.4조 개이며, 토큰당 활성화(Activation)는 불과 95B로, 희소 MoE(Sparse MoE)와 하이브리드 주의 집중 메커니즘(Hybrid Attention Mechanism)을 결합한다. 100만 토큰의 컨텍스트 창(Context Window)과 네이티브 시각 이해 능력을 갖추고 있으며, 랭킹 또한 무시할 수 없는 수준이다 — Text Arena에서 5위, Vision Arena에서 2위, CodeArena에서 4위, PaperBench에서는 93.0점(Anthropic Fable 5의 88.8점을 상회)을 기록했다. API는 Alibaba Cloud Model Studio를 통해 공개되었으며, 가중치(Weights)는 다음 주 Qwen 3.8-27B와 함께 오픈될 예정이다.
주목할 만한 것은 데모다. 빈 폴더에서 「자기 진화 에이전트 프레임워크」를 만들라는 지시를 받자, 모델은 약 16일간 코드 생성, 테스트, 프리뷰, 로그 분석을 자율 루프(Self-driving loop)로 반복하며, 사용자 피드백과 커뮤니티의 관행을 통합하여 실제로 동작하는 자기 진화 에이전트 하네스(Harness)인 「oh-my-cli」를 완성했다. 이는 GitHub를 통해 오픈 소스로 공개되었으며 조작 이력도 함께 공개되었다. 해당 팀은 125시간의 자율 연구 실행을 통해 기존 논문을 재현하여 AIME24 점수를 2.7점 추가 상승시켰으며, 양자화 투자 워크플로우를 통해 약 330개의 서브 에이전트(Sub-agent)를 통괄하고 약 6,000회의 팩터 백테스트(Factor Backtest)를 수행했다고 보고했다.
가격 책정은 폐쇄형(Closed) 플래그십 모델들을 압박하는 형국으로 보인다. 중국 내 가격은 입력 100만 토큰당 12위안, 출력 36위안, 캐시 히트(Cache Hit)는 1.5위안이다. 국제 가격은 Opus 5의 약 40% 및 24% 수준이다. 같은 날, 사무용 에이전트 제품인 QwenWork도 출시되어 PC 클라이언트와 DingTalk에서 모델을 이용할 수 있게 되었다. 오픈 웨이트(Open-weight) 경쟁은 동등한 성능을 가진 폐쇄형 연구소들의 가격 책정 여지를 지속적으로 압축하고 있다.
— Alibaba Cloud · Qwen · The Paper
🔗 Alibaba Cloud — Qwen 3.8-Max 발표 · Qwen · 澎湃新聞報道
OpenAI는 8월 3일, 제3세대 음성 시스템인 GPT-Live가 턴제(Turn-based)에서 스트리밍 방식의 풀 듀플렉스(Full-duplex, 전이중) 대화로 전환된 원리를 설명하는 엔지니어링 아티클을 공개했다. 모델은 듣는 동시에 말한다. 「언제 말을 시작할지」를 결정하던 기존의 턴 검출기(Turn detector)는 사라졌으며, 음성은 이산적인 블롭(Blob)이 아닌 연속적인 신호로서 모델에 직접 흘러 들어온다. 더 깊은 추론이나 도구 사용이 필요한 경우에는 대화를 중단시키지 않고 프론티어 모델(Frontier Model, GPT-5.5 등)로 백그라운드에서 위임한다.
엔지니어링 측면이 이 아티클의 핵심이다. 추론 엔진은 Python의 asyncio 파이프라인에서 Go로 재작성되었으며, 프레임 전달의 p95 성능이 기존의 p50 수준에 도달했다. 전송(Transport)은 WebRTC 기반이며, 클록 드리프트(Clock drift)를 흡수하기 위해 음성을 신축(Time-stretching)하여 실시간성을 유지한다. 새로운 프로토콜인 WARP(WebRTC Abridged Roundtrip Protocol)는 세션 시작을 6회 왕복에서 1회 왕복으로 단축했으며, Instant Connect는 SDP 파라미터를 사전 협상하여 단일 UDP 패킷만으로 세션을 시작할 수 있게 한다. 상태 유지 추론(Stateful inference)을 통해 모델 인스턴스의 웜 교체(Warm swap), 컨텍스트가 포함된 프리필(Prefill), 미디어를 중단하지 않는 컨텍스트 압축도 가능하다.
이 아키텍처는 ChatGPT 데스크톱 앱의 컴퓨터 조작과 ChatGPT 내의 에이전트 연동을 지원하며, 향후 공개 예정인 GPT-Live API의 기반이 된다. 개발자를 위한 실무적 관점: 실시간 음성은 「위임 서피스(Delegation Surface)」가 된다. 즉, 가볍고 빠른 모델이 대화를 담당하고, 고비용의 추론은 크리티컬 패스(Critical path)에서 벗어나게 되어 사용자는 핸드오프(Handoff)를 인지하지 못하게 된다.
— OpenAI
Anthropic은 7월 28일, Claude Mythos Preview가 암호 알고리즘의 구현이 아닌 수학 그 자체를 공격한 첫 번째 성과를 공개했다. NIST의 포스트 양자 서명 후보 중 2년간의 전문가 리뷰 2라운드를 견뎌낸 HAWK에 대해, Mythos는 격자 구조(Lattice structure)의 비자명한 자기 동형(Non-trivial automorphism)을 발견하여 실효 키 강도를 약 60시간 만에 절반으로 줄였다. 7라운드 버전 AES에 대해서는 「Möbius Bridge(메비우스의 다리)」라고 명명한 지름길을 고안하여, 256가지를 열거하던 룩업(Lookup)을 제거함으로써 기존 최강의 이론적 공격보다 200~800배 빠르게 수행했다.
두 결과 모두 실제 운용에는 영향을 미치지 않는다. HAWK는 아직 배포되지 않았으며, AES 공격은 약 2^105개의 선택 평문 (Chosen-plaintext)을 전제로 하는 모델로, Anthropic 스스로도 "완전히 비현실적"이라고 언급했다. HAWK 팀은 이후 NIST 프로세스에서 철수한다고 발표했다. 각 성과의 개발 비용은 API 이용료로 약 10만 달러였다. 거의 자율적으로 실행되었으며, AES 공격은 한 명의 연구자가 스캐폴드 (Scaffold)를 구성한 후, Mythos가 3일 동안 약 10억 토큰의 출력을 통해 발견했다.
이 기사에서 가장 흥미로운 점은 Anthropic이 검증에 대해 인정한 부분이다. Mythos는 AES 공격을 1주일 만에 발견했지만, 두 명의 연구자가 그 정확성을 확인하는 데 약 한 달이 걸렸으며, 회사는 연구 시간의 대부분을 모델 성과의 검증에 사용하고 있다고 한다. Anthropic은 ETH Zurich, 텔아비브 대학교, 하이파 대학교와 함께 CryptanalysisBench를 구축하여 LLM의 암호 해독 능력을 측정 가능하게 만들었다. 세이프티 (Safety) 연구를 추적하는 이들에게 주는 시사점은 명확하다. 이제 병목 현상은 발견이 아니라, 발견의 검증이다.
— Anthropic · CyberScoop
🔗 Anthropic Research — 암호 약점의 발견 · CyberScoop
Safe Superintelligence Inc. (SSI)와 NVIDIA는 7월 27일, 장기 전략적 파트너십을 발표했다. NVIDIA는 출자를 진행하며 (Bloomberg는 약 50억 달러라고 보도했으나, 양사 모두 금액을 확인해주지는 않았다), 차세대 Vera Rubin 플랫폼에 대한 접근 권한을 제공한다. SSI는 12개월 이내에 연산력을 한 자릿수(10배) 확대할 수 있을 것으로 전망된다. 양사는 SSI의 연구 통찰력을 활용하고, NVIDIA의 현재 및 차세대 컴퓨팅 플랫폼의 기술 진보에서도 협업할 예정이다.
특기할 점은 NVIDIA가 무엇을 얻었는가 하는 것이다. 젠슨 황(Jensen Huang) CEO는 "해당 회사의 엄격하게 보호된 연구에 대한 희귀한 접근 권한을 얻은 후" 파트너십을 결정했다고 밝혔다. SSI는 2024년 Ilya Sutskever와 Daniel Levy가 설립한 이후 약 2년 동안 침묵을 지켜왔다. 누적 조달 금액은 약 30억 달러, 기업 가치는 320억 달러이다 (a16z, DST Global, Greenoaks, Sequoia 참여). Sutskever의 코멘트는 여전히 간결하다. "스케일 업 (Scale-up)할 가치가 있는 연구가 있으며, 거대한 NVIDIA 컴퓨터에 대한 접근이 그것을 가능하게 한다."
이 거래로 NVIDIA의 업계 내 역할은 한 단계 더 변화한다. 이제 더 이상 "찾아오는 모든 이에게 칩을 파는" 것이 아니라, 차세대 플랫폼에 대한 조기 접근 권한을 누구에게 부여할지 선택하고, 신뢰하는 연구소에 투자하는 입장이 되었다. SSI처럼 "정렬된 슈퍼인텔리전스 (Aligned Superintelligence)"라는 단일한 장기적 베팅에 모든 것을 거는 연구소에게, 이번 파트너십은 AI에서 가장 희귀한 자원인 차세대 연산력을 비용 항목에서 전략 자산으로 변화시킨다.
— NVIDIA · SSI · TechCrunch
🔗 NVIDIA Newsroom — SSI 파트너십 · SSI · TechCrunch
Fireworks AI는 Atreides Management, Index Ventures, TCV가 주도하고 NVIDIA, Lightspeed, Bessemer, Menlo Ventures 등이 참여하는 15.05억 달러 규모의 Series D를 기업 가치 175억 달러로 발표했다. 이 라운드에 수반되는 수치들이 이야기를 들려준다. 연간 반복 매출 (ARR)은 10억 달러를 초과하며 (전년 대비 5배 성장), 일일 토큰 처리량은 15조 개에서 40조 개 이상으로 증가했다. 이 중 95%는 범용 API 접근이 아닌, 특화 및 파인튜닝 (Fine-tuned)된 모델에서 발생한다.
2022년 Lin Qiao를 포함한 Meta 및 Google Brain 출신 엔지니어들이 창업한 Fireworks는 기업이 오픈 모델을 자사 데이터로 파인튜닝하여 실제 서비스에서 제공할 수 있는 추론 (Inference) 클라우드를 운영한다. 고객사로는 Uber, Shopify부터 GitLab, MongoDB, 그리고 이 회사 위에서 구축된 법률 AI Harvey와 코딩 도구 Cursor까지 포함된다. Qiao의 비용 설명은 명확하다. "동등한 품질의 클로즈드 모델 (Closed model)과 비교했을 때, 당사의 비용은 5~10분의 1 수준이다."
이번 라운드는 AI 인프라 역사상 최대 규모의 추론 레이어 조달이며, "모델 가격이 낮아지면 최적화 레이어 기업들은 범용화 (Commodity)될 것이다"라는 뿌리 깊은 비관론에 대한 직접적인 반증이다. 위의 수치들이 보여주는 반증은 다음과 같다. 모델 가격의 하락은 더 많은 기업 워크로드 (Workload)를 AI 인프라로 끌어들였고, 우수한 제공 서비스의 가치를 높였다. 시장 전체에 보내는 시그널로서, 95%가 특화 모델인 10억 달러 규모의 ARR은 "AI 인프라의 자금은 모델을 소유하고 제공하는 곳으로 집중된다"는 것을 가장 명확하게 보여주고 있다.
— Fireworks AI · Yahoo Finance
🔗 Fireworks — Series D 발표 · Yahoo Finance
미쓰비시 자동차(Mitsubishi Motors)는 도쿄 대학에서 스핀오프한 로보틱스 스타트업 Highlanders(하이랜더즈)와 제조 현장용 휴머노이드 로봇(Humanoid Robot)의 개발 및 활용에 관한 기본 합의를 체결했다. 계획은 다음과 같다. 우선 미쓰비시 자동차의 자사 공장에 휴머노이드 로봇을 도입하여 실운용 데이터와 노하우를 축적한다. 로봇 본체의 생산은 미쓰비시 자동차의 교토 공장에서 2027년부터 시작될 예정이다. 자동차 제조사는 제조 노하우를, Highlanders는 로보틱스와 AI 기술 스택(Physical AI 응용)을 제공한다.
핵심 동력은 일본의 인구 통계학적 변화다. 미쓰비시는 이번 제휴를 산업 노동력 부족에 대한 현실적인 대응으로 규정하고 있다. 즉, 숙련된 제조 기술을 로봇 시스템을 통해 보존 및 계승하며, 그 과정에서 새로운 비즈니스 라인을 창출할 가능성도 기대하고 있다. 일본의 전통적인 자동차 제조사가 양산 지향적인 휴머노이드 로봇 시장에 진입하는 것은 Tesla Optimus 라인 등 국내외 선행 사례에 이은 구체적인 행보다. 휴머노이드 로봇을 단순한 연구용 데모가 아니라, 경제성을 계산할 수 있는 공장 바닥이라는 '최초의 구현 단계'로 취급하는 패턴이 확산되고 있다.
합의 시점에서는 로봇의 사양, 생산 대수, 최초 적용 공정 등이 공개되지 않았으며, 2027년 목표를 향해 순차적으로 밝혀질 예정이다. 이미 주목할 만한 점은 패턴 그 자체다. 자동차 제조사가 휴머노이드 로봇을 '노동력 인프라'로 취급하기 시작했다는 점이다.
— Mitsubishi Motors · Highlanders · Humanoid Press
🔗 Mitsubishi Motors · Humanoid Press · Highlanders
OpenAI는 7월 30일, ANA 홀딩스에서 스핀오프한 AI 고객 서비스 기업 avatarin의 고객 사례(Customer Story)를 공개했다. GPT-Realtime 위에 구축된 '쿠라시 마루고토 AI 에이전트(くらしマルゴトAIエージェント)'는 야마다 전기(Yamada Denki)의 온라인 스토어에서 24시간 다국어 음성 상품 상담을 제공한다. 주목할 만한 설계는 지시를 기다리는 것이 아니라 사용자에게 능동적으로 질문을 던지는 것이다. 2주간의 공개 캠페인 동안 약 3만 명이 이용했으며, 이용 후 설문조사에서 92%가 긍정적인 답변을 내놓았다.
이 아키텍처(Architecture)는 참고할 만한 패턴이다. RAG(검색 증강 생성)가 상품 답변을 정확한 카탈로그 데이터에 접지(Grounding)시키는 동시에, GPT-Realtime이 대화의 반응성(Responsiveness)을 유지한다. 야마다 전기의 판매 지식은 대화 흐름에 통합되어, 고객이 요구 사항을 변경하거나 화제가 바뀌더라도 적응한다. 그리고 능동적 질문 설계가 상호작용을 단순 Q&A에서 가이드형 발견(Guided Discovery)으로 전환시킨다. avatarin의 CEO인 후카보리 아키라(深堀晃)의 말은 명확하다. "고객이 원하는 것은 챗봇이 아니라 지성입니다. '4인 가족용 냉장고가 필요한데 주방이 좁아요. 어떤 것을 골라야 할까요?'와 같은 질문에 답할 수 있는 것이 진정한 고객 서비스입니다."
흥미로운 신호는 이것이 OpenAI 자신의 서사 중 어디에 위치하는가 하는 점이다. 즉, 매장 영업시간 외에도 전문 지식을 확장하는, 상시 가동·다국어·음성 우선(Voice-first) 에이전트다. 매번의 대화는 고객이 무엇을 신경 쓰고 있는지에 대한 인사이트를 생성한다. 에이전트형 커머스의 향방을 추적한다면, 아직 아무도 말하지 않은 수치에 주목하고 싶다. '판매 현장'이 폐점하지 않는 음성 에이전트가 되었을 때, 소매업의 인터페이스는 어떻게 변할 것인가.
— OpenAI · avatarin · Yamada Denki
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기