
AI Daily Digest — 2026년 7월 16일: Mistral Leanstral 1.5, Poolside Laguna, 자기 검증형
요약
Mistral AI의 Leanstral 1.5, Poolside의 Laguna 시리즈, Meta의 Muse Spark 1.1 등 최신 AI 모델 출시 소식을 다룹니다. 수학적 증명, 코딩, 에이전틱 워크플로우를 위한 고성능 오픈 웨이트 모델들의 성능과 전략적 변화를 요약합니다.
핵심 포인트
- Mistral Leanstral 1.5: 수학 증명 특화 모델로 높은 비용 효율성 달성
- Poolside Laguna: 로컬 실행 가능한 코딩 모델 및 대규모 엔터프라이즈 모델 출시
- NVIDIA & HuggingFace: 로봇 AI를 위한 Isaac GR00T 1.7 및 오픈 데이터 이니셔티브 발표
- Meta: 에이전틱 코딩용 Muse Spark 1.1 출시 및 Llama API 종료 전략 전환
- Z.ai: Cursor 등에 대항하는 에이전트 개발 환경 ZCode 출시
Mistral AI는 7월 2일, Lean 4 증명 엔지니어링 전용 오픈 웨이트 (Open-weight) 모델인 Leanstral 1.5를 출시했다. 119B 파라미터의 MoE (1 토큰당 6B 활성) 모델로, miniF2F의 검증 세트와 테스트 세트 모두에서 100%를 달성했으며, PutnamBench에서는 672문제 중 587문제를 해결했고, FATE-H(87%)와 FATE-X(34%)에서 신기록을 수립했다. 문제당 비용은 약 4달러로, 경쟁사의 고성능 프루버 (Prover, 300달러 이상)의 75분의 1 이하이다.
특기할 점은 테스트 시 스케일링 (Test-time scaling) 동작으로, PutnamBench의 성적은 50K 토큰에서 44문제에서 4M 토큰에서 587문제로 단조 증가하며, 예산이 허락하는 한 추론을 계속한다. 순수 수학을 넘어 Rust 코드를 Lean으로 변환하고, Leanstral이 정당성 속성 (Validity property)을 추론하여 증명을 시도하는 파이프라인도 구축했다. 57개의 리포지토리에서 47개의 위반 속성과 11개의 실제 버그를 발견했으며, 그 중 5개는 미보고 상태였다. HuggingFace에서 Apache 2.0 라이선스로 공개 중이다.
— Mistral AI · HuggingFace
🔗 Mistral Leanstral 1.5 발표 · HuggingFace 모델
Poolside AI는 7월 2일, 첫 번째 퍼블릭 오픈 웨이트 코딩 모델을 출시했다. Laguna XS 2.1 (33B 파라미터 MoE, 3B 활성)은 데스크톱 GPU에서 로컬 실행이 가능하며, Laguna M.1 (225B 파라미터, 23B 활성)은 엔터프라이즈용이다. 30T 토큰과 6,144개의 NVIDIA H200 GPU로 자체 학습하였으며, SWE-bench Verified 70.9%, SWE-bench Multilingual 63.1%를 달성했다. OpenMDW-1.1 라이선스로 제공되며, NVIDIA의 투자로 20억 달러를 조달하여 기업 가치 120억 달러를 기록했다.
— Poolside · NVIDIA · OpenMDW
🔗 Poolside Laguna XS 2.1 · Poolside Models
NVIDIA와 HuggingFace는 로봇용 오픈 소스 기반 모델의 공동 개발을 발표했다. Isaac GR00T 1.7을 LeRobot 에코시스템에 통합하여 로봇 AI의 훈련 및 배포 장벽을 대폭 낮춘다. 이와 병행하여 에이전트 구축을 위해 10조 개 이상의 사전 학습 토큰과 수백만 개의 포스트 트레이닝 (Post-training) 샘플을 공개하는 Open Data for Agents 이니셔티브를 발표했다. 여기에는 Nemotron Post-Training v3 Prompt Atlas도 포함된다.
— NVIDIA · HuggingFace
Meta는 Muse Spark 1.1을 출시하며, 이를 에이전틱 코딩 (Agentic coding)을 겨냥한 최강의 에이전트 모델로 포지셔닝했다. CEO인 Zuckerberg가 3년 만에 X에 게시하며 발표했다. Meta AI 책임자인 Alexandr Wang은 Spark 1.1을 "에이전트 태스크와 코딩에서 현재 가장 능력이 뛰어난 모델"이라고 평가했다. 동시에 7월 6일부로 Llama API를 종료하고, 오픈 소스인 Llama와 클로즈드 소스인 Muse의 투트랙 전략으로 전환한다. 더 대규모 모델인 Watermelon은 GPT-5.5에 필적하는 성능을 달성 중이다.
— Meta · TechCrunch · Reuters
Z.ai (구 智譜AI)는 7월 2일, GLM-5.2를 탑재한 "Agentic Development Environment"인 ZCode를 출시했다. Cursor, Claude Code, GitHub Copilot에 직접 대항한다. 멀티 스텝 목표 태스크와 멀티 에이전트 협업을 특징으로 하며, WeChat/Feishu 봇을 통한 원격 태스크 관리도 가능하다. GLM-5.2는 753B 파라미터 MoE (약 40B 활성), MIT 라이선스, 100만 토큰 컨텍스트를 지원하며, API 가격은 입력당 $1.40/M 토큰이다. 구독 서비스는 월 $18부터 시작한다.
— Z.ai · TechTimes
상하이의 스타트업 기원율동(基元律動, 기업 가치 1억 달러)이 개발하는 오픈소스 AI 에이전트 프레임워크 OpenSquilla가 버전 0.4.0에서 '자기 검증 (Self-verification)' 메커니즘을 도입했다. Red→Green→Regression의 에비던스 체인 (Evidence chain)을 통해, AI는 수정 전 의도적으로 실패하는 테스트를 작성하고, 수정 후에는 해당 테스트를 통과시키며, 기존 테스트를 파괴하지 않았음을 확인한다. micrograd 라이브러리를 사용하여 경사 계산 (Gradient calculation)을 10자리 정밀도로 PyTorch와 일치시키는 데 성공했다. 비용을 60-80% 절감했으며, GitHub 스타 5,300개 이상을 달성했다.
— OpenSquilla · 澎湃新聞
LMU Munich 등의 연구팀이 arXiv에 공개한 MetaSkill-Evolve는 LLM 에이전트의 스킬 개선을 원샷 (One-shot)이 아닌 재귀적 (Recursive)으로 수행하는 2단계 시간 스케일 (Two-stage time scale) 프레임워크이다. 개선 파이프라인 전체(Analyzer, Retriever, Allocator, Proposer, Evolver)를 메타 스킬 (Meta-skill)로 파라미터화하며, 태스크 스킬 (Task skill)은 고속 루프 (Fast loop)에서, 메타 스킬은 저속 루프 (Slow loop)에서 진화시킨다. OfficeQA에서 +23.54포인트, SealQA에서 +16.09포인트, ALFWorld에서 +1.92포인트의 개선을 달성했다.
— arXiv · LMU Munich
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기