Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Microsoft가 Claude를 활용하여 실질적인 AI 에이전트를 구축하는 워크숍을 개최했습니다. 시니어 개발자 에반젤리스트가 주도하여 Foundry와 Claude를 사용해 컵케이크 가게 사례를 바탕으로 에이전트 구현 과정을 시연했습니다.
PaddleOCR 3.5 업데이트를 통해 Transformers를 추론 백엔드로 정식 지원하며 Hugging Face 생태계와 완전히 통합되었습니다. 이를 통해 PP-OCRv5 및 PaddleOCR-VL 1.5 모델을 Hugging Face에서 즉시 실행할 수 있으며, LLM 없이도 모델의 정확도를 높일 수 있게 되었습니다.
Google의 Gemini 1.5 Flash 모델이 Intelligence vs Speed의 파레토 프런티어를 확장하며 성능과 속도 면에서 혁신을 보여주었습니다. Artificial Analysis의 측정 결과, 이 모델은 이전 버전인 Gemini 1.5 Flash보다 높은 지능 지수를 기록하며 Grok 및 Claude와 같은 경쟁 모델을 능가했습니다.
AI를 활용하여 수동으로 진행하던 두부방사선 계측(Cephalometric) 과정을 자동화한 OrthoKit App이 출시되었습니다. 기존에 의사가 수십 개의 랜드마크를 직접 찍어야 했던 번거로움을 해결하여, 자동 인식부터 보고서 생성까지 단 몇 초 만에 완료할 수 있습니다.
작성자는 Cursor와 Claude를 활용하여 기존에 149달러에 판매되던 Three.js 기반의 열대 해양 실시간 상호작용 시스템을 단 2시간 만에 복제하는 데 성공했습니다. AI 에이전트의 발전으로 인해 고가의 SaaS나 소프트웨어를 직접 구현할 수 있는 시대가 도래했음을 강조하며, 물리 시뮬레이션의 확장 가능성을 제시합니다.
Tencent가 VLLM의 고대 한자 인식 능력을 평가하기 위한 오픈소스 벤치마크인 Chronicles-OCR을 공개했습니다. 이 데이터셋은 3,000년의 역사적 변천사를 담은 7종의 서체와 2,800장의 이미지를 포함하며, 시각적 분포 변화에 따른 모델의 성능 저하 문제를 다룹니다.
OpenClaw를 활용한 40일간의 실전 육성 경험을 바탕으로 한 가이드입니다. 모델의 아키텍처를 수정하거나 프롬프트를 복잡하게 조정하는 대신, 지속적인 대화와 피드백을 통해 캐릭터를 성장시키는 과정을 다룹니다.
Figure 휴머노이드 로봇이 4일째 중단 없는 자율 운영(nonstop autonomous operations)을 성공적으로 수행하며, 실제 창고 환경에서 내구력 테스트를 진행하고 있습니다. 이 과정에서 로봇은 집기, 운반, 분류, 순환 작업을 스스로 수행하며 고장 데이터 및 유지보수 시점 등 실질적인 데이터를 수집합니다. 이는 휴머노이드 로봇이 단순한 움직임을 넘어 실제 업무를 지속적으로 처리할 수 있는 단계로 진화하고 있음을 보여줍니다.
중국 최대 중고 거래 플랫폼인 Xianyu가 외국 사용자들에게 알려지면서, 중국 유학생들이 이 플랫폼을 통해 GPT-5.4/5.5 및 Claude API 액세스 권한을 매우 저렴하게 구매하고 있는 상황이 포착되었습니다. 사용자들이 하루에 1달러 정도의 비용으로 1억 개 이상의 토큰을 소모하며 활발히 코딩 활동(vibecoding)을 이어가고 있습니다.
David Heckhoff가 자신의 포트폴리오 웹사이트를 새롭게 제작하여 오픈 소스로 공개했습니다. 이 사이트는 방문자에게 몰입형 3D 사무실 경험을 제공하며, 카툰 스타일의 애니메이션과 상호작용 요소를 특징으로 합니다. 마우스 움직임에 반응하는 부드러운 물리 피드백이 구현되어 높은 수준의 사용자 경험을 보여줍니다.
Vercel Labs가 AI 에이전트(AI Agent) 전용 프로그래밍 언어인 Zero를 출시했습니다. 이 언어는 에이전트가 작성, 수정 및 유지보수하기 쉽도록 처음부터 설계된 시스템 언어입니다. 개발자는 더 빠르고, 작으며, 명시적 기능과 타입 안전한 수정을 지원하는 환경을 목표로 합니다.
Anthropic의 Claude Mythos 모델이 Google Cloud Console에 갑작스럽게 등장했으며, 이전과 달리 'preview' 태그가 사라진 상태로 확인되었습니다. 이는 Anthropic이 새로운 모델을 먼저 클라우드 콘솔에 노출한 후 공식적으로 출시하는 패턴을 따르는 것으로 보입니다.
전직 Anthropic 소속의 skirano(MagicPathAI CEO)가 디자인과 개발 영역의 통합을 보여주는 중대한 데모를 공개했습니다. 이제 MagicPath 기능을 Codex 내에서 네이티브 캔버스 형태로 직접 실행할 수 있게 되었습니다.
긴 컨텍스트 LLM의 경쟁 양상이 단순히 토큰 길이를 늘리는 것에서 정교한 아키텍처 최적화로 변화하고 있습니다. Sebastian Raschka는 Gemma 4부터 DeepSeek V4에 이르는 주요 LLM들의 발전 과정을 분석하며, KV 공유(KV sharing), 레이어별 임베딩(per-layer embeddings), 압축된 어텐션(compressed attention) 등 효율성을 높이는 다양한 최적화 기법들을 제시했습니다.
Anthropic이 자사의 내부 매뉴얼인 《Founder's Playbook》을 공개했습니다. 이 문서는 AI 기술의 우수성을 홍보하는 자료가 아니며, Claude Code와 여러 YC 창업자들의 실제 경험과 시행착오를 바탕으로 정리된 교훈을 담고 있습니다. 특히, AI 시대에는 오히려 창업 실패율이 높아질 수 있다는 경고성 메시지를 전달하고 있습니다.
Diffusion Language Model(DLM)의 매력적인 기능에도 불구하고 초기 훈련 비용이 매우 높다는 문제가 있었습니다. Duke 대학 팀은 '다시 훈련하지 말고 정렬하라(Don’t Retrain, Align)'는 접근법을 제시하며, 이미 학습된 Autoregressive LM(AR LM)의 표현 공간(Representation Space)을 동결하고, Masked Diffusion 훈련 시 코사인 유사도를 이용해 DLM의 은닉 상태를 AR teacher 모델에 정렬하는 REPR-ALIGN 기법을 제안했습니다. 이 방법은 훈련 속도를 최대 4배 향상시키고 데이터가 적은 환경에서도 효과적임을 입증했습니다.
HuggingPapers가 'World Action Models: The Next Frontier in Embodied AI'라는 제목의 중요한 리뷰 논문을 발표했습니다. 이 논문은 World Action Models (WAMs)를 체계적으로 정의한 최초의 서베이로, WAMs는 미래 세계 상태를 공동으로 예측하고 행동을 생성하는 Embodied Foundation Models입니다. 해당 논문은 WAMs의 아키텍처, 데이터 생태계, 그리고 평가 프로토콜에 대해 포괄적으로 다루고 있습니다.
Slides Arena에서 발표된 Design Arena 순위에 따르면, Anthropic AI의 Opus 4.7이 1위를 차지했습니다. 특히 'Thinking' 버전도 높은 순위(2위)를 기록하며 강세를 보였습니다. 또한 Zai_org의 GLM 5.1 모델 역시 상위권에 진입하여 주목받고 있습니다.
한국 WIRobotics가 6800만 달러 규모의 투자를 유치했습니다. 이들은 ALLEX라는 인공인간 로봇을 개발했으며, 특히 손 부분 데모를 통해 뛰어난 정밀도와 생체 모방 기능을 선보였습니다.
Google의 Gemini Spark 최신 내부 스크린샷이 유출되었으며, 이 모델은 Agent 모드와 Chat 모드를 동시에 지원하는 것이 특징입니다. 주요 기능으로는 고급 도구 사용(Advanced tool use)과 Skills 생성 프로세스가 강조되었습니다. 다만, 현재는 Skills가 MD 파일 복사/붙여넣기 방식으로만 생성 가능하며, 직접 가져오기 옵션이나 Browser/Computer Use 기능은 지원하지 않는 것으로 보입니다.