Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DexTacWAM은 정교한 조작을 위해 시각 정보와 촉각 정보를 결합한 새로운 세계-행동 모델(WAM)입니다. 손가락 및 자세 인식 촉각 압축기를 통해 얻은 촉각 잠재 변수를 비디오 확산 세계 모델에 주입하여, 접촉 역학까지 고려하는 시각-촉각 세계 모델링을 구현했습니다. 이 모델은 다양한 정교한 조작 과제에서 기존 최고 성능의 기준 모델 대비 높은 성능 향상을 입증했습니다.
Shanghai AI Laboratory가 플러그형 Memory Decoder와 Ascend 공동 최적화 기능을 통합한 오픈 웨이트 과학 멀티모달 모델인 Intern-S2-397B를 공개했습니다. 이 모델은 Hugging Face와 ModelScope에서 가중치를 확인할 수 있습니다.
AI 연구 인력 유출 및 컴퓨팅 자원 구매 제한 등의 어려움에도 불구하고, Yandex가 Muon, Kimi Delta 등 현대적인 소형 MoE 모델을 개발한 성과를 언급합니다. 이 모델들은 약 18T 토큰 규모로 추정됩니다.
Paramount가 Warner Bros. Discovery의 합병을 막기 위해 제기했던 소송에 캘리포니아와 나머지 11개 주들과 합의했습니다. 이 합의는 미디어 산업의 거대한 합병을 가로막던 주요 법적 장애물을 제거합니다. 핵심 내용은 향후 5년간 최소 극장 영화 개봉 수 요구 사항과 미국 내 제작에 대한 추가 지출 약속입니다.
WorldCrafter는 암시적 3D 인식 메모리를 갖춘 비디오 월드 모델입니다. 이 모델은 카메라 질의가 가능한 메모리 인코더와 자세 조건부 판독 모듈을 통해, 다양한 시점의 증거를 효율적으로 압축하고 통합합니다. 이를 통해 단일 입력으로부터 장기적인 시간적 일관성을 유지하며 스트리밍 장면 탐색이 가능해졌습니다.
AI 에이전트가 디자인 규칙과 사용법을 학습하도록 돕는 방법을 제시합니다. 또한, 실제 제품 컴포넌트에 AI 변형을 적용하고 HTML 프로토타입으로 공유하는 방법과, GPT-2를 활용하여 트랜스포머의 작동 원리를 시각적으로 이해할 수 있는 방안을 소개합니다.
토스뱅크 디자이너가 자산관리 리포트 기능의 클릭률을 높이기 위해 디자인 개선 과정을 공유합니다. 기존에 본문 정보와 섞여 지나치기 쉬웠던 추천 기능을, 웹사이트의 '툴팁' 개념을 차용하여 플로팅 카드 형태로 분리 배치했습니다. 이를 통해 사용자의 핵심 작업 흐름을 방해하지 않으면서도 개인화된 제안을 효과적으로 노출하는 방법을 찾았습니다.
AMD가 차세대 Radeon GPU에 대비하여 오픈 소스 리눅스 그래픽 드라이버(amdgpu)를 업데이트했습니다. 이 패치는 드라이버가 인식하는 VRAM 유형 목록에 GDDR7을 공식적으로 추가함으로써, AMD의 소프트웨어 스택에서 최초로 GDDR7 지원을 제공합니다.
본 논문은 다중 턴 도구 사용 시 발생하는 학습 문제를 해결하기 위해 Critical-State RL을 제안합니다. 이 방법은 상호작용 과정에서 행동이 태스크 성공에 미치는 영향을 포착할 수 있는 '학습 가능한 상태'를 식별하고, 이를 기반으로 정책을 최적화하여 성능 향상을 입증했습니다.
본 기사는 Mac Studio와 RTX 5090 등 다양한 GPU 환경에서 Qwen 3.8 27B 같은 대형 언어 모델(LLM)의 생성 속도를 비교 분석합니다. M5 Ultra가 이전 세대 대비 성능 향상을 보였으나, vLLM이나 SGLang과 같은 최적화된 프레임워크를 사용하는 RTX 5090 환경이 훨씬 높은 처리량(tok/s)을 보여주었습니다.
James Calligeros가 Apple Silicon Mac의 복잡한 오디오 서브시스템을 지원하기 위한 대규모 Linux 커널 패치를 공개했습니다. 이 패치는 'macaudio' 머신 드라이버를 도입하여 스피커 및 헤드셋 잭 기능을 활성화합니다. 또한, speakersafetyd와 같은 사용자 공간 데몬이 실행되지 않을 경우 안전장치도 구현했습니다.
샤오미가 MiMo-V2.6 모델을 출시하며, 모든 모달리티를 내장한 최첨단 지능을 공개했습니다. 이 모델은 낮은 학습 비용($3.5M)으로도 높은 성능을 달성했으며, 라이브 벤치마킹 대시보드를 통해 그 성능을 입증하고 있습니다.
본 논문은 에이전트가 데이터의 온톨로지 레이어를 질의할 수 있게 함으로써 성능 향상을 입증합니다. EvoOntology는 전용 에이전트를 통해 온톨로지를 구축하고, 이를 런타임에 질문하여 데이터 에이전트의 정확도를 크게 높입니다. 이 방식은 기존의 수동적인 의미론적 레이어보다 확장성이 뛰어납니다.
RouteMind는 일반 RAG 방식에 사람이 지식의 영역과 관계를 정의하는 '라우팅' 단계를 추가한 Agentic RAG 프로젝트입니다. 이 프로젝트는 인간 개입 수준이 RAG 성능에 미치는 영향을 실험하며, 특히 단순 검색(retrieval)을 넘어 정보의 최신성 및 권위(authority) 판단의 중요성을 검증하고 있습니다.
본 글은 CGNAT 환경에서 셀프 호스팅을 구현하는 기술적 방법을 논하며, VPS와 홈랩(Home Lab)의 장단점을 비교합니다. 특히 보안 강화를 위해 autossh 포트 포워딩이나 Docker 컨테이너를 활용하여 필요한 트래픽만 제한적으로 전달하는 방안을 제시하고 있습니다.
파인튜닝을 완료한 여러 개의 모델들을 Hugging Face에 푸시하여 관리하고, 이를 agentic approach의 핵심 요소로 활용할 수 있습니다. 특히 langgraph orchestrator와 같은 도구를 사용해 입력값에 따라 적절한 모델로 라우팅하는 시스템 구축이 가능합니다.
M5 Ultra 환경에서 Qwen 3.8 Flash Next 모델의 최적화 작업을 진행하고 있으며, 현재 prefill 속도는 3.1k tok/s로 측정되었습니다.
Meta의 새로운 AI 에이전트 Muse가 미국과 캐나다 시장에서 ChatGPT보다 더 많은 다운로드 수와 일일 활성 사용자를 기록한 것으로 추정됩니다. 이는 Meta의 AI 전략 및 사용자 확보 측면에서 중요한 지표로 해석될 수 있습니다.
브라셈(Braskem)의 채권단이 지배 주주인 페트로브라스와 IG4 Capital Group에게 30억 달러 규모의 신규 자본 투입을 요구하고 있습니다. 이는 어려움을 겪는 브라질 석유화학 생산 업체에 대한 재정적 압박과 구조조정 과정에서 발생하는 갈등을 보여줍니다.
중고차 소매업체인 CarMax가 어려운 시장 상황에 대응하여 기업 인력의 약 4%에 해당하는 145개 직무를 폐지했습니다. 이는 짧은 기간 동안 세 번째로 진행된 구조조정 조치입니다.