Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Google의 Gemma 2 모델은 하이브리드 어텐션 메커니즘과 지식 증류 기술을 통해 모델 크기 대비 압도적인 성능을 구현했습니다. 로컬 및 글로벌 어텐션을 교차 사용하고 GQA를 도입하여 추론 효율성과 문맥 인지 능력을 동시에 높였습니다.
현대차의 Boston Dynamics 완전 인수 계획과 중국 휴머노이드 기업의 새로운 파운데이션 모델 출시 등 로보틱스 산업의 주요 동향을 다룹니다. 또한, 강화학습을 물리 세계에 적용한 'Physical Atari' 논문과 월드 모델 관련 연구 및 투자 소식을 포함합니다.

GLM-5.2 모델의 성능을 기존 프런티어 모델인 Claude Fable 5와 비교 벤치마킹한 결과입니다. 동일한 프롬프트와 루브릭을 사용하여 테스트한 결과, Claude Fable 5가 9.1점, GLM-5.2가 9.0점을 기록했습니다.

GPT-5.6 Pro의 출시 예정 정보와 주요 성능 향상 사항을 다룹니다. 지식 컷오프가 2025년 12월로 확장되었으며, 추론 능력과 비전 기능이 대폭 강화되었습니다.

ALE 벤치마크 결과, 최신 AI 에이전트들이 전문가 수준의 고난도 과제에서 0%의 통과율을 기록하며 기대치에 못 미치는 성능을 보였습니다. 데모 영상의 화려함과 실제 배포 가능성 사이의 간극을 경고하며, 과장된 기대 대신 객관적인 벤치마크를 바탕으로 한 엔지니어링 접근을 권고합니다.
LLM이 특정 캐릭터 이름에 대해 강력한 사전 확률을 가지고 있어, 모델별로 선호하는 이름 조합이 존재한다는 연구 결과입니다. 특정 이름들이 앙상블 형태로 함께 나타나며, 이는 모델의 환각 현상과도 연관될 수 있습니다.
산불 대피 물류 네트워크의 신뢰성을 높이기 위해 교차 모달 지식 증류(Cross-Modal Knowledge Distillation)와 제로 트러스트 아키텍처를 결합한 연구를 소개합니다. 다양한 데이터 소스(위성, 센서, 소셜 미디어 등)를 통합하면서도 데이터 오염과 사이버 공격으로부터 시스템을 보호하는 방안을 다룹니다.
Hugging Face에서 향후 6시간 동안 GLM-5.2 모델의 추론 기능을 무료로 제공합니다. 사용자는 제공된 링크를 통해 해당 모델을 직접 테스트해 볼 수 있습니다.
PLCopen XML의 그래픽 래더 다이어그램(LD) 형식을 검증하기 위한 ESBMC-GraphPLC를 제안합니다. DFS 기반 리졸버를 통해 그래픽 로직을 불리언 접점 결합으로 추출하여, 기존의 공허한 검증 문제를 해결하고 IEC 스캔 사이클 의미론을 준수합니다.

사용자들이 AI 모델의 성능 저하를 체감하는 현상을 Google Trends와 Reddit 데이터를 통해 분석한 연구입니다. 성능 저하라는 막연한 신화보다는 특정 이벤트와 제품 정책 변화가 사용자 정서와 이탈에 결정적인 영향을 미침을 밝혀냈습니다.
Artificial Analysis에서 LLM의 계획 및 실행 능력을 평가하는 새로운 벤치마크를 출시했습니다. Claude Fable과 GLM 5.2가 해당 테스트에서 최고 성능을 기록했습니다.

이커머스 카테고리 5곳에서 20,000건의 AI 추천을 분석한 결과, 기업의 AI 준비도(AI Commerce Score™)와 실제 AI 추천 빈도 사이에는 유의미한 상관관계가 거의 없음을 발견했습니다.


ByteDance 연구진이 3D 공간 작업 수행을 위한 공간 에이전트인 S-Agent를 발표했습니다. 이 에이전트는 도구 사용을 통해 접지, 재구성, 추론을 수행하며, 별도의 학습 없이도 GPT-4o와 Gemini 1.5 Pro를 능가하는 성능을 보여줍니다.

Moebius는 0.22B의 적은 파라미터만으로도 SOTA 수준의 인페인팅 성능을 구현할 수 있음을 증명했습니다. FLUX.1-Fill-Dev와 경쟁 가능한 성능을 보이면서도 추론 속도는 15배 더 빠릅니다.

Google이 Hugging Face를 통해 WikiProfile을 출시했습니다. 이 벤치마크는 LLM이 사실 관계를 틀리는 원인이 지식의 부재인지, 아니면 회상 병목 현상 때문인지를 진단합니다.
STORM은 인터넷 조사를 통해 인용이 포함된 긴 글을 생성하는 연구 프레임워크입니다. 사전 작성 단계에서 주제에 대한 다양한 관점의 질문을 생성하고, 이를 바탕으로 체계적인 개요와 참고 문헌을 수집하여 기사를 작성합니다.
HippoRAG 2는 인간의 장기 기억 방식을 모방하여 LLM의 연상성 및 의미 파악 능력을 향상시키는 새로운 메모리 프레임워크입니다. 기존 GraphRAG 등과 비교해 오프라인 인덱싱 리소스를 적게 사용하면서도 멀티홉 검색 성능을 극대화합니다.

AI 시대에 보안 취약점(CVE) 공개 건수가 급증함에 따라 보안 리스크도 비례하여 증가하는지 분석했습니다. 30개월간의 OSS 패키지 데이터를 조사한 결과, 취약성 공개는 크게 늘었으나 실제 피해 규모는 그만큼 폭증하지 않았음을 확인했습니다.
컨텍스트 윈도우가 커지더라도 무관한 정보(노이즈)가 포함되면 LLM의 정답률이 저하되는 'context rot' 현상을 실측 분석합니다. 정보의 총량보다 정보의 관련도가 모델의 성능을 결정짓는 핵심 요소임을 강조합니다.
Google의 소형 모델인 Gemma 4 E4B QAT를 Apple M5 환경에서 실측 테스트한 결과입니다. 7GB 규모임에도 불구하고 경시 수학, 코드 분석, 청구서 검토 등 복잡한 태스크에서 뛰어난 추론 성능을 보여주었습니다.