Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
AI 데이터센터의 비효율성이 심화되면서, 대형 언어모델 추론 과정은 연산 능력보다 메모리 대역폭에 병목 현상을 겪고 있습니다. 이로 인해 GPU 활용률이 낮아지자, 시장은 메모리 용량과 대역폭 확충을 가장 효율적인 해결책으로 인식하며 메모리 가격 상승을 주도하고 있습니다.
본 기고문은 검찰의 보완수사권 폐지 주장에 반론을 제기하며, 수사권을 없애는 것은 '눈 가린 문지기가 더 잘 지킨다'는 궤변에 불과하다고 주장합니다. 진정한 개혁 방향은 수사 권한이 아닌 기소권 남용 문제 해결에 초점을 맞추고, 검찰-경찰 간의 독점적 분리 구조를 넘어 '분산'하는 다층적 시스템 구축이 필요함을 강조합니다.

Claude Code harness가 기대만큼 성능이 좋지 않다는 분석이 나왔습니다. 이 글은 Claude Code의 우수성이 특정 'harness' 기능 때문이라기보다는, 근본적으로 Claude 모델 자체의 뛰어난 능력 덕분임을 강조합니다.
Anthropic의 모델 라인업에 대한 모순점을 지적하는 글입니다. 소문에 따르면 Opus 5가 Fable 5를 능가할 것으로 예상되지만, 이는 기존 'Mythos-class' 등급 체계를 약화시킬 수 있습니다.

Grok이 새로운 코딩 벤치마크인 VulcanBench에서 높은 점수를 기록하며 성능을 입증했습니다. Grok은 다섯 가지 언어의 23개 소프트웨어 작업 중 21개를 해결하여 Claude Fable 5와 GPT-5.6 Sol 같은 경쟁 모델들을 능가하는 성과를 보였습니다.
본 기사는 Anthropic의 성공 요인과 해자(moat)를 분석하며, 그 핵심이 코딩 사용 사례에 대한 집중 투자와 독점적인 사용자 데이터 확보에 있음을 제시합니다. 하지만 이러한 성공 방식은 경쟁사들에게도 복제 가능하여, 향후 시장에서 치열한 경쟁이 예상된다고 전망합니다.

Kimi K3가 사용 속도가 빨라진 이유를 분석하며, 이는 서비스 제공자가 용량 한계에 도달하여 신규 구독 판매를 중단했기 때문이라고 추론합니다. 과거 Anthropic의 사례와 비교하며, 사용자 경험과 수익 모델 간의 관계를 지적하고 있습니다.

AMD 선임 AI 디렉터의 GitHub 활동을 분석한 결과, Anthropic이 AMD의 잠재적 고객이 될 것이라는 내용입니다. 이는 특정 기업 간의 기술 협력 및 시장 동향에 대한 정보를 제공합니다.
Kimi CEO Zhilin Yang은 AI 연구소들이 모델 자체를 가장 중요하게 생각하는 관점에 반론을 제기합니다. 그는 진정한 핵심 가치는 기술적 성능(모델)보다 그것을 구축하고 운영하는 '사람들의 조직 구성'에 있다고 강조했습니다.
본 논문은 LLM의 복잡한 추론 능력을 이해하기 위해 사전 학습(Pre-training)부터 강화학습(RL)까지 전체 파이프라인을 연구합니다. 체스 게임이라는 통제된 테스트베드를 사용하여, RL 성능이 사전 학습 단계에서 형성되는 손실로부터 예측 가능하며, 어려운 문제에서는 SFT만으로는 얻기 어려웠던 능력을 발현함을 입증했습니다.
CRAFT는 기존 평가 시스템의 한계를 극복하고, LLM이 실패한 근본적인 역량(capability)을 진단하는 새로운 방법을 제시합니다. 이는 루브릭 기반 평가 데이터셋을 모델 특정 약점 진단으로 변환하여 계층적 역량 트리로 클러스터링합니다. 이 과정을 통해 목표 지능형 지도 학습 파인튜닝 데이터를 생성할 수 있습니다.
본 논문은 AI 시스템의 거버넌스 측면에서 감사 가능한 신뢰성 수준을 확보하기 위한 경량 방법론을 제안합니다. 이 방법론은 형식적 프레임워크와 라이프사이클 거버넌스 절차 두 가지 구성 요소로 이루어져 있습니다. 이를 통해 AI의 변화를 시간 흐름에 따라 문서화하고 모니터링할 수 있는 증거 기반을 제공합니다.
본 논문은 다중 에이전트 시스템(MAS)과 단일 에이전트 시스템(SAS)의 차이를 정보 병목 관점에서 분석했습니다. MAS가 경계가 있는 중계 메시지를 사용하는 반면, SAS는 전체 컨텍스트를 공유한다는 점에 주목합니다. 연구 결과, MAS의 이점은 압축으로 인한 정보 손실보다 중복 컨텍스트 감소로 얻는 효율성 개선이 클 때 발생함을 보여줍니다.
본 논문은 인간의 능동적 관찰 능력과 MLLMs의 시각 인지 능력을 비교하며, 현재 모델들이 이 부분에서 취약함을 지적합니다. 'ActiveVision'이라는 새로운 벤치마크를 제시하여, 단일 정적 설명이 아닌 반복적인 시각적 추론을 요구하는 17개 과제로 구성했습니다. 평가 결과, GPT-5.5와 Claude Fable 5 등 최신 모델들이 이 능동 관찰 테스트에서 현저히 낮은 성능을 보였습니다.
본 논문은 멀티모달 과학 주장을 검증하기 위한 새로운 프레임워크 ToolSciVer를 제안합니다. ToolSciVer는 VLM에 표/차트 파싱, 영역 확대 등 세 가지 시각적 도구를 장착하여 복잡한 과학 자료에서 명시적인 증거를 추출합니다. 이 프레임워크는 GRPO 기반의 정책 학습을 통해 높은 정확도를 달성했습니다.
본 논문은 Muon을 사용하여 에이전트 기반 강화학습(RL)의 희소 보상 환경에 적용한 연구 결과를 제시합니다. Qwen2.5-0.5B-Instruct 모델과 ALFWorld에서 GiGPO 및 GraphGPO 등의 정책 최적화기를 활용하여, Muon이 AdamW 대비 높은 성능 향상을 보여주었음을 입증했습니다.
본 연구는 자율주행차(CAV)의 취약점 정보를 구조화된 위협 정보 표현(STIX)으로 변환하는 오픈 가중치 LLM을 평가했습니다. CAV 관련 CVE를 STIX, CWE, MITRE ATT&CK에 매핑한 데이터셋을 구축하고 다양한 LLM을 테스트하여 높은 성능을 확인했습니다. 이는 AI가 교통 보안 분야의 위협 인텔리전스 자동화 및 방어 우선순위 지정에 기여할 수 있음을 보여줍니다.
본 논문은 리포지토리 레벨 문서(README 등)의 부정확성으로 발생하는 'README 버그'를 실시간으로 탐지하고 복구하는 READU라는 불일치 기반 기법을 제시합니다. READU는 소스 코드나 외부 의존성과 같은 진실의 원천과의 불일치를 찾아내고, 이를 바탕으로 문서 패치를 자동으로 합성하여 높은 효율성을 입증했습니다.
본 논문은 자율주행 시스템(ADS)의 복잡한 테스트 문제를 다루며, 6개국 9개사 전문가 인터뷰를 통해 산업 현장의 관행과 과제를 분석했습니다. 현재는 시나리오 기반 및 X-in-the-loop 방식이 주류이나, 향후 AI와 월드 모델을 활용한 자동화되고 데이터 기반의 폐쇄 루프 테스트 프레임워크가 필요함을 제안합니다.
본 논문은 복합 시스템의 이질적인 도메인 간 연결성을 다루는 '도메인 간 디지털 트윈(trans-domain digital twin)'을 제안합니다. 이는 정렬된 공유 상태를 통해 데이터, 모델, 목표, 제어 등을 명시적으로 결합하는 운영적 공식화입니다. 제안된 프레임워크는 7개 계층의 아키텍처와 오케스트레이션 코어를 포함하며, 적응 및 안전성 검증에 대한 기준을 제시합니다.