Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Artificial Analysis가 에이전틱 AI 인프라를 위한 최초의 벤치마크인 AgentPerf를 발표했습니다. 기존의 단일 샷 방식과 달리 다단계 에이전트 궤적을 재현하여 실제 프로덕션 환경의 부하와 효율성을 측정합니다.

Tencent가 Hugging Face를 통해 대규모 양손 로봇 조작 데이터셋을 공개했습니다. 70개 이상의 태스크를 포함한 25만 개 이상의 에피소드와 고충실도 시연 데이터를 제공합니다.

APPO는 에이전트 기반 강화학습(RL)에서 미세한 절차적 결정 지점을 분기하여 신용 할당 방식을 개선한 연구입니다. 새로운 분기 점수(Branching Score)를 통해 작은 선택이 최종 결과에 미치는 영향을 정밀하게 분석합니다.

Kling Team이 개발한 OmniDirector는 멀티샷 비디오의 카메라 움직임을 추출하여 이미지에 복제할 수 있는 새로운 프레임워크입니다. 카메라 그리드 표현과 계층적 프롬프트 에이전트를 통해 캐릭터, 동작, 카메라 움직임을 정밀하게 제어합니다.

SWE-Explore 벤치마크 연구 결과, Claude Code와 Codex 등 주요 AI 코딩 에이전트들이 올바른 파일은 찾아내지만 핵심 코드 라인의 14-19%만을 커버하는 구조적 한계를 보였습니다. 이는 모델의 성능 향상과 관계없이 발생하는 공통적인 문제로 나타났습니다.

공개된 연구를 바탕으로 Claude Mythos 아키텍처를 재구성하는 프로젝트와 Excel 데이터를 JSON으로 추출하는 도구를 소개합니다.

Anthropic의 Claude Fable 5 시스템 프롬프트가 유출되어 GitHub에 공개되었습니다. 유출된 프롬프트를 통해 모델의 기반 구조, 지식 컷오프 시점, 출력 스타일 지침 등 핵심 내부 정보가 드러났습니다.
LLM 개발 패러다임이 처음부터 학습하는 방식에서 모듈형 모델 병합 방식으로 전환되고 있습니다. Rio의 사례처럼 오픈 소스 모델을 전략적으로 재조합함으로써 막대한 비용을 절감하고 특화된 AI 솔루션을 구축하는 방법론을 다룹니다.
리우데자네이루의 자체 개발 LLM인 Rio-3.5가 실제로는 Nex와 Qwen 모델의 가중치 병합(Merge) 결과라는 의혹이 제기되었습니다. 가중치 분석 결과 두 모델의 선형 결합임이 드러났으며, 자체 학습 증거가 부족하다는 비판이 나오고 있습니다.

Sentient Labs와 UC San Diego 연구진이 발표한 CryptoAnalystBench는 기존 AI 벤치마크가 놓치고 있는 에이전트의 실질적 한계를 지적합니다. 환각률은 낮지만, 금융 데이터의 복잡한 맥락을 종합하지 못하거나 모순된 정보를 제공하는 등 고도화된 추론 능력의 결여를 증명했습니다.

DiffusionGemma 26B A4B 모델의 양자화 버전(Q6_K, Q4_K_M)에 대한 개인 튜닝 및 성능 테스트 결과입니다. RTX 5090 환경에서 llama.cpp를 활용하여 컨텍스트 제한, VRAM 사용량, 최적 파라미터 및 실행 명령어를 분석했습니다.
Anthropic 엔지니어 1,680명의 이력서를 분석하여 AI 최전선 기업의 채용 트렌드를 파악한 연구 결과입니다. 기존의 통념과는 다른 실제 인재들의 역량과 배경에 대한 흥미로운 인사이트를 제공합니다.
Gemma 4 모델의 QAT(양자화 인식 학습)를 적용한 GGUF 파일 생성 프로세스와 그 결과에 대해 설명합니다. 오차를 최소화하기 위해 F32 정밀도를 사용하여 대칭/비대칭 양자화를 결정하는 새로운 패치 방식을 제안합니다.

Anthropic이 강력한 성능을 가진 새로운 AI 모델 Claude Fable 5를 출시했습니다. 이 모델은 프레젠테이션 제작, 재무 모델링, 심층 조사, 데이터 분석 등 기존 소프트웨어 구독 서비스를 대체할 수 있는 9가지 핵심 기능을 제공합니다.

Mixture of Experts(MoE) 아키텍처의 동작 원리와 연산 효율성 및 메모리 비용 간의 트레이드오프를 분석합니다. 라우터의 역할과 희소(sparse) 모델이 밀집(dense) 모델과 차별화되는 지점을 설명합니다.


DiffusionGemma는 기존의 토큰 단위 예측 방식이 가진 메모리 대역폭 병목 현상을 해결하기 위해 설계되었습니다. 디노이징 패스를 통해 한 번에 256개의 토큰을 병렬로 생성함으로써, 병목 지점을 메모리 대역폭에서 순수 연산 능력으로 전환합니다.
DeepMind의 로보틱스 연구 접근 방식을 분석하며, 강화학습(RL)을 통한 자율적 로봇 개발의 핵심 요소를 다룹니다. 시뮬레이션 환경, 모델 기반 RL, 모방 학습 등 주요 방법론과 시뮬레이션-실제 간극(Sim-to-Real)과 같은 기술적 과제를 탐구합니다.
진화적 탐색(MAP-Elites)이 소형 LLM 환경에서 일반적인 경사 하강법보다 우수한 성능을 보였으나, 실제 학습 방식인 해석적 경사(Exact Gradient)를 상대로는 성능 차이가 사라짐을 검증한 연구 기록입니다.
56대의 AI 에이전트를 활용한 '반증 검증(adversarial verification)'을 통해 연구 결과의 독창성을 검증한 사례를 다룹니다. 학술 문헌과 특허 데이터베이스 조사 결과 반례를 찾지 못해, 특허 출원 대신 방어적 공개를 결정한 과정과 핵심 기술 개념을 설명합니다.
AI가 생성하는 환각(Hallucination) 현상의 주요 사례들을 조사한 글입니다. 구글 AI Overviews의 잘못된 정보 제공부터 법률 판례 조작, 에어 캐나다의 챗봇 오안내 사례까지 다양한 유형의 오류를 다룹니다.