Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM 에이전트의 메모리 활용 과정에서 발생하는 아첨(Sycophancy) 현상을 평가하기 위한 새로운 벤치마크인 MemSyco-Bench를 제안합니다. 기존 벤치마크가 저장과 검색에 집중했다면, 본 연구는 메모리가 추론과 의사 결정에 미치는 부정적 영향을 측정하는 데 중점을 둡니다.
LVLM의 장기 비디오 품질 이해 능력을 평가하기 위한 새로운 벤치마크인 LongVQUBench를 제안합니다. 기존 벤치마크가 놓치기 쉬운 시간적 연속성과 누적 저하를 측정하기 위해 계층적 평가 체계와 NDQA 패러다임을 도입했습니다.
LLM 기반의 자율적 과학 발견 프레임워크인 DiscoPER를 소개합니다. 이 시스템은 2차 추론 메커니즘을 통해 이전 발견을 분석하고, 코드를 동적으로 생성하여 개방형 연구를 수행합니다. iNatDisco 벤치마크에서 기존 모델을 능가하는 성능을 입증했습니다.
Diffusion-GR2는 생성 추론 재순위화기의 느린 추론 속도를 해결하기 위해 블록 확산 언어 모델을 활용한 새로운 방법론을 제안합니다. 변환 미세 조정(CFT)과 온-정책 증류(OPD)를 통해 구조적·분포적 격차를 해소하여 높은 정확도와 빠른 처리량을 동시에 달성했습니다.
자율 실험실에서 AI 에이전트가 제안한 실험 배치들을 하드웨어 제약 조건에 맞춰 최적으로 계획하고 실행하는 2단계 방법론을 제시합니다. 제약 프로그래밍을 통한 스케줄링과 상태 의존성 시스템을 활용하여 자원 활용도를 극대화합니다.
FurnitureVLA는 VLA 모델을 활용하여 실제 규모의 양팔 가구 조립을 수행하는 연구입니다. 시뮬레이션 파이프라인과 VR 원격 조작 시스템을 통해 데이터를 수집하며, 진행 강화 VLA를 통해 장기 시계열 과업의 성공률을 크게 높였습니다.

비디오를 기반으로 3D 모션을 재구성하여 4D 합성을 가능하게 하는 기술을 소개합니다. 관련 소스 코드는 GitHub를 통해 제공됩니다.
LLM 서비스 비용을 최적화하기 위해 쿼리의 난이도에 따라 모델을 선택하는 'Cluster-Route-Escalate' 캐스케이드 방식을 제안하는 논문입니다. 저렴한 모델로 대부분의 쿼리를 처리하고, 품질 추정기를 통해 신뢰도가 낮은 경우에만 고성능 모델로 에스컬레이션하여 비용과 정확도를 동시에 잡습니다.
Ilya Sutskever의 관점을 통해 데이터 고갈 문제와 스케일링 법칙의 한계를 분석합니다. 차세대 모델의 핵심은 단순한 규모 확장이 아닌 추론, 에이전트, 시스템 구축에 있음을 강조합니다.
에이전트를 시니어 엔지니어 수준으로 평가하기 위해 설계된 새로운 오픈 소스 벤치마크인 Senior SWE-Bench를 소개합니다. 자연어 기반의 모호한 지시사항과 복잡한 런타임 조사가 필요한 버그 해결 능력을 측정하며, 기존 모델들의 한계를 보여줍니다.
최신 연구에 따르면 상위 5개 LLM은 인간의 유머 선호도와 일치하지 않으며, 오히려 모델 간의 유사한 선택을 보이는 경향이 있습니다. 이는 AI가 진정한 유머를 이해하기보다 패턴 매칭과 구조적 모방에 의존하고 있음을 시사합니다.

PerceptionRubrics는 10,000개 이상의 원자적 루브릭을 활용해 멀티모달 모델의 인지 능력을 평가하는 새로운 벤치마크입니다. 게이트형 점수 산정 방식을 통해 환각 현상에 엄격한 벌점을 부여하며, 오픈 소스와 폐쇄형 모델 간의 인지 격차를 분석합니다.

Microsoft가 Hugging Face에 안전 정렬된 Llama 모델인 HARC를 출시했습니다. 이 모델은 유해성 신호와 거부 신호를 결합하여 탈옥 시도를 효과적으로 방어하면서도 유용성을 유지합니다.

$ abla^2$DFT는 약물 유사 분자를 대상으로 하는 범용 양자 화학 데이터셋과 신경망 포텐셜(NNP)을 제안합니다. 이 연구는 분자 구조와 화학적 성질을 더 정확하게 예측하기 위한 새로운 접근 방식을 다룹니다.

Alibaba Cloud가 Unified Model(UModel)을 오픈 소스로 전환하고, 기업 데이터의 의미론적 파편화를 해결하기 위한 Universal Semantic Standard(USS) 이니셔티브를 발표했습니다. 이는 데이터 사일로와 의미론적 불일치를 해소하여 AI 에이전트의 신뢰성을 높이는 것을 목표로 합니다.
Center for AI Safety와 Scale AI Labs가 발표한 Remote Labor Index(RLI)에 따르면, Claude Fable 5가 실제 원격 업무의 16.1%를 완전 자동화하며 역대 최고치를 기록했습니다. 이는 AI가 단순 보조를 넘어 지식 노동의 상당 부분을 직접 대체할 수 있는 단계에 진입했음을 시사합니다.

비디오 매팅 모델인 RVM과 MatAnyone2에서 발생하는 녹색 테두리(halo) 현상의 원인을 분석합니다. RVM은 촬영 시 발생하는 녹색광 반사가 원인인 반면, MatAnyone2는 추론 스크립트의 구현 문제로 인해 발생함을 밝힙니다.

Anthropic의 Claude Fable 5 서비스 재개 소식과 함께 Notion의 HTML 임베드 기능, xAI의 노코드 음성 에이전트 베타 출시 등 주요 AI 기술 업데이트를 다룹니다. 또한 NVIDIA의 오픈 웨이트 확산형 언어 모델 공개와 Cloudflare의 AI 크롤러 차단 방침 등 산업 전반의 움직임을 요약합니다.

Anthropic이 Opus를 상회하는 최상위 티어 모델인 Claude Fable 5를 공개했습니다. 이 모델은 높은 코딩 성능과 자율 에이전트 활용에 최적화되어 있으며, 사고(Thinking) 프로세스가 상시 활성화된 것이 특징입니다.
기존의 단기 코딩 벤치마크와 달리 장시간 수행되는 작업을 측정하는 SWE-Marathon 벤치마크를 소개합니다. 모델들이 짧은 작업에서는 높은 성능을 보이지만, 단계가 길어질수록 자기 검증 실패와 오류 누적으로 인해 성능 격차가 기하급수적으로 벌어짐을 분석합니다.