Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 VLM이 행동 크기나 공간 좌표와 같은 수치적 출력을 생성할 때 실제 공간적 지각에 근거하는지 분석합니다. SpaceNum 프레임워크를 통해 모델들이 수치와 공간 구조 간의 매핑에 실패하며, 무작위 추측에 가까운 성능을 보인다는 점을 밝혀냈습니다.
언어 에이전트의 기술 생애주기인 경험 생성, 기술 추출, 기술 소비를 아우르는 체계적인 연구를 제시합니다. 모델 생성 기술의 효용성과 부정적 전이 문제를 분석하고, 기술 품질을 향상시키기 위한 메타 기술을 제안합니다.
기존 스케일링 법칙이 설명하지 못하는 비단조적 성능 저하 현상을 Shannon-Hartley 정리를 통해 해석하는 새로운 이론적 프레임워크를 제안합니다. 모델 파라미터를 대역폭으로, 학습 토큰을 신호 전력으로 매핑하여 LLM의 근본적인 정보 전송 용량을 분석합니다.
CVSearch는 고해상도 이미지 인식 시 발생하는 커버리지와 효율성 간의 트레이드오프를 해결하기 위한 적응형 프레임워크입니다. '평가 후 탐색' 워크플로우를 통해 전역 정보 부족 시 전문가 보조 탐색과 의미 인식 스캐닝을 동적으로 스케줄링합니다.
LLM 에이전트의 지속적 메모리에 주입된 악의적 기록을 탐지하기 위한 사후 인과적 감사 프레임워크 MemAudit을 제안합니다. 반사실적 영향력 점수와 메모리 일관성 그래프를 결합하여 유해한 행동의 원인이 되는 메모리를 식별합니다.
Any2Any는 소량의 데이터와 연산만으로 사전 학습된 전신 추적(WBT) 모델을 새로운 휴머노이드 신체 구조로 효율적으로 전이하는 새로운 패러다임을 제안합니다. 운동학적 정렬과 PEFT를 결합하여 기존 지식을 보존하면서도 타겟 로봇에 빠르게 적응할 수 있습니다.
OnePred는 다회차 대화에서 사용자의 다음 질의를 예측하기 위해 재귀적 의도 메모리를 사용하는 연구입니다. 전체 대화 이력을 사용하는 대신 진화하는 의도 궤적을 추적하여 토큰 효율성과 예측 정확도를 동시에 높였습니다.
에이전트 기반 증명 시스템이 프로그램 검증 분야에서 보여주는 성능을 Lean 4 벤치마크인 CLEVER를 통해 평가했습니다. Claude Code를 활용한 실험 결과, 높은 명세 생성 및 구현 인증 성공률을 기록하며 컴파일러 인 더 루프 패러다임의 유효성을 입증했습니다.
멀티모달 거대 언어 모델(MLLMs)의 지식 편집 시 발생하는 일반성 문제를 해결하기 위한 연구입니다. 적대적 부분 공간 정렬을 통해 의미론적으로 유사한 입력에 대해서도 일관된 편집 효과를 유지하는 방법을 제안합니다.
AI 에이전트의 보안성을 평가하는 기존 벤치마크의 한계를 분석한 연구입니다. 벤치마크 취약성, 시간적 노후화, 런타임 불확실성이라는 세 가지 핵심 과제를 규명하고 신뢰할 수 있는 평가 프레임워크 구축 방향을 제시합니다.
Swift Sampling은 테일러 급수를 활용해 비디오 내 정보량이 높은 '시간적 놀라움' 프레임을 식별하는 학습이 필요 없는 알고리즘입니다. 시각적 궤적의 속도와 가속도를 계산하여 예측 경로를 벗어나는 프레임을 효율적으로 추출합니다.
야생 환경의 대규모 건물 및 래스터화된 평면도에서도 작동 가능한 3D 기반 평면도 위치 추정 기술을 제안합니다. 3D 장면을 2D 밀도 맵으로 투영하고 파운데이션 모델을 미세 조정하여 이미지와 평면도 간의 외형 차이를 극복합니다.
Claw AI Lab은 단일 프롬프트로 맞춤형 역할과 협업 워크플로우를 갖춘 자율 연구 팀을 생성하는 플랫폼입니다. Claw-Code Harness를 통해 로컬 코드와 데이터셋을 실험에 연결하며, 실험의 완결성과 결과의 무결성을 보장합니다.
MLLM의 시공간 추론 능력을 정밀하게 평가하기 위한 새로운 비디오 벤치마크인 VGenST-Bench를 제안합니다. 생성 모델과 멀티 에이전트 파이프라인을 활용하여 고도로 제어된 비디오와 QA 쌍을 능동적으로 합성하는 것이 특징입니다.
LLM의 설득력을 높이기 위해 마음 이론(ToM)을 활용한 새로운 추론 프레임워크인 TTBYS를 제안합니다. BDI 프레임워크와 대규모 데이터셋 ToM-BPD를 통해 모델이 타인의 정신 상태를 더 정교하게 추론하도록 설계되었습니다.
Spreadsheet-RL은 강화학습(RL)을 활용하여 복잡한 스프레드시트 작업을 수행하는 LLM 에이전트의 성능을 높이는 새로운 프레임워크입니다. Microsoft Excel 환경에서 다단계 워크플로우를 처리할 수 있도록 설계되었으며, 새로운 벤치마크 데이터셋과 Spreadsheet Gym 환경을 함께 제안합니다.
AtelierEval은 텍스트-이미지(T2I) 시스템의 프롬프트 작성 숙련도를 평가하기 위한 최초의 통합 벤치마크입니다. 인간과 MLLM의 프롬프트 작성 능력을 정량화하며, 인간 전문가와 높은 상관관계를 보이는 에이전트 기반 평가자인 AtelierJudge를 함께 제안합니다.
금융 분야의 복잡한 스프레드시트 워크플로우를 수행하는 LLM 에이전트를 평가하기 위한 새로운 벤치마크인 WorkstreamBench를 소개합니다. 정확도, 수식, 형식을 포함한 다차원적 평가 체계를 통해 에이전트의 실질적인 금융 모델링 능력을 측정합니다.
시계열 예측 문제에서 모델의 성능이 높을수록 오히려 예측력이 떨어지는 역스케일링(inverse scaling) 현상을 분석했습니다. 특히 금융이나 전염병과 같이 꼬리 위험(tail risk)이 중요한 상황에서 상위 꼬리 예측 오류가 두드러짐을 발견했습니다.
Gated DeltaNet-2는 선형 어텐션의 한계를 극복하기 위해 삭제와 쓰기 과정을 채널별 게이트로 분리한 새로운 모델입니다. 기존 KDA와 Gated DeltaNet을 일반화하여 긴 문맥 처리와 검색 성능을 획기적으로 개선했습니다.