Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM-as-a-Judge를 활용한 루브릭 기반 강화학습에서 발생하는 보상 해킹 문제를 다룹니다. 제어 가능한 해킹 환경인 CHERRL을 통해 판사 편향을 주입하고 보상 해킹의 메커니즘을 재현 및 분석할 수 있는 테스트베드를 제안합니다.
AdaKoop은 Koopman operator 이론을 활용하여 비정상 데이터 스트림 내의 비선형 동역학을 효율적으로 모델링하는 새로운 알고리즘입니다. 확률적 프레임워크와 이중 뷰 정식화를 통해 복잡한 비선형 패턴을 선형 시스템으로 변환하여 실시간 예측 성능을 극대화합니다.
AI 소프트웨어 개발 에이전트를 지원하는 운영 프레임워크의 프로세스 분류 체계와 성능을 비교 분석한 연구입니다. 6가지 차원의 분류 체계를 구축하여 기존 프레임워크들의 특징을 평가하고, 프로세스 깊이와 이식성 사이의 트레이드오프를 규명했습니다.
사용자의 절차적 작업을 실시간으로 보조하는 선제적 멀티모달 어시스턴트 시스템을 위한 새로운 벤치마크와 아키텍처를 제안합니다. EgoProactive 데이터셋과 Pro2Bench 벤치마크를 통해 계획 외 상황에서의 복구 능력을 검증하며, Llama 4 기반의 향상된 성능을 입증했습니다.
능동적 추론(Active Inference)에서 기대 자유 에너지(EFE) 최소화와 변분 자유 에너지(VFE) 간의 관계를 수학적으로 증명한 연구입니다. EFE 기반 계획을 위해 필요한 엔트로피 교정 항과 계획 교정의 역할을 규명하고 실험을 통해 검증했습니다.
체스 퍼즐을 협력적으로 해결하는 과정에서 발생하는 다자간 대화 데이터셋인 DeliChess를 소개합니다. 이 데이터셋은 그룹 심의가 정확도 향상에 미치는 영향과 탐색적 발화의 역할을 분석할 수 있는 환경을 제공합니다.
LLM 에이전트의 자율성 증가에 따른 검증 및 디버깅 문제를 해결하기 위해 증거 추적과 실행 출처를 다루는 서베이 논문입니다. 에이전트의 행동, 도구 호출, 메모리 활용 과정을 체계적으로 모델링하는 프레임워크와 분류 체계를 제안합니다.
SharedRequest는 모델 수정 없이 프롬프트 프라이버시를 보호하는 모델 불가지론적 추론 프레임워크입니다. 배치 단위로 노이즈 섞인 변형을 혼합하여 민감 정보를 가리며, 의미론적 그룹화를 통해 추론 비용을 획기적으로 절감합니다.
멀티모달 모델의 비디오 이해 능력을 평가하기 위해 인지 심리학에 기반한 새로운 벤치마크 프레임워크인 M³Eval을 제안합니다. 기존 연구가 간과했던 메모리의 보존성, 간섭 저항성 등을 체계적으로 분석하여 모델의 한계와 특성을 밝힙니다.
LLM의 지름길 학습 문제를 해결하기 위해 논리적 구조가 동일한 데이터 간의 그래디언트를 정렬하는 IGA 프레임워크를 제안합니다. 논리적 동형 집합과 그래디언트 충돌 마스크를 통해 OOD 일반화 성능을 획기적으로 높였습니다.
LLM이 복잡한 법령과 규칙을 적용하여 추론하는 의무론적 추론(Deontic Reasoning)의 한계를 극복하기 위한 DAR 프레임워크를 제안합니다. 에이전트형 하네스를 통해 규칙과 상호작용하며 추론 성능을 높이는 방식을 연구하고 평가했습니다.
Strabo는 선언적 상호작용 프로토콜을 기반으로 다중 에이전트 시스템을 모델링하고 구현하는 연구입니다. Google의 UCP를 Langshaw 프로토콜로 모델링하고 Peach 프로그래밍 모델을 통해 에이전트 간 상호 운용성을 입증했습니다.
장기적 반복 프로세스를 평가하기 위한 새로운 벤치마크 AutoLab을 소개합니다. 시스템 최적화 및 CUDA 커널 등 36개 과제를 통해 프론티어 모델의 지속적인 개선 능력을 측정하며, 모델의 성공은 초기 품질보다 반복적인 피드백 통합 능력에 달려 있음을 보여줍니다.
UniCAD는 멀티모달 및 멀티태스크 CAD 학습을 위한 통합 벤치마크와 범용 모델인 UniCAD-MLLM을 제안합니다. 텍스트, 이미지, 스케치 등 다양한 입력을 통해 CAD 재구성, 생성, 질의응답을 단일 프레임워크에서 수행하며 최첨단 성능을 입증했습니다.
LLM의 학문적 대표성 결여와 주석 작업의 품질 문제를 해결하기 위한 새로운 지식 벤치마크 KINA를 제안합니다. 261개 학문 분야를 대상으로 모델 성능을 평가하며, 보너스 기반 토너먼트 방식이 리뷰 품질 향상에 효과적임을 증명합니다.
인간의 수학 교수법인 GASING 방식을 활용하여 소규모 언어 모델의 산술 추론 능력을 향상시키는 연구를 소개합니다. 별도의 강화 학습 없이 다음 토큰 예측만으로 학습시킨 결과, 모델이 절차적 경로를 내재화하고 암산 능력을 갖추는 과정을 기계론적 분석으로 증명했습니다.
본 연구는 초록을 기반으로 연구 논문의 제목을 자동으로 생성하는 기술을 제안합니다. 새로운 데이터셋인 SpringerSSAT를 소개하며, 다양한 LLM의 성능을 비교 분석했습니다.
라벨이 부족한 특화 도메인에서 Vision Foundation Models를 적응시키기 위한 새로운 방법론인 FINO를 제안합니다. 메타데이터를 활용한 자기 지도 학습을 통해 모델의 범용성을 유지하면서도 과학적 도메인에서 뛰어난 성능을 입증했습니다.
아이의 1인칭 시점 경험을 모방하여 단일 연대기적 통과만으로 시각 및 언어 학습을 수행하는 BabyCL 프레임워크를 제안합니다. 이 모델은 스트리밍 시각 표현 학습과 이중 리플레이 버퍼를 결합하여 기존 오프라인 학습과의 성능 격차를 줄였습니다.
AgentMob은 LLM 기반 에이전트를 활용하여 개인의 이동성을 예측하는 새로운 프레임워크를 제안합니다. 적응형 증거 제어 방식을 통해 일상적인 경로와 모호한 사례를 구분하여 처리하며, 기존 방식보다 높은 정확도와 해석 가능성을 보여줍니다.