Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
대규모 언어 모델(LLM)과 자율 에이전트의 배포 증가로 인해 신뢰할 수 있는 인간-기계 구별 능력이 중요해지고 있습니다. 기존 방식은 출력 결과에 초점을 맞추지만, 본 연구는 인지과학적 관점에서 행동을 생성하는 '과정' 자체를 평가합니다. CogCAPTCHA30이라는 30개의 인지 과제 세트를 통해 과정 수준 특징이 단순한 성과 지표보다 인간과 에이전트를 더 강력하게 구별할 수 있음을 입증했습니다.
본 논문은 기존 다중 에이전트 강화학습(MARL) 벤치마크가 단순히 최종 결과(리턴, 성공률 등)만을 측정하는 한계를 지적하며, 에이전트 간의 '협조 방식'을 진단할 수 있는 새로운 평가 관점을 제안합니다. 이 관점은 STAT라는 통제된 테스트베드를 통해 에이전트, 작업, 환경 크기를 체계적으로 변화시키며 협력 메커니즘을 분석합니다. 연구 결과는 유사한 최종 리턴이라도 중복 할당, 할당 다양성 등 다양한 협조 기제를 반영할 수 있음을 보여주었으며, MARL 평가에 있어 협조 감지 평가의 중요성을 강조합니다.
본 논문은 딥러닝 최적화 과정에서 방향성 정렬(directional consistency)과 손실 수렴이 분리될 수 있다는 현상을 발견하고, 이를 활용한 새로운 옵티마이저 GONO를 제안합니다. 기존 옵티마이저들은 기울기 크기에만 의존하여 평탄 지대나 안장점 등을 구분하는 데 한계가 있습니다. GONO는 연속적인 기울기 방향의 코사인 유사도($cc_t$)를 측정하여, 방향성이 일관될 때는 모멘텀을 증폭시키고 진동할 때는 억제함으로써 최적화 성능을 개선합니다.
본 논문은 속도 벡터장 상의 최적 제어 문제로 표현되는 결정론적 아도인트 매칭 프레임워크를 제시합니다. 이 방법은 정책 하에서 가치 기울기를 직접 회귀하여 단순하고 안정적인 학습 목표를 달성할 수 있게 합니다. 또한, 계산 효율성을 높이기 위해 보상 신호가 집중되는 궤적의 말단 부분에만 계산을 수행하는 절단 아도인트 스키마와, 정렬 강도 및 분포 보존 간의 유연한 트레이드오프를 제공하는 일반화된 정규화 기법을 소개합니다.
본 논문은 구조적 그래프 유사성을 측정하는 NP-hard 문제인 Graph Edit Distance (GED)를 근사하는 신경 그래프 매칭 아키텍처의 인코더 기하학 역할을 이론적으로 분석합니다. 연구진은 그래프 유사성 예측기와 정렬 기반 두 가지 범주의 신경 GED 추정기에 대해, 특정 조건 하에서 bi-Lipschitz 인코더가 제어된 GED 대리값(surrogate)을 제공하고 순위 안정성을 개선함을 증명했습니다. 이를 바탕으로 FSW-GNN이라는 bi-Lipschitz WL-등가 인코더를 제안하며, 이 변형이 기존 아키텍처에 적용되었을 때 GED 예측 및 순위 지표에서 유의미한 성능 향상을 보임을 입증합니다.
DINORANKCLIP은 기존의 대조적 언어-이미지 사전 학습(CLIP) 모델이 가진 두 가지 주요 약점, 즉 순서 정보 손실과 지역 구조 민감도 부족 문제를 해결하기 위해 제안된 새로운 프레임워크입니다. 이 모델은 DINOv3 스터디를 활용하고 다중 스케일 퓨전 모듈 및 갈등 인식 게이트를 통합하여 시각적 표현의 공간적 정보를 보존합니다. 또한, 고차원 Plackett-Luce 순위 모델을 도입함으로써 기존 CLIP과 RANKCLIP보다 더 풍부한 순서 일관성 제약을 적용하며, 다양한 벤치마크에서 우수한 성능을 입증했습니다.
UniSD는 대형 언어 모델(LLMs)의 자기 분별(Self-distillation, SD) 학습 과정을 체계적으로 연구하고 개선하기 위한 통합 프레임워크입니다. 기존 방법들이 개별적인 설계 선택에 초점을 맞춘 것과 달리, UniSD는 감독 신뢰성, 표현 정렬, 학습 안정성 문제를 해결하는 다중 교사 동의, EMA 교사 안정화, 토큰 수준 대비 학습 등 여러 보완적 메커니즘을 통합했습니다. 이 프레임워크를 통해 구축된 UniSDfull은 기본 모델보다 5.4점 높은 성능을 달성하며, 외부 강자 없이도 LLM 적응에 효과적인 실용적이고 조작 가능한 접근법임을 입증합니다.
본 논문은 대규모 언어 모델(LLMs)에서 발생하는 '주의 싱크(Attention Sink)' 현상의 구조적 기원을 규명합니다. 이 현상은 자기 주의 메커니즘의 값 집계 과정에서 발생하는 체계적인 분산 불일치와, 이를 Feed-Forward Network (FFN) 레이어 내의 슈퍼 뉴런 활성화가 증폭시키기 때문에 발생합니다. 연구진은 두 가지 통제된 개입을 통해 이 인과 관계를 검증하고, 궁극적으로 값 집계 출력의 안정성을 보장하는 'head-wise RMSNorm'이라는 새로운 정규화 기법을 제안하여 모델 훈련 속도를 가속화할 수 있음을 입증했습니다.
SkillOS는 LLM 기반 에이전트가 과거 경험으로부터 재사용 가능한 스킬을 학습하고 큐레이션하여 자기 진화를 할 수 있도록 설계된 새로운 프레임워크입니다. 기존 방법들이 직면했던 간접적이고 지연된 피드백을 통한 장기적인 스킬 큐레이션 정책 학습의 어려움을 해결합니다. SkillOS는 고정된 에이전트 실행기와 누적 경험을 바탕으로 외부 스킬 저장소(SkillRepo)를 업데이트하는 훈련 가능한 스킬 큐레이터를 결합하여, 복합 보상을 통해 효과적으로 스킬 사용을 최적화하고 일반화 성능을 입증합니다.
본 논문은 대규모 모델 훈련에서 주목받는 SignSGD와 같은 시그널 기반 최적화 알고리즘이 왜 그리고 언제 표준 SGD보다 우수한 성능을 보이는지에 대한 이론적 분석을 제시합니다. 기존의 표준 설정(smoothness, finite variance)에서는 SGD가 이미 minimax optimal하여 시그널 기반 방법의 개선 여지가 없다는 한계가 있었습니다. 이를 극복하기 위해 $\ell_1$-norm stationarity, $\ell_ ext{fty}$-smoothness, 그리고 separable noise 모델을 도입한 새로운 문제 기하학 하에서 SignSGD의 이론적 우위를 증명했습니다.
본 기술 기사는 대형 언어 모델(LLM) 기반 다중 에이전트 시스템(MAS)의 프롬프트 최적화 문제를 해결하기 위한 새로운 프레임워크인 MASPO를 소개합니다. MASPO는 전체 시스템 목표에 초점을 맞춰 자동으로 반복적으로 프롬프트를 정교화하며, 로컬 유효성뿐만 아니라 후속 에이전트의 성공 가능성을 평가하는 통합 평가 메커니즘을 핵심으로 합니다. 이 프레임워크는 데이터 기반 진화적 빔 검색을 사용하여 고차원 프롬프트 공간을 효율적으로 탐색하고, 다양한 작업에서 최신 기법들을 능가하는 성능 향상을 입증했습니다.
본 기사는 LLM의 추론 능력을 향상시키기 위해 강화학습(RL)을 적용하는 새로운 접근 방식인 ScaleLogic을 소개합니다. ScaleLogic은 요구되는 증명 계획의 깊이(지평선)와 기본 논리의 표현력이라는 두 가지 독립적인 난이도 축을 제어할 수 있는 합성 논리 추론 프레임워크입니다. 이 프레임워크는 다양한 논리를 지원하며, LLM이 장기 지평선의 복잡한 추론 능력을 학습하도록 체계적으로 훈련하는 것을 목표로 합니다.
Recursive Agent Optimization (RAO)은 자기 자신을 생성하고 재귀적으로 하위 작업을 새로운 인스턴스에 위임할 수 있는 재귀적 에이전트를 훈련하기 위한 강화학습 접근법입니다. 이 방법은 분할 정복(divide and conquer) 원리를 활용하여 더 긴 컨텍스트와 복잡한 문제에서도 일반화하는 추론 시간 스케일링 알고리즘을 구현합니다. RAO는 에이전트가 언제, 어떻게 위임하고 소통해야 하는지 학습시켜, 모델의 컨텍스트 윈도우를 초월하는 작업 확장성과 높은 일반화 능력을 제공하며 효율성을 높입니다.
본 연구는 멀티모달 도메인 일반화(MMDG) 분야의 현황을 종합적으로 분석하고, 기존 평가 프로토콜의 부재와 일관성 없는 보고 문제를 지적하며 새로운 표준 벤치마크인 MMDG-Bench를 제안합니다. MMDG-Bench는 행동 인식, 기계적 고장 진단, 감정 분석 등 세 가지 이질적인 도메인을 아우르는 통합 플랫폼으로, 단순 정확도를 넘어 왜곡 견고성, 모달리티 누락 일반화 등을 체계적으로 평가합니다. 연구 결과, 현재의 MMDG 방법론들은 공정한 비교 하에 미미한 개선만을 보이며, 모든 방법이 현실 세계의 도전 과제(왜곡 및 모달리티 누락)에서 심각한 성능 저하를 겪는 등 이 분야가 아직 해결되지 않았음을 보여줍니다.
본 논문은 심층 신경망의 예측을 인간이 이해하기 쉬운 고수준 개념으로 설명하는 '개념 기반 추론 및 대비적 설명' 프레임워크를 제안합니다. 기존 방법들이 직면했던 한계점(인과 연결 부족, 저수준 특징에 국한)을 극복하고, 모델 결과와 인과적으로 관련된 최소한의 고수준 개념 집합을 포착하는 것이 목표입니다. 이 방법을 통해 개별 이미지뿐만 아니라 사용자가 정의한 공통 '행동'을 보이는 이미지 집단에서도 모델 예측에 대한 이해를 제공할 수 있음을 입증했습니다.
본 연구는 LLM 기반 에이전트의 장기적 의사결정 문제를 해결하기 위해 '전략적 궤적 추상화(StraTA)'라는 프레임워크를 제안합니다. StraTA는 초기 작업 상태에서 컴팩트한 전략을 샘플링하고, 후속 행동은 이 전략에 조건부로 결정하며, 계층적 GRPO 스타일의 롤아웃 설계를 통해 전략 생성과 행동 실행을 동시에 학습합니다. 실험 결과, StraTA는 ALFWorld, WebShop, SciWorld 등 다양한 환경에서 기존 강력한 베이스라인 모델들을 능가하는 높은 성공률과 샘플 효율성을 보여주었습니다.
본 기사는 기존의 정보 검색 에이전트가 가진 한계점, 즉 반복적이고 탐험적인 검색 과정으로 인해 발생하는 지연 시간 및 낮은 회수율 문제를 해결하기 위해 'SuperIntelligent Retrieval Agent (SIRA)'를 제안합니다. SIRA는 다중 라운드의 복잡한 탐색 과정을 단일의 정교하게 구성된(corpus-discriminative) 검색 액션으로 압축하는 것이 핵심입니다. 이를 위해 LLM이 문서와 쿼리 양쪽에서 누락되거나 중요한 증거 어휘를 예측하고, 통계적 필터링을 거쳐 최적화된 단일 가중치 BM25 호출을 수행합니다. 실험 결과, SIRA는 기존의 밀도 기반 리트리버 및 다중 라운드 에이전트 베이스라인보다 우수한 성능을 보여주었습니다.
AI Co-Mathematician은 수학자들이 오픈 엔드 연구를 수행하고 상호작용적으로 AI 에이전트를 활용할 수 있도록 설계된 통합 작업대입니다. 이 시스템은 아이디어 생성, 문헌 검색, 계산적 탐색, 정리 증명 등 복잡한 수학적 워크플로우 전반에 걸쳐 포괄적인 지원을 제공합니다. 특히 비동기 상태를 유지하며 사용자 의도를 정교화하고 실패한 가설까지 추적하는 기능을 통해 인간의 협업 연구 과정을 효과적으로 모방하여 높은 성능을 입증했습니다.
본 논문은 대형 언어 모델(LLMs) 파인튜닝 과정에서 사전 학습과 동일한 최적화기를 사용하는 '최적화기-모델 일관성' 현상을 제시합니다. 이 방법은 다른 접근 방식보다 더 나은 학습-망각 트레이드오프를 달성하여, 새로운 작업에 대한 성능을 유지하면서도 기존의 사전 학습 지식 손실(망각)을 최소화하는 것으로 나타났습니다. 또한, 특정 최적화기(Muon)가 추론 작업에서 기대만큼 좋은 성능을 보이지 않을 수 있음을 실험적으로 분석했습니다.
본 논문은 대형 언어 모델(LLMs)이 과학 및 수학 문제를 생성하는 과정의 한계를 극복하기 위해 '검증기 기반 어려운 문제 생성 프레임워크(VHG)'를 제안합니다. VHG는 기존의 설정자-해결자 구조에 독립적인 검증기를 통합하여, 문제가 유효성(검증기에 의해 평가)과 난이도(해결자에 의해 평가)라는 두 가지 기준을 모두 충족하도록 보상을 제한합니다. 이 프레임워크는 무한정 적분 및 일반 수학 추론 작업에서 기존 방법들보다 월등히 우수한 성능을 입증했습니다.