Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 LLM 기반 에이전트의 장기적 의사결정 문제를 해결하기 위해 '전략적 궤적 추상화(StraTA)'라는 프레임워크를 제안합니다. StraTA는 초기 작업 상태에서 컴팩트한 전략을 샘플링하고, 후속 행동은 이 전략에 조건부로 결정하며, 계층적 GRPO 스타일의 롤아웃 설계를 통해 전략 생성과 행동 실행을 동시에 학습합니다. 실험 결과, StraTA는 ALFWorld, WebShop, SciWorld 등 다양한 환경에서 기존 강력한 베이스라인 모델들을 능가하는 높은 성공률과 샘플 효율성을 보여주었습니다.
본 기사는 기존의 정보 검색 에이전트가 가진 한계점, 즉 반복적이고 탐험적인 검색 과정으로 인해 발생하는 지연 시간 및 낮은 회수율 문제를 해결하기 위해 'SuperIntelligent Retrieval Agent (SIRA)'를 제안합니다. SIRA는 다중 라운드의 복잡한 탐색 과정을 단일의 정교하게 구성된(corpus-discriminative) 검색 액션으로 압축하는 것이 핵심입니다. 이를 위해 LLM이 문서와 쿼리 양쪽에서 누락되거나 중요한 증거 어휘를 예측하고, 통계적 필터링을 거쳐 최적화된 단일 가중치 BM25 호출을 수행합니다. 실험 결과, SIRA는 기존의 밀도 기반 리트리버 및 다중 라운드 에이전트 베이스라인보다 우수한 성능을 보여주었습니다.
본 기사는 기존의 라벨링된 벤치마크가 없는 상황에서 여러 LLM의 안전성을 비교 평가하는 방법론을 제시합니다. 이 '라벨 없는 비교 안전 점수(benchmarkless comparative safety scoring)'는 고정된 시나리오, 평가 기준, 감사자/판사 등의 엄격한 조건 하에만 유효하며, 단순 응답성 측정 대신 목표 기반 분산 우위 및 재실행 안정성을 핵심 지표로 사용합니다. 이를 통해 실제 공공 부문 조달 사례(노르웨이)를 검증하고, 안전성이 모델의 시나리오 카테고리 및 위험 측정에 따라 달라지므로 단일 점수화보다는 여러 메트릭을 종합적으로 보고해야 함을 강조합니다.
AI Co-Mathematician은 수학자들이 오픈 엔드 연구를 수행하고 상호작용적으로 AI 에이전트를 활용할 수 있도록 설계된 통합 작업대입니다. 이 시스템은 아이디어 생성, 문헌 검색, 계산적 탐색, 정리 증명 등 복잡한 수학적 워크플로우 전반에 걸쳐 포괄적인 지원을 제공합니다. 특히 비동기 상태를 유지하며 사용자 의도를 정교화하고 실패한 가설까지 추적하는 기능을 통해 인간의 협업 연구 과정을 효과적으로 모방하여 높은 성능을 입증했습니다.
본 논문은 대형 언어 모델(LLMs) 파인튜닝 과정에서 사전 학습과 동일한 최적화기를 사용하는 '최적화기-모델 일관성' 현상을 제시합니다. 이 방법은 다른 접근 방식보다 더 나은 학습-망각 트레이드오프를 달성하여, 새로운 작업에 대한 성능을 유지하면서도 기존의 사전 학습 지식 손실(망각)을 최소화하는 것으로 나타났습니다. 또한, 특정 최적화기(Muon)가 추론 작업에서 기대만큼 좋은 성능을 보이지 않을 수 있음을 실험적으로 분석했습니다.
본 논문은 GUI 에이전트의 핵심 기능인 GUI grounding의 성능 향상을 목표로 합니다. 기존 모델들이 고해상도 이미지와 복잡한 인터페이스 요소에서 발생하는 편향 문제(정밀 및 혼란 편향)를 겪는 문제를 해결하기 위해, 'Bias-Aware Manipulation Inference (BAMI)'라는 방법을 제안합니다. BAMI는 coarse-to-fine focus와 candidate selection이라는 두 가지 핵심 조작을 통해 훈련 없이 다양한 GUI grounding 모델의 정확도를 크게 향상시키며, 실제 벤치마크에서 유의미한 성능 개선을 입증했습니다.
본 논문은 대형 언어 모델(LLMs)이 과학 및 수학 문제를 생성하는 과정의 한계를 극복하기 위해 '검증기 기반 어려운 문제 생성 프레임워크(VHG)'를 제안합니다. VHG는 기존의 설정자-해결자 구조에 독립적인 검증기를 통합하여, 문제가 유효성(검증기에 의해 평가)과 난이도(해결자에 의해 평가)라는 두 가지 기준을 모두 충족하도록 보상을 제한합니다. 이 프레임워크는 무한정 적분 및 일반 수학 추론 작업에서 기존 방법들보다 월등히 우수한 성능을 입증했습니다.
UniPool은 기존의 계층별(per-layer) 전문가 할당 방식에 의존하는 Mixture-of-Experts (MoE) 아키텍처의 한계를 극복하기 위해 제안된 새로운 MoE 구조입니다. 이 모델은 모든 레이어가 독립적인 전문가 세트를 소유하는 대신, 전체 시스템이 공유하는 단일 글로벌 전문가 풀(UniPool)을 사용합니다. 이를 통해 전문가 용량을 전역적 예산으로 취급함으로써, 깊이 증가에 따라 전문가 파라미터가 선형적으로 증가할 필요 없이 효율적이면서도 높은 성능을 유지할 수 있음을 입증했습니다.
ActCam은 비디오 생성 과정에서 캐릭터의 동작과 카메라 궤적을 동시에 정밀하게 제어할 수 있는 Zero-Shot 방법을 제시합니다. 이 모델은 사전 학습된 이미지-비디오 확산 모델을 기반으로 하며, 장면 깊이와 캐릭터 포즈 조건을 입력받아 기하학적으로 일관된 비디오를 생성합니다. ActCam의 독특한 두 단계 조건부 스케줄링 프로세스는 초기 분해소에서 장면 구조를 강제하고, 이후 고주파수 세부 사항을 정교화하여 카메라 준수도와 동작 충실도를 크게 향상시킵니다.
Uno-Orchestra는 기존 LLM 다중 에이전트 시스템의 한계인 경직된 오케스트레이션 문제를 해결하기 위해 개발되었습니다. 이 프레임워크는 작업을 선택적으로 분해하고, 각 서브태스크를 허용 가능한 (모델, 원시) 쌍으로 전송합니다. 특히, 작업 분해와 워커(모델) 선택이라는 두 가지 결정을 실제 워커 상호작용 기반의 커티드 RL 궤적에서 공동 최적화하여 높은 정확도와 효율성을 동시에 달성했습니다.
본 논문은 확산 모델이 구조적 환각(hallucinations)을 일으키는 현상을 '모델 유도 다양체 상의 불안정성'으로 해석하고, 이를 완화하기 위한 새로운 접근 방식을 제안한다. 연구진은 이러한 불안정성의 근본 원인이 로컬 내재 차원(LID)에 있음을 밝혀내고, 이를 수정하는 메커니즘인 '본질 냉각(Intrinsic Quenching: IQ)'을 개발했다. IQ는 다양한 벤치마크에서 기존의 환각 감소 기법보다 우수한 성능을 보여주며, 특히 의료 영상 분야에서 해부학적 일관성을 유지하는 데 유용할 것으로 기대된다.
본 논문은 임베디드 AI(EAI) 시스템이 실제 환경에 적용되면서 발생하는 심각한 프라이버시 문제를 다룹니다. 기존 EAI 솔루션들은 각 구성 요소를 독립적으로 최적화하는 경향이 있어, 전체 라이프 사이클에서 발생할 수 있는 통합적인 프라이버시 위기를 간과하고 있습니다. 이를 해결하기 위해 저자들은 '안전한 프라이버시 통합(SPINE)'이라는 새로운 프레임워크를 제안하며, 프라이버시를 시스템 전반의 구조적 제약으로 다루어 EAI의 안전성과 기능성을 동시에 확보하는 방법을 제시합니다.
본 논문은 5G/6G 환경에서 AoA(Angle of Arrival) 기반 실외 위치 추정의 정확도를 높이기 위한 적응적 학습 프레임워크를 제안합니다. 이 프레임워크는 데이터셋 크기에 따라 두 가지 전략을 제공하는데, 대규모 데이터가 있을 경우 계층적 오프라인 학습을 통해 고성능을 달성하고, 소규모 데이터만 있는 경우에는 온라인/점진적 학습(Few-Shot Learning 포함)을 활용하여 실시간으로 정확도를 개선할 수 있습니다. 이를 통해 대규모 데이터셋 구축의 어려움을 완화하며 높은 견고성을 확보합니다.
본 연구는 전기차(EV) 충전 세션 초기의 제한된 정보만을 사용하여 총 에너지 수요를 정확하게 예측하는 방법을 제시합니다. 특히, 사용자 의도와 초기 행동 패턴을 포착하기 위해 메타데이터와 초기 충전 측정을 결합한 데이터셋을 구축했습니다. 또한, 연방 학습(FL) 환경에서 데이터를 분산 유지하면서 중앙 집중식 수준의 높은 예측 성능을 달성할 수 있음을 입증하여, 프라이버시를 보호하는 확장 가능한 충전 수요 예측 솔루션을 제공합니다.
본 논문은 재료 과학 분야의 데이터 수집 비용 문제를 해결하기 위해, 목표 속성의 정보량을 최대화하면서도 미사용(비목표) 속성들의 성능을 보존하는 데이터셋 구축 프레임워크를 제안합니다. 이 접근법은 '다양성 인식 선택(diversity-aware selection)' 기법을 활용하여 재료 공간의 광범위한 커버리지를 확보합니다. 실험 결과에 따르면, 이 프레임워크는 무작위 샘플링 대비 목표 속성과 비목표 속성 모두에서 예측 성능을 크게 향상시키며, 데이터셋 구축 과정 전반에 걸쳐 편향 없는 고품질 데이터를 유지할 수 있음을 입증했습니다.
본 연구는 대규모 언어 모델(LLMs)을 활용하여 신경망 구조를 생성하는 기존 방식의 높은 계산 비용과 긴 코드 길이 문제를 해결하기 위해 '델타 코드 생성' 방식을 제안합니다. 이 방법은 전체 모델 코드를 처음부터 생성하는 대신, 기본 아키텍처에 대한 컴팩트한 통합 디프스(deltas)만을 생성하여 효율성을 극대화합니다. 연구진은 다양한 데이터셋과 여러 LLM을 사용하여 평가했으며, DeepSeek-Coder, Qwen2.5-Coder, Mistral 등 모든 모델이 기존의 전체 생성 기준선 및 동시 접근법보다 월등히 높은 성능(예: CIFAR-10 1 에포크 정확도)을 달성했음을 입증했습니다.
본 논문은 트랜스포머 모델의 암호학적 안전한 추론 과정에서 사용되는 '셔플링 방어(shuffling defense)'가 주장하는 것만큼 견고하지 않음을 보여줍니다. 연구진은 공통 순열과 다르게 섞인 활성화 값을 정렬하여 모델 가중치를 추출하는 새로운 공격 방법을 제안했습니다. Pythia-70m 및 GPT-2 실험을 통해, 이 공격이 매우 낮은 오차 범위에서도 성공적으로 작동하며 실제 환경에서 민감한 모델 정보를 복원할 수 있음을 입증했습니다.
본 논문은 대규모 언어 모델(LLMs)이 다른 에이전트의 상호작용에 의해 결과가 결정되는 멀티 에이전트 게임 환경에서 전략적 추론 능력을 강화하는 새로운 RL 기반 프레임워크인 Strat-Reasoner를 제안합니다. 이 프레임워크는 에이전트의 추론 과정이 다른 에이전트의 추론 과정을 통합하는 반복적인 추론 패러다임을 도입했습니다. 또한, 중앙 집중식 CoT 비교 모듈을 사용하여 중간 추론 단계에 효과적인 보상 신호를 제공하고, 그룹 상대적 RL 접근법을 통해 LLM 정책 최적화를 수행하여 다양한 멀티 에이전트 게임에서 평균 22.1%의 성능 향상을 입증했습니다.
본 기사는 제약 자산 발견 분야에서 범용 LLM과 전문화된 AI 플랫폼을 비교 평가한 결과를 제시합니다. 연구진은 웹 검색 기능을 갖춘 네 가지 최첨단 LLM(Claude Opus 4.7, GPT 5.5, Gemini 3.1 Pro, Perplexity sonar-pro)과 자체 개발한 'Gosset' 플랫폼을 사용하여 10개의 니치 종양학/면역학 표적에 대한 약물 자산 주석 검색 성능을 비교했습니다. 그 결과, Gosset은 최첨단 시스템보다 쿼리당 검증된 약물 수를 3.2배 더 많이 반환하며 압도적인 성능 우위를 보였습니다. 이는 전문적으로 큐레이션된 인덱스를 활용하는 것이 일반 웹 검색 기반의 LLM보다 훨씬 효과적임을 시사합니다.
Neural Rule Inducer (NRI)는 데이터에서 해석 가능한 논리 규칙을 학습하는 Zero-Shot 기반의 기초 모델입니다. 기존 ILP 방법들이 특정 술어에 묶여 재학습이 필요했던 한계를 극복하고, 클래스 조건부 확률 등 도메인 무관 통계적 속성을 사용하여 리터럴을 표현합니다. NRI는 병렬 슬롯 디코더와 곱 T-노름 완화 기법을 통해 논리 합의 순열 불변성을 유지하며, 규칙 복원 및 Zero-Shot 전이 성능에서 우수한 결과를 보여줍니다.