Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 불완전 정보 게임을 해결하기 위한 CFR(Counterfactual Regret Minimization) 알고리즘을 실시간으로 실행할 수 있도록 설계된 최초의 병렬화 프레임워크인 Parallel CFR을 제안합니다. 정보 집합 및 트리 노드 단위의 병렬성과 GPU를 활용한 배치 신경망 추론을 결합하여, 단일 스레드 대비 최대 3.4배의 속도 향상을 달성했습니다. 이를 통해 일반적인 데스크톱급 장치에서도 실시간 게임 플레이에 필요한 충분한 반복 횟수를 확보할 수 있음을 입증했습니다.
노드 특징(node features)이 없는 그래프 환경에서 부분적인 쌍별 레이블만을 활용하여 효율적으로 노드 표현을 학습하는 Contrastive FUSE 프레임워크를 제안합니다. 커뮤니티 인지 구조 신호와 부호가 있는 쌍별 제약 조건을 통합한 스펙트럼 대조 목적 함수를 사용하며, 모듈성 그래디언트를 경량화된 근사치로 대체하여 대규모 그래프에서도 빠른 학습이 가능합니다. 실험 결과, 기존 방식 대비 뛰어난 실행 속도와 함께 경쟁력 있는 분류 성능을 입증했습니다.
본 연구는 시각-언어 모델(VLMs)의 저비트 사후 훈련 양자화(PTQ) 시 발생하는 텍스트와 시각 모달리티 간의 활성화 분포 불일치 문제를 해결하기 위한 SplitQ 프레임워크를 제안합니다. SplitQ는 모달리티 특화 이상치 채널을 격리하는 MOCD 모듈과 양자화 오차를 동적으로 완화하는 ACC 모듈을 통해 모델의 정확도 저하를 최소화합니다. 실험 결과, SplitQ는 W3A3와 같은 극한의 양자화 설정에서도 FP16 성능의 93.5%를 유지하며 기존 방식보다 뛰어난 성능을 입증했습니다.
StruMPL은 위성 라이다 데이터와 지상 조사구 데이터가 서로 다른 변수를 제공하는 비연결적 부분 감독 상황에서 산림 생물량을 추정하기 위한 멀티태스크 밀집 회귀 프레임워크입니다. 데이터가 무작위가 아닌 방식으로 누락된 MNAR(Missing Not At Random) 상황을 해결하기 위해 공유 인코더, 임퓨테이션 및 성향 헤드, 그리고 물리적 제약 조건을 평가하는 학습 가능한 물리 모듈을 결합했습니다. 실험 결과, StruMPL은 기존 방법론보다 AGB(산림 지상부 생물량)의 RMSE와 편향 측면에서 우수한 성능을 보였으며, 특히 AIPW를 통해 편향을 약 54% 감소시켰습니다.
사회적으로 민감한 영역에서 사용되는 파운데이션 모델의 안전성을 확보하기 위해 로보틱스의 제어 개념을 도입한 새로운 가드레일 접근 방식을 제안합니다. 기존의 사후 중재 방식에서 벗어나, 상호작용을 하나의 궤적으로 보고 런타임에 행동을 제어하는 Grounded Observer 프레임워크를 통해 일상 대화 및 치료 환경에서의 안전한 상호작용을 구현합니다.
본 논문은 체화된 지능(Embodied intelligence)에서 세계(World)와 에고(Ego)의 역학이 얽혀 발생하는 성능 저하 문제를 해결하기 위해 World-Ego Modeling(WEM) 패러다임을 제안합니다. WEM은 세계와 에고를 분리하여 예측하는 플래너와 계층적 병렬 전문가 혼합(CP-MoE) 확산 생성기를 결합한 모델입니다. 또한, 내비게이션과 조작이 결합된 하이브리드 작업을 평가하기 위한 최초의 벤치마크인 HTEWorld를 구축하여 최첨단 성능을 입증했습니다.
Tiny Recursive Models(TRM)의 결정론적 재귀로 인한 하위 솔루션 수렴 문제를 해결하기 위해, 각 재귀 단계에 가우시안 노이즈를 주입하는 Probabilistic TRM(PTRM) 프레임워크를 제안합니다. PTRM은 별도의 재학습 없이도 확률적 탐색을 통해 다양한 솔루션을 탐색하며, 매우 적은 파라미터로도 거대 언어 모델(LLMs)을 능가하는 높은 정확도를 달성합니다.
본 연구는 유창함을 유지하며 LLM을 탈옥하는 최적화 기반 적대적 접미사를 탐지하기 위해 토큰 수준의 엔트로피 변화를 추적하는 CPD Online(CPD) 기법을 제안합니다. CPD는 별도의 학습 없이 온라인으로 실행되며, 기존 퍼플렉시티 기반 탐지기보다 높은 정확도로 적대적 공격의 시작 지점을 국소화할 수 있습니다. 또한 LLaMA Guard의 경량 게이트로 활용 시 탐지 품질을 유지하면서도 가드 호출 횟수를 17-22% 절감하는 효율성을 보여주었습니다.
본 논문은 최근 주목받는 회전 기반 벡터 양자화 기법들(EDEN, RabitQ, TurboQuant)에 대한 통합적인 이론적 비교를 제공합니다. 이를 바탕으로 구형 기하학을 활용하여 임베딩의 구조를 더 잘 보존하는 새로운 블록 양자화 알고리즘인 BlockQuant를 제안하며, 재구성 MSE와 기대 내적 왜곡 측면에서 기존 방식보다 뛰어난 성능을 입증했습니다.
기존의 신경망 정책이 다음 노드 예측에만 집중하여 발생하는 근시안적 의사결정 문제를 해결하기 위해 '다중 노드 앞서보기 예측(MnLP)' 전략을 제안합니다. MnLP는 학습 과정에서 여러 미래 노드를 동시에 예측하도록 하여 모델이 장기적인 계획 능력을 갖추게 하며, 추론 시에는 추가적인 오버헤드 없이 효율성을 유지합니다.
LLM의 성능 평가를 위한 벤치마크 데이터셋이 사전 학습 데이터에 포함되어 발생하는 '오염(contamination)' 문제를 지적합니다. 본 논문은 모델이 학습할 수는 없지만 추론은 가능하도록 설계된 '오염 저항성(contamination-resistant)' 데이터셋의 필요성을 주장합니다. 이를 위해 Transformer 아키텍처의 학습과 추론 파이프라인 간 비대칭성을 활용한 수학적 접근법과 새로운 방법론 도입을 제안합니다.
GeoX는 대규모 인간 주석 데이터 없이도 지리 공간 추론 능력을 학습할 수 있는 셀프 플레이(Self-play) 프레임워크입니다. 실행 가능한 프로그램을 통해 검증 가능한 보상을 생성하며, 강화학습을 통해 멀티모달 정책과 검증기를 동시에 최적화합니다. 이를 통해 기존 VLM의 성능을 크게 향상시키고 지리 공간 이해를 위한 새로운 벤치마크를 제시합니다.
LLM 에이전트의 성능을 높이기 위해 사용되는 '에이전트 기술(Agent Skills)'이 특정 도메인에서는 오히려 성능을 저하시킬 수 있다는 연구 결과가 발표되었습니다. 공격적 사이버 보안 환경에서 MCP 기반 CTF 에이전트를 분석한 결과, 환경의 피드백 대역폭이 높을 경우 제공된 기술이 불필요한 오버헤드가 되어 한계 이익이 급격히 감소함을 확인했습니다.
본 논문은 신경망 학습의 핵심인 학습률(Learning Rate)을 최적화하기 위해 두 개의 대립하는 베이지안 프로세스를 활용하는 '이중 베이지안(Double-Bayesian)' 확률론적 프레임워크를 제안합니다. 기존의 경험적 방식에서 벗어나 이론적으로 최적의 학습률을 도출함으로써, 분류, 세그멘테이션, 탐지 등 다양한 작업에서 모델 성능을 입증했습니다.
AutoResearchClaw는 기존의 선형적인 자율 연구 시스템의 한계를 극복하기 위해 설계된 멀티 에이전트 기반의 자율 연구 파이프라인입니다. 구조화된 토론, 자기 치유형 실행기, 인간 참여형 협업 및 실행 간 진화 메커니즘을 통해 과학적 발견 과정을 반복적이고 자기 강화적인 형태로 구현합니다. ARC-Bench 테스트 결과, AI Scientist v2 대비 54.7% 향상된 성능을 기록하며 연구 증폭기로서의 가능성을 입증했습니다.
본 논문은 RIS 지원 무선 네트워크 환경에서 Soft Actor-Critic(SAC) 에이전트를 대상으로 하는 새로운 적응형 보상 오염 공격인 DGRP를 제안합니다. DGRP는 SAC의 이중 비평가 간 불일치가 발생하는 지점을 공략하여 가치 추정을 왜곡하고 정책을 차선책으로 유도함으로써 네트워크 성능을 저하시킵니다. 연구 결과, DGRP는 기존의 주기적 또는 탐색 트리거 방식보다 더 큰 피해를 입히며 심층 강화학습의 강건성 확보를 위한 불일치 인지 위협 고려의 중요성을 시사합니다.
본 연구는 체화된 LLM(Embodied LLM) 에이전트가 완벽한 정답 관찰(ground-truth symbolic observations)을 제공받을 때 오히려 문제 해결 능력이 저하되는 역설적인 현상을 분석합니다. 실험 결과, 적절한 수준의 노이즈가 포함된 RGB 입력 환경에서 에이전트의 성능이 가장 높게 나타났으며, 이는 노이즈가 반복적인 행동 루프를 줄여주는 역할을 하기 때문입니다. 결과적으로 LLM의 성능 평가 시 단순 성공률뿐만 아니라 지각 오류와 추론 실패 간의 상호작용을 고려해야 함을 시사합니다.
기존의 Classifier-Free Guidance(CFG) 방식이 생성 매니폴드의 기하학적 구조를 무시하여 확률 보존을 깨뜨리는 문제를 분석합니다. 본 연구는 연속 방정식을 통해 가이드 효과를 점수 평행 항과 발산 항으로 분해하고, 이를 제어하는 적응형 매니폴드 가이드(AdaMaG)를 제안합니다. AdaMaG는 추가 비용 없이 이미지의 사실성을 높이고 환각 현상을 줄이며 채도 저하 문제를 개선합니다.
진화적 코딩 에이전트가 성능을 높이는 실제 메커니즘을 분석하기 위해 새로운 데이터셋인 EvoTrace와 분석 방법론인 EvoReplay를 제안합니다. 연구 결과, 성능 향상이 반드시 새로운 알고리즘 구조의 발견을 의미하지는 않으며, 삭제된 코드를 다시 도입하는 결정론적 순환 패턴이나 평가기에 대한 과적합 등 다양한 요인이 작용함을 밝혀냈습니다.
VL-DPO는 시각-언어 모델(VLM)을 활용하여 자율 주행 모델의 동작 예측을 인간의 선호도에 정렬시키는 새로운 프레임워크입니다. VLM을 제로샷 추론기로 사용하여 선호도 쌍을 자동으로 생성하고, 이를 Direct Preference Optimization(DPO) 방식으로 미세 조정하여 주행 성능을 개선합니다. 실험 결과, 기존 사전 학습 모델 대비 인간 선호도 점수(RFS)는 향상되고 평균 변위 오차(ADE)는 감소하는 성과를 거두었습니다.