Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
역전파(BP)를 대체할 수 있는 Forward-Forward 알고리즘을 회귀 문제로 확장한 FFR 프레임워크를 제안합니다. 거리 인식 순서형 지도 학습과 계층적 사다리 구조를 통해 연속적인 타겟 공간에서도 효율적인 학습이 가능함을 입증했습니다.
시각적 추론을 위한 강화학습(RL)에서 기존의 토큰 엔트로피 기반 신용 할당 방식이 가진 한계를 지적합니다. 시각적 민감도를 엔트로피와 결합하여 성능을 높인 새로운 프레임워크 VEPO를 제안하며, 실험을 통해 기존 방식보다 높은 성능을 입증했습니다.
강화학습에서 보상의 불확실성을 활용하여 에이전트의 행동 다양성을 유도하는 새로운 프레임워크를 제안합니다. 기존의 엔트로피 정규화 방식과 달리, 보상을 분포로 정의하여 성능 저하 없이 자연스러운 다양성을 확보합니다.
UAV 내비게이션을 위해 멀티모달 GPT 에이전트를 활용한 AgenticRL 프레임워크를 제안합니다. 이 시스템은 보상 함수 설계부터 정책 개선까지 폐쇄 루프 자기 개선 프로세스를 통해 자율적으로 수행하며, 시뮬레이션과 실제 환경 간의 높은 전이 성능을 입증했습니다.
연합 학습(FL) 환경에서 발생하는 시간적 데이터 분포 변화(temporal drift)로 인한 망각 문제를 해결하기 위한 FlashbackCL 방법론을 제안합니다. 시간적 감쇠 라벨 수와 CBRS 리플레이 버퍼 등을 통해 글로벌 모델이 과거 데이터에 고착되는 현상을 완화합니다.
저자원 언어 및 니치 도메인을 위한 대화형 ASR 학습을 위해 LLM과 TTS를 결합한 데이터 증강 파이프라인을 제안합니다. 합성된 시뮬레이션 대화가 실제 대화 데이터의 부족 문제를 효과적으로 보완하며 음성 인식 성능을 향상시킴을 입증했습니다.
시각 언어 모델(VLM)의 공간 추론 능력을 높이기 위해 상상적 지각 토큰(IPT)을 제안하는 연구입니다. IPT는 보이지 않는 공간을 추론하는 중간 지각 표현을 통해 관점 취하기, 경로 추적 등의 작업에서 성능을 향상시킵니다.
인간의 학습 과정을 모방하여 LLM의 지속적 학습과 지식 전이를 개선하는 '수면(Sleep)' 패러다임을 제안합니다. 기억 공고화와 꿈꾸기라는 두 단계를 통해 단기 지식을 장기 파라미터로 증류하고 스스로를 재귀적으로 개선합니다.
본 연구는 시각적 특징들이 하나의 객체로 연결되는 '결합 문제(Binding Problem)'를 정보 이론적 관점에서 공식화합니다. ViT 모델의 내부 표현에서 결합 정보를 측정하는 프로빙 방법을 제안하고, 다양한 시각적 과제를 통해 결합 능력이 시각적 인식과 추론의 핵심임을 입증합니다.
Humanoid-GPT는 20억 프레임 규모의 대규모 모션 코퍼스로 학습된 GPT 스타일의 트랜스포머 모델입니다. 데이터와 모델 용량을 스케일링하여 기존 MLP 트래커의 한계를 극복하고, 미학습 동작 및 제어 태스크에 대해 뛰어난 제로샷 일반화 성능을 보여줍니다.
대규모 추론 모델(LRMs)이 자신의 내재적 신뢰도와 언어적 표현 사이의 일치성(Faithful Calibration)을 얼마나 잘 유지하는지 분석합니다. 기존 측정 방식의 한계를 지적하며, 토큰 확률과 은닉 상태 등을 활용한 새로운 정량화 프레임워크를 제안합니다.
AlignAtt4LLM은 Decoder-only LLM을 활용하여 IWSLT 2026 동시 음성 번역을 수행하는 새로운 시스템입니다. 인코더-디코더 구조 없이도 프롬프트 내 소스 스팬과 정렬 헤드 등을 통해 저지연 번역 성능을 구현했습니다.
LLM의 사고 사슬(CoT) 추론 시 발생하는 토큰 비효율성과 제어 불가능 문제를 해결하기 위한 ACTS 프레임워크를 제안합니다. 컨트롤러 에이전트가 마르코프 결정 과정을 통해 추론 과정을 적응적으로 조향하여, 성능 저하 없이 추론 예산을 효율적으로 관리합니다.
QUBRIC은 쿼리와 루브릭을 공동 설계하여 강화학습의 성능을 높이는 새로운 프레임워크를 제안합니다. 기존 방식의 구조적 병목을 해결하기 위해 시나리오 기반 질문 재작성과 대조적 루브릭 생성을 활용하며, ArenaHard 벤치마크에서 유의미한 성능 향상을 입증했습니다.
단일 스마트폰 비디오를 활용해 3D 운동학적 바이오마커를 추출하는 QMT 파이프라인을 개발하고 검증한 연구입니다. 딥러닝 기반 3D 포즈 추정 기술을 통해 광학식 모션 캡처와 높은 일치도를 보이며, 만성 통증 환자의 움직임을 객관적으로 측정할 수 있음을 입증했습니다.
자율 LLM 에이전트의 보안 리스크를 평가하기 위한 새로운 프레임워크 SeClaw를 소개합니다. 명세 기반의 보안 태스크 합성 기술과 실행 기반의 평가 방식을 결합하여, 에이전트의 행동 궤적을 추적하고 보안 실패를 체계적으로 진단합니다.
제약 조건 위반 시 즉각 거부하는 대신, 가능한 수리(repair)를 통해 실행 가능성을 높이는 RACL 프레임워크를 제안합니다. 이 방식은 의사결정 의미론 내에서 수리 연산자를 통합하여 허위 거부를 획기적으로 줄입니다.
제약 조건이 있는 다중 에이전트 강화학습(CMARL)의 복잡성을 해결하기 위해 조정 그래프와 라그랑주 쌍대성을 결합한 CG-CMARL 프레임워크를 제안합니다. 이 방식은 결합 행동 공간의 폭발 문제를 해결하고, 재학습 없이 파레토 프런트를 추적할 수 있는 확장 가능한 구조를 제공합니다.
멀티모달 에이전트의 도구 사용이 실제 능력 향상으로 이어지는지에 대한 체계적인 연구를 다룹니다. Thyme과 DeepEyesV2 모델 분석 결과, 도구 사용이 성능 개선이나 비용 절감에 미치는 영향이 미미하며 에이전트가 도구의 기능보다 호출 패턴만을 학습할 가능성을 제시합니다.
기존 지구 관측 파운데이션 모델(EOFM)이 래스터 데이터에만 치중된 한계를 지적하며, 벡터 데이터의 의미론적 정보를 통합하는 새로운 연구 방향을 제시합니다. 래스터의 물리적 패턴과 벡터의 구조적 정보를 단일 임베딩 공간에서 학습하는 공동 공간 표현 학습의 필요성을 강조합니다.