Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM 에이전트가 사용자의 불충분한 지시사항을 환경 관찰을 통해 보완하도록 돕는 ACCORD 프레임워크를 제안합니다. 에이전트가 누락된 문맥을 식별하고 관찰된 증거에 행동을 접지함으로써 작업 성공률을 크게 향상시킵니다.
엔드투엔드 음성 대화 시스템에서 모델의 파라미터 사전 확률이 문맥 신호를 압도하여 발생하는 문맥 준수 문제를 해결하기 위한 CAD 방식을 제안합니다. 내부 어텐션 메커니즘을 활용해 핵심 문맥을 증폭함으로써 다회차 대화의 일관성을 높였습니다.
멀티모달 검색 증강 질의응답(KB-VQA)에서 정답 정보의 위치에 따른 성능 변화를 분석한 연구입니다. 텍스트 모델의 '중간에서 길을 잃는' 현상과 달리, 멀티모달 모델은 정답이 처음에 있을 때 성능이 높은 '끝에서 길을 잃다(Lost at the End)' 현상이 나타남을 발견했습니다.
daVinci-kernel은 GPU 커널 최적화를 위해 기술 선택, 정책 생성, 기술 요약을 수행하는 세 가지 에이전트를 강화학습(RL)으로 공동 학습시키는 프레임워크입니다. 단일 LLM 백본을 공유하며, 실행 기반 검증을 통해 검증된 기술만을 라이브러리에 추가하여 효율성을 극대화합니다.
REFLEX는 LLM을 활용해 해석 가능한 프로그래밍 정책을 진화시키는 새로운 프레임워크입니다. 시각적 진단과 코드 생성을 분리하여 투명한 피드백 루프를 구축하고, 기술 메모리를 통해 지식 전이를 가능하게 합니다.
DoubtProbe는 구조적 검증과 의미론적 감사를 결합하여 LLM의 블랙박스 탈옥 공격을 방어하는 새로운 프레임워크입니다. 프롬프트의 구조적 일관성을 검사함으로써 진화하는 공격 기법에 대해 강력하고 안정적인 방어 성능을 제공합니다.
단어의 의미가 시간에 따라 변화하는 양방향 의미 변화(sense gain/loss)를 탐지하기 위한 BD-LSC 및 SlangTrack 데이터셋을 제안합니다. 속어와 표준어의 복잡한 의미 궤적을 분석하며, GPT-4o가 가장 우수한 성능을 보였으나 속어 탐지에는 여전히 한계가 있음을 확인했습니다.
LLM 에이전트가 수천 개의 도구 중 필요한 것을 효율적으로 찾을 수 있도록 돕는 SING 프레임워크를 제안합니다. 사용자 의도와 도구 역량을 연결하는 '의도-도구 그래프'를 통해 장기적 작업 수행 시 도구 검색의 정확도와 효율성을 크게 높였습니다.
LLM 에이전트가 상호작용을 통해 숨겨진 환경(DFA)을 추론할 수 있는지 평가하는 '에이전트적 오토마타 학습'을 제안합니다. 실험 결과, 추론 모델이 일반 모델보다 우수하지만 DFA 크기가 커질수록 성능이 급격히 저하되며 고전적 알고리즘 대비 효율성이 낮음을 확인했습니다.
임상 시각-언어 모델(VLM)의 안전한 배포를 위해 불확실성 추정(UE)의 유효성을 벤치마킹한 연구입니다. UE가 모델의 성능 저하 지점을 정확히 예측하며, 모델의 취약성을 진단하는 도구로서 활용될 수 있음을 입증했습니다.
다자간 음성 대화 시스템의 신뢰할 수 있는 발화 순서 교대를 위한 2단계 오디오 파이프라인을 제안합니다. 확산 모델 기반의 데이터 증강 기법을 통해 발화 경계 탐지 및 다음 화자 예측 성능을 향상시켰습니다.
VeriGraph는 LLM 에이전트의 데이터 분석 과정에서 추론의 검증 가능성을 높이기 위해 제안된 신경-기호 추론 프레임워크입니다. 이 시스템은 계산 과정과 자연어 주장을 이종 증거 DAG(Directed Acyclic Graph)로 구조화하여 추론 과정을 투명하게 추적할 수 있게 합니다.
LLM의 아첨(Sycophancy) 현상을 재료 과학 프레임워크를 통해 분석한 연구입니다. 대화와 모델의 반응을 하중과 재료적 실패로 정의하여, 다양한 하중 사례에 따른 다축 특성화를 시도했습니다.
이슬람 지식 분야의 특수성을 고려한 거대 언어 모델(LLM) 연구 동향을 조사한 논문입니다. 아랍어 NLP, RAG, 환각 방지 및 신뢰성 확보를 위한 벤치마크와 연구 과제를 다룹니다.
SMS가 웹페이지로 유도하는 교차 채널 사기를 탐지하기 위한 새로운 벤치마크인 FraudSMSWalker를 소개합니다. URL이나 도메인 정보 같은 평판 단서를 배제하고, 모델이 웹페이지 콘텐츠와 SMS 문맥을 통해 증거 기반의 판단을 내릴 수 있는지 평가합니다.
RAG 시스템의 고정 길이 청킹으로 인한 경계 파편화 문제를 해결하기 위해 적응형 검색 정책인 SCAR를 제안합니다. SCAR는 쿼리-이웃 관련도와 구조적 연속성 페널티를 활용해 인접 청크를 선택적으로 확장하여 토큰 오버헤드를 줄이면서도 높은 재현율을 유지합니다.
멀티모달 환경에서 AI 에이전트가 자신의 출력을 평가할 때 발생하는 '평가자 선호도 붕괴(EPC)'와 '교차 모달 전염' 현상을 연구했습니다. 특정 전략이 지배적으로 나타나는 편향을 분석하고, 이를 완화하기 위한 자기 평가(Self-evaluation)의 효과를 입증했습니다.
베어링 결함 진단을 위해 물리적 지식을 점진적으로 유도하는 새로운 LLM 프레임워크를 제안합니다. 이 모델은 물리 기반 사전 지식을 활용하여 신호 처리의 효율성과 해석 가능성을 동시에 확보했습니다.
종단적 텍스트 데이터에서 현재의 정동 추정과 미래의 정동 변화 예측이 서로 다른 정보원에 의존함을 밝힌 연구입니다. TSAP 및 ACF-Hybrid 프레임워크를 통해 텍스트 의미론과 수치적 궤적 역학의 역할을 비교 분석했습니다.
마스크 확산 모델(MDMs)에서 이전 출력을 반복적으로 재검토하고 수정할 수 있는 '반성적 마스킹(Reflective Masking)' 기술을 제안합니다. 아키텍처 변경 없이도 테스트 시간 스케일링을 통해 텍스트, 스도쿠, 이미지 편집 등 다양한 작업에서 성능을 향상시킵니다.