Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
하이브리드 선형 어텐션 모델로의 효율적인 변환을 위한 새로운 초기화 방법론인 Taylor-Calibrate를 제안합니다. Taylor 전개를 활용해 교사 모델의 통계량을 기반으로 학생 모델의 파라미터를 설정함으로써, 증류 과정의 효율성을 극대화하고 성능을 대폭 개선합니다.
LLM 에이전트가 사용자의 불충분한 지시사항을 환경 관찰을 통해 보완하도록 돕는 ACCORD 프레임워크를 제안합니다. 에이전트가 누락된 문맥을 식별하고 관찰된 증거에 행동을 접지함으로써 작업 성공률을 크게 향상시킵니다.
엔드투엔드 음성 대화 시스템에서 모델의 파라미터 사전 확률이 문맥 신호를 압도하여 발생하는 문맥 준수 문제를 해결하기 위한 CAD 방식을 제안합니다. 내부 어텐션 메커니즘을 활용해 핵심 문맥을 증폭함으로써 다회차 대화의 일관성을 높였습니다.
멀티모달 검색 증강 질의응답(KB-VQA)에서 정답 정보의 위치에 따른 성능 변화를 분석한 연구입니다. 텍스트 모델의 '중간에서 길을 잃는' 현상과 달리, 멀티모달 모델은 정답이 처음에 있을 때 성능이 높은 '끝에서 길을 잃다(Lost at the End)' 현상이 나타남을 발견했습니다.
daVinci-kernel은 GPU 커널 최적화를 위해 기술 선택, 정책 생성, 기술 요약을 수행하는 세 가지 에이전트를 강화학습(RL)으로 공동 학습시키는 프레임워크입니다. 단일 LLM 백본을 공유하며, 실행 기반 검증을 통해 검증된 기술만을 라이브러리에 추가하여 효율성을 극대화합니다.
REFLEX는 LLM을 활용해 해석 가능한 프로그래밍 정책을 진화시키는 새로운 프레임워크입니다. 시각적 진단과 코드 생성을 분리하여 투명한 피드백 루프를 구축하고, 기술 메모리를 통해 지식 전이를 가능하게 합니다.
Anthropic이 백악관의 Fable 탈옥 보고서를 공유하며 보안 취약점 개선을 위한 전문가 검토를 요청했습니다. 보고서에 따르면 모델은 보안 검토 요청은 거부하지만, 코드 수정 요청에는 응답하는 특성을 보였습니다.
DoubtProbe는 구조적 검증과 의미론적 감사를 결합하여 LLM의 블랙박스 탈옥 공격을 방어하는 새로운 프레임워크입니다. 프롬프트의 구조적 일관성을 검사함으로써 진화하는 공격 기법에 대해 강력하고 안정적인 방어 성능을 제공합니다.
단어의 의미가 시간에 따라 변화하는 양방향 의미 변화(sense gain/loss)를 탐지하기 위한 BD-LSC 및 SlangTrack 데이터셋을 제안합니다. 속어와 표준어의 복잡한 의미 궤적을 분석하며, GPT-4o가 가장 우수한 성능을 보였으나 속어 탐지에는 여전히 한계가 있음을 확인했습니다.
LLM 에이전트가 수천 개의 도구 중 필요한 것을 효율적으로 찾을 수 있도록 돕는 SING 프레임워크를 제안합니다. 사용자 의도와 도구 역량을 연결하는 '의도-도구 그래프'를 통해 장기적 작업 수행 시 도구 검색의 정확도와 효율성을 크게 높였습니다.
LLM 에이전트가 상호작용을 통해 숨겨진 환경(DFA)을 추론할 수 있는지 평가하는 '에이전트적 오토마타 학습'을 제안합니다. 실험 결과, 추론 모델이 일반 모델보다 우수하지만 DFA 크기가 커질수록 성능이 급격히 저하되며 고전적 알고리즘 대비 효율성이 낮음을 확인했습니다.
임상 시각-언어 모델(VLM)의 안전한 배포를 위해 불확실성 추정(UE)의 유효성을 벤치마킹한 연구입니다. UE가 모델의 성능 저하 지점을 정확히 예측하며, 모델의 취약성을 진단하는 도구로서 활용될 수 있음을 입증했습니다.
다자간 음성 대화 시스템의 신뢰할 수 있는 발화 순서 교대를 위한 2단계 오디오 파이프라인을 제안합니다. 확산 모델 기반의 데이터 증강 기법을 통해 발화 경계 탐지 및 다음 화자 예측 성능을 향상시켰습니다.
VeriGraph는 LLM 에이전트의 데이터 분석 과정에서 추론의 검증 가능성을 높이기 위해 제안된 신경-기호 추론 프레임워크입니다. 이 시스템은 계산 과정과 자연어 주장을 이종 증거 DAG(Directed Acyclic Graph)로 구조화하여 추론 과정을 투명하게 추적할 수 있게 합니다.
LLM의 아첨(Sycophancy) 현상을 재료 과학 프레임워크를 통해 분석한 연구입니다. 대화와 모델의 반응을 하중과 재료적 실패로 정의하여, 다양한 하중 사례에 따른 다축 특성화를 시도했습니다.
NVIDIA Jetson Orin Nano를 대상으로 엣지 ML 추론 지연 시간 추정 시 CPU/GPU 주파수 외에 메모리 클록과 테일 효과가 미치는 영향을 분석한 연구입니다. 메모리 클록의 중요성과 미스율의 클러스터링 현상, 그리고 주파수 전환 시 발생하는 지연 시간을 규명했습니다.
이슬람 지식 분야의 특수성을 고려한 거대 언어 모델(LLM) 연구 동향을 조사한 논문입니다. 아랍어 NLP, RAG, 환각 방지 및 신뢰성 확보를 위한 벤치마크와 연구 과제를 다룹니다.
SMS가 웹페이지로 유도하는 교차 채널 사기를 탐지하기 위한 새로운 벤치마크인 FraudSMSWalker를 소개합니다. URL이나 도메인 정보 같은 평판 단서를 배제하고, 모델이 웹페이지 콘텐츠와 SMS 문맥을 통해 증거 기반의 판단을 내릴 수 있는지 평가합니다.
RAG 시스템의 고정 길이 청킹으로 인한 경계 파편화 문제를 해결하기 위해 적응형 검색 정책인 SCAR를 제안합니다. SCAR는 쿼리-이웃 관련도와 구조적 연속성 페널티를 활용해 인접 청크를 선택적으로 확장하여 토큰 오버헤드를 줄이면서도 높은 재현율을 유지합니다.
멀티모달 환경에서 AI 에이전트가 자신의 출력을 평가할 때 발생하는 '평가자 선호도 붕괴(EPC)'와 '교차 모달 전염' 현상을 연구했습니다. 특정 전략이 지배적으로 나타나는 편향을 분석하고, 이를 완화하기 위한 자기 평가(Self-evaluation)의 효과를 입증했습니다.