Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
기존 시각-언어 모델(LVLM)의 자기 성찰 과정에서 발생하는 시각적 근거 부족 문제를 해결하기 위해 새로운 강화학습 프레임워크인 VRRL을 제안합니다. VRRL은 궤적 접두사 마스킹과 경험 재생 버퍼를 통해 모델이 잘못된 예측으로부터 효과적으로 회복하고 시각적 근거에 기반해 수정하도록 학습시킵니다.
본 연구는 오디오북 낭독의 음향적 특징이 청취자의 몰입과 조회율에 미치는 영향을 분석합니다. 사전 학습된 오디오 모델을 통해 어조, 속도, 음량 등의 데이터와 소비 데이터 간의 상관관계를 체계적으로 탐구했습니다.
장편 TV 드라마의 복잡한 맥락에서 화자를 정확히 식별하기 위한 새로운 벤치마크와 모델을 제안합니다. 대규모 추론 모델(LRM)을 활용해 시각, 청각, 언어적 단서를 통합함으로써 기존 방식보다 뛰어난 화자 인식 성능을 입증했습니다.
패킷 손실 은닉(PLC) 성능을 높이기 위해 수신된 신호만을 활용하여 모델을 실시간 적응시키는 TTT-PLC 프레임워크를 제안합니다. 별도의 참조 신호 없이도 자기 지도 학습을 통해 각 통화의 특성에 맞춰 모델을 튜닝할 수 있습니다.
확산 언어 모델(DLM)이 내부 잔차 스트림에 확산 타임스텝 정보를 잠재적으로 인코딩하고 있음을 밝힌 연구입니다. 프로빙을 통해 이 신호를 추출하고, 이를 활용해 모델의 노이즈 제거 과정을 제어할 수 있음을 입증했습니다.
본 연구는 백만 토큰 규모의 대규모 코퍼스에서 언어 모델이 수행하는 인컨텍스트 검색 능력을 체계적으로 분석합니다. BlockSearch 아키텍처를 통해 길이 일반화 문제를 해결하고, 어텐션 희석 현상을 극복하기 위한 새로운 조정 기법을 제안합니다.
고위험 시나리오에서 개인 맞춤형 설득을 수행하기 위한 Q-러닝 기반의 대화 정책 선택(DiPS) 프레임워크를 제안합니다. 화재 구조 상황을 가정하여 대화 문맥에 따라 동적으로 설득 전략을 선택하며, 기존 LLM 및 RAG 방식보다 높은 성공률을 입증했습니다.
LLM이 교육적 의도를 정확히 추론할 수 있도록 돕는 새로운 계산 형식론인 APV 프레임워크를 제안합니다. 베이지안 엔진을 통해 교육적 콘텐츠를 식별하며, GPT-4o 및 Claude 3.5 실험 결과 인간의 판단과 매우 높은 상관관계를 보였습니다.
ADVENT는 귀납 논리 프로그래밍(ILP)의 병목 현상인 술어 발명을 해결하기 위해 LLM의 가추적 생성과 Prolog의 연역적 검증을 결합한 새로운 메커니즘을 제안합니다. 이 방식은 의미 있는 보조 술어를 생성하고 지식 풀에 축적하여 태스크 간 재사용성을 높입니다.
멀티 에이전트 LLM 시스템에서 에이전트 간 통신이 출력의 수렴이나 다양화에 미치는 영향을 측정하는 BOUNDARY_SYNC 프로토콜을 제안합니다. GPT-4o 실험을 통해 텍스트와 이미지 통신이 주로 균질화를 유발하며, 그룹 크기와 프롬프트 컨텍스트에 따라 결합 방향이 조절됨을 입증했습니다.
LLM의 추론 능력과 신경-기호적 월드 모델을 결합하여 클라우드 시스템의 결함을 자율적으로 복구하는 PASE 프레임워크를 제안합니다. 이 시스템은 계획 합성, 시뮬레이션 검증, 메타 프롬프트 최적화를 통해 복구 시간을 40% 이상 단축합니다.
데이터 과학 워크플로우를 자동화하는 LLM 기반 데이터 에이전트를 엄격하게 평가하기 위한 종합 벤치마크인 AgenticDataBench를 제안합니다. 15개 도메인의 실제 데이터와 LLM 기반 생성 작업을 포함하여 에이전트의 미세한 성능을 측정합니다.
언어 모델이 허구 데이터를 학습할 때 발생하는 '부정 무시' 현상을 해결하기 위해, 그래디언트 편집 모듈인 Goggles를 제안합니다. Goggles는 데이터 자체를 수정하는 대신 미세 조정 과정에서 그래디언트를 편집하여 모델이 데이터의 성격(인식적 프레임)을 올바르게 인식하도록 돕습니다.
합성 데이터 스케일링의 두 가지 방식인 소스 확장(SE)과 고정 소스 합성(FSS)을 비교 분석한 연구입니다. FSS 환경에서 수정된 스케일링 법칙을 제안하며, 예산 규모에 따른 두 방식의 성능 차이와 FSS의 특성을 규명합니다.
지속적 사후 학습에서 온폴리시 자기 증류(SDPO)의 효과를 재검토한 연구입니다. SDPO는 특정 도메인 전문화에는 유리하지만, 분포 외 일반화 능력이 떨어지고 망각 및 모델 붕괴 위험이 있음을 밝혀냈습니다.
Speech-LLM의 ASR 성능 향상을 위해 음성-텍스트 시퀀스를 인터리빙하는 JSTIP 학습 전략을 제안합니다. 실험 결과, 기존 공동 학습 방식보다 개체 정확도가 향상되었으며 모달리티 간극을 줄여 LLM의 사전 지식을 효과적으로 보존함을 입증했습니다.
Decoder-only LLM의 비대칭적 정보 흐름 문제를 해결하기 위해 프롬프트의 일부 토큰만 선택적으로 반복하는 PartRep 기법을 제안합니다. NLL 기반의 경량 게이트를 통해 정보량이 많은 토큰만 증강함으로써, 성능은 유지하면서 KV 캐시와 연산 비용을 획기적으로 절감합니다.
분자 발견 분야에서 LLM이 화학적 구조 변화에 대해 얼마나 일반화할 수 있는지 섭동 기반 분석을 통해 조사합니다. 연구 결과, 미세한 구조 변화에도 성능이 급격히 저하되는 취약성이 발견되었으며, 이를 완화하기 위한 방안으로 인컨텍스트 튜닝(ICT)의 효과를 제시합니다.
스티어링 벡터를 활용한 제어된 텍스트 생성의 일반성 한계를 연구한 논문입니다. 특성 표현력, 작업 전이, 다중 특성 조합 측면에서 스티어링 벡터가 가진 성능 저하와 트레이드오프 문제를 분석했습니다.
항공 운영 지식에 특화된 LLM 평가를 위한 오픈 소스 벤치마크인 'Pre-Flight'를 소개합니다. 국제 표준 및 규정을 바탕으로 작성된 300개의 질문을 통해 최신 모델들의 도메인 특화 추론 능력을 측정합니다.