Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
멀티미디어 이벤트 추출 연구에서 발생하는 평가의 함정을 체계적으로 분석한 연구입니다. 데이터 처리, 작업 가정, 평가 설정의 불일치가 모델 성능을 과대평가할 수 있음을 지적하며 엄격한 평가 표준의 필요성을 강조합니다.
8세기부터 19세기까지 벵골 헌신 문학의 8개 전통을 대상으로 코퍼스 분석을 수행한 연구입니다. TF-IDF와 코사인 유사도를 활용해 불교 바즈라야나 어휘가 샤크타 탄트라 전통으로 흡수되었음을 정량적으로 입증했습니다.
OPID는 언어 에이전트의 강화학습 성능을 높이기 위해 온폴리시 궤적에서 계층적 기술 감독을 추출하는 프레임워크입니다. 에피소드 및 단계 수준의 기술을 활용해 토큰 수준의 조밀한 감독을 제공함으로써 샘플 효율성과 강건성을 향상시킵니다.
LLM이 토큰 생성 과정에서 지식 베이스로부터 사실적 지식을 자동으로 가져올 수 있는 KARLA 방법론을 제안합니다. 특수 토큰을 통해 지식 베이스 쿼리를 트리거함으로써 모델 재학습 없이도 지식 업데이트와 설명 가능성을 확보할 수 있습니다.
IWSLT 2026의 음성 지시 이행(Instruction Following) 태스크를 위한 FBK의 Long-form SpeechLLMs 연구를 소개합니다. 단문 및 장문 음성 지시 이행 성능을 분석하며, 특히 장문 생성 시의 안정성을 높이기 위한 분할 방식과 새로운 평가 지표인 HIFS를 제안합니다.
AgentX는 추천 시스템의 실험 주기를 자동화하기 위해 설계된 멀티 에이전트 시스템입니다. 가설 생성부터 코드 구현, A/B 테스트, 지식 축적까지의 과정을 자율적으로 수행하며 시스템 스스로를 개선하는 자기 진화형 엔진을 지향합니다.
산업용 IoT 엣지 디바이스의 LLM 배포를 위해 계층적 다중 입도 프루닝(Cascaded Multi-Granularity Pruning) 프레임워크를 제안합니다. 레이어부터 채널까지 단계별로 압축하며 저차원 복구를 통해 성능 저하를 최소화하고, 아키텍처별 프루닝 신뢰성을 예측하는 SIA 조건을 공식화했습니다.
언어 모델의 표현이 자연스러운 언어 자극 이해 과정에서 유용한 신경 예측 변수 역할을 할 수 있음을 입증한 연구입니다. 8개의 동결된 언어 모델을 활용해 뇌파 및 ECoG 데이터를 분석한 결과, 모델의 특징이 신경 활동을 효과적으로 주석화할 수 있음을 확인했습니다.
시각-언어 모델(VLM)의 환각 문제를 해결하기 위해 캡션 오류를 검증, 설명, 위치 식별하는 GAVEL 프레임워크를 제안합니다. 새로운 데이터셋과 벤치마크를 함께 공개하며, 지도 학습 베이스라인이 기존 폐쇄형 모델보다 우수한 성능을 보임을 입증했습니다.
비전문가도 밴딧 알고리즘을 통해 LLM의 탈옥(Jailbreak)을 자동화할 수 있다는 연구 결과를 발표했습니다. 새로운 공격 전략과 함께 대규모 안전성 벤치마크인 FrankensteinBench를 구축하여 모델의 취약성을 입증했습니다.
이질적인 텍스트 소스로부터 지식을 해석 가능한 계층 구조로 조직화하는 용어 중심(Term-centric) 프레임워크를 제안합니다. 문서 수준의 표현 대신 자동 용어 추출과 공유 표현 공간을 활용하여 교차 소스 간의 일관성을 높였습니다.
의료 VQA 모델이 과도하게 확신하는 문제를 해결하기 위해 복합 손실 함수를 활용한 언어화된 불확실성 보정 프레임워크를 제안합니다. MedGemma 및 Qwen2 VL 모델 실험을 통해 예측 정확도를 유지하면서도 보정 오차를 60% 이상 개선했습니다.
다국어 음성 모델의 안전성과 공정성 격차를 조사하고, 이를 평가하기 위한 새로운 벤치마크인 RedVox를 제안합니다. 연구 결과, 비영어권 언어와 음성 입력 환경에서 모델의 취약성이 더욱 증폭됨을 확인했습니다.
MinGram은 Unigram 토크나이저의 복잡한 학습 과정을 단순화한 새로운 방식입니다. BPE 기반 시드 어휘와 가지치기 기법을 통해 학습 효율을 높이면서도 높은 압축률과 우수한 형태소 정렬 성능을 동시에 달성했습니다.
심리학 기반 사고 사슬(Psy-CoT)과 역할 인식 정책 최적화(RAPO)를 통해 범용 역할 수행 에이전트의 성능을 개선하는 연구를 제안합니다. 단순 모방을 넘어 상호작용 인지, 심리학적 공감, 논리적 구성을 통한 동적 사고를 유도합니다.
사법적 재량을 정량화하기 위해 게이트형 멀티태스크 학습(Gated Multi-Task Learning) 아키텍처를 제안합니다. Gemma-4 26B-A4B를 기반으로 판사 정체성과 판결 맥락을 분리하여 모델링함으로써, 기존 SFT 방식보다 적은 파라미터로 SOTA 성능을 달성했습니다.
LLM이 패턴 매칭을 통해 정답을 맞히는지 아니면 유연한 추론을 하는지 검증하기 위해 '수수께끼 수수께끼' 패러다임을 제안합니다. 실험 결과, LLM은 실제 수수께끼보다 문자 그대로의 해석을 요구하는 변형 문제에서 성능이 크게 저하되어, 기존의 높은 성능이 유연한 추론보다는 기억 회상에 의존할 가능성을 시사합니다.
LMM의 유해 비디오 이해 능력을 다각도로 평가하기 위한 새로운 벤치마크인 HarmVideoBench를 제안합니다. 기존의 이진 분류 방식에서 벗어나 세 가지 계층적 차원을 통해 모델의 깊은 맥락 이해도를 측정하며, BCR 방식을 통해 성능을 크게 향상시켰습니다.
LLM의 예측 성능 향상을 위해 희소 오토인코더(SAE)를 사용하여 내부 피처를 분석하고 제어하는 연구입니다. 시간 인지적 피처를 증폭함으로써 모델의 앞서 보기 편향(Look-ahead bias)을 줄이고 일반화 성능을 높일 수 있음을 입증했습니다.
사용자의 의도를 모델링하여 LLM 안전성 분류기의 성능을 높이는 '의도 인식 학습(Intent-Aware Training)' 방법론을 제안합니다. 새로운 데이터셋 AIMS를 통해 SFT, DPO, GRPO 등 다양한 학습 체계에서 의도 모델링의 효과를 입증했습니다.