Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
멀티모달 대규모 추론 모델(MLRM)의 복잡한 시각적 추론 능력을 평가하기 위한 새로운 벤치마크 VistaHop을 소개합니다. 기존 벤치마크가 놓치고 있는 반복적 이미지 조사와 멀티홉 근거 통합 능력을 측정하며, 실험 결과 현재 모델들의 성능이 매우 낮음을 확인했습니다.
동남아시아 문화권의 이해도를 측정하기 위한 새로운 NLI 벤치마크인 SEA-NLI를 소개합니다. 8개국 언어를 대상으로 실험한 결과, 기존 모델들이 문화적 지식 부족으로 인해 지식 집약적 분야에서 낮은 성능을 보임을 확인했습니다.
본 연구는 영어 중심의 언러닝 연구를 넘어 5개 언어로 확장된 다국어 언러닝의 전이성과 역학을 분석합니다. 언러닝이 주로 후기 디코딩 레이어에서 표면적 억제를 유도한다는 점을 발견했으며, 이를 통해 언러닝된 지식을 상당 부분 복구할 수 있음을 입증했습니다.
TV 시리즈의 장편 서사를 이해하기 위한 멀티홉 추론 벤치마크인 SagaQA를 소개합니다. 기존의 국소적 이해를 넘어 에피소드 간 정보를 연결하는 장거리 추론 능력을 평가하며, 다양한 에이전트 계획 전략의 성능을 분석합니다.
저자원 아프리카 언어의 자연어 추론(NLI) 성능을 높이기 위한 다양한 프롬프팅 전략을 연구했습니다. Llama3.2와 Gemma 모델을 대상으로 실험한 결과, 대조적(Contrastive) 프롬프팅이 가장 안정적인 성능 향상을 보였습니다.
기존 LLM 벤치마크가 실제 사용자의 모호함과 비협조적 행동을 반영하지 못하는 한계를 극복하기 위해 RUT-Bench를 제안합니다. 19개 모델을 테스트한 결과, 복잡한 비이상적 시나리오에서 모든 모델의 성공률이 40% 미만으로 나타났습니다.
CAPER은 Text-to-SQL 시스템의 성능 향상을 위해 SQL 추상 구문 트리(AST)를 활용한 절(Clause) 수준의 감독 프로세스를 제안합니다. 이를 통해 오류의 근본 원인을 파악하고 보상 모델링을 최적화하여 실행 정확도를 크게 개선했습니다.
소비자 기기 수리 질문에 대한 LLM의 성능을 평가하기 위해 Reddit 데이터를 기반으로 한 새로운 벤치마크를 제안합니다. 정확성, 완전성, 실용성, 안전성 기준을 통해 6개 모델을 분석한 결과, LLM이 유용할 수 있으나 고위험 수리 작업에는 여전히 신뢰도가 낮음을 확인했습니다.
SemEval-2026 Task 9를 위해 Lingo_Research_Group이 제안한 양극화 탐지 연구입니다. 12개의 다양한 프롬프트 설계를 통해 aya-101 및 Gemma3-27B 모델의 성능을 다국어 환경에서 평가했습니다.
이미지의 객관적 사실과 주관적 정서적 측면을 모델링하는 P-Topics 개념과 이를 구현하는 PercepT 아키텍처를 제안합니다. 비지도 학습을 통해 시각-텍스트 클러스터를 동적으로 발견하고 이미지를 관련 지각 경험에 매핑하는 2단계 구조를 가집니다.
SLM(소형 언어 모델)의 심리측정 평가 시 모델의 출력이 실제 추론 능력이 아닌 프롬프트 구성 요소에 의한 아티팩트를 측정할 위험이 있음을 밝힙니다. 연구팀은 프롬프트 변형 프레임워크를 통해 모델이 심리적 특성보다 프롬프트 준수 여부에 더 크게 반응함을 증명했습니다.
잔차 연결(Residual Connection)과 소프트 어텐션(Soft Attention)을 결합한 경량 LSTM 아키텍처인 ResLSTM-SA를 제안합니다. 이 모델은 매우 적은 파라미터로도 기존 대규모 모델에 필적하는 음성 감정 인식 성능을 보여줍니다.
기업의 비공개 비즈니스 지식과 긴 컨텍스트를 활용한 Text-to-SQL 능력을 평가하기 위한 새로운 벤치마크 EntSQL을 소개합니다. 기존 벤치마크가 간과한 조직 규칙과 도메인 지식 기반의 SQL 생성 난이도를 입증합니다.
고객의 행동을 보고 의도를 추론하여 선제적으로 개입하는 SII 프레임워크와 PIWM 모델을 제안합니다. AIDA 및 BDI 모델을 활용해 고객 상태를 예측하며, 새로운 벤치마크인 GuidanceSalesBench를 통해 성능을 검증했습니다.
LVLM의 환각 현상과 시각적 강건성 문제를 해결하기 위해 제안된 P²-DPO 학습 패러다임을 소개합니다. 모델이 스스로 온-폴리시 선호 쌍을 생성하고 보정 손실을 사용하여 시각 정보와 텍스트 생성을 정밀하게 정렬합니다.
MoE 모델 병합 시 발생하는 라우팅 붕괴 문제를 해결하기 위한 새로운 연구를 소개합니다. Hessian-Aware Router Calibration(HARC)은 재학습 없이 2차 곡률 정보를 활용하여 병합된 라우터를 효과적으로 보정합니다.
임상 환경에서 LLM 사용 시 발생하는 개인정보 유출 위험을 줄이기 위해, 민감한 토큰만을 선택적으로 암호화하는 HERALD 프레임워크를 제안합니다. 이 방식은 문맥을 보존하면서도 모델 변경 없이 클라이언트 측에서 작동하여 데이터 보안과 모델 성능 사이의 균형을 맞춥니다.
Transformer 모델이 Counter Language를 처리할 때 학습하는 스택 표현의 인과적 역할을 분석한 연구입니다. 선형 프로브를 통해 추출한 스택 깊이 방향을 제거했을 때 모델의 성능이 완전히 붕괴됨을 입증했습니다.
대화형 AI 에이전트의 메모리 일관성을 위해 LLM 요약 대신 수학적 점수 산정 방식을 사용하는 결정론적 메모리 프레임워크(DMF)를 제안합니다. DMF는 로지스틱 투영과 생존 점수를 활용하여 토큰 비용을 획기적으로 줄이면서도 높은 정확도를 유지합니다.
지시어 튜닝된 LLM이 베이스 모델보다 캘리브레이션 성능이 떨어지는 원인을 분석한 연구입니다. 채팅 템플릿이 '소유권 편향'을 유발하여 모델이 자신의 답변에 과도한 확신을 갖게 함을 밝히고, 이를 개선하기 위한 추론 시점의 프레이밍 전략을 제안합니다.