Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
STORM은 비디오-언어 모델(LVLM)의 시공간 추론을 위해 명시적인 텍스트 CoT 대신 잠재 궤적을 활용하는 2단계 프레임워크입니다. 외부 도구나 비디오 재생성 없이도 추론 과정을 내재화하여 지연 시간을 줄이고 정확도를 높였습니다.
LLM 에이전트의 상호작용적 인과 발견 능력을 평가하기 위한 확장 가능한 환경인 CausaLab을 소개합니다. 에이전트가 단순 예측을 넘어 실제 인과 기제를 복구할 수 있는지 검증하며, 현재 모델들이 예측 정확도와 구조적 충실도 사이에서 겪는 격차를 분석합니다.
지식 그래프 도구 사용 시 GRPO 학습 과정에서 발생하는 '피크 후 붕괴(Peak-Then-Collapse)' 현상을 분석한 연구입니다. 모델의 성능 저하가 보상 설계의 문제가 아닌, 인터페이스 피드백의 특성에서 기인함을 밝히고 자기 증류를 통한 완화 방안을 제시합니다.
칠레 서비스 이용약관 내 불공정 조항을 탐지하기 위한 RAG 기반 프레임워크를 제안합니다. 하이브리드 검색과 재순위화 기술을 결합하여 오픈 웨이트 모델에서도 높은 성능을 구현하며, 새로운 법적 조항 데이터셋을 공개합니다.
활성화 오라클(Activation Oracles)의 자연어 출력에 대한 불확실성 정량화 및 신뢰도 보정 방법을 연구했습니다. 6가지 추정 방법을 비교한 결과, 부트스트랩 모드 빈도가 가장 우수한 보정 성능을 보임을 확인했습니다.
다국어 환경에서 텍스트 기반 화자 속성을 정확히 분류하기 위한 인간-LLM 협업 재주석 프레임워크를 제안합니다. 불일치 중심 샘플링과 근거 도출 방식을 통해 WhoSaidIt 데이터셋을 구축하고 LLM의 성능을 분석했습니다.
LLM Judge를 다중 목적 프롬프트로 최적화할 때 발생하는 실패 모드를 분석한 연구입니다. 텍스트 기울기 방법론이 여러 평가 기준을 동시에 처리할 때 발생하는 기울기 희석과 지침 간섭 현상을 규명했습니다.
StakeBench는 시장 참여 의지(market commitment)를 기반으로 언어 이해를 평가하는 새로운 프레임워크입니다. Polymarket 등의 실제 거래 데이터와 코멘트를 연결하여 모델이 단순 감성이 아닌 실제 시장 행동을 얼마나 정확히 파악하는지 측정합니다.
AI 벤치마크의 설계 결함과 환경 의존성을 체계적으로 찾아내는 에이전트 기반 프레임워크인 Auto Benchmark Audit(ABA)을 소개합니다. 168개의 벤치마크를 분석한 결과, 많은 작업에서 모호한 설계와 잘못된 정답이 발견되었으며 이를 필터링할 경우 모델 성능 평가가 크게 달라짐을 입증했습니다.
Transformer 기반 LLM의 컨텍스트 확장성 문제를 해결하기 위해 수면과 유사한 통합 메커니즘을 제안합니다. 최근 컨텍스트를 빠른 가중치로 변환하여 추론 시 지연 시간을 보존하면서도 장기적 과업 수행 능력을 높입니다.
MobileGym은 모바일 GUI 에이전트 연구를 위한 경량화된 브라우저 호스팅 시뮬레이션 플랫폼입니다. 구조화된 JSON 상태를 통해 결정론적 검증과 대규모 병렬 강화학습(RL)을 지원하며, 실제 기기와의 높은 Sim-to-Real 성능 유지력을 보여줍니다.
멀티모달 지속적 지시어 튜닝(MCIT) 연구의 엔지니어링 병목을 해결하기 위한 Prism 프레임워크를 소개합니다. Prism은 플러그인 방식을 통해 기존 MLLM 코드베이스를 수정하지 않고도 새로운 알고리즘을 독립적으로 통합할 수 있게 합니다.
LLM의 긴 컨텍스트 처리 시 발생하는 비용과 성능 간의 트레이드오프를 최적화하기 위한 '효율성 경계(The Efficiency Frontier)' 프레임워크를 제안합니다. 이 프레임워크는 작업 성능, 토큰 비용, 전처리 재사용성을 통합적으로 고려하여 최적의 컨텍스트 관리 전략을 결정합니다.
SemEval-2026 Task 7에 참여한 DFKI-MLT 시스템은 다국어 LLM의 문화적 지식을 강화하기 위해 활성화 유도(activation steering) 기법을 사용합니다. 파라미터 업데이트 없이 언어 벡터를 잔차 스트림에 추가하여 추론 시점 적응을 수행하며, MCQ 트랙에서 86.96%의 정확도를 기록했습니다.
MoE-LLM의 메모리 오버헤드를 해결하기 위해 전문가별 중요도에 따라 비트 너비를 다르게 할당하는 GEMQ 양자화 기법을 제안합니다. 글로벌 선형 계획법과 라우터 미세 조정을 통해 양자화 오차를 최소화하고 추론 효율을 극대화합니다.
명말청초 문집 내 제목을 분석하여 개인 서신과 서문을 구분하는 BERT 기반 분류기 'Lepton'을 소개합니다. 5,438개의 라벨링된 데이터를 통해 bert-base-chinese를 미세 조정하였으며, 이를 통해 명 서신 플랫폼 구축에 기여했습니다.
단문형 개방형 설문 응답 분석을 위해 확률론적 STM과 임베딩 기반 BERTopic의 성능을 비교 평가한 연구입니다. BERTopic이 토픽 일관성 면에서 우수하며, 맥락 증강 전략이 성능 향상에 가장 효과적임을 입증했습니다.
본 연구는 Claude Sonnet 4.5, GPT-5 등 주요 MLLM을 대상으로 언어와 모달리티가 탈옥 공격 취약성에 미치는 영향을 분석했습니다. 영어와 스페인어 간의 공격 성공률 차이를 통해 언어적·시각적 정렬 실패 메커니즘이 서로 다름을 입증했습니다.
본 연구는 LLM을 활용한 정신과적 선별 검사의 신뢰성을 평가하기 위해 SCID 기반 벤치마크를 제안합니다. 5개의 최첨단 모델을 대상으로 증상, 기능적 손상, 보호적 맥락에 대한 가중치 패턴을 분석하여 모델의 진단 정확도와 오류 원인을 조사했습니다.
Fast-dDrive는 자율 주행을 위한 효율적인 블록 확산(Block-Diffusion) VLA 모델을 제안합니다. 기존 AR 모델의 메모리 제한과 확산 모델의 인과 관계 위반 문제를 해결하며, 높은 처리량과 정확도를 동시에 달성했습니다.