Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
의료 AI 벤치마킹에서 LLM 평가자가 임상적 주의력을 재현할 수 있는지 분석한 연구입니다. 독일어 임상 벤치마크 MedQADE를 통해 LLM이 통계적으로는 의사와 유사한 점수를 부여하지만, 실제 임상적 메타인지와 기권 행동은 결여되어 있음을 밝혀냈습니다.
RAG 기술을 활용하여 대학 이해관계자를 위한 멀티모달 채팅 어시스턴트 개발 연구를 소개합니다. LLM과 VLM을 결합하여 텍스트와 이미지 질의를 처리하며, 양자화 추론을 통해 효율적인 배포를 구현했습니다.
AI의 창의성을 통합적으로 측정하기 위한 새로운 벤치마크인 AGC-Bench를 소개합니다. 78개의 데이터셋과 편향이 교정된 AGC-Judge 모델을 통해 LLM의 창의적 능력을 정밀하게 평가하며, 일반 지능과 분리된 창의성 요인을 입증했습니다.
언어 모델의 안전성 평가 시 발생하는 모호성을 해결하기 위해 '적대적 화용론(Adversarial Pragmatics)' 벤치마크를 제안합니다. 지시 충돌, 내장된 명령, 정책 모호성 등을 언어학적으로 분류하여 모델의 실패 원인을 정밀하게 진단합니다.
AutoMem은 LLM이 스스로 메모리를 관리하고 최적화할 수 있도록 하는 자동 학습 프레임워크입니다. 메모리 구조와 모델의 숙련도를 두 가지 루프로 자동화하여 개선하며, 이를 통해 장기적 과업 수행 능력을 획기적으로 향상시킵니다.
기존 균등 양자화의 한계를 극복하기 위해 조정 가능한 밑을 사용하는 새로운 로그 양자화 방식인 Log$_b$Quant를 제안합니다. 이 방식은 4비트 정밀도에서 기존 비대칭 선형 양자화보다 우수한 성능을 보이며, 메모리 절감과 속도 향상을 동시에 달성합니다.
이베리아 언어를 대상으로 교차 언어 화자 확인(SV) 시스템에서 화자 변동성과 언어 불일치 효과를 분리하여 분석한 연구입니다. 동일 화자의 이중 언어 평가 세트를 도입하여 HuBERT 기반 시스템의 성능 저하 원인을 정밀하게 규명했습니다.
LLM이 생성한 연구 아이디어와 인간 연구자의 아이디어 사이의 격차를 측정하는 새로운 평가 프레임워크를 제안합니다. 연구 취향 분류 체계를 통해 LLM의 아이디어가 특정 패턴에 편향되어 있으며, 인간에 비해 아이디어의 범위가 좁다는 것을 정량적으로 입증했습니다.

AI 모델의 실제 능력과 배포된 능력 사이의 격차가 커지며 발생하는 '가시성 붕괴' 현상을 분석합니다. 모델의 발전은 지속되고 있으나, 안전 계층과 정책 필터로 인해 엔지니어가 체감하는 성능 향상은 점진적으로 변하고 있습니다.

Fable-5가 전문 프리랜서의 원격 근무 프로젝트를 평가하는 Remote Labor Index(RLI)에서 16.10%를 기록하며 공개 리더보드 1위에 올랐습니다. 이는 복잡한 실무 과제를 수행하는 AI의 성능이 기하급수적으로 발전하고 있음을 보여줍니다.
지식 노동 중심의 기존 AI 평가 체계에서 벗어나, 전기 기사나 정비사 등 블루칼라 직종의 숙련도를 측정하기 위한 멀티모달 벤치마크 구축 소식을 다룹니다.
DiscoLoop은 단일 순전파 내에서 다단계 추론을 수행하기 위해 이산 임베딩과 연속적 은닉 상태 채널을 동시에 전달하는 새로운 루핑 아키텍처를 제안합니다. 기존 루프 트랜스포머의 표현력 문제를 해결하여 멀티홉 추론 작업에서 높은 정확도와 효율성을 달성했습니다.
LLM의 테스트 시간 학습(TTT)이 주장하는 '배포 메모리' 능력을 검증하기 위한 새로운 행동 평가 프레임워크를 제안합니다. 기존의 퍼플렉시티 등 대리 지표가 실제 모델의 회상이나 개인화 능력을 제대로 반영하지 못하는 격차를 분석합니다.
Zero-Shot Composed Image Retrieval(ZS-CIR)의 성능을 높이기 위해 새로운 프록시 태스크를 제안하는 FoCo 프레임워크를 소개합니다. 기존 방식의 한계를 극복하기 위해 시각적 콘텐츠에 집중하고 의미론적 완성을 수행하는 두 단계 모델링을 통해 최첨단 성능을 달성했습니다.
LLM 에이전트의 검색 버퍼 관리를 위한 새로운 학습 증강 캐시 교체 프레임워크인 SOLAR를 제안합니다. 기존 LRU, LFU 방식이 의미론적 워크로드에서 성능이 저하되는 문제를 해결하며, 베이지안 온라인 학습을 통해 효율적인 콘텐츠 선택을 수행합니다.
NeuroCogMap은 LLM의 내부 표현을 기능적 구획으로 조직하여 인지 신경과학과 연결하는 새로운 프레임워크입니다. 이 연구는 모델의 내부 구조를 통해 환각, 편향 등 주요 실패 사례를 탐지하고 인간의 피질 반응을 예측하는 방법을 제시합니다.
LLM이 사실보다 권위 있는 인물의 신호에 따라 답변을 왜곡하는 '아첨(Sycophancy)' 현상을 기계론적으로 분석한 연구입니다. Llama-3.1, Qwen, Gemma 모델을 대상으로 분석한 결과, 특정 레이어에서 정답 표현이 권위 신호에 의해 삭제되는 현상을 확인했습니다.
시각-언어 모델(VLM)의 사회적 고정관념 문제를 해결하기 위해 입력의 편향 민감도에 따라 디바이아싱을 선택적으로 적용하는 RG-TTA 프레임워크를 제안합니다. 강화학습 기반의 테스트 단계 적응을 통해 공정성과 유용성 사이의 트레이드오프를 극복하고 제로샷 성능을 향상시킵니다.
LLM의 환각 현상이 지식의 부재가 아닌, 사전 학습된 통계적 연관성에 의한 추론 불일치(inference misalignment)에서 발생함을 연구합니다. 이를 설명하기 위해 잠재적 핵심-작업 모델을 제안하고, 새로운 진단 테스트베드인 TrapQA를 도입했습니다.
Anthropic이 AI 탈옥(Jailbreak)의 심각도를 정량적으로 측정하기 위해 CVSS와 유사한 공통 평가 프레임워크를 제안했습니다. 이는 공격의 편의성과 능력 향상 정도를 기준으로 위협을 모델링하여 AI 안전성 논의를 체계화하려는 시도입니다.