Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
멀티모달 거대 언어 모델(MLLM)의 실시간 안전 모니터링 능력을 평가하기 위한 새로운 벤치마크 PaSBench-Video를 제안합니다. 기존 정적 방식의 한계를 넘어 운전, 의료 등 4개 영역의 스트리밍 비디오를 통해 모델의 선제적 경고 능력을 정밀하게 측정합니다.
PEFT를 단순한 비용 절감 수단이 아닌, 공유 파운데이션 모델 위에 개인화된 로컬 상태를 구축하는 핵심 기술로 재정의합니다. Scale Up, Down, Out이라는 세 가지 축을 통해 수백만 개의 개인화된 모델을 관리하는 연구 방향을 제시합니다.
언어 에이전트의 지속 학습(Continual Learning) 능력을 엄격하게 평가하기 위한 새로운 프레임워크 AgentCL을 제안합니다. 기존 벤치마크의 한계를 극복하기 위해 구성적 작업 스트림을 구축하고, 메모리 설계의 효과를 진단하는 MemProbe 기법을 통해 에이전트의 학습 및 재사용 능력을 분석합니다.
멀티모달 에이전트가 CAPTCHA와 같은 인간 검증 경계를 통과할 수 있는지 평가하는 새로운 벤치마크 HLL을 소개합니다. 8개의 최첨단 에이전트를 테스트한 결과, 현재의 에이전트들은 복잡한 인터페이스와 행동 일관성 측면에서 여전히 한계를 보였습니다.
식이 장애(ED) 사용자가 LLM을 통해 조언을 구할 때, 모델이 위험한 요청에 비판 없이 적응하여 발생할 수 있는 위해를 체계적으로 평가한 연구입니다. 임상 전문가와의 협업을 통해 특정 언어적 단서가 안전하지 않은 응답을 유도함을 밝혀냈습니다.
NICU와 같은 복잡한 의료 환경에서 다학제적 요약을 위해 문장 단위의 임상 출처를 분류하는 연구를 소개합니다. Llama-3 모델을 SFT로 미세 조정하여 높은 성능을 달성했으며, 모델 규모와 양자화가 성능에 미치는 영향을 분석했습니다.
비영어 입력에 대한 추론 성능 격차를 줄이기 위해, 모델이 직접 이해하기 어려울 때만 선택적으로 영어 번역을 호출하는 Luar 프레임워크를 제안합니다. 강화학습을 통해 번역의 필요성을 판단하도록 학습하며, 특히 저자원 언어에서 뛰어난 성능 향상을 보였습니다.
도구 증강 에이전트가 지연 시간을 줄이기 위해 수행하는 추측적 도구 호출이 사용자 의도를 외부로 유출하는 'Ghost Tool Calls' 문제를 다룹니다. 이를 해결하기 위해 호출 시점에 정책을 적용하는 '추측적 도구 프라이버시 계약'이라는 새로운 런타임 추상화를 제안합니다.
자살 밈의 심각도와 비유적 언어를 분석하기 위한 최초의 데이터셋인 FigSIM을 소개합니다. 1,049개의 밈을 대상으로 심각도, 비유적 현상, 관련 콘텐츠를 주석 처리하여 멀티모달 모델의 성능을 벤치마킹했습니다.
멀티모달 지속적 지시어 튜닝(MCIT) 시 발생하는 치명적 망각과 파라미터 효율성 문제를 해결하기 위한 CRAM 프레임워크를 제안합니다. 중심점 가이드 라우팅과 적응형 MoE를 통해 태스크 간 간섭을 최소화하고 효율적인 능력 확장을 구현합니다.
본 연구는 기존의 구조화된 ADHD 평가 척도가 놓칠 수 있는 신호를 교사의 개방형 서술형 텍스트에서 발견하기 위해 LLM을 활용합니다. 연구 결과, 서술형 데이터와 구조화된 점수는 서로 상호 보완적인 정보를 제공하며, LLM 기반의 주제 발견을 통해 임상적으로 유의미한 행동 패턴을 식별할 수 있음을 입증했습니다.
LLM의 주관적 질문에 대한 응답 프레이밍을 평가하기 위한 자동화된 프레임워크 FRANZ와 데이터셋 SQUARE를 소개합니다. 문화적 포지셔닝, 의인화 등 네 가지 차원을 통해 모델의 의사소통 방식을 분석합니다.
SafeSteer는 LLM의 안전 정렬 과정에서 발생하는 성능 저하(alignment tax)를 최소화하기 위해 제안된 국소적 온폴리시 증류 기법입니다. 안전 토큰에만 집중하여 학습함으로써 범용 데이터 없이도 매우 적은 양의 유해 샘플만으로 높은 안전성과 일반 능력을 동시에 확보합니다.
다국어 ASR 평가 시 서로 다른 문자 표기로 인해 발생하는 WER의 과대평가 문제를 해결하기 위한 SN-WER 지표를 제안합니다. 참조 텍스트와 가설을 표준 문자로 음차하여 계산하는 이 방식은 인도어 환경에서 모델 간 격차를 최대 12% 완화합니다.
응급실 분류 기록을 활용하여 자해를 탐지하는 3단계 머신러닝 접근법을 제안합니다. LLM 기반의 증거 추출 기술을 결합하여 기존 진단 코드의 한계를 극복하고 높은 전이 가능성을 입증했습니다.
LLM의 사후 학습 압축 시 기존의 레이어 단위 방식에서 벗어나 서브모듈 단위로 압축하는 SubFit 기법을 제안합니다. 비연속적인 서브모듈 선택과 경량화된 잔차 바이패스를 통해 높은 정확도와 낮은 퍼플렉시티를 유지하며 추론 속도 및 KV-캐시 효율을 개선합니다.
AdaCodec은 비디오 프레임 간의 시간적 중복성을 활용하여 시각적 토큰을 효율적으로 압축하는 예측형 시각 코드를 제안합니다. 예측 가능한 프레임은 변화량인 P-토큰으로 인코딩하여 토큰 사용량을 줄이고 모델의 성능과 추론 속도를 동시에 개선합니다.
확산 언어 모델(dLLM)의 추론 속도를 높이기 위해 제안된 SimSD 알고리즘을 소개합니다. 이 방식은 별도의 학습 없이도 dLLM에 시간적 문맥을 제공하여 투기적 디코딩을 가능하게 하며, 처리량을 최대 7.46배 향상시킵니다.
에이전트 기술(Agent skills)의 생애주기 전반을 공격하는 새로운 벤치마크 SkillHarm을 소개합니다. 고정 페이로드 오염(FPP)과 자기 변이 오염(SMP) 시나리오를 통해 현재 에이전트 시스템의 보안 취약성을 체계적으로 분석합니다.
ClinEnv는 LLM이 실제 입원 사례와 유사한 환경에서 주치의 역할을 수행하며 의사결정을 내리는 과정을 평가하는 대화형 벤치마크입니다. 기존 정적 벤치마크와 달리 정보 수집 과정과 결정의 품질을 동시에 측정하여 모델의 임상 추론 능력을 정밀하게 분석합니다.