Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
목표 지향적 에피소드 작업에서 규칙 유도 능력을 평가하는 새로운 벤치마크인 HERO'S JOURNEY를 소개합니다. LLM이 시연을 통해 숨겨진 규칙을 추론하고 실행하는 능력을 분석하며, 특히 절차적 유도에서의 한계를 지적합니다.
Text-to-SQL 에이전트의 성능 향상을 위해 에피소드와 턴 수준의 메모리를 결합한 MERIT 프레임워크를 제안합니다. 강화학습과 프로세스 보상 모델을 활용하여 상호작용 단계에 최적화된 메모리 검색을 수행합니다.
도구 사용 언어 모델이 악의적인 지침을 전달받는 채널(사용자 메시지, 도구 메타데이터, 도구 출력)에 따라 취약성이 달라지는 '안전 비대칭성'을 연구했습니다. 실험 결과, 에이전트 특화 모델과 범용 모델 간의 취약성 패턴이 다르게 나타남을 확인했습니다.
본 연구는 VLM 증류 과정에서 언어 사전 지식과 시각적 접지 간의 그래디언트 직교성을 발견하고, 이를 수학적으로 분해하여 제안합니다. 시각적 접지 성능을 높이기 위해 업데이트 벡터를 동적으로 재정렬하는 Visual Gradient Steering(VGS) 기법을 통해 기존 방식보다 뛰어난 성능을 입증했습니다.
LinguIUTics 팀은 PsyDefDetect 2026 태스크에서 Qwen3-8B를 활용해 심리적 방어 기제 탐지 성능을 크게 향상시켰습니다. 클래스 불균형 문제를 해결하기 위해 QLoRA 미세 조정과 어휘 증강, 로짓 편향 튜닝 등의 전략을 사용했습니다.
파라미터 기반 지식 편집이 LLM의 추론 능력을 저해하는 이론적 한계를 분석합니다. 차원 붕괴 가설을 통해 국소적 수정이 전역적 간섭을 일으키는 과정을 설명하며, 검색 기반 방식이 파라미터 편집보다 우수함을 입증합니다.
텍스트와 이미지, 샌드박스 도구 사용 능력을 갖춘 코딩 에이전트가 네이티브 옴니모달 모델만큼 강력한 성능을 낼 수 있음을 입증했습니다. 이들은 미디어 스트림을 직접 처리하는 대신 코드를 통해 정보를 검색하고 처리하는 방식으로 문제를 해결합니다.
다중 정답 질의응답(Multi-Answer QA) 환경에서 도구 사용 에이전트의 성능을 높이기 위한 강화학습 프레임워크 SPADER를 제안합니다. 단계별 신용 할당과 다양성 인지 탐색 보상을 통해 롱테일 엔티티 발견 능력을 강화했습니다.
LUNA는 언어학적 인지 기반의 비왜곡 LLM 워터마킹 기술을 제안합니다. 형태론과 품사 문맥을 활용하여 모델의 출력 품질 저하를 최소화하면서도 다국어 환경에서 효과적인 워터마크 탐지가 가능함을 입증했습니다.
본 논문은 다국어 LLM을 사회 과학 및 인문학 연구를 위한 해석학적 도구로 재개념화하며, 기존 NLP 벤치마크의 한계를 극복하기 위한 새로운 평가 프레임워크를 제안합니다. 문화적 정렬과 교차 언어적 안정성을 포함한 이론적 근거를 바탕으로 책임감 있는 LLM 통합 방법론을 다룹니다.
MemPro는 자율 에이전트의 메모리 구축-검색(MCR) 파이프라인 전체를 진화 가능한 프로그램으로 취급하는 새로운 프레임워크입니다. 기존의 고정된 파이프라인 한계를 극복하기 위해 버전 트리를 통해 실패 모드를 진단하고 시스템을 지속적으로 개선합니다.
자기 증류 과정에서 발생하는 스타일 편향과 노이즈를 해결하기 위해 분포 정렬 자기 증류(DASD) 기법을 제안합니다. 답변 인지 참조 모델을 통해 유용한 논리적 지식은 보존하고, 분포에 맞지 않는 스타일 노이즈는 동적으로 필터링하여 추론 성능을 높입니다.
MoE 모델의 '안전 희소성' 문제를 해결하기 위해 제안된 MESA 프레임워크를 소개합니다. 최적 운송(OT) 이론을 활용하여 안전 책임을 전문가들에게 전략적으로 분산함으로써, 모델의 유용성을 유지하면서도 유해성 방어 성능을 극대화합니다.
AXIOM은 수학적 추론의 신뢰성을 높이기 위해 언어 모델을 정형화 도구로 활용하는 신경-기호(neuro-symbolic) 아키텍처입니다. 비정형 텍스트를 결정론적 컴퓨터 대수 시스템(CAS)용 스키마로 변환하여 정답을 도출하며, 높은 정확도와 낮은 지연 시간을 동시에 달성했습니다.
FineVerify는 에이전트 기반 검색의 성능을 높이기 위해 테스트 시간 연산을 확장하는 세밀한 자기 검증 프레임워크입니다. 질문을 검증 가능한 하위 질문으로 분해하고 각 단계별로 점수를 매겨 최적의 후보를 선택함으로써 모델의 정확도를 크게 향상시킵니다.
충실한 질의응답을 위해 설계된 소형 언어 모델(SLM) 제품군인 OCC-RAG를 소개합니다. 대규모 합성 데이터 파이프라인을 통해 멀티홉 추론과 문맥 충실도를 극대화하여, 작은 규모로도 거대 모델을 능가하는 성능을 입증했습니다.
확산 언어 모델(Diffusion Language Models)의 CFG 제약 조건 하에서의 추론 속도 저하 문제를 해결하기 위한 EPIC 프레임워크를 제안합니다. 어휘 분석 메모이제이션과 Earley 스타일 파싱을 통해 병렬 디코딩의 장점을 유지하며 추론 시간을 대폭 단축했습니다.
CNF를 활용하여 고차원 데이터의 OOD 탐지 문제를 해결하기 위한 LSF 프레임워크를 제안합니다. 생성 모델의 가능도 역설 문제를 분석하고, 속도장을 기반으로 한 기하학적 진단 신호를 통해 음성 합성 모델의 발음 오류를 효과적으로 탐지합니다.
WaveFilter는 Diffusion LLM의 긴 문맥 처리 시 발생하는 계산 오버헤드와 지연 시간을 해결하기 위한 새로운 캐싱 프레임워크입니다. 웨이브릿 변환을 활용해 핵심 토큰을 정밀하게 식별하고 희소 KV 캐시를 구축하여 성능을 높입니다.
LLM의 장기적 상호작용에서 사용자의 성격에 맞춘 개인화된 공감 능력을 연구합니다. 이를 위해 PersonaEmp 데이터셋과 보상 모델링 프레임워크인 PereGRM을 제안하여 공감 전략의 성능을 향상시켰습니다.