Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM의 장문 생성 시 발생하는 환각 문제를 해결하기 위해, 주장의 불확실성에 따라 검증 기준을 조정하는 FACTOR 프레임워크를 제안합니다. FACTOR는 불확실성 추정 및 적응형 검증을 통해 검증 비용을 최적화하면서도 사실성을 높입니다.
LLM의 반복적 퇴보와 단조로움을 유발하는 '우도 함정'을 해결하기 위한 새로운 디코딩 기법인 VCM을 제안합니다. VCM은 별도의 훈련 없이 PMI와 적응형 자기 디바이아싱을 통해 확률 분포를 동적으로 재형성하여 생성 품질을 높입니다.
자기회귀 시각 모델(AVM)의 생성 과정에서 발생하는 의미론적 오류를 해결하기 위한 새로운 프레임워크 Gazer를 제안합니다. MLLM의 피드백을 활용하여 추가 훈련 없이도 이미지와 비디오의 생성 품질 및 정렬 성능을 높입니다.
macOS 환경에서 AI 에이전트의 성능을 정밀하게 측정하기 위한 새로운 벤치마크인 MacAgentBench를 제안합니다. 기존의 이진 평가 방식에서 벗어나 GUI와 CLI 상호작용을 포함한 다중 애플리케이션 작업과 세밀한 다중 체크포인트 점수 산정 방식을 도입했습니다.
멀티모달 사고의 연쇄(CoT) 추론의 효과와 한계를 체계적으로 분석한 연구입니다. CoT가 수학 및 과학 추론에는 효과적이지만, 인지 작업에서는 시각적 접지 성능을 저하시키는 부작용이 있음을 밝혀냈습니다.
자연어 설명을 도메인 특화 언어(DSL) 코드로 변환하는 Text2DSL 연구를 확장하여, 문맥 인식 증류 방식과 구조적 요인 절제 연구를 수행했습니다. DeepSeek-V4-Flash를 활용해 검증된 PolkitBench 코퍼스를 구축하고, 구조적 문맥이 코드 생성 성능에 미치는 핵심적인 역할을 입증했습니다.
소형 언어 모델(SLM)이 특정 작업 적응(task adaptation)을 통해 제로샷 성능의 대규모 언어 모델(LLM)을 능가할 수 있음을 입증한 연구입니다. 10억 파라미터 미만의 모델이 일반 및 문학적 관계 추출 작업에서 GPT-5.4나 Claude Sonnet 4.6보다 높은 성능을 보였습니다.
설형문자 점토판의 자동 해독을 위해 DETR 기반의 객체 탐지 모델을 활용한 연구입니다. 대규모 주석 데이터셋을 통해 시각적 문자 탐지와 텍스트 구조를 통합하는 엔드투엔드 시스템을 제안하며, 기존 연구 대비 성능을 크게 개선했습니다.
다국어 언어 모델의 토큰화 성능 격차를 해결하기 위해 국제 음성 기호(IPA)를 활용한 언어 중립적 입력 표현 방식을 제안합니다. 실험 결과, IPA 기반 토큰화는 비라틴 스크립트에서 품질을 향상시키고 미학습 언어에 대한 일반화 성능이 뛰어남을 입증했습니다.
과학 논문의 텍text, 표, 그림 등 멀티모달 소스에서 구조화된 정보를 추출하는 에이전트 하네스 'Beaver'를 소개합니다. Beaver는 멀티모달 증거 툴링과 태스크 스캐폴딩을 통해 추론 과정을 감사 가능하게 만들며, 기존 에이전트 대비 높은 성능을 입증했습니다.
Metanym Game은 인지 과학 구조를 기반으로 LLM의 구조적 지능을 측정하는 새로운 경쟁적 단어 게임 벤치마크입니다. 정답지나 오라클 모델 없이 피어 커뮤니티의 상호 평가를 통해 사실적 정확성과 유추 능력을 검증하며, 데이터 오염을 방지하도록 설계되었습니다.
LLM 공격자가 사이버 기만(Cyber Deception) 전략에 어떻게 반응하는지 평가하는 Honeyquest 프레임워크를 소개합니다. 연구 결과, LLM은 인간과 달리 기만 트랩을 인식하면서도 실제로는 이를 악용하는 '인식-행동 간극'을 보이며, 인간 중심의 방어 가설이 AI에게는 적용되지 않음을 입증했습니다.
LLM을 활용하여 이벤트 온톨로지를 확장하는 새로운 프레임워크인 ConceptE를 제안합니다. 기존 방식의 한계인 문맥적 혼동을 해결하기 위해 LLM으로 개념 수준의 의미론을 도출하고 이를 트리거 정보와 공동 인코딩하여 클러스터링과 계층 확장 성능을 높였습니다.
DistilBERT 기반 자동 에세이 채점(AES) 시스템에서 인구통계학적 메타데이터를 텍스트와 결합할 때 발생하는 성능 저하를 연구했습니다. 실험 결과, 메타데이터를 조기 융합하는 방식은 예측 정확도를 낮추고 채점 편향을 악화시키는 것으로 나타났습니다.
다중 레이블 감정 어노테이션의 주관성과 어노테이터 간 불일치가 NLP 모델에 미치는 영향을 분석한 연구입니다. 하드 레이블 대신 소프트 투표 점유 레이블을 사용하여 모델의 불확실성을 더 효과적으로 반영하는 평가 프레임워크를 제안합니다.
전역 의존성과 지역적 패턴을 동시에 효과적으로 모델링하기 위해 FiLM(Feature-wise Linear Modulation)을 활용한 이중 분기 Transformer 구조를 제안합니다. 두 분기 간의 동적인 채널별 조정을 통해 단일 분기 모델보다 우수한 성능과 파라미터 효율성을 입증했습니다.
OTTER는 LLM의 독성 기반 중재 필터를 우회하기 위한 블랙박스 레드팀 프레임워크입니다. 단 5개의 토큰 교체만으로 표면적 독성과 적대적 의도를 분리할 수 있음을 증명하며, 공격 성공률(ASR)을 대폭 향상시켰습니다.
LLM의 자살 충동 탐지 메커니즘을 분석하기 위해 검증 게이트 기반의 프레임워크를 제안합니다. 모델의 내부 특징이 단순 어휘적 베이스라인을 넘어 의미론적이고 인과적인 역할을 수행함을 기계론적으로 입증했습니다.
다회차 탈옥(Multi-turn jailbreaks)을 탐지하기 위해 긴 컨텍스트 연결 없이도 효율적인 계층적 어텐션 트랜스포머 모델을 제안합니다. 이 모델은 대화의 역동성을 포착하며, 기존 Claude Opus 모델보다 높은 F1 점수를 기록하고 오탐률을 절반으로 낮췄습니다.
GRAG는 개인화와 근거 제시(Grounding)를 분리하여 대화형 에이전트의 성능을 높이는 새로운 프레임워크입니다. 범용 LLM의 응답을 스캐폴딩으로 활용해 작은 모델이 페르소나 주입에만 집중할 수 있도록 설계되었습니다.