Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 온디바이스 환경에서 개인 식별 정보(PII)를 처리하는 새로운 파이프라인을 제안합니다. 기존의 PII 삭제 방식이 후속 NLP 작업에 유용성을 저해하는 문제를 해결하기 위해, 이 시스템은 탐지된 PII를 일관되고 유형을 보존하는 가짜 값으로 치환합니다. 특히, 단순한 고정 예시 사용 시 발생하는 SLM의 '메아리 현상(regurgitation)' 문제를 로케일 조건부 회전 퓨샷 예시(locale-conditioned rotating few-shot demonstrations)를 통해 해결하고, 이 하이브리드 접근 방식이 다양한 평가 지표에서 우수한 성능을 보임을 입증합니다.
본 논문은 개인화된 광고 이미지와 텍스트 생성을 위해 통합 자기회귀 모델(Unified Autoregressive Models)을 제안합니다. 기존 방식들이 이미지와 텍스트를 분리하여 처리해 정렬에 어려움이 있었던 문제를 해결하고자, 본 연구는 두 요소를 단일 토큰 시퀀스로 처리하는 통합 프레임워크를 도입했습니다. 이를 통해 광고의 일관성과 품질을 높여 사용자 요구사항에 맞는 고도로 개인화된 콘텐츠 생성이 가능함을 입증했습니다.
기존의 자동 오정보 탐지는 기사에 명시적으로 드러나는 거짓 정보를 잘 포착하지만, 배경 지식이나 생략된 맥락을 통해 오도하는 유형의 오정보에는 취약합니다. 본 논문은 이러한 '누락 관련 설정(omission-relevant setting)'에 초점을 맞춰, 대상 문장에 누락된 사실을 명시적으로 재구성하고 이를 그래프 추론 기반의 교차 출처 관계로 활용하는 검색 가이드형 탐지기인 LCV를 제안했습니다. LCV는 시간 순서로 정렬된 맥락 기사를 검색한 후, LLM에게 각 문장-기사 쌍에 대한 누락 맥락 설명을 생성하게 하고, 이를 이종 그래프 구조에 통합하여 오정보 탐지의 성능을 크게 향상시켰습니다.
본 연구는 기존의 DPO(Direct Preference Optimization)가 전체 시퀀스 선호도를 모델링하는 한계를 극복하고, 토큰 수준의 선호도 최적성(token-level preference optimization)을 회복하는 방법을 제시합니다. 이를 위해 'Token-level Bregman Preference Optimization (TBPO)'라는 새로운 프레임워크를 도입했습니다. TBPO는 표준적인 시퀀스 수준 쌍체 비교만을 사용하면서, 토큰별 다음 행동에 대한 선호도 모델을 가정하고 일반화된 목적 함수(Bregman-divergence 밀도 비율 매칭)를 도출합니다. 실험 결과, TBPO는 다양한 벤치마크에서 기존의 강력한 시퀀스 및 토큰 수준 베이스라인 대비 정렬 품질과 학습 안정성을 개선하고 출력 다양성을 증가시키는 성능을 보였습니다.
확산 대규모 언어 모델(dLLMs)은 효율적인 텍스트 생성을 위한 유망한 방법이지만, 강화학습 기반의 사후 학습 적용에 어려움이 있습니다. 기존 정책 최적화 기법들은 dLLMs에서 다루기 쉬운 시퀀스 수준 로그 비율을 확보하기 어렵고, 이로 인해 높은 분산과 불안정한 훈련 문제를 야기합니다. 본 논문은 이러한 문제를 해결하는 새로운 방법(RSPO)을 제안하며, 이는 수학적 추론 및 계획 작업에서 강력한 성능 향상을 입증했습니다.