Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
사용자의 수정 사항을 런타임 규칙으로 컴파일하여 코딩 에이전트의 선호도 준수율을 높이는 TRACE 기술을 소개합니다. 기존 메모리 방식의 한계를 극복하여 에이전트가 사용자의 지시를 지속적으로 준수하도록 돕습니다.
LAUKIN은 호주, 영국, 인도 세 관할권의 법적 동등성을 비교한 새로운 데이터셋입니다. 이 데이터셋은 8가지 계약 유형의 204개 계약에서 추출된 14,727개의 조항 쌍을 포함하며, 수동 레이블링된 3,000개의 샘플로 구성되어 있습니다. 연구진은 이를 활용하여 다중 관할권 법률 NLP 모델의 성능을 평가하고 새로운 벤치마크를 제시했습니다.
최적 운송(Optimal Transport) 이론을 활용하여 NMT 및 요약 모델의 환각을 탐지하는 계층별 분석 방법을 제안합니다. 디코더 계층별 교차 주의 집중 분포를 분석하여 환각 유형을 식별하고, 모델의 해석 가능성을 높이는 연구입니다.
본 연구는 RLHF의 핵심인 보상 모델에서 유용성(Helpfulness)과 무해성(Harmlessness)이라는 상충되는 목표가 어떻게 정렬 긴장(alignment tension)을 형성하는지 탐구합니다. 활성화 기반 방법론을 통해 각 목표와 관련된 뉴런들을 식별하고, 이들이 서로 간섭하며 모델 행동에 불균형한 영향을 미치는 메커니즘을 밝혀냈습니다.
본 논문은 아랍어와 히브리어 같은 동족어 언어를 활용한 LLM의 교차 언어 의미 이해 능력을 평가하는 새로운 벤치마크인 SemCog Bench를 소개합니다. 이 벤치마크는 진정한 동족어, 가짜 친구, 차용어 쌍을 포함하며, 오픈 소스 및 상용 LLMs의 성능을 분석했습니다. 연구 결과, 모델들은 형태 유사성에 과도하게 의존하여 교차 언어 추론에서 결정적인 한계를 보였습니다.
시각적 자기회귀(VAR) 모델의 구조적 특성을 활용한 새로운 이미지 편집 기술인 BitResEdit을 제안합니다. 비트 단위 잔차를 제어하여 텍스트 정렬 성능을 높이면서도 배경 보존력을 유지하는 것이 특징입니다.
TikTok의 정신 건강 인식의 달 기간 동안 영상과 댓글의 주제, 감성, 독성을 분석한 연구입니다. BERTopic과 XLM-T 등을 활용해 콘텐츠 제작자와 시청자의 수용 방식 차이를 정량적으로 규명했습니다.
RAG 시스템에서 재작성 방식이 유발하는 환각 문제를 해결하기 위해 추출(Extraction) 방식을 제안하고 평가한 연구입니다. 행 번호 기반 소스 선택 방식이 정밀도와 재현율 측면에서 기존 방식보다 우수한 성능을 보임을 입증했습니다.
VLM의 시각적 텍스트 이해(VTC) 능력을 향상시키기 위해 어텐션 메커니즘을 활용한 AGAR 방식을 제안합니다. 모델의 중간-후기 레이어 어텐션을 통해 중요한 시각적 패치를 식별하고 이를 확대 렌더링하여 성능을 개선합니다.
제로 소스 환경에서 LLM의 환각을 탐지하기 위한 새로운 패러다임인 HCPD를 제안합니다. 인간의 추론 방식을 모방하여 판단 기준을 해석 가능한 가중치 세트로 분해하고, 약한 지도 학습을 통해 모델을 정렬합니다.
PRISM은 공감형 음성 대화를 위해 음성 인지, 응답 생성, 음성 합성을 분리하여 조정하는 멀티 에이전트 프레임워크입니다. 운율-언어 번역 메커니즘과 외부 지식 도구 호출을 통해 정서적 일치도와 응답 품질을 동시에 개선합니다.
다국어 RAG 환경에서 발생하는 중국어와 영어 증거 간의 충돌 문제를 진단하고 처리하는 X-MADAM-RAG 프레임워크를 제안합니다. 새로운 벤치마크인 X-RAMDocs-ZHEN을 통해 증거 충돌 상황에서의 모델 성능과 한계를 심층 분석했습니다.
소셜 웹 하이라이팅 패턴이 개인의 일시적인 상태(state)인지 지속적인 특성(trait)인지 분석한 연구입니다. 24개월 이상의 장기 추적 결과, 개인의 선택 시그니처는 시간이 지나도 매우 안정적으로 유지됨을 확인했습니다.
SENTINEL은 언어 모델 에이전트의 도구 사용 능력을 향상시키기 위해 실패 기반 강화학습 프레임워크를 제안합니다. 컨트롤러, 제안자, 솔버 루프를 통해 모델의 오류 패턴을 분석하고 이를 타겟팅한 학습 태스크를 생성하여 학습 효율을 극대화합니다.
MDForge는 LLM 에이전트를 활용하여 복잡한 분자 역학(MD) 파이프라인 설계를 자동화하는 연구입니다. 다중 에이전트 토론과 언어적 보상을 통해 희소한 시뮬레이터 피드백 환경에서도 전문가 수준의 코드 생성이 가능합니다.
베트남어 음성 번역(ST) 시스템의 ASR 오류 전파 문제를 해결하기 위한 새로운 데이터 증강 기법인 PiDA를 제안합니다. 음성적 유사성을 기반으로 단어를 교체하여 ASR 오류와 유사한 데이터를 생성함으로써 번역 성능을 향상시킵니다.
LLM의 정치적 편향성을 측정하기 위한 새로운 다지선다형 벤치마크인 Polar를 소개합니다. 미국과 한국의 정치적 맥락을 반영하여 38개 모델을 평가한 결과, 언어와 이슈에 따라 편향성이 체계적으로 변화함을 확인했습니다.
PolyAlign은 언어 모델이 단일한 전역 비서 행동에 맞춰지는 문제를 해결하기 위해 제안된 분포 인식 정렬 프레임워크입니다. 이는 상호작용 맥락에 맞는 인간 응답 분포와 일치하도록 모델을 훈련하며, 버킷별 SFT와 HDPO를 결합합니다.
본 논문은 LLM이 생성한 텍스트에서 다원적 격차(pluralistic gap)를 식별하는 비지도 다층 프레임워크를 제안합니다. 이 프레임워크는 책 리뷰와 같은 다양한 관점을 가진 데이터셋으로 평가되었으며, 모델들이 광범위한 스펙트럼을 포괄하려 하지만 희귀한 관점은 여전히 과소 대표됨을 보여줍니다.
본 연구는 다국어 커뮤니티에서 흔한 혼합 언어 질의(mixed-language querying)가 밀집 검색기 성능에 미치는 영향을 분석했습니다. mMARCO 데이터셋을 활용하여 임베딩 레벨의 혼합 비율을 체계적으로 조절하며 검색 성능을 평가했습니다. 실험 결과, 비영어 문서 인덱스에서는 혼합이 유익했으나 영어 포함 인덱스에서는 순수 영어가 가장 효과적이며, 영어는 모든 비영어 언어에 강력한 파트너 역할을 함을 발견했습니다.