Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이커머스 대화 시스템에서 추론 정확도와 언어적 자연스러움을 동시에 최적화하는 MORE 프레임워크를 제안합니다. 제약 조건 기반의 정책 최적화를 통해 추가적인 추론 오버헤드 없이 두 목표를 균형 있게 달성합니다.
SG-OPD는 온폴리시 증류(OPD) 과정에서 발생하는 궤적 불일치와 토큰 신뢰성 문제를 해결하기 위한 새로운 방법론을 제안합니다. 부호 일관성 게이팅과 단계적 교사 샘플링을 통해 수학적 추론 성능을 크게 향상시켰습니다.
본 연구는 상용 및 오픈 소스 LLM을 활용하여 우크라이나어 문법 오류 교정(GEC) 성능을 평가합니다. 제로샷, 퓨샷, 프롬프트 최적화 전략을 비교한 결과, 최소 편집 프롬프트와 LLM 지원 최적화 조합이 가장 우수한 성능을 보였습니다.
PBSD는 장기적 에이전트 작업에서 발생하는 신용 할당 문제를 해결하기 위해 베이지안 보정 자기 증류 방법론을 제안합니다. 베이즈 정리를 활용해 희소한 최종 보상을 턴 수준의 정밀한 신호로 변환하여 에이전트의 학습 효율과 일반화 성능을 높입니다.
LLM이 개별 사실을 알고 있음에도 이를 결합해 추론하는 멀티홉 추론에 실패하는 현상을 분석합니다. 연구 결과, 이러한 실패는 지식의 부재가 아닌 사전 학습 과정에서 합성적 문맥에 노출되지 않았기 때문임을 입증했습니다.
본 연구는 LLM의 인컨텍스트 러닝(ICL)을 활용하여 설문 데이터의 결측치를 보정하는 새로운 방법을 제안합니다. 다양한 결측 메커니즘 환경에서 기존 통계적 방법론인 MICE PMM보다 우수한 성능을 보였으며, 특히 비무작위 결측(MNAR) 상황에서 큰 개선을 입증했습니다.
SkeMex는 모델 가중치 업데이트 없이 기술 기반 메모리를 통해 의료 에이전트를 개선하는 자기 진화 프레임워크입니다. 상호작용 궤적을 구조화된 기술로 증류하고, 환경 피드백을 통해 유용한 메모리를 선별적으로 관리하여 임상 추론 능력을 강화합니다.
음성 신호를 동결된 LLM에 통합할 때 발생하는 정보 손실 문제를 해결하기 위해 Convex Gate(C-Gate)를 제안합니다. C-Gate는 음성 표현을 LLM의 임베딩 매니폴드 내 볼록 조합으로 제한하여 연속적인 표현력과 모델 호환성을 동시에 확보합니다.
기존의 참조 없는 충실도 지표가 정밀도(Precision)에만 치중되어 모델의 절제(Abstention) 현상을 보상하는 문제를 지적합니다. F1 레이스 및 기상 예보 데이터를 활용해 재현율(Recall)을 포함한 커버리지 인식 평가의 필요성을 입증하고 새로운 지표를 제안합니다.
검증 가능한 보상이 동일하여 학습 신호가 부족한 문제를 해결하기 위해 Reasoning Arena 프레임워크를 제안합니다. 판사 시스템을 통해 추론 과정 간의 세밀한 선호도를 비교하는 '추론 토너먼트'를 구성하여 효율적인 강화학습을 가능하게 합니다.
SFT 과정에서 발생하는 과적합 문제를 해결하기 위해, 동결된 사전 학습 모델의 분포를 활용하는 PriFT 기법을 제안합니다. 모델의 사전 지식을 왜곡하지 않도록 토큰 가중치를 재설정하여 일반화 성능과 RL 초기화 상태를 개선합니다.
LLM의 개방형 법률 응답 신뢰성을 평가하기 위한 루브릭 기반 벤치마크인 LexRubric을 소개합니다. 649개의 법률 인스턴스와 12,337개의 세밀한 채점 기준을 통해 모델의 오류 원인을 정밀하게 진단합니다.
본 연구는 창의성의 근간인 연상 지식을 모델링하기 위해 6가지 인지 과업을 결합한 멀티플렉스 의미 네트워크를 제안합니다. 다국가 데이터를 통해 단일 과업보다 다중 과업 기반의 네트워크가 창의성을 더 풍부하게 포착함을 입증했습니다.
구조화된 출력(Structured Output)이 모델의 추론 성능에 미치는 영향을 분석한 연구입니다. 형식 지정은 모델의 여유 용량에 따라 성능 저하를 유발하며, 이는 단순한 토큰 부족이 아닌 용량 경쟁 문제임을 밝혀냈습니다.
LLM 에이전트의 기술(skill) 재작성 시 발생하는 품질과 비용 간의 트레이드오프를 연구합니다. 단순 프롬프트 압축을 넘어, 운영 지식 공학 관점에서 정보 보존 전략을 통해 비용을 절감하면서도 에이전트의 성능을 유지하는 방법을 제안합니다.
본 연구는 쌍체 비교(Pairwise Comparisons)와 Elo 점수 방식이 생성 모델의 정확도 순위와 강력하게 일치함을 입증합니다. 벤치마크를 자유 형식 평가로 변환했을 때 정확도와 0.9 이상의 높은 상관관계를 보이며, 판사 편향의 영향을 최소화할 수 있음을 확인했습니다.
음성 중심의 차례 주고받기 예측 프레임워크를 수어 상호작용으로 전이하는 초기 연구를 다룹니다. 포즈 기반 특징을 활용해 수어 활동을 예측하며, 손 신호를 통한 SHIFT/HOLD 예측의 가능성과 SHIFT 예측의 한계를 제시합니다.
MUDIDI는 스캔된 다국어 사전을 기계 판독 가능한 형식으로 변환하기 위한 2단계 프레임워크입니다. 문자 인식 및 마크업 보존, 사전 항목 분할 및 스키마 매핑 과정을 통해 저자원 언어의 디지털화를 지원합니다.
위기 상황에서 VLM(시각-언어 모델) 운영자의 통신 능력을 평가하기 위한 새로운 벤치마킹 프레임워크를 제안합니다. 시뮬레이션된 대피 환경에서 통신 전략과 환경 표현 방식이 민간인 에이전트 안내 성공률에 미치는 영향을 분석했습니다.
자동 형식화(Autoformalization) 작업에서 정답 참조 없이도 추론의 정확성을 검증할 수 있는 '프록시 판사(Proxy-Judge)' 프레임워크를 제안합니다. 축별 속성 검사를 통해 오류를 식별하고 이를 수정하는 성찰적 정교화 루프를 통해 모델의 성능을 높입니다.