Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
LLM Reranker가 스스로 랭킹 품질을 예측할 수 있는지 연구한 논문입니다. 훈련이 필요 없는 자기 일관성 방식과 훈련 기반의 Verb-Num, Verb-List 방식을 비교 분석했습니다.
에이전트들이 동료의 경험을 공유하며 함께 진화하는 사회적 진화 과정을 정량적으로 평가하는 SAGE 프레임워크를 소개합니다. 연구 결과, 공유된 이력은 자기 개선에 정체된 에이전트에게 돌파구를 제공하며, 단순한 로그보다 추상화된 정보가 성능 향상에 더 효과적임을 밝혀냈습니다.
중국어 학술 텍스트 분류의 불균형 문제를 해결하기 위한 AutoTail-BSFGM 방법론을 제안합니다. 자동 게이트형 테일-사전 조정과 Balanced Softmax, FGM 적대적 정규화를 결합하여 추론 시 추가 비용 없이 분류 성능을 향상시킵니다.
파키스탄 Balti 언어를 위한 음성 코퍼스인 BaltiVoice를 소개합니다. OpenAI Whisper-small 모델을 이 코퍼스로 미세 조정하여, 기존 제로샷 성능 대비 단어 오류율(WER)을 획기적으로 낮추는 데 성공했습니다.
LVLM이 밈의 표면적 내용과 실제 화용론적 의도를 혼동하는 문제를 해결하기 위해 Intent Projection 프레임워크를 제안합니다. 이 프레임워크는 표현, 출력, 목적 수준에서 문자적 정보와 화용론적 정보를 분리하여 밈의 숨겨진 의도를 정확히 파악합니다.
CauTion은 통계적 인과 발견의 한계를 극복하기 위해 LLM의 도메인 지식을 앙상블 알고리즘에 안정적으로 통합하는 프레임워크입니다. 합의 필터링과 신뢰 보정 메커니즘을 통해 LLM의 오류를 최소화하고 인과 그래프의 정확도를 높였습니다.
대규모 추론 모델(LRM)이 복잡하거나 상충하는 지시 사항을 따르지 못하는 문제를 해결하기 위해 지식 그래프 기반의 CRGC 프레임워크를 제안합니다. 이 방식은 '가교 제약 조건'을 통해 제약 조건 간의 관계를 모델링하여 모델의 지시 이행 능력을 향상시킵니다.
CoEval은 레이블 데이터나 기존 벤치마크 없이도 언어 모델의 성능을 평가할 수 있는 오픈 소스 프레임워크입니다. 티처 모델을 통해 오염되지 않은 새로운 벤치마크를 합성하고, 교차 패밀리 판사 앙상블을 활용해 모델의 순위를 정확하게 매깁니다.
월드 모델의 구체적 시각적 시뮬레이션과 MLLM의 추상적 추론을 결합하는 '제어된 구체적 추론' 방식을 제안합니다. PF-OPSD 학습법을 통해 미래 비디오를 직접 관찰하지 않고도 정확한 예측과 추론을 수행하며, 벤치마크 테스트에서 성능 향상을 입증했습니다.
미세 조정(Fine-tuning)이 LLM의 안전성에 미치는 영향을 역량(Capability) 관점에서 분석한 연구입니다. 기존의 무작위적 실험 방식 대신 역량 목표를 고정하여 다차원적인 평가를 수행해야 함을 강조합니다.
장문 생성 시 발생하는 환각 스노우볼링 문제를 해결하기 위해 SHARS 프레임워크를 제안합니다. 환각 탐지기를 사용하여 오류가 발생한 세그먼트를 식별하고 재샘플링함으로써 사실적 일관성을 높입니다.
AI 생성 텍스트 탐지의 한계를 극복하기 위해 저확률 토큰의 불확실성에 집중하는 새로운 방법론인 Uncertainty를 제안합니다. 상용구 지배 문제와 단일 확률 점수의 취약성을 해결하여 탐지 성능과 강건성을 높였습니다.
Video-LLM의 계산 오버헤드를 줄이기 위해 제안된 학습이 필요 없는(training-free) 시각적 토큰 압축 기술인 InfoMerge를 소개합니다. Temporal Fingerprint Difference와 콘텐츠 인지형 예산 할당(CABA)을 통해 정보 밀도에 따라 토큰을 동적으로 배분합니다.
시각적으로 풍부한 문서의 유형 분류를 위해 Transformer 및 LLM 기반 멀티모달 모델들을 체계적으로 비교 분석한 연구입니다. RVL-CDIP 벤치마크를 통해 OCR 의존 여부에 따른 성능 차이와 각 모달리티의 기여도를 검증했습니다.
텍스트 기반 에이전트의 추론 비용을 줄이기 위해 여러 환경에서 공통으로 작동하는 경량 신경 재순위화기(reranker) 연구를 소개합니다. DeBERTa-v3를 활용한 공동 학습을 통해 단일 환경 모델에 근접하는 성능과 높은 교차 도메인 전이 효율을 입증했습니다.
CRAFTQA는 테이블과 지식 그래프 등 이기종 구조화된 데이터에 대해 복잡한 추론을 수행하는 새로운 코드 기반 적응형 프레임워크입니다. 기존의 사전 정의된 함수 방식의 한계를 넘어, Python 코드를 동적으로 생성하여 복잡한 연산을 처리합니다.
기존 일관성 학습이 모델의 은폐(obfuscation) 문제를 야기하는 한계를 극복하기 위해 RMCT 기법을 제안합니다. RMCT는 입력 섭동 전반에서 모델의 행동 특성 비율을 일치시켜, 모니터링 가능성을 유지하면서도 행동적 강건성을 향상합니다.
LLM의 의사결정 과정에서 성별 단서가 가치 상충(Value Trade-offs)에 미치는 영향을 분석한 연구입니다. RVDB 벤치마크를 통해 성별 섭동이 모델의 결정 불변성을 해치고 체계적인 결정 반전을 유도함을 입증했습니다.
건강 관련 오정보를 수정하기 위해 이전 경험을 학습하고 스스로 진화하는 LLM 에이전트 프레임워크인 EvoNote를 제안합니다. EvoNote는 세밀한 신용 할당을 통해 경험 메모리를 구축하며, 인간의 노트를 선호하는 높은 품질의 노트를 생성합니다.
SaaS 연동 LLM 에이전트를 겨냥한 간접 프롬프트 주입 위협을 평가하는 새로운 벤치마크 AgentRedBench를 소개합니다. 24개 기업용 서비스를 대상으로 동적 레드팀 테스트를 수행하며, 방어 모델인 AgentRedGuard를 통해 공격 성공률을 획기적으로 낮추는 성과를 입증했습니다.