Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
BayesPO는 프롬프트 최적화를 이산 토큰에 대한 베이지안 사후 샘플링 문제로 정의하는 새로운 연구 프레임워크입니다. 병렬 템퍼링과 Langevin 기반 Gibbs 샘플러를 결합하여 LLM의 복잡한 에너지 지형에서 전역적 최적 프롬프트를 탐색합니다.
LLM 워터마크 기술이 법적 증거로서 갖는 포렌식적 신뢰성을 실증적으로 평가한 연구입니다. KGW, Unigram, SynthID-Text를 대상으로 패러프레이징 공격을 수행한 결과, 대부분의 워터마크가 쉽게 제거되어 법적 기준을 충족하지 못함을 확인했습니다.
LLM의 분석적 지식 노동 능력을 측정하기 위해 비즈니스 사례 연구법을 활용한 새로운 벤치마크인 BusinessCaseBench를 소개합니다. 실험 결과, Frontier AI 모델들은 복잡한 비즈니스 사례 분석에서 높은 성능을 보이며 빠르게 발전하고 있음을 입증했습니다.
새로운 루프형 트랜스포머 모델인 Loopie 시리즈를 소개합니다. MoE 구조를 활용하여 동일 연산 예산 대비 기존 바닐라 트랜스포머보다 뛰어난 성능을 입증했습니다.
LLM이 컨텍스트 내 문자열을 정확히 복사하지 못하는 원인을 Transformer의 위치 인코딩 문제로 분석합니다. 이를 해결하기 위해 텍text를 2D 그리드로 구성하는 2D-RoPE를 제안하며, 실험을 통해 긴 입력 길이에서도 뛰어난 복사 성능을 입증했습니다.
언어 모델의 인코딩 방식인 토큰, 바이트, 픽셀의 속도-효용 경계를 비교 분석한 연구입니다. 콘텐츠와 용량을 통제한 상태에서 각 인코딩 방식이 보존하는 정보의 특성과 작업별 성능 차이를 규명했습니다.
본 논문은 틱톡 정치 대화 분석을 위한 멀티모달 데이터셋인 TikStance를 제시합니다. 이 데이터셋은 2023년~2025년 미국 선거 기간 동안 트럼프, 바이든, 해리스 세 인물을 다루며, 비디오와 댓글의 시청각적/대화적 맥락을 모두 보존합니다. 이를 통해 멀티모달 방침 탐지 및 계산 사회 과학 연구를 지원합니다.
본 연구는 기존의 정적 RAG(Retrieval Augmented Generation) 유틸리티가 다단계 에이전트 탐색 과정에서 발생하는 인과적 유용성을 예측하지 못함을 실험적으로 증명했습니다. 특히, 문서가 현재 질문에 대한 답변보다 에이전트의 다음 행동을 가능하게 하는 '브릿지 문서'의 중요성을 강조합니다. 이는 검색 시스템 설계 시 고려해야 할 새로운 관점입니다.
본 논문은 헬스케어 분야의 멀티모달 VQA(Visual Question Answering) 시스템을 분석하며, 신뢰성과 해석 가능성의 중요성을 강조합니다. 단순히 백본 모델을 적응하는 것만으로는 충분하지 않으며, 구조화된 추론과 명시적 근거를 강제하는 방법이 더 나은 성능을 보였습니다.
본 논문은 대규모 언어 모델(LM)의 사전 학습 데이터가 계산적 선전을 통해 오염될 수 있음을 입증했습니다. 기존 연구들이 제한적인 데이터 소스에 머물렀던 것과 달리, 공개 토론 인터페이스를 활용하여 웹 규모로 오염 공격이 가능함을 보여주었습니다. 또한, 적대적 콘텐츠 포함을 추정하는 새로운 분석 도구 HalfLife를 소개하고 그 중요성을 강조합니다.
본 연구는 인 컨텍스트 러닝이 만족해야 할 통계적 자기 일관성 원칙을 조사했습니다. 이진 트리를 이용해 모집단을 분할하고, 하위 집단별 추정치를 다시 전체로 집계하여 비교한 결과, LLM 추정치들이 기본적인 일관성 속성을 광범위하게 위반함을 발견했습니다. 이는 모델이 부분적 지식은 가지고 있으나 이를 신뢰성 있게 통합하지 못함을 시사합니다.
SciDiagramEdit은 연구 논문의 그림(figure)을 수정하는 과정을 자동화하기 위해 제안된 벤치마크이자 스킬 진화 프레임워크입니다. 이 시스템은 자연어 개정본으로부터 학습하며, 사용자가 에이전트와 함께 그림의 기본 요소를 공동 편집할 수 있게 합니다. 이를 통해 논문 개정 과정에서 발생하는 복잡한 시각 자료 편집 작업을 효과적으로 지원함을 입증했습니다.
본 논문은 기존 AI 생성 텍스트 탐지(AIGTD)가 문서를 정적 객체로 취급하는 한계를 지적하며, 이를 잠재적 생성 궤적을 구별하는 동적인 문제로 재정립합니다. 연구진은 기하학적 궤적 및 대조 학습(GTCL) 프레임워크를 제안하여, 텍스트 표현의 시퀀스 전반에 걸친 진화 과정을 모델링하고 이를 통해 강력한 탐지 신호를 확보했습니다.
본 논문은 기존 벤치마크의 한계를 극복하고자, 다양한 시나리오 전반에서 범용 AI 에이전트를 평가하는 OmniaBench를 제안합니다. 이 벤치마크는 ToC, ToB, ToE를 아우르는 계층적 분류 체계와 1,431개의 태스크로 구성되어 있습니다. 이를 통해 모델의 계획, 제약 조건 유지 등 전반적인 역량을 진단적으로 평가할 수 있게 합니다.
본 논문은 라틴 문자 중심의 토크나이저가 저자원 게에즈 문자 언어에서 겪는 성능 저하 문제를 해결하기 위해 VEXMLM이라는 어휘 확장 변형 모델을 제안합니다. 이 모델은 암하라어와 티그리냐어 단일 언어 코퍼스를 활용하여 게에즈 문자 서브워드를 XLM-R의 어휘에 추가하고, 이를 통해 QA, NER 등 다양한 작업에서 기존 모델 대비 높은 성능 향상을 입증했습니다.
본 논문은 LLM 에이전트를 활용하여 정치적 연합 형성 과정을 시뮬레이션하는 다중 에이전트 프레임워크를 제시합니다. SFT, DPO, RAG를 결합하여 사실 기반과 이념적 정렬을 모두 갖춘 당파적 에이전트를 구현했습니다. 이를 통해 협상 과정의 투명성을 높이고 각 조항의 출처와 기여도를 추적할 수 있습니다.
본 연구는 신경 언어 모델(NLM)이 문자열의 문법성을 내부 표현에 어떻게 인코딩하는지 조사했습니다. 기존 확률 기반 평가의 한계를 넘어, 질량-평균 프로빙을 사용하여 문법적/비문법적 문장이 표현 공간에서 체계적으로 분리됨을 입증했습니다. 이는 NLM이 통사론적 지식을 일관된 표현적 차원으로 구성함을 보여줍니다.
본 논문은 LLM 평가 및 훈련에 사용되는 루브릭(Rubrics)의 신뢰성 문제를 다루며, 기존 방식의 한계를 극복하는 새로운 프레임워크를 제안합니다. 'Rubrics on Trial'이라는 이 프레임워크는 외부 주석이나 모델 훈련 없이 합성된 응답 쌍으로부터 루브릭 세트를 진화시킵니다. 이를 통해 비구별적이거나 과도하게 특정적인 후보 루브릭을 효과적으로 걸러내어 평가의 정확도를 높입니다.
본 연구는 Grokipedia와 Wikipedia를 비교하며 LLM 기반 백과사전의 정치적 중립성을 분석했습니다. 1,394개 기사 쌍에 대한 대규모 연구 결과, 두 플랫폼 모두 전반적으로 정치인에게 호의적이었으나, 편향 양상은 달랐습니다. 특히 Grokipedia는 경제 우파 성향을, Wikipedia는 사회 진보 성향에 더 치우친 경향을 보였습니다.
본 연구는 L2(제2언어) 발화 평가의 한계점을 극복하기 위해 자기 지도 WavLM 표현을 활용한 텍스트 프리 프레임워크를 제안합니다. 이 방법은 DTW 기반으로 영어와 일본어 L2 발화를 음소적 정확도, 리듬, 억양 등 다각적으로 평가할 수 있음을 보여주었습니다.