Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
사용자의 신념 표현(EoB) 방식이 LLM의 맥락 수용 및 사전 지식 고수 여부에 미치는 영향을 연구했습니다. 언어학적 차원에 기반한 새로운 유형학을 도입하여 다양한 모델의 응답 패턴을 체계적으로 평가했습니다.
Transformer 아키텍처의 이산적 연산을 연속 기하학적 프레임워크로 모델링하는 새로운 연구를 제시합니다. 미분 기하학 및 확률 미적분학을 통해 RMSNorm, Attention, SGD 등 핵심 구성 요소를 정량적으로 분석하고 예측합니다.
LLM 에이전트의 전사 과정에서 발생할 수 있는 개인정보 및 자격 증명 유출을 방지하는 SlotGuard를 제안합니다. 기존 비식별화 방식의 한계를 극복하여 에이전트의 성능을 유지하면서도 민감한 데이터를 효과적으로 보호합니다.
LLM 탈옥 공격을 공격자 중심의 성공률이 아닌, 모델의 안전성 개선에 기여하는 방어자 중심 관점에서 평가하는 새로운 프레임워크 A-MESS를 제안합니다. Shapley 기반의 AttackSHAP 점수를 통해 공격의 유용성을 측정하고 최적의 공격 부분 집합을 선택하는 방법을 다룹니다.
키르기스어와 같은 저자원 언어의 LLM 평가를 위해 설계된 KyrgyzLLM-Bench 벤치마크를 소개합니다. 현지 작성 데이터와 정교하게 번역된 데이터셋을 통해 26개 모델의 성능과 교차 언어 전이 능력을 체계적으로 분석했습니다.
영어 기반의 LLM 안전성이 저자원 언어인 하우사어 환경에서 어떻게 변화하는지 연구했습니다. 실험 결과, 로컬 배포 가능한 소규모 모델들은 영어 대비 하우사어 사용 시 임상 정확도가 급격히 하락하는 '드리프트' 현상을 보였습니다.
LLM의 질문 순서 효과를 분석하기 위해 양자 질문 등식(QQ)을 감사 기준으로 활용하는 연구를 소개합니다. 연구 결과, 현재의 다음 토큰 로그 확률 방식은 모델의 포화 상태로 인해 분포 수준의 QQ 감사를 수행하기에 불충분함을 밝혀냈습니다.
불확실한 지식 그래프(UKG)를 활용하여 LLM의 환각 현상을 줄이는 새로운 프레임워크 Debate-on-Graph(DoG)를 제안합니다. 휴리스틱 탐색과 적응형 적대적 토론 메커니즘을 통해 노이즈가 포함된 지식 속에서도 신뢰할 수 있는 추론을 수행합니다.
멀티모달 감성 분석(MSA)에서 누락된 모달리티를 반드시 복구해야 하는지에 대한 의문을 제기합니다. 샘플별로 모달리티의 효용성이 다르다는 점에 착안하여, 복구 여부를 학습 가능한 결정으로 전환하는 SIEVE 프레임워크를 제안합니다.
한-영 의학 강의를 위한 사후 ASR 워크플로우인 AI_LectureNote의 성능을 평가한 연구입니다. Whisper와 GPT-4o를 활용해 의학 용어의 영문 표기 렌더링 성능은 향상되었으나, 의미론적 드리프트와 극성 오류가 발생함을 확인했습니다.
캐릭터와 세계가 상호작용하며 함께 진화하는 오픈 스키마 프레임워크인 EvolvingWorld를 제안합니다. LLM 기반의 캐릭터 에이전트와 월드 모델을 결합하여 장기적인 문학 시뮬레이션 성능을 개선하고 새로운 벤치마크를 제시합니다.
TalTech은 긴 의사-환자 대화에서 직접 SOAP 노트를 생성하는 BeTraC 챌린지에서 1위를 차지했습니다. LoRA 미세 조정과 DAPO 강화 학습을 통해 Voxtral 모델을 최적화하여 낮은 환각률과 높은 사실적 신뢰성을 입증했습니다.
LLM-as-judge 시스템 구축 시 합성 코퍼스 생성 과정에서 발생하는 구조적 결함과 테스트 오라클 문제를 분석한 연구입니다. 디코딩 파라미터 공유로 인한 데이터 왜곡 현상을 규명하고, 이를 방지하기 위한 검증 프로토콜을 제안합니다.
BayesPO는 프롬프트 최적화를 이산 토큰에 대한 베이지안 사후 샘플링 문제로 정의하는 새로운 연구 프레임워크입니다. 병렬 템퍼링과 Langevin 기반 Gibbs 샘플러를 결합하여 LLM의 복잡한 에너지 지형에서 전역적 최적 프롬프트를 탐색합니다.
LLM 워터마크 기술이 법적 증거로서 갖는 포렌식적 신뢰성을 실증적으로 평가한 연구입니다. KGW, Unigram, SynthID-Text를 대상으로 패러프레이징 공격을 수행한 결과, 대부분의 워터마크가 쉽게 제거되어 법적 기준을 충족하지 못함을 확인했습니다.
LLM의 분석적 지식 노동 능력을 측정하기 위해 비즈니스 사례 연구법을 활용한 새로운 벤치마크인 BusinessCaseBench를 소개합니다. 실험 결과, Frontier AI 모델들은 복잡한 비즈니스 사례 분석에서 높은 성능을 보이며 빠르게 발전하고 있음을 입증했습니다.
새로운 루프형 트랜스포머 모델인 Loopie 시리즈를 소개합니다. MoE 구조를 활용하여 동일 연산 예산 대비 기존 바닐라 트랜스포머보다 뛰어난 성능을 입증했습니다.
LLM이 컨텍스트 내 문자열을 정확히 복사하지 못하는 원인을 Transformer의 위치 인코딩 문제로 분석합니다. 이를 해결하기 위해 텍text를 2D 그리드로 구성하는 2D-RoPE를 제안하며, 실험을 통해 긴 입력 길이에서도 뛰어난 복사 성능을 입증했습니다.
언어 모델의 인코딩 방식인 토큰, 바이트, 픽셀의 속도-효용 경계를 비교 분석한 연구입니다. 콘텐츠와 용량을 통제한 상태에서 각 인코딩 방식이 보존하는 정보의 특성과 작업별 성능 차이를 규명했습니다.
본 논문은 틱톡 정치 대화 분석을 위한 멀티모달 데이터셋인 TikStance를 제시합니다. 이 데이터셋은 2023년~2025년 미국 선거 기간 동안 트럼프, 바이든, 해리스 세 인물을 다루며, 비디오와 댓글의 시청각적/대화적 맥락을 모두 보존합니다. 이를 통해 멀티모달 방침 탐지 및 계산 사회 과학 연구를 지원합니다.