Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 시계열(TS) 언어 모델링에서 균일한 토큰 처리가 비효율적임을 지적하며, TS 토큰의 불균등한 스펙트럼 기여도를 분석했습니다. 이를 바탕으로 주파수 영역 구조를 활용하여 TS 토큰을 압축하고 레이어를 거치며 프롬프트 토큰을 점진적으로 줄이는 적응형 토큰 예산 책정 프레임워크를 제안합니다. 이 방법은 예측, 분류 등 다양한 작업에서 추론 가속 및 성능 향상을 입증했습니다.
본 연구는 음성 기반 3D 얼굴 애니메이션의 품질 향상을 위해 다양한 음성 표현(SSL 특징, 신경 코덱 라텐트 등)을 비교 평가했습니다. 네 가지 표현 계열을 객관적 지표와 지각적 평가로 분석하고, 특히 음성학적 클래스를 인코딩하는 것이 정확한 얼굴 애니메이션 예측에 유용함을 입증했습니다.
본 논문은 복잡한 질문 분해 과정을 수학적 구조인 Operad를 사용하여 모델링하는 프레임워크를 제안합니다. 이를 통해 QA 모델을 $Q$ 위의 대수(algebras over $Q$)로 해석할 수 있음을 보였습니다. 특히 'operadic consistency'라는 새로운 개념을 제시하여, 다단계 추론의 일관성을 측정하고 개선할 수 있는 방법을 제시했습니다.
대화가 길어질 때 LLM의 정확도가 하락하는 'Lost in Conversation' 현상을 해결하기 위해 메모리 증강 강화학습과 샤딩 파이프라인을 제안합니다. 압축된 롤링 메모리를 유지하도록 학습함으로써 긴 문맥에서도 뛰어난 점진적 추론 성능을 확보했습니다.
본 논문은 대규모 데이터셋의 샘플 기여도를 분석하는 Data Attribution(DA) 방법론을 다룹니다. 기존 영향 함수 기반 방법론들이 처리 속도와 저장 공간 효율성 문제로 인해 실제 구현에 어려움이 있었는데, 이를 해결하기 위해 Influcoder라는 빠르고 비용 효율적인 접근 방식을 제안합니다.
본 논문은 정적 환경에 국한된 기존 LLM 에이전트 평가의 한계를 지적하며, 동적인 환경 변화를 모델링하는 새로운 벤치마크 EvoArena를 제안합니다. 또한, 메모리 진화를 구조화된 업데이트 히스토리로 기록하는 패치 기반 메모리 시스템인 EvoMem을 개발했습니다. 실험 결과, EvoMem은 기존 에이전트 대비 다양한 표준 벤치마크에서 성능 향상을 입증하며, 동적 환경에서의 에이전트 신뢰성을 높이는 데 기여함을 보여줍니다.
멀티 에이전트 시스템(MAS)이 단일 에이전트 시스템(SAS)보다 우월하다는 통념에 의문을 제기하는 연구입니다. 실험 결과, 자동 생성된 MAS는 비용 대비 성능이 CoT-SC보다 낮으며, 현재의 자동 설계 방식이 불필요한 복잡성만 초래함을 입증했습니다.
AI 동료 심사(Peer Review) 시스템을 기만하기 위해 프롬프트 주입 없이 논문의 프레젠테이션 구조만 수정하는 '적대적 재포장(adversarial repackaging)' 공격 기법을 연구했습니다. 실험 결과, 과학적 근거를 유지한 채 서사 구조를 변경하는 것만으로도 AI 리뷰어의 점수를 유의미하게 높일 수 있음을 확인했습니다.
MedGemma-27B를 활용하여 의료 CRF 작성을 위한 2단계 로컬 LLM 파이프라인을 제안합니다. 분류와 추출을 분리한 아키텍처를 통해 환각을 방지하고 데이터 주권을 보장하며, 로컬 오픈 소스 모델 중 높은 성능을 기록했습니다.
금융 보고서의 복잡한 구조를 평가하기 위한 새로운 롱 컨텍스트 벤치마크인 LEDGER를 공개합니다. 도표와 표가 포함된 4,999개의 기업 연례 보고서를 활용하여 KPI 검색, 단일 값 조회, 전체 KPI 추출 능력을 다각도로 평가합니다.
잠재 사고 사슬(Latent CoT)을 표준 온폴리시 강화학습으로 최적화하기 위해 경계 토큰을 사용하는 SWITCH 프레임워크를 제안합니다. 이 방식은 추론 압축과 기계론적 분석 가능성을 동시에 확보하며 기존 방식보다 뛰어난 성능을 보입니다.
독일 공공 부문에 특화된 통합 LLM 벤치마크인 MÖVE를 소개합니다. 기존 영어·미국 중심 벤치마크의 한계를 넘어, 성능과 거버넌스라는 두 가지 차원에서 39개 모델을 다각도로 평가합니다.
G-Long은 장기 대화의 일관성을 유지하기 위해 그래프 강화 메모리 관리 프레임워크를 제안합니다. 소형 언어 모델(sLM)을 활용한 구조화된 트리플렛 추출과 주의력 인식 중요도 점수 산정 메커니즘을 통해 효율성과 성능을 동시에 개선했습니다.
기존 벤치마크의 데이터 오염 문제를 해결하기 위해 라이브 웹 탐색 기반의 진화형 벤치마크인 EvoBrowseComp를 제안합니다. 세 가지 에이전트 협업 프레임워크를 통해 최신 지식을 반영한 고난도 QA 쌍을 자동으로 합성하고 업데이트할 수 있습니다.
동시 음성-음성 번역에서 발생하는 끊김 현상을 해결하기 위해 유창성 인식 최적화 프레임워크인 NaturalFlow를 제안합니다. 모델 내부 신호를 활용해 청크 간 침묵을 최소화함으로써 낮은 지연 시간과 자연스러운 음성 흐름을 동시에 달성합니다.
MemRefine은 장기 상호작용에서 발생하는 대규모 언어 모델(LLM) 에이전트의 메모리 관리 문제를 해결하기 위해 제안된 기법입니다. 이 방법은 단순히 표면적 유사성 대신, 사실적 가치를 기반으로 LLM 심사위원이 삭제, 병합, 보존 결정을 내립니다. 이를 통해 제한된 저장 예산 내에서 유용한 정보를 효과적으로 유지하며 성능을 향상시킵니다.
본 논문은 소셜 미디어 기반의 생명윤리적 토론을 모델링하기 위한 맥락 인식 스탠스 탐지 데이터셋 BioStance를 제시합니다. 이 데이터셋은 레딧에서 수집된 39,600개의 주석이 달린 게시물-댓글 쌍으로 구성되어 있으며, 가치 충돌 등 세 가지 차원의 논쟁적 주제를 다룹니다.
본 논문은 LLM의 입장 탐지 성능을 진단하는 새로운 7차원 측정치인 SICI(Stance Inference Complexity Index)를 제안합니다. SICI는 목표-텍스트 쌍이 가지는 의미-화용론적 복잡도를 측정하며, 이 지표가 증가함에 따라 LLM 오류 패턴이 체제 변화(regime shift)를 겪음을 밝혀냈습니다.
본 연구는 대규모 음성 코퍼스 내의 노이즈나 오류가 포함된 데이터를 필터링하는 방법을 제안합니다. 오디오-언어 모델을 훈련하여 페어드 스피치로부터 직접 데이터 보존/제거 결정을 내리도록 합니다. 이를 위해 경량 랭커를 이용해 의사 레이블을 생성하고, 이를 기반으로 대규모 오디오 LLM을 학습시켜 음성 조건부 데이터 선택 성능을 높였습니다.
본 기사는 대화형 AI 시스템의 신뢰성 문제를 다루며, 기존 튜링 테스트를 '신뢰도' 검증으로 재정의했습니다. 이를 위해 RogueAI라는 인터랙티브 웹앱을 제시하여, 플레이어가 두 LLM 에이전트 중 속임수를 쓰는 가짜 에이전트를 식별하는 게임플레이를 구현했습니다. 이 연구는 기만적인 AI가 특정 언어적 서명을 가지며, 인간과 단순 휴리스틱의 탐지 정확도에 차이가 있음을 보여줍니다.