Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
정적인 논문을 실행 가능한 상호작용형 웹 시스템으로 변환하는 'Paper-to-Interactive-System Agent'를 제안합니다. 이를 평가하기 위한 벤치마크인 I-WebGenBench와 구조화된 생성 프레임워크인 PaperVoyager를 통해 시스템의 품질을 입증했습니다.
강화학습 과정에서 발생하는 엔트로피 붕괴 문제를 해결하기 위해 모델 파라미터 내부에 온도를 내재화하는 TS-OPSD 기법을 제안합니다. 이 방법은 외부 교사 없이 모델의 로짓에 높은 온도를 적용해 자기 증류함으로써 탐색 능력을 복원합니다.
MoE 모델의 성능 향상을 위해 토큰별 라우팅 신뢰도에 따라 게이트 날카로움을 조절하는 $\kappa$-SwiGLU를 제안합니다. 실험 결과, 추가 파라미터와 계산 비용을 최소화하면서도 MoE Transformer의 성능을 효과적으로 개선했습니다.
LLM의 적대적 테스트 시 발생하는 커버리지 격차와 모드 붕괴 문제를 해결하기 위해 의미론적 수준에서 작동하는 품질-다양성(Quality-Diversity) 진화 프레임워크를 제안합니다. MAP-Elites를 활용해 해석 가능한 공격 전략을 생성하며, 주요 모델별 취약점 프로필을 체계적으로 분석합니다.
기업용 멀티 에이전트 시스템에서 문제 유형에 따라 협업 전략을 동적으로 선택하는 연구를 다룹니다. 실험 결과, 특정 전략이 항상 승리하는 결정론적 방식보다는 최적의 성능에 근접하는 '최선에 근접한 라우팅(near-best routing)' 방식이 유효함을 입증했습니다.
Gemma 모델 세대 간 연구를 통해 LLM의 안전 정렬이 단조롭게 개선되지 않는 '비단조적' 특성을 발견했습니다. 특정 세대에서 공격 성공률이 급증하는 퇴보 현상이 관찰되었으며, 이는 정적 벤치마크가 아닌 적응형 종단적 탐사를 통해서만 확인 가능합니다.
멀티 에이전트 토론(MAD)에서 발생하는 답변 변화가 진정한 추론인지 사회적 순응인지 분석한 연구입니다. 세 가지 소스 분해 프레임워크를 통해 자발적 불안정성, 입장 유도형 순응, 추론 유도형 설득을 구분하여 제시합니다.
기존 자기 보고식 설문지의 오염 및 편향 문제를 해결하기 위해 투사 패러다임을 활용한 GenPT 프레임워크를 제안합니다. GenPT는 생성적 자극을 통해 LLM 에이전트의 심리 상태를 보다 신뢰성 있게 측정하며, 기존 방식보다 높은 타당도를 보여줍니다.
Sympatheia는 사용자의 감정 상태를 연속적인 가치-각성(VA) 신호로 조건화하여 응답하는 음성 대 음성 대화 프레임워크입니다. 멀티모달 센싱을 통해 감정 정보를 통합함으로써, 모호한 상황에서도 의미와 감정이 적절히 정렬된 음성 응답을 생성합니다.
기존 단일 세션 중심 벤치마크의 한계를 극복하기 위해 멀티 세션 환경에서의 지속적 메모리와 추론을 평가하는 Momento를 제안합니다. 실험 결과, 현재 에이전트들은 과거 정보를 현재 컨텍스트의 신뢰할 수 있는 지표로 활용하는 데 어려움을 겪고 있습니다.
LLM의 창의적 사고와 고착 현상을 체계적으로 분석하기 위한 평가 프레임워크 IDEAFix를 소개합니다. 이 프레임워크는 작업 구성과 프롬프팅 전략이 아이디어 생성의 독창성에 미치는 영향을 통제된 환경에서 평가합니다.
LLM의 법률 인용 환각 문제를 해결하기 위해 인용 근거 설정(Citation Grounding, CG) 지표를 제안합니다. 인용 정확도, 관련성, 시의성을 평가하며, CG-DPO 기법을 통해 모델이 올바른 법률 인용을 수행하도록 미세 조정하는 방법을 제시합니다.
RAG 시스템의 핵심 요소인 청킹(chunking) 방법론의 효과성을 체계적으로 평가한 연구입니다. 기존의 고정 크기 및 의미론적 청킹 방식의 한계를 분석하고, 다양한 시나리오에서의 성능과 계산 비용 문제를 다룹니다.
MLLM-Microscope라는 새로운 시스템을 통해 MLLM 내부의 숨겨진 표현을 분석한 연구입니다. LLaVA-NeXT와 OmniFusion 모델을 대상으로 토큰 임베딩의 선형성, 고유 차원, 이방성을 평가하여 모델 간 차이를 규명했습니다.
LLM 에이전트가 외부 정보 스트림(피드)을 소비할 때 발생하는 의사결정 왜곡 현상을 연구했습니다. 연구 결과, 피드 구성에 따라 에이전트가 적대적 정보에 굴복하거나 결정이 뒤집히는 현상이 확인되었습니다.
소규모 언어 모델(SLM)의 기능적 붕괴 상황에서 관계적 스타일의 개입이 모델의 행동에 미치는 영향을 분석한 연구입니다. 실험 결과, 관계적 구조와 1인칭 레지스터가 결합될 때만 유의미한 행동 변화가 나타남을 확인했습니다.
LLM의 환각 현상을 완화하기 위해 소프트 프롬프트를 활용하는 RCSP(Responsible Contrastive Soft Prompting) 방법론을 제안합니다. 이 방식은 매개변수 효율적인 학습을 통해 환각 억제, 불확실성 시 기권, 사실적 회상 보존 사이의 균형을 맞춥니다.
시퀀스 모델의 계층별 상태 인코딩 특성이 아키텍처뿐만 아니라 수행하는 태스크의 종류에 따라 역전될 수 있음을 밝힌 연구입니다. 실험을 통해 모델의 계산 구조가 가환성보다 태스크의 계산 방식에 더 큰 영향을 받는다는 것을 증명했습니다.
Mamba-2 모델의 상태 싱크(state sink) 현상을 분석하여, 단일 버킷 프로브가 실제 계산을 수행하는 회로를 정확히 식별하지 못한다는 점을 밝혀냈습니다. 표현적 유사성이 반드시 기능적 동등성을 의미하지 않음을 입증하며, 회로 분석 시 어블레이션의 중요성을 강조합니다.
생물 의학 질의응답의 정확도뿐만 아니라 파싱 가능성과 신뢰성을 평가하기 위한 HypothesisMed 프레임워크를 제안합니다. 추론 시간 답변 융합과 SPACE 레이블링을 통해 모델의 답변 공간을 구조화하여 진단합니다.