Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 LLM 기반의 건강 챗봇 개발 시 실제 환자 대화 데이터를 분석했습니다. 커뮤니케이션 패턴과 감정 표현의 높은 다양성을 발견했으며, 이를 반영한 환자 시뮬레이터를 개발하여 현실성이 높음을 입증했습니다. 또한, 커뮤니케이션 스타일이 응급도 평가 성능에 큰 영향을 미침을 밝혀내며, 실제 환경 배포 시 시스템 설계의 복잡성 수용 필요성을 강조합니다.
본 논문은 LLM의 효율적인 경량화를 위해 PALS (Percentile-Aware Layerwise Sparsity)라는 새로운 가지치기 기법을 제안합니다. PALS는 활성화 크기의 분위수를 기반으로 계층별 희소성을 조정하여, 기존 방법들보다 더 나은 성능과 낮은 퍼플렉서티를 달성함을 보여줍니다. 또한, 기울기 기반 할당 방식의 한계점도 제시했습니다.
기존 LLM 벤치마크가 실제 데이터 분석 환경을 반영하지 못하는 문제를 지적하며, 정부 공개 데이터를 기반으로 DataGovBench를 소개합니다. 이 벤치마크는 복잡한 질문에 답하는 Table QA와 전문가 수준의 통찰력을 발견하는 Table Insight 두 가지 작업을 포함하여 LLM 평가의 새로운 기준을 제시합니다.
본 논문은 전이중(full-duplex) 음성 언어 모델(SLMs)의 핵심 과제인 모달리티 간섭 문제를 다룹니다. 연구진은 이 문제가 깊은 매개변수 공간 공유에서 발생하는 기울기 충돌 때문임을 밝혀냈습니다. 이에 따라, 모달리티 분리 및 의미 일관성을 유지하는 계층적 전이중 프레임워크 Lychee-FD를 제안합니다.
TiCodec은 시불변 표현 추출(TIRE) 모듈을 통해 음성 콘텐츠에서 화자 및 환경 정보를 분리하는 신경망 음성 코덱 연구입니다. 중간 레이어의 상호 보완성을 활용한 Dual-TIRE 구조를 제안하며, 스트리밍 환경에서도 성능 저하 없이 저지연 음성 처리가 가능함을 입증했습니다.
LLM이 생성할 남은 출력 길이를 내부적으로 추정하고 있다는 연구 결과입니다. 은닉 상태를 통한 선형 프로빙 결과, 모델은 응답의 전체 길이를 예측할 수 있는 내부 표현을 가지고 있음이 확인되었습니다.
LLM의 계보 추적과 관리를 위해 가중치 스펙트럼 밀도를 활용한 '스펙트럼 시그니처' 지표를 제안합니다. 이 방식은 데이터 없이도 모델의 고유 특성을 포착하며, 대규모 모델 코퍼스의 효율적인 분석과 클러스터링을 가능하게 합니다.
SMM4H-HeaRD 2026 태스크의 일환으로 TCGA 병리 보고서를 활용해 TNM 병기를 예측하는 연구입니다. ClinicalBERT, BioBERT 등 임베딩과 LightGBM, WRN 모델을 활용하여 다중 레이블 분류 성능을 분석했습니다.
LLM이 의미 없는 필러 토큰을 사용하여 내부적으로 추론을 수행하는 현상을 분석한 연구입니다. DeepSeek V3와 Kimi K2 모델을 통해 필러 토큰 내의 은닉 상태에서 계산 흔적을 추출하고 복구하는 비지도 디코딩 파이프라인을 제안합니다.
언어 모델이 문화적 현상을 정량화할 때, 모델과 데이터, 평가 방식이 문화적 현실을 단순히 기록하는 것이 아니라 능동적으로 구성한다는 점을 논합니다. 카렌 바라드의 '행위적 절단' 개념을 통해 모델 설계가 문화적 경계를 획정하는 과정을 분석합니다.
MER-TRANS 2026의 스페인어 쉬운 읽기(Easy-to-Read) 생성 태스크를 위한 HULAT2 시스템을 소개합니다. LangGraph 기반의 멀티 에이전트 워크플로우와 신호 유도형 라우팅을 통해 기존 베이스라인보다 우수한 성능을 입증했습니다.
LLM 에이전트용 스킬 마켓플레이스에서 개별 스킬의 조합으로 발생하는 '암시적 의도'를 탐지하기 위한 SkillFuzz를 제안합니다. 실행 없이도 몬테카를로 트리 탐색을 통해 충돌하는 스킬 조합을 효율적으로 찾아내는 연구입니다.
LLM의 발전으로 인해 NLP 연구의 학술적 중심이 ACL과 같은 전통적인 NLP 컨퍼런스에서 일반 머신러닝(ML) 컨퍼런스로 이동하고 있습니다. 연구 결과, 신진 저자들의 일반 ML 학술 대회 게재 비중이 크게 증가했으며 이는 인용 프리미엄의 영향으로 분석됩니다.
RAG 시스템의 신뢰성을 높이기 위해 미디어 출처의 신뢰성을 평가하는 '미디어 배경 조사(MBC)' 연구를 소개합니다. 기존의 비용 문제와 재현성 한계를 극복하기 위해 200개 미디어 출처를 포함한 공개 지식 저장소인 MEDIAREF를 제안합니다.
LLM의 단일 언어적 한계를 극복하기 위해 문학적 분석 도구를 활용한 문화적 AI 구축 방안을 제안합니다. 비판 이론과 세계 문학 접근 방식을 통해 AI가 다원적 해석과 문화적 소양을 갖출 수 있는 계층적 프레임워크를 다룹니다.
LLM을 활용하여 Linux/bash 명령 응답을 자동 채점하는 연구를 다룹니다. 4단계 인지 분류 체계를 도입하여 GPT, Claude, Gemini 등의 모델 성능을 평가했으며, 루브릭 기반 프롬프팅이 채점 정확도 향상에 핵심임을 입증했습니다.
LLM의 스케일링 법칙이 사회적 시뮬레이션의 충실도를 개선할 수 있는지 연구했습니다. 대부분의 행동 및 의견 모델링은 스케일링에 따라 개선되지만, 종단적 예측이나 저자원 도메인, 특정 인지적 편향 보정에는 한계가 있음을 밝혀냈습니다.
자율 에이전트가 제한된 상호작용 예산 내에서 정책을 반복적으로 개선하는 능력을 평가하는 새로운 벤치마크인 EvoPolicyGym을 소개합니다. 이 시스템은 에이전트의 정책 진화 과정을 궤적 수준에서 진단하여 단순 점수 이상의 심층적인 분석을 제공합니다.
소프트웨어 코드와 테스트의 공동 진화를 평가하기 위한 실행 가능한 라이브 벤치마크인 TestEvo-Bench를 소개합니다. 실제 커밋 히스토리를 기반으로 테스트 생성 및 업데이트 능력을 측정하며, 데이터 누수를 방지하기 위해 주기적으로 업데이트되는 구조를 갖추고 있습니다.
CLIP 기반 시각-언어 모델(LVLM)이 이미지 내 텍스트에 의해 시각적 의미 대신 어휘적 의미에 편향되는 '타이포그래피 공격(TA)' 문제를 분석합니다. 별도의 훈련 없이 기계론적 해석 가능성을 통해 공격의 근원을 식별하고, 어텐션 가중치 조정을 통해 모델의 강건성을 높이는 방법을 제안합니다.