Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
방사선 보고서의 임상적 정확성을 평가하기 위해 LLM 기반의 새로운 지표를 연구합니다. 기존 모델들이 무해한 표현 변화에 과도한 벌점을 주는 판별 편향을 확인하였으며, 이를 해결하기 위해 경량화된 해석 가능한 지표를 제안합니다.
HandwritingAgent는 대규모 추론 모델을 활용하여 SVG 형식의 자연스러운 필기 시퀀스를 합성하는 언어 기반 에이전트입니다. 기존 모델의 높은 계산 비용과 제어 능력 부족을 해결하며, 텍스트와 참조 이미지를 통해 정교한 필기 스타일 제어가 가능합니다.
다중 주체 공유 메모리 환경을 위한 새로운 벤치마크인 GateMem을 소개합니다. 이 연구는 에이전트의 메모리 유용성, 권한 기반 액세스 제어, 그리고 능동적 망각 능력을 의료, 사무 등 다양한 도메인에서 평가합니다.
긴 문맥 추론 능력을 향상시키기 위해 보상 엔지니어링 대신 데이터 중심의 접근 방식을 제안합니다. 검색, 증거 합성, 추론 작업을 포함한 8개의 데이터셋 레시피를 통해 Qwen 모델의 벤치마크 성능과 에이전트 작업 수행 능력을 크게 개선했습니다.
ScholarSum은 지식 그래프와 학생-교사 방식의 상호작용을 활용하여 과학 문헌의 생성적 요약을 수행하는 프레임워크입니다. 지식 그래프를 통해 전역적 논리를 포착하고, 교사 역할을 하는 검토자가 초안을 반복적으로 정교화하여 사실적 충실성을 높입니다.
시퀀스 레이블링의 표현력 한계를 극복하기 위해 확산 모델(Diffusion)을 활용하는 새로운 연구를 소개합니다. 기존 CRF 방식의 장거리 의존성 문제를 해결하여 품사 태깅(POS-tagging) 오류를 16.5% 감소시켰습니다.
금융 분야의 데이터 부족 문제를 해결하기 위해 합성 데이터를 활용한 지식 증류(distillation) 프레임워크를 제안합니다. 클러스터링 기반의 시드 선택을 통해 소형 모델이 최소한의 라벨링만으로도 높은 금융 감성 분석 성능을 달성할 수 있음을 입증했습니다.
프롬프트 최적화를 위한 확률적 탐색 프레임워크인 SPO와 에이전트 유도 탐색 방식인 SAGE를 제안합니다. SAGE는 멀티 에이전트 파이프라인을 통해 프롬프트 공간을 탐색하며, 실제 챗봇 서비스 적용 시 사용자 유지율을 높이는 성과를 보였습니다.
의료 커뮤니케이션 품질을 개선하기 위해 언어 모델 가이드 기반의 반사실적 추천 파이프라인을 제안하는 연구입니다. 어조, 개인화 등 해석 가능한 특징을 활용하여 의료적 정확성을 유지하면서도 환자의 긍정적 피드백을 높이는 최소한의 문구 변화를 추천합니다.
REVES는 테스트 시간 스케일링을 위해 수정 및 검증 증강 학습을 제안하는 2단계 반복 프레임워크입니다. 성공적인 복구 과정 중의 'near-miss' 답변을 활용하여 모델이 오류를 식별하고 수정하는 능력을 극대화합니다. 코딩, 수학, 제약 충족 퍼즐 등 다양한 벤치마크에서 기존 RL 방식보다 뛰어난 성능을 입증했습니다.
PLCopen XML의 그래픽 래더 다이어그램을 SMT 기반 모델 체킹으로 검증하기 위한 Graph-ESBMC-PLC 프레임워크를 제안합니다. DFS 기반 리졸버를 통해 그래픽 인코딩을 유효한 GOTO 중간 표현으로 변환하여 IEC 스캔 사이클 의미론에 부합하는 형식 검증을 수행합니다.
비유적 표현과 부정(Negation)이 결합된 텍스트를 LLM이 얼마나 정확하게 해석하는지 평가한 연구입니다. 새로운 주석 데이터셋을 개발하여 모델 성능을 테스트했으며, 프롬프트 스타일에 따라 성능 차이가 크게 나타남을 확인했습니다.
하이브리드 문서 내 AI 생성 텍스트를 탐지하기 위한 새로운 모델 SenFlow와 벤치마크 MOSAIC를 제안합니다. 문장 간의 의존성을 고려한 그래프 기반 전파와 CRF 디코딩을 통해 문장 수준 탐지 성능을 극대화했습니다.
GraphPO는 추론 모델의 강화학습 효율을 높이기 위해 추론 과정을 유향 비순환 그래프(DAG)로 표현하는 새로운 프레임워크입니다. 중복된 추론 경로를 병합하여 탐색 효율을 높이고, 결과로부터 과정 감독 신호를 도출하여 이점 추정의 분산을 줄입니다.
시계열 질의응답(TSQA)에서 발생하는 토큰화 병목 현상을 해결하기 위해 새로운 프레임워크 CADE를 제안합니다. 직접적 타임스텝 임베딩과 대조적 정렬을 통해 데이터 손실을 줄이고 LLM과의 의미론적 간극을 좁혔습니다.
교차 언어 관용구 정렬을 위해 Wiktionary의 의미 설명(Gloss)을 활용한 새로운 벤치마크 G-IdiomAlign을 제안합니다. LLM이 관용구를 문자 그대로 번역하는 편향을 분석하고, 의미 설명이 성능 향상에 미치는 영향을 평가합니다.
음성 기반 치매 평가 시 발생하는 전사 오류와 비언어적 검사 누락 문제를 해결하기 위한 연구입니다. Whisper 임베딩과 전사 점수를 통합하여 전문가의 종합 등급을 정확하게 예측하는 모델을 제안합니다.
1.5T 토큰으로 처음부터 사전 학습된 7B 규모의 오픈 소스 균일 확산 언어 모델(UDLM)인 Sumi를 소개합니다. Sumi는 기존 자기회귀 모델과 경쟁력 있는 성능을 보이며, 대규모 네이티브 균일 확산 연구를 위한 기준점을 제공합니다.
다국어 추론 능력을 향상시키기 위해 각 소스 모델의 기여도를 조절할 수 있는 ST-Merge 프레임워크를 제안합니다. 게이트형 교차 어텐션 메커니즘을 통해 모델 간 충돌을 해결하며, 21개 언어 벤치마크에서 기존 베이스라인을 능가하는 성능을 입증했습니다.
멀티 에이전트 LLM 팀에서 리더십(조정 제어)의 효용성을 팀 과학의 상황 의존 이론을 통해 분석한 연구입니다. 특정 조건에서만 컨트롤러가 다수결 투표보다 높은 회복력을 보임을 입증하며, 리더십을 정적 성능 지표가 아닌 상황 의존적 요소로 정의합니다.