Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 자동 음성 인식(ASR) 평가에 사용되는 단어/문자 오류율(WER/CER)이 인간 지각과 낮은 상관관계를 가진다는 문제점을 지적합니다. 이를 해결하기 위해, 본 연구는 선택된 여러 지표를 통합하여 '최소 편집 거리(minED)'라는 새로운 패러다임을 제시합니다. 이 접근법은 전사 오류와 인간의 실제 지각을 연결하고, 오류의 심각도에 대한 분석을 가능하게 합니다.
본 논문은 키릴 문자를 사용하는 저자원 언어인 시리아어(Tajik)를 위한 생성형 대규모 언어 모델(LLM) 적응 방안을 제시합니다. 연구진은 31만 건의 문서로 구성된 시리아어 웹 코퍼스를 구축하고, 전체 미세 조정, LoRA, QLoRA 등 다양한 PEFT 전략을 적용하여 성능을 비교 분석했습니다. 그 결과, Mistral 7B 모델에 QLoRA(r=16)를 적용했을 때 가장 우수한 성능(평균 퍼플렉시티 5.03)을 달성했으며, 이는 계산 효율성과 품질 유지 측면에서 실질적인 가치를 제공함을 입증했습니다.
본 논문은 기존 임상 텍스트 데아이덴티피케이션(de-identification) 벤치마크의 한계를 극복하기 위해 구축된 SHIELD 데이터셋과 이를 기반으로 압축된 소규모 언어 모델(SLM)을 소개합니다. SHIELD는 다양한 범주의 노트와 골드 스탠더드 PHI를 포함하며, 인간 참여 과정을 거쳐 높은 다양성을 확보했습니다. 연구진은 이 데이터를 사용하여 여러 LLM의 성능 상한선을 설정하고, 이를 로컬 배포가 가능한 SLM으로 압축하여 표준 워크스테이션 환경에서 높은 정밀도와 회귀율을 달성하는 모델을 개발했습니다.
이 기술 기사는 LLM 추론 과정에서 '공개 타이밍'을 조절 가능한 결정으로 만드는 새로운 방법인 Side-by-Side (SxS) Interleaved Reasoning을 제안합니다. 기존의 자동 회귀 생성 방식은 토큰 하나하나가 비가역적인 공개적 약속을 구성하여, 추가적인 고찰이 지연되거나 초기 스트리밍에 편향될 위험(침묵세금)을 초래했습니다. SxS는 부분적인 공개와 지속적인 사적 추론을 교차시키면서도, 현재까지의 추론에 의해 '지원'될 때만 콘텐츠를 방출하여 이 문제를 해결합니다.
LLM-XTM은 다국어 주제 모델링의 한계를 극복하기 위해 제안된 프레임워크입니다. 이 방법은 대규모 언어 모델(LLM) 유도 주제 정교화와 자기 일관성 불확실성 양적을 결합하여, 기존 모델들이 겪던 희소한 자원 의존성 및 불안정성을 개선합니다. LLM-XTM은 다국어 코퍼스에서 주제의 일관성과 정렬을 향상시키면서도 비용 효율적이고 안정적인 성능을 보여줍니다.
본 논문은 반복적인 LLM 추론(repeated sampling)의 성능이 단순히 단일 호출 정확도로 결정되는 것이 아니라, 예시별 정답 확률의 잠재 분포에 의해 결정됨을 분석합니다. 연구진은 조건부 독립 동일 분포 하에서 2차 모멘트까지 활용하여 안정적 오류와 회복 가능한 무작위성을 구분하는 방법을 제시하며, 이를 통해 고정된 다수 투표 예산이 분포에 관계없이 일정한 성능 이득을 제공함을 보였습니다. 또한, 최대 엔트로피 및 잠재 난이도 가우시안-프로빗(LDGP) 점 완성을 추가하여 실험적으로 3표 및 5표 정확도가 2 호출 영역에 포함됨을 입증했습니다.
본 논문은 기존에 RAG(추출 증강 생성)가 수학 및 코드 생성 같은 추론 작업에는 효과적이지 않다고 여겨졌던 통념을 반박하며, 사고 추적(thinking traces)을 검색 소스로 활용하는 새로운 접근 방식을 제안합니다. 문제 해결 과정에서 발생하는 중간 추론 경로를 구조화하고 검색 친화적인 표현으로 변환하는 T3라는 오프라인 방법을 소개했습니다. 이 방법으로 구성된 RAG 파이프라인은 AIME, LiveCodeBench 등 주요 벤치마크에서 최신 모델 대비 높은 성능 향상을 보였으며, 추가 추론 비용 절감 효과도 입증했습니다.
본 논문은 대규모 언어 모델(LLM)의 높은 비용과 지연 시간 문제를 해결하기 위해 소규모 언어 모델(SLM)을 활용한 텍스트-SQL 생성 방법을 제안합니다. 핵심 프레임워크인 FINER-SQL은 그룹 상대 정책 최적화(Group Relative Policy Optimization)를 기반으로 하며, 기존의 희소 이진 보상 대신 '메모리 보상'과 '원자 보상'이라는 두 가지 혁신적인 피드백 메커니즘을 도입합니다. 이를 통해 SLM이 잘못된 SQL에 대해서도 지속적이고 해석 가능한 학습 신호를 받아 안정적으로 성능을 향상시키며, BIRD 및 Spider 벤치마크에서 대형 LLM 대비 높은 효율성과 정확도를 입증했습니다.
본 논문은 대화형 AI 심리 치료사의 반응 품질을 평가하기 위해 기존 LLM 판단자의 한계를 극복하는 새로운 모델 무관 평가자, 동적 감정 서명 그래프(DESG)를 제안합니다. DESG는 임상 기하학을 비대칭적으로 사용하여 대화 윈도우의 상태와 점수를 산출하며, 이는 단순히 텍스트 유사성이나 LLM 판단에 의존하는 기존 방식보다 더 정확하고 해석 가능한 평가를 제공합니다. 다양한 심리 지원 시나리오에서 DESG는 높은 성능을 입증하며, 임상 상태 매니폴드가 대화 품질 구별의 핵심임을 보여줍니다.
SURE-RAG는 검색 증강 생성(RAG)의 한계를 극복하기 위해 개발된 새로운 프레임워크로, 제공된 증거가 답변을 충분히 지지하는지 여부를 선택적으로 검증합니다. 이 시스템은 문서 수준의 점수를 넘어 공유 쌍 수준에서 주장-증거 관계를 분석하고, 커버리지, 관계 강도, 불일치, 충돌 등 세 가지 핵심 결정과 함께 해석 가능한 신뢰성 점수를 제공합니다. HotpotQA-RAG v3 벤치마크에서 높은 성능을 입증했으며, 기존의 강력하지만 감사하기 어려운 모델들보다 우수한 투명성과 안전성을 제공함을 보여줍니다.
CuraView는 방출 요약서 작성 시 발생하는 충실성 환각(faithfulness hallucinations) 문제를 해결하기 위해 설계된 다중 에이전트 프레임워크입니다. 이 시스템은 환자의 EHR 데이터에서 GraphRAG 기반 지식 그래프를 구축하고, 문장 수준의 증거 검색 및 분류(E1-E4)를 포함하는 폐쇄형 생성-탐지 파이프라인을 구현합니다. 실험 결과, CuraView는 기존 모델 대비 높은 F1 점수를 달성하며 임상 문서의 사실적 신뢰성을 크게 향상시키고 재사용 가능한 주석 데이터셋까지 제공함을 입증했습니다.
기존에 LLM의 성공으로 인해 주목받아 온 그래프 토큰화 대형 언어 모델(GTokenLLMs) 패러다임에 의문을 제기하는 논문입니다. 이 연구는 GTokenLLMs가 자연어 임베딩 공간에서 그래프 토큰을 실제로 완전히 이해하는지 평가하기 위해 'GTEval'이라는 새로운 평가 파이프라인을 제안했습니다. 광범위한 실험 결과, 기존 GTokenLLMs는 그래프 토큰에 대한 이해도가 불완전하며, 명령 변화에 과민하거나 텍스트 정보에 지나치게 의존하는 경향을 보였습니다.
Workspace-Bench는 대규모 파일 의존성을 가진 작업 공간(workspace) 작업을 위한 AI 에이전트를 평가하기 위해 개발된 새로운 벤치마크입니다. 이 벤치마크는 현실적인 작업 환경을 시뮬레이션하여 최대 20GB의 파일을 포함하고, 총 388개의 고유한 파일 의존성 그래프를 가진 작업을 제공합니다. 이를 통해 에이전트가 교차 파일 검색, 문맥적 추론, 적응형 의사결정 능력을 종합적으로 평가할 수 있습니다.
본 논문은 특허 심사를 단순한 분류 작업이 아닌, 사무소 조치 생성 및 신청인 반박이 포함된 상호작용적이고 반복적인 과정으로 모델링하는 새로운 벤치마크 'PatRe'를 소개합니다. PatRe는 480개의 실제 사례를 기반으로 하며, 특허 심사 과정을 동적 다중 턴(multi-turn)의 정당화 및 응답 과정으로 재정의했습니다. 광범위한 LLM 실험을 통해 모델 성능에 대한 통찰력을 제공하며, 이는 특허 법률 추론과 기술적 신규성 판단이라는 복잡한 실제 세계 과제를 해결하는 데 있어 현재 AI 모델들이 가진 잠재력과 한계를 동시에 보여줍니다.
AfriVox-v2는 대규모 언어 모델(LLMs)의 아프리카 언어 적용에 있어 부족했던 실전적 평가 환경을 개선하기 위해 설계된 포괄적인 음성 인식 벤치마크입니다. 이 벤치마크는 실제 '현장(in the wild)' 비기록 오디오를 포함하며, 정부, 금융, 건강 등 10개 산업 분야에 걸친 엄격한 도메인 세분화 평가를 도입했습니다. AfriVox-v2의 결과는 최신 음성 모델들이 전문적이고 노이즈가 많은 아프리카 환경에서 여전히 일반화 격차를 보임을 입증하며, 지역화된 음성 AI 개발을 위한 중요한 지침을 제공합니다.
BIT.UA와 AAUBS 팀이 저자원 의료 QA 환경인 ArchEHR-QA 2026 공유 과제에 참여하여 LLM 평가를 수행했습니다. 이 연구는 데이터 부족과 엄격한 프라이버시 제약이 있는 의료 분야에서, 가중치 업데이트 없이 다양한 프롬프트 엔지니어링 전략을 사용하여 상용 및 오픈소스 LLM의 성능을 비교 분석합니다. 그 결과, 상용 모델은 전반적인 견고성을 보였으나, 도메인 적응형 오픈소스 모델(예: MedGemma 3 27B)이 최적화된 프롬프트와 결합했을 때 매우 경쟁력 있는 성능을 보여주었으며, 특히 증거 인용 정렬에서 우수한 성과를 거두었습니다.
Rose-SQL은 대규모 추론 모델(LRM)의 다중 턴 텍스트-SQL 작업에서의 잠재력을 극대화하기 위해 설계된 새로운 트레이닝 프리 프레임워크입니다. 이 프레임워크는 'Role-State'라는 개념을 도입하여 스키마 링크링과 SQL 생성 사이의 구조적 간극을 연결합니다. Rose-SQL은 구조적 동형성 검사를 통해 대화의 역사적 컨텍스트를 추적하며, 모델이 검증된 상호작용 경로를 따라 정확한 SQL 조성을 추론하도록 안내하여 높은 성능을 달성했습니다.
본 논문은 트랜스포머 모델이 컨텍스트에 따라 두 가지 추론 모드(In-Distribution 및 Out-of-Distribution)를 가질 수 있음을 보여줍니다. 내부 표현을 분석한 결과, 학습된 작업 벡터 기하학이 이 두 모드를 지배함을 밝혀냈습니다. 구체적으로, 분포 내 행동은 기존 작업 벡터의 볼록 결합으로 구현되는 베이즈적 검색에 의해 발생하며, 분포 밖 일반화는 작업 벡터 공간과 직교하는 새로운 서브스페이스를 차지하는 추측성 학습을 통해 이루어집니다.
본 기사는 대형 언어 모델(LLMs)이 법률 워크플로우에 통합되면서 발생하는 실제적인 위험성을 평가하기 위해 한국어 벤치마크 'TriBench-Ko'를 소개합니다. 이 벤치마크는 사법 심리, 판례 검색, 법적 문제 추출, 증거 분석 등 네 가지 핵심 사법 과제를 다루며, 환상(hallucination), 편향, 불일치 등 다양한 배포 위험 범주에서 LLM의 성능을 종합적으로 평가합니다. 연구 결과에 따르면, 현재 많은 LLMs가 판례 검색과 중요한 법적 정보 포착에 어려움을 겪는 심각한 위험성을 나타내는 것으로 분석되었습니다.
이 가이드는 토큰화부터 RLHF에 이르기까지 현대 NLP 파이프라인 전체를 포괄적으로 다루는 연구 지향적인 실습 매뉴얼입니다. 12개의 손으로 하는 세션은 이론과 상세한 구현 계획, 평가 지표를 결합하여 재현 가능한 연구 결과물(Artefact)을 만드는 데 중점을 둡니다. 특히 Hugging Face 생태계와 오픈 웨이트 모델을 활용하며, 데이터 부족 환경에 적응하는 방법론까지 다루는 심층적인 실습 경험을 제공합니다.