Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 대형 추론 모델(Large Reasoning Models)의 다단계 추론 과정 중 발생하는 지식 격차를 해결하기 위해 적응형 검색 프레임워크인 ReaLM-Retrieve를 제안합니다. 기존 RAG 시스템이 추론 시작 전 컨텍스트 제공에 최적화된 것과 달리, ReaLM-Retrieve는 추론 단계별 불확실성을 감지하고 외부 증거가 가장 필요한 시점에 개입하는 정책을 학습하여 검색의 효율성과 정확도를 동시에 높입니다. 실험 결과, 이 프레임워크는 표준 RAG 대비 F1 점수에서 평균 10.1%의 개선을 달성했으며, 검색 호출 횟수를 크게 줄이면서도 높은 성능을 유지했습니다.
본 논문은 LLM의 추론 과정에서 발생하는 높은 연산 비용 문제를 해결하기 위해 '슈퍼토큰(supertokens)'이라는 새로운 압축 기법을 제안합니다. 이 방법은 추론 토큰을 구조적이고 반복적인 저엔트로피 패턴과 문제 특이적인 고엔트로피 내용으로 분리하여, 전자의 패턴에 크로스워드 BPE 병합을 적용해 슈퍼토큰을 생성하고 이를 모델에 학습시킵니다. 그 결과, 정확도 손실 없이 평균 8.1%의 추론 트레이스를 단축하는 효과를 보였으며, 나아가 이 슈퍼토큰이 모델의 상위 레벨 전략(예: 백트래킹)을 해석 가능한 주석으로 활용될 수 있음을 입증했습니다.
본 논문은 텐서 병렬성(TP)과 시퀀스 병렬성(SP)을 하나의 장치 축에 통합하는 새로운 병렬 실행 전략인 '텐서와 시퀀스 병렬성(TSP)'을 제안합니다. TSP는 모델 가중치와 토큰 모두를 동일한 장치 축을 따라 분산하여, 파라미터 메모리와 활성화 메모리를 동시에 효율적으로 줄입니다. 이를 통해 기존의 다차원 병렬성 방식보다 통신 부하가 적은 메모리 오버헤드로 메모리 제약이 큰 대규모 모델 학습 및 추론에 효과적인 하드웨어 인식 솔루션을 제공합니다.
ClassEval-Pro는 명세로부터 완전하고 구조화된 클래스를 생성하는 '구성적 코드 생성' 능력을 평가하기 위해 개발된 새로운 크로스 도메인 벤치마크입니다. 이 벤치마크는 2025년 1월 이후의 실제 GitHub 코드를 활용하여 11개 도메인에 걸쳐 300개의 클래스 레벨 작업을 포함합니다. 연구 결과, 최첨단 LLM조차도 클래스 레벨 Pass@1에서 45.6%에 그쳤으며, 오류 분석을 통해 교차 메서드 조정(cross-method coordination)이 주요 성능 병목 현상임을 밝혀냈습니다.
본 논문은 Parametric Retrieval-Augmented Generation (PRAG)의 한계점인 '지식과 작업 행동의 얽힘(entanglement)' 문제를 해결하기 위한 새로운 어댑터 학습 설정, Orthogonal Subspace Decomposition (OSD)을 제안합니다. OSD는 재사용 가능한 작업 행동을 별도의 Task LoRA로 분리하고, 문서별 지식을 직교 서브스페이스에 인코딩하는 방식으로 PRAG를 개선합니다. 이 직교화 전략은 여러 어댑터를 병합할 때 파라메트릭 RAG의 구성적 견고성(compositional robustness)을 크게 향상시키는 것으로 나타났습니다.
본 논문은 전자 건강 기록(EHRs)을 대상으로 하는 근거 기반 질문 답변(grounded QA) 과제를 해결하기 위한 연동형 LLM 파이프라인인 HealthNLP_Retrievers 시스템을 제시합니다. 이 시스템은 Gemini 2.5 Pro를 기반으로 하며, 환자 쿼리 재형식화, 증거 스코어링, 근거 기반 답변 생성, 그리고 정밀한 답변-증거 정렬의 네 가지 통합 모듈로 구성됩니다. 이러한 다단계 파이프라인 접근 방식은 LLM을 구조화하여 근거 기반성, 정밀도 및 전문적인 건강 커뮤니케이션 능력을 크게 향상시켰습니다.
본 논문은 소형 언어 모델(SLM)이 대형 언어 모델(LLM)의 추론 능력 격차를 극복하는 새로운 방법인 '지역적 충분성(local sufficiency)'을 제안합니다. 기존 방식들이 외부 LLM 호출이나 표준 지식전달에 의존하여 한계를 겪었던 문제를 해결하기 위해, 이 연구는 LLM의 선택 과정을 SLM이 제시한 후보 순위 내에서의 선택 논리로 재정의하는 'SELECT TO THINK (S2T)' 프레임워크를 도입합니다. 이를 통해 개발된 S2T-LOCAL은 외부 의존성 없이도 자율적인 리랭킹을 수행하며, 벤치마크에서 탐욕적 디코딩 대비 평균 24.1%의 성능 향상을 달성했습니다.
본 논문은 대형 언어 모델(LLMs)이 생성한 텍스트를 탐지하기 위해 DSIPA라는 새로운 비학습 기반 프레임워크를 제안합니다. 이 방법은 LLM이 일반적으로 감정적으로 더 일관된 출력을 보이는 반면, 인간 작성 텍스트는 더 큰 정서적 변동을 보인다는 근본적인 행동 비대칭성을 활용합니다. DSIPA는 지도 학습이나 모델 파라미터 접근 없이도 제로샷/블랙박스 방식으로 작동하며, 다양한 도메인과 최신 LLM에 대해 높은 탐지 성능과 강력한 일반화 능력을 입증했습니다.
본 논문은 LLM 개인화 평가에 있어 '저자성 과학' 기반의 평가 기준이 필수적임을 주장합니다. 기존의 스타일적 개인화 평가는 저자의 고유한 스타일을 측정하는 이론적 근거가 부족하여, 실제로는 의미 있는 '저자성 격차(authorship gap)'를 놓치고 있습니다. 연구진은 LUAR와 같은 이론 기반 지표를 사용하여 50명의 저자와 1,000개의 생성 데이터를 평가한 결과, 모든 개인화 방법이 낮은 점수를 받았으며, 기존의 임의적인 벤치마크들은 이 격차를 감지하지 못함을 입증했습니다. 이는 LLM 성능 평가가 단순한 데이터 측정에 그치는 것이 아니라, 견고한 이론적 기반을 갖추어야 함을 시사합니다.
본 논문은 차등 프라이버시(DP) 기반 텍스트 재작성이 단순 단어 치환을 넘어 언어의 전반적인 스타일과 레지스터 정체성에 영향을 미친다는 것을 탐구합니다. 연구 결과, DP 제약 하의 재작성은 텍스트의 소통적 서명을 체계적으로 변형시키며, 특히 상호작용 마커나 복잡한 종속 관계 같은 인간 저자의 고유 스타일을 크게 손실시킵니다. 이는 의미론적 내용은 보존하지만, 텍스트를 비참여적이고 설득력이 없는 중립적인 레지스터로 강제적으로 동질화시키는 경향이 있음을 보여줍니다.
본 논문은 여러 개의 독립적인 시퀀스를 동시에 디코딩해야 하는 속성 값 추출(AVE)과 같은 작업의 효율성을 높이기 위해 하이퍼-병렬 디코딩(HPD)이라는 새로운 알고리즘을 제안합니다. HPD는 위치 ID 조작을 통해 토큰 생성을 순서에 얽매이지 않게 하여, 병렬 처리를 극대화하고 추론 속도를 혁신적으로 가속화합니다. 이 방법은 모든 LLM과 호환되며, AVE 작업뿐만 아니라 독립적인 출력 구조를 가진 다양한 시나리오에 적용 가능하여 산업적 활용도가 매우 높습니다.
본 연구는 인도네시아어 인스타그램 댓글에서 사이버 괴롭힘을 탐지하기 위해 다양한 머신러닝 및 딥러닝 모델의 성능을 비교 분석했습니다. 650개의 균형 잡힌 데이터셋과 슬랭 정규화, 스템밍 등을 포함한 도메인 특화 전처리 파이프라인을 적용하여 Naive Bayes, Logistic Regression 등 전통적인 ML 모델과 BiLSTM with Attention 같은 딥러닝 모델의 성능을 평가했습니다. 그 결과, 로지스틱 회귀가 머신러닝 중 최고 성능을 보였고, BiLSTM with Attention은 가장 강력한 전반적 성능을 달성하여, 도메인 특화 전처리와 각 접근법의 장점을 입증했습니다.
본 기술 기사는 Word2Vec 기반의 마스크드 언어 모델(MLM)을 활용하여 잠재적 의미 스케일링(LSS)의 새로운 버전을 개발하고, 이를 통해 텍스트에 극성 점수를 할당하는 준지도 기법을 제안합니다. 이 방법은 시드 단어가 주어진 문맥에서 발생할 확률을 기반으로 단어와 문서에 극성 점수를 부여하며, 기존 공간적 모델보다 더 정확하고 해석 가능하며 일관성이 높은 것으로 나타났습니다. COVID-19 팬데믹 기간 동안의 언론 보도 분석 사례를 통해 제안된 방법이 우수한 성능을 입증했습니다.
본 기사는 가상 캐릭터 대화에서 단순한 사실 회상을 넘어선 '전략적 기억 활용' 능력을 평가하기 위해 새로운 벤치마크인 StratMem-Bench를 소개합니다. 기존의 벤치마크들이 기억을 정적인 정보 저장소로 취급했던 한계를 극복하고, 이 데이터셋은 필수적, 지원적, 무관한 기억으로 구성된 복잡한 기억 풀을 탐색하도록 설계되었습니다. 또한, 엄격한 기억 준수, 통합 품질 등 다각적인 평가 지표를 제시하여 캐릭터의 고도화된 대화 능력을 측정합니다.
FlowBot은 이계층 최적화와 텍스트적 기울기(textual gradients)를 활용하여 LLM 워크플로우를 데이터 기반으로 자동으로 유도하고 최적화하는 새로운 접근법입니다. 기존의 수동 파이프라인 의존성 문제를 해결하며, 상위 루프는 전체 워크플로우 구조를, 하위 루프는 개별 LLM 호출을 각각 최적화합니다. 이 방법을 통해 발견된 워크플로우는 인간 제작 또는 자동 생성 방식의 강력한 베이스라인과 경쟁할 수 있는 성능을 입증했습니다.
본 연구는 '20-Emotion Text Classification Dataset'을 활용하여 20개 클래스에 대한 정교한 감정 분류 성능을 비교 분석했습니다. 로지스틱 회귀, SVM 등 전통적인 머신러닝 모델과 BiLSTM, GRU, 트랜스포머 같은 최신 딥러닝 아키텍처를 벤치마킹했습니다. 그 결과, BiLSTM이 높은 정확도와 F1 점수를 기록하며 전반적인 성능에서 가장 우수한 결과를 보였으며, 이는 순서 기반의 딥러닝 모델이 텍스트의 문맥적 감정 단서를 포착하는 데 효과적임을 입증합니다.
본 논문은 입지 감지(Stance detection) 작업을 위해 제로샷 프롬프팅부터 다중 에이전트 논쟁까지 다양한 LLM 기반 전략들을 체계적으로 비교 분석했습니다. 15개의 다양한 크기의 LLM을 사용하여 총 5가지 방법을 4개 데이터셋의 14개 서태스크에 걸쳐 실험한 결과, 가장 좋은 성능은 프롬프팅 기반 방법에서 나왔으며, 에이전트 기반 방법은 높은 API 호출 비용을 요구하는 것으로 나타났습니다. 또한, 모델 스케일이 방법 선택보다 성능에 더 큰 영향을 미치며, 특정 크기(약 32B) 이후에는 성능 향상이 정체되는 경향을 발견했습니다.
본 논문은 대형 언어 모델(LLMs)의 강화학습(RL) 학습 과정에서 발생하는 성능 포화 문제를 해결하기 위한 새로운 방법인 Entrocraft를 제안합니다. 기존 RL 알고리즘들이 겪는 엔트로피 붕괴 문제를 다루기 위해, Entrocraft는 거부 표본 추출 기반으로 사용자 정의 엔트로피 스케줄을 구현하며 목적 함수 정규화나 이득 추정기에 의존하지 않습니다. 실험 결과, Entrocraft는 LLM의 일반화 능력과 출력 다양성을 크게 개선하여 성능 포화 문제를 효과적으로 해결함을 입증했습니다.
음성 생성 및 변환 분야에서 감정 표현력을 측정하기 위해 흔히 사용되는 임베딩 기반의 코사인 유사도 접근 방식에 대해 비판적으로 고찰합니다. 이 방법은 참조 샘플과 생성된 샘플 간의 감정적 합성을 정량화하는 데 필수적이지만, 실제로는 언어적 및 화자 변이로 인해 감정 특징을 포착하는 데 한계가 있습니다. 연구는 통제된 적대적 작업과 인간 평가를 통해 이러한 잠재 공간 유사성 지표가 제로샷(zero-shot) 환경에서 신뢰할 수 없으며, 궁극적으로 인간의 실제 청각 지각과 정렬되지 않음을 주장합니다.
이 논문은 언어 모델(LMs)의 문장 이해 전략에 대한 기존 연구의 한계를 지적하며, 인간처럼 인지 자원 제약 하에서의 행동을 탐구하는 새로운 이중 작업 패러다임을 제안합니다. 실험 결과, GPT-4o와 같은 최신 LMs는 산술 계산과 문장 이해를 결합한 이중 작업 조건에서 '가능성 기반(plausibility-based)' 추론으로 전환되는 경향을 보였습니다. 이는 메모리와 처리 자원의 제한이 모델의 합리적이고 인간과 유사한 추론 능력을 촉진함을 시사하며, 인지 자원 할당 관점에서 LMs를 이해하는 데 중요한 통찰을 제공합니다.