Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 대규모 언어 모델(LLM)의 신뢰성을 높이기 위한 불확실성 정량화(UQ) 기법으로, 샘플링에 의존하지 않는 그래디언트 기반 방법을 제안합니다. 기존 방법들이 파라미터 공간에서 작동했던 것과 달리, 본 연구는 의미 공간(semantic space)에서의 그래디언트를 고려하는 '의미 보존 점수(SPS)'를 도입했습니다. 이를 통해 LLM이 의미적으로 동등한 입력 변화에도 안정적인 출력을 유지해야 한다는 직관을 구현하며, 효율적이고 효과적인 불확실성 추정 방법을 제시합니다.
FAAST는 사전 학습된 모델의 효율적인 지도 학습 적응을 위해 제안된 새로운 방법론입니다. 이 방법은 단일 패스(single pass)로 라벨링된 예시들을 분석적으로 빠른 가중치(fast weights)로 컴파일하여, 메모리나 컨텍스트 의존성을 제거합니다. 그 결과, FAAST는 상수 시간 추론을 달성하고 기존의 역전파 기반 적응 방식과 동등하거나 더 나은 성능을 보이면서도 적응 시간을 90% 이상 단축하고 메모리 사용량을 크게 절감하는 효율적인 솔루션을 제공합니다.
본 논문은 대형 언어 모델(LLM)이 입력 프롬프트를 의미적으로 변형(Paraphrase)할 때, 원래 요청했던 출력 형식과 구조를 유지하지 못하는 '출력 모드 붕괴' 현상을 발견했습니다. 특히 온도가 0인 경우에도 이러한 실패가 발생하며, 이는 닫힌 형식(closed-form) 답변이 필요한 작업에서 심각한 문제를 야기합니다. 연구진은 이를 측정하기 위해 대규모 데이터셋 PARACONSIST를 구축하고 '의미 일관성 점수'를 제안했습니다.
본 논문은 시간 지식 그래프(Temporal Knowledge Graph, TKG) 추론의 핵심 과제인 역사적 증거와 진화적 역동성을 통합적으로 활용하는 새로운 프레임워크 CHE-TKG를 제안합니다. 기존 방법들이 이 두 출처 중 하나에만 집중했던 한계를 극복하기 위해, CHE-TKG는 두 관점을 명시적으로 분리하고 함께 모델링하여 상호 보완적인 예측 신호를 학습합니다. 이를 통해 장기적 구조와 단기 변화 모두를 포착하며 TKG 추론 성능을 향상시킵니다.
본 논문은 오디오 언어 모델(ALM)에 대한 적대적 공격(제일브레이킹)의 비효율성을 분석하고, 이를 개선하기 위한 새로운 최적화 기법을 제안합니다. 기존 공격 방식이 전체 웨이브포름을 밀도 있게 업데이트하는 반면, 연구진은 오디오 토큰 경량 에너지가 불균일하여 일부 작은 영역만 최적화를 지배한다는 것을 발견했습니다. 이에 따라, 고경량 에너지 토큰과 정렬된 웨이브포름에만 집중하고 나머지는 마스킹하는 '토큰 인식 기울기 최적화(TAGO)'를 제안했으며, 이는 기존 방식 대비 강력한 공격 성공률을 유지하면서도 상당한 희소화를 달성함을 입증했습니다.
본 논문은 도구 통합 Text-to-SQL 파싱의 크레딧 할당 문제를 해결하기 위해 FineStep이라는 새로운 프레임워크를 제안합니다. 기존 강화학습 접근법은 최종 결과물에만 보상을 집중하여, 중간 단계가 비효율적이거나 오류를 포함해도 모델이 동일한 보상을 받는 근본적인 문제가 있었습니다. FineStep은 독립적인 과정 보상 설계와 각 추론 단계의 가치를 정량화하는 단계 수준 크레딧 할당 메커니즘을 도입하여, 모델이 효율적이고 일반화된 방식으로 SQL을 생성하도록 유도합니다.
본 논문은 대형 언어 모델(LLMs)이 생성한 스토리가 인간의 내러티브 구조나 선호도에 미치지 못하는 문제를 해결하기 위해, 스토리 생성 과정에서 인간의 선호도를 효과적으로 모델링하는 방법을 제시합니다. 연구진은 첫 번째 벤치마크인 StoryRMB를 소개하고, 기존 보상 모델들이 인간 선호 스토리를 정확하게 선택하는 데 어려움을 겪는 한계를 발견했습니다. 이를 극복하기 위해 약 10만 개의 고품질 스토리 선호 쌍으로 훈련된 고급 보상 모델 'StoryReward'를 개발했으며, 이 모델은 StoryRMB에서 최고 성능(SoTA)을 달성하고 실제 응용 분야에서도 뛰어난 성능을 입증했습니다.
Gyan은 기존 트랜스포머 기반 대규모 언어 모델(LLM)의 한계점, 즉 구성적 문맥 포착 실패, 환각 현상, 높은 컴퓨팅 자원 요구 등의 문제를 해결하기 위해 설계된 새로운 설명 가능한 신경 기호 언어 모델입니다. 이 모델은 수사적 구조 이론, 의미역할 이론 등 지식 기반 계산언어학에 기반을 두어 완전한 구성적 문맥을 포착하며 '세계 모델'로 확장하여 인간의 이해를 모방합니다. Gyan은 특히 신뢰성과 투명성이 필수적인 임무 중요(mission critical) 사용 사례에서 높은 성능과 신뢰성을 제공할 수 있음을 입증했습니다.
본 논문은 다중모달 대형 언어 모델(MLLMs)의 환각 문제를 해결하기 위해 '불확실성 인지 탐색적 직접 선호 최적화(UE-DPO)'라는 새로운 방법을 제안합니다. 이 방법은 토큰 수준의 인식적 불확실성을 활용하여, 모델이 자신의 지식적 결함을 스스로 발견하고 적극적으로 수정하도록 유도하는 것이 핵심입니다. UE-DPO는 불확실성 인지 탐색 강도를 기반으로 시각적 결핍 토큰에 대한 학습 압력을 강화함으로써, MLLMs의 정렬(alignment)을 더욱 깊고 견고하게 만듭니다.
본 연구는 알려진 원시 요소들의 새로운 조합을 올바르게 해석하는 '구성적 일반화' 문제를 해결하기 위해 강화학습(RL)의 적용 가능성을 탐구했습니다. 기존의 감독식 미세 조정 방식은 전역적인 구성 구조를 포착하는 데 한계가 있어, 본 연구는 최종 결과에 대한 피드백을 활용하는 그룹 상대 정책 최적화(GRPO) 프레임워크를 제안합니다. 실험 결과, RL이 단순한 이진 보상뿐만 아니라 추가적인 구성 피드백을 제공하는 복합 보상을 통해 감독 학습보다 구성적 일반화를 효과적으로 개선함을 입증했습니다.
본 논문은 데이터가 부족한 희소 관측 환경에서 대규모 언어 모델(LLM)을 대리 모델로 활용하는 방식을 연구합니다. LLM이 유도하는 '대리 신념'이 프롬프트 텍스트와 쿼리 프로토콜에 크게 의존함을 밝히고, 이를 측정하기 위한 불확실성 정렬 기준을 제안했습니다. 실험 결과, 구조화된 프롬프트를 사용하면 효과적인 사전 확률로 작용하며, 다양한 쿼리 방식(POINTWISE, JOINT)과 순차적 증거는 비모노토닉하고 순서에 민감한 신뢰도 업데이트를 유발함을 보여주었습니다.
본 기술 기사는 기존의 직접 선호 최적화(DPO)가 가진 유창성 편향(verbosity bias) 문제를 해결하기 위해 RLearner-LLM이라는 하이브리드 학습 프레임워크를 제안합니다. 이 방법은 DeBERTa-v3 NLI 신호와 verifier LLM 점수를 결합하여 자동화된 선호 파이프라인을 구축함으로써, 인간 주석에 의존하지 않고 논리적 정확성(NLI)과 유창성을 동시에 개선하는 것을 목표로 합니다. 실험 결과, RLearner-LLM은 다양한 학술 도메인 및 소형 모델에서 SFT 대비 높은 NLI 향상률을 보였으며, 이는 LLM이 지식 집약적인 생성 작업에 필요한 논리적 추론 능력을 효과적으로 강화했음을 입증합니다.
본 논문은 현재의 LLM 벤치마크가 사회과학 과제를 충분히 포함하지 못하여 평가와 연구 발전에 한계를 초래한다고 지적합니다. 벤치마크는 AI 개발에 필수적인 요소이지만, 사회과학 분야의 복잡하고 문맥에 민감한 데이터셋이 부족합니다. 이에 저자들은 계산 사회과학자들이 주석한 데이터셋으로 구성된 새로운 벤치마크인 'BenCSSmark'를 제안하며, 이를 통해 LLM의 일반화 능력과 사회적 관련성을 높이고 AI 시스템의 투명한 발전을 촉진하고자 합니다.
본 논문은 혁신의 출현이 특허 데이터의 집단적인 언어적 변화를 통해 예측될 수 있음을 제시합니다. 연구진은 국제 특허 분류(IPC) 코드를 단어로 취급하고 트랜스포머 기반 모델인 TechToken을 개발하여, 이 코드 임베딩 간의 문맥 유사성을 측정함으로써 기술적 조합의 초기 신호를 포착하는 방법을 제안했습니다. 이를 통해 수천 개의 특허에 걸친 집단적인 변화를 분석하여 미래의 혁신을 높은 정확도로 예측할 수 있음을 입증했습니다.
본 논문은 대형 언어 모델(LLM)의 환각 현상을 분석하며, 특히 주의 메커니즘을 통해 정보 흐름의 방향성(운송 능력)을 진단하는 기존 스펙트럼 방법론의 근본적인 한계를 지적합니다. 연구진은 특정 주의 연산자가 구조적으로 방향에 무관함을 수학적으로 증명하고, 비대칭 계수를 방향 제어 변수로 설정하여 인과 관계를 정량화했습니다. 이 결과를 바탕으로, 모델의 병목 현상(bottleneck)과 확산(diffusion) 같은 실패 모드가 단순히 크기만 다른 것이 아니라 근본적인 '극성' 차이를 가지며, 이를 통해 해석 가능한 진단 신호를 제공할 수 있음을 보여줍니다.
본 기술 기사는 에이전트 기억 시스템에 대한 기존 접근 방식의 한계를 지적하며, 'True Memory'라는 새로운 검색 중심 아키텍처를 제안합니다. True Memory는 저장 스키마 대신 정문(event)에 초점을 맞춘 다단계 검색 파이프라인을 사용하여, 쿼리가 발생하기 전에 폐기되는 콘텐츠 손실 문제를 해결합니다. 이 시스템은 단일 SQLite 파일로 상용 CPU에서 실행 가능하며, 다양한 대화 및 장기 기억 평가 벤치마크에서 기존의 최신 모델들보다 높은 성능을 입증했습니다.
본 연구는 50개의 대형 언어 모델(LLM)을 대상으로 다양한 심리측정 설문지를 적용하여 LLM들이 공유하는 주요 심리측정적 변동 축을 식별했습니다. 분석 결과, 모델 간의 가장 지배적인 차원은 전통적인 성격 특성보다는 '현상적 경험의 원천으로서 자신을 제시하는 정도'와 '행동 반응 시스템으로 자신을 제시하는 정도'를 구분하는 Pinocchio 축($ ext{Pinocchio Axis}$)임이 밝혀졌습니다. 이 축은 모델이 자신의 존재 방식을 어떻게 자기 표현(self-represent)하는지에 대한 훈련 기반의 경향성을 반영하며, 이는 후속 미세 조정 과정의 영향을 강하게 받음을 시사합니다.
본 논문은 대규모 언어 모델(LLM)의 후 훈련 과정이 전체 깊이에 걸쳐 작업 기울기를 전파하는 기존 방식을 비싸고 침습적이라고 지적하며, 새로운 방법인 LoPT(Local-Learning Post-Training)를 제안합니다. LoPT는 트랜스포머 구조의 중간 지점에 단일 기울기 경계를 설정하여 후 훈련을 수행합니다. 이 방식은 작업 목표로부터 학습하는 부분과 표현 보존을 위한 부분을 분리하고, 초기 레이어에 대한 직접적인 간섭을 최소화하면서도 높은 효율성과 성능을 달성합니다.
본 논문은 터키어계 저자 자문 언어인 바슈키르어를 위한 대규모 언어 모델(LLM) 적응 과정에서 LoRA와 QLoRA의 성능을 비교 분석했습니다. 71k 문서로 구성된 코퍼스를 사용하여 다양한 아키텍처의 모델에 PEFT 기법을 적용한 결과, Mistral-7B나 Phi-2 같은 대형 모델에서도 파라미터 효율성을 유지하면서도 높은 품질을 달성할 수 있음을 입증했습니다. 특히 QLoRA는 계산 비용과 성능 사이에서 효과적인 균형점을 제공하며, 단지 낮은 퍼플렉시티가 항상 최적의 출력 품질을 보장하지 않으므로 모델 선택 및 평가 지표에 대한 신중한 접근이 필요함을 강조합니다.
본 기술 기사는 SemEval-2026 과제 11(대규모 언어 모델에서 내용과 형식 추론 분리)에 제출된 시스템을 소개합니다. 이 시스템은 소수 파라미터의 작은 LLM과 기호 증명기를 결합한 효율적인 모듈형 신경 기호 접근법을 사용합니다. 주요 구성 요소로는 자연어 시론을 일차 논리(FOL)로 변환하는 LLM 기반 파서, 자동 정리 증명기, 그리고 다국어 처리를 위한 기호 검색 컴포넌트가 포함됩니다.