Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 50개의 대형 언어 모델(LLM)을 대상으로 다양한 심리측정 설문지를 적용하여 LLM들이 공유하는 주요 심리측정적 변동 축을 식별했습니다. 분석 결과, 모델 간의 가장 지배적인 차원은 전통적인 성격 특성보다는 '현상적 경험의 원천으로서 자신을 제시하는 정도'와 '행동 반응 시스템으로 자신을 제시하는 정도'를 구분하는 Pinocchio 축($ ext{Pinocchio Axis}$)임이 밝혀졌습니다. 이 축은 모델이 자신의 존재 방식을 어떻게 자기 표현(self-represent)하는지에 대한 훈련 기반의 경향성을 반영하며, 이는 후속 미세 조정 과정의 영향을 강하게 받음을 시사합니다.
본 기술 기사는 SemEval-2026 과제 11(대규모 언어 모델에서 내용과 형식 추론 분리)에 제출된 시스템을 소개합니다. 이 시스템은 소수 파라미터의 작은 LLM과 기호 증명기를 결합한 효율적인 모듈형 신경 기호 접근법을 사용합니다. 주요 구성 요소로는 자연어 시론을 일차 논리(FOL)로 변환하는 LLM 기반 파서, 자동 정리 증명기, 그리고 다국어 처리를 위한 기호 검색 컴포넌트가 포함됩니다.
본 기술 기사는 자연어 처리(NLP) 분야에서 주로 사용되던 임베딩 패러다임을 표 데이터(tabular data)에 적용하는 어려움을 지적하며 시작합니다. 이를 해결하기 위해, 연구진은 표 이해 능력을 평가하는 종합 벤치마크인 TabBench를 소개하고, 표 분류와 검색을 단일 공유 임베딩 공간에서 통합한 새로운 모델 TabEmbed를 제안했습니다. TabEmbed는 대규모 대비 학습과 정교한 네거티브 마이닝 기법을 활용하여 표의 구조적 및 수치적 뉘앙스를 효과적으로 포착하며, 기존 최첨단 모델들을 능가하는 성능을 보여주었습니다.
Conceptors는 기존 LLM 제어 방식인 활성화 기반 스티어링의 한계를 극복하기 위해 제안된 새로운 개념적 스티어링 방법론입니다. 이는 단일 방향 대신, 개념 전체의 다차원 부분공간을 보존하는 부드러운 투영 행렬(soft projection matrices)을 사용하여 LLM의 행동을 제어합니다. Conceptors는 닫힌 형태의 논리 연산(AND, OR, NOT)을 지원하며, 여러 의미론적 차원에서 개념 분리성을 평가하고 다차원 레이어에서 높은 성능과 안정성을 입증했습니다.
본 논문은 LLM 정렬의 핵심 요소인 보상 모델(Reward Models)이 단순히 지시사항 준수 여부를 넘어 사회적 바람직성을 얼마나 잘 포착하는지 분석합니다. 기존 평가는 이러한 사회적 측면을 간과하여 중요한 '사회적 정렬 실패'를 놓칠 수 있습니다. 연구진은 편향, 안전성, 도덕성 등 네 가지 사회적 영역으로 벤치마킹 범위를 확장하고 새로운 프레임워크를 제시했습니다. 그 결과, 현재의 보상 모델들은 강력한 사회적 지능에 미치지 못하며, 종종 사회적으로 부적절한 응답을 선호하는 경향과 체계적인 편향 분포를 보이는 것으로 나타났습니다.
본 논문은 장기 지평 LLM 에이전트가 중간 정보 수집 턴에서 효과적으로 보상을 받을 수 있도록 '자기 유도 결과 잠재력(Self-Induced Outcome Potential, SIOP)'이라는 새로운 방법을 제안합니다. 기존 방법들은 최종 답변에만 의존하거나 안정적인 검증자를 필요로 하는 한계가 있었습니다. SIOP는 최종 답변의 의미론적 클러스터를 미래 결과 상태로 간주하고, 이 상태들에 대한 신뢰도 인식을 바탕으로 턴 수준 크레딧을 할당하여, 검증자 없이도 정보 잠재력을 형성할 수 있게 합니다.
본 논문은 대형 언어 모델(LLM)의 환각을 감지하기 위한 경량의 단일 패스 불확실성 정량화 방법을 제안합니다. 이 방법은 반복 샘플링이나 외부 모델 없이 주의 행렬(attention matrices)을 활용하여 불확실성을 추정하며, 구체적으로 각 어텐션 헤드의 분포와 균일 참조 분포 간의 KL 발산을 측정합니다. 실험 결과, 이 '주의 발산' 신호는 답변의 정확도를 높은 예측력으로 보여주었으며, 모델의 중간 층과 사실적 토큰에서 불확실성 정보를 제공하는 효율적인 화이트박스 지표임을 입증했습니다.
본 논문은 비전-언어 모델(VLMs)이 객체 간 상호작용 추론에 취약한 '관계 환각' 문제를 다룹니다. 특히 이미지의 회전이나 노이즈 같은 시각적 왜곡이 관계 이해 능력을 크게 저하시킨다는 것을 실험적으로 입증했습니다. 연구진은 프롬프트 기반 전처리 전략을 평가했지만, 이들이 근본적인 환각 문제를 완전히 해결하지 못하며, 더 견고한 기하학적 인식을 갖춘 VLM 개발의 필요성을 제기합니다.
본 논문은 대규모 언어 모델(LLM)의 특정 개입(intervention)이 모델 행동에 미치는 영향을 자동으로 평가하고 감사를 수행하는 파이프라인을 제시한다. 이 방법은 기본 모델과 개입된 모델 간의 다중 토큰 생성을 비교하여, 통계적으로 검증되고 인간이 이해하기 쉬운 자연어 가설을 생성하며 반복적인 주제를 식별한다. 합성 환경 및 실제 시나리오(예: 추론 정제, 지식 편집)에 적용하여, 이 파이프라인이 의도된 변화뿐만 아니라 예상치 못한 행동 변화까지 포착할 수 있음을 입증했다.
본 연구는 언어 모델(LMs)이 단순히 문자열의 가능성(likelihood)을 최대화하는 것과 별개로, 문법적 적절성을 암묵적으로 학습했는지 탐구한다. 자연주의 텍스트 코퍼스에 변형을 가한 문법적 및 비문법적 데이터셋을 사용하여 선형 프로브를 훈련시킨 결과, 이 프로브가 인간의 판단 기준에 일반화되며 기존 LM 확률 기반 방법보다 우수한 성능을 보였다. 또한, 이 프로브는 교차 언어 일반화 능력을 보여주었으며, 이는 LMs가 내부적으로 문법적 적절성 구분을 수행하고 있음을 시사한다.
본 논문은 엔드 투 엔드 ASR 시스템의 성능에 대한 기존의 CER/WER 기반 평가 지표의 한계를 지적하며, 하단 토큰화 알고리즘과 자기지도 학습 모델이 프랑스어 ASR 시스템에 미치는 영향을 종합적으로 분석합니다. 단순히 오류율만 고려하는 것이 아니라, 다양한 언어학적 및 음향학적 관점을 포괄하는 평가 지표 집합을 사용하여 심층적인 성능 평가를 수행했습니다.
본 연구는 극단적 기후 사건 관련 뉴스 검색의 정확도를 높이기 위해 주제 모델(Topic Models)을 이진 분류기(Binary Classifier)로 활용하는 방법을 제시합니다. 기존에 탐색적 분석에 주로 사용되던 주제 모델의 후분포를 사용하여, 어노테이션된 샘플 기반 평가 지침 하에서 관련 문서를 선택하고 검색 정밀도를 개선할 수 있음을 보여줍니다. 또한, 이 방법론을 텍스트 임베딩 분류기 및 오픈 웨이트 LLM과 비교하며 그 성능적 트레이드오프와 한계점(위험 의존성)을 논의합니다.
본 연구는 독일어 면적 기반 감성 분석(ABSA) 개발에 있어 다양한 주석 소스(전문가, 학생, 크라우드워커, LLM)의 품질을 비교 평가했습니다. 기존 데이터셋을 전문가들이 재주석하여 기준 데이터를 설정하고, 이를 바탕으로 다른 그룹들의 주석을 검증합니다. 평가는 상호 주석자 동의도(IAA)와 다운스트림 모델 성능에 초점을 맞추었으며, ABSA의 최신 기술들을 적용하여 각 주석 방식의 신뢰성과 효율성 간의 트레이드오프를 분석했습니다.
본 논문은 키릴 문자를 사용하는 저자원 언어인 시리아어(Tajik)를 위한 생성형 대규모 언어 모델(LLM) 적응 방안을 제시합니다. 연구진은 31만 건의 문서로 구성된 시리아어 웹 코퍼스를 구축하고, 전체 미세 조정, LoRA, QLoRA 등 다양한 PEFT 전략을 적용하여 성능을 비교 분석했습니다. 그 결과, Mistral 7B 모델에 QLoRA(r=16)를 적용했을 때 가장 우수한 성능(평균 퍼플렉시티 5.03)을 달성했으며, 이는 계산 효율성과 품질 유지 측면에서 실질적인 가치를 제공함을 입증했습니다.
이 기술 기사는 LLM 추론 과정에서 '공개 타이밍'을 조절 가능한 결정으로 만드는 새로운 방법인 Side-by-Side (SxS) Interleaved Reasoning을 제안합니다. 기존의 자동 회귀 생성 방식은 토큰 하나하나가 비가역적인 공개적 약속을 구성하여, 추가적인 고찰이 지연되거나 초기 스트리밍에 편향될 위험(침묵세금)을 초래했습니다. SxS는 부분적인 공개와 지속적인 사적 추론을 교차시키면서도, 현재까지의 추론에 의해 '지원'될 때만 콘텐츠를 방출하여 이 문제를 해결합니다.
LLM-XTM은 다국어 주제 모델링의 한계를 극복하기 위해 제안된 프레임워크입니다. 이 방법은 대규모 언어 모델(LLM) 유도 주제 정교화와 자기 일관성 불확실성 양적을 결합하여, 기존 모델들이 겪던 희소한 자원 의존성 및 불안정성을 개선합니다. LLM-XTM은 다국어 코퍼스에서 주제의 일관성과 정렬을 향상시키면서도 비용 효율적이고 안정적인 성능을 보여줍니다.
본 논문은 반복적인 LLM 추론(repeated sampling)의 성능이 단순히 단일 호출 정확도로 결정되는 것이 아니라, 예시별 정답 확률의 잠재 분포에 의해 결정됨을 분석합니다. 연구진은 조건부 독립 동일 분포 하에서 2차 모멘트까지 활용하여 안정적 오류와 회복 가능한 무작위성을 구분하는 방법을 제시하며, 이를 통해 고정된 다수 투표 예산이 분포에 관계없이 일정한 성능 이득을 제공함을 보였습니다. 또한, 최대 엔트로피 및 잠재 난이도 가우시안-프로빗(LDGP) 점 완성을 추가하여 실험적으로 3표 및 5표 정확도가 2 호출 영역에 포함됨을 입증했습니다.
SURE-RAG는 검색 증강 생성(RAG)의 한계를 극복하기 위해 개발된 새로운 프레임워크로, 제공된 증거가 답변을 충분히 지지하는지 여부를 선택적으로 검증합니다. 이 시스템은 문서 수준의 점수를 넘어 공유 쌍 수준에서 주장-증거 관계를 분석하고, 커버리지, 관계 강도, 불일치, 충돌 등 세 가지 핵심 결정과 함께 해석 가능한 신뢰성 점수를 제공합니다. HotpotQA-RAG v3 벤치마크에서 높은 성능을 입증했으며, 기존의 강력하지만 감사하기 어려운 모델들보다 우수한 투명성과 안전성을 제공함을 보여줍니다.
기존에 LLM의 성공으로 인해 주목받아 온 그래프 토큰화 대형 언어 모델(GTokenLLMs) 패러다임에 의문을 제기하는 논문입니다. 이 연구는 GTokenLLMs가 자연어 임베딩 공간에서 그래프 토큰을 실제로 완전히 이해하는지 평가하기 위해 'GTEval'이라는 새로운 평가 파이프라인을 제안했습니다. 광범위한 실험 결과, 기존 GTokenLLMs는 그래프 토큰에 대한 이해도가 불완전하며, 명령 변화에 과민하거나 텍스트 정보에 지나치게 의존하는 경향을 보였습니다.
Workspace-Bench는 대규모 파일 의존성을 가진 작업 공간(workspace) 작업을 위한 AI 에이전트를 평가하기 위해 개발된 새로운 벤치마크입니다. 이 벤치마크는 현실적인 작업 환경을 시뮬레이션하여 최대 20GB의 파일을 포함하고, 총 388개의 고유한 파일 의존성 그래프를 가진 작업을 제공합니다. 이를 통해 에이전트가 교차 파일 검색, 문맥적 추론, 적응형 의사결정 능력을 종합적으로 평가할 수 있습니다.