Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 특허 심사를 단순한 분류 작업이 아닌, 사무소 조치 생성 및 신청인 반박이 포함된 상호작용적이고 반복적인 과정으로 모델링하는 새로운 벤치마크 'PatRe'를 소개합니다. PatRe는 480개의 실제 사례를 기반으로 하며, 특허 심사 과정을 동적 다중 턴(multi-turn)의 정당화 및 응답 과정으로 재정의했습니다. 광범위한 LLM 실험을 통해 모델 성능에 대한 통찰력을 제공하며, 이는 특허 법률 추론과 기술적 신규성 판단이라는 복잡한 실제 세계 과제를 해결하는 데 있어 현재 AI 모델들이 가진 잠재력과 한계를 동시에 보여줍니다.
본 논문은 트랜스포머 모델이 컨텍스트에 따라 두 가지 추론 모드(In-Distribution 및 Out-of-Distribution)를 가질 수 있음을 보여줍니다. 내부 표현을 분석한 결과, 학습된 작업 벡터 기하학이 이 두 모드를 지배함을 밝혀냈습니다. 구체적으로, 분포 내 행동은 기존 작업 벡터의 볼록 결합으로 구현되는 베이즈적 검색에 의해 발생하며, 분포 밖 일반화는 작업 벡터 공간과 직교하는 새로운 서브스페이스를 차지하는 추측성 학습을 통해 이루어집니다.
이 가이드는 토큰화부터 RLHF에 이르기까지 현대 NLP 파이프라인 전체를 포괄적으로 다루는 연구 지향적인 실습 매뉴얼입니다. 12개의 손으로 하는 세션은 이론과 상세한 구현 계획, 평가 지표를 결합하여 재현 가능한 연구 결과물(Artefact)을 만드는 데 중점을 둡니다. 특히 Hugging Face 생태계와 오픈 웨이트 모델을 활용하며, 데이터 부족 환경에 적응하는 방법론까지 다루는 심층적인 실습 경험을 제공합니다.
본 연구는 복잡한 집합 구성적(set-compositional) 쿼리 검색의 성능을 BM25, ReasonIR, Search-R1 등 다양한 방법론으로 재현성 있게 분석했습니다. 기존 신경망 기반 검색기는 QUEST 벤치마크에서 높은 성능을 보였으나, 통제된 환경인 LIMIT+에서는 그 이점이 사라지는 경향을 보였습니다. 특히, 구성적 깊이가 깊어질수록 모든 방법의 성능이 저하되며, 대수적 희소(algebraic sparse) 및 단어 기반 접근법이 더 안정적인 성능을 유지하는 것으로 나타났습니다.
본 논문은 트랜스포머 모델이 초기 레이어에서 계산된 중요한 표현 정보를 깊은 층으로 전달하는 과정에서 손실되는 문제를 해결하기 위해 SATFormer를 제안합니다. 기존의 정적 잔류값 추가 방식보다 더 세밀하고 효율적인 접근 방식을 제공하며, 컨텍스트 의존적 게이트 메커니즘을 사용하여 초기 표현에 대한 선택적 재사용을 가능하게 합니다. 그 결과, 특히 검색(retrieval) 중심의 벤치마크에서 기존 방법 대비 성능 향상을 보이며, 처리량과 메모리 사용량 측면에서도 효율성을 유지합니다.
본 논문은 단순한 유사성 매칭을 넘어 추론 과정을 지원하는 '추론 집약적 검색'의 중요성을 강조하며, 에이전트 기반 검색 시스템에 필요한 리트리버 평가 및 훈련 방법론 개선을 제안합니다. 연구진은 다면적인 골드 증거를 포함하고 정적/에이전트 기반 프로토콜에서 평가하는 새로운 전문가 주석 벤치마크인 BRIGHT-Pro를 소개했습니다. 또한, 보완적인 긍정 예시와 조건부 부정 예시를 생성하는 측면 분해 합성 코퍼스 RTriever-Synth도 구축하여 리트리버의 성능을 향상시키는 방안을 제시합니다.
본 논문은 대형 언어 모델(LLMs)의 환각 문제를 해결하기 위해 '논리적 일관성'을 연결고리로 활용하는 새로운 프레임워크인 LaaB를 제안합니다. 기존 방법들이 응답이나 자기 판단 중 한 측면에만 초점을 맞춘 것과 달리, LaaB는 응답(Response)과 메타-판단(Meta-Judgment) 라벨 간의 논리적 연결고리를 모델링하여 두 신호를 통합하고 상호 학습함으로써 환각 탐지 성능을 획기적으로 개선합니다.
본 기술 기사는 텍스트 토큰으로 사전 학습된 고정(Frozen) Gemma 4 31B 트랜스포머 가중치를 활용하여, 별도의 훈련 가능한 인터페이스를 통해 다양한 모달리티 간의 경계를 넘어 지식을 전이하는 방법을 제시합니다. 이 접근 방식은 로봇 조작 작업(OGBench 등)에서 기존 최고 성능 기록을 능가하는 성과를 달성하며, 특히 기지판(baseboard)이 결코 본 적 없는 새로운 작업에서도 우수한 성능을 보여주었습니다. 또한, 구조적 분석 및 아블레이션 연구를 통해 모델의 특정 헤드와 스케일링 방법론이 모달리티 간 지식 전이에 핵심적인 역할을 함을 입증했습니다.
본 기사는 인공지능 시대의 중요한 연구 분야인 법조리 채굴(legal argument mining)을 다루며, 이 분야가 데이터, 기술, 이론적 측면에서 발전해 왔음을 설명합니다. 하지만 지속적인 진보에도 불구하고 전반적인 발전 속도가 느린 근본적인 원인을 분석했습니다. 저자는 그 핵심 원인이 단순히 데이터나 기술의 부족이 아니라, 법학적 이론적 표현력과 계산적 실현 가능성을 통합하는 구조적 접근법의 부재에 있다고 지적하며, 미래 연구 방향을 제시하고 있습니다.
ARGUS는 온라인 광고 거버넌스가 직면하는 규제 정책의 비정상성 문제를 해결하기 위해 제안된 시스템입니다. 이 시스템은 다중 에이전트 적대적 판정자(multi-agent adversarial umpiring)를 활용한 진화 강화 학습을 가능하게 합니다. ARGUS는 새로운 정책 데이터가 희소할 때 초기 인식, 적대적 레이블 정정 등의 3단계 프레임워크를 사용하여 효과적으로 작동합니다.
본 논문은 특허 신규성 평가의 복잡성을 다루며, 기존의 단순 이진 분류 방식이 가진 한계를 지적합니다. 이를 극복하기 위해 'FiNE-Patents'라는 새로운 세밀한 데이터셋을 소개하고, 단순히 청구항 전체를 판단하는 것이 아니라 기능 수준에서 기존 기술과의 매칭 및 추론 과정을 통합적으로 평가하는 새로운 패러다임을 제안합니다. 연구진은 LLM 기반 워크플로우를 구현하여 기능을 분해하고 각 기능을 개별적으로 분석함으로써 신규성을 예측하며, 이 방법이 기존의 임베딩 기반 방식보다 우수함을 입증했습니다.
본 연구는 반복적인 LLM 루프에서 모델이 특정 패턴에 수렴하는 현상을 분석하고, 이 루프를 다른 곳으로 이동시키기 위해 필요한 교란(disruption)의 양과 지속성을 탐구합니다. 30단계의 반복적 루프 환경에서 Append, Replace, Dialog 업데이트 규칙을 분리하여 테스트한 결과, 컨텍스트 길이와 업데이트 방식에 따라 모델이 원래 패턴에서 벗어나거나 새로운 목적지로 일관되게 이동하는 정도가 다름을 보여줍니다. 특히 전체 역사 프로토콜 하에서는 1,500 토큰 근처에서 탈출 성공률이 높아지는 등, 메모리 정책과 컨텍스트 관리 전략의 중요성을 강조합니다.
본 논문은 외부 증거를 활용하여 부정확한 텍스트를 수정하는 사실 오류 수정(FEC)의 한계를 극복하기 위해 '구성적 오류 수정(CECoR)' 프레임워크를 제안합니다. CECoR은 다단계 명제를 해석 가능한 추론 단계로 분해하고, 제어된 왜곡을 주입하여 고품질 훈련 쌍을 합성하는 것이 핵심입니다. 이 방법은 지도 미세 조정과 강화 학습을 결합한 두 단계 학습 전략을 통해 사실적 정확도와 견고성을 높였으며, 다단계 오류 수정에서 우수한 성능을 입증했습니다.
본 연구는 언어 모델이 수학 문제 해결과 같은 구조적이고 형식적인 출력을 생성할 때 발생하는 신뢰도 격차를 분석합니다. 기존의 프롬프트 엔지니어링(NAIVE, REFERENCE)이나 제약 디코딩 방식은 높은 작업 정확도를 유지하면서 일관되게 유효한 JSON 구조를 출력하는 데 실패했습니다. 연구진은 이를 해결하기 위해 'AloLab'이라는 블랙박스 API 기반의 반복적인 시스템 프롬프트 최적화기를 개발했으며, 이는 기존 방법론보다 훨씬 높은 수준의 형식적 출력 신뢰도와 작업 정확도를 동시에 달성함을 입증했습니다.
본 논문은 대규모 언어 모델(LLM)이 학습 데이터의 사회적 편향을 흡수하여 고정관념을 강화하는 문제를 해결하기 위해, 모델 가중치를 수정하지 않고 디코딩 시간(추론 시간)에 편향을 완화하는 새로운 접근 방식을 제안합니다. 이 방법은 별도의 프로세스 보상 모델(PRM)이 후보 토큰들을 공정성과 유창성 측면에서 점수화하여 '판사' 역할을 수행하며, Best-of-N 선택, 순차적 비평 및 수정(Sequential critique-and-revise), 헌법적 자체 감사 등 세 가지 정교한 스키마를 설계했습니다. 실험 결과, 특히 순차적 디비아싱 기법이 가장 효과적이어서 평균 편향 점수를 크게 개선하면서도 언어의 유창성을 유지하거나 향상시키는 것으로 나타났습니다.
InfoLaw는 대규모 언어 모델(LLM)의 훈련 과정에서 정보 확장 법칙을 다루는 새로운 프레임워크입니다. 이 방법은 소비된 토큰 수, 모델 크기, 데이터 혼합 가중치, 그리고 반복 횟수까지 고려하여 LLM의 성능을 예측합니다. 기존 방식이 혼합 레시피나 반복에 대한 외부 추정을 제공하지 못했던 한계를 극복하고, 다양한 컴퓨팅 예산 하에서 최적의 데이터 조합과 규모를 결정할 수 있게 합니다.
본 가이드는 언어 모델의 추론 능력을 평가하는 연구자들을 위해 작성되었으며, 단순히 최종 답변의 정확도만으로는 충분하지 않다고 강조합니다. 대신, 추론 과정을 '검색과 같은 절차'로 형식화하여 중간 단계의 선택 및 정지 과정을 분석해야 한다고 주장합니다. 따라서 최종 결과뿐 아니라 중간 디코딩 과정이나 외부화된 추론 흔적(traces)을 평가 목표로 삼는 프로세스 기반 평가 방법론으로의 전환이 필요함을 제안합니다.
HalluScan은 대규모 언어 모델(LLMs)의 환각 현상을 체계적으로 탐지하고 완화하기 위한 포괄적인 벤치마크 프레임워크입니다. 이 프레임워크는 6가지 탐지 방법, 4개 오픈웨이트 모델 계열, 그리고 3개 도메인을 포함하는 총 72가지 구성을 평가합니다. 주요 기여로는 인간 전문가 판단과 높은 상관관계를 보이는 새로운 복합 지표인 HalluScore와 비용 효율적인 적응형 탐지 라우팅(ADR) 알고리즘 등이 있습니다.
Shadow-Loom은 서사적 세계를 버전 관리 가능한 그래픽 세계 모델로 변환하는 실험적인 오픈소스 프레임워크입니다. 이 시스템은 물리적 인과성(Pearl의 계단)을 다루는 엔진과 반사실적 계산(AMWN 기반)을 수행하는 엔진을 결합하여, 미스터리, 서스펜스 등 네 가지 구조적 독자 상태에 따라 내러티브를 분석합니다. 대규모 언어 모델은 보조적인 역할로만 사용되며, 핵심 추론 및 개입은 그래프 상의 타입 코드를 통해 이루어져 연구 예술품으로 제공됩니다.
기존의 환각(hallucination) 평가는 영어에 편중되어 있어 다국어 적용에 한계가 있습니다. 본 연구는 MultiWikiQA 데이터셋을 활용하여 306개 언어의 합성 환각 데이터셋을 구축하고, 이를 기반으로 유럽 언어 30개에 대한 토큰 단위 환각 분류기를 개발했습니다. 이 분류기를 사용하여 여러 대규모 언어 모델(LLM)의 다국어 환각률을 평가한 결과, 일반적으로 모델 크기가 클수록 성능이 우수하며, 저자본 언어일수록 환각률이 높아지는 경향을 확인했습니다.