Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
배전 유틸리티를 위해 요금 청구, 탄소 배출 분석, 부하 계획을 통합한 엔드 투 엔드 생성형 AI 프레임워크를 제안합니다. 이 시스템은 구조화된 수치를 자연어 명세서로 변환하는 생성형 AI 에이전트와 트랜스포머 기반의 소비 예측기를 포함하여 지속 가능한 자원 최적화를 지원합니다.
임상 의사 결정 지원 시스템(CDSS)의 투명성을 높이기 위해 데이터 출처부터 학습 프레임워크, 평가 프로토콜까지 전 과정을 공개하는 'Fully Open Meditron' 파이프라인을 제안합니다. 이 파이프라인은 임상 의사가 검증한 데이터셋과 엄격한 오염 방지 절차를 포함하며, 다양한 베이스 모델에 적용했을 때 기존 모델보다 뛰어난 의료 성능을 입증했습니다. 특히 Apertus-70B-MeditronFO는 새로운 FO SoTA를 기록하며 완전 개방형 방식의 효용성을 증명했습니다.
본 연구는 뇌 손상으로 인한 실어증 개념을 응용하여 언어 모델(LMs)의 내부 언어 기능 조직을 분석하는 새로운 기법을 제안합니다. 모델 파라미터를 의도적으로 손상시켜 나타나는 증상을 임상적 실어증 지표로 측정하였으며, 그 결과 모델의 구성 요소와 레이어 깊이에 따라 서로 다른 언어적 결함이 나타남을 확인했습니다.
Argus는 심층 연구 에이전트의 효율성을 높이기 위해 Searcher와 Navigator가 협력하는 증거 조립 시스템입니다. 기존의 병렬 롤아웃 방식이 정보의 중복 문제를 겪는 것과 달리, Argus는 증거 그래프를 기반으로 누락된 정보를 전략적으로 수집하여 추론 효율을 극대화합니다. 이를 통해 적은 컨텍스트 토큰을 사용하면서도 기존의 독점 에이전트들을 능가하는 성능을 보여주었습니다.
FORGE는 그래디언트 업데이트 없이 자연어 메모리 진화를 통해 LLM 에이전트의 의사결정 능력을 향상시키는 개체군 기반 프로토콜입니다. 성찰 에이전트가 실패한 경로를 규칙(Rules)이나 예시(Examples)로 변환하고, 성능이 우수한 메모리를 개체군 전체에 전파하는 방식을 사용합니다. 실험 결과, 기존 Reflexion 방식보다 높은 수익률을 기록하며 특히 성능이 낮은 모델의 역량을 효과적으로 보완함을 입증했습니다.
Transformer 레이어 압축 시 사용되는 교체(Replacement) 테스트와 교환(Interchange) 테스트의 개념적 차이와 그에 따른 결과의 불일치를 분석합니다. 연구 결과, 두 프로토콜은 모델의 규모와 학습 단계에 따라 레이어 제거의 안전성 범위를 크게 변화시키며, 따라서 레이어 병합이나 제거 전 두 가지 스왑-KL 점수를 모두 측정할 것을 권장합니다.
본 연구는 LLM이 사전 학습에 존재하지 않는 가상의 명령형 언어(PyLang)에서 코드 생성 능력을 얼마나 잘 전이할 수 있는지 분석했습니다. 그 결과, 파인튜닝은 구문적 지식 습득에는 효과적이지만, 의미론적 역량 자체를 새로운 언어로 옮기는 데는 실패하는 것으로 나타났습니다. 특히 모든 설정에서 Python이 PyLang보다 높은 성능을 보였으며, 모델들이 알고리즘적 이해력과 실제 구현 능력 사이의 '구현 충실도 격차(implementation fidelity gap)'를 가지고 있음을 밝혀냈습니다.
본 기사는 LLM 공격 벤치마크들이 위협 표면을 얼마나 포괄적으로 다루고 있는지 감사하기 위한 재사용 가능한 프레임워크를 소개합니다. 이 프레임워크는 STRIDE 기반의 Target $\times$ Technique 매트릭스를 사용하여, 기존 6개 공개 벤치마크가 전체 매트릭스의 최대 25%만을 커버하고 있음을 분석했습니다. 또한, 표준화된 평가 부재로 인해 특정 위협 카테고리(Service Disruption, Model Internals)에서 테스트되지 않은 공격들이 높은 성공률을 보이는 구조적 취약점을 지적하며, 향후 연구의 방향성을 제시합니다.
본 논문은 대규모 언어 모델(LLMs)의 추론 능력 향상을 위해 검증 가능한 보상(RLVR)을 활용한 강화학습 패러다임을 다룹니다. 기존 RLVR 학습이 겪는 희소한 이진 보상 및 약한 신용 할당 문제를 해결하기 위해, 외부 신호에 의존하지 않고 온-정책 실패 궤적을 교정 지향적 감독으로 변환하는 '교정 지향적 정책 최적화(CIPO)'를 제안합니다. CIPO는 모델의 실패 시도에서 얻은 교정 샘플을 표준 RLVR 목적 함수와 공동 최적화하여, 학습 효율성을 높이고 모델이 스스로 오류를 수정하는 능력을 강화하며, 수학적 추론 및 코드 생성 등 다양한 벤치마크에서 우수한 성능을 입증했습니다.
본 논문은 에이전트 강화학습 과정에서 발생하는 '액션 병목(Action Bottleneck)' 현상을 다룹니다. 기존 정책 경사 방법들이 궤적 내 모든 토큰에 균등한 신용 할당을 하는 것이 오히려 비효율적임을 지적하며, 실제 학습 신호가 추론 토큰보다 환경 대응 액션 토큰에 집중됨을 보여줍니다. 이를 해결하기 위해, 본 연구는 ActFocus라는 단순한 토큰 재가중치 기법과 에너지 기반의 추가적인 가중치 재분배 메커니즘을 제안합니다.
본 논문은 Large Language Diffusion Models (LLDMs)의 안전한 배포를 위해 불확실성 정량화(Uncertainty Quantification, UQ) 방법을 제시합니다. 기존 UQ 방법들이 LLDM의 효율성을 저해하는 문제를 해결하기 위해, 본 연구는 중간 생성물, 토큰 재마스킹 역학, 디노이징 복잡도를 활용하여 경량화된 제로샷 불확실성 신호를 개발했습니다. 이 방법은 계산 오버헤드를 크게 줄이면서도 강력한 샘플링 기반 베이스라인에 근접하는 뛰어난 비용 대비 성능을 달성하며, LLDM의 빠른 추론과 신뢰할 수 있는 환각 탐지를 동시에 가능하게 합니다.
SciPaths는 기존 AI4Science 벤치마크가 인용 예측이나 문헌 검색에 집중했던 한계를 극복하고, 과학적 발견 경로 예측(discovery pathway forecasting)이라는 새로운 패러다임을 제시합니다. 이 시스템은 목표로 하는 과학적 기여를 실현하는 데 필요한 선행 기여(enabling contributions)를 식별하고, 해당 선행 연구가 존재할 경우 이를 이전 문헌에 근거(grounding)시키는 것을 목표로 합니다. 262개의 전문가 주석 골드 경로와 2,444개의 실버 경로로 구성된 SciPaths 벤치마크는 이러한 복잡한 과학적 의존성 추론 능력을 평가하는 데 사용됩니다.
본 논문은 대규모 시각-언어 모델(LVLMs)이 모호한 시각적 증거로 인해 환각을 일으키는 문제를 다루며, 이를 해결하기 위해 외부 도구 없이 내부에서 반사실적 참조를 구축하는 새로운 프레임워크인 SIRA를 제안합니다. SIRA는 공유 접두사를 통해 이미지와 텍스트 토큰의 상호작용을 유지하면서, 트랜스포머 후기 레이어에서 시각적 증거 접근이 제한된 내부 대조적 분기를 생성하여 언어적 사전 지식 중심의 참조를 만듭니다. 실험 결과, SIRA는 기존의 다중 패스 디코딩 방식보다 낮은 오버헤드로 환각을 효과적으로 줄이는 것으로 나타났습니다.
본 연구는 암각화 학술 텍스트와 같이 전문 용어가 밀집된 문화유산 자료를 다국어로 보급하는 과정에서 발생하는 번역 품질 문제를 다룹니다. 스페인어 암각화 텍스트에 대한 세 가지 영어 기계 번역(MT) 설정(DeepL, Gemini-Simple, Gemini-RAG)을 비교한 결과, 용어집 증강 프롬프팅을 적용한 Gemini-RAG가 가장 높은 정확도의 전문 용어 일치율과 전반적인 품질을 보여주었습니다. 이는 최소한의 자원으로도 문화유산 번역에서 효과적인 용어 제어를 달성할 수 있음을 시사합니다.
본 연구는 LLM의 내부 표현을 이해하기 위한 새로운 접근 방식인 비선형 개입(Non-linear Interventions) 방법을 제안합니다. 기존 방법들이 선형 가설에 기반하여 비선형 매니폴드 특징들을 포착하지 못했던 한계를 극복하고, 일반적인 공식과 학습 절차를 제시했습니다. 이를 통해 직접적인 출력 시그니처가 부족한 암시적 특징까지 개입할 수 있으며, 거부 우회 스티어링 실험에서 선형 방식보다 더 정밀하게 모델을 제어함을 입증했습니다.
본 연구는 기존의 텍스트 기반 LLM 도구 호출 벤치마크를 데이터셋에 구애받지 않는(dataset-agnostic) 방식으로 오디오 기반 평가로 변환하는 프레임워크를 제안합니다. 이 프레임워크는 텍스트 음성 변환, 화자 변이, 환경 소음 등을 활용하여 기존 주석을 보존한 채 텍스트-오디오 쌍을 생성할 수 있습니다. 광범위한 모델 평가 결과, 성능은 모델과 작업에 따라 크게 달라지며, 특히 오디오 내 인자 값 이해 부족이 주요 실패 원인으로 분석되었습니다.
본 연구는 페르시아 음악의 독특한 음조와 선법 체계(Dastgah)를 포착하기 위해 900시간 이상의 고품질 오디오 샘플로 구성된 최초의 대규모 페르시아 노래 데이터셋을 구축했습니다. 이 데이터를 활용하여 최첨단 생성 모델인 MusicGen을 미세 조정(fine-tuning)하였으며, 그 결과 미세 조정된 모델이 페르시아 스타일 관습에 더 부합하는 음악을 성공적으로 생성함을 입증했습니다.
본 연구는 논문 간의 구조적 관계를 활용하여 연구 아이디어 생성을 돕는 'Graphs of Research (GoR)'라는 지도 학습 방법을 제안합니다. GoR은 시드 논문을 중심으로 인용 위치, 빈도, 출판 시간 등을 고려한 참고 문헌 진화 유향 비순환 그래프(DAG)를 구축하고, 이를 LLM의 미세 조정에 활용합니다. 이 방법은 기존의 정적 검색이나 단순 프롬프트 엔지니어링 방식보다 우수하며, GPT-4o 기반 베이스라인 대비 SOTA 성능을 달성하여 자동화된 과학 혁신 가속화에 기여할 수 있음을 입증했습니다.
본 연구는 Composed Image Retrieval (CIR) 벤치마크에서 높은 성능이 반드시 '멀티모달 구성(multimodal composition)' 능력 때문인지 의문을 제기합니다. 조사 결과, 상당수의 CIR 쿼리가 참조 이미지나 텍스트 수정 사항 중 단일 모달리티만으로 해결될 수 있는 '유니모달 지름길(unimodal shortcuts)'을 이용하고 있음을 발견했습니다. 따라서 높은 CIR 성능은 진정한 멀티모달 구성 능력보다는 이러한 단순한 유니모달 신호에 의존할 가능성이 높습니다.
본 논문은 복잡한 다단계 프로세스를 수행하는 AI 에이전트의 현재 미흡한 평가 방식을 개선하기 위한 종합적인 프레임워크를 제시합니다. 이 프레임워크는 하향식(top-down) 에이전트 수준 진단과 상향식(bottom-up) 구간 수준(span-level) 평가를 결합하여, 분석을 독립적인 구간별 평가로 분해하고 각 판정에 대한 근거를 생성할 수 있습니다. TRAIL 벤치마크에서 이 프레임워크는 GAIA와 SWE-Bench 모두에서 기존 최고 성능의 베이스라인 대비 여러 지표에서 높은 개선율을 입증했습니다.