Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 대규모 언어-시각 모델(LLVM)을 활용하여 자동 표적 인식(ATR) 분야의 발전을 목표로 합니다. 특히 합성 개구 레이더(SAR) 이미지에 초점을 맞추어, 원격 감지 이미지 캡셔닝 및 시각 질문 답변(VQA) 능력을 검토합니다. 연구진은 MSTAR 데이터셋을 기반으로 VQA 기능을 확장한 새로운 SAR 학습/평가 벤치마크를 개발했으며, 이를 통해 LLVM이 복잡한 환경 조건 하에서 미묘한 표적 특성을 높은 정확도로 식별할 수 있도록 파인튜닝하는 방법을 제시합니다.
언어 모델이 민감하거나 숨겨야 할 정보를 작문 과정에서 얼마나 잘 유지하는지 테스트한 연구입니다. 비밀 단어를 주고 공개하지 말라고 지시했음에도 불구하고, 다섯 가지 최첨단(frontier) 언어 모델 모두 해당 비밀 단어를 이야기의 내용에 주제적으로 유출하는 것으로 나타났습니다. 이는 언어 모델이 프롬프트된 정보를 완전히 통제하거나 숨기기 어렵다는 점을 시사합니다.
본 연구는 대규모 언어 모델(LLM) 기반 에이전트 시스템에서 장문 컨텍스트가 오도 정보(hard-distractor)에 의해 어떻게 영향을 받는지 분석합니다. 기존 연구들이 단순히 관련성 있는 오도 문서의 존재만 확인한 것과 달리, 본 연구는 하드 디스트랙터의 비율을 체계적으로 변화시키며 성능 저하 패턴을 정량화했습니다. 그 결과, 하드 디스트랙터의 비율이 증가함에 따라 모델 성능은 초기 작은 분율에서 급격하게 떨어지는 비선형적 관계를 발견했습니다.
본 연구는 LLM의 문화적 정렬 문제를 해결하기 위해 DISCA(Disagreement-Informed Steering for Cultural Alignment)라는 새로운 추론 시간 방법을 제안합니다. 기존 방법들이 높은 비용이나 내부 구조 접근을 요구했던 것과 달리, DISCA는 국가별 페르소나 에이전트 패널 간의 '불일치'를 핵심 조향 신호로 활용하여 모델의 문화적 편향성을 보정합니다. 이 방법은 가중치 변경 없이도 다양한 규모와 수의 오픈 가중치 LLM에서 효과적으로 문화적 불일치를 감소시키는 것으로 입증되었습니다.
본 논문은 LLM 기반 에이전트 시스템에서 어휘적 검색(BM25)의 충분성을 재검토하며, 'Pi-Serini'라는 검색 에이전트를 소개합니다. 이 에이전트는 문서 검색, 탐색, 읽기 기능을 갖추고 있으며, 최신 LLM과 결합하여 심층 연구를 지원하는 데 효과적임을 입증했습니다. 실험 결과, Pi-Serini는 GPT-5.5와 함께 사용되어 높은 답변 정확도(83.1%)와 표면화 증거 회수율(94.7%)을 달성하며 기존의 밀집 리트리버 기반 시스템보다 우수한 성능을 보였습니다.
본 논문은 임의의 에이전트들의 능력을 비교하기 위한 형식적 프레임워크인 일반화된 튜링 테스트(GTT)를 제안합니다. GTT는 특정 데이터셋이나 태스크에 구애받지 않고, 한 에이전트가 다른 에이전트를 모방하도록 지시받았을 때 그 둘을 신뢰성 있게 구별할 수 없는 '구별 불가능성' 개념을 핵심으로 합니다. 연구진은 이 비교자의 구조를 분석하고, 이를 현대 AI 모델 컬렉션에 적용하여 경험적으로 평가함으로써, 기존 벤치마크와 독립적이면서도 의미 있는 계층적 지능 순서화를 제공함을 입증했습니다.
본 논문은 언어 에이전트의 메모리 시스템이 단순히 과거 경험을 '설명'하는 것을 넘어, 미래의 '결정'을 지원하기 위해 필요한 핵심 정보를 보존하는 데 초점을 맞춥니다. 기존 방식들이 관련성이나 요약 품질에 의존했던 것과 달리, 이 연구는 메모리를 결정 중심의 비트율-왜곡 문제로 재정의합니다. 이를 바탕으로 DeMem이라는 새로운 온라인 메모리 학습기를 제안하며, 이는 공유된 상태가 결정 충돌을 일으킬 때만 파티션을 개선하여 근사 최소-최대 후회(near-minimax regret)를 보장함으로써 에이전트 메모리의 효율성과 정확성을 크게 향상시킵니다.
본 기사는 추론 모델 훈련에 사용되는 On-policy distillation의 효과적인 적용 조건과 한계를 탐구합니다. 기존 연구들이 전체 훈련 실행에 의존하여 성능 지표를 측정하는 것과 달리, 저자들은 토큰별, 질문별, 교사 모델별로 작동할 수 있는 새로운 '훈련 불필요 진단 프레임워크'를 제안했습니다. 이 프레임워크는 이상적인 노드당 기울기를 정의하며, 최적의 증류 컨텍스트가 학생 모델의 용량과 목표 작업에 따라 달라지므로, 범용적인 해결책은 없음을 보여줍니다.
AssayBench는 LLM과 에이전트 시스템의 성능을 평가하기 위해 설계된 새로운 벤치마크입니다. 이 벤치마크는 가상 세포 모델링을 활용하여, 기존에는 어려웠던 *in silico* 표현형 스크리닝(phenotypic screening) 능력을 측정하는 데 중점을 둡니다. 이는 LLM이 다양한 텍스트 입력과 복잡한 생물학적 맥락에서 예측된 표현형 출력을 결합해야 하는 과제를 제공하며, 가상 세포 연구의 발전을 위한 표준화된 테스트베드를 제공합니다.
본 논문은 신경 사후 추정(Neural posterior estimation)이 대규모 조건 변수 집합에 의존하는 응용 분야에서 발생하는 계산적 한계를 해결하는 방법을 제시합니다. 연구진은 표현 학습과 사후 모델링을 분리하는 새로운 전략을 도입하여, 최대 크기 2의 작은 집합으로 Deep Set 인코더를 훈련하고 이를 임의의 대규모 조건 변수 집합에 일반화할 수 있게 했습니다. 이 접근 방식은 추론 비용이 배포 시점의 조건 변수 개수(N)와 독립적이어서, 메모리와 컴퓨팅 자원 측면에서 실용적인 해결책을 제공합니다.
본 논문은 언어 모델(LLM) 내에서 '계획' 메커니즘이 구조적으로 어떻게 형성되고 작동하는지 연구합니다. 특히, 미래 토큰의 내부 표현이 순전파 과정 중 어떤 방식으로 생성에 인과적으로 기여하는지에 초점을 맞춥니다. 운율 쌍 완성 같은 제약 조건 테스트를 사용하여 Qwen3, Gemma-3, Llama-3 등 여러 모델에서 경량 탐색 방법(선형 탐색 및 활성화 패치)을 적용한 결과, 미래의 운율 정보가 라인 경계에서 선형적으로 디코딩 가능함을 발견했습니다.
본 논문은 텍스트-이미지 모델이 여러 요구사항을 통합하여 복잡한 시각적 의도를 구현하는 데 어려움을 겪는 문제를 다룹니다. 이를 해결하기 위해, 연구진은 '의미론적 약속'을 구조적으로 유지하고 미해결된 약속 주변으로 검색, 추론, 복구 스킬을 조건부로 호출하는 명세 기반 오케스트레이션 프레임워크인 SCOPE를 제안합니다. SCOPE는 새로운 벤치마크 Gen-Arena와 평가 지표 EGIP를 도입하여, 복잡한 이미지 생성에서 지속적인 약속 추적의 효과를 입증하며 기존 모델들을 크게 능가하는 성능을 보여줍니다.
본 논문은 비디오 이해 보상 모델링의 발전을 가로막는 평가 벤치마크 및 고품질 데이터 부족 문제를 해결하기 위한 통합 프레임워크를 제안합니다. 연구진은 일반, 장문, 추론 중심 작업을 포괄하는 2,100개의 선호도 쌍을 가진 Video Understanding Reward Bench (VURB)와 대규모 감독 데이터를 제공하는 Video Understanding Preference Dataset (VUP-35K)를 구축했습니다. 이 데이터셋을 기반으로 판별적(VideoDRM) 및 생성적(VideoGRM) 보상 모델을 훈련시켜, 기존 벤치마크에서 최첨단 성능을 달성했음을 입증합니다.
PPI-Net은 단백질-단백질 상호작용(PPI) 네트워크와 Reactome 같은 경로 수준의 계층 구조를 통합하여 질병을 모델링하는 새로운 계층적 그래프 신경망입니다. 이 모델은 분자 수준의 PPI 정보부터 고차원적인 기능적 생물학적 과정까지 정보를 효과적으로 집계할 수 있습니다. 임상 데이터(RNA-seq 등)에 적용한 결과, 여러 암 유형에서 높은 예측 성능을 보였으며, 특히 계층적 구조를 통합함으로써 기존 모델 대비 정확도를 크게 향상시켰습니다.
본 기사는 Vision-language-action (VLA) 모델이 장기 계획을 위해 사용하는 월드 모듈의 설계 문제를 다룹니다. 기존 방식은 높은 시각적 대역폭으로 프레임별 스트림을 전달하여 자원 비효율성을 초래했습니다. 이에 저자들은 각 뷰를 '프레임당 단일 의미론적 토큰'으로 압축하는 OneWM-VLA라는 새로운 접근 방식을 제안합니다.
신념 함수는 불확실성을 수학적으로 다루는 강력한 프레임워크로, 특히 확률 분포 학습이 어려운 상황에서 유용합니다. 본 설문조사는 신념 함수 기반 추론 체인의 핵심 단계인 '추론'에 초점을 맞춥니다. 구체적으로 통계적 데이터로부터 어떻게 신념 측정값을 효과적으로 학습하고 이를 활용하는지에 대한 주요 기여들을 검토합니다.
본 연구는 머신러닝 기반의 예측적 자원 할당이 가진 근본적인 한계점, 즉 알레아토릭 불확실성을 해결할 수 없다는 점에 주목합니다. 따라서 스크리닝 단계와 알고리즘적 표적화 단계를 결합한 2단계 최적 할당 프레임워크를 제안합니다. 이 프레임워크는 자원을 가장 위험도가 높은 단위와 예측 모델의 한계(margin)에 있는 단위에 전략적으로 배분하여, 제한된 예산 하에서 할당 효율성을 극대화하는 방법을 제시합니다.
본 기사는 대규모 언어 모델(LLMs)의 신뢰성 평가에 대한 새로운 접근 방식을 제안합니다. 기존의 확률적 정확도 추정치나 단순한 '자신감' 지표가 LLM의 실제 성능을 예측하는 데 한계가 있음을 지적하며, 인간 심리학의 인지 평가 이론(cognitive appraisal theory)을 차용했습니다. 이에 따라 자신감 외 6가지 추가적인 평가 기반 차원을 도입하여 모델 자기 평가를 다차원적으로 분석하고, 이를 통해 LLM 실패를 더 효과적으로 예측할 수 있음을 입증합니다.
본 연구는 희소 컨텍스트-상태 믿음 전파를 활용하여 가변 차수 마르코프 모델에 정규 제약 조건을 정확하게 적용하는 방법을 제시합니다. 기존의 방법들이 1차 마르코프 체인에 국한되었던 한계를 넘어, 생성기가 가변 차수/백오프 모델일 때 필요한 상태 공간을 식별하고 믿음 전파 추론을 수행할 수 있도록 확장했습니다. 이는 복잡한 언어 구조와 제약 조건을 동시에 만족시키며 시퀀스를 생성하는 데 기여합니다.
본 논문은 확률적 경사 하강법으로 학습되는 넓은 신경망의 숨겨진 가중치 스펙트럼 변화를 연구하며, 특히 벌크(bulk)와 아웃라이어(outlier) 스펙트럴 다이내믹스를 공동 추적하는 2단계 동역학 평균장 이론(DMFT)을 개발했습니다. 이 프레임워크는 무한 너비의 비선형 네트워크와 고차원 극한의 깊은 선형 네트워크 두 가지 설정에 적용되었습니다. 연구 결과, 아웃라이어 스펙트럼이 훈련 시간, 네트워크 너비, 출력 스케일 등 다양한 매개변수에 따라 어떻게 진화하는지 예측할 수 있음을 보여줍니다.