Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
ActCam은 비디오 생성 과정에서 캐릭터의 동작과 카메라 궤적을 동시에 정밀하게 제어할 수 있는 Zero-Shot 방법을 제시합니다. 이 모델은 사전 학습된 이미지-비디오 확산 모델을 기반으로 하며, 장면 깊이와 캐릭터 포즈 조건을 입력받아 기하학적으로 일관된 비디오를 생성합니다. ActCam의 독특한 두 단계 조건부 스케줄링 프로세스는 초기 분해소에서 장면 구조를 강제하고, 이후 고주파수 세부 사항을 정교화하여 카메라 준수도와 동작 충실도를 크게 향상시킵니다.
Uno-Orchestra는 기존 LLM 다중 에이전트 시스템의 한계인 경직된 오케스트레이션 문제를 해결하기 위해 개발되었습니다. 이 프레임워크는 작업을 선택적으로 분해하고, 각 서브태스크를 허용 가능한 (모델, 원시) 쌍으로 전송합니다. 특히, 작업 분해와 워커(모델) 선택이라는 두 가지 결정을 실제 워커 상호작용 기반의 커티드 RL 궤적에서 공동 최적화하여 높은 정확도와 효율성을 동시에 달성했습니다.
본 논문은 확산 모델이 구조적 환각(hallucinations)을 일으키는 현상을 '모델 유도 다양체 상의 불안정성'으로 해석하고, 이를 완화하기 위한 새로운 접근 방식을 제안한다. 연구진은 이러한 불안정성의 근본 원인이 로컬 내재 차원(LID)에 있음을 밝혀내고, 이를 수정하는 메커니즘인 '본질 냉각(Intrinsic Quenching: IQ)'을 개발했다. IQ는 다양한 벤치마크에서 기존의 환각 감소 기법보다 우수한 성능을 보여주며, 특히 의료 영상 분야에서 해부학적 일관성을 유지하는 데 유용할 것으로 기대된다.
본 논문은 재료 과학 분야의 데이터 수집 비용 문제를 해결하기 위해, 목표 속성의 정보량을 최대화하면서도 미사용(비목표) 속성들의 성능을 보존하는 데이터셋 구축 프레임워크를 제안합니다. 이 접근법은 '다양성 인식 선택(diversity-aware selection)' 기법을 활용하여 재료 공간의 광범위한 커버리지를 확보합니다. 실험 결과에 따르면, 이 프레임워크는 무작위 샘플링 대비 목표 속성과 비목표 속성 모두에서 예측 성능을 크게 향상시키며, 데이터셋 구축 과정 전반에 걸쳐 편향 없는 고품질 데이터를 유지할 수 있음을 입증했습니다.
본 기사는 제약 자산 발견 분야에서 범용 LLM과 전문화된 AI 플랫폼을 비교 평가한 결과를 제시합니다. 연구진은 웹 검색 기능을 갖춘 네 가지 최첨단 LLM(Claude Opus 4.7, GPT 5.5, Gemini 3.1 Pro, Perplexity sonar-pro)과 자체 개발한 'Gosset' 플랫폼을 사용하여 10개의 니치 종양학/면역학 표적에 대한 약물 자산 주석 검색 성능을 비교했습니다. 그 결과, Gosset은 최첨단 시스템보다 쿼리당 검증된 약물 수를 3.2배 더 많이 반환하며 압도적인 성능 우위를 보였습니다. 이는 전문적으로 큐레이션된 인덱스를 활용하는 것이 일반 웹 검색 기반의 LLM보다 훨씬 효과적임을 시사합니다.
Neural Rule Inducer (NRI)는 데이터에서 해석 가능한 논리 규칙을 학습하는 Zero-Shot 기반의 기초 모델입니다. 기존 ILP 방법들이 특정 술어에 묶여 재학습이 필요했던 한계를 극복하고, 클래스 조건부 확률 등 도메인 무관 통계적 속성을 사용하여 리터럴을 표현합니다. NRI는 병렬 슬롯 디코더와 곱 T-노름 완화 기법을 통해 논리 합의 순열 불변성을 유지하며, 규칙 복원 및 Zero-Shot 전이 성능에서 우수한 결과를 보여줍니다.
본 기술 기사는 LLM 기반 다중 에이전트 시스템을 활용하여 과학 아이디어를 생성하는 새로운 프레임워크인 '진화하는 아이디어 그래프(Evolving Idea Graphs, EIG)'를 소개합니다. 기존의 텍스트 기반 접근 방식과 달리, EIG는 아이디어를 노드(과학적 주장)와 엣지(관계)로 구성된 그래프 구조로 표현하여, 아이디어 발전 과정에서 발생하는 약점이나 해결되지 않은 부분을 명확하게 추적할 수 있게 합니다. 이 프레임워크는 학습된 수정 및 커밋 컨트롤러를 통해 에이전트가 그래프를 체계적으로 개선하고 최종 제안서 형태로 완성하는 과정을 안내하며, 기존 벤치마크에서 높은 성능을 입증했습니다.
본 논문은 단일 세포 RNA-seq 데이터 기반 유전자 조절 네트워크(GRN) 추론에서 인과적 방법이 상관관계 기반 방법보다 항상 우월하다는 기존의 가정을 재검토한다. 연구진은 드롭아웃, 잠재적 혼란 변수 등 7가지 생물학적 병리학적 요인을 분리하여 통제된 진단 프레임워크를 구축하고, 다양한 추론 방법들이 이러한 요인에 따라 어떻게 성능이 저하되는지 체계적으로 분석했다. 그 결과, 인과적 방법은 깨끗한 환경에서는 우수하지만, 드롭아웃이나 잠재적 혼란 변수 같은 특정 병리학적 조건 하에서는 그 장점이 중립화될 수 있음을 밝혀냈다.
본 논문은 LLM 추론의 한 방법인 그룹 상대 정책 최적화(GRPO)가 겪는 세 가지 주요 문제점(균일한 토큰 수준, 균일한 극성, 제로 분산 붕괴)을 분석하고 이를 해결하기 위한 새로운 프레임워크인 엔트로피·진행 정렬 GRPO(EP-GRPO)를 제안합니다. EP-GRPO는 엔트로피 게이트드 조절을 통해 높은 정보적 가치를 가진 결정 전환점을 강조하며, 결과 기반의 방향성 피드백과 누적 엔트로피 매핑을 통합하여 학습 효율성과 정확도를 크게 향상시킵니다.
본 논문은 분포 이동을 모델링하는 최적 전송(Optimal Transport, OT) 프레임워크를 개선한 '이동량 재형성 최적 전송(ReshapeOT)' 방법을 제안합니다. ReshapeOT는 관찰된 샘플 이동량을 추가 지식원으로 활용하여 기본 거리를 재구성함으로써, 기존의 유클리드 거리 대신 마할라노비 거리와 같은 더 정교한 메트릭을 사용합니다. 이 방법은 계산 효율적이며 다양한 OT 솔버에 쉽게 통합될 수 있으며, 합성 및 실제 데이터에서 전송 신뢰성을 크게 향상시키는 것으로 입증되었습니다.
본 기사는 LLM의 능력을 새로운 기술에 맞춰 확장하는 어려움을 다루며, 기존 파인튜닝 방식의 한계(재기억 위험)와 컨텍스트 기반 접근법의 제한성을 지적합니다. 이를 해결하기 위해 '기술 신조어(skill neologisms)'라는 개념을 제안하는데, 이는 모델 가중치 업데이트 없이 특정 기술 능력을 선택적으로 확장하는 방법입니다. 연구 결과, 이 신조어가 사전 학습된 LLM에 통합되어 다양한 기술과 조합 가능하며, 심지어 제로샷으로도 기능을 수행할 수 있음을 입증했습니다.
본 논문은 대형 언어 모델(LLMs)이 적대적 프롬프트 기반의 제이브레이크 공격에 취약하다는 문제를 다루며, 기존 평가 방법론의 한계를 지적합니다. 이를 해결하기 위해 'Security Cube'라는 통합 다차원 평가 프레임워크를 제안합니다. 이 프레임워크를 통해 다양한 공격 및 방어 기법을 체계적으로 분류하고 벤치마크함으로써, LLM 보안 취약점과 견고성을 종합적으로 분석하고 향후 연구 방향을 제시하는 것을 목표로 합니다.
본 기술 기사는 '개념 필드(Concept Field)'라는 새로운 개념을 소개하며, 이를 통해 텍스트의 블랙박스 환각 여부와 신규성을 측정하는 방법을 제시합니다. 이 방법은 문장 임베딩 공간에서 국소 편차 필드를 정의하고, 후보 문장의 전이(transition)가 이 필드와 얼마나 일치하는지를 점수화하여 해석 가능한 지표를 제공합니다. 또한, 벡터 시퀀스 데이터베이스(VSDB)를 도입하여 계산 효율성을 높였으며, 규정법 및 Project Gutenberg 등 다양한 도메인에서 그라운드드니스와 신규성 탐지 성능을 입증했습니다.
본 논문은 장기 시퀀스 모델링에 내재된 근본적인 트레이드오프를 '불가능 삼각형'으로 형식화하고 증명합니다. 이 삼각형은 효율성(단계당 계산 비용), 압축성(상태 크기), 그리고 회상 능력(장기 의존성 기억) 세 가지 속성을 동시에 만족하는 모델이 존재할 수 없음을 보여줍니다. 연구진은 트랜스포머, SSM, RNN 등 다양한 아키텍처를 통합한 온라인 시퀀스 프로세서 추상화 내에서 이 한계를 수학적으로 증명하며, 실제 실험을 통해 이론적 한계가 경험적으로도 유효함을 검증합니다.
본 논문은 오프라인에서 온라인 강화학습(O2O-RL)의 한계를 극복하기 위해, 제한된 온라인 상호작용 예산 하에서 정책 선택 및 미세 조정을 위한 적응형 접근 방식을 제안합니다. 기존 O2O-RL 방식은 신뢰도가 낮은 오프-정책 평가(OPE)에 의존하거나, 과도한 온라인 상호작용을 요구하는 문제가 있었습니다. 본 연구는 먼저 다양한 후보 정책을 학습하고 OPE로 초기 성능을 추정한 후, 상한 신뢰 구간(UCB) 접근법을 활용하여 예측된 성능에 기반해 가장 효율적으로 정책을 선택하고 미세 조정함으로써 실제 환경에서의 적용 가능성을 높였습니다.
본 논문은 Deng et al. (2026)가 제안한 Generative Modeling via Drifting (GMD) 프레임워크를 Wasserstein Gradient Flows (WGF) 관점에서 분석합니다. 연구진은 GMD의 특정 알고리즘이 Parzen smoothing을 적용한 밀도에서의 KL divergence WGF 극한점과 대응됨을 증명했습니다. 또한, 이 아이디어가 Sinkhorn divergence, MMD, sliced Wasserstein distance 등 다양한 다른 WGF로 확장 가능함을 보여주었습니다.
본 기술 기사는 코딩 에이전트 시스템을 사용하여 ARC-AGI-3 게임에 대한 실현 가능한 월드 모델 평가 결과를 보고합니다. 이 시스템은 이전 관찰을 검증하고, MDL 기반 단순성 편향의 대안으로 추상화하여 계획을 세우는 방식으로 작동합니다. 25개의 공개 게임 테스트 결과, 에이전트는 7개 게임을 완전히 해결했으며, 평균적으로 상대적 인간 행동 효율성(RHAE)은 32.58%를 기록하며 유망한 초기 성능을 보여주었습니다.
본 논문은 전체 슬라이스 이미지(WSI) 분석에서 기존 방법들이 간과했던 조직의 계층적 구조와 지역적 이질성을 포착하기 위해 새로운 접근 방식을 제안합니다. 연구진은 WSI 특징을 쌍중 기하학적 공간(hyperbolic-Euclidean)에 임베딩하는 하이브리드 표현을 도입하고, 이를 기반으로 BatMIL이라는 분류 프레임워크를 개발했습니다. 이 모델은 구조화된 상태 공간 시퀀스 모델(S4)과 청크 레벨 Mixture-of-Experts (MoE) 모듈을 결합하여 장기 의존성 포착 및 지역적 특성 고려라는 두 가지 목표를 달성하며, 최첨단 성능을 입증했습니다.
본 논문은 환각 탐지(hallucination detection)를 위해 여러 번의 디코딩을 필요로 하는 기존 방법들(Self-consistency, Semantic self-consistency)의 한계를 극복하는 새로운 접근 방식인 'phi_first'를 제안합니다. phi_first는 단일 그리디 디코딩 과정에서 첫 번째 토큰의 top-K 로짓 엔트로피를 사용하여 모델의 초기 신뢰도를 측정하며, 폐서적 사실 질문 답변(closed-book factual QA) 태스크에서 기존 방법들과 동등하거나 더 높은 성능을 보였습니다. 이는 다중 샘플링 기반 불확실성 정보가 이미 첫 번째 토큰 분포에 상당 부분 포함되어 있음을 시사합니다.
본 논문은 복잡하고 긴 작업을 수행하는 검색 에이전트(long-horizon search agent)가 직면하는 컨텍스트 관리 문제를 해결하기 위해 '탄성 컨텍스트 오케스트레이션' 패러다임을 제안합니다. 이 패러다임은 Context-ReAct이라는 통합 루프를 통해 Skip, Compress, Rollback, Snippet, Delete와 같은 5가지 원자 연산을 제공하여 에이전트가 작업의 관련성에 따라 컨텍스트를 동적으로 재구성할 수 있게 합니다. 이를 기반으로 개발된 LongSeeker는 기존 검색 벤치마크에서 높은 성능을 보여주며, 적응적 컨텍스트 관리가 장기 지평 추론의 신뢰성과 효율성을 크게 향상시킬 수 있음을 입증했습니다.