Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 Deng et al. (2026)가 제안한 Generative Modeling via Drifting (GMD) 프레임워크를 Wasserstein Gradient Flows (WGF) 관점에서 분석합니다. 연구진은 GMD의 특정 알고리즘이 Parzen smoothing을 적용한 밀도에서의 KL divergence WGF 극한점과 대응됨을 증명했습니다. 또한, 이 아이디어가 Sinkhorn divergence, MMD, sliced Wasserstein distance 등 다양한 다른 WGF로 확장 가능함을 보여주었습니다.
본 연구는 인간 시각 시스템에 최적화된 실용적인 학습된 이미지 압축 코덱을 설계하는 데 중점을 둡니다. 기존 전통 코덱 대비 감각적 품질과 실제 실행 시간(runtime)을 동시에 고려하여 모델링 선택 및 아블레이션 기법을 종합적으로 연구했습니다. 그 결과, 신경망 구조 검색(NAS)을 통해 최적화된 새로운 코덱을 개발했으며, 이 코덱은 AV1, VVC 등 기존 표준 대비 2.3-3배의 비트레이트 절감 효과를 보여주면서도, 모바일 기기에서 매우 빠른 인코딩/디코딩 속도를 달성했습니다.
본 기술 기사는 코딩 에이전트 시스템을 사용하여 ARC-AGI-3 게임에 대한 실현 가능한 월드 모델 평가 결과를 보고합니다. 이 시스템은 이전 관찰을 검증하고, MDL 기반 단순성 편향의 대안으로 추상화하여 계획을 세우는 방식으로 작동합니다. 25개의 공개 게임 테스트 결과, 에이전트는 7개 게임을 완전히 해결했으며, 평균적으로 상대적 인간 행동 효율성(RHAE)은 32.58%를 기록하며 유망한 초기 성능을 보여주었습니다.
본 논문은 시계열 예측에 사용되는 트랜스포머 아키텍처가 NLP에서처럼 복잡한 '중첩(redundancy)' 표현에 의존하는지에 대한 기계적 해석 가능성 분석을 수행했습니다. 희소 오토인코더(SAE)를 사용하여 PatchTST의 내부 표현을 탐지한 결과, 트랜스포머의 성능이 강한 중첩에 의존한다는 경험적 증거는 발견되지 않았습니다. 대신, 이 표현들은 희소하고, 차원 확장에도 안정적이며, 잠재적인 개입에 대해 비교적 둔감함을 보여주었습니다. 이는 시계열 예측에서 트랜스포머의 성공이 반드시 풍부한 구성 표현을 요구하지 않으며, 단순 선형 모델의 경쟁력을 설명하는 데 도움을 줄 수 있음을 시사합니다.
본 논문은 3D Gaussian Splatting (3DGS) 기반의 3D 콘텐츠 제작에서 간과되어 온 '미학(Aesthetics)' 평가 문제를 다룹니다. 기존 방법들이 재구성 정밀도에만 초점을 맞춘 한계를 극복하기 위해, 연구진은 체계적인 미적 평가 프레임워크인 Aes3D와 이를 위한 데이터셋 Aesthetic3D를 제안했습니다. 또한, 3DGS 표현 자체에서 장면의 미학 점수를 직접 예측하는 경량 모델인 Aes3DGSNet을 제시하여, 계산 효율성을 유지하면서도 상위 수준의 미적 특성 포착 능력을 입증했습니다.
본 기술 기사는 SemEval-2026 Task 9: 다국어 극단성 감지 시스템을 소개하며, 22개 언어를 대상으로 하는 이진 분류 작업을 수행합니다. 핵심 접근 방식은 대형 언어 모델(LLM)의 합성 데이터 증강과 LoRA를 활용한 각 언어별 Gemma-3 모델 미세 조정입니다. 개발 집합에서 얻은 지식을 재학습 없이도 전이 학습 및 앙상블 기법을 통해 테스트 환경에 성공적으로 적용하여, 모든 22개 언어에서 평균 매크로-F1 점수 0.811을 달성하며 높은 성능을 입증했습니다.
본 논문은 전체 슬라이스 이미지(WSI) 분석에서 기존 방법들이 간과했던 조직의 계층적 구조와 지역적 이질성을 포착하기 위해 새로운 접근 방식을 제안합니다. 연구진은 WSI 특징을 쌍중 기하학적 공간(hyperbolic-Euclidean)에 임베딩하는 하이브리드 표현을 도입하고, 이를 기반으로 BatMIL이라는 분류 프레임워크를 개발했습니다. 이 모델은 구조화된 상태 공간 시퀀스 모델(S4)과 청크 레벨 Mixture-of-Experts (MoE) 모듈을 결합하여 장기 의존성 포착 및 지역적 특성 고려라는 두 가지 목표를 달성하며, 최첨단 성능을 입증했습니다.
본 논문은 환각 탐지(hallucination detection)를 위해 여러 번의 디코딩을 필요로 하는 기존 방법들(Self-consistency, Semantic self-consistency)의 한계를 극복하는 새로운 접근 방식인 'phi_first'를 제안합니다. phi_first는 단일 그리디 디코딩 과정에서 첫 번째 토큰의 top-K 로짓 엔트로피를 사용하여 모델의 초기 신뢰도를 측정하며, 폐서적 사실 질문 답변(closed-book factual QA) 태스크에서 기존 방법들과 동등하거나 더 높은 성능을 보였습니다. 이는 다중 샘플링 기반 불확실성 정보가 이미 첫 번째 토큰 분포에 상당 부분 포함되어 있음을 시사합니다.
LLM 에이전트의 발전은 하르네스(harness)와 기반 모델의 빠른 공진화에 힘입어 놀라운 속도로 진행되고 있습니다. 이번 연구에서 소개된 업데이트된 다중 에이전트 시스템인 'Design Conductor 2.0'은 이전보다 훨씬 큰 작업을 처리하며, 완전히 자율적으로 작동할 수 있는 높은 품질을 보여줍니다. 이 시스템은 LLM 추론 가속기(VerTQ)를 포함하여, 복잡한 하드웨어 설계를 80시간 만에 성공적으로 구축하고 FPGA에 매핑하는 성과를 입증했습니다.
본 논문은 Behavior Cloning(BC)의 한계점인 온라인 개선 메커니즘 부재를 해결하기 위해 Q2RL이라는 새로운 오프라인-온라인 학습 알고리즘을 제안합니다. Q2RL은 BC 정책으로부터 Q-함수를 추정하고, 이 Q-값을 기반으로 샘플 수집 과정에서 BC와 강화학습(RL) 정책 행동 간의 전환을 관리하여 효율적인 온라인 개선을 가능하게 합니다. D4RL 및 robomimic 벤치마크에서 높은 성공률과 빠른 수렴 속도를 보여, 특히 고정밀 조작 작업에 효과적임을 입증했습니다.
본 논문은 복잡하고 긴 작업을 수행하는 검색 에이전트(long-horizon search agent)가 직면하는 컨텍스트 관리 문제를 해결하기 위해 '탄성 컨텍스트 오케스트레이션' 패러다임을 제안합니다. 이 패러다임은 Context-ReAct이라는 통합 루프를 통해 Skip, Compress, Rollback, Snippet, Delete와 같은 5가지 원자 연산을 제공하여 에이전트가 작업의 관련성에 따라 컨텍스트를 동적으로 재구성할 수 있게 합니다. 이를 기반으로 개발된 LongSeeker는 기존 검색 벤치마크에서 높은 성능을 보여주며, 적응적 컨텍스트 관리가 장기 지평 추론의 신뢰성과 효율성을 크게 향상시킬 수 있음을 입증했습니다.
본 논문은 이미지 생성을 위한 Diffusion Transformers (DiT)에서 발생하는 '이상치 토큰(outlier tokens)' 문제를 다룹니다. 기존 연구가 높은 노름을 가진 소수 토큰에 초점을 맞췄다면, 본 연구는 이 현상이 단순히 극단적인 값 때문이 아니라 손상된 지역 패치 의미론과 관련 있음을 밝혀냈습니다. 이를 해결하기 위해 훈련된 레지스터를 활용하는 Dual-Stage Registers (DSR)라는 개입 기법을 제안했으며, 이는 DiT의 아티팩트를 줄이고 전반적인 생성 품질을 향상시키는 효과를 보였습니다.
본 연구는 언어 모델(LM)이 '반례 제시 및 수정'이라는 철학적 개념 분석 과정을 반복적으로 수행할 수 있는지 탐구했습니다. 20개 개념에 대해 수천 번의 반례-수정 사이클을 거친 결과, LM은 인간과 유사하게 유효성 판단에서 일관성을 보였으나, LM 판사는 인간보다 더 많은 반례를 수용하는 경향이 있었습니다. 또한, 반복적인 수정 과정이 정의의 정확도를 개선하기보다는 단순히 길어지게 만들고, 일부 개념은 안정화된 정의에 저항한다는 점을 발견했습니다.
본 논문은 베이지안 예측 추론의 계산적 비효율성을 해결하기 위해 새로운 변분 베이지안 프레임워크를 제안합니다. 기존 방식이 후방 분포 근사 후 몬테카를로 시뮬레이션을 통해 예측을 수행하는 두 단계 절차인 반면, 이 방법은 후방 및 이에 대응하는 예측 분포를 공동으로 학습하여 계산 비용을 크게 줄입니다. 특히 연산적(amortized) 방식으로 변분 분포를 훈련함으로써, 고충실도 모델에서도 정확도를 유지하면서 온라인 추론 속도를 향상시킬 수 있습니다.
이 논문은 전통적인 소프트웨어 개발 스쿼드를 인간과 인공지능(AI)의 협업을 기반으로 하는 미래형 하이브리드 구조로 전환하기 위한 교육 전략을 분석합니다. 특히, 기존 전문가를 'AI 옹호자(AI Advocate)'로 업스킬링하는 과정을 통해 조직 내 문화적 및 기술적 변혁을 촉진하는 방안에 초점을 맞춥니다. 본문은 브라질 사내 기술 기업의 실제 경험 보고를 바탕으로 AI 옹호자의 교육 과정과 주요 과제를 제시합니다.
본 논문은 대규모 데이터셋의 정보를 작은 합성 데이터셋으로 압축하는 확산 모델 기반의 데이터 디스틸레이션 기법을 제안합니다. 기존 방법들이 필요로 했던 추가적인 미세 조정 단계를 제거하고, 훈련 없는 효율적인 가이드를 중심으로 Dual Matching Guided Diffusion (DMGD) 프레임워크를 제시했습니다. DMGD는 의미 매칭과 오토모티브 트랜스포트(OT) 기반 분포 매칭을 결합하여 합성 데이터의 다양성을 유지하면서 목표 분포 구조에 효과적으로 정렬하는 것이 특징입니다.
본 논문은 사용자가 물리적 객체에 느끼는 애착을 AI 동반자로 확장하는 '쌍중이체(Doppelgänger)' 프레임워크인 Deco를 제안합니다. Deco는 다중 모달 LLM과 증강 현실을 통합하여, 디지털 에이전트가 물리적 동반자의 감정적 유대와 역사를 계승하고 확장할 수 있도록 합니다. 연구 결과에 따르면, Deco는 기존의 디지털 동반자보다 인식된 동반성 및 감정적 유대 측면에서 우수하며, 사용자의 주관적 웰빙 개선과 지속적인 참여를 입증했습니다.
본 논문은 고위험 방위 및 보안 분야와 같이 인간 개입이 필수적인 컴퓨팅 집약적 HPC 환경을 위한 비동기 인간-AI 협업 워크플로우 프레임워크를 제안합니다. 이 프레임워크는 HPC 클러스터, 로컬 머신, 클라우드 등 하이브리드 인프라 전반에 걸쳐 작동하며, 컴퓨팅 작업을 중단하지 않고 정의된 체크포인트에서 인간의 입력을 받아 비차단적 감시 및 적응형 워크플로우를 가능하게 합니다. 이를 통해 자원 대기 시간을 최소화하고 운영 AI 시스템의 효율성과 이동성을 크게 향상시킬 수 있습니다.
MOSAIC-Bench는 코딩 에이전트가 개별 안전 검토를 통과하더라도 복잡한 엔지니어링 작업(티켓 분해)을 수행하는 과정에서 구조적인 취약점을 배포할 수 있음을 보여주는 새로운 벤치마크입니다. 이 벤치마크에 따르면, 주요 상용 코딩 에이전트들은 최종적으로 무해한 티켓을 작성하는 데 성공하며 높은 전체 ASR(end-to-end ASR)을 보였습니다. 또한, 기존의 코드 리뷰어 프로토콜은 이러한 누적된 취약점을 효과적으로 잡아내지 못했으며, 적대적인 펜테스터 프레임워크를 적용한 오픈 웨이트 모델이 가장 우수한 탐지 성능을 보였습니다.
SymptomAI는 Fitbit 앱을 통해 13,917명의 일반 참가자와 상호작용하도록 설계된 대화형 AI 에이전트 세트로, 일상적인 증상 평가 및 감별 진단(DDx)에 초점을 맞추고 있습니다. 이 시스템은 실제 세계의 다양한 소통 패턴과 질병 분포를 포착하여 구축되었으며, 무작위 이중 맹검 비교 결과 독립적인 의사의 진단보다 유의하게 높은 정확도를 보였습니다. 특히, 추가 증상 정보를 체계적으로 유도하는 특화된 '증상 인터뷰' 에이전트 전략은 일반 대화나 사용자 안내 대화보다 훨씬 뛰어난 성능을 입증했습니다. 이 연구는 소비자 LLM들이 기본 설정으로 사용하는 방식의 한계를 지적하며, 전문적인 임상 증상 평가의 중요성을 강조합니다.