Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Diffusion Transformers(DiTs)의 높은 계산 비용을 해결하기 위해 설계된 새로운 사후 학습 프루닝 기법인 DiT-Pruning을 제안합니다. 에너지 기반의 새로운 중요도 지표와 클러스터링을 고려한 프루닝 입도를 통해 높은 희소도에서도 이미지 품질을 효과적으로 보존합니다.
심장 운동 추정을 위한 암시적 신경 표현(INR)의 최적화 속도와 정확도를 높이기 위해 네 가지 사전 학습(prior) 전략을 비교 연구했습니다. 연구 결과, 메타 학습과 합의 사전 정보가 초기 적응 성능과 추적 정확도를 실질적으로 향상시킴을 확인했습니다.
에이전트형 RAG 시스템의 신뢰성을 높이기 위해 베이지안 네트워크를 활용하여 다단계 추론 과정의 불확실성을 추정하는 프레임워크를 제안합니다. 플래너, 평가자, 생성자 단계에서 발생하는 신호를 통해 시스템의 잠재적 실패 지점을 식별합니다.
흉부 X-ray의 롱테일 분포 문제를 해결하기 위한 TRCGL-Net 프레임워크를 제안합니다. 확산 모델을 통한 데이터 증강과 그래프 컨볼루션 네트워크를 활용해 희귀 질환 분류 성능을 극대화했습니다.
SenseWalk는 LLM 기반 에이전트를 활용하여 구역화된 환경 내 의미론적 궤적 시뮬레이션을 지원하는 대화형 시스템입니다. LLM과 사회적 힘 모델을 결합하여 물리적 타당성과 의미론적 일관성을 동시에 확보했습니다.
심장 종양학 분야의 조기 심독성 예측을 위한 다기관 종단적 심초음파 데이터셋인 EchoRisk를 공개합니다. 이 데이터셋은 LVEF 자동 추정, 좌심실 기능 장애 분류, 조기 심독성 예측을 위한 벤치마크를 제공합니다.
DART-VLN은 재학습 없이 이산적 시각-언어 내비게이션(VLN)의 성능을 개선하는 테스트 시간 제어 프레임워크입니다. 메모리 감쇠와 루프 방지 정규화를 통해 과거의 중복 증거를 억제하고 비효율적인 되돌아가기를 방지합니다.
LLM 에이전트가 정적 학습의 한계로 인해 실제 오픈 월드 환경에서 겪는 일반화 격차 문제를 분석합니다. OpenAgent 프레임워크를 통해 환경 변화에 따른 성능 저하를 진단하고, 이를 해결하기 위한 섭동 증강 미세 조정(Perturbation-Augmented Fine-Tuning) 전략을 제안합니다.
LLM 에이전트의 메모리 활용 과정에서 발생하는 아첨(Sycophancy) 현상을 평가하기 위한 새로운 벤치마크인 MemSyco-Bench를 제안합니다. 기존 벤치마크가 저장과 검색에 집중했다면, 본 연구는 메모리가 추론과 의사 결정에 미치는 부정적 영향을 측정하는 데 중점을 둡니다.
LVLM의 장기 비디오 품질 이해 능력을 평가하기 위한 새로운 벤치마크인 LongVQUBench를 제안합니다. 기존 벤치마크가 놓치기 쉬운 시간적 연속성과 누적 저하를 측정하기 위해 계층적 평가 체계와 NDQA 패러다임을 도입했습니다.
LLM 기반의 자율적 과학 발견 프레임워크인 DiscoPER를 소개합니다. 이 시스템은 2차 추론 메커니즘을 통해 이전 발견을 분석하고, 코드를 동적으로 생성하여 개방형 연구를 수행합니다. iNatDisco 벤치마크에서 기존 모델을 능가하는 성능을 입증했습니다.
Diffusion-GR2는 생성 추론 재순위화기의 느린 추론 속도를 해결하기 위해 블록 확산 언어 모델을 활용한 새로운 방법론을 제안합니다. 변환 미세 조정(CFT)과 온-정책 증류(OPD)를 통해 구조적·분포적 격차를 해소하여 높은 정확도와 빠른 처리량을 동시에 달성했습니다.
자율 실험실에서 AI 에이전트가 제안한 실험 배치들을 하드웨어 제약 조건에 맞춰 최적으로 계획하고 실행하는 2단계 방법론을 제시합니다. 제약 프로그래밍을 통한 스케줄링과 상태 의존성 시스템을 활용하여 자원 활용도를 극대화합니다.
FurnitureVLA는 VLA 모델을 활용하여 실제 규모의 양팔 가구 조립을 수행하는 연구입니다. 시뮬레이션 파이프라인과 VR 원격 조작 시스템을 통해 데이터를 수집하며, 진행 강화 VLA를 통해 장기 시계열 과업의 성공률을 크게 높였습니다.
상호작용형 월드 모델(IWMs)의 장기적 안정성을 평가하기 위한 새로운 오픈 월드 벤치마크인 WorldRoamBench를 소개합니다. 행동, 시각, 물리, 메모리의 네 가지 차원에서 모델의 성능을 다각도로 검증합니다.
확산 모델의 생성 과정을 사용자가 지정한 히스토그램 분포(색상 또는 잠재 토큰)에 맞춰 제어하는 HIG 프레임워크를 제안합니다. 최적 운송(OT) 이론을 활용해 전역적 일관성과 지역적 정밀도 사이의 균형을 맞추는 새로운 제어 메커니즘을 선보입니다.
지도 학습 기반의 특징 선택 시 최적의 절단 지점을 결정하기 위한 새로운 분포 프레임워크를 제안합니다. 바타차야 계수를 활용한 잔차-중첩 정지 규칙을 통해 예측 성능을 유지하면서도 고차원 데이터의 변수를 효과적으로 축소할 수 있습니다.
ShopX는 LLM 에이전트 기반 쇼핑에서 의도 이해와 아이템 실행 간의 간극을 해결하기 위해 제안된 파운데이션 모델입니다. 시맨틱 ID(SID)를 활용하여 검색, 랭킹, 제품 번들링 등의 작업을 단일 모델 내에서 통합 수행합니다.
로봇의 촉각 일반화를 위해 구축된 촉각-시각-언어(RCT) 데이터셋을 소개합니다. 122개의 산업용 재질을 대상으로 수집된 29,279개의 촉각 프레임을 포함하며, 새로운 재질에 대한 로봇의 인지 능력을 평가할 수 있는 구조를 제공합니다.
희소 오토인코더(SAE)를 활용하여 확산 모델 내의 특정 개념을 탐지하고 삭제하는 연구를 다룹니다. SAE가 개념 탐지에는 효과적이지만, 잠재 공간에서의 직접적인 개입은 시각적 아티팩트를 유발한다는 한계를 밝히고 탐지 기반의 패치 교체 방식을 제안합니다.