Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
심장 종양학 분야의 조기 심독성 예측을 위한 다기관 종단적 심초음파 데이터셋인 EchoRisk를 공개합니다. 이 데이터셋은 LVEF 자동 추정, 좌심실 기능 장애 분류, 조기 심독성 예측을 위한 벤치마크를 제공합니다.
DART-VLN은 재학습 없이 이산적 시각-언어 내비게이션(VLN)의 성능을 개선하는 테스트 시간 제어 프레임워크입니다. 메모리 감쇠와 루프 방지 정규화를 통해 과거의 중복 증거를 억제하고 비효율적인 되돌아가기를 방지합니다.
LLM 에이전트가 정적 학습의 한계로 인해 실제 오픈 월드 환경에서 겪는 일반화 격차 문제를 분석합니다. OpenAgent 프레임워크를 통해 환경 변화에 따른 성능 저하를 진단하고, 이를 해결하기 위한 섭동 증강 미세 조정(Perturbation-Augmented Fine-Tuning) 전략을 제안합니다.
LLM 에이전트의 메모리 활용 과정에서 발생하는 아첨(Sycophancy) 현상을 평가하기 위한 새로운 벤치마크인 MemSyco-Bench를 제안합니다. 기존 벤치마크가 저장과 검색에 집중했다면, 본 연구는 메모리가 추론과 의사 결정에 미치는 부정적 영향을 측정하는 데 중점을 둡니다.
LVLM의 장기 비디오 품질 이해 능력을 평가하기 위한 새로운 벤치마크인 LongVQUBench를 제안합니다. 기존 벤치마크가 놓치기 쉬운 시간적 연속성과 누적 저하를 측정하기 위해 계층적 평가 체계와 NDQA 패러다임을 도입했습니다.
LLM 기반의 자율적 과학 발견 프레임워크인 DiscoPER를 소개합니다. 이 시스템은 2차 추론 메커니즘을 통해 이전 발견을 분석하고, 코드를 동적으로 생성하여 개방형 연구를 수행합니다. iNatDisco 벤치마크에서 기존 모델을 능가하는 성능을 입증했습니다.
Diffusion-GR2는 생성 추론 재순위화기의 느린 추론 속도를 해결하기 위해 블록 확산 언어 모델을 활용한 새로운 방법론을 제안합니다. 변환 미세 조정(CFT)과 온-정책 증류(OPD)를 통해 구조적·분포적 격차를 해소하여 높은 정확도와 빠른 처리량을 동시에 달성했습니다.
자율 실험실에서 AI 에이전트가 제안한 실험 배치들을 하드웨어 제약 조건에 맞춰 최적으로 계획하고 실행하는 2단계 방법론을 제시합니다. 제약 프로그래밍을 통한 스케줄링과 상태 의존성 시스템을 활용하여 자원 활용도를 극대화합니다.
FurnitureVLA는 VLA 모델을 활용하여 실제 규모의 양팔 가구 조립을 수행하는 연구입니다. 시뮬레이션 파이프라인과 VR 원격 조작 시스템을 통해 데이터를 수집하며, 진행 강화 VLA를 통해 장기 시계열 과업의 성공률을 크게 높였습니다.
상호작용형 월드 모델(IWMs)의 장기적 안정성을 평가하기 위한 새로운 오픈 월드 벤치마크인 WorldRoamBench를 소개합니다. 행동, 시각, 물리, 메모리의 네 가지 차원에서 모델의 성능을 다각도로 검증합니다.
확산 모델의 생성 과정을 사용자가 지정한 히스토그램 분포(색상 또는 잠재 토큰)에 맞춰 제어하는 HIG 프레임워크를 제안합니다. 최적 운송(OT) 이론을 활용해 전역적 일관성과 지역적 정밀도 사이의 균형을 맞추는 새로운 제어 메커니즘을 선보입니다.
지도 학습 기반의 특징 선택 시 최적의 절단 지점을 결정하기 위한 새로운 분포 프레임워크를 제안합니다. 바타차야 계수를 활용한 잔차-중첩 정지 규칙을 통해 예측 성능을 유지하면서도 고차원 데이터의 변수를 효과적으로 축소할 수 있습니다.
ShopX는 LLM 에이전트 기반 쇼핑에서 의도 이해와 아이템 실행 간의 간극을 해결하기 위해 제안된 파운데이션 모델입니다. 시맨틱 ID(SID)를 활용하여 검색, 랭킹, 제품 번들링 등의 작업을 단일 모델 내에서 통합 수행합니다.
로봇의 촉각 일반화를 위해 구축된 촉각-시각-언어(RCT) 데이터셋을 소개합니다. 122개의 산업용 재질을 대상으로 수집된 29,279개의 촉각 프레임을 포함하며, 새로운 재질에 대한 로봇의 인지 능력을 평가할 수 있는 구조를 제공합니다.
희소 오토인코더(SAE)를 활용하여 확산 모델 내의 특정 개념을 탐지하고 삭제하는 연구를 다룹니다. SAE가 개념 탐지에는 효과적이지만, 잠재 공간에서의 직접적인 개입은 시각적 아티팩트를 유발한다는 한계를 밝히고 탐지 기반의 패치 교체 방식을 제안합니다.
텍스트-투-이미지(T2I) 모델의 프롬프트 충실도를 정밀하게 측정하기 위한 새로운 벤치마크 Arena-T2I Hard를 제안합니다. 의존성 인식 체크리스트 보상과 GDPO를 결합하여 미학적 품질과 프롬프트 준수 사이의 최적의 트레이드오프를 달성하는 방법론을 다룹니다.
본 연구는 저자원 언어인 루마니아어를 대상으로 LLM을 활용한 교차 언어 관계 추출(RE) 성능을 평가합니다. Gemma 4 31B 모델을 사용하여 Zero-shot, Few-shot, QLoRA 미세 조정 성능을 분석하고 기존 인코더 모델과 비교했습니다.
시각-언어 모델(VLMs)이 대화 중 공유된 정보와 잠재적 정보를 구분하지 못하고 공통 기반을 과대평가하는 편향을 분석한 연구입니다. 모델들이 대화 맥락을 추적하기보다 정적인 지도 정보에 의존하여 정렬(alignment)을 과도하게 예측하는 경향을 확인했습니다.
스타일 임베딩 평가의 파편화 문제를 해결하기 위해 설계된 오픈 소스 벤치마크인 STEB를 소개합니다. 7개 언어와 96개 데이터셋을 통해 저자 확인 및 AI 텍스트 탐지 등 다양한 응용 분야를 표준화된 방식으로 평가합니다.
FedXDS는 연합 학습의 데이터 이질성 문제를 해결하기 위해 XAI(설명 가능한 AI)를 활용하는 새로운 연구입니다. 특징 기여도 기술을 통해 작업 관련 특징을 식별하고, 메트릭 프라이버시를 적용하여 데이터 보안과 모델 성능을 동시에 확보합니다.