Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
시계열 분류 모델의 예측을 유지하는 데 필수적인 하위 시퀀스를 식별하기 위한 새로운 프레임워크 TimePNS를 제안합니다. Pearl의 반사실적 필연성 개념을 활용하여 가짜 하위 시퀀스를 억제하고 결정적인 요소를 정확히 강조합니다.
Barzilai-Borwein(BB) 방법이 모든 차원(n≥4)의 엄격한 볼록 이차 문제에서 초선형 수렴하는지에 대해 부정적인 결과를 제시합니다. 특정 조건의 열린 집합에서 BB 방법이 근-초선형 수렴을 할 수 없음을 컴퓨터 보조 증명을 통해 입증했습니다.
GraphVid는 상호작용 그래프를 활용하여 정밀한 다중 객체 상호작용을 제어하는 새로운 이미지-to-비디오 생성 모델입니다. 구조화된 관계 주석이 포함된 GraphVid-Bench 데이터셋을 통해 기존 모델 대비 뛰어난 비디오 품질과 제어 성능을 입증했습니다.
VLM-IE3D는 RGB 비디오를 통해 암시적 및 명시적 3D 기하학 정보를 학습하여 VLM의 공간 인지 능력을 강화하는 프레임워크입니다. 추가적인 3D 입력 없이도 미세한 공간적 추론과 3D 작업을 수행할 수 있도록 설계되었습니다.
결정론적 KV-Cache 제거 방식의 오류 추정 불가능성을 증명하고, 무작위 제거(Randomized eviction)를 통해 오류 인증(Error Certificates)을 가능하게 하는 연구를 소개합니다. 무작위 샘플링을 통해 정확도 손실 없이 오류를 인증할 수 있으며, 이를 통해 캐시 문제와 고유 실패를 분리할 수 있습니다.
GS-Agent는 자연어 설명을 바탕으로 물리적으로 타당한 4D 세계를 생성하는 멀티 에이전트 프레임워크입니다. 물리 엔진을 루프 내에 통합하여 엔티티 관리와 렌더링 구성을 자동화함으로써 역동적인 시뮬레이션을 구현합니다.
LLM이 훈련 데이터와 RLHF의 영향으로 '에파나스토시스(자기 수정 수사법)'를 남용하는 현상을 분석한 연구입니다. 모델이 문체(register)에 따라 수사법을 과잉 또는 과소 사용하는 미조정 상태임을 밝히고, LoRA 및 SFT를 통한 교정 방안을 제시합니다.
민감한 데이터를 다루는 연구 환경을 위해 로컬에서 실행 가능한 오픈 웨이트 LLM 기반 AI 에이전트의 데이터 준비 효능을 평가한 연구입니다. 영국 코호트 연구 데이터를 활용해 데이터 클리닝 및 병합 작업에서의 성능을 벤치마킹했습니다.
Rust의 동시 상태 유지 API 테스트 생성을 위해 Petri-net 가이드 방법론을 제안하는 연구입니다. LLM이 생성하는 테스트의 낮은 충실도와 수동 코딩의 번거로움을 해결하기 위해, Petri-net을 중간 표현으로 사용하여 정교한 동시성 시나리오를 도출합니다.
홀수 사이클 그래프의 Shannon 용량에 대한 새로운 하한값을 제시합니다. LLM과의 상호작용을 통해 $C_7, C_{11}, C_{13}$ 그래프의 독립 집합을 구성함으로써 기존의 최선 하한값을 개선하는 성과를 거두었습니다.
LLM이 위험한 목표에 직접 노출될 때보다 다중 에이전트가 목표를 변형하여 전달할 때 더 안전한 조언을 생성한다는 연구 결과입니다. 이는 모델이 조작적 의도를 인식할 때 발생하는 행동적 역전 현상과 구성적 안전성 격차를 보여줍니다.
비디오 편집 시 발생하는 사전 정보 붕괴 문제를 해결하기 위해 ElasticTTT 프레임워크를 제안합니다. 생성 모델의 분포를 보존하면서도 효과적인 테스트 시간 튜닝을 가능하게 하여 원샷 비디오 편집에서 SOTA 성능을 달성했습니다.
SoftReason은 고차원 지각 데이터로부터 미분 가능한 연역 추론을 수행하는 신경-소프트-심볼릭 아키텍처를 제안합니다. 지각과 연역 사이의 이산적 인터페이스를 제거하여 그래디언트 격차를 해결하고, 지식 그래프를 활용한 엔드투엔드 추론을 지원합니다.
페르시아어 OCR 기술 발전을 위해 설계된 대규모 합성 데이터셋인 Persian Pixel을 소개합니다. 343,000개 이상의 고충실도 이미지-텍스트 쌍을 통해 복잡한 페르시아 문자 체계와 다양한 문서 환경을 모델링합니다.
AI 공급망 내에서 데이터셋, 모델, 애플리케이션을 거치며 라이선스 의무 사항이 누락되거나 변경되는 '라이선스 세탁' 현상을 분석한 연구입니다. 분석 결과, 허용적 라이선스는 생존율이 높지만 의무 사항이 포함된 라이선스는 생존율이 7% 미만으로 매우 낮음을 확인했습니다.
임상 바이오마커 분석 워크플로우를 최적화하기 위한 HIPAA 준수 AI 증강 LIMS 아키텍처인 FMRP-LEAN을 제안합니다. 유한 상태 모델과 하이브리드 에지-내부 격리 기술을 통해 데이터 보안과 워크플로우 가시성을 동시에 확보합니다.
지속적인 환경을 공유하는 다중 로봇 시스템에서 미래의 부작용을 최소화하기 위한 '예의 바른 예측 계획(courteous anticipatory planning)' 방법론을 제안합니다. 모델 기반 계획기와 독립 학습된 추정기를 결합하여 전체 로봇의 누적 비용을 최소화하는 효율적인 계획 수립 방식을 다룹니다.
리테일 환경에서 휴머노이드 로봇의 성능 격차를 줄이기 위한 DEED 프레임워크를 제안합니다. 데이터 효율적 사후 학습과 경험 기반 정교화 기술을 통해 실험실 환경을 넘어 실제 매장 운영이 가능한 VLA 시스템을 구축하는 방법을 다룹니다.
산업용 비디오 이상 탐지(IVAD)를 위해 객체의 상태 변화를 추적하는 학습이 필요 없는 에이전트 기반 프레임워크인 O-VAD를 제안합니다. 이 방법은 도메인 지식 주입 없이도 객체의 시공간적 역동성을 추적하여 비정상 객체를 식별하며, 기존 VLM 및 미세 조정된 모델보다 뛰어난 성능을 보입니다.
현대적 VLM이 생성한 이미지의 변조를 탐지하기 위한 도메인 일반화(Domain Generalization) 연구를 소개합니다. 균형 잡힌 미니배치 샘플링과 후기 주입 전략을 통해 새로운 VLM 분포에서도 견고한 픽셀 수준 변조 위치 탐지가 가능함을 입증했습니다.