
완전 합성곱 신경망 (Fully Convolutional Neural Networks)을 통한 뇌 MRI 기반 다발성 경화증 병변 분할
요약
최신 AI 연구 동향을 다루는 논문 목록으로, 멀티모달 추론, 강화학습, 비디오 생성, 에이전트 학습 등 다양한 최첨단 연구 주제를 포함하고 있습니다. 특히 LLM의 추론 능력 강화와 멀티모달 모델의 효율성 및 정렬 문제에 집중하고 있습니다.
핵심 포인트
- 멀티모달 긴 체인 성찰적 추론 및 에이전트 학습 연구
- 강화학습(RL)을 통한 모델 정렬 및 보상 모델링 최적화
- 비디오 생성, 편집 및 초해상도를 위한 통합 프레임워크
- LLM의 메모리 활용 및 장기 과제 수행 능력 향상
1
초기 경험을 통한 에이전트 학습 (Agent Learning via Early Experience)
2
MM-HELIX: 통합 플랫폼 및 적응형 하이브리드 정책 최적화를 통한 멀티모달 긴 체인 성찰적 추론 (Multimodal Long-Chain Reflective Reasoning) 강화
...
4440개 이상의 파트...
3
MemMamba: 상태 공간 모델 (State Space Model)에서의 메모리 패턴 재고
4
UniVideo: 비디오를 위한 통합 이해, 생성 및 편집
5
VideoCanvas: 인컨텍스트 컨디셔닝 (In-Context Conditioning)을 통한 임의의 시공간 패치로부터의 통합 비디오 완성
6
DreamOmni2: 멀티모달 지시 기반 편집 및 생성
7
무엇에서 왜로: 증거 기반 화학 반응 조건 추론을 위한 멀티 에이전트 시스템
8
메타 인지 (Meta-Awareness)가 추론 모델을 강화하는 방법: 자기 정렬 강화학습 (Self-Alignment Reinforcement Learning)
9
생각이 사실을 만날 때: 긴 문맥 언어 모델 (Long-Context LMs)을 위한 재사용 가능한 추론
10
검증 가능한 보상을 가진 강화학습 (Reinforcement Learning)에서 저확률 토큰이 탐색을 유지하는 방법
11
정렬의 왈츠 (The Alignment Waltz): 안전을 위해 협업하도록 에이전트를 공동 학습시키기
12
학습이 필요 없는 그룹 상대적 정책 최적화 (Training-Free Group Relative Policy Optimization)
13
하이브리드 강화: 보상이 희소할 때는 밀집된(Dense) 것이 더 낫다
14
NewtonBench: LLM 에이전트에서의 일반화 가능한 과학 법칙 발견 벤치마킹
15
ARTDECO: 구조화된 장면 표현을 통한 효율적이고 고충실도의 온더플라이 (On-the-Fly) 3D 재구성 연구
16
DeepPrune: 트레이스 간 중복 없는 병렬 스케일링
17
첫 시도가 중요하다: 추론 모델에서 성찰 (Reflection)의 역할 재고
18
LLM은 의도치 않게 속이는 법을 배운다: 정렬되지 않은 샘플에서 편향된 인간-AI 상호작용에 이르기까지 부정직함에서 나타나는 창발적 미정렬 (Emergent Misalignment)
19
UniMMVSR: 계층적 비디오 초해상도 (Video Super-Resolution)를 위한 통합 멀티모달 프레임워크
20
NaViL: 데이터 제약 하에서의 네이티브 멀티모달 거대 언어 모델 (Native Multimodal Large Language Models)의 스케일링 특성 재고
21
CoMAS: 상호작용 보상을 통한 공동 진화 멀티 에이전트 시스템
22
PickStyle: 컨텍스트-스타일 어댑터를 이용한 비디오-투-비디오 스타일 전이
23
UNIDOC-BENCH: 문서 중심 멀티모달 RAG를 위한 통합 벤치마크
24
InstructX: MLLM 가이드를 통한 통합 시각적 편집 연구
25
LongRM: 보상 모델링 (Reward Modeling)의 컨텍스트 경계(Context Boundary) 규명 및 해제
26
Learning on the Job: 장기 과제 (Long-Horizon Tasks)를 위한 경험 기반 자기 진화 에이전트
27
Direct Group Preference Optimization을 통한 확산 모델 (Diffusion Models) 강화
28
고급 모달리티 조건 (Modality Condition) 및 상호작용을 통한 텍스트 기반 사운드 포함 비디오 생성 제어
29
활성화 (Activation)를 통한 엔트로피 정규화: 활성화를 메모리 (Memory)로 활용하여 연속 제어 (Continuous Control), 대규모 언어 모델 (LLMs), 이미지 분류 성능 향상
30
함수 토큰 (Function Tokens)을 통한 대규모 언어 모델 (Large Language Models)의 메모리 검색 및 공고화
31
사전 학습된 체크포인트 (Pretrained Checkpoints) 재활용: 효율적인 대규모 언어 모델 (Large Language Model) 사전 학습을 위한 전문가 혼합 (Mixture-of-Experts)의 직교 성장
32
GCPO: 대조 (Contrast)가 실패할 때, 골드 (Gold)를 선택하라
33
UP2You: 제약 없는 사진 컬렉션으로부터의 빠른 자기 재구성
34
OmniRetarget: 휴머노이드 전신 로코-매니퓰레이션 (Loco-Manipulation) 및 장면 상호작용을 위한 상호작용 보존 데이터 생성
35
DexNDM: 관절별 신경 역학 모델 (Joint-Wise Neural Dynamics Model)을 통한 숙련된 손 안 회전 (In-Hand Rotation)의 현실 격차 (Reality Gap) 해소
36
A^2Search: 강화학습 (Reinforcement Learning)을 이용한 모호성 인지 질의응답
37
밴딧 피드백 (Bandit Feedback)으로부터 LLM 라우팅 학습하기: 하나의 정책, 다양한 트레이드오프
38
Search-R3: 대규모 언어 모델 (Large Language Models)에서의 추론 (Reasoning)과 임베딩 생성 (Embedding Generation) 통합
39
R2RGEN: 공간적으로 일반화된 매니퓰레이션 (Manipulation)을 위한 Real-to-Real 3D 데이터 생성
40
Drive&Gen: 엔드투엔드 (End-to-End) 주행 및 비디오 생성 모델의 공동 평가
41
이상치 (Outliers)를 넘어: 양자화 (Quantization) 환경에서의 옵티마이저 (Optimizers) 연구
42
SViM3D: 단일 이미지 3D 생성을 위한 안정적인 비디오 물질 확산 (Stable Video Material Diffusion)
43
GyroSwin: 자이로키네틱 플라즈마 난류 시뮬레이션을 위한 5D 대리 모델 (5D Surrogates)
44
확장 가능하고 일관된 3D 편집을 향하여
45
가능하다면 온라인 네트워크를 사용하라: 빠르고 안정적인 강화학습 (Reinforcement Learning)을 향하여
46
강력한 로봇 일반화를 위한 충실도 인지 (Fidelity-Aware) 데이터 구성
47
SciVideoBench: 대규모 멀티모달 모델 (Large Multimodal Models)의 과학 비디오 추론 벤치마킹
48
점수 정규화된 연속 시간 일관성 (Score-Regularized Continuous-Time Consistency)을 통한 대규모 확산 증류 (Diffusion Distillation)
49
턴 제한을 넘어: 동적 컨텍스트 윈도우 (Dynamic Context Window)를 통한 심층 검색 에이전트 (Deep Search Agents) 학습
50
OpenRubrics: 보상 모델링 (Reward Modeling) 및 LLM 정렬 (Alignment)을 위한 확장 가능한 합성 루브릭 (Synthetic Rubric) 생성 연구
51
카메라와 함께 생각하기: 카메라 중심 이해 및 생성을 위한 통합 멀티모달 모델 (Unified Multimodal Model)
52
D2E: Embodied AI로의 전이를 위한 데스크톱 데이터 기반 비전-액션 사전 학습 (Vision-Action Pretraining) 확장
53
TAG: 환각 저항성 확산 샘플링 (Hallucination-Resistant Diffusion Sampling)을 위한 접선 증폭 가이드 (Tangential Amplifying Guidance)
54
멀티모달 프롬프트 최적화 (Multimodal Prompt Optimization): MLLM을 위해 왜 여러 모달리티를 활용하지 않는가
55
AutoPR: 당신의 학술적 승진을 자동화하세요!
56
R-Horizon: 대규모 추론 모델 (Large Reasoning Model)의 너비와 깊이는 실제로 어디까지 도달할 수 있는가?
57
Webscale-RL: RL 데이터를 사전 학습 (Pretraining) 수준으로 확장하기 위한 자동화된 데이터 파이프라인
58
SpaceVista: mm에서 km까지, 모든 규모의 시각적 공간 추론 (Visual Spatial Reasoning)
59
StreamingVLM: 무한한 비디오 스트림을 위한 실시간 이해
60
실수를 낭비하지 마세요: 신뢰도 재가중치 (Confidence Reweighting)를 통한 부정적 RL-그룹 (Negative RL-Groups) 활용
61
ARES: 난이도 인식 토큰 수준 엔트로피 셰이핑 (Difficulty-Aware Token-Level Entropy Shaping)을 통한 멀티모달 적응형 추론
62
KORMo: 모두를 위한 한국어 오픈 추론 모델 (Korean Open Reasoning Model)
63
DISCO: 효율적인 모델 평가를 위한 샘플 응축 (Sample Condensation) 다양화
64
추론과 학습의 연결: 복잡성 분포 외 일반화 (Complexity Out-of-Distribution Generalization)를 통한 환상 제거
65
Open-Vocabulary 점유 예측 (Occupancy Prediction)을 위한 비등방성 인식 샘플링 (Anisotropy-aware Sampling) 기반 점진적 가우시안 트랜스포머 (Progressive Gaussian Transformer)
66
StatEval: 통계학 분야 대규모 언어 모델 (Large Language Models)을 위한 종합 벤치마크
67
MRMR: 추론 집약적 멀티모달 검색 (Reasoning-Intensive Multimodal Retrieval)을 위한 현실적이고 전문가 수준의 다학제적 벤치마크
68
PhysToolBench: MLLM의 물리적 도구 이해 (Physical Tool Understanding) 벤치마킹
69
BigCodeArena: 실행을 통한 코드 생성에서의 더욱 신뢰할 수 있는 인간 선호도 공개
70
추론에 중요한 헤드(Heads)는 무엇인가? RL 가이드 KV 캐시 압축 (KV Cache Compression)
71
Dyna-Mind: 더 나은 AI 에이전트를 위해 경험으로부터 시뮬레이션하는 법 배우기
72
ReviewerToo: AI가 프로그램 위원회(Program Committee)에 참여해야 하는가?
동료 검토 (Peer Review)의 미래를 살펴보기
73
Pseudo2Real: 자동 음성 인식 (Automatic Speech Recognition)에서의 의사 라벨 (Pseudo-Label) 교정을 위한 태스크 산술 (Task Arithmetic)
74
잠재 추론 모델 (Latent Reasoning Models)을 위한 병렬 테스트 시간 스케일링 (Parallel Test-Time Scaling)
75
Mind-Paced Speaking: 음성 언어 모델 (Spoken Language Models)의 실시간 추론을 위한 이중 뇌 접근 방식
76
계획 없는 목표는 단지 소망일 뿐이다: 장기 지평 에이전트 태스크 (Long-Horizon Agent Tasks)를 위한 효율적이고 효과적인 글로벌 플래너 (Global Planner) 학습
77
TC-LoRA: 적응형 확산 제어 (Adaptive Diffusion Control)를 위한 시간적 변조 조건부 LoRA (Temporally Modulated Conditional LoRA)
78
추론 형성 (Reasoning Shaping)을 통한 과도한 생각 (Overthinking) 완화
79
신뢰할 수 있는 모니터에 대한 적응형 공격이 AI 제어 프로토콜을 무력화한다
80
GTAlign: 상호 복지를 위한 LLM 어시스턴트의 게임 이론적 정렬 (Game-Theoretic Alignment)
81
보고서를 통한 DeepResearch 이해
82
모든 것을 캡션하기 위한 하나의 패치: 통합 제로샷 캡셔닝 (Zero-Shot Captioning) 프레임워크
83
자기 지도 단안 깊이 추정 (Self-supervised Monocular Depth Estimation)을 위한 거친 수준에서 세밀한 수준의 언어 가이드를 활용한 하이브리드 입도 특징 집계 (Hybrid-grained Feature Aggregation)
84
자기 회귀적 텍스트-이미지 생성 (Autoregressive Text-to-image Generation) 가속화를 위한 추측적 Jacobi-Denoising 디코딩
85
함께할 때 더 좋다: 더 강력한 단일 모달 모델 (Unimodal Models)을 위한 비쌍 데이터 (Unpaired Multimodal Data) 활용
86
LightReasoner: 소형 언어 모델 (Small Language Models)이 대형 언어 모델 (Large Language Models)에게 추론을 가르칠 수 있는가?
87
ACE: 다중 홉 사실 회상 (Multi-hop Factual Recall)을 위한 속성 제어 지식 편집 (Attribution-Controlled Knowledge Editing)
88
개인적 서사 (Personal Narratives)에서의 스타일 정식화 (Formalizing Style)
89
LLM4Cell: 단일 세포 생물학 (Single-Cell Biology)을 위한 대형 언어 및 에이전트 모델 (Large Language and Agentic Models) 조사
90
시간적 프롬프팅 (Temporal Prompting)의 중요성: 참조 비디오 객체 분할 (Referring Video Object Segmentation)에 대한 재고
91
ELMUR: 장기 RL (Long-Horizon RL)을 위한 업데이트/재작성 기능이 포함된 외부 레이어 메모리 (External Layer Memory with Update/Rewrite)
92
Instant4D: 몇 분 만에 완성하는 4D 가우시안 스플래팅 (4D Gaussian Splatting)
93
QeRL: 효율성을 넘어 -- LLM을 위한 양자화 강화 학습 (Quantization-enhanced Reinforcement Learning)
94
표현 오토인코더 (Representation Autoencoders)를 결합한 확산 트랜스포머 (Diffusion Transformers)
95
OmniVideoBench: Omni MLLM을 위한 시청각 이해 평가를 향하여
96
잠재 정제 디코딩 (Latent Refinement Decoding): 신념 상태 (Belief States) 정제를 통한 확산 기반 언어 모델 (Diffusion-Based Language Models) 강화
97
RLFR: 흐름 환경 (Flow Environment)을 통한 LLM을 위한 강화 학습 (Reinforcement Learning) 확장
98
멀티모달 강화 학습 (Multimodal Reinforcement Learning)을 위한 토큰 인지 (Token Perception) 조명
99
AVoCaDO: 시간적 오케스트레이션 (Temporal Orchestration)에 의해 구동되는 시청각 비디오 캡셔너 (Audiovisual Video Captioner)
100
DiT360: 하이브리드 학습을 통한 고충실도 파노라마 이미지 생성
101
수학적 추론 (Mathematical Reasoning)을 적응형으로 만들기
102
에이전트 추론 (Agentic Reasoning)에서의 강화 학습 (Reinforcement Learning) 신비 해제
103
InternSVG: 멀티모달 대형 언어 모델 (Multimodal Large Language Models)을 통한 통합 SVG 작업 구현
104
합성 데이터 (Synthetic Data)를 통한 일반 에이전트 시스템 (General Agentic Systems)의 기초 가드레일 구축
105
ACADREASON: 학술 연구 문제 (Academic Research Problems)를 통한 추론 모델 (Reasoning Models)의 한계 탐구
106
BrowserAgent: 인간에게 영감을 받은 웹 브라우징 동작을 통한 웹 에이전트 (Web Agents) 구축
107
FinAuditing: LLM 평가를 위한 금융 분류 체계 구조화 다중 문서 벤치마크
108
DocReward: 구조화 및 스타일화를 위한 문서 보상 모델 (Document Reward Model)
109
에이전트를 단순히 미세 조정 (Fine-tune)하지 말고, 환경을 조정하라
110
GIR-Bench: 추론을 통한 이미지 생성을 위한 다목적 벤치마크
111
AdaViewPlanner: 4D 장면의 시점 계획 (Viewpoint Planning)을 위한 비디오 확산 모델 (Video Diffusion Models) 적응
112
Vlaser: 시너지 효과를 내는 체화된 추론 (Embodied Reasoning)을 갖춘 시각-언어-행동 모델 (Vision-Language-Action Model)
113
SPG: 마스크 확산 언어 모델 (Masked Diffusion Language Models)을 위한 샌드위치 정책 경사 (Sandwiched Policy Gradient)
114
CodePlot-CoT: 코드 기반 이미지를 통한 사고를 활용한 수학적 시각적 추론 (Mathematical Visual Reasoning by Thinking with Code-Driven Images)
115
대형 시각-언어 모델 (Large Vision-Language Models)의 객체 환각 (Object Hallucinations)에 대한 시각적 토큰 (Visual Tokens)의 인식론적 불확실성 (Epistemic Uncertainty)에 관하여
116
Gaussian Splatting을 이용한 실제 환경의 제로샷 (Zero-Shot) 로봇 조작 학습을 위한 고충실도 (High-Fidelity) 시뮬레이션 데이터 생성
117
기술 타겟 적응형 훈련 (Skill-Targeted Adaptive Training)
118
ReLook: 에이전트형 웹 코딩을 위한 멀티모달 LLM 비평가 (Critic) 기반의 시각 접지 강화학습 (Vision-Grounded RL)
119
PEAR: 효율적인 추론을 위한 위상 엔트로피 인식 보상 (Phase Entropy Aware Reward)
120
테스트 시간에서의 자기 개선 LLM 에이전트 (Self-Improving LLM Agents at Test-Time)
121
FastHMR: Diffusion Decoding을 통한 토큰 및 레이어 병합 기반의 인간 메쉬 복원 (Human Mesh Recovery) 가속화
122
개인화의 함정: 사용자 메모리가 LLM의 감정적 추론을 어떻게 변화시키는가
123
Stable Video Infinity: 오류 재활용 (Error Recycling)을 통한 무한 길이 비디오 생성
124
LikePhys: 가능도 선호도 (Likelihood Preference)를 통한 비디오 확산 모델 (Video Diffusion Models)의 직관적 물리 이해 평가
125
HUME: 텍스트 임베딩 (Text Embedding) 작업에서 인간-모델 성능 격차 측정
126
SwarmSys: 확장 가능하고 적응적인 추론을 위한 분산형 군집 영감 에이전트 (Decentralized Swarm-Inspired Agents)
127
데이터에서 보상으로: 최대 가능도 추정 (Maximum Likelihood Estimation)에 대한 이중 수준 최적화 (Bilevel Optimization) 관점
128
InfiniHuman: 정밀한 제어를 통한 무한 3D 인간 생성
129
LLaMAX2: 번역 강화 모델이 추론에서도 우수한 성능을 보이는 이유
130
World-To-Image: 에이전트 기반 세계 지식 (World Knowledge)을 통한 텍스트-이미지 생성의 접지 (Grounding)
131
RePro: 사전 학습 (Pretraining)을 위해 웹 데이터를 충실히 재활용하도록 언어 모델을 훈련하는 방법
132
대화형 에이전트를 위한 멀티모달 정책 내재화 (Multimodal Policy Internalization)
133
그래프 확산 트랜스포머 (Graph Diffusion Transformers)는 인컨텍스트 (In-Context) 분자 설계 도구이다
134
VER: 파운데이션 증류 (Foundation Distillation) 및 동적 라우팅 (Dynamic Routing)을 통한 로봇 학습용 시각 전문가 트랜스포머 (Vision Expert Transformer)
135
LLM과 유도된 소형 프록시의 이야기: 지식 마이닝을 위한 확장 가능한 에이전트
136
대형 추론 모델 (Large Reasoning Models)은 중단 가능한가?
137
IVEBench: 지시어 가이드 비디오 편집 평가를 위한 현대적 벤치마크 스위트 (Modern Benchmark Suite for Instruction-Guided Video Editing Assessment)
138
AndesVL 기술 보고서: 효율적인 모바일 측면 멀티모달 대규모 언어 모델 (An Efficient Mobile-side Multimodal Large Language Model)
139
ViSurf: 대규모 시각-언어 모델 (Large Vision-and-Language Models)을 위한 시각적 지도 및 강화 미세 조정 (Visual Supervised-and-Reinforcement Fine-Tuning)
140
LLM이 생성한 JavaScript의 숨겨진 DNA: 고정밀 저자 식별을 가능하게 하는 구조적 패턴 (The Hidden DNA of LLM-Generated JavaScript: Structural Patterns Enable High-Accuracy Authorship Attribution)
141
CoBia: 구성된 대화는 LLM 내에 숨겨진 사회적 편향을 유발할 수 있다 (Constructed Conversations Can Trigger Otherwise Concealed Societal Biases in LLMs)
142
공격자는 두 번째로 움직인다: 더 강력한 적응형 공격은 LLM 탈옥 (Jailbreaks) 및 프롬프트 주입 (Prompt Injections) 방어 체계를 우회한다 (The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against LLM Jailbreaks and Prompt Injections)
143
LiDAR의 관점을 통해: 지상 점구름 분할 (Terrestrial Point Cloud Segmentation)을 위한 특징 풍부 및 불확실성 인지 어노테이션 파이프라인 (Through the Perspective of LiDAR: A Feature-Enriched and Uncertainty-Aware Annotation Pipeline for Terrestrial Point Cloud Segmentation)
144
LLM의 단문 및 장문 답변 사이의 사실적 (불)일치에 관한 기묘한 사례 (The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers)
145
MultiCOIN: 멀티모달 제어 가능 비디오 인비트위닝 (Multi-Modal COntrollable Video INbetweening)
146
Pathology-CoT: 전문가의 전체 슬라이드 이미지 (Whole Slide Image) 진단 행동으로부터 시각적 사고 사슬 (Visual Chain-of-Thought) 에이전트 학습하기 (Pathology-CoT: Learning Visual Chain-of-Thought Agent from Expert Whole Slide Image Diagnosis Behavior)
147
어텐션 (Attention)은 LLM 추론을 밝힌다: 사전 계획 및 앵커 리듬을 통한 미세 정책 최적화 (Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization)
148
FlashWorld: 몇 초 내에 수행되는 고품질 3D 장면 생성 (FlashWorld: High-quality 3D Scene Generation within Seconds)
149
CVD-STORM: 자율 주행을 위한 시공간 재구성 모델 기반 교차 뷰 비디오 확산 (Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving)
150
InteractiveOmni: 오디오-비주얼 다회차 대화를 위한 통합 옴니모달 모델 (A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue)
151
멀티모달 메타-추론기 (Multimodal Meta-Reasoner)로서의 생성형 범용 검증기 (Generative Universal Verifier as Multimodal Meta-Reasoner)
152
Bee: 고급 완전 오픈 MLLM을 해제하기 위한 고품질 코퍼스 및 풀스택 스위트 (Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs)
153
Trace Anything: 궤적 필드 (Trajectory Fields)를 통한 모든 비디오의 4D 표현 (Trace Anything: Representing Any Video in 4D via Trajectory Fields)
154
ParallelBench: 확산 LLM (Diffusion LLMs)에서 병렬 디코딩 (Parallel Decoding)의 트레이드오프 이해하기 (ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs)
155
LIBERO-Plus: In
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기