Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
HairPort는 시점과 스케일 차이가 큰 이미지 간에도 자연스러운 헤어스타일 전이를 가능하게 하는 3D 인지형 프레임워크입니다. Bald Converter와 새로운 데이터셋 Baldy를 통해 기하학적 일관성을 유지하며 사실적인 헤어 합성을 구현합니다.
로보틱스 모방 학습 시 품질이 낮은 하위 최적 데이터를 효과적으로 활용하는 Ambient Diffusion Policy를 제안합니다. 확산 모델의 노이즈 의존적 데이터 사용 방식을 통해 유용한 특징만을 추출하며, 대규모 데이터셋에서 기존 방식보다 뛰어난 성능을 입증했습니다.
CHORUS는 단일 VLA 백본을 활용하여 분산형 다중 로봇 팀 제어에 적응시키는 프레임워크입니다. 이 방법은 각 로봇이 자신의 국부적 관측치와 식별 프롬프트만으로 반응적인 협업을 가능하게 합니다. 실험 결과, CHORUS는 기존의 중앙 집중식 및 분산형 모델 대비 높은 성능 향상을 입증했습니다.
RL 학습 과정에서 MTP의 수락률 저하 문제를 해결하기 위해 거부 샘플링을 결합한 Bebop 연구를 제안합니다. 모델 엔트로피 변동을 완화하는 새로운 TV 손실 함수를 통해 추론 처리량을 최대 25% 향상시키고 학습 속도를 가속화합니다.
Claude Fable 5와 Opus 4.8을 대상으로 게임 설계서 리뷰 성능을 비교한 실험 결과입니다. Fable 5는 통계적 오류를 자발적이고 우선적으로 지적한 반면, Opus 4.8은 명시적 질문 후에야 개선 사항으로 언급하는 차이를 보였습니다.
Google과 오픈 소스 커뮤니티는 AI 빌더들을 사보타주하기보다 역량 강화에 초점을 맞추고 있습니다. 특히 Hugging Face와 같은 플랫폼이 에이전트 간의 협업을 지원하는 허브 역할을 할 것으로 기대됩니다.
본 논문은 언어 모델 후처리(Post-Training)가 스칼라 보상 최적화에 크게 의존하여 데이터의 학습 과정을 투명하게 파악하기 어렵다는 문제를 지적합니다. 이를 해결하기 위해 해석 가능성 프로토콜을 활용하여 선호/비선호 데이터를 개념 수준에서 분리하고, 데이터 중심의 후처리 파이프라인을 제안합니다. 이 방법은 모델이 목표를 벗어난 학습을 완화하고 원하는 속성을 정교하게 형성하는 데 도움을 줍니다.
본 논문은 누락된 모달리티가 존재하는 환경에서의 멀티모달 학습을 위한 Latent World Recovery (LWR) 프레임워크를 제안합니다. LWR는 각 모달리티의 임베딩을 공유 잠재 공간에 정렬하고, 실제로 사용 가능한 모달리티만을 융합하여 통합 표현을 구성하는 것이 핵심입니다. 이를 통해 부분 관찰 환경에서도 강력한 멀티모달 예측이 가능함을 입증했습니다.
본 논문은 계산 비용이 높은 Transformer의 이차 어텐션 문제를 해결하기 위해 Subquadratic 아키텍처를 비교 분석했습니다. xLSTM, Mamba-2, Gated DeltaNet 세 가지 접근 방식을 코드 모델 사전 학습, LLM 증류, 시계열 모델링 등 복잡한 작업에 적용하여 평가했습니다. 그 결과, xLSTM이 가장 강력하고 안정적인 성능을 제공함을 입증하며, 이는 상태 추적 및 메모리 역학 덕분이라고 결론지었습니다.
UniIntervene는 인간 참여형 강화학습(HiL-RL)에서 발생하는 과도한 인간 개입 문제를 해결하기 위한 에이전트 기반 개입 모델입니다. 비생산적인 탐색을 감지하고 자율적으로 고가치 상태로 회복하여 인간의 노동 비용을 줄이고 학습 효율을 높입니다.
조명 변화가 심한 환경에서도 로봇이 비접촉식으로 심박수를 정확히 측정할 수 있는 새로운 시공간 트랜스포머 프레임워크를 제안합니다. 3D 얼굴 정렬과 조명 증강 기술을 통해 기존 모델 대비 심박수 오차를 93.6% 감소시키는 성과를 거두었습니다.
LLM 에이전트의 다회차 도구 사용 능력을 향상시키기 위한 새로운 강화학습 방법론인 APPO를 제안합니다. 기존의 거친 휴리스틱 단위 대신 시퀀스 내 미세한 결정 지점을 식별하여 신용 할당 문제를 해결합니다.
본 논문은 다목적 최적화 알고리즘인 SPEA2의 실행 시간 분석을 수행하고, 기존 방식의 한계를 지적했습니다. 그 결과, SPEA2가 OneTrapZeroTrap 벤치마크에서 파레토 전선을 효율적으로 커버하지 못함을 증명했습니다. 이를 개선하기 위해 모든 쌍별 거리를 고려하는 새로운 변형인 SPEA2$^+$를 제안했으며, 이 알고리즘은 다른 대표적인 알고리즘과 동등한 성능을 보장합니다.
TAHOE는 경험 기반의 자동 힌트 최적화를 통해 Text-to-SQL 성능을 향상시키는 시스템입니다. 오류 기반의 힌트 뱅크를 구축하여 구문 및 의미론적 힌트를 추출하고, 이를 통해 모델 파라미터 업데이트 없이도 SQL 생성 정확도를 크게 높입니다.
체화된 에이전트를 위한 VLM 플래너의 테스트 시간 연산(test-time compute) 효율성을 최적화하는 DIRECT 프레임워크를 제안합니다. 무분별한 연산 확장 대신 멀티모달 문맥을 활용해 연산을 전략적으로 할당함으로써, 지연 시간을 대폭 줄이면서도 높은 성공률을 유지합니다.
ATLAS(Active Theory Learning for Automated Science)는 과학적 이해를 자동화하기 위한 능동 학습 프레임워크입니다. 이 시스템은 기계론적 가설을 생성하고, 이를 최적으로 구별할 수 있는 실험을 설계하는 과정을 반복합니다. ATLAS는 기존의 무작위 실험 대비 5~10배 높은 샘플 효율성을 보여주며, 과학적 탐구의 속도를 높일 잠재력을 입증했습니다.
기존 VLM의 시각적 토큰 제거 방식은 비가역적이라 정보 손실이 발생합니다. 이를 해결하기 위해 선택되지 않은 토큰을 폐기하지 않고 다음 단계에서 재사용하는 'Reroute' 기술을 제안합니다.
본 논문은 긴 문서를 효율적으로 처리하기 위해 Doc-to-Atom(Doc2Atom)이라는 구성적 파라미터 메모리 프레임워크를 제안합니다. 이 방법은 문서를 의미론적 지식 원자(knowledge atoms)로 분해하고, 각 원자를 독립적인 마이크로-LoRA 어댑터와 출처 검색 키로 컴파일합니다. 추론 시 쿼리 라우터를 통해 관련 원자만 선택하여 전용 어댑터를 구성함으로써 메모리 효율성과 성능을 동시에 개선했습니다.
본 논문은 고가 센서 없이 외부 관절 토크를 추정하는 데이터 기반 방법 NEXT를 제안합니다. 이를 통해 저가형 로봇 팔에서도 힘 피드백 원격 조작이 가능해집니다. 또한, FIRST 기법을 적용하여 행동 복제 과정에서 접촉 전후 데이터를 재샘플링함으로써 정책 학습 성능을 크게 개선했습니다.
본 논문은 장기 다중 턴 대화에서 발생하는 누적된 비용과 정보 손실 문제를 해결하기 위해 Context-Driven Incremental Compression (C-DIC)을 제안합니다. C-DIC는 대화를 수정 가능한 맥락적 스레드로 간주하고, 경량의 검색-수정-쓰기 백 루프를 통해 메모리를 업데이트하여 장기 행동 안정성을 높입니다. 또한, TBPTT를 조정하여 턴 간 의존성 학습을 개선했습니다.