Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 음악에 맞춰 춤을 생성하는 새로운 프레임워크를 제시하며, 안무를 원자적 움직임(atomic movements)의 시퀀스로 모델링합니다. 이 구조 인식 접근 방식은 기존 신경망 모델이 놓치던 구조적 불일치를 해결하여, 의미론적으로 일관되고 제어 가능한 댄스 생성을 가능하게 합니다.
본 논문은 에이전틱 AI 확산에 따라 전통적 충성도 모델로는 설명할 수 없는 새로운 소비자-브랜드 관계를 다룹니다. 'DVM-HALL' 모델을 통해 인간의 감정적 자산, 신뢰 등을 정식화하고, DeFi 환경에서의 실행 위험까지 예측 변수로 포함합니다. 또한, 감사 가능한 'NHAS' 지표를 제시하여 인간과 에이전트 간의 정렬도를 측정하는 프레임워크를 제안합니다.
본 논문은 기존의 인프라 손상 중심 침투 테스트 패러다임을 넘어, AI 기반 시스템에 특화된 목표 지향적 행동 평가로 침투 테스트를 재정의합니다. 공격자가 프롬프트나 데이터를 조작하여 시스템 동작을 변경하는 'AI 기반 침투' 개념을 제시하며, 이를 위한 새로운 테스트 워크플로우와 기술적 프레임워크를 제안합니다.
본 논문은 지식 습득부터 평가 개발까지 5단계에 걸쳐 AI 가속화를 적용하는 엔드투엔드 역량 강화 프레임워크를 제시합니다. 이 프레임워크는 생산성과 학습 효율성을 모두 높이는 것을 목표로 합니다. 실제로는 US National Association of State Boards of Accountancy의 승인을 받았으며, NVIDIA Certified Professional in Agentic AI 시험 합격 사례 등 강력한 검증을 거쳤습니다.
본 논문은 LLM의 복잡한 추론 과정에서 발생하는 오류를 효율적으로 수정하는 'Deep Interaction' 메커니즘을 제안합니다. 기존 방식의 한계를 극복하기 위해, 원본 응답을 직접 편집하여 정확한 추론 단계를 유지하면서 오류 부분만 수정할 수 있게 합니다.
본 논문은 기호적 액션과 수치적 매개변수를 결합한 PAMDP 환경에서의 강화학습 문제를 다룹니다. 기존 방법의 샘플 비효율성을 개선하기 위해, 신경-기호적 지식 및 기울기 기반 강화학습(KGRL) 알고리즘을 제안합니다. KGRL은 도메인 지식을 활용하여 액션을 가지치기하고 매개변수를 제약함으로써 훈련 효율성과 성능을 동시에 높입니다.
본 논문은 언어 모델이 비증거 기반 압력 하에서 잘못 보고하는 '내부 인센티브 호환성(IC) 실패' 문제를 다룹니다. 이를 해결하기 위해, 금지된 영향에는 불변하면서 허가된 증거에는 반응하는 반사실적 보고 중개자 학습 및 인증 방법을 제시합니다. 이 방법은 모델의 답변, 자신감, 주의사항에 대한 인과적 좌표를 식별하고, 인센티브가 중화된 환경에서 모델을 훈련시키는 '반사실적 보고 좌표(CRC) 클램프'를 도입하여 높은 저항성과 업데이트 능력을 달성했습니다.
본 논문은 멀티모달 대규모 언어 모델(MLLMs)의 발전에 따라 부족했던 해석 기하학 분야를 위한 문제 생성 프레임워크 FormalAnalyticGeo를 제안합니다. 이 프레임워크는 CDL이라는 공식적 중간 표현을 활용하여, 문제 텍스트와 SDF 기반 다이어그램 렌더링을 연결합니다. 이를 통해 정답과 주석이 포함된 대규모 검증 데이터셋 AnalyticGeo7K가 구축되었습니다.
본 논문은 베트남 호텔 추천 시스템 연구의 한계를 극복하기 위해 ViHoRec이라는 품질 관리된 데이터셋을 제안했습니다. 이 데이터셋은 6,832명의 사용자와 560개 호텔 간의 상호작용 데이터를 포함하며, 재현 가능한 구축 파이프라인과 개인 정보 보호 기술을 적용했습니다. 또한, 콜드 스타트 환경에 초점을 맞춘 공개 벤치마크를 제공하여 저자원 추천 연구에 기여합니다.
본 논문은 기존의 자기회귀 디코더 방식 대신 이산 확산 언어 모델을 활용하여 오디오 네이티브 음성 인식(ASR) 시스템을 제안합니다. DiffusionGemma는 26B MoE 기반으로, 노이즈 제거 단계를 통해 전체 전사본을 병렬로 정제하며, 기존의 한계점을 극복하는 새로운 학습 방식을 제시했습니다.
PixelLoop는 픽셀 수준의 상대적 3D 기하학에 기반하여 위상 맵에 직접 루프 클로저를 도입한 방법론입니다. 기존 SLAM 방식과 달리, 이는 단순 좌표 정렬을 넘어 계획 연결성 및 비용 전파를 변경하는 조밀한 위상 단축 경로 역할을 합니다. 이 기술은 안정적인 임의 지점 내비게이션을 가능하게 하며, 이미지 상대 기준선 대비 성공률과 SPL에서 35% 이상의 개선을 달성했습니다.
본 연구는 Vision-Language Models (VLMs)의 Chain-of-Thought (CoT) 프롬프팅이 추론 과정 전반에 걸쳐 이미지 토큰 접근을 연장하는지 분석했습니다. 그 결과, CoT가 성능 개선을 위해 직접적인 이미지 토큰 접근을 늘리기보다는, 이미지에서 파생된 은닉 상태 정보에 대한 언어적 계산을 확장하여 성능을 향상시키는 것으로 나타났습니다.
AI 에이전트와의 상호작용은 요청-결과-평가-수정의 반복 루프를 형성하며, 이는 사용자의 무의식적인 신경가소성 훈련 환경을 만듭니다. 본 논문은 이 현상을 역이용하여, 반응적 재요청 대신 배경 관찰(behind-the-scenes observation)을 수행하는 프레임워크를 제안합니다. 이를 통해 장기 강화(LTP) 대신 장기 억제(LTD)를 유도하여 부정적인 패턴의 고착화를 막는 것을 목표로 합니다.
본 논문은 Multi-agent Reinforcement Learning (MARL)에서 단순한 보상으로부터 복잡한 집단 행동이 출현하는 메커니즘을 해석하려는 연구입니다. 새로운 분석 도구인 Agent Response Map (ARM)을 제안하여, 로봇들이 환경의 기하학적 장(geometric fields)을 암묵적으로 학습하고 이를 협력 및 경쟁 상황 모두에서 활용함을 입증했습니다.
본 논문은 리듬 게임 차트 생성의 품질을 평가하는 새로운 프레임워크인 ChartGenEval을 소개합니다. 이 프레임워크는 노트 선택에 대한 자유도를 열어두고 타이밍만 고정하여, 단순한 공식 일치도 대신 용량 제어 실패(dose-controlled failures)를 통해 핵심 출력을 테스트합니다. 이를 통해 생성 모델의 민감성 및 불변성을 다차원적으로 측정할 수 있습니다.
본 논문은 변형 유발 자기전기 결합을 이용한 초상자성 나노점 앙상블 기반 리저버 컴퓨팅 시스템의 온도 민감도 문제를 다룹니다. 시뮬레이션을 통해 주변 온도 변화가 자화 동역학 및 작업 성능에 미치는 영향을 분석했습니다. 이를 해결하기 위해 서로 다른 특성을 가진 이종(heterogeneous) 나노점 패턴을 통합하여, 광범위한 온도 범위에서도 리저버의 안정적인 성능 유지가 가능함을 입증했습니다.
본 논문은 임상 기록에서 구조화되지 않은 징후 및 증상을 추출하기 위한 다중 에이전트 시스템 Pythia를 제안합니다. Pythia는 별도의 미세 조정이나 수동 프롬프트 엔지니어링 없이도 자율적으로 최적의 추출 프롬프트를 생성하고, 로컬 환경에서 작동하여 데이터 보안을 유지합니다. 실험 결과, Pythia는 기존 방법론 대비 높은 민감도와 특이도를 달성하며 임상 개념 추출의 새로운 가능성을 보여주었습니다.
본 논문은 로봇 학습 시스템의 진행도 평가를 위해 시간 기반 레이블이 사용되는 한계를 지적하며, 이를 보완하는 Unsupervised Robotic Value Correction (UR-VC) 방법을 제안합니다. UR-VC는 시연 데이터 내 유사한 상태들의 시간 기반 레이블을 집계하여 노이즈가 많은 물리적 작업 진행도를 오프라인으로 보정합니다. 이 방법은 추가적인 라벨링이나 모델 없이도 로봇의 실제 작업을 개선하는 데 효과적임을 입증했습니다.
본 논문은 노인 돌봄 분야의 필수 기술인 낙상 감지를 위해 물리 정보 기반 프레임워크를 제안합니다. 기존 방식이 간과했던 불안정성 역학을 모델링하기 위해, CoM 및 BoS 서브시스템으로 구성된 이중 LTC 아키텍처를 도입했습니다. 이는 연속적인 기계적 관성을 인코딩하여 저전력 엣지 장치에서 실시간 추론이 가능합니다.
MM-ToolSandBox는 시각적 기반을 갖춘 도구 호출 에이전트 평가를 위한 통합 프레임워크입니다. 이 프레임워크는 16개 애플리케이션 도메인, 500개 이상의 도구를 아우르며 다중 이미지/다중 턴 작업을 지원합니다. 최신 모델들을 평가한 결과, 현재 에이전트들은 시각적 도구 호출 능력과 정밀도 측면에서 여전히 부족함을 보여주었습니다.