Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
torchtune은 LLM의 사후 학습(post-training) 라이프사이클을 간소화하기 위해 설계된 PyTorch 네이티브 라이브러리입니다. 기존 프레임워크와 달리 모듈성, 해킹 가능성, PyTorch 구성 요소에 대한 직접적인 접근을 강조하며, 효율적인 미세 조정과 실험을 지원합니다. Axolotl 및 Unsloth와 비교했을 때 연구 반복을 위한 유연성과 강력한 성능 및 메모리 효율성을 동시에 제공합니다.
컴퓨터 사용 에이전트(CUA)의 높은 지연 시간과 오류 문제를 해결하기 위해 에이전트 적시 컴파일(Agent JIT Compilation) 방식을 제안합니다. 이 방식은 자연어 작업을 실행 가능한 코드로 직접 컴파일하여 LLM 호출을 줄이고, JIT-Planner와 JIT-Scheduler를 통해 실행 속도와 정확도를 획기적으로 향상시킵니다.
Microsoft는 보안 분석가의 수동적인 대응을 보완하기 위해 상시 가동형 적응형 에이전트인 Dynamic Threat Detection Agent(DTDA)를 소개했습니다. DTDA는 통합 타임라인, 프롬프트 계약, 플래너-실행자 조사 루프를 결합하여 숨겨진 위협을 탐지하고 설명 가능한 경고를 생성합니다. 실제 배포 결과, 높은 정밀도와 함께 기존 모델 대비 향상된 탐지 성능을 입증하며 자율 에이전트의 실무 적용 가능성을 보여주었습니다.
본 포지션 페이퍼는 유용한 에이전트 지능을 구현하기 위해 개인용 에이전트 아키텍처가 클라우드에서 엣지(Edge)로 이동해야 한다고 주장합니다. 에이전트가 로컬 컨텍스트와 결합하고 제로 레이턴시를 유지하며 실시간 상호작용을 통해 학습하기 위해서는 물리적 환경과 가까운 엣지 기반의 실행 제어가 필수적임을 강조합니다.
GeoFuse는 날씨 변화로 인해 저하된 드론 이미지의 지리 위치 식별(geo-localization) 문제를 해결하기 위해 개발된 교차 모달 융합 프레임워크입니다. 이 프레임워크는 정밀하게 정렬된 도로 지도 데이터를 위성 이미지와 통합하여, 기상 조건에 강건하고 변별력 높은 구조적 사전 정보를 생성합니다. GeoFuse는 토큰 및 채널 수준의 유연한 특징 결합과 동적 게이팅 메커니즘을 통해 성능을 극대화하며, 다양한 날씨 조건에서 기존 최신 기술 대비 우수한 정확도를 입증했습니다.
본 논문은 목표 지향적 전송을 위해 소스 압축뿐만 아니라 물리 계층 매핑에서도 작업 관련 정보를 보호하는 공동 의미론적-물리 계층 프레임워크를 제안합니다. 이 프레임워크는 벡터 양자화 변분 오토인코더와 의미론적 중요도 지표(SCI)를 활용하여, 중요한 심볼에 더 높은 보호 수준을 부여하고 채널 상태에 따라 전송 서브셋을 동적으로 선택하는 방식을 사용합니다. 그 결과, 제안된 성좌는 표준 M-QAM 대비 월등히 높은 의미론적 품질과 압축률을 달성하며, 작업 중요도에 따른 심볼 취약성을 정량화하여 성능 우수성을 입증했습니다.
본 논문은 EEG 신호의 아티팩트 제거 기술인 ASR(Artifact Subspace Reconstruction)이 임계값 민감성 및 필수 신경 정보 손실 등의 한계를 가짐을 지적합니다. 이를 해결하기 위해, 아티팩트 제거와 다운스트림 디코딩을 공동으로 최적화하는 새로운 End-to-End 학습 가능한 Keras 레이어인 nASR을 제안했습니다. nASR은 PC 분산과 고유값 확산을 정량화하여 선택적인 채널 수준 재구성을 가능하게 하며, 기존 ASR 대비 우수한 분류 성능과 6~8배 단축된 추론 시간을 보여 실시간 BCI에 적합함을 입증합니다.
본 논문은 IRS 지원 mmWave MIMO 시스템에서 효율적인 채널 추정을 위한 Multi-Block Attention (MBA) 프레임워크를 제안한다. 이 방법은 OFDM 기반의 캐스케이드 채널 추정 문제를 다루며, 최소 제곱(LS) 추정기의 최적성을 바탕으로 설계되었다. 제안된 MBA 아키텍처는 공간 상관관계 회복을 위한 Convolutional Attention Network (CAN)와 노이즈 억제를 위한 Complex Multi-Convolutional Network (CMN)를 결합하여 오차 전파를 완화한다. 시뮬레이션 결과, MBA 방식은 파일럿 오버헤드를 최대 87%까지 줄이고, 기존 방법 대비 NMSE를 약 51% 낮게 달성하는 높은 성능을 보였다.
본 연구는 LLM 서빙 환경에서 Speculative Decoding (SD)의 동작을 분석하고 이를 위한 해석 가능한 지연 시간 모델을 개발했습니다. 이 모델은 Little's Law를 활용하여 요청률로부터 유효 배치 크기를 추론하며, 다양한 부하 조건 하에서의 지연 시간을 예측합니다. 연구진은 vLLM을 이용한 광범위한 측정을 통해 이 모델의 정확성을 검증하고, 서버 부하 증가에 따른 속도 향상 감소 원인과 주요 구성 요소(초안 길이, 수락률 등)가 지연 시간에 미치는 영향을 규명했습니다.
본 논문은 의료 영상 기반 질병 스크리닝 모델의 해석 가능성 및 성능 문제를 해결하기 위해 EviScreen이라는 증거 기반 추론 프레임워크를 제안합니다. EviScreen은 과거 사례에서 검색된 영역 수준의 증거(region-level evidence)를 활용하여 회고적 해석 가능성을 제공하며, 이를 통해 현재와 과거 사례의 증거를 모두 고려한 예측을 수행함으로써 스크리닝 성능을 향상시킵니다. 또한, 사후적 살리언시 맵 대신 대조 검색에서 유도된 이상 맵을 사용하여 국소화 해석 가능성까지 강화했습니다.
본 논문은 과학적 머신러닝(SciML)을 파운데이션 모델로 확장할 때 발생하는 '부정적 전이' 문제를 해결하기 위해 Shodh-MoE라는 새로운 아키텍처를 제안합니다. Shodh-MoE는 다중 물리 수송 현상을 위한 희소 활성화 잠재 트랜스포머이며, 물리 정보 기반 오토인코더와 Top-1 소프트-시맨틱 라우터를 결합하여 작동합니다. 이 모델은 개수로 유체 역학과 다공성 매질 흐름 같은 서로 다른 물리 체계를 동시에 학습하면서도 각 메커니즘의 특성을 유지하고 높은 정확도를 달성함을 입증했습니다.
본 연구는 고해상도 임피던스 마노메트리(HRIM) 기록과 환자 정보를 결합하고, 식도 생리학에 그래프 기반 모델링을 통합하는 멀티모달 머신러닝 분류 접근 방식을 제안합니다. HRIM 데이터는 시공간 그래프로 표현되며, 노드는 압력 값, 엣지는 공간적 인접성과 임피던스 역학을 나타냅니다. 이 GNN 기반의 멀티모달 모델은 환자 임베딩과 결합되어 식도 운동 장애를 분류하며, HRIM 특징만 사용하는 기존 모델보다 우수한 성능을 입증했습니다.
MILM은 수치와 텍스트가 혼합된 불규칙한 멀티모달 시계열(MITS) 데이터를 처리하기 위해 LLM을 활용하는 새로운 프레임워크입니다. MITS를 XML 형식의 삼중항으로 변환한 뒤, 샘플링 패턴과 관측값을 단계적으로 학습하는 2단계 미세 조정 전략을 통해 예측 성능을 극대화합니다.
대도시 홍수 예측을 위해 천수 방정식(SWE)을 대체할 수 있는 저차원 잠재 신경 상미분 방정식 기반의 CLDNet을 제안합니다. 이 모델은 좌표 기반 디코더를 사용하여 메모리 효율성을 높이고 불규칙한 지형을 처리하며, 기존 수리 역학 시뮬레이션 대비 약 115배 빠른 속도로 96시간의 예보를 생성합니다.
본 연구는 스마트워치를 활용하여 정신병적 재발을 조기에 탐지하기 위한 두 가지 혁신적인 프레임워크를 개발했습니다. 첫 번째는 심장 역학 예측과 관찰값 간의 편차를 이상 징후로 사용하고, 두 번째는 수면, 움직임, 심장 신호를 통합하는 멀티태스크 학습을 통해 시간 인지 임베딩 및 측정 타이밍을 예측합니다. 최종적으로 이 두 아키텍처에서 도출된 이상 점수를 후기 융합(late-fusion)하여 시너지를 내는 통합 모델을 제안했으며, 실제 데이터셋에서 우수한 성능 향상을 입증했습니다.
본 논문은 기존의 글로벌 대리 모델(global-surrogate) 기반 신경 연산자(neural operator)가 새로운 도메인에 대한 재사용성이 떨어진다는 한계를 지적하며, 이를 극복하기 위한 국소-전역 프레임워크 $\textbf{NEST}$ (Neural-Schwarz Tiling)를 제안합니다. NEST는 전체 해 필드를 학습하는 대신, 작은 이웃 영역(voxel patch)에서의 국소 물리 솔버를 학습하고, 고전적인 도메인 분할 및 Schwarz 결합을 통해 전역 일관성을 확보하여 일반화 능력을 크게 향상시킵니다. 이를 통해 크기와 기하학적 복잡성이 다른 대규모 PDE 문제에 적용 가능한 확장성 높은 학습형 PDE 솔버를 구현했습니다.
MetaColloc는 편미분 방정식(PDEs)을 푸는 과정에서 발생하는 느린 최적화 과정을 제거하는 혁신적인 프레임워크입니다. 이 시스템은 기저 발견 과정을 풀이 단계와 분리하고, 다양한 Gaussian Random Fields 상에서 듀얼-브랜치 신경망을 메타 학습하여 범용 사전(universal dictionary)의 신경망 기저 함수를 생성합니다. 테스트 시점에는 네트워크를 동결한 후 콜로케이션 행렬과 선형 최소제곱법을 사용하여 PDE 해를 찾으며, 이는 높은 정확도와 계산 효율성을 동시에 달성합니다.
Pion은 직교 동등 변환(Orthogonal Equivalence Transformation)에 기반한 스펙트럼 보존 옵티마이저로, LLM 학습의 효율성을 높이기 위해 설계되었습니다. 기존 가산적 옵티마이저와 달리, Pion은 좌우 직교 변환을 통해 각 가중치 행렬의 특이값과 스펙트럼 노름을 유지하면서 최적화를 수행합니다. 이 메커니즘은 LLM 사전 학습 및 미세 조정 과정에서 안정적이고 경쟁력 있는 성능을 보여줍니다.
본 논문은 Whisper 인코더 임베딩과 해석 가능한 음향 특징(eGeMAPS) 및 목소리 스트레스/비유창성 보조 확률을 결합한 준지도 하이브리드 프레임워크를 제안합니다. 이 프레임워크는 레이블링되지 않은 데이터에서 불확실성을 인식하며 가짜 레이블을 생성하고 고품질 샘플만 학습에 활용하는 전략을 도입하여, 희귀 정답 데이터 의존도를 낮춥니다. 실험 결과, 본 접근 방식은 WavLM, HuBERT 등 기존 자기 지도 학습 모델들을 능가하는 성능(Macro-F1 0.751)을 달성했습니다.
본 논문은 여러 개의 실현체를 가질 수 있는 높은 실현 개수를 갖는 최소 강성 그래프를 찾는 문제를 다룹니다. 기존의 전수 탐색 방식은 후보 그래프가 초지수적으로 증가하고 평가 비용이 높아 비실용적입니다. 이에 저자들은 헤네베르그 이동을 통해 최소 강성 그래프를 구성하는 강화학습(RL) 접근 방식을 제안하며, Graph Isomorphism Network와 Deep Cross-Entropy Method를 사용하여 실현 개수 불변량을 최적화함으로써 새로운 기록 경계의 그래프를 성공적으로 도출했습니다.