Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 비만성 폐암(NSCLC)의 주요 아형인 선종암과 편평상피세포암의 정확한 병리학적 분류를 위해 '가상 스캐닝' 기법을 제안합니다. 이 방법은 기존 CT 스캔 데이터에 3D Pix2Pix GAN을 사용하여 합성된 pseudo-PET 볼륨(합성 PET)을 추가하여, 부족한 대사 정보를 보완하는 것을 목표로 합니다. 실험 결과, 이러한 다중 모달 접근 방식은 분류 성능 지표(AUC 및 GMean)를 통계적으로 유의미하게 개선하며, 물리적 PET 스캔이 불가능한 임상 환경에서 강력한 특징 강화 전략이 될 수 있음을 입증했습니다.
본 기술 기사는 LLM이 생성하는 작업 계획에 사용자가 효과적으로 개입하고 의도를 표현할 수 있도록 돕는 새로운 시스템 U-Define를 소개합니다. 기존 연구의 한계점인 하드 제약 조건의 경직성과 복잡한 가중치 문제를 해결하기 위해, U-Define는 제약을 '하드(Hard)'와 '소프트(Soft)'라는 두 가지 고수준 유형으로 추상화했습니다. 이 시스템은 사용자가 자연어로 제약을 정의하고, 이를 형식 모델 확인(하드) 또는 LLM 기반 평가(소프트)를 통해 검증함으로써, 사용자 경험을 유지하면서도 계획의 신뢰성과 유연성을 동시에 확보할 수 있게 합니다.
본 연구는 이미지 초해상도(Image Super Resolution)를 위해 계산 비용이 높은 기존 확산 모델의 한계를 극복하는 TOC-SR 프레임워크를 제안합니다. 이 방법은 16 채널 잠재 확산 모델에서 시작하여, 특징 기반 생성 증류와 베이지안 최적화를 결합해 파라미터 효율적인 컴팩트한 확산 백본을 발견했습니다. 그 결과, 기존 모델 대비 현저히 감소된 복잡성을 가지면서도 강력한 초해상도 성능을 유지하는 단일 단계 생성기를 성공적으로 구축했음을 입증했습니다.
자동 음성 인식(ASR) 시스템은 구음 장애와 같은 비정상적 음성에 여전히 취약하며, 기존 오디오-언어 모델들이 임상 컨텍스트를 효과적으로 활용하지 못한다는 한계를 발견했습니다. 연구진은 Speech Accessibility Project (SAP) 데이터셋을 기반으로 진단 라벨 및 상세한 임상 설명을 활용하는 벤치마크를 구축하고, 다양한 모델에 대한 비교 테스트를 수행했습니다. 그 결과, 단순 프롬프트 추가만으로는 성능 개선이 미미하거나 오히려 오류율을 높이는 경우가 많았으며, 컨텍스트 의존적 파인튜닝(fine-tuning) 방식을 통해 WER을 52% 감소시키는 성과를 거두었습니다.
본 논문은 대규모 사전 학습 모델을 다양한 작업에 적응시키는 과정에서 발생하는, '압축 후 적응'이라는 순차적 접근법의 한계를 극복하는 새로운 프레임워크 JACTUS를 제안합니다. JACTUS는 압축(Compression)과 적응(Adaptation) 과정을 단일 통합 프레임워크로 결합하여, 작업 인식 서브스페이스(Task-aware Subspaces) 내에서 투영 저랭크 근사 및 전역 랭크 할당을 수행합니다. 이를 통해 기존의 분리된 방식보다 더 높은 성능과 효율성을 달성하며, 특히 Vision 및 Language 영역에서 강력한 결과를 입증했습니다.
본 논문은 LLM 추론 속도를 가속화하는 Speculative Decoding의 핵심 하이퍼파라미터인 speculation length($γ$)를 고정값 대신 동적으로 최적화하는 적응형 컨트롤러 $\text{SpecKV}$를 제안합니다. $\text{SpecKV}$는 드래프트 모델에서 추출한 신호(엔트로피, 신뢰도 등)를 활용하여 각 추측 단계마다 최적의 토큰 수를 결정하며, 이를 통해 고정된 Speculative Decoding 방식 대비 56.0%의 성능 향상을 달성했습니다.
본 논문은 체적 깊이의 3D OCT와 평면 컨텍스트의 2D en face OCT를 효과적으로 결합하도록 설계된 안과 다중 모달리티 기반 모델인 OphMAE를 제안합니다. OphMAE는 새로운 교차 모달리티 융합 구조와 적응적 추론 메커니즘을 통해 대규모 데이터셋에서 사전 학습되었으며, 다양한 진단 과제에서 기존 모델들을 능가하는 최상의 성능을 입증했습니다. 특히 단일 모달리티 입력에서도 높은 정확도를 유지하며 뛰어난 데이터 효율성을 보여주어 임상 환경에서의 실용적 적용 가능성을 높였습니다.
본 논문은 시각 언어 모델(VLM)의 시각 모달리티를 활용하여 기존의 안전 정렬(Safety Alignment)을 우회하는 네 가지 새로운 '제일브레이킹 공격' 기법을 제시합니다. 이 공격들은 해로운 지시를 시각적 기호로 인코딩하거나, 위험한 물체를 무해한 대체품으로 교체하고, 이미지 내 텍스트를 수정하는 등 다양한 방식으로 이루어집니다. 실험 결과, 이러한 시각 기반 공격은 텍스트 기반 안전 훈련만으로는 포착하기 어려운 취약점을 드러냈으며, VLM의 견고한 정렬을 위해서는 시각적 측면을 필수적으로 고려해야 함을 강조합니다.
본 기술 기사는 사용자의 일상적인 컴퓨터 사용 패턴으로부터 그들의 근본적인 삶의 목표를 추론하는 새로운 '스트라이빙 공동 창작(striving co-creation)' 과정을 소개합니다. 이 시스템은 활동 이론과 개인적 스트라이빙 프레임워크에 기반하여, 단순한 행동 관찰을 넘어 사용자 활동의 계층적 구조와 그 목적까지 파악하려고 시도합니다. 특히, 사용자가 시스템이 자신을 이해하는 방식에 개입하고 수정할 수 있는 편집 인터페이스를 제공함으로써, 주도권을 부여하고 더 정확하며 개인화된 목표 추론을 가능하게 합니다.
본 논문은 세계 모델(World Models) 연구가 시각적 합성, 3D 재구성, 잠재 표현 등 여러 부분으로 분산되어 있어 물리적으로 신뢰할 수 있는 예측에 한계가 있음을 지적하며, 이를 해결하기 위해 해밀토니안 세계 모델(Hamiltonian World Models)을 제안합니다. 이 모델은 관찰을 구조화된 잠재 위상 공간에 인코딩하고, 제어, 감쇠, 잔류항이 포함된 해밀토니안 역학을 통해 상태를 진화시키며 예측 궤적을 생성하여 계획에 활용하는 물리 기반 접근 방식입니다. 이러한 해밀토니안 구조는 모델의 해석 가능성, 데이터 효율성, 그리고 장기적인 안정성을 크게 개선할 수 있습니다.
본 기술 기사는 대형 언어 모델(LLMs)의 메모리 및 컴퓨팅 요구사항 문제를 해결하기 위해 BWLA (Binarized Weights and Low-bit Activations)라는 새로운 양자화 프레임워크를 제안합니다. BWLA는 가중치를 1비트로 압축하는 동시에 활성화에 저비트 정밀도(예: 6비트)를 적용하여, 기존 방법들이 해결하지 못했던 활성화의 무거운 꼬리 문제를 극복하고 높은 정확도를 유지합니다. 이 프레임워크는 Qwen3-32B 모델에서 뛰어난 성능을 보여주었으며, 추론 속도 향상과 다양한 NLP 작업에서의 개선을 입증하며 LLM 경량화에 큰 잠재력을 제시합니다.
본 논문은 장기 지평 로봇 조작을 위해 명시적인 중간 표현인 '교차 시각-언어 추론 흔적(Interleaved Vision-Language Reasoning Trace)'을 활용하는 IVLR 프레임워크를 제안합니다. 이 프레임워크는 초기 관측과 지시사항에서 전역적인 의미-기하학적 단서를 생성하고, 이를 행동 디코더에 조건부로 제공하여 로봇의 계획 일관성을 높입니다. 시뮬레이션 벤치마크(LIBERO 등)에서 높은 성공률을 달성했으며, 특히 두 모달리티가 결합된 전역적인 흔적이 가장 효과적임을 입증했습니다.
본 논문은 AI 접근법을 활용하여 전통적인 CFD 시뮬레이션을 가속화하는 방법을 다루며, 특히 IPU-POD16 플랫폼에 최적화된 솔루션을 제시합니다. 연구진은 Poplar SDK와 커스텀 TensorFlow를 사용하여 CFD 응용 프로그램을 훈련시키고, 'popdist' 라이브러리를 통해 데이터 공급 병목 현상을 해결하여 최대 34%의 속도 향상을 달성했습니다. 또한, IPU 간 통신을 활용한 데이터 병렬성을 통해 처리량을 크게 개선할 수 있음을 입증했습니다.
본 연구는 부분 자동화 운전 시스템 환경에서 '의미 있는 인간 제어(MHC)'를 경험하는 정도를 평가하기 위한 새로운 방법을 제시했습니다. 24명의 운전자들을 대상으로 촉각 공유 제어 및 거래된 제어 모드 하에 시뮬레이터 실험을 진행하고, 행동 데이터와 주관적 설문조사를 결합하여 분석했습니다. 연구 결과, 자동화 차량의 이해도와 조향 토크 충돌 간의 음의 상관관계가 확인되었으며, 운전자 의도와 일치하는 미묘한 촉각 안내가 MHC를 높이는 긍정적인 효과를 가짐을 발견했습니다. 따라서 미래 시스템 설계는 무리 없는 개입과 자동화 의도의 투명한 전달에 중점을 두어야 합니다.
본 논문은 우주 데이터 센터에서 대규모 언어 모델(LLMs)을 효율적으로 분산 배포하는 'Space Network of Experts (Space-XNet)' 프레임워크를 제안합니다. 이 프레임워크는 MoE(Mixture-of-Experts) 모델의 특성을 활용하여, LLM의 구성 요소들을 여러 위성 네트워크에 최적화된 방식으로 배치하고 매핑하는 두 단계의 전략을 제시합니다. 실험 결과, Space-XNet은 기존 방식 대비 최소 3배의 지연 시간 감소 효과를 입증하며 우주 기반 AI 컴퓨팅의 실현 가능성을 높입니다.
본 논문은 기존 GPU 스케줄러가 LLM 에이전트의 연쇄 호출(워크플로우)을 독립적으로 취급하여 발생하는 심각한 지연 시간 증가 문제를 해결하기 위해 'SAGA'라는 새로운 분산 스케줄러를 제안합니다. SAGA는 개별 추론 호출 대신 전체 에이전트 워크플로우 자체를 스케줄링 단위로 간주하는 프로그램 수준의 접근 방식을 채택했습니다. 이를 통해 KV 캐시 재사용을 최적화하고, 세션 친화적인 배치 및 공정한 자원 할당 메커니즘을 구현하여, 기존 시스템 대비 작업 완료 시간을 크게 단축시키고 GPU 메모리 활용도를 개선함을 입증했습니다.
본 기사는 소비자 하드웨어에서 대규모 언어 모델(LLM)을 추론하는 현황과 관련된 기술적 과제들을 분석합니다. Nvidia와 Apple Silicon 생태계를 비교하며, LLM 배포를 위한 아키텍처별 트레이드오프를 제시합니다. 핵심적으로, Nvidia는 높은 처리량을 제공하지만 복잡한 런타임 제약 조건(지연 시간 vs. 생성 속도)과 VRAM 한계에 직면하는 반면, Apple은 통합 메모리 구조(UMA) 덕분에 대규모 모델을 효율적으로 확장하고 전력 효율성에서 우위를 점합니다.
A11y-Compressor는 GUI와 상호작용하는 AI 에이전트가 신뢰할 수 있는 관측 표현을 얻도록 돕는 프레임워크입니다. 기존의 접근성 트리는 중복성이 높고 공간적 구조 정보가 부족하다는 단점이 있습니다. 이 프레임워크는 시각적 컨텍스트 재구성 및 중복 감소를 통해 선형화된 접근성 트리를 컴팩트하고 구조화된 표현으로 변환하며, 이를 통해 OSWorld 벤치마크에서 토큰을 크게 줄이고 에이전트의 작업 성공률을 개선하는 성능을 입증했습니다.
본 논문은 자연어 지시사항을 시각적 좌표로 매핑하는 GUI 그라운딩 문제를 해결하기 위해 오패olicy 자기 증류(OPSD) 프레임워크를 제안합니다. 특히, GUI-SD라는 새로운 방법을 통해 목표 경계 박스와 가우시안 소프트 마스크를 활용하여 풍부한 우선 맥락을 생성하고, 엔트로피 기반 증류로 토큰에 적응적으로 가중치를 부여하는 것이 특징입니다. 광범위한 실험 결과, GUI-SD는 기존의 GRPO 기반 방법보다 정확도와 학습 효율성 모두에서 우수한 성능을 입증했습니다.
AdaMeZO는 대규모 언어 모델(LLM)의 파인튜닝 과정에서 발생하는 높은 GPU 메모리 요구 문제를 해결하기 위해 제안된 새로운 옵티마이저입니다. 기존의 Adam과 같은 표준 옵티마이저는 모멘트 추정을 위해 많은 메모리를 필요로 하며, MeZO와 같은 효율적인 방법은 손실 지형 탐색 능력이 부족하다는 단점이 있었습니다. AdaMeZO는 메모리에 모멘트를 유지하지 않으면서도 Adam 스타일의 1차 및 2차 모멘트 추정 기능을 활용하여, 높은 성능과 낮은 메모리 요구량을 동시에 달성하는 것을 목표로 합니다.