Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이 기술 기사는 대규모 언어 모델(LLM)의 사후 학습 양자화(Post-Training Quantization, PTQ)를 위한 하드웨어 인지적 방법론인 Scaled Outer Product (SOP)을 소개합니다. SOP는 레이어별 LUT 디코딩이 가능한 하드웨어에서 가중치당 4.5~6비트 수준의 손실 없는 충실도를 제공하도록 설계되었습니다. 이 방법론은 코드북 탐색, 블록별 부호화 스케일링, 활성화 가중 코사인 선택 등을 결합하며, 새로운 하드웨어 효율적 LUT 출력 형식(HIF)을 통해 성능과 에너지 효율성을 개선합니다.
Slot-MPC는 객체 중심 표현을 활용하여 목표 조건부 모델 예측 제어(Goal-Conditioned Model Predictive Control, MPC)를 가능하게 하는 새로운 프레임워크입니다. 이 방법은 슬롯 기반 표현을 학습하여 개별 객체를 인코딩하고, 이를 통해 행동 조건부 객체 중심 역학 모델을 구축합니다. Slot-MPC는 MPC를 사용하여 에이전트가 이전에 경험하지 못한 상황에서도 일반화된 행동 계획을 수행할 수 있게 하며, 특히 그래디언트 기반 MPC를 활용하여 계산 효율성을 높였습니다.
본 논문은 중환자실(ICU) 패혈증 관리를 위해 임상 월드 모델로 증강된 LLM 에이전트인 SepsisAgent를 제안합니다. SepsisAgent는 후보 치료 중재에 따른 환자 반응을 시뮬레이션하는 '제안-시뮬레이션-정제' 워크플로우를 따릅니다. 이 에이전트는 3단계의 커리큘럼 학습(지도 미세 조정, 행동 복제, 강화학습)을 거쳐 MIMIC-IV 데이터셋에서 기존 방법론 대비 우수한 성능과 안전성을 입증했습니다.
IntentVLA은 로봇 모방 데이터의 부분 관측성 문제를 해결하기 위해 개발된 이력 조건부 VLA 프레임워크입니다. 이는 최근 시각적 관측을 압축된 단기 지향 의도 표현으로 인코딩하여 액션 청크 생성에 활용합니다. 또한, IntentVLA는 단기 관측 모호성을 평가하는 새로운 벤치마크인 AliasBench를 도입하여 그 성능과 안정성을 입증했습니다.
본 논문은 일반화된 GUI Agent 학습에 필요한 대규모 상호작용 궤적 데이터 부족 문제를 해결하기 위해, 레이블링되지 않은 인터넷 비디오에서 근거 기반(Grounded) GUI 상호작용 궤적을 자동으로 추출하는 Video2GUI 프레임워크를 제안합니다. 이 프레임워크를 활용하여 1,500개 이상의 애플리케이션과 웹사이트를 포괄하는 대규모 데이터셋 WildGUI를 구축했습니다. WildGUI로 Qwen2.5-VL 및 Mimo-VL 같은 모델을 사전 학습시킨 결과, 여러 GUI 관련 벤치마크에서 최첨단 성능에 근접하거나 능가하는 성능 향상을 입증했습니다.
본 연구는 알츠하이머병(AD) 진단을 위한 새로운 경량 고성능 모델인 DeepTokenEEG를 제안합니다. 이 모델은 공간 및 시간 토크나이저를 활용하여 EEG 신호에서 AD 관련 바이오마커를 효과적으로 포착하며, 적은 파라미터 수(0.29백만 개)로도 높은 정확도를 달성했습니다. 결합 데이터셋에서 DeepTokenEEG는 특정 주파수 대역에서 최대 100%의 기록된 정확도를 보여, 기존 최신 기술 대비 성능 향상을 입증하며 AD 조기 탐지 및 선별에 큰 잠재력을 가집니다.
SpeakerLLM은 오디오 우선 에이전트 환경에서 필수적인 화자 특화 이해를 통합하기 위해 설계된 새로운 audio-LLM 프레임워크입니다. 이 모델은 누가 말하고 있는지, 목소리가 어떻게 들리는지, 녹음 조건의 영향을 포착하는 것을 목표로 합니다. 기존 시스템들이 제공하지 못했던 언어적 근거와 구조화된 추론 과정을 통합하여, 단일 발화 화자 프로파일링, 녹음 조건 이해, 그리고 증거 기반 검증 추론을 수행할 수 있습니다. SpeakerLLM은 계층적 화자 토크나이저를 사용하여 다양한 세밀도의 화자 정보를 포착하며, 구조화된 추적을 통해 최종 결정의 근거를 명확히 제시합니다.
본 기사는 Microsoft BitLocker와 같은 디스크 암호화 솔루션의 근본적인 보안 취약점과, 이들이 하드웨어 및 운영체제 수준에서 가지는 구조적 한계를 분석합니다. 특히, TPM 기반 자동 잠금 해제 방식이 가진 인증 우회 가능성이나 SMM 모듈 패치 등을 통해 물리적으로 접근한 공격자에게 데이터가 노출될 수 있음을 지적하며, BitLocker의 보안 신뢰성에 의문을 제기합니다. 결론적으로, 하드웨어 자체가 안전하지 않다면 디스크 암호화는 근본적인 한계를 가지며, 이러한 취약점들은 기업과 개인 모두에게 중요한 경고를 던집니다.
Code with Claude 프로젝트에서 사용자들에게 소형 컴퓨터(cardputer)를 제공하고, 이를 활용하여 다양한 창작 결과물들을 선보였습니다. 소개된 작품들은 라이트/다크 모드 전환 기능의 'Magic Wand', 철자 맞추기 게임인 'Hazy Daisy', 동작 제어 미로 게임 'Tilt', 음악 연주 프로그램 'Synthesizer' 등입니다. 또한, 선택에 따라 운명이 결정되는 생존 시뮬레이션 게임 'Oregon Trail'도 제작되었습니다.
Supertonic 3는 31개 언어를 지원하는 초경량 온디바이스 TTS(Text-to-Speech) 솔루션을 출시했습니다. 이 버전은 <laugh>, <breath> 등 10종의 감정 태그를 텍스트에 삽입하여 다양한 감정 표현이 가능하며, 발음 정확도와 음성 복제 성능을 개선했습니다. 모델 크기가 99M Parameters로 매우 작아 온디바이스 환경에서 프라이버시가 보장되고 네트워크 지연 없이 배포할 수 있다는 장점이 있습니다.
본 논문은 LLM 추론 속도를 높이는 Speculative Decoding 기법을 개선하기 위해, 초안 모델(draft model)의 정책 최적화 방식을 제안합니다. 기존 방법들이 토큰 레벨 지도 학습에 의존했던 한계를 극복하고, 윈도우 레벨에서 성능 중심의 최적화를 수행하는 강화 학습 프레임워크인 PPOW를 제시했습니다. PPOW는 적응형 윈도잉과 다양한 보상 함수를 결합하여 추측적 디코딩 효율성을 크게 향상시켰습니다.
본 기사는 대규모 언어 모델(LLMs)에서 발생하는 '조기 결론(Premature closure)' 문제를 다루며, 이를 불확실성 하에서의 부적절한 확신으로 정의합니다. 연구진은 구조화 및 개방형 의료 작업에 다섯 가지 Frontier LLM을 평가한 결과, 높은 비율로 답변을 제공하는 경향을 발견했습니다. 특히 정답 선택지가 제거된 MedQA와 AfriMed-QA 같은 상황에서 모델들은 여전히 높은 오작동률을 보였으며, 이는 안전 지향적 프롬프팅만으로는 해결되지 않는 근본적인 문제임을 시사합니다.
본 연구는 딥러닝 모델의 효율성을 높이기 위해 동적 배치 민감도를 활용한 새로운 옵티마이저인 Dynamic Batch-Sensitive Adam (DBS-Adam)을 제안합니다. DBS-Adam은 그래디언트 노름과 배치 손실의 지수 이동 평균에서 도출된 '배치 난이도 점수'를 사용하여 학습률을 동적으로 조절하며, 어려운 배치에는 더 많은 업데이트를, 쉬운 배치에는 적은 업데이트를 적용하여 학습 안정성과 수렴 속도를 향상시킵니다. 이 옵티마이저는 차량 사고 부상 심각도 예측 태스크에 Bi-LSTM과 결합되어 기존 최신 옵티마이저들 대비 통계적으로 유의미한 성능 개선을 입증했습니다.
도쿄대학의 과학자들이 열을 발생시키지 않고 작동하면서 컴퓨터 처리 속도를 1000배 증가시키는 혁신적인 장치를 개발했습니다. 이 기술은 기존 대비 월등히 빠른 데이터 처리를 가능하게 하여, 이전에는 1시간이 걸리던 작업도 단 1초 만에 완료할 수 있게 합니다.
본 논문은 하드웨어 회로 자동 구축의 어려운 과제인 Reactive synthesis에 대한 새로운 접근 방식을 제시합니다. 알고리즘적으로는 대규모 추론 모델을 모델 체커와 결합한 신경-심볼릭(neuro-symbolic) 방법을 통해 Verilog 구현을 반복 수정하며, 결정 불가능한 매개변수화된 시스템까지 확장 가능함을 보여줍니다. 또한, 명세 작성의 어려움을 해결하기 위해 자연어 명세를 형식화하는 자동 형식화(autoformalization) 단계를 도입하여, 이를 엔드 투 엔드 워크플로우로 완성했습니다.
ML-Embed는 3차원 마트료시카 학습(3D-ML) 기반의 새로운 프레임워크로, 고품질 텍스트 임베딩이 직면한 계산 비용, 언어적 편향성, 투명성 부족 등의 문제를 해결하기 위해 개발되었습니다. 이 모델은 대규모 다국어 데이터셋을 사용하여 140M에서 8B 매개변수까지의 포괄적인 모델 세트를 제공하며, 모든 구성 요소를 공개하여 재현 가능한 AI 시스템 구축에 기여합니다.
Vision-Language-Action (VLA) 모델은 복잡하고 장기적인 환경에서 오류가 누적되기 쉬워 숙련된 조작에 어려움을 겪습니다. 대화형 모방 학습(IIL)을 통해 인간의 개입 데이터를 활용하여 정책 개선이 가능하지만, 고자유도 로봇 손에 적용할 경우 개입 시점의 원격 조작과 정책 실행 간 명령 불일치 문제가 발생합니다.
본 기술은 AI Agent가 스크린샷 픽셀 추측 대신 시스템의 접근성 트리(Accessibility Tree)를 활용하여 운영체제와 상호작용할 수 있는 계층을 제공합니다. 이를 통해 에이전트는 버튼의 역할, 상태 및 정확한 계층 구조 정보를 얻어 더욱 신뢰성 높은 작업을 수행할 수 있습니다.
SpaceX와 Anthropic이 대규모 컴퓨팅 인프라 계약을 체결하며 AI 경쟁의 패러다임 변화를 보여주었습니다. 이 파트너십 덕분에 Anthropic은 Claude Code 및 Claude API의 사용 제한(usage limits)을 크게 늘릴 수 있게 되었으며, 이는 단순한 기능 업데이트를 넘어선 핵심적인 인프라 확보입니다. 이 사건은 AI 경쟁이 더 이상 최고의 모델 성능만으로 결정되는 것이 아니라, 대규모 사용자에게 안정적으로 서비스를 제공할 충분한 GPU 접근성, 전력 용량 및 데이터 센터 컴퓨팅 자원 확보 능력에 달려 있음을 시사합니다.
Hugging Face(HF)는 지원자들이 실제 과제를 통해 역량을 검증받도록 '테이크홈' 과제를 진행했습니다. 이 과제는 논문 방법론 선택부터 HF Jobs를 사용한 실험 실행, 정확도 개선 및 결과 보고까지 엔드투엔드 과정을 포함합니다. 특히 AI 도구의 활용 여부를 공개하도록 요구하여 지원자의 투명성을 높였습니다.