Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기사는 Hugging Face Inference Endpoints를 활용하여 Whisper 모델의 전사(transcription) 속도를 극대화하는 방법을 설명합니다. vLLM 프로젝트와 PyTorch 컴파일레이션, CUDA graphs, float8 KV cache 양자화 등 최신 AI 최적화 기술들을 결합하여, NVIDIA GPU 환경에서 기존 대비 획기적으로 빠른 추론 성능을 달성했습니다. 이를 통해 사용자는 복잡한 ASR 파이프라인을 간편하게 배포하고, 높은 전사 품질과 실시간 효율성을 갖춘 서비스를 구축할 수 있습니다.
Nvidia는 AI 데이터 센터용 광섬유 공급망을 확보하고 미국 내 생산 능력을 통제하기 위해 Corning에 3억 달러를 투자했습니다. 이 투자는 North Carolina와 Texas 등지에 새로운 제조 시설 3개를 건설하는 것을 포함하며, 이를 통해 Corning의 미국 내 광섬유 연결 제조 출력은 10배 증가하고 국내 생산 능력은 50% 이상 확대될 것으로 예상됩니다. AI 워크로드의 폭발적인 성장은 대규모 데이터 전송을 요구하며, 이는 광학 네트워크에 대한 막대한 수요를 창출합니다. Nvidia는 이 투자를 통해 AI 인프라 구축의 핵심 병목 현상인 광섬유 공급망을 장악하고 미국 내 지배력을 강화할 계획입니다.
본 기사는 전통적인 '인간 중심의 계층형 조직' 구조가 더 이상 유효하지 않으며, AI 기술이 전제하는 새로운 형태의 '플랫형 조직'으로 근본적으로 전환되고 있음을 주장합니다. 이 변화는 관리직(매니지먼트), 중간 보고 조정 레이어, 그리고 지나치게 분업된 전문직 등의 기존 구조적 역할을 불필요하게 만들고 있습니다.
본 연구는 대규모 언어 모델(LLMs)을 활용하여 신경망 구조를 생성하는 기존 방식의 높은 계산 비용과 긴 코드 길이 문제를 해결하기 위해 '델타 코드 생성' 방식을 제안합니다. 이 방법은 전체 모델 코드를 처음부터 생성하는 대신, 기본 아키텍처에 대한 컴팩트한 통합 디프스(deltas)만을 생성하여 효율성을 극대화합니다. 연구진은 다양한 데이터셋과 여러 LLM을 사용하여 평가했으며, DeepSeek-Coder, Qwen2.5-Coder, Mistral 등 모든 모델이 기존의 전체 생성 기준선 및 동시 접근법보다 월등히 높은 성능(예: CIFAR-10 1 에포크 정확도)을 달성했음을 입증했습니다.
본 논문은 대규모 언어 모델(LLMs)이 다른 에이전트의 상호작용에 의해 결과가 결정되는 멀티 에이전트 게임 환경에서 전략적 추론 능력을 강화하는 새로운 RL 기반 프레임워크인 Strat-Reasoner를 제안합니다. 이 프레임워크는 에이전트의 추론 과정이 다른 에이전트의 추론 과정을 통합하는 반복적인 추론 패러다임을 도입했습니다. 또한, 중앙 집중식 CoT 비교 모듈을 사용하여 중간 추론 단계에 효과적인 보상 신호를 제공하고, 그룹 상대적 RL 접근법을 통해 LLM 정책 최적화를 수행하여 다양한 멀티 에이전트 게임에서 평균 22.1%의 성능 향상을 입증했습니다.
DART(Damage Assessment via Rope Transformer)는 합성 섬유 로프(SFRs)의 상태 모니터링(CM)을 위한 비전-언어 기반 통합 모델입니다. 이 모델은 Vision Transformer와 Llama-3.2를 결합하고, Joint-Embedding Predictive Architecture (JEPA)를 크로스 모달 도메인으로 확장하여 다중 작업 아키텍처를 구현했습니다. DART는 손상 분류, 연속적 심각도 회귀, 그리고 few-shot 인식 등 다양한 로프 검사 작업을 단일 백본에서 수행할 수 있어, 기존의 분류기 기반 시스템을 뛰어넘는 일반적인 CM 솔루션을 제공합니다.
본 논문은 공통 목표를 공유하지만 상호작용 범위가 제한적인 협업 로봇 군집을 위한 다중 에이전트 강화학습(MARL) 문제를 다룹니다. 기존의 접근 방식은 모든 가능한 조합적 상태를 표현해야 하므로 메모리 한계에 직면합니다. 이에 본 논문은 상태 공간 상호작용을 효율적으로 표현하기 위해 모듈형(분해된) 표현 방식을 제안하며, 각 특징을 독립적으로 학습하고 결과를 집계하여 이 문제를 해결하는 방법을 제시했습니다.
본 기사는 심층 신경망의 가중치 행렬이 가지는 '기하학적 연속성' 현상의 원인을 탐구합니다. 연구 결과, 이 연속성은 잔여 연결(residual connections)을 통한 층 간 기울기 일관성과 대칭성을 파괴하는 비선형성(symmetry-breaking nonlinearities)의 조합에 의해 발생함을 밝혀냈습니다. 특히, 활성화 함수와 정규화가 각각 주된 특이값 방향과 여러 방향으로 연속성을 집중시키거나 분산시키는 등 서로 다른 역할을 수행하며, 트랜스포머 구조에서 각 투영 메커니즘(Q, K, Gate, Up vs O, Down)의 역할 차이를 분석했습니다.
본 기술 기사는 MoE(Mixture-of-Experts) 모델을 HPC 환경에서 효율적으로 훈련시키는 데 발생하는 메모리, 통신, 작업 불균형 등의 문제를 다룹니다. 이를 해결하기 위해 'Piper'라는 프레임워크를 제안합니다. Piper는 리소스 모델링을 활용하여 목표 플랫폼에 최적화된 훈련 전략을 식별하고, 파이프라인 병렬화를 적용함으로써 기존 대비 월등히 높은 MFU(Model Flops Utilization)와 대역폭 향상을 달성하는 것을 목표로 합니다.
Driver-WM은 자율주행 시스템의 안전성을 높이기 위해 외부 교통 상황에 조건화된 차내 역동성 예측 잠재 세계 모델입니다. 기존 주행 세계 모델이 외부 환경 예측에 치중했던 것과 달리, Driver-WM은 물리적 운동학 예측과 드라이버의 행동 및 감정적 의미 인식을 통합하여 차량 내부의 복잡한 동역학을 다단계로 롤아웃할 수 있습니다. 이 모델은 듀얼 스트림 아키텍처와 게이트 인가 메커니즘을 통해 외부 컨텍스트를 내부 상태에 조건적으로 주입하며, 반응성이 높은 상황에서도 장기적이고 의미론적으로 정렬된 예측 성능을 보여줍니다.
본 논문은 LLM이 끊임없이 변화하는 환경에 적응하기 위해, 생물학적 기억 시스템의 원리를 모방한 지속적인 지식 업데이트 메커니즘을 제안한다. 기존 외부 메모리 시스템들이 명시적으로 관리되는 것과 달리, 이 접근 방식은 다중 시간 척도 역학(multi-timescale dynamics)을 활용하여 새로운 연관성을 즉각 사용 가능하게 하고, 반복된 정보를 강화하며, 불필요한 정보는 선택적으로 망각하는 방식으로 작동한다. 이를 통해 외부 기억을 자체적인 재구성 학습 기질로 재정의할 수 있다.
본 논문은 임상 환경에서 흔히 발생하는 데이터의 불완전성(MNAR 누락)과 시간적 혼란을 동시에 다루어 치료 효과를 추정하는 2단계 파이프라인을 제안합니다. 첫 번째 단계인 CausalFlow-T는 DAG 제약 기반의 정규화 플로우로, 명시적인 인과 구조를 활용하여 정확한 반허상(counterfactual) 추론을 수행합니다. 두 번째 단계에서는 LLM 기반 진화적 임푸터가 MNAR 누락된 바이오마커와 인과 지표를 효과적으로 복원하며, 이 파이프라인은 실제 EHR 데이터에서 높은 회복력과 정확도를 입증했습니다.
LineRides는 사용자 제공 공간 가이드라인과 희소 키 방향(key-orientations)만을 사용하여 자전거 로봇의 다양한 스텝 동작을 학습하는 새로운 라인 가이드 강화 학습 프레임워크입니다. 기존 방법들이 데모나 명시적 타이밍에 의존하는 한계를 극복하며, 물리적으로 불가능한 경로도 추적 마진을 통해 처리할 수 있습니다. Ultra Mobility Vehicle(UMV) 테스트에서 LineRides는 정상 주행과 MiniHop, LargeHop 등 5가지 스텝 동작 간의 원활하고 명령 기반 전환 능력을 입증했습니다.
본 연구는 인간 시각 시스템에 최적화된 실용적인 학습된 이미지 압축 코덱을 설계하는 데 중점을 둡니다. 기존 전통 코덱 대비 감각적 품질과 실제 실행 시간(runtime)을 동시에 고려하여 모델링 선택 및 아블레이션 기법을 종합적으로 연구했습니다. 그 결과, 신경망 구조 검색(NAS)을 통해 최적화된 새로운 코덱을 개발했으며, 이 코덱은 AV1, VVC 등 기존 표준 대비 2.3-3배의 비트레이트 절감 효과를 보여주면서도, 모바일 기기에서 매우 빠른 인코딩/디코딩 속도를 달성했습니다.
본 기술 기사는 SemEval-2026 Task 9: 다국어 극단성 감지 시스템을 소개하며, 22개 언어를 대상으로 하는 이진 분류 작업을 수행합니다. 핵심 접근 방식은 대형 언어 모델(LLM)의 합성 데이터 증강과 LoRA를 활용한 각 언어별 Gemma-3 모델 미세 조정입니다. 개발 집합에서 얻은 지식을 재학습 없이도 전이 학습 및 앙상블 기법을 통해 테스트 환경에 성공적으로 적용하여, 모든 22개 언어에서 평균 매크로-F1 점수 0.811을 달성하며 높은 성능을 입증했습니다.
LLM 에이전트의 발전은 하르네스(harness)와 기반 모델의 빠른 공진화에 힘입어 놀라운 속도로 진행되고 있습니다. 이번 연구에서 소개된 업데이트된 다중 에이전트 시스템인 'Design Conductor 2.0'은 이전보다 훨씬 큰 작업을 처리하며, 완전히 자율적으로 작동할 수 있는 높은 품질을 보여줍니다. 이 시스템은 LLM 추론 가속기(VerTQ)를 포함하여, 복잡한 하드웨어 설계를 80시간 만에 성공적으로 구축하고 FPGA에 매핑하는 성과를 입증했습니다.
본 논문은 Behavior Cloning(BC)의 한계점인 온라인 개선 메커니즘 부재를 해결하기 위해 Q2RL이라는 새로운 오프라인-온라인 학습 알고리즘을 제안합니다. Q2RL은 BC 정책으로부터 Q-함수를 추정하고, 이 Q-값을 기반으로 샘플 수집 과정에서 BC와 강화학습(RL) 정책 행동 간의 전환을 관리하여 효율적인 온라인 개선을 가능하게 합니다. D4RL 및 robomimic 벤치마크에서 높은 성공률과 빠른 수렴 속도를 보여, 특히 고정밀 조작 작업에 효과적임을 입증했습니다.
xAI 산하 SpaceXAI가 Anthropic과 협력하여 Colossus 1 슈퍼컴퓨터에 대한 접근 권한을 확보했습니다. 이 클러스터는 H100, H200 등 최신 NVIDIA GPU를 포함하여 22만 개 이상의 GPU로 구성된 초대형 AI 컴퓨팅 자원입니다. Anthropic은 이 막대한 컴퓨팅 파워를 활용하여 Claude Pro 및 Claude Max 사용자를 위한 용량을 확장하고 모델 성능을 향상시키는 데 사용할 예정입니다.
StemDeck은 YouTube 링크의 오디오를 로컬 기기에서 여섯 개의 개별 트랙(보컬, 드럼, 베이스, 기타, 피아노 등)으로 분리하는 도구입니다. 이 과정은 클라우드 전송이나 계정 등록 없이 사용자의 장치 내에서 완전히 처리됩니다. 사용자는 DAW와 유사한 인터페이스를 통해 각 트랙을 음소거하거나 솔로 재생하고 페이더를 조절할 수 있으며, BPM, 키, 라우드니스 등의 추가 분석 정보도 얻을 수 있어 노래 연습이나 음악 제작에 매우 유용합니다.

본 기사는 컴퓨팅 시장의 미래가 전통적인 서버 CPU와 GPU 중심에서 에이전트 AI 작업에 최적화된 새로운 '일반 목적 컴퓨팅(general purpose compute)'으로 이동하고 있음을 강조합니다. AMD CEO 리사 수(Lisa Su)는 데이터센터 CPU 총 시장 규모(TAM)가 2030년까지 연평균 18% 성장하여 600억 달러에 이를 것으로 예측했으며, 이는 기존의 서버 시스템과는 다른 추세입니다. 특히 에이전트 AI 작업은 많은 추가적인 CPU 작업을 생성하며, 이로 인해 과거 GPU 대비 CPU 비율(예: 1:4 또는 1:8)이 점차 1:1에 가까워지는 변화가 예상됩니다.