Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이 기술 기사는 특정 하드웨어 조합(Muazzam qwen3.6-35b-a3b-nvfp4 모델, RTX Pro 6000 GPU)과 라이브러리(vllm)를 사용하여 5개의 병렬 요청을 처리했을 때의 성능 테스트 결과를 공유합니다. 이 구성은 평균적으로 초당 127.20 토큰이라는 높은 속도를 달성했습니다.
본 기술 기사는 최신 워크로드와 병목 현상을 반영하도록 진화한 SPEC CPU2026 벤치마크 분석 결과를 제시합니다. 연구진은 Intel, AMD, Ampere, Nvidia 등 다양한 플랫폼에 걸쳐 9개 플랫폼을 아우르는 종합적인 분석을 수행했으며, SPEC CPU2026이 이전 버전 대비 명령어 양과 메모리 발자국을 증가시키고 새로운 병목 현상(예: 인스트럭션 캐시 스트레스)으로 압력을 이동시킨 것을 발견했습니다. 또한, 전체 벤치마크 스위트의 대표성을 유지하면서 평가 비용을 크게 줄일 수 있는 효율적인 서브셋 구성 방법과, SPEC CPU2017, DCPerf, MLPerf 등 다른 표준과의 비교 분석 결과를 제공하여 실용적인 아키텍처 연구를 지원합니다.
본 논문은 프로세서 설계의 전통적인 정적 정책 기반 접근 방식에 의문을 제기하며, 단일 스레드 성능 향상을 위해 여러 정책 조합을 동적으로 선택하는 방식을 탐구한다. 연구진은 49개의 벤치마크를 세분화하여 시뮬레이션을 수행했으며, 그 결과 최상의 정적 정책이 항상 최적인 것은 아니며, 특히 두 개의 신중하게 선택된 정책 간의 동적 전환이 평균 IPC 손실을 크게 줄여 오라클 성능에 근접한 높은 효율성을 달성할 수 있음을 입증했다. 이는 단일 스레드 성능 개선이 어려워지는 현 시점에서 매우 유망한 새로운 설계 접근법임을 시사한다.
본 논문은 현대 설계 흐름에서 자동화가 부족하여 채택이 어려웠던 2상 클로킹(Two-Phase Clocking)을 위한 완전 자동화된 오픈 소스 플로우를 제시합니다. 이 방법론은 OpenROAD Flow Scripts (ORFS)에 통합되어, 기존의 플립플롭 기반 RTL을 Yosys 기술 매핑, ABC 리타이밍, 듀얼 클럭 트리 합성 등을 사용하여 래치 기반 설계로 자동 변환합니다. 이를 통해 타이밍 마진과 유연성을 확보하면서도, 전력 감소 및 래치 수 감소 효과를 입증하는 두 가지 변형(클럭 게이팅 및 순환 멀티플렉서)을 구현했습니다.
Mixture-of-Experts (MoE) 모델은 대규모 언어 모델에서 계산 효율성을 높이는 데 사용되지만, 전문가 병렬성(EP) 과정에서의 빈번하고 비규칙적인 인터-GPU 통신이 성능 저하의 주요 원인입니다. 기존의 NVLink SHARP와 같은 솔루션들은 이러한 동적이고 비규칙적인 패턴을 지원하지 못합니다. 본 논문은 이러한 격차를 해소하기 위해, 통합된 동적 인-스위칭 컴퓨팅 솔루션인 DySHARP를 제안했습니다.
본 논문은 대규모 언어 모델(LLM)의 텐서 병렬성(TP) 과정에서 발생하는 통신-계산 불일치 문제를 해결하기 위한 'Compute-Aware In-Switch 컴퓨팅' 프레임워크인 CAIS를 제안합니다. 기존의 인-스위치 컴퓨팅 솔루션은 통신 중심 설계로 인해 LLM 계산 커널의 메모리 요구사항과 충돌하여 자원 활용도와 오버랩에 한계가 있었습니다. CAIS는 Compute-Aware ISA 확장, 요청 병합 개선을 위한 Merge-Aware TB 좌표 사용, 그리고 그래프 수준 데이터플로우 옵티마이저를 통해 통신 모드가 계산의 메모리 의미 요구와 일치하도록 설계되어, 다중 GPU 시스템에서 LLM 훈련 속도를 크게 향상시킵니다.
본 기술 기사는 대형 언어 모델(LLM) 서빙의 주요 병목인 KV 캐시 메모리 문제를 해결하기 위해 'TokenStack'이라는 이질적인 HBM-PIM 아키텍처를 제안합니다. TokenStack은 LLM 레이어를 밀집 용량 영역과 PIM 활성화 컴퓨팅 영역으로 수직 분리하고, 논리 기반 디어 컨트롤러를 사용하여 효율적으로 데이터 이동 및 관리를 수행합니다. 이를 통해 뜨거운 KV 캐시 데이터를 PIM 근처에 유지하고 차가운 상태는 고밀도 저장소로 옮겨 메모리 대역폭과 용량을 최적화하며, 기존 방식 대비 높은 처리량 증가와 에너지 효율성 개선을 입증했습니다.
생산성 도구 경쟁의 중심이 데스크톱 환경을 넘어 모바일 생태계 점유 싸움으로 이동하고 있습니다. 애플 기기 간 연결성을 강화하는 것이 핵심 전략이며, 이는 단순한 기능 제공을 넘어 사용자의 개발 시간 전체를 장악하려는 플랫폼 전쟁 양상으로 진화하고 있습니다.
본 논문은 NP-hard 문제 해결을 위한 비전통적 컴퓨팅 접근법의 한계점을 지적하며, 특히 기하학적 구조 변환 과정에서 발생하는 해 품질 저하 문제를 다룹니다. 이를 극복하기 위해 고속 광학 양자 무작위 수생성기를 기반으로 하는 확률적 컴퓨팅 아키텍처와 가상 하드웨어 연결을 활용하여 문제의 선택집합에 대한 휴리스틱 해법 적용 가능성을 논합니다. 또한, 그리디 그래프 컬러링 알고리즘을 통해 스케일링 가능한 병렬화를 구현하고, 광학 확률적 컴퓨터가 디지털 어닐링 유닛보다 지수적으로 빠른 성능을 보일 것으로 예측하며 그 우수성을 입증합니다.
본 논문은 대형 언어 모델(LLMs)을 활용하여 FPGA 기반 가속기의 설계 공간 탐색(Design Space Exploration, DSE) 과정을 자동화하는 프레임워크인 SECDA-DSE를 제안합니다. 기존의 하드웨어-소프트웨어 공동 설계 방법론(SECDA)은 복잡하지만 최적 설계를 찾기 위해 수동 노력이 많이 필요했습니다. SECDA-DSE는 구조화된 탐색 도구, LLM 기반 추론 엔진(RAG 및 CoT 프롬프팅), 그리고 강화 학습 피드백 루프를 결합하여 효율적인 자동화된 가속기 설계 최적화를 가능하게 합니다.
본 논문은 대규모 언어 모델(LLMs)의 혼합 정밀도 추론에 최적화된 새로운 MAC 아키텍처인 XtraMAC을 제안합니다. 기존 FPGA 기반 솔루션들이 가진 고정 데이터 타입 및 자원 공유 비효율성 문제를 해결하기 위해, XtraMAC은 단일 데이터 타입 적응형 마이크로 아키텍처 내에서 정수, 부동소수점, 혼합 정밀도 연산을 통합적으로 처리합니다. AMD Xilinx U55c FPGA 테스트 결과, XtraMAC은 기존 대비 높은 컴퓨팅 밀도와 에너지 효율성, 속도 향상을 입증했습니다.
본 논문은 리소스 제약이 있는 에지 장치에서 Power-of-Two (PoT) 양자화된 심층 신경망(DNN)을 효율적으로 가속화하기 위한 오픈 소스 엔드투엔드 파이프라인인 PoTAcc를 제안합니다. PoT양자화는 DNN 크기를 줄이고 곱셈 연산을 비트 시프트로 대체하여 에지 컴퓨팅에 적합하지만, 기존 프레임워크와 하드웨어 지원의 부족으로 배포가 어려웠습니다. PoTAcc는 TFLite 기반으로 CPU 및 커스텀 FPGA 가속기를 아우르는 이종 플랫폼에서 모델 준비와 배포를 원활하게 하며, 이를 통해 최대 3.6배의 속도 향상과 78%의 에너지 절감을 입증했습니다.

엔비디아 CEO 젠슨 황은 회사가 코닝과 파트너십을 체결하고 미국 내 광학 연결 제조 능력을 확장하는 것이 미국의 기술 공급망 재건에 중요한 기회라고 강조했습니다. 그는 AI가 전 세계적인 기본 인프라가 될 것이며, 이 과정에서 발생하는 막대한 수요를 충족시키기 위해 미국 제조업 및 공급망에 대규모 투자가 이루어지고 있다고 설명했습니다. 특히 칩 연결에 필수적인 광학 기술의 확장이 미국의 산업 역량을 강화하고 경제 전반에 걸쳐 새로운 일자리와 성장을 창출할 것이라고 전망했습니다.
본 논문은 기존 SIMT 기반 GPU의 높은 레지스터 파일(RF) 액세스 및 제어 로직 오버헤드를 해결하기 위해 DICE라는 새로운 아키텍처를 제안합니다. DICE는 SIMD 백엔드를 최소 오버헤드의 정적 스케줄링 CGRA(Coarse-Grained Reconfigurable Arrays)로 대체하여, 활성 스레드를 피플라인 방식으로 직접 디스패치하고 데이터 흐름을 처리 요소(PE) 간에 직접 발생시켜 RF 액세스를 크게 줄입니다. 이 아키텍처는 동적 의존성을 정적으로 관리하는 'p-graph' 컴파일 방식을 사용하며, 추가적인 최적화들(더블 버퍼링, 언롤링, TMCU 등)을 통해 기존 GPU 대비 높은 에너지 효율과 전력 감소를 달성함을 입증했습니다.
UVMarvel은 LLM(대규모 언어 모델)을 활용하여 서브시스템 레벨 RTL에 대한 UVM 테스트벤치를 자동으로 구축하는 혁신적인 검증 프레임워크입니다. 이 도구는 Intermediate Representation (IR)과 Bus Protocol Library를 도입하고 Signal Tracker 및 Verilog Patching Library를 사용하여 복잡한 사양을 프로토콜 정합의 UVM 환경으로 자동 변환합니다. UVMarvel은 기존에 수동 코딩과 전문 지식이 필요했던 테스트벤치 구축 과정을 획기적으로 단축하여, 검증 시간을 수일에서 몇 시간으로 줄이고 높은 코드 커버리지를 달성할 수 있게 합니다.
Google이 온디바이스 환경에 최적화된 멀티모달 대규모 언어 모델(LLM)인 Gemma 3n을 오픈 소스 생태계에 공개했습니다. 이 모델은 이미지, 텍스트, 오디오, 비디오 입력을 모두 지원하며, 특히 메모리 효율성을 극대화하여 실제 파라미터 수보다 훨씬 적은 VRAM으로 구동할 수 있는 것이 특징입니다. Gemma 3n은 transformers, llama.cpp, ollama 등 주요 오픈 소스 라이브러리에 즉시 통합되어 사용 가능합니다.
대규모 언어 모델(LLMs)의 추론 비용 문제를 해결하기 위해 Ternary 모델을 활용하는 Litespark-Inference라는 새로운 방법을 제안합니다. 이 방법은 가중치가 {-1, 0, +1}로 제한된 Ternary 모델의 특성을 이용해 부동 소수점 곱셈 대신 정수 점곱 명령어를 사용하는 커스텀 SIMD 커널을 구현했습니다. 그 결과, Apple Silicon 및 Intel/AMD CPU에서 기존 표준 추론 방식 대비 현저히 빠른 속도와 높은 효율성(예: 첫 토큰 시간 9.2배 단축, 처리량 52배 증가)을 달성하여 개인 기기에서의 AI 작업 부하 활용도를 높였습니다.
본 논문은 3D MRI 볼륨을 연속적인 위치, 방향, 규모의 2D 슬라이스 렌더링 시퀀스로 변환하여 자기지도 사전 학습(self-supervised pretraining) 목표를 제안합니다. 이 접근 방식은 3D 데이터를 액션 궤적이 제어 인자가 되는 밀도 높은 비디오-액션 시퀀스로 취급하며, 이를 통해 잠재 역학 모델이 특징의 시간적 진화를 예측하도록 학습시킵니다. 실험 결과는 이러한 '제어 가능한 슬라이스 네비게이션' 방식이 대규모 라벨 없는 MRI 데이터셋에서 해부학적 및 공간적 표현을 효과적으로 학습하는 데 유용한 인터페이스임을 입증합니다.
본 논문은 연속 시간 및 상태/행동 공간을 갖는 강화학습(RL)의 불안정성 문제를 해결하기 위해 'VPSD-RL'이라는 새로운 프레임워크를 제안합니다. 이 방법은 리 군 작용과 관련된 역행 연산자를 사용하여 가치 보존 매핑을 정의하고, 이를 제어된 확산 모델링에 통합하여 연속 RL을 수행합니다. VPSD-RL은 해밀턴-자코비-벨만 불일치가 작은 경우 근사 가치 보존 구조를 찾고, 관련된 리 군 연산자를 검색함으로써 정확한 및 근사 가치 보존 구조를 모두 발견할 수 있습니다.
본 논문은 기존 자기회귀(autoregressive) 방식의 한계를 극복하고, 텍스트를 계층적 잠재 공간에서 생성하는 새로운 접근 방식인 Cola DLM을 제안합니다. Cola DLM은 Text VAE와 블록-인과적 DiT를 결합하여 안정적인 잠재 매핑과 전역적 의미 모델링을 수행하며, 이를 통해 토큰 수준의 복원 대신 잠재 선행(latent prior) 전송에 초점을 맞춥니다. 이 설계는 비자기회귀 유도 편향을 제공하고 연속적 모달리티로의 확장을 용이하게 하며, 기존 LLM 대비 우수한 스케일링 행동과 생성 품질을 입증합니다.