Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 NP-hard 문제 해결을 위한 비전통적 컴퓨팅 접근법의 한계점을 지적하며, 특히 기하학적 구조 변환 과정에서 발생하는 해 품질 저하 문제를 다룹니다. 이를 극복하기 위해 고속 광학 양자 무작위 수생성기를 기반으로 하는 확률적 컴퓨팅 아키텍처와 가상 하드웨어 연결을 활용하여 문제의 선택집합에 대한 휴리스틱 해법 적용 가능성을 논합니다. 또한, 그리디 그래프 컬러링 알고리즘을 통해 스케일링 가능한 병렬화를 구현하고, 광학 확률적 컴퓨터가 디지털 어닐링 유닛보다 지수적으로 빠른 성능을 보일 것으로 예측하며 그 우수성을 입증합니다.
본 논문은 대형 언어 모델(LLMs)을 활용하여 FPGA 기반 가속기의 설계 공간 탐색(Design Space Exploration, DSE) 과정을 자동화하는 프레임워크인 SECDA-DSE를 제안합니다. 기존의 하드웨어-소프트웨어 공동 설계 방법론(SECDA)은 복잡하지만 최적 설계를 찾기 위해 수동 노력이 많이 필요했습니다. SECDA-DSE는 구조화된 탐색 도구, LLM 기반 추론 엔진(RAG 및 CoT 프롬프팅), 그리고 강화 학습 피드백 루프를 결합하여 효율적인 자동화된 가속기 설계 최적화를 가능하게 합니다.
본 논문은 대규모 언어 모델(LLMs)의 혼합 정밀도 추론에 최적화된 새로운 MAC 아키텍처인 XtraMAC을 제안합니다. 기존 FPGA 기반 솔루션들이 가진 고정 데이터 타입 및 자원 공유 비효율성 문제를 해결하기 위해, XtraMAC은 단일 데이터 타입 적응형 마이크로 아키텍처 내에서 정수, 부동소수점, 혼합 정밀도 연산을 통합적으로 처리합니다. AMD Xilinx U55c FPGA 테스트 결과, XtraMAC은 기존 대비 높은 컴퓨팅 밀도와 에너지 효율성, 속도 향상을 입증했습니다.
본 논문은 리소스 제약이 있는 에지 장치에서 Power-of-Two (PoT) 양자화된 심층 신경망(DNN)을 효율적으로 가속화하기 위한 오픈 소스 엔드투엔드 파이프라인인 PoTAcc를 제안합니다. PoT양자화는 DNN 크기를 줄이고 곱셈 연산을 비트 시프트로 대체하여 에지 컴퓨팅에 적합하지만, 기존 프레임워크와 하드웨어 지원의 부족으로 배포가 어려웠습니다. PoTAcc는 TFLite 기반으로 CPU 및 커스텀 FPGA 가속기를 아우르는 이종 플랫폼에서 모델 준비와 배포를 원활하게 하며, 이를 통해 최대 3.6배의 속도 향상과 78%의 에너지 절감을 입증했습니다.
본 논문은 기존 SIMT 기반 GPU의 높은 레지스터 파일(RF) 액세스 및 제어 로직 오버헤드를 해결하기 위해 DICE라는 새로운 아키텍처를 제안합니다. DICE는 SIMD 백엔드를 최소 오버헤드의 정적 스케줄링 CGRA(Coarse-Grained Reconfigurable Arrays)로 대체하여, 활성 스레드를 피플라인 방식으로 직접 디스패치하고 데이터 흐름을 처리 요소(PE) 간에 직접 발생시켜 RF 액세스를 크게 줄입니다. 이 아키텍처는 동적 의존성을 정적으로 관리하는 'p-graph' 컴파일 방식을 사용하며, 추가적인 최적화들(더블 버퍼링, 언롤링, TMCU 등)을 통해 기존 GPU 대비 높은 에너지 효율과 전력 감소를 달성함을 입증했습니다.
UVMarvel은 LLM(대규모 언어 모델)을 활용하여 서브시스템 레벨 RTL에 대한 UVM 테스트벤치를 자동으로 구축하는 혁신적인 검증 프레임워크입니다. 이 도구는 Intermediate Representation (IR)과 Bus Protocol Library를 도입하고 Signal Tracker 및 Verilog Patching Library를 사용하여 복잡한 사양을 프로토콜 정합의 UVM 환경으로 자동 변환합니다. UVMarvel은 기존에 수동 코딩과 전문 지식이 필요했던 테스트벤치 구축 과정을 획기적으로 단축하여, 검증 시간을 수일에서 몇 시간으로 줄이고 높은 코드 커버리지를 달성할 수 있게 합니다.
로컬 대형 언어 모델(LLM) 추론 환경은 경량 모델에서 초대형 모델로 진화하며 소비자 하드웨어에 심각한 시스템적 과제를 제기하고 있습니다. 본 논문은 Nvidia와 Apple Silicon 생태계를 비교 분석하여, 거대 모델 배포를 위한 아키텍처별 트레이드오프를 제시합니다. 특히 Nvidia는 높은 처리량을 제공하지만 복잡한 런타임 제약과 VRAM 한계에 직면하는 반면, Apple의 통합 메모리 아키텍처(UMA)는 병목 현상을 우회하며 뛰어난 에너지 효율성과 확장성을 보여줍니다.
본 기술 기사는 대규모 언어 모델(LLMs)의 엣지 배포 환경에서 필수적인 일반 행렬 곱셈(GEMM) 가속을 위한 새로운 프레임워크인 Tempus를 제안합니다. 기존 SOTA 프레임워크들이 공간적 스케일링에 의존하여 리소스 제한된 엣지 SoC에서 실패하는 문제를 해결하기 위해, Tempus는 고정된 계산 블록과 시간 기반의 스트리밍 및 데이터 타일링을 통해 자원 불변(Resource-Invariant)한 확장성을 달성합니다. 이 프레임워크는 AMD Versal AI Edge SoC에서 높은 성능(607 GOPS @ 10.677 W)과 함께 기존 방식 대비 월등히 낮은 전력 및 리소스 활용도를 입증하며, 엣지 LLM 추론을 위한 지속 가능한 기반을 제공합니다.
본 논문은 대규모 언어 모델(LLMs)의 효율적인 처리를 위해 도입된 와프 전문화와 같은 최신 GPGPU 아키텍처 기능을 지원하는 사이클 정확도 시뮬레이터 프레임워크인 Sim-FA를 제안합니다. 기존 학술 도구들이 새로운 GPU 기능(예: TMA)을 적시에 통합하지 못하고 DRAM 트래픽 추정에서 부정확성을 보이는 문제를 해결하고자 합니다. Sim-FA는 FlashAttention-3 커널 인스트루멘테이션부터 사이클 정확도 시뮬레이션까지의 전체 파이프라인을 구축했으며, H800과 비교하여 낮은 오차율(MAPE 5.7%)을 달성하며 그 성능을 입증했습니다.
본 논문은 신경 구조 탐색(NAS)이 단순히 정확도와 효율성을 넘어, 실제 배포 환경에서 필수적인 내구성(Robustness)과 지속적 학습(Continual Learning)까지 포괄하는 '삼중 목표'로 진화하고 있음을 분석합니다. 저자들은 이 세 가지 축을 기준으로 NAS 접근법들을 분류하고, 이를 통합적으로 다루는 새로운 프레임워크인 HERCULES를 제안했습니다. HERCULES는 다중 목표 NAS의 계산 비용 문제를 해결하며, 궁극적으로 하드웨어 효율성, 환경 탄력성, 구조적 가소성을 모두 갖춘 배포 가능한 평생 학습 AI 시스템으로 가는 로드맵을 제시합니다.
본 논문은 엣지 ML 환경에서 자원 효율성을 높이기 위해 설계된 미분 논리 게이트 네트워크(LGN)의 FPGA 구현에 초점을 맞춥니다. 연구는 LGN의 깊이와 너비를 변화시키면서 전력, 자원 활용, 추론 속도, 모델 정확도 간의 복잡한 트레이드오프를 분석합니다. 주요 결과로, LGN의 마지막 층이 합성 연산의 논리 크기를 결정하여 타이밍 및 자원 사용량 최소화에 가장 중요한 역할을 한다는 점을 밝혀냈습니다.
täkō는 캐시 미스, 반출(eviction), 쓰기 복귀(writeback)와 같은 메모리 이벤트에서 사용자 정의 콜백을 실행하여 데이터 이동 가속화를 제공하는 프로그래머블 메모리 계층 구조입니다. 하지만 이로 인해 시스템의 복잡성이 크게 증가하고 직관적인 제어가 어렵다는 문제가 있습니다. 본 연구는 täkō의 동작 의미를 포착하는 ISA 레벨 메모리 일관성 모델(MCM)을 개발하여, 프로그래머가 täkō 프로그램을 형식적으로 추론할 수 있도록 합니다.
본 논문은 최신 GPU 아키텍처(NVIDIA Blackwell B200 및 AMD CDNA3 MI300A)의 복잡한 성능 특성을 포착하기 위해 마이크로벤치마크 기반 분석 성능 모델을 개발했습니다. 이 모델은 각 아키텍처의 핵심 요소(예: TMEM, Infinity Cache, 텐서 코어 등)를 반영하여 설계되었으며, 기존의 단순한 이론적 모델(Roofline)보다 훨씬 높은 정확도를 보여주었습니다. 또한, 이 모델은 다른 세대 GPU(H200, MI250X)에도 쉽게 적용 가능함을 입증했습니다.
본 기사는 대규모 언어 모델 훈련 환경에서 발생하는 '무음 데이터 부패(SDC)' 문제를 다루며, 이 문제로 인해 GPU 클러스터의 신뢰성이 위협받는 상황을 설명합니다. 연구진은 63개 CUDA 마이크로 벤치마크에 게이트 레벨 결함 주입을 수행하여 SDC 특성을 분석했으며, 그 결과 NaN/무한대 값의 비율이 낮고 단일 비트 플립 이벤트가 전체의 일부만을 차지하며 부패 주소에 주기성이 있다는 통계적 사실을 밝혀냈습니다. 이러한 발견은 분포 기반의 상위 수준 결함 모델링 및 실제 GPU 아키텍처의 회복력 평가를 위한 현실적인 소프트웨어 기반 접근 방식을 제시합니다.
RangeGuard는 DRAM의 밀도 증가로 인한 잦은 비트 플립 및 다비트 오류에 취약한 심층 신경망(DNN) 모델의 안정성을 높이기 위한 메타데이터 중심 오류 수정 프레임워크입니다. 기존 방식과 달리, 원본 비트를 보호하는 대신 각 값의 수치적 범위를 포착하는 '범위 식별자(RIDs)'를 인코딩합니다. 이 RIDs는 메모리 오염으로 인한 해로운 의미적 편차에만 집중하여 오류를 수정하고, 유용한 변동은 무시함으로써 높은 효율성과 신뢰성을 동시에 제공합니다.
UVMarvel은 대규모 IC 개발의 병목 현상인 서브시스템 레벨 RTL 검증을 혁신적으로 개선하는 LLM 기반 자동화 프레임워크입니다. 이 도구는 복잡하고 이질적인 사양(Heterogeneous Specifications)을 분석하여 프로토콜에 맞는 UVM 테스트벤치를 자동으로 구축합니다. 또한, Signal Tracker와 Verilog Patching Library를 활용해 고품질의 스티뮬러스 생성까지 자동화함으로써, 검증 시간을 획기적으로 단축시키고 높은 코드 커버리지를 달성할 수 있게 합니다.
본 논문은 예측 가능한 트래픽 패턴을 보이는 AI 칩 및 SoC의 내장 애플리케이션에 최적화된 초저전력 NoC(Network-on-Chip) 설계를 제안한다. 이 설계는 공간 분할 다중화(SDM) 기법을 활용하여 필요한 통신 경로만을 물리적인 회로 스위치로 구현하고, 하드웨어 스위치와 프로그래밍 가능한 크로스바를 결합한 새로운 라우터 아키텍처를 사용한다. 그 결과, 기존 패킷 스위칭 방식 대비 전력 소비를 38% 절감하고 면적 및 지연 시간도 개선하는 성과를 보였다.
본 논문은 근사 곱셈(Approximate Computing)이 혼합 전문가(MoE) DNN 아키텍처에 미치는 영향을 분석한 AxMoE를 제시합니다. 연구진은 다양한 CNN 및 Vision Transformer (ViT) 모델과 세 가지 MoE 변형을 대상으로, 여러 종류의 양자화된 근사 곱셈기를 사용하여 성능 저하와 회복률을 평가했습니다. 주요 결과로, 재학습 없이 Dense 구조가 가장 안정적이었으며, ViT-Small의 경우 Hard MoE가 특정 조건에서 높은 효율성을 보였고, 아키텍처 및 토폴로지에 따라 근사 인식 재학습 후 성능 회복 정도가 크게 달라짐을 확인했습니다.
본 연구는 오픈소스 RISC-V 벡터 클러스터 Spatz의 전이 오버 민감성을 SET 및 SEU 오류 모델 하에서 분석했습니다. 10만 회의 오류 주입 실험 결과, 주요 오류 현상은 데이터 부패(FD)로 나타났으며, 특히 TCDM 영역이 데이터 부패의 핵심 원인으로 밝혀졌습니다. 또한, FP8 정밀도가 가장 낮은 출력 영향도를 보였고, 지수부(Exponent)를 표적으로 한 오류가 가장 심각한 데이터 손상 사건을 유발하므로, 특정 경로에 대한 선택적 보호 조치가 필요함을 제안합니다.
MCFlash는 상용 오프더 선반(COTS) 3D NAND 플래시 칩 자체 내에서 대량의 비트 연산을 직접 수행할 수 있도록 설계된 실용적인 기술입니다. 이 기법은 표준 사용자 모드 명령어를 활용하며, 다중 레벨 셀(MLC) 데이터 인코딩과 동적으로 조정되는 읽기 참조 전압을 결합하여 칩 내부에서 '제자리(in-place)' 비트 연산을 가능하게 합니다. 연구 결과에 따르면, MCFlash는 신선한 블록에서 10억 회 이상의 안정적인 연산 능력을 보여주었으며, 높은 내구성을 유지하며 낮은 비트 오류율을 달성했습니다.