Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 AES-128 및 SHA-256과 같은 암호화 알고리즘 처리 시 발생하는 메모리 병목 현상을 해결하기 위해 근접 메모리 프로세싱(Near-Memory Processing)의 잠재력을 조사합니다. UPMEM PIM 아키텍처를 활용한 실험 결과, 단일 랭크에서는 CPU보다 성능이 낮지만 계산을 여러 랭크에 분산할 경우 암호화 알고리즘을 효과적으로 가속화할 수 있음을 입증했습니다.
본 논문은 그래프 신경망(GNN)의 불규칙한 메모리 액세스 패턴과 데이터 이동 오버헤드 문제를 해결하기 위한 새로운 PIM 아키텍처인 NEM-GNN을 제안합니다. NEM-GNN은 DAC/ADC가 없는 디지털 방식의 확장 가능한 설계를 통해 기존 CPU 및 GPU 기반 실행의 에너지 효율 문제를 극복합니다. 실험 결과, 기존 최첨단 방식 대비 압도적인 성능 향상과 에너지 효율성을 입증하였습니다.
본 논문은 저조도 환경에서 광전 에너지 하베스팅으로 구동되는 IoT 및 임베디드 시스템의 에너지 효율 문제를 해결하기 위한 하드웨어 기반 동적 전력 관리 아키텍처를 제안합니다. 기존 소프트웨어 기반 방식의 정지 전류 소모 문제를 해결하기 위해 마이크로컨트롤러와 주변 장치를 완전히 파워 게이팅하고, 특수 개발된 래치 회로를 통해 452nA의 초저전력 상태를 구현했습니다.
본 기술 기사는 AI 가속기 파이프라인 프로그램에서 발생할 수 있는 하드웨어 가시성 데이터 레이스(data races)를 검증하는 새로운 방법론인 AccelSync를 소개합니다. 기존의 시뮬레이션 및 테스트 방식으로는 포착하기 어려운 크로스-유닛 동기화 문제를 해결하기 위해, 제한된 동시 언어와 매개변수화된 하드웨어 이벤트 의미론을 정의했습니다. 이를 통해 프로그램 순서, 동기화 순서, 배리어 순서를 고려하여 '배리어 충분성'이라는 핵심 질문으로 검증 범위를 축소했으며, 실제 LLM 생성 커널에서 높은 결함 탐지율과 낮은 비용 효율성을 입증했습니다.
플라즈마 시뮬레이션은 고차원 운동학적 진화, 입자-메시 결합 등 복잡한 계산이 필요한 대표적인 과학 워크로드입니다. 범용 프로세서의 스케일링 한계에 직면함에 따라, 본 논문은 플라즈마 시뮬레이션을 위한 세 가지 주요 무어 이후 기술(재구성 가능한 가속기, 비폰 노이만 아키텍처, 양자 컴퓨팅)을 커뮤니티 로드맵 관점에서 평가합니다. 각 기술의 적용 가능성은 입자-셀 워크로드를 중심으로 공동 설계 접근법으로 논의됩니다.
본 논문은 대규모 LLM 워크로드와 Many-core 가속기의 복잡성 증가로 인해 발생하는 RTL 시뮬레이션의 느린 속도 문제를 해결하는 End-to-End 모델링 접근 방식을 제시합니다. 이 방법론은 TeraNoC와 같은 초대형 시스템을 대상으로 하며, 필수적이지 않은 하드웨어 세부 사항을 추상화하면서 지연 시간에 민감한 스크래치패드 메모리(SPM)의 타이밍 동작을 정확하게 포착할 수 있습니다. 그 결과, 기존 사이클 정확도 RTL 모델 대비 최대 115배 빠른 시뮬레이션 속도를 달성하며, 상세한 프로파일링 및 설계 최적화 기회를 제공합니다.
본 기술 기사는 자원 제한적인 임베디드 환경을 위한 고성능 타겟 탐지 시스템을 개발하는 방법을 제시합니다. YOLOv3-Tiny 같은 경량 CNN 모델과 FPGA 하드웨어 가속기를 결합하여, 저비트 양자화 및 배치 정규화 융합 등의 최적화를 통해 계산 효율성과 자원 활용도를 극대화했습니다.
본 논문은 복잡성이 증가하는 디지털 물리 설계 분야에 머신러닝을 적용하기 위한 구조적 프레임워크인 EDA-Schema-V2를 소개합니다. 이 다중 모드 스키마는 로직 합성, 플로어플래닝, 배치 등 다양한 설계 단계의 물리적 속성 및 품질 지표를 포괄적으로 표현할 수 있습니다. 또한, 재현 가능한 연구를 지원하고 표준화된 평가가 가능하도록 관련 데이터셋과 벤치마크도 함께 공개합니다.
CARMEN은 자원 효율적인 딥러닝 추론을 위해 설계된 런타임 적응형 다중 정밀도 벡터 엔진입니다. 이 엔진은 CORDIC 알고리즘의 반복 깊이가 계산 정확도를 직접 제어하는 특성을 활용하여, 하드웨어 수정 없이 근사(approximate) 모드와 정확(accurate) 모드 간의 동적 전환을 가능하게 합니다. 이를 통해 전력 및 자원 소모를 최소화하면서도 높은 추론 성능을 달성할 수 있습니다.
본 기술 기사는 트랜스-정밀도 도트-곱 누산(DPA) 연산을 위해 면적 효율적인 재구성 가능한 부동소수점 유닛(FPU), TransDot을 제안합니다. 기존의 FPU는 DPA를 지원하지 않아 높은 정밀도를 유지하면서 처리량에 병목 현상을 겪었으나, TransDot은 이를 해결하여 입력/출력 대역폭과 컴퓨팅 자원을 모두 활용할 수 있게 합니다. 이 디자인은 AMD Versal 같은 차세대 AI 엔진에 확장 가능한 배포가 가능함을 입증했습니다.
EULER-ADAS는 첨단 운전자 보조 시스템(ADAS)을 위한 에너지 효율적이고 신뢰성 높은 신경 컴퓨팅 엔진입니다. 이 엔진은 포지트 산술의 장점을 활용하면서도, 기존 포지트 표현의 변동 길이 인코딩 및 데이터 경로 문제를 해결했습니다. 제안된 EULER-ADAS는 경계 레짐 포지트와 SIMD 공유 콰이어 누산 경로를 결합하여 낮은 전력 소비(0.29 W)로 높은 정확도 향상과 실시간 ADAS 추론 성능을 달성했음을 입증합니다.
TREA는 객체 탐지 및 분류를 위해 설계된 자원 효율적인 엣지 AI 가속기입니다. 이 아키텍처는 저정밀도 시간 다중화(time-multiplexed) 방식을 채택하고, MSDF 시프트-앤드-애드 계산과 런타임 비트 절단을 활용하는 DQ-MAC 유닛을 통합했습니다. 이를 통해 기존 승산기 오버헤드를 제거하고 누산기 비트 폭을 줄여, 하드웨어 중복 없이 높은 처리량(최대 4배)과 에너지 효율성을 달성하여 실시간 엣지 비전 워크로드에 최적화되었습니다.
현대 딥러닝 모델이 자동차 시스템이나 데이터 센터와 같은 안전 필수 영역에 사용되면서 일시적인 하드웨어 결함으로부터의 신뢰성 확보가 중요해지고 있습니다. 본 논문은 메모리 집약적 DL 워크로드에서 ECC를 적용하는 기존 방식의 한계를 극복하고, 우수한 신뢰성을 유지하면서도 메모리 효율적인 두 가지 대안(MSET 및 CEP)을 제안합니다.
MoE-Hub는 대규모 언어 모델(LLM)에서 발생하는 MoE 아키텍처의 확장성 문제를 해결하기 위해 제안된 하드웨어-소프트웨어 공동 설계 솔루션입니다. 기존 시스템은 MoE의 동적 토큰-전문가 매핑과 GPU의 정적 주소 기반 통신 간의 불일치로 인해 복잡한 소프트웨어 중재 단계를 거쳐야 했고, 이는 성능 저하를 야기했습니다. MoE-Hub는 데이터 전송을 주소 관리에서 분리하고 로직적 목적지만 사용하여 라우팅함으로써, 하드웨어 가속화된 통신 제어 평면을 통해 원활하고 투명한 겹침(overlap)을 가능하게 하여 성능을 크게 향상시킵니다.
본 기술 기사는 최신 워크로드와 병목 현상을 반영하도록 진화한 SPEC CPU2026 벤치마크 분석 결과를 제시합니다. 연구진은 Intel, AMD, Ampere, Nvidia 등 다양한 플랫폼에 걸쳐 9개 플랫폼을 아우르는 종합적인 분석을 수행했으며, SPEC CPU2026이 이전 버전 대비 명령어 양과 메모리 발자국을 증가시키고 새로운 병목 현상(예: 인스트럭션 캐시 스트레스)으로 압력을 이동시킨 것을 발견했습니다. 또한, 전체 벤치마크 스위트의 대표성을 유지하면서 평가 비용을 크게 줄일 수 있는 효율적인 서브셋 구성 방법과, SPEC CPU2017, DCPerf, MLPerf 등 다른 표준과의 비교 분석 결과를 제공하여 실용적인 아키텍처 연구를 지원합니다.
본 논문은 프로세서 설계의 전통적인 정적 정책 기반 접근 방식에 의문을 제기하며, 단일 스레드 성능 향상을 위해 여러 정책 조합을 동적으로 선택하는 방식을 탐구한다. 연구진은 49개의 벤치마크를 세분화하여 시뮬레이션을 수행했으며, 그 결과 최상의 정적 정책이 항상 최적인 것은 아니며, 특히 두 개의 신중하게 선택된 정책 간의 동적 전환이 평균 IPC 손실을 크게 줄여 오라클 성능에 근접한 높은 효율성을 달성할 수 있음을 입증했다. 이는 단일 스레드 성능 개선이 어려워지는 현 시점에서 매우 유망한 새로운 설계 접근법임을 시사한다.
본 논문은 현대 설계 흐름에서 자동화가 부족하여 채택이 어려웠던 2상 클로킹(Two-Phase Clocking)을 위한 완전 자동화된 오픈 소스 플로우를 제시합니다. 이 방법론은 OpenROAD Flow Scripts (ORFS)에 통합되어, 기존의 플립플롭 기반 RTL을 Yosys 기술 매핑, ABC 리타이밍, 듀얼 클럭 트리 합성 등을 사용하여 래치 기반 설계로 자동 변환합니다. 이를 통해 타이밍 마진과 유연성을 확보하면서도, 전력 감소 및 래치 수 감소 효과를 입증하는 두 가지 변형(클럭 게이팅 및 순환 멀티플렉서)을 구현했습니다.
Mixture-of-Experts (MoE) 모델은 대규모 언어 모델에서 계산 효율성을 높이는 데 사용되지만, 전문가 병렬성(EP) 과정에서의 빈번하고 비규칙적인 인터-GPU 통신이 성능 저하의 주요 원인입니다. 기존의 NVLink SHARP와 같은 솔루션들은 이러한 동적이고 비규칙적인 패턴을 지원하지 못합니다. 본 논문은 이러한 격차를 해소하기 위해, 통합된 동적 인-스위칭 컴퓨팅 솔루션인 DySHARP를 제안했습니다.
본 논문은 대규모 언어 모델(LLM)의 텐서 병렬성(TP) 과정에서 발생하는 통신-계산 불일치 문제를 해결하기 위한 'Compute-Aware In-Switch 컴퓨팅' 프레임워크인 CAIS를 제안합니다. 기존의 인-스위치 컴퓨팅 솔루션은 통신 중심 설계로 인해 LLM 계산 커널의 메모리 요구사항과 충돌하여 자원 활용도와 오버랩에 한계가 있었습니다. CAIS는 Compute-Aware ISA 확장, 요청 병합 개선을 위한 Merge-Aware TB 좌표 사용, 그리고 그래프 수준 데이터플로우 옵티마이저를 통해 통신 모드가 계산의 메모리 의미 요구와 일치하도록 설계되어, 다중 GPU 시스템에서 LLM 훈련 속도를 크게 향상시킵니다.
본 기술 기사는 대형 언어 모델(LLM) 서빙의 주요 병목인 KV 캐시 메모리 문제를 해결하기 위해 'TokenStack'이라는 이질적인 HBM-PIM 아키텍처를 제안합니다. TokenStack은 LLM 레이어를 밀집 용량 영역과 PIM 활성화 컴퓨팅 영역으로 수직 분리하고, 논리 기반 디어 컨트롤러를 사용하여 효율적으로 데이터 이동 및 관리를 수행합니다. 이를 통해 뜨거운 KV 캐시 데이터를 PIM 근처에 유지하고 차가운 상태는 고밀도 저장소로 옮겨 메모리 대역폭과 용량을 최적화하며, 기존 방식 대비 높은 처리량 증가와 에너지 효율성 개선을 입증했습니다.