Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 엣지 LLM 추론을 위해 iGPU와 NPU 같은 이종 자원을 효과적으로 활용하는 스케줄링 프레임워크인 HeteroMosaic를 제안합니다. HeteroMosaic는 이종 루프라인 모델과 마이크로 배치 분해를 통해 크로스-가속기 오버랩을 노출하고, 메모리 경합 등 실제 효과를 고려하여 공동 최적화를 수행합니다.
본 논문은 마이크로아키텍처 이벤트 간의 복잡한 상호작용을 분석하는 관측성 프레임워크인 Microflow를 제안합니다. Microflow는 실행 트레이스를 MFIR로 변환하여 소프트웨어 의미론, 명령어, 하드웨어 리소스 전반의 의존성을 포착합니다. 이를 통해 성능 병목 현상의 근본 원인을 체계적으로 분석하고 하드웨어-소프트웨어 공동 설계를 지원합니다.
본 논문은 데이터 교란 오류인 ColumnDisturb 문제를 다루며, 특히 인접 서브어레이 간의 비트 플립(inter-subarray bitflips)을 완화하는 새로운 기법 CODA를 제안합니다. 기존 방식이 유발하던 과도한 오버헤드를 줄여 성능 저하 없이 ColumnDisturb 허용을 가능하게 합니다.
본 연구는 Job-Shop Scheduling Problem의 산업 변형을 세 가지 플랫폼(IBM Quantum, D-Wave, Fujitsu)에서 양자 및 고전적 방식으로 비교 분석했습니다. 그 결과, 솔루션 품질과 확장성을 위해서는 하드웨어와 소프트웨어를 공동 설계하는 것이 필수적임을 입증했습니다.
본 논문은 LLM의 계산 및 메모리 요구 사항으로 인한 전반적인 추론 효율성 문제를 해결하기 위해 CIMERA라는 새로운 가속기를 제안합니다. CIMERA는 컴퓨팅, 인터커넥트, 메모리를 통합하고 재구성 가능한 정밀도를 활용하여 에너지 효율성을 극대화했습니다.
본 논문은 비디오 확산 트랜스포머(vDiTs)가 가진 높은 컴퓨팅 비용 문제를 해결하기 위해 알고리즘과 하드웨어를 공동 설계한 Kaleido를 제안합니다. Kaleido는 잠재 공간의 시공간적 상관관계를 활용하여 중복 계산을 건너뛰고, 이를 효율적으로 지원하는 시스틱 어레이 가속기를 포함합니다.
최신 딥러닝 워크로드가 요구하는 저정밀도 마이크로 스케일 부동소수점(MXFP) 형식에 대한 FPGA 구현 방안을 연구했습니다. 본 논문은 Altera Agilex-5 FPGA에서 MXFP 내적 구현의 다양한 전략을 분석하고, 텐서 모드의 산술 밀도를 평가합니다.
본 논문은 생의학 신호 획득 및 인코딩에 최적화된 이벤트 기반 아날로그 프론트 엔드(AFE) ASIC을 제시합니다. 이 칩은 적응형 비동기 델타 변조기(aADM)와 펄스 주파수 변조(PFM)를 결합한 이중 모드 인코딩 메커니즘을 갖추고 있습니다. 이를 통해 저전력으로 높은 데이터 압축률의 신경 신호 처리가 가능하며, BCI 및 SNN 프로세서와의 호환성을 제공합니다.
본 논문은 중성 원자 양자 컴퓨팅(NAQC)의 느린 실행 속도 문제를 해결하기 위해 FPGA 기반 제어 아키텍처인 AtomFlow를 제안합니다. 이 아키텍처는 형광 이미지 분석과 원자 재배열 알고리즘을 단일 Zynq UltraScale+ 장치에 통합하여, 기존 파이프라인의 왕복 지연 시간을 제거하고 스트리밍 방식으로 작동합니다.
본 논문은 자율주행 차량과 같은 Physical AI 시스템을 위해 이기종 엣지 GPU 환경에서 Vision Transformer 모델의 효율적인 배포 방법을 제시합니다. 'Heterogeneous Frame Dispatch Scheduling (H-FraDS)' 방법론을 통해 GPU와 DLA 코어 전반에 걸쳐 프레임을 라우팅하여 활용도를 개선했습니다. 이를 통해 낮은 전력 및 지연 시간 제약 조건 하에서도 높은 처리량과 실시간 작동이 가능함을 입증했습니다.
AMD Ryzen AI NPU 프로그래밍을 위한 시각적 데이터플로우 설계 환경인 IRONSmith를 소개합니다. 이 도구는 사용자가 코딩 없이 인터랙티브 캔버스에서 와이어 연결 블록으로 ML 데이터플로우를 설계할 수 있게 합니다. IRONSmith는 구조적 완성, 종속성 관리 등을 자동 처리하여 AMD Ryzen AI NPU에서 실행 가능한 IRON Python 코드로 변환합니다.
본 논문은 오픈소스 EDA 툴의 설계 공간 탐색(DSE)을 공개 노브를 넘어 소스 레벨 메커니즘으로 확장하는 ReviewDSE 프레임워크를 제안합니다. 이 보호된 화이트박스 DSE는 재사용 가능한 검색 지식을 기록하고, OpenROAD에 구현하여 최종 HPWL을 평균 1.78% 감소시키는 성능 향상을 입증했습니다.
본 논문은 엣지 장치에 DNN 배포 시 필수적인 HW 인식 신경망 구조 탐색(HW-NAS) 과정에서 발생하는 지연 시간 측정의 병목 현상을 해결하는 방법을 제시합니다. 연구진은 그래프 어텐션 네트워크 기반의 고정밀, 저비용 지연 시간 예측기인 HiFi-LLP를 개발했습니다. 이를 통해 NAS 프로세스의 정확도를 높이고 하이브리드 프레임워크를 구축하여 기존 대비 높은 속도 향상을 달성했습니다.
본 연구는 LLM이 컴퓨터 아키텍처 논문을 단순 요약하는 것을 넘어, 핵심 메커니즘을 비판적으로 분석하고 구조화된 이해를 수행할 수 있는지 Gauntlet이라는 오픈 소스 파이프라인으로 검증했습니다. 20개 최신 학회 논문 분석 결과, Gauntlet은 인간 전문가의 분석보다 '비판적 엄밀성' 측면에서 유의미하게 우수한 성능을 보였습니다.
본 논문은 학습된 실행기의 신뢰성을 높이기 위해 트레이스 기반 심볼릭 신경 CPU(trace-supervised symbolic neural CPU)를 제안합니다. 이 아키텍처는 재귀적 제어, 명시적인 연산 라우터, 목적지 마스크 레지스터 쓰기백 등을 결합하여 상태 전이를 가시화하고 정확한 실행을 목표로 합니다.
본 기사는 LLM 추론 시 HBM 용량 제약을 극복하기 위한 새로운 공동 설계 시스템인 FlashAccel을 소개합니다. FlashAccel은 HBF(고대역폭 플래시)를 HBM 기반 GPU에 통합하여 접근 지연 시간을 완화하고, 특수 데이터 레이아웃 및 스토리지 관리 계층을 통해 대역폭 활용률과 이기종 자원 관리를 개선했습니다.
본 논문은 대규모 트랜스포머 모델을 저전력 엣지 디바이스에 배포하기 위한 적응형 모델 압축(AMC) 프레임워크를 제안합니다. 이 시스템은 토큰 중요도에 따라 하드웨어 자원을 동적으로 할당하여, 중요한 정보는 고정밀로 처리하고 덜 중요한 데이터는 비트 폭을 줄여 에너지 효율성을 극대화했습니다.
본 논문은 하드웨어 검증의 복잡성 증가에 대응하여 LLM의 의미론적 추론 능력을 활용한 새로운 퍼징 프레임워크인 ChipFuzzer를 제안합니다. ChipFuzzer는 커버리지 가이드와 버그 가이드를 결합한 2단계 워크플로우로, 테스트 케이스 생성 및 우선순위화에 LLM을 적용하여 검증 효율성을 극대화했습니다.
본 기사는 IEC 61131-3 래더 다이어그램의 안전성을 향상시키기 위한 새로운 실행 가능한 형식 의미론 K-ESBMC를 소개합니다. K-ESBMC는 접점, 코일 등 PLC 요소를 모델링하며, 단일 정의로 인터프리터와 연역적 검증기를 모두 생성하여 표준에 충실한 오라클 역할을 합니다. 이를 통해 기존 변환 기반 검증기의 건전성을 감사하고 결함을 노출시킵니다.
본 논문은 인-DRAM Rowhammer 방어 기법의 한계점을 지적하며, 런타임 온도 변화에 따라 변하는 실제 Rowhammer 임계값(TRHD)을 관리하기 위한 '동적 Rowhammer 임계값 관리'를 제안합니다. 이 방법은 관측된 온도를 기반으로 각 방어 기법의 임계값을 재소스화하여 물리적 TRHD 조정의 비일관성을 해결하고, 다양한 위반 사례에서 성능 개선을 입증했습니다.