Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Edge-AI의 에너지 병목 현상을 해결하기 위해 이벤트 기반 비전 센서(DVS)와 멤리스터 기반 인메모리 아날로그 컴퓨팅을 결합하는 기술을 분석합니다. 현재 기술 성숙도가 낮은 상태이며, 로보틱스 및 자율 주행 등 다양한 응용 분야에서 실질적인 시스템 통합을 위한 연구 로드맵과 프레임워크가 필요함을 강조합니다.
AI 워크로드의 에너지 효율을 높이기 위해 데이터 이동을 최소화하는 시간 영역(Time-domain) 근접 메모리 컴퓨팅 아키텍처를 제안합니다. 기존 아날로그 방식의 DAC/ADC 오버헤드 문제를 해결하기 위해 디지털 친화적인 인터페이스를 유지하면서 시간 영역에서 곱셈-누산(MAC) 연산을 수행합니다. 실험 결과, 40 MHz 동작 주파수에서 7.62 TOPS/W의 높은 에너지 효율을 달성하였습니다.
A3D는 하드웨어 가속기 설계를 자동화하기 위해 에이전트 기반 AI 워크플로우를 제안하는 연구입니다. 워크로드 분석부터 마이크로 아키텍처 생성까지의 전 과정을 자동화하며, 전문 에이전트 간의 협업과 Agentic RAG를 통해 복잡한 과학 애플리케이션의 가속기 설계를 인간의 개입 없이 수행합니다.
ITHICA는 실리콘 제조 결함으로 발생하는 침묵 데이터 오염(SDC)을 탐지하기 위해 명령어 중복과 출력 비교를 활용하는 새로운 스레드 내부 명령어 검사 방식입니다. 동일한 명령어를 실행하더라도 실행 컨텍스트에 따라 결과가 달라질 수 있다는 점을 이용하여, 임의의 프로그램을 결함 탐지용 기능 테스트로 자동 변환합니다. 3,000대 이상의 CPU 서버 테스트 결과, 기존 방식보다 39% 더 많은 결함 서버를 탐지하는 성능을 입증했습니다.
본 논문은 불규칙한 메모리 액세스 패턴을 효율적으로 처리하기 위해 명령어 수준의 상관관계를 활용하는 새로운 하드웨어 프리페칭 메커니즘인 ICP를 제안합니다. 기존 시계열 프리페처가 주소의 재발에 의존하여 큰 저장 오버헤드를 발생시키는 것과 달리, ICP는 주소를 생성하는 명령어 간의 안정적인 데이터 의존 관계를 학습하여 미래의 액세스를 예측합니다. 실험 결과, ICP는 기존 프리페처 대비 높은 성능 향상을 보이면서도 하드웨어 저장 공간 요구량을 획기적으로 줄였습니다.
본 논문은 인메모리 컴퓨팅(IMC) 시스템의 라우팅 문제를 해결하기 위해 10T SRAM 셀과 전가산기를 통합한 새로운 디지털 맞춤형 연산 엔진 아키텍처를 제안합니다. 이 설계는 이진 신경망(BNN)의 XNOR 연산에 최적화되어 있으며, 기존 CMOS 설계 대비 면적 효율성을 2.67배 향상시켰습니다.
레이 트레이싱의 핵심 병목 현상인 BVH 순회 과정에서의 메모리 지연 시간을 해결하기 위해 새로운 하드웨어 프리페처인 TTP를 제안합니다. TTP는 RT 유닛의 기존 트리 순회 스택을 활용하여 매우 높은 정확도로 노드 데이터를 미리 가져옴으로써 메모리 대역폭 문제를 완화합니다. 시뮬레이션 결과, 하드웨어 오버헤드를 최소화하면서도 베이스라인 대비 최대 1.89배의 성능 향상을 달성했습니다.
본 논문은 정수 선형 계획법(ILP)의 높은 희소성과 분기 집중 문제를 해결하기 위해 근접 메모리 아키텍처 기반의 가속기인 SPARK를 제안합니다. SPARK는 기존 CPU의 L1 캐시를 재목적화하여 최소한의 하드웨어 오버헤드로 희소성 인식 연산과 데이터 이동 최적화를 수행합니다. 실험 결과, 기존 CPU 및 GPU 대비 성능은 최대 20배 향상되었으며 에너지 효율은 대폭 개선되었습니다.
본 논문은 데이터 이동으로 인한 지연 시간과 에너지 오버헤드를 줄이기 위해 메모리 패브릭 내에서 직접 정렬을 수행하는 새로운 ADS-IMC 아키텍처를 제안합니다. 6T SRAM을 활용한 인메모리 정렬 방식을 통해 오프칩 데이터 전송을 제거하며, 기존 멤리스터 기반 IMC 방식보다 지연 시간을 3.4배 단축했습니다.
본 논문은 멀티프로세서 시스템의 전압 무결성을 유지하기 위해 아키텍처 전력 트레이스를 활용한 워크로드 인지형 PDN 최적화 방법론을 제안합니다. 기존의 정적 또는 최악의 경우를 가정한 설계 방식 대신, 시뮬레이션을 통해 포착한 시간적·공간적 전력 밀도 분포를 기반으로 적응형 자원 할당을 수행합니다. 실험 결과, IR 드롭 및 일렉트로마이그레이션 제약 조건을 유지하면서도 PDN 금속 면적을 최대 32.94% 절감할 수 있음을 확인했습니다.
μ-ORCA는 AMD ACAP 플랫폼에서 마이크로초 단위의 초저지연 DNN 추론을 달성하기 위해 설계된 맞춤형 이기종 가속기 프레임워크입니다. 기존 프레임워크가 해결하지 못한 온칩 통신 비효율성과 계층 간 지연 시간을 해결하기 위해 AIE 어레이 상의 직접적인 계층 간 통신과 512-bit/cycle 캐스케이드 연결을 도입했습니다. 실험 결과, DeepSets 모델에서 0.93μs의 지연 시간을 기록하며 기존 프레임워크 대비 탁월한 성능 향상을 입증했습니다.
본 논문은 오실레이터 기반 Ising Machine(OIM)의 성능을 저해하는 온칩 변동 문제를 해결하기 위해 ROA 브릭 기반의 회전 진행파 오실레이터(RTWOs)를 제안합니다. 제안된 ROA-SHIL 방식은 PVT 변동 환경에서도 안정적인 2.31 GHz 신호를 제공하며, 324-노드 max-cut 문제에서 최대 97%의 높은 정확도를 유지합니다. 또한 낮은 에너지 소모량과 확장 용이성을 입증하여 OIM 구현의 한계를 극복할 수 있는 가능성을 보여줍니다.
본 연구는 AI 가속기의 핵심 요소인 산술 곱셈기에서 발생하는 NBTI(Negative Bias Temperature Instability) 노화 문제를 해결하기 위한 새로운 기술을 제안합니다. 곱셈의 부호 불변성 특성을 활용하여 2의 보수 변환을 선택적으로 적용함으로써 트랜지스터의 스트레스를 재분배하고 하드웨어 수명을 연장합니다. 실험 결과, 면적과 지연 오버헤드를 최소화하면서도 systolic arrays 환경에서 효과적인 노화 완화 성능을 입증하였습니다.
반도체 공정이 2nm 노드에 도달함에 따라 TSMC의 COUPE 아키텍처와 같은 공동 패키징 광학(CPO) 통합 과정에서 발생하는 열-광학 결합 문제를 다룹니다. 온도 변화에 민감한 마이크로 링 공진기의 열 드리프트(Thermal Drift) 현상을 방지하기 위해, 예측적 소프트웨어 스케줄링을 조기 경보 힌트 레이어로 활용하는 방안을 제시합니다.
본 논문은 AES-128 및 SHA-256과 같은 암호화 알고리즘 처리 시 발생하는 메모리 병목 현상을 해결하기 위해 근접 메모리 프로세싱(Near-Memory Processing)의 잠재력을 조사합니다. UPMEM PIM 아키텍처를 활용한 실험 결과, 단일 랭크에서는 CPU보다 성능이 낮지만 계산을 여러 랭크에 분산할 경우 암호화 알고리즘을 효과적으로 가속화할 수 있음을 입증했습니다.
본 논문은 그래프 신경망(GNN)의 불규칙한 메모리 액세스 패턴과 데이터 이동 오버헤드 문제를 해결하기 위한 새로운 PIM 아키텍처인 NEM-GNN을 제안합니다. NEM-GNN은 DAC/ADC가 없는 디지털 방식의 확장 가능한 설계를 통해 기존 CPU 및 GPU 기반 실행의 에너지 효율 문제를 극복합니다. 실험 결과, 기존 최첨단 방식 대비 압도적인 성능 향상과 에너지 효율성을 입증하였습니다.
본 논문은 저조도 환경에서 광전 에너지 하베스팅으로 구동되는 IoT 및 임베디드 시스템의 에너지 효율 문제를 해결하기 위한 하드웨어 기반 동적 전력 관리 아키텍처를 제안합니다. 기존 소프트웨어 기반 방식의 정지 전류 소모 문제를 해결하기 위해 마이크로컨트롤러와 주변 장치를 완전히 파워 게이팅하고, 특수 개발된 래치 회로를 통해 452nA의 초저전력 상태를 구현했습니다.
본 기술 기사는 AI 가속기 파이프라인 프로그램에서 발생할 수 있는 하드웨어 가시성 데이터 레이스(data races)를 검증하는 새로운 방법론인 AccelSync를 소개합니다. 기존의 시뮬레이션 및 테스트 방식으로는 포착하기 어려운 크로스-유닛 동기화 문제를 해결하기 위해, 제한된 동시 언어와 매개변수화된 하드웨어 이벤트 의미론을 정의했습니다. 이를 통해 프로그램 순서, 동기화 순서, 배리어 순서를 고려하여 '배리어 충분성'이라는 핵심 질문으로 검증 범위를 축소했으며, 실제 LLM 생성 커널에서 높은 결함 탐지율과 낮은 비용 효율성을 입증했습니다.
플라즈마 시뮬레이션은 고차원 운동학적 진화, 입자-메시 결합 등 복잡한 계산이 필요한 대표적인 과학 워크로드입니다. 범용 프로세서의 스케일링 한계에 직면함에 따라, 본 논문은 플라즈마 시뮬레이션을 위한 세 가지 주요 무어 이후 기술(재구성 가능한 가속기, 비폰 노이만 아키텍처, 양자 컴퓨팅)을 커뮤니티 로드맵 관점에서 평가합니다. 각 기술의 적용 가능성은 입자-셀 워크로드를 중심으로 공동 설계 접근법으로 논의됩니다.
본 논문은 대규모 LLM 워크로드와 Many-core 가속기의 복잡성 증가로 인해 발생하는 RTL 시뮬레이션의 느린 속도 문제를 해결하는 End-to-End 모델링 접근 방식을 제시합니다. 이 방법론은 TeraNoC와 같은 초대형 시스템을 대상으로 하며, 필수적이지 않은 하드웨어 세부 사항을 추상화하면서 지연 시간에 민감한 스크래치패드 메모리(SPM)의 타이밍 동작을 정확하게 포착할 수 있습니다. 그 결과, 기존 사이클 정확도 RTL 모델 대비 최대 115배 빠른 시뮬레이션 속도를 달성하며, 상세한 프로파일링 및 설계 최적화 기회를 제공합니다.