Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Apple Neural Engine(ANE)의 아키텍처, 컴파일러, 펌웨어 및 데이터패스를 역공학하여 분석한 기술 보고서입니다. A11부터 M5까지의 칩셋을 대상으로 처리량, 에너지 효율, 가중치 압축 방식 등을 심층적으로 다룹니다.
NPU 환경에서 희소 행렬 곱셈(SpMM)의 성능을 최적화하기 위한 새로운 프레임워크 NeutronSparse를 제안합니다. 이기종 엔진 간의 협업 조율과 지역성 인식 타일 오케스트레이션을 통해 데이터 관리 병목 현상을 해결합니다.
멤리스티브 크로스바 패브릭을 활용하여 온칩 신경망을 위한 다층 저항성 시냅스 설계를 제안합니다. 이온 수송 물리 모델을 기반으로 에너지 효율적인 아날로그 VMM 연산과 인메모리 학습을 구현하여 LLM 구동에 최적화된 하드웨어 구조를 제시합니다.
SkyWater 130nm 공정을 활용하여 엣지 뉴로모픽 시스템을 위한 네 가지 디지털 IP 블록을 설계하고 구현했습니다. PVT 센서, 확률적 LIF 뉴런, STDP 컨트롤러, 멤리스티브 크로스바 컨트롤러를 포함하며, Tiny Tapeout을 통해 테이프아웃을 진행했습니다.
DRAM의 새로운 읽기 방해 현상인 ColumnDisturb 취약점을 해결하기 위한 ColumnKeeper 방법론을 제안합니다. 결정론적 방식(CK-D)과 확률적 방식(CK-P)을 통해 낮은 성능 및 면적 오버헤드로 비트 플립을 효과적으로 방지합니다.
DRAM 내부에서 연산을 수행하는 PuD(Processing-using-DRAM) 시스템을 위한 새로운 벡터-스칼라 비교 알고리즘 Clutch를 제안합니다. 시간 코딩과 멀티 비트 청크 분할 방식을 통해 명령어 오버헤드를 줄이고 메모리 효율성을 극대화했습니다.
Tsetlin Machine(TM) 추론을 최적화하기 위해 RISC-V 기반의 저전력 축소 명령어 세트 프로세서를 설계했습니다. 이 설계는 프로그래밍 가능성을 유지하면서도 기존 BNN 대비 실행 시간을 대폭 단축하고 에너지 효율을 극대화합니다.
CNN과 유전 알고리즘을 활용하여 3포트 Doherty 전력 증폭기용 픽셀화된 결합기를 설계하는 새로운 방법론을 제안합니다. GaN HEMT 프로토타입을 통해 높은 피크 드레인 효율과 우수한 선형성을 입증했습니다.
CMOS 기반 메모리를 대체할 유망한 기술인 멤리스터(ReRAM, STT-RAM)의 특성과 신뢰성 위협을 분석합니다. 읽기/쓰기 오류 및 소프트 에러 문제를 다루며, 이를 해결하기 위한 최신 기술과 컴퓨팅 유닛으로서의 활용 가능성을 제시합니다.
Processing-using-DRAM(PuD) 연산 시 발생하는 데이터 오염 현상인 'PuDGhost'를 분석한 연구입니다. DRAM 밀도가 높아짐에 따라 비활성 행 및 인접 컬럼의 간섭으로 인해 연산 결과가 왜곡되는 문제를 실험적으로 증명했습니다.
열역학적 컴퓨팅을 활용하여 mRNA 코돈 최적화 문제를 해결하는 새로운 하드웨어 기반 접근 방식을 제안합니다. 기존 GPU 대비 약 10^6배의 에너지 절감 효과를 보여주며, 제약 R&D 분야의 에너지 효율적인 계산 가능성을 제시합니다.
3D IC의 고해상도 열 시뮬레이션을 위해 GPU 가속을 지원하는 희소 행렬 솔버인 CUTh-Solver를 제안합니다. DIA 압축 저장, 병합된 메모리 액세스, 혼합 정밀도 전략을 통해 기존 범용 라이브러리 대비 탁월한 성능 향상을 달성했습니다.
Google의 TPU v2부터 Ironwood까지 5세대에 걸친 아키텍처 진화 과정을 다룬 논문입니다. AI 워크로드 변화에 대응하는 확장성, 회복 탄력성, 전력 효율성 및 지속 가능성을 중심으로 하드웨어의 비약적인 성능 향상을 분석합니다.
MCMC 기법의 높은 계산 비용과 병렬화 문제를 해결하기 위해 Intel 16nm 공정으로 설계된 맞춤형 RISC-V SoC인 AIA를 제안합니다. AIA는 16개의 맞춤형 RISC-V 코어와 2D 메시 구조를 통해 에지 디바이스에서 효율적인 근사 추론을 지원합니다.
확률적 그래픽 모델(PGM)의 MCMC 알고리즘을 가속하기 위한 16nm 멀티코어 SoC인 AIA를 제안합니다. 비정규화 Knuth-Yao 샘플링과 코어 간 레지스터 공유를 통해 기존 가속기 대비 속도와 에너지 효율을 대폭 향상했습니다.
MPX는 행렬 곱셈과 다항식 곱셈을 하나의 하드웨어 패브릭에서 모두 지원하는 이중 모드 시스톨릭 어레이 설계입니다. 기존 AI 하드웨어의 웨이브프런트 데이터플로우를 활용하여 암호화 워크로드(FHE, PQC)를 효율적으로 처리합니다.
베이지안 신경망의 엣지 환경 추론을 위해 산술 연산 대신 상수 비교기를 사용하는 혁신적인 이진 트리 가우시안 난수 생성기(TreeGRNG)를 제안합니다. 기존 방식 대비 에너지 효율과 처리량을 획기적으로 높였으며, 확률 분포의 유연한 조정이 가능합니다.
자원 제한적인 FPGA 환경에서 DNN 배포를 위해 가중치를 델타(deltas) 형태로 저장하는 효율적인 압축 기술을 제안합니다. 고정 참조 델타 방식을 통해 메모리 사용량을 약 50% 절감하면서도 준수한 정확도를 유지하는 하드웨어 가속기 성능을 입증했습니다.
DataGuard는 시스톨릭 어레이 기반 가속기에서 차분 프라이버시(DP)와 연합 학습(FL)을 결합하여 하드웨어 수준에서 프라이버시를 보호하는 메커니즘을 제안합니다. 제3자 애플리케이션을 신뢰하지 않고도 설정된 프라이버시 예산을 초과하지 않도록 보장하며, 매우 낮은 면적 및 성능 오버헤드를 입증했습니다.
지속 가능한 실리콘 시스템 설계를 지원하는 Architecture Carbon Tool v3(ACT3)를 소개합니다. ACT3는 탄소 비용을 고려한 설계 공간 탐색을 위해 강화된 모델링 기능과 분석 텔레메트리를 제공하는 확장 가능한 플랫폼입니다.