Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
DRAM의 신뢰성을 위협하는 RowHammer 및 RowPress 현상의 물리적 메커니즘을 분석한 연구입니다. 기존 소자 모델과 실험적 결과 사이의 격차를 해소하기 위해 TCAD 시뮬레이션을 활용하여 비트 플립의 원인을 규명하고 완화 방안을 제시합니다.
LLM 서빙의 에너지 효율을 높이기 위해 차세대 M3D 메모리 기술을 활용한 교차 계층 시뮬레이션 프레임워크 LLMET을 제안합니다. 연구 결과, 온칩 캐시 용량을 확장함으로써 데이터 이동을 줄여 GPU 환경 및 엣지 플랫폼에서 상당한 에너지 절감 효과를 거둘 수 있음을 입증했습니다.
MDTransformer는 모드 분할 광학 기술을 활용하여 트랜스포머 추론을 가속화하는 새로운 하드웨어-소프트웨어 공동 설계 방식입니다. 역설계된 광학 텐서 코어를 통해 기존 광학 가속기 대비 면적, 전력 및 에너지 효율을 획기적으로 개선했습니다.
벡터 프로세서에서 Transformer 추론 성능을 극대화하기 위한 Ventaglio 아키텍처를 제안합니다. RVV ISA 확장을 통해 희소 텐서 수축을 Roofline 성능 한계치까지 끌어올려 LLaMA-3-8B 모델의 추론 속도를 크게 향상시켰습니다.
65nm 단일 폴리 플로팅 게이트 아날로그 인메모리 컴퓨팅에서 발생하는 데이터 유지 손실 문제를 회로 및 알고리즘 수준의 기술로 완화하는 연구입니다. 실험 결과, 프로그래밍 60일 후에도 추론 정확도를 기준치 대비 2-4% 이내로 유지할 수 있음을 입증했습니다.
MCTS 알고리즘의 각 단계를 하드웨어 네이티브 IMC 프리미티브로 재구성하여 에너지 효율을 극대화하는 기술을 소개합니다. 22nm 공정 기반의 IMC-MCTS는 기존 CPU 및 H100 GPU 대비 압도적인 에너지 효율을 달성하며 에지 배포 가능성을 입증했습니다.
Pascal부터 Blackwell까지 NVIDIA GPU 아키텍처의 워프 분기(Warp Divergence) 처리 방식을 분석한 연구입니다. 분기 비용은 아키텍처와 무관하게 경로 수에 따라 선형적으로 증가하며, 재수렴 메커니즘의 진화 과정을 상세히 다룹니다.
SpiNNaker2는 딥러닝과 뉴로모픽 컴퓨팅의 간극을 메우기 위해 설계된 멀티코어 뇌 모방 플랫폼입니다. ARM M4F 프로세서와 전용 가속기를 탑재하여 높은 에너지 효율성과 확장 가능한 이벤트 기반 통신을 제공합니다.
대규모 SoC 내 하드웨어 트로이잔을 탐지하기 위해 And-Inverter Graph(AIG)와 지식 그래프 임베딩(KGE)을 결합한 새로운 접근 방식을 제안합니다. 이 방법은 회로 구조를 효율적으로 모델링하여 대규모 환경에서도 선형적인 복잡도로 트로이잔을 식별할 수 있는 확장성을 제공합니다.
멀티태스크 추론 시 불필요한 연산을 줄이기 위해 명령어 기반의 태스크 조건부 연산 건너뛰기 기술을 제안합니다. HW/SW 공동 설계를 통해 모델 변경 없이도 에너지 효율과 추론 속도를 대폭 개선했습니다.
LLM 디코딩 시 발생하는 KV 캐시 메모리 병목을 해결하기 위해 알고리즘과 하드웨어를 공동 설계한 HiKV를 제안합니다. 계층적 중요도 인식을 통해 KV 캐시를 압축하며, 전용 가속기를 통해 성능과 에너지 효율을 극대화했습니다.
RISC-V의 Zfh 및 Zvfh 확장을 활용하여 자원이 제한된 싱글 코어에서 float16 기반 온디바이스 학습을 구현하는 프레임워크를 제안합니다. float32 대비 메모리 사용량을 50% 절감하면서도 모델 성능 저하를 최소화하는 하드웨어-소프트웨어 공동 설계 방식을 다룹니다.
엣지 컴퓨팅 환경에서 지속 학습(Continual Learning)을 가속화하기 위한 새로운 IMC 시스템인 CLASP를 제안합니다. BEOL 호환 ECRAM 장치를 활용하여 데이터 이동 문제를 해결하고, 기존 GPU 학습 대비 67배 빠른 속도와 132배의 에너지 절감을 달성했습니다.
Apple M5의 전용 Neural Accelerator를 활용하여 LLM 추론 성능을 극대화하는 Metal 기반 런타임 BaseRT를 소개합니다. BaseRT는 Metal 4 텐서 API를 통해 행렬 연산을 가속하며, llama.cpp 및 MLX 대비 압도적인 프롬프트 처리량을 제공합니다.
PolySim은 CiM(Compute-in-Memory) 하드웨어에서 확률적 임베딩을 효율적으로 처리하기 위한 결정론적 다항식 대리 모델 프레임워크입니다. 몬테카를로 샘플링 대신 저차 다항식 기저를 사용하여 확률적 정보를 보존하면서도 단일 행렬-벡터 곱셈으로 추론이 가능하게 합니다.
칩렛 기반 AI SoC의 신뢰성을 높이기 위해 기존 KGD 선별 방식을 넘어선 KGRD(Known Good Reliable Die) 선별 방법론을 제안합니다. 베이지안 확률 모델과 제약된 추론을 통해 조립 전 데이터를 바탕으로 조립 후의 고장 가능성을 예측하고 보증하는 연구입니다.
유연 소자(FE) 내 혼성 신호 회로 테스트를 위한 분산 지연 기반 BIST 프레임워크를 제안합니다. IGZO-TFT 기반의 링 발진기와 VCO를 활용하여 기존 설계 대비 면적과 전력을 획기적으로 줄였습니다.
RAG의 병목 현상인 밀집 벡터 검색을 해결하기 위해 하드웨어-소프트웨어 공동 설계된 인-스토리지 가속기 D-NOVA를 제안합니다. NAND 메모리 내부에 검색 기능을 직접 통합하여 데이터 이동을 최소화하고 에너지 효율을 극대화했습니다.
AI 모델의 의도를 제어하기 위해 하드웨어 수준에서 성능을 동적으로 제한하는 새로운 마이크로아키텍처 메커니즘을 제안합니다. L2 캐시 및 공유 메모리 포트 제어를 통해 소프트웨어 보안 우회를 방지하는 최후의 방어선을 구축합니다.
OpenROAD 프로젝트의 일부로 개발된 ORRAM은 표준 셀을 활용하여 RAM 블록을 생성하는 통합 메모리 생성기입니다. PDK에 종속되지 않고 사용자 정의 비트셀 없이도 배치 및 라우팅이 완료된 RAM을 생성하여 ASIC 설계 흐름을 최적화합니다.