Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
데이터센터 워크로드에서 메모리 대역폭 낭비를 줄이기 위한 새로운 하드웨어-소프트웨어 인터페이스인 Themis를 제안합니다. 소프트웨어가 페이지 수준의 힌트를 제공하여 하드웨어 프리페처의 부정확한 액세스를 필터링함으로써 성능을 최적화합니다.
MNIST 분류에 최적화된 시분할 방식의 SNN 가속기 설계 및 FPGA 구현에 관한 연구입니다. 파이프라인형 판독 모듈과 시분할 스파이크 피딩 메커니즘을 통해 FPGA의 물리적 제약을 극복하고 성능을 크게 향상시켰습니다.
멀티 다이 GPU 시스템에서 발생하는 비균일 네트워크 액세스(NUNA) 문제를 해결하기 위한 새로운 연구를 소개합니다. NUNA 인식 라우팅(NAR)과 배치(NAP) 기술을 통해 GPU 간 통신 지연을 최적화하고 머신러닝 추론 성능을 향상시킵니다.
아날로그 Compute-In-Memory(CIM) 시스템에서 LLM 추론 시 발생하는 하드웨어 노이즈 문제를 해결하기 위한 연구입니다. 중요 토큰은 디지털로 처리하고 대량의 KV 캐시는 아날로그로 처리하는 계층적 보호 전략을 제안합니다.
유연한 전자 공학(FE) 플랫폼을 위해 a-IGZO TFT 기술을 활용한 저전력 PLL 기반 클록 안정화 기술을 제안합니다. 기존 발진기 방식의 전력 소모와 PVT 드리프트 문제를 해결하여, 매우 낮은 전력과 면적으로 안정적인 클록 생성을 가능하게 합니다.
에지 비전 시스템의 전력 및 대역폭 제약을 해결하기 위한 저전력 희소 합성곱 가속기를 제안합니다. IFTA 스케줄링과 비트맵 기반 압축 방식을 통해 연산 효율을 높였으며, 16nm 공정에서 검증되었습니다.
DRAM의 신뢰성을 위협하는 RowHammer 및 RowPress 현상의 물리적 메커니즘을 분석한 연구입니다. 기존 소자 모델과 실험적 결과 사이의 격차를 해소하기 위해 TCAD 시뮬레이션을 활용하여 비트 플립의 원인을 규명하고 완화 방안을 제시합니다.
LLM 서빙의 에너지 효율을 높이기 위해 차세대 M3D 메모리 기술을 활용한 교차 계층 시뮬레이션 프레임워크 LLMET을 제안합니다. 연구 결과, 온칩 캐시 용량을 확장함으로써 데이터 이동을 줄여 GPU 환경 및 엣지 플랫폼에서 상당한 에너지 절감 효과를 거둘 수 있음을 입증했습니다.
MDTransformer는 모드 분할 광학 기술을 활용하여 트랜스포머 추론을 가속화하는 새로운 하드웨어-소프트웨어 공동 설계 방식입니다. 역설계된 광학 텐서 코어를 통해 기존 광학 가속기 대비 면적, 전력 및 에너지 효율을 획기적으로 개선했습니다.
벡터 프로세서에서 Transformer 추론 성능을 극대화하기 위한 Ventaglio 아키텍처를 제안합니다. RVV ISA 확장을 통해 희소 텐서 수축을 Roofline 성능 한계치까지 끌어올려 LLaMA-3-8B 모델의 추론 속도를 크게 향상시켰습니다.
65nm 단일 폴리 플로팅 게이트 아날로그 인메모리 컴퓨팅에서 발생하는 데이터 유지 손실 문제를 회로 및 알고리즘 수준의 기술로 완화하는 연구입니다. 실험 결과, 프로그래밍 60일 후에도 추론 정확도를 기준치 대비 2-4% 이내로 유지할 수 있음을 입증했습니다.
MCTS 알고리즘의 각 단계를 하드웨어 네이티브 IMC 프리미티브로 재구성하여 에너지 효율을 극대화하는 기술을 소개합니다. 22nm 공정 기반의 IMC-MCTS는 기존 CPU 및 H100 GPU 대비 압도적인 에너지 효율을 달성하며 에지 배포 가능성을 입증했습니다.
Pascal부터 Blackwell까지 NVIDIA GPU 아키텍처의 워프 분기(Warp Divergence) 처리 방식을 분석한 연구입니다. 분기 비용은 아키텍처와 무관하게 경로 수에 따라 선형적으로 증가하며, 재수렴 메커니즘의 진화 과정을 상세히 다룹니다.
SpiNNaker2는 딥러닝과 뉴로모픽 컴퓨팅의 간극을 메우기 위해 설계된 멀티코어 뇌 모방 플랫폼입니다. ARM M4F 프로세서와 전용 가속기를 탑재하여 높은 에너지 효율성과 확장 가능한 이벤트 기반 통신을 제공합니다.
대규모 SoC 내 하드웨어 트로이잔을 탐지하기 위해 And-Inverter Graph(AIG)와 지식 그래프 임베딩(KGE)을 결합한 새로운 접근 방식을 제안합니다. 이 방법은 회로 구조를 효율적으로 모델링하여 대규모 환경에서도 선형적인 복잡도로 트로이잔을 식별할 수 있는 확장성을 제공합니다.
멀티태스크 추론 시 불필요한 연산을 줄이기 위해 명령어 기반의 태스크 조건부 연산 건너뛰기 기술을 제안합니다. HW/SW 공동 설계를 통해 모델 변경 없이도 에너지 효율과 추론 속도를 대폭 개선했습니다.
LLM 디코딩 시 발생하는 KV 캐시 메모리 병목을 해결하기 위해 알고리즘과 하드웨어를 공동 설계한 HiKV를 제안합니다. 계층적 중요도 인식을 통해 KV 캐시를 압축하며, 전용 가속기를 통해 성능과 에너지 효율을 극대화했습니다.
RISC-V의 Zfh 및 Zvfh 확장을 활용하여 자원이 제한된 싱글 코어에서 float16 기반 온디바이스 학습을 구현하는 프레임워크를 제안합니다. float32 대비 메모리 사용량을 50% 절감하면서도 모델 성능 저하를 최소화하는 하드웨어-소프트웨어 공동 설계 방식을 다룹니다.
엣지 컴퓨팅 환경에서 지속 학습(Continual Learning)을 가속화하기 위한 새로운 IMC 시스템인 CLASP를 제안합니다. BEOL 호환 ECRAM 장치를 활용하여 데이터 이동 문제를 해결하고, 기존 GPU 학습 대비 67배 빠른 속도와 132배의 에너지 절감을 달성했습니다.
Apple M5의 전용 Neural Accelerator를 활용하여 LLM 추론 성능을 극대화하는 Metal 기반 런타임 BaseRT를 소개합니다. BaseRT는 Metal 4 텐서 API를 통해 행렬 연산을 가속하며, llama.cpp 및 MLX 대비 압도적인 프롬프트 처리량을 제공합니다.