Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
저비트 LLM 추론의 에너지 효율과 정확도를 높이기 위한 새로운 회전 방식 및 하드웨어 가속기 LightRot을 제안합니다. FHT 기반 회전 유닛과 GLR, ODA 알고리즘을 통해 LLaMA2/3 모델에서 뛰어난 성능과 에너지 효율을 입증했습니다.
금속 나노입자 네트워크를 활용하여 에너지 효율적인 뉴로모픽 아키텍처를 제안하는 연구입니다. 정적 제어 전극을 통해 수동적 리저버를 튜닝 가능한 비선형 동적 시스템으로 변환하며, 계산 성능 극대화를 위한 세 가지 핵심 설계 규칙을 제시합니다.
LLM 에이전트를 활용해 RTL 설계의 PPA(전력, 성능, 면적)를 최적화하는 Ares를 제안합니다. 비용 효율성을 위해 추론 노력을 적응적으로 조절하며, 기존 방식 대비 낮은 비용으로 높은 최적화 성능을 달성합니다.
DRAM의 신뢰성을 위협하는 RowHammer 및 RowPress 현상의 물리적 메커니즘을 분석한 연구입니다. 기존 소자 모델과 실험적 결과 사이의 격차를 해소하기 위해 TCAD 시뮬레이션을 활용하여 비트 플립의 원인을 규명하고 완화 방안을 제시합니다.
NELSSA는 GPU와 PNM(Processing-near-Memory)을 통합하여 혼합 길이 LLM 워크로드를 효율적으로 처리하는 시스템을 제안합니다. 요청 길이에 따라 GPU와 PNM으로 라우팅하고 런타임 마이그레이션을 통해 동적 컨텍스트 성장에 대응합니다.
LLM 서빙의 에너지 효율을 높이기 위해 차세대 M3D 메모리 기술을 활용한 교차 계층 시뮬레이션 프레임워크 LLMET을 제안합니다. 연구 결과, 온칩 캐시 용량을 확장함으로써 데이터 이동을 줄여 GPU 환경 및 엣지 플랫폼에서 상당한 에너지 절감 효과를 거둘 수 있음을 입증했습니다.
에지 비전 시스템의 전력 및 대역폭 제약을 해결하기 위한 저전력 희소 합성곱 가속기를 제안합니다. IFTA 동적 스케줄링과 비트맵 기반 압축 형식을 통해 연산 효율을 높였으며, 16nm 공정에서 검증되었습니다.
엣지 컴퓨팅의 자원 제한 및 불안정한 환경을 고려하여, 시스템 단위가 아닌 개별 기능 단위의 안정성을 정의하는 새로운 프레임워크를 제안합니다. 연속적인 품질 함수와 정량적 지표를 통해 기존의 이진적 신뢰성 모델이 포착하지 못하는 서비스 품질 요구사항을 정밀하게 분석합니다.
HLS 설계를 위해 계약 정렬형 멀티 에이전트 워크플로우인 ContractHIL-HLS를 제안합니다. 자연어 요구사항을 구조화된 계약으로 변환하고, 하드웨어 피드백 루프를 통해 설계의 정확도와 성능을 최적화합니다.
MDTransformer는 모드 분할 광학 기술을 활용하여 트랜스포머 추론을 가속화하는 새로운 하드웨어-소프트웨어 공동 설계 방식입니다. 역설계된 광학 텐서 코어를 통해 기존 광학 가속기 대비 면적, 전력 및 에너지 효율을 획기적으로 개선했습니다.
벡터 프로세서에서 Transformer 추론 성능을 극대화하기 위한 Ventaglio 아키텍처를 제안합니다. RVV ISA 확장을 통해 희소 텐서 수축을 Roofline 성능 한계치까지 끌어올려 LLaMA-3-8B 모델의 추론 속도를 크게 향상시켰습니다.
65nm 단일 폴리 플로팅 게이트 아날로그 인메모리 컴퓨팅에서 발생하는 데이터 유지 손실 문제를 회로 및 알고리즘 수준의 기술로 완화하는 연구입니다. 실험 결과, 프로그래밍 60일 후에도 추론 정확도를 기준치 대비 2-4% 이내로 유지할 수 있음을 입증했습니다.
LLM 추론 성능을 최적화하기 위해 연산자 스케줄링과 가중치 레이아웃을 공동 최적화하는 DOPS 프레임워크를 제안합니다. NPU와 PIM 등 이기종 하드웨어 환경에서 Prefill-Decode 분리 방식보다 뛰어난 속도 향상을 입증했습니다.
VPR-Evolve는 LLM 멀티 에이전트를 활용하여 FPGA 배치 및 라우팅 엔진인 VPR의 소스 코드를 설계별로 최적화하는 프레임워크입니다. 하이퍼파라미터 튜닝을 넘어 코드 수준의 진화를 통해 회로 성능과 도구 실행 시간을 획기적으로 개선합니다.
MCTS 알고리즘의 각 단계를 하드웨어 네이티브 IMC 프리미티브로 재구성하여 에너지 효율을 극대화하는 기술을 소개합니다. 22nm 공정 기반의 IMC-MCTS는 기존 CPU 및 H100 GPU 대비 압도적인 에너지 효율을 달성하며 에지 배포 가능성을 입증했습니다.
배터리가 없는 간헐적 컴퓨팅 시스템의 시간 유지를 위해 스핀트로닉스 메모리인 MTJ의 확률적 유지 손실을 활용한 FLINT 기술을 제안합니다. 기존 커패시터 방식보다 에너지 효율이 11배 높고 면적은 작으면서도, 소자 노화에 영향을 받지 않고 정밀한 시간 추적이 가능합니다.
MoE 추론 시 발생하는 라우팅 분포 왜곡 문제를 해결하기 위한 분포 인식 프레임워크와 DA-MoE 런타임을 제안합니다. 실시간 라우팅 히스토그램을 활용해 최적의 fused-MoE 커널을 선택함으로써 DeepSeek-V3 등에서 추론 지연 시간을 크게 개선했습니다.
CircuitWeave는 텍스트 명세와 회로도(Schematics)를 결합하여 실행 가능한 RTL을 생성하는 멀티모달 프레임워크입니다. 회로의 토폴로지와 동작 계약을 통합한 '회로 계약'을 통해 텍스트 기반 LLM의 구조적 한계를 극복합니다.
SPARC은 프리실리콘 단계에서 프로세서의 전력 부채널 누설(PSCL)을 자동으로 탐지하고 근본 원인을 분석하는 프레임워크입니다. 정보 흐름 추적(IFT) 기술을 통해 누설을 특정 하드웨어 신호와 소프트웨어 명령어로 매핑하며, 기존 방식보다 8배 빠른 시뮬레이션 속도를 제공합니다.
Pascal부터 Blackwell까지 NVIDIA GPU 아키텍처의 워프 분기(Warp Divergence) 처리 방식을 분석한 연구입니다. 분기 비용은 아키텍처와 무관하게 경로 수에 따라 선형적으로 증가하며, 재수렴 메커니즘의 진화 과정을 상세히 다룹니다.