Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Ternary LLM의 효율적인 어텐션 연산을 위해 부호 있는 자리수(Signed-Digit) 기반의 통합 룩업 테이블 추론 방식을 제안합니다. K/V 캐시를 스케일링된 다중 평면 방식으로 저장하여 캐시 저장소와 연산 사이의 밀집된 실체화 과정을 생략하고 하드웨어 효율성을 높입니다.
저비트 LLM 추론의 정확도 손실을 줄이기 위해 양자화 이질성을 고려한 새로운 마이크로스케일링 방식인 AdaMX를 제안합니다. AdaMX는 추가적인 비트 폭 증가 없이 블록 및 피연산자별로 최적의 정밀도를 선택하여 정확도를 크게 개선합니다.
검색 기반 희소 어텐션을 지원하기 위해 KV 캐시를 GPU 외부로 재배치하는 범용 PNM 설계인 KARAT을 제안합니다. GPU와 PNM 노드를 분리하여 연산 효율을 높이고, 스케줄링 최적화를 통해 파이프라인 버블을 최소화합니다.
GPU 가속을 통해 미분 가능한 스위칭 전력 분석 및 최적화를 수행하는 DiffPower 프레임워크를 소개합니다. 바이트코드 표현과 자동 미분을 활용하여 CPU 대비 최대 1,002배 빠른 속도와 높은 정확도를 달성했습니다.
ComFuse는 현대적 GPU 아키텍처를 위해 연산 집약적 연산자와 메모리 집약적 서브그래프를 결합하는 새로운 자동화된 GPU 컴파일 시스템입니다. 기존 컴파일러의 경직된 융합 경계를 극복하여 연산과 메모리 작업을 동시에 실행함으로써 성능을 최적화합니다.
3D 중성 원자 양자 컴퓨터를 위한 새로운 컴파일러 프레임워크인 Piqasso를 소개합니다. 기존 평면 구조의 한계를 넘어 수직축을 활용함으로써 원자 수송 거리를 단축하고 실행 속도와 충실도를 크게 향상시켰습니다.
3D Gaussian Splatting(3DGS) 가속기의 확장성 문제를 해결하기 위해 분리된 데이터플로우를 사용하는 DeGS 아키텍처를 제안합니다. 워크로드 파싱과 재구성을 통해 PE 활용도를 높여 기존 가속기 대비 높은 처리량과 에너지 효율을 달성했습니다.
LLM 추론 시 가중치와 활성화의 이중 희소성을 효율적으로 처리하기 위한 Celty 시스템을 제안합니다. RLC-CSC 포맷과 Sparse SIMT 마이크로아키텍처를 공동 설계하여 메모리 액세스를 최적화하고 추론 속도를 대폭 향상했습니다.
LEAP는 VLSI 설계의 전력 분석 효율성을 높이기 위해 제안된 자기 지도 학습 기반의 사이클별 토글 전파 예측 모델입니다. 그래프 트랜스포머를 활용하여 기존 EDA 도구보다 7.6배 빠른 속도와 높은 정확도를 동시에 달성했습니다.
Oasis는 Parquet 파일 디코딩을 네트워크 데이터 패스 상의 SmartNIC로 오프로드하여 쿼리 성능을 개선하는 시스템입니다. 디코딩 작업을 하드웨어 가속기로 처리함으로써 CPU 부하를 줄이고 스캔 작업을 다른 쿼리 실행과 중첩시켜 처리량을 극대화합니다.
데이터센터 워크로드에서 메모리 대역폭 낭비를 줄이기 위한 새로운 하드웨어-소프트웨어 인터페이스인 Themis를 제안합니다. 소프트웨어가 페이지 수준의 힌트를 제공하여 하드웨어 프리페처의 부정확한 액세스를 필터링함으로써 성능을 최적화합니다.
MNIST 분류에 최적화된 시분할 방식의 SNN 가속기 설계 및 FPGA 구현에 관한 연구입니다. 파이프라인형 판독 모듈과 시분할 스파이크 피딩 메커니즘을 통해 FPGA의 물리적 제약을 극복하고 성능을 크게 향상시켰습니다.
커스텀 8단계 RISC-V 소프트 프로세서에서 FreeRTOS를 구현하고 RV32와 RV64 간의 지연 시간 차이를 분석한 연구입니다. RV64가 트랩 프레임 및 데이터 구조 확장으로 인해 태스크 스위칭과 선점에서 더 높은 오버헤드를 보임을 입증했습니다.
멀티 다이 GPU 시스템에서 발생하는 비균일 네트워크 액세스(NUNA) 문제를 해결하기 위한 새로운 연구를 소개합니다. NUNA 인식 라우팅(NAR)과 배치(NAP) 기술을 통해 GPU 간 통신 지연을 최적화하고 머신러닝 추론 성능을 향상시킵니다.
머신러닝 기반 예측기가 프로세서 성능 추정에서 보이는 한계를 분석한 연구입니다. 구조적 파라미터와 행동 정책 영역에서 ML 모델이 직관에 반하는 결과를 내거나 미세한 성능 차이를 구분하지 못하는 문제를 정보 이론적 관점에서 규명합니다.
현대 프로세서의 다양한 마이크로아키텍처 정책(프리페처, 교체 규칙 등) 간의 상호작용과 동적 선택 가능성을 연구한 논문입니다. SPEC CPU 벤치마크를 통해 정적 정책의 한계를 분석하고, 실행 성능 피드백과 수동 수요 모니터링을 통한 효율적인 정책 선택 메커니즘을 제안합니다.
차세대 가속기를 위한 에이전트 기반 커널 생성 프레임워크인 Zomboss를 제안합니다. 컴파일러의 심볼릭 인터페이스를 활용해 신경망 에이전트가 검증된 설계 공간 내에서 워크로드별 최적의 매핑을 결정하도록 합니다.
LLM이 금융 컴퓨팅용 FPGA 하드웨어 설계를 수행할 수 있는지 평가하는 벤치마크 FinHardBench를 제안합니다. 실험 결과, LLM은 시스템 수준의 설계 공간 탐색(DSE)에서 기존 최적화 알고리즘보다 높은 신뢰성을 보였으나, 코드 생성 성능과 아키텍처 최적화 성능 사이에는 차이가 있었습니다.
Forbench는 시뮬레이션의 직관성과 형식 검증의 수학적 엄격함을 결합한 심볼릭 시뮬레이션 프레임워크입니다. 기존 시뮬레이션의 한계인 코너 케이스 탐색 문제를 해결하며, Python 인터페이스를 통해 사용 편의성과 검증 속도를 대폭 향상시켰습니다.
대역폭이 제한된 환경에서 FPGA를 활용한 효율적인 스트리밍 추론을 위한 CascadeLUT 프레임워크를 제안합니다. 특징을 순서 있는 하위 집합으로 분할하여 점진적으로 예측을 정교화함으로써 데이터 이동을 최소화하고 지연 시간을 대폭 단축합니다.