Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
데이터센터 워크로드에서 메모리 대역폭 낭비를 줄이기 위한 새로운 하드웨어-소프트웨어 인터페이스인 Themis를 제안합니다. 소프트웨어가 페이지 수준의 힌트를 제공하여 하드웨어 프리페처의 부정확한 액세스를 필터링함으로써 성능을 최적화합니다.
MNIST 분류에 최적화된 시분할 방식의 SNN 가속기 설계 및 FPGA 구현에 관한 연구입니다. 파이프라인형 판독 모듈과 시분할 스파이크 피딩 메커니즘을 통해 FPGA의 물리적 제약을 극복하고 성능을 크게 향상시켰습니다.
커스텀 8단계 RISC-V 소프트 프로세서에서 FreeRTOS를 구현하고 RV32와 RV64 간의 지연 시간 차이를 분석한 연구입니다. RV64가 트랩 프레임 및 데이터 구조 확장으로 인해 태스크 스위칭과 선점에서 더 높은 오버헤드를 보임을 입증했습니다.
멀티 다이 GPU 시스템에서 발생하는 비균일 네트워크 액세스(NUNA) 문제를 해결하기 위한 새로운 연구를 소개합니다. NUNA 인식 라우팅(NAR)과 배치(NAP) 기술을 통해 GPU 간 통신 지연을 최적화하고 머신러닝 추론 성능을 향상시킵니다.
머신러닝 기반 예측기가 프로세서 성능 추정에서 보이는 한계를 분석한 연구입니다. 구조적 파라미터와 행동 정책 영역에서 ML 모델이 직관에 반하는 결과를 내거나 미세한 성능 차이를 구분하지 못하는 문제를 정보 이론적 관점에서 규명합니다.
현대 프로세서의 다양한 마이크로아키텍처 정책(프리페처, 교체 규칙 등) 간의 상호작용과 동적 선택 가능성을 연구한 논문입니다. SPEC CPU 벤치마크를 통해 정적 정책의 한계를 분석하고, 실행 성능 피드백과 수동 수요 모니터링을 통한 효율적인 정책 선택 메커니즘을 제안합니다.
차세대 가속기를 위한 에이전트 기반 커널 생성 프레임워크인 Zomboss를 제안합니다. 컴파일러의 심볼릭 인터페이스를 활용해 신경망 에이전트가 검증된 설계 공간 내에서 워크로드별 최적의 매핑을 결정하도록 합니다.
LLM이 금융 컴퓨팅용 FPGA 하드웨어 설계를 수행할 수 있는지 평가하는 벤치마크 FinHardBench를 제안합니다. 실험 결과, LLM은 시스템 수준의 설계 공간 탐색(DSE)에서 기존 최적화 알고리즘보다 높은 신뢰성을 보였으나, 코드 생성 성능과 아키텍처 최적화 성능 사이에는 차이가 있었습니다.
Forbench는 시뮬레이션의 직관성과 형식 검증의 수학적 엄격함을 결합한 심볼릭 시뮬레이션 프레임워크입니다. 기존 시뮬레이션의 한계인 코너 케이스 탐색 문제를 해결하며, Python 인터페이스를 통해 사용 편의성과 검증 속도를 대폭 향상시켰습니다.
대역폭이 제한된 환경에서 FPGA를 활용한 효율적인 스트리밍 추론을 위한 CascadeLUT 프레임워크를 제안합니다. 특징을 순서 있는 하위 집합으로 분할하여 점진적으로 예측을 정교화함으로써 데이터 이동을 최소화하고 지연 시간을 대폭 단축합니다.
아날로그 Compute-In-Memory(CIM) 시스템에서 LLM 추론 시 발생하는 하드웨어 노이즈 문제를 해결하기 위한 연구입니다. 중요 토큰은 디지털로 처리하고 대량의 KV 캐시는 아날로그로 처리하는 계층적 보호 전략을 제안합니다.
LLM과 오픈 소스 형식 검증 도구를 결합하여 RTL 설계를 자동으로 수정하는 멀티 에이전트 파이프라인을 제안합니다. 반례 유도 반복 방식을 통해 수학적 증명과 함께 하드웨어 버그를 탐지하고 수정하는 연구 결과를 담고 있습니다.
KV-Cache 양자화 과정에서 발생하는 런타임 리스크를 실시간으로 관측하고 관리할 수 있는 WitCert 프레임워크를 제안합니다. 이 시스템은 수학적으로 증명 가능한 상한선을 통해 양자화로 인한 정보 손실을 측정하고, 필요 시 품질을 복구하는 게이팅 메커니즘을 제공합니다.
유연한 전자 공학(FE) 플랫폼을 위해 a-IGZO TFT 기술을 활용한 저전력 PLL 기반 클록 안정화 기술을 제안합니다. 기존 발진기 방식의 전력 소모와 PVT 드리프트 문제를 해결하여, 매우 낮은 전력과 면적으로 안정적인 클록 생성을 가능하게 합니다.
멀티 파티션 NUMA GPU 환경에서 LLM 커널의 메모리 액세스 및 데이터 상호작용 특성을 분석한 연구입니다. 메모리 트레이스 분석과 시뮬레이션을 통해 워크그룹 간 데이터 공유 패턴을 분류하고, 지연 시간 최적화를 위한 다양한 스케줄링 전략을 제안합니다.
RTL 코드 생성을 위한 LLM 학습 데이터의 품질을 높이는 RTLCurator를 제안합니다. 단순히 정확성만으로 데이터를 필터링하는 대신, 동작 인식 호환성을 학습하여 데이터의 구조적 풍부함과 정렬을 유지하며 효율적인 데이터 큐레이션을 수행합니다.
에지 비전 시스템의 전력 및 대역폭 제약을 해결하기 위한 저전력 희소 합성곱 가속기를 제안합니다. IFTA 스케줄링과 비트맵 기반 압축 방식을 통해 연산 효율을 높였으며, 16nm 공정에서 검증되었습니다.
임피던스 네트워크를 활용한 아날로그 컴퓨팅에서 연산 속도를 제한하는 동역학적 제약 조건을 분석한 연구입니다. CUGBW를 통해 아날로그 하드웨어가 물리적으로 처리 가능한 연산자 속도의 경계를 정의하며, 다양한 회로 아키텍처와 시뮬레이션을 통해 이를 검증했습니다.
CircuitProver는 Lean 4를 기반으로 하드웨어 설계와 자연어 사양을 자동 변환하여 검증하는 에이전트 기반 프레임워크입니다. 증명 지식을 라이브러리로 축적하여 재사용함으로써 검증 효율성을 높이고, 하드웨어 정리 증명을 위한 최초의 벤치마크를 함께 제시합니다.
GyRot은 저비트 LLM 추론을 위해 회전(Rotation)과 미세 그룹 양자화를 결합한 새로운 알고리즘-하드웨어 공동 설계 프레임워크입니다. CoRFiG와 HAP 기술을 통해 양자화 정확도를 높이고 하드웨어 오버헤드를 최소화하여 효율적인 LLM 배포를 가능하게 합니다.