Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
커스텀 8단계 RISC-V 소프트 프로세서에서 FreeRTOS를 구현하고 RV32와 RV64 간의 지연 시간 차이를 분석한 연구입니다. RV64가 트랩 프레임 및 데이터 구조 확장으로 인해 태스크 스위칭과 선점에서 더 높은 오버헤드를 보임을 입증했습니다.
머신러닝 기반 예측기가 프로세서 성능 추정에서 보이는 한계를 분석한 연구입니다. 구조적 파라미터와 행동 정책 영역에서 ML 모델이 직관에 반하는 결과를 내거나 미세한 성능 차이를 구분하지 못하는 문제를 정보 이론적 관점에서 규명합니다.
현대 프로세서의 다양한 마이크로아키텍처 정책(프리페처, 교체 규칙 등) 간의 상호작용과 동적 선택 가능성을 연구한 논문입니다. SPEC CPU 벤치마크를 통해 정적 정책의 한계를 분석하고, 실행 성능 피드백과 수동 수요 모니터링을 통한 효율적인 정책 선택 메커니즘을 제안합니다.
차세대 가속기를 위한 에이전트 기반 커널 생성 프레임워크인 Zomboss를 제안합니다. 컴파일러의 심볼릭 인터페이스를 활용해 신경망 에이전트가 검증된 설계 공간 내에서 워크로드별 최적의 매핑을 결정하도록 합니다.
LLM이 금융 컴퓨팅용 FPGA 하드웨어 설계를 수행할 수 있는지 평가하는 벤치마크 FinHardBench를 제안합니다. 실험 결과, LLM은 시스템 수준의 설계 공간 탐색(DSE)에서 기존 최적화 알고리즘보다 높은 신뢰성을 보였으나, 코드 생성 성능과 아키텍처 최적화 성능 사이에는 차이가 있었습니다.
Forbench는 시뮬레이션의 직관성과 형식 검증의 수학적 엄격함을 결합한 심볼릭 시뮬레이션 프레임워크입니다. 기존 시뮬레이션의 한계인 코너 케이스 탐색 문제를 해결하며, Python 인터페이스를 통해 사용 편의성과 검증 속도를 대폭 향상시켰습니다.
대역폭이 제한된 환경에서 FPGA를 활용한 효율적인 스트리밍 추론을 위한 CascadeLUT 프레임워크를 제안합니다. 특징을 순서 있는 하위 집합으로 분할하여 점진적으로 예측을 정교화함으로써 데이터 이동을 최소화하고 지연 시간을 대폭 단축합니다.
LLM과 오픈 소스 형식 검증 도구를 결합하여 RTL 설계를 자동으로 수정하는 멀티 에이전트 파이프라인을 제안합니다. 반례 유도 반복 방식을 통해 수학적 증명과 함께 하드웨어 버그를 탐지하고 수정하는 연구 결과를 담고 있습니다.
KV-Cache 양자화 과정에서 발생하는 런타임 리스크를 실시간으로 관측하고 관리할 수 있는 WitCert 프레임워크를 제안합니다. 이 시스템은 수학적으로 증명 가능한 상한선을 통해 양자화로 인한 정보 손실을 측정하고, 필요 시 품질을 복구하는 게이팅 메커니즘을 제공합니다.
멀티 파티션 NUMA GPU 환경에서 LLM 커널의 메모리 액세스 및 데이터 상호작용 특성을 분석한 연구입니다. 메모리 트레이스 분석과 시뮬레이션을 통해 워크그룹 간 데이터 공유 패턴을 분류하고, 지연 시간 최적화를 위한 다양한 스케줄링 전략을 제안합니다.
RTL 코드 생성을 위한 LLM 학습 데이터의 품질을 높이는 RTLCurator를 제안합니다. 단순히 정확성만으로 데이터를 필터링하는 대신, 동작 인식 호환성을 학습하여 데이터의 구조적 풍부함과 정렬을 유지하며 효율적인 데이터 큐레이션을 수행합니다.
임피던스 네트워크를 활용한 아날로그 컴퓨팅에서 연산 속도를 제한하는 동역학적 제약 조건을 분석한 연구입니다. CUGBW를 통해 아날로그 하드웨어가 물리적으로 처리 가능한 연산자 속도의 경계를 정의하며, 다양한 회로 아키텍처와 시뮬레이션을 통해 이를 검증했습니다.
CircuitProver는 Lean 4를 기반으로 하드웨어 설계와 자연어 사양을 자동 변환하여 검증하는 에이전트 기반 프레임워크입니다. 증명 지식을 라이브러리로 축적하여 재사용함으로써 검증 효율성을 높이고, 하드웨어 정리 증명을 위한 최초의 벤치마크를 함께 제시합니다.
GyRot은 저비트 LLM 추론을 위해 회전(Rotation)과 미세 그룹 양자화를 결합한 새로운 알고리즘-하드웨어 공동 설계 프레임워크입니다. CoRFiG와 HAP 기술을 통해 양자화 정확도를 높이고 하드웨어 오버헤드를 최소화하여 효율적인 LLM 배포를 가능하게 합니다.
저비트 LLM 추론의 에너지 효율과 정확도를 높이기 위한 새로운 회전 방식 및 하드웨어 가속기 LightRot을 제안합니다. FHT 기반 회전 유닛과 GLR, ODA 알고리즘을 통해 LLaMA2/3 모델에서 뛰어난 성능과 에너지 효율을 입증했습니다.
금속 나노입자 네트워크를 활용하여 에너지 효율적인 뉴로모픽 아키텍처를 제안하는 연구입니다. 정적 제어 전극을 통해 수동적 리저버를 튜닝 가능한 비선형 동적 시스템으로 변환하며, 계산 성능 극대화를 위한 세 가지 핵심 설계 규칙을 제시합니다.
LLM 에이전트를 활용해 RTL 설계의 PPA(전력, 성능, 면적)를 최적화하는 Ares를 제안합니다. 비용 효율성을 위해 추론 노력을 적응적으로 조절하며, 기존 방식 대비 낮은 비용으로 높은 최적화 성능을 달성합니다.
NELSSA는 GPU와 PNM(Processing-near-Memory)을 통합하여 혼합 길이 LLM 워크로드를 효율적으로 처리하는 시스템을 제안합니다. 요청 길이에 따라 GPU와 PNM으로 라우팅하고 런타임 마이그레이션을 통해 동적 컨텍스트 성장에 대응합니다.
에지 비전 시스템의 전력 및 대역폭 제약을 해결하기 위한 저전력 희소 합성곱 가속기를 제안합니다. IFTA 동적 스케줄링과 비트맵 기반 압축 형식을 통해 연산 효율을 높였으며, 16nm 공정에서 검증되었습니다.
엣지 컴퓨팅의 자원 제한 및 불안정한 환경을 고려하여, 시스템 단위가 아닌 개별 기능 단위의 안정성을 정의하는 새로운 프레임워크를 제안합니다. 연속적인 품질 함수와 정량적 지표를 통해 기존의 이진적 신뢰성 모델이 포착하지 못하는 서비스 품질 요구사항을 정밀하게 분석합니다.