Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
물리적 AI 시스템의 Batch-1 디코딩 워크로드가 단순히 메모리 대역폭에만 의존하지 않음을 분석합니다. NVIDIA H100과 L4 GPU 비교를 통해 고성능 GPU일수록 런치 사이드 오버헤드가 지연 시간에 미치는 영향이 크다는 점을 밝혀냈습니다.
MixFP4는 NVFP4의 한계를 극복하기 위해 제안된 적응형 FP4/INT4 혼합 마이크로 포맷 기술입니다. 추가 메타데이터 없이 E2M1과 E1M2 포맷을 선택적으로 사용하여 LLM 양자화의 정확도와 견고성을 높입니다.
elasticAI.explorer는 하드웨어 제약 조건을 고려한 신경망 구조 탐색(NAS)을 위한 통합 Python 프레임워크입니다. YAML 기반 명세와 Docker 기반 툴체인을 통해 모델 설계부터 온디바이스 벤치마킹까지의 전 과정을 자동화합니다.
제한된 GPU 메모리 환경에서 대규모 MoE 모델을 효율적으로 실행하기 위한 Rotary GPU 방식을 제안합니다. 소비자용 노트북 환경에서 Qwen3.6-35B-A3B 모델을 성공적으로 로컬 실행하며 배포 접근성을 탐색했습니다.
초소형 스마트 센서 시스템을 위해 LUT 기반 사전 계산 방식을 적용한 1D-CNN 최적화 연구를 소개합니다. 그룹화된 합성곱을 활용해 확장성 문제를 개선하고, FPGA 상에서 DSP나 BRAM 없이도 높은 정확도로 심방세동을 탐지하는 하드웨어 가속기 구현 방법을 제안합니다.
FPGA 설계 시 버려지는 시뮬레이션 메타데이터와 구조적 특징을 결합하여 전력을 최적화하는 Context-aware Simopt-Power 프레임워크를 제안합니다. 기존 방식의 면적 오버헤드 문제를 해결하며, 아키텍처 인식 파라미터를 통해 전력과 지연 시간 간의 효율적인 트레이드오프를 달성합니다.
하드웨어 설계 사양으로부터 SystemVerilog Assertions(SVAs)를 자동 생성하기 위한 새로운 오픈 소스 벤치마크 AssertLLM2를 소개합니다. 기존 벤치마크의 한계를 극복하여 실제 설계 데이터와 버그가 포함된 RTL을 활용한 엄격한 평가 프레임워크를 제공합니다.
대규모 AI 워크로드의 DRAM 저활용 문제를 해결하기 위해 CXL 기반 분리형 메모리 클러스터를 모델링하는 CXL-ClusterSim 프레임워크를 제안합니다. gem5와 SST를 결합하여 확장성과 유연성을 갖춘 풀 시스템 시뮬레이션 환경을 구축했습니다.
HZO 강유전체 멤커패시터를 활용하여 비휘발성 전하 영역 어텐션 연산을 수행하는 FCDC 소자를 제안합니다. 시뮬레이션 결과, LLM의 성능 저하를 최소화하면서도 기존 GPU 대비 에너지 효율을 획기적으로 높일 수 있음을 입증했습니다.
FT-Pilot은 GNN과 LLM을 결합하여 RTL 설계의 소프트 에러 취약성을 자동으로 식별하고 수정하는 프레임워크입니다. RAG 기술을 활용해 결함 허용(Fault-tolerant) 코드를 자동으로 재작성함으로써 설계 초기 단계의 신뢰성 최적화를 지원합니다.
2.5D SiP 설계 시 칩렛 링크 IP의 PPA를 추정하고 생성할 수 있는 CLIPGen 프레임워크를 제안합니다. 상위 수준 시뮬레이션부터 RTL 구현에 필요한 표준 부수 자료까지 자동 생성하여 아키텍처 최적화를 지원합니다.
RowHammer 취약점 분석을 위해 gem5 기반의 전체 시스템 레벨 모델링 프레임워크인 HammerSim을 제안합니다. 확률 기반 비트플립 모델링을 통해 하드웨어 및 소프트웨어 완화 기술을 효과적으로 평가할 수 있습니다.
AMD ACAP 플랫폼에서 마이크로초 단위의 초저지연 DNN 추론을 구현하기 위한 μ-ORCA 프레임워크를 제안합니다. 계층 간 직접 통신과 캐스케이드 연결을 통해 기존 프레임워크의 지연 시간 문제를 해결하고 최적화된 성능을 제공합니다.
Cassandra는 엣지 기기에서의 효율적인 LLM 추론을 위해 알고리즘과 하드웨어를 공동 설계한 자기 투기적 디코딩 프레임워크입니다. 추가 학습 없이도 미세한 데이터 선택과 가중치 최적화를 통해 저배치 시나리오에서 높은 추론 속도를 제공합니다.
자원 제약이 있는 하드웨어를 위한 매우 큰 상수 곱셈(VLCM) 문제를 해결하기 위한 새로운 연구를 소개합니다. 기존의 휴리스틱 방식 대신 선언적 최적화 모델과 제약 프로그래밍을 결합하여 패턴 분해 및 재구성 과정을 최적화했습니다.
긴 문맥 LLM 추론 시 발생하는 TTFT 지연을 해결하기 위해 KV Cache 재사용 시스템인 CacheTune을 제안합니다. 주파수 영역 분석을 통해 핵심 토큰을 식별하고 하드웨어 인식형 최적화를 결합하여 생성 품질 저하 없이 성능을 극대화합니다.
이벤트 기반 모션 추정을 위한 CMAX-CAMEL 프레임워크를 제안합니다. 런타임 적응형 실행 전략과 메모리 중심 아키텍처를 통해 계산 효율성을 높이고 엣지 디바이스에서의 실시간 저전력 처리를 구현했습니다.
Direct-mapped 멀티코어 아키텍처에서 공유 자원 간섭에 대한 공식적인 경계 분석을 제시합니다. 특정 아키텍처 불변량 하에서 액세스당 스톨의 상한선을 증명하며, 이는 항공 소프트웨어 인증을 위한 WCET 분석에 활용될 수 있습니다.
LLM 디코딩의 메모리 병목 현상을 해결하기 위해 벡터 양자화(VQ)를 활용한 새로운 아키텍처 EVA를 제안합니다. EVA는 입력-코드북 간 직접 내적을 통해 디코딩을 GEMM 연산으로 변환하고 메모리 충돌을 제거하여 성능을 극대화합니다.
MX-SAFE는 실시간 지수 및 가수 비트 할당을 통해 학습과 추론 모두를 지원하는 다목적 마이크로스케일링(MX) 포맷입니다. 적응형 모드와 타일 기반 블록 설계를 통해 정확도를 높이고 하드웨어 에너지 효율을 개선했습니다.