Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
에이전트형 AI 워크로드의 높은 에너지 소비 문제를 지적하며, NVIDIA의 최신 Edge AI 하드웨어가 프로세스 단위의 에너지 관측 가능성을 지원하지 않는 문제를 분석합니다. 연구 결과, 현재 플랫폼은 CPU 에너지 정보를 노출하지 않아 정밀한 에너지 귀속이 불가능함을 밝히고 표준화된 요구 사항을 제안합니다.
Apple Silicon에서 FP16을 활용한 고성능 FFT 및 SAR 이미징 구현 방법을 제안합니다. 단순 FP16 사용 시 발생하는 오버플로 문제를 Block-Floating-Point(BFP) 스케줄링으로 해결하여, FP32 수준의 품질을 유지하면서도 처리량을 2.2배 향상시켰습니다.
확산 샘플링의 효율성을 높이는 Kuramoto drift를 가속하기 위한 전용 시스톨릭 어레이인 SA-Kura를 제안합니다. 기존 CNN 가속기가 처리하기 어려운 비선형 스텐실 연산을 최적화하여 지연 시간과 에너지 소모를 획기적으로 줄였습니다.
Posit 수 체계를 위한 에너지 효율적인 근사 곱셈-나눗셈 유닛 설계를 제안합니다. LUT와 단일 뺄셈을 활용해 역수를 근사하며, 기존 설계 대비 면적과 전력 지연 곱(PDP)을 획기적으로 개선했습니다.
AGI 경쟁의 핵심 병목인 AI 데이터 센터의 전력 관리 프로세스를 다룹니다. 150MW 규모의 GB200 GPU 클러스터를 대상으로 초기 계획부터 동적 런타임 최적화까지의 엔드 투 엔드 사례를 제시합니다.
zkVM의 성능 병목인 트레이스 생성 단계를 해결하기 위한 이기종 가속기 아키텍처 ZK-Tracer를 제안합니다. 메인 및 병렬 치환 트레이스 유닛을 통해 효율적인 작업 오프로딩을 지원하며, ASIC 구현 결과 CPU 대비 압도적인 성능 향상을 입증했습니다.
MoE 모델의 온디바이스 배포를 위해 3D NAND 기반의 새로운 CIM 아키텍처인 NASiC을 제안합니다. CAM 기반 마스킹과 멀티비트 CIM 셀을 결합하여 동적 전문가 선택과 계산을 통합함으로써 에너지 효율과 처리량을 획기적으로 개선했습니다.
DORA는 복잡한 DNN 워크로드의 효율성을 높이기 위해 데이터플로우를 명시적으로 제어하는 명령어 기반 오버레이 아키텍처입니다. 새로운 메모리 및 병렬성 관리 메커니즘을 통해 다양한 모델에서도 안정적인 성능을 유지하며, 기존 가속기 대비 최대 5배의 처리량 향상을 입증했습니다.
전통적인 기술 스케일링의 한계를 극복하기 위한 상온 및 극저온 환경의 차세대 메모리 기술을 다룹니다. SRAM, DRAM부터 RRAM, MRAM, FeFET 및 극저온용 JJFET까지 다양한 메모리 소자의 작동 원리와 트레이드오프를 분석합니다.
본 연구는 GPU 내부의 개별 컴포넌트 단위로 전력을 관리하는 'CompPow' 방식의 필요성을 제기합니다. 데이터 센터 수준의 최적화를 넘어 컴포넌트 인식 기반의 관리를 통해 에너지 효율을 10%, 성능을 5% 향상시킬 수 있음을 입증했습니다.
본 연구는 기존 하드웨어 가속기의 공간 효율성 문제를 해결하기 위해 런타임 중에 가속기를 교체할 수 있는 재구성 가능 프로세서(Reconfigurable processors)를 제안합니다. 특히 마이크로코드 실행 시 루프, 조건부 점프, 예외 처리와 같은 동적 제어 흐름을 지원하는 기술을 소개합니다. 다양한 도메인의 벤치마크를 통해 범용 프로세서 대비 상당한 성능 향상을 입증하였습니다.
ELSA는 SNN(Spiking Neural Networks)의 탄력적 추론 특성을 극대화하기 위해 설계된 near-SRAM 데이터플로우 아키텍처입니다. 기존 가속기들이 레이어 단위로 동작하여 응답 지연이 발생하는 문제를 해결하기 위해, 미세한 스파인/토큰 단위의 파이프라인과 최적화된 통신 프로토콜을 도입했습니다. 이를 통해 정확도를 유지하면서도 기존 SOTA 가속기 대비 비약적인 속도 및 에너지 효율 향상을 달성했습니다.
E-ReCON은 에지 AI 추론을 위해 설계된 에너지 및 자원 효율적인 16 Kb 디지털 컴퓨트 인 메모리(DCIM) 매크로입니다. 3T1R ReRAM 비트셀과 새로운 인터리브형 가산기 트리를 통해 CNN과 SNN 워크로드 모두에서 높은 에너지 효율과 낮은 지연 시간을 달성합니다. 특히 프루닝 적용 시에도 높은 정확도를 유지하며, 기존 ADC 기반 설계 대비 성능이 크게 개선되었습니다.
폰 노이만 구조의 병목 현상을 해결하기 위해 2D 물질을 활용한 차세대 컴퓨팅 기술의 전망을 다룹니다. 그래핀 트랜지스터, 멤리스터 기반 인메모리 아날로그 컴퓨팅, 그리고 광학 컴퓨팅 소자의 통합이 향후 반도체 기술의 핵심이 될 것으로 전망합니다.
본 논문은 초저전력 AI 애플리케이션에 필수적인 아날로그 순환 연산의 한계를 극복하는 하드웨어-소프트웨어 공동 설계 방식을 제시한다. 기존 아날로그 구현이 피드포워드 구조로 제한되어 왔던 문제를, 이산 값 출력과 히스테리시스 역학을 가진 BMRUs를 활용한 전류 모드 아날로그 회로 설계를 통해 해결했다. 그 결과, 노이즈 축적 문제를 획기적으로 개선하고, 소프트웨어 모델이 물리적 하드웨어의 고충실도 시뮬레이터 역할을 수행할 수 있음을 입증하여 엔드 투 엔드 키워드 스포팅에서 서브 마이크로와트 추론을 달성했다.
본 연구는 근사 회로(Approximate circuits)의 지적 재산(IP)을 보호하기 위한 새로운 위협 모델인 '근사 난독화(approximate obfuscation)'를 제안하고 이를 탐지하는 프레임워크를 다룹니다. 공격자가 설계 구조를 숨기면서도 원본과 유사한 오류 특성을 유지하도록 만드는 위협에 대응하여, 통계적 오류 프로파일을 비교함으로써 IP 도용을 체계적으로 탐지하는 방법을 제시합니다.
본 연구는 거대 과학 실험의 실시간 이벤트 선택을 위해 AMD Versal VCK190 플랫폼에서 Graph Neural Networks(GNN)를 효율적으로 배포하는 방법을 제시합니다. FPGA 패브릭과 AI Engine 타일을 동시에 활용하는 반자동 설계 흐름을 통해, 기존 FPGA 전용 솔루션 대비 처리량을 53% 향상시키고 지연 시간을 7.15마이크로초로 최적화했습니다.
LLM을 EDA 및 하드웨어 보안 설계에 통합함으로써 RTL 코드 생성과 테스트벤치 자동화 등 반도체 설계 프로세스의 혁신이 가능해졌습니다. 하지만 데이터 오염, 적대적 머신러닝 회피, 데이터 암기 등 심각한 보안 취약점도 함께 발생하고 있습니다. 본 리뷰는 최신 기술적 돌파구와 함께 이를 해결하기 위한 레드팀 활동 및 동적 벤치마킹 등의 대응책을 심층적으로 분석합니다.
MoE 모델의 토큰-대-전문가 분포가 양봉형으로 변함에 따라 발생하는 기존 PIM 시스템의 효율성 저하 문제를 해결하기 위한 새로운 기술을 제안합니다. Sieve는 런타임 토큰 분포에 따라 GPU와 PIM 간의 전문가 실행을 동적으로 분할하고, 연산과 통신을 중첩시켜 처리량을 최적화합니다. 실험 결과, 주요 MoE 모델에서 기존 PIM 시스템 대비 최대 1.6배의 처리량 및 상호작용성 향상을 입증했습니다.
TLX는 현대 GPU의 복잡한 하드웨어 유닛과 비동기 메커니즘을 효율적으로 제어하기 위해 개발된 MIMW(Multi-Instruction, Multi-Warp) 기반의 GPU 컴파일러 확장입니다. Triton의 생산적인 블록 프로그래밍 모델을 유지하면서도 워프 그룹 단위의 세밀한 조율을 가능하게 하여, 데이터 이동과 텐서 코어 연산 최적화를 지원합니다. 실제 대규모 학습 및 추론 프로덕션 환경에서 성능과 커스터마이징 유연성을 입증하였습니다.