Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 논문은 Mixture-of-Experts (MoE) 아키텍처를 사용하는 대규모 언어 모델(LLMs)의 추론 과정에서 발생하는 병목 현상을 다룹니다. 특히, 여러 노드에 분산된 환경에서 발생하는 비효율적인 토큰 라우팅과 높은 all-to-all 통신 오버헤드를 해결하는 데 초점을 맞춥니다. 연구진은 실제 MoE 모델들의 전문가 활성화 패턴을 분석하여, 부하 불균형 및 도메인별 전문가 선호도 등의 공통 특성을 발견했으며, 이를 바탕으로 워크로드 인식 마이크로 배치 그룹화와 전문가 배치 전략을 제안했습니다. 이 최적화 기법은 노드 간 통신 데이터를 최대 20%까지 줄여 MoE 디코드 지연 시간을 개선하고 가속기 활용도를 높이는 효과를 입증했습니다.
본 논문은 벡터 양자화(VQ)를 활용하여 신경망 가중치를 효율적으로 압축하는 세 가지 기법을 개발하고 검증했습니다. 코사인 유사도 기반 할당 방식을 채택하고, 이를 top-1 샘플링 및 스트레이트-through 추정기(STE)와 결합하여 가중 평균 재구성을 제거함으로써 접근 방식을 개선했습니다. 또한, 미분 가능한 신경 구조 검색(NAS)을 활용하여 레이어별 양자화 구성을 최적화하는 방법을 제시합니다.
본 논문은 대규모 언어 모델(LLMs)의 추론 지연 시간 문제를 해결하기 위해 JIT 컴파일과 CUDA 그래프 실행을 결합한 하이브리드 런타임 프레임워크를 제안합니다. 이 프레임워크는 트랜스포머 추론 과정을 정적 및 동적 구성 요소로 분할하여, 각각 CUDA 그래프 재생 또는 JIT 커널 처리를 통해 효율적으로 실행합니다. 실험 결과, LLaMA-2 7B 모델에서 하이브리드 런타임은 첫 토큰 생성 시간(TTFT)을 최대 66.0% 감소시키고 낮은 P99 지연 시간을 달성하여, 짧은 시퀀스 워크로드의 실용적인 배포에 효과적임을 입증했습니다.
TimingLLM은 Verilog 코드에서 합성 전 타이밍(WNS/TNS)을 예측하기 위해 설계된 혁신적인 두 단계 검색 증강 LLM 프레임워크입니다. 이 시스템은 경량화된 구조적 단서로 경로 수준의 도착 시간/요구 시간을 추정하는 미세 조정된 LLM과, 가장 가까운 타이밍 레이블 모듈을 검색하여 WNS/TNS를 예측하는 LLM 기반 회귀기로 구성됩니다. TimingLLM은 기존 방법보다 1.3~1.6배 빠르게 실행되면서도 높은 정확도를 달성하여, RTL 반복 프로세스의 속도를 크게 향상시킵니다.
본 논문은 트랜스포머 모델에서 높은 하드웨어 비용을 차지하는 Softmax와 Layer Normalization(LayerNorm) 연산을 Edge 디바이스에 최적화한 아키텍처를 제안합니다. 기존 연구들이 순위 기반 작업에 초점을 맞춘 것과 달리, 본 설계는 점수 기반 NLP 및 생성형 AI 응용 프로그램에 필수적인 '보장된 정규화'를 유지하면서 하드웨어 효율성을 극대화했습니다. Verilog HDL로 구현된 이 아키텍처는 기존 대비 면적을 크게 줄이면서도 높은 정확도를 유지하는 것으로 입증되었습니다.
본 논문은 에지 AI 의료기기의 안전성을 확보하기 위해 아키텍처 격리(architectural isolation)를 통한 타이밍 안전성 원천의 중요성을 제시합니다. 동일한 MobileNetV2 모델을 NVIDIA Jetson Orin Nano Super에서 GPU 가속기(TensorRT FP16)와 CPU(ONNX Runtime FP32) 두 가지 경로로 실행하여, 정확도 유지와 더불어 부하 조건 하에서의 타이밍 제약 조건 위반 문제를 실험적으로 입증했습니다. 연구진은 추론 레이어의 안전성 요구사항을 충족시키기 위해 '안전 임계값 초과율(STER)'과 '지연 시간'의 공동 검증 방법을 제안하며, 이는 향후 FDA 규제 준수 및 임상 적용에 활용될 예정입니다.
FlowPlace는 반도체 물리 설계의 핵심 단계인 칩 배치 문제를 해결하기 위해 개발된 새로운 프레임워크입니다. 기존 생성형 모델 기반 솔루션들이 가진 무작위 데이터 의존성, 긴 샘플링 시간, 오버랩 문제 등의 한계를 극복했습니다. FlowPlace는 마스크 가이드드 합성 데이터 생성, 플로우 기반 효율적 학습, 그리고 하드 컨스트레인트 샘플링을 통해 높은 PPA 지표와 획기적으로 빠른 속도(10~50배)를 달성하며 오버랩이 없는 레이아웃을 제공합니다.
본 논문은 DRAM의 RowHammer 취약성에 대응하기 위해 'Rowhammer Vulnerability Count (RVC)'라는 새로운 프레임워크를 제안합니다. 기존 완화 기법들이 단순히 행(row)의 활성화 횟수를 추적하는 방식과 달리, RVC는 실제 비트 플립 위험에 처한 행만을 식별하여 선택적으로 리프레시를 발행함으로써 효율성을 극대화합니다. 이로써 불필요한 전력 소모와 시스템 지연을 크게 줄이면서도 기존 방법 대비 높은 보안 성능 향상을 달성했습니다.
본 논문은 FPGA 기반 가속기인 VTA(Versatile Tensor Accelerator)를 활용하여 복잡한 CNN 모델을 배포하는 방법을 다룹니다. 기존의 독립형 컴파일러가 가진 한계를 극복하기 위해, 연구진은 VTA 컴파일 체인을 확장하고 자동화함으로써 완전한 CNN 컴파일이 가능하도록 개선했습니다. 이 개선된 시스템은 온칩 메모리를 초과하는 대규모 매개변수를 포함하는 더 큰 CNN까지 지원하며, YOLO-NAS 모델을 성공적으로 컴파일 및 시뮬레이션하여 그 효과를 입증했습니다.
본 연구는 자원 제약이 엄격한 TinyML 환경에서 CNN 추론의 지연 시간을 최적화하기 위한 새로운 프레임워크를 제시합니다. 이 프레임워크는 근사 행렬 분해(Approximate Matrix Decomposition)를 활용하여 주어진 CNN 모델을 하드웨어 구현에 맞게 최적화하며, 재학습이나 미세 조정 과정 없이도 작동하는 것이 특징입니다. 유전 알고리즘 기반의 접근 방식을 통해 FPGA 타겟용 곱셈기 없는 CNN 가속기를 설계하고, 기존 방식 대비 높은 효율성을 입증했습니다.
본 논문은 PyTorch로 정의된 스파이킹 신경망(SNN)을 저비용 FPGA 플랫폼에 결정론적으로 배포하기 위한 하드웨어-소프트웨어 공동 설계 프레임워크를 제시합니다. 이 프레임워크는 단일 아티팩트를 통해 가중치, 임계값, 연결성 정보와 시간-첫 번째 스파이크(TTFS) 디코딩 메타데이터를 운반하며, 소프트웨어 참조 및 보드 런타임 모두에서 재사용됩니다. 실험 결과, 이 시스템은 MNIST 분류기에서 높은 정확도(87.40%)를 달성했으며, 낮은 서비스 지연 시간(0.1375 μs/이미지)과 추정 동적 에너지(31.6 nJ/이미지)를 보여주어 저비용 FPGA가 SNN 모델에 대한 재현 가능한 경로를 제공할 수 있음을 입증했습니다.
HGQ-LUT는 LUT(루크업 테이블) 기반 신경망의 학습 및 하드웨어 구현 문제를 해결하는 새로운 접근법입니다. 이 방법은 최첨단 하드웨어 효율성을 유지하면서도 GPU에서의 학습 속도를 100배 이상 가속화합니다. HGQ-LUT는 규칙적이고 가속기 친화적인 레이어를 도입하고, 자동화된 비트 정밀도 탐색 및 통합 설계 워크플로우를 제공하여 LUT 기반 DNN을 실제 배포 환경에 실용적으로 적용할 수 있게 합니다.
본 논문은 행렬-행렬 곱셈(mmul)을 핵심 패턴으로 하는 계산 커널을 조립식 재구성 가능 배열(CGRA)에 매핑하는 새로운 컴파일링 방법론을 제시합니다. 이 방법론은 다면체 변환(polyhedral transformations)을 사용하여 소스 코드 내에 숨겨진 mmul 연산을 효과적으로 노출시키고, 이를 전문적인 CGRA 커널 스케줄링으로 최적화된 어셈블리로 대체합니다. 그 결과, 직접 명시되지 않은 부분에서도 리소스 활용도를 극대화하여 실행 시간 성능을 크게 향상시키는 것이 가능함을 입증했습니다.
본 연구는 멀티모달 파운데이션 모델(MFMs)을 가속화하기 위한 하드웨어 및 소프트웨어 공동 설계 방법론을 제시한다. 이 방법론은 트랜스포머 블록에 대한 양자화, 가지치기 등의 압축 기법과 더불어, 모델 캐스케이드 및 최적화된 데이터플로우를 결합하여 계산 및 메모리 요구사항을 획기적으로 줄인다. 궁극적으로 전용 하드웨어 가속기를 활용하고 다양한 워크로드를 공동 최적화함으로써 MFM의 효율적인 배포와 에너지 효율성을 달성하는 것을 목표로 한다.
본 기술 기사는 대수 연산 가속화를 위해 DigitsOnTurbo(DoT)라는 새로운 접근 방식을 제안합니다. DoT는 기존 알고리즘을 벡터화하는 대신, 독립적이고 데이터 병렬적인 연산을 중심으로 계산 구조를 재구성하여 SIMD의 이점을 극대화합니다. 그 결과, 덧셈 및 뺄셈에서 최대 1.85배, 곱셈에서 최대 2.3배의 속도 향상을 달성하며, 이는 과학 계산과 암호학 분야 전반에 걸쳐 상당한 성능 개선을 가져옵니다.
GR-Evolve은 대규모 언어 모델(LLM)을 활용하여 알고리즘 코드를 반복적으로 수정함으로써, ASIC 설계의 복잡성 증가와 기존 EDA 도구의 한계를 극복하는 '설계 적응형 (design-adaptive)' 전역 라우팅 프레임워크입니다. 이 시스템은 QoR 기반 피드백을 받아 LLM이 전역 라우터 소스 코드를 자동으로 진화시키고 최적화합니다. 벤치마크 테스트 결과, GR-Evolve는 기존 라우터 대비 와이어 길이(wirelength)를 최대 8.72%까지 감소시키는 성능 향상을 입증하며, LLM 기반의 설계 적응형 EDA 도구링의 잠재력을 보여줍니다.
본 연구는 고수준 합성(HLS)으로 생성된 RTL 설계의 기능적 버그나 보안 취약점을 형식 검증을 통해 확인하는 것을 목표로 합니다. 기존 모델 체킹은 큰 규모의 RTL 때문에 계산 시간이 오래 걸리는 문제가 있었습니다. 이에 본 논문은 HLS 설계의 특성을 활용하여, 가장 효과적인 '보조 명제(helper assertions)' 집합을 자동으로 생성하고 선택하는 프레임워크를 제안함으로써 검증 프로세스를 획기적으로 가속화했습니다.
본 기사는 GPU 자원의 과소 활용 문제를 해결하기 위한 NVIDIA의 두 가지 주요 기술인 MPS(Multi-Process Service)와 MIG(Multi-Instance GPU)를 비교 평가합니다. 연구 결과에 따르면, MPS는 유연성을 바탕으로 최적화된 시나리오에서 성능을 향상시키고 에너지 효율을 높일 수 있지만, 메모리 경쟁 상황에서는 심각한 성능 저하를 겪습니다. 반면, MIG는 완전한 하드웨어 격리를 제공하여 일관적인 성능 개선을 보장하지만, 높은 오버헤드와 경직성으로 인해 특정 상황에서 성능 저하가 발생할 수 있습니다.
본 논문은 양자 우위를 실현하기 위한 오류 허용 양자 컴퓨팅(FTQC) 아키텍처의 과도한 오버헤드 문제를 해결하는 새로운 설계를 제안합니다. 이 설계는 보조 큐비트 중심 영역 주변에 표면 코드 패치를 배치하여 모든 데이터 큐비트에 균일한 접근성을 제공하며, 부하 기반 배치 방법을 도입해 최적화된 레이아웃을 결정합니다. 또한, 워크로드별로 측정 지연을 줄이는 재구성 가능한 최적화를 통해 효율성과 동시 실행 능력을 크게 향상시켰습니다.
본 논문은 응용 분야별로 상이한 네트워크 요구 사항(저지연 vs. 고처리량)에 대응하기 위해, 프로토콜과 아키텍처를 공동 최적화하여 맞춤형 FPGA 기반 네트워크 스위치를 자동 생성하는 SPAC(Switch and Protocol Adaptive Customization)라는 새로운 접근법을 제안합니다. SPAC는 DSL, 모듈형 HLS 라이브러리, DSE 엔진으로 구성된 통합 워크플로우를 통해 프로토콜-아키텍처 공동 설계를 자동화하며, 다중 충실도 시뮬레이션을 통해 최적의 설계를 신속하게 식별할 수 있습니다. 실험 결과에 따르면, SPAC가 생성한 맞춤형 스위치는 기존 고정 아키텍처 대비 리소스 사용량을 크게 줄이고 지연 시간을 효과적으로 감소시키는 것으로 나타났습니다.