Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
로컬 대형 언어 모델(LLM) 추론 환경은 경량 모델에서 초대형 모델로 진화하며 소비자 하드웨어에 심각한 시스템적 과제를 제기하고 있습니다. 본 논문은 Nvidia와 Apple Silicon 생태계를 비교 분석하여, 거대 모델 배포를 위한 아키텍처별 트레이드오프를 제시합니다. 특히 Nvidia는 높은 처리량을 제공하지만 복잡한 런타임 제약과 VRAM 한계에 직면하는 반면, Apple의 통합 메모리 아키텍처(UMA)는 병목 현상을 우회하며 뛰어난 에너지 효율성과 확장성을 보여줍니다.
본 기술 기사는 대규모 언어 모델(LLMs)의 엣지 배포 환경에서 필수적인 일반 행렬 곱셈(GEMM) 가속을 위한 새로운 프레임워크인 Tempus를 제안합니다. 기존 SOTA 프레임워크들이 공간적 스케일링에 의존하여 리소스 제한된 엣지 SoC에서 실패하는 문제를 해결하기 위해, Tempus는 고정된 계산 블록과 시간 기반의 스트리밍 및 데이터 타일링을 통해 자원 불변(Resource-Invariant)한 확장성을 달성합니다. 이 프레임워크는 AMD Versal AI Edge SoC에서 높은 성능(607 GOPS @ 10.677 W)과 함께 기존 방식 대비 월등히 낮은 전력 및 리소스 활용도를 입증하며, 엣지 LLM 추론을 위한 지속 가능한 기반을 제공합니다.
본 논문은 대규모 언어 모델(LLMs)의 효율적인 처리를 위해 도입된 와프 전문화와 같은 최신 GPGPU 아키텍처 기능을 지원하는 사이클 정확도 시뮬레이터 프레임워크인 Sim-FA를 제안합니다. 기존 학술 도구들이 새로운 GPU 기능(예: TMA)을 적시에 통합하지 못하고 DRAM 트래픽 추정에서 부정확성을 보이는 문제를 해결하고자 합니다. Sim-FA는 FlashAttention-3 커널 인스트루멘테이션부터 사이클 정확도 시뮬레이션까지의 전체 파이프라인을 구축했으며, H800과 비교하여 낮은 오차율(MAPE 5.7%)을 달성하며 그 성능을 입증했습니다.
본 논문은 신경 구조 탐색(NAS)이 단순히 정확도와 효율성을 넘어, 실제 배포 환경에서 필수적인 내구성(Robustness)과 지속적 학습(Continual Learning)까지 포괄하는 '삼중 목표'로 진화하고 있음을 분석합니다. 저자들은 이 세 가지 축을 기준으로 NAS 접근법들을 분류하고, 이를 통합적으로 다루는 새로운 프레임워크인 HERCULES를 제안했습니다. HERCULES는 다중 목표 NAS의 계산 비용 문제를 해결하며, 궁극적으로 하드웨어 효율성, 환경 탄력성, 구조적 가소성을 모두 갖춘 배포 가능한 평생 학습 AI 시스템으로 가는 로드맵을 제시합니다.
본 논문은 엣지 ML 환경에서 자원 효율성을 높이기 위해 설계된 미분 논리 게이트 네트워크(LGN)의 FPGA 구현에 초점을 맞춥니다. 연구는 LGN의 깊이와 너비를 변화시키면서 전력, 자원 활용, 추론 속도, 모델 정확도 간의 복잡한 트레이드오프를 분석합니다. 주요 결과로, LGN의 마지막 층이 합성 연산의 논리 크기를 결정하여 타이밍 및 자원 사용량 최소화에 가장 중요한 역할을 한다는 점을 밝혀냈습니다.
täkō는 캐시 미스, 반출(eviction), 쓰기 복귀(writeback)와 같은 메모리 이벤트에서 사용자 정의 콜백을 실행하여 데이터 이동 가속화를 제공하는 프로그래머블 메모리 계층 구조입니다. 하지만 이로 인해 시스템의 복잡성이 크게 증가하고 직관적인 제어가 어렵다는 문제가 있습니다. 본 연구는 täkō의 동작 의미를 포착하는 ISA 레벨 메모리 일관성 모델(MCM)을 개발하여, 프로그래머가 täkō 프로그램을 형식적으로 추론할 수 있도록 합니다.
본 논문은 최신 GPU 아키텍처(NVIDIA Blackwell B200 및 AMD CDNA3 MI300A)의 복잡한 성능 특성을 포착하기 위해 마이크로벤치마크 기반 분석 성능 모델을 개발했습니다. 이 모델은 각 아키텍처의 핵심 요소(예: TMEM, Infinity Cache, 텐서 코어 등)를 반영하여 설계되었으며, 기존의 단순한 이론적 모델(Roofline)보다 훨씬 높은 정확도를 보여주었습니다. 또한, 이 모델은 다른 세대 GPU(H200, MI250X)에도 쉽게 적용 가능함을 입증했습니다.
본 기사는 대규모 언어 모델 훈련 환경에서 발생하는 '무음 데이터 부패(SDC)' 문제를 다루며, 이 문제로 인해 GPU 클러스터의 신뢰성이 위협받는 상황을 설명합니다. 연구진은 63개 CUDA 마이크로 벤치마크에 게이트 레벨 결함 주입을 수행하여 SDC 특성을 분석했으며, 그 결과 NaN/무한대 값의 비율이 낮고 단일 비트 플립 이벤트가 전체의 일부만을 차지하며 부패 주소에 주기성이 있다는 통계적 사실을 밝혀냈습니다. 이러한 발견은 분포 기반의 상위 수준 결함 모델링 및 실제 GPU 아키텍처의 회복력 평가를 위한 현실적인 소프트웨어 기반 접근 방식을 제시합니다.
RangeGuard는 DRAM의 밀도 증가로 인한 잦은 비트 플립 및 다비트 오류에 취약한 심층 신경망(DNN) 모델의 안정성을 높이기 위한 메타데이터 중심 오류 수정 프레임워크입니다. 기존 방식과 달리, 원본 비트를 보호하는 대신 각 값의 수치적 범위를 포착하는 '범위 식별자(RIDs)'를 인코딩합니다. 이 RIDs는 메모리 오염으로 인한 해로운 의미적 편차에만 집중하여 오류를 수정하고, 유용한 변동은 무시함으로써 높은 효율성과 신뢰성을 동시에 제공합니다.
UVMarvel은 대규모 IC 개발의 병목 현상인 서브시스템 레벨 RTL 검증을 혁신적으로 개선하는 LLM 기반 자동화 프레임워크입니다. 이 도구는 복잡하고 이질적인 사양(Heterogeneous Specifications)을 분석하여 프로토콜에 맞는 UVM 테스트벤치를 자동으로 구축합니다. 또한, Signal Tracker와 Verilog Patching Library를 활용해 고품질의 스티뮬러스 생성까지 자동화함으로써, 검증 시간을 획기적으로 단축시키고 높은 코드 커버리지를 달성할 수 있게 합니다.
본 논문은 예측 가능한 트래픽 패턴을 보이는 AI 칩 및 SoC의 내장 애플리케이션에 최적화된 초저전력 NoC(Network-on-Chip) 설계를 제안한다. 이 설계는 공간 분할 다중화(SDM) 기법을 활용하여 필요한 통신 경로만을 물리적인 회로 스위치로 구현하고, 하드웨어 스위치와 프로그래밍 가능한 크로스바를 결합한 새로운 라우터 아키텍처를 사용한다. 그 결과, 기존 패킷 스위칭 방식 대비 전력 소비를 38% 절감하고 면적 및 지연 시간도 개선하는 성과를 보였다.
본 논문은 근사 곱셈(Approximate Computing)이 혼합 전문가(MoE) DNN 아키텍처에 미치는 영향을 분석한 AxMoE를 제시합니다. 연구진은 다양한 CNN 및 Vision Transformer (ViT) 모델과 세 가지 MoE 변형을 대상으로, 여러 종류의 양자화된 근사 곱셈기를 사용하여 성능 저하와 회복률을 평가했습니다. 주요 결과로, 재학습 없이 Dense 구조가 가장 안정적이었으며, ViT-Small의 경우 Hard MoE가 특정 조건에서 높은 효율성을 보였고, 아키텍처 및 토폴로지에 따라 근사 인식 재학습 후 성능 회복 정도가 크게 달라짐을 확인했습니다.
본 연구는 오픈소스 RISC-V 벡터 클러스터 Spatz의 전이 오버 민감성을 SET 및 SEU 오류 모델 하에서 분석했습니다. 10만 회의 오류 주입 실험 결과, 주요 오류 현상은 데이터 부패(FD)로 나타났으며, 특히 TCDM 영역이 데이터 부패의 핵심 원인으로 밝혀졌습니다. 또한, FP8 정밀도가 가장 낮은 출력 영향도를 보였고, 지수부(Exponent)를 표적으로 한 오류가 가장 심각한 데이터 손상 사건을 유발하므로, 특정 경로에 대한 선택적 보호 조치가 필요함을 제안합니다.
MCFlash는 상용 오프더 선반(COTS) 3D NAND 플래시 칩 자체 내에서 대량의 비트 연산을 직접 수행할 수 있도록 설계된 실용적인 기술입니다. 이 기법은 표준 사용자 모드 명령어를 활용하며, 다중 레벨 셀(MLC) 데이터 인코딩과 동적으로 조정되는 읽기 참조 전압을 결합하여 칩 내부에서 '제자리(in-place)' 비트 연산을 가능하게 합니다. 연구 결과에 따르면, MCFlash는 신선한 블록에서 10억 회 이상의 안정적인 연산 능력을 보여주었으며, 높은 내구성을 유지하며 낮은 비트 오류율을 달성했습니다.
본 논문은 RISC-V 아키텍처의 ISA 확장, 데이터패스 너비, 파이프라인 깊이 등 여러 설계 축에 걸친 트레이드오프를 정량적으로 분석한 10개의 점진적인 FPGA 구현 마이크로아키텍처 'RV-IM100'을 제시합니다. 연구 결과는 I-to-IM 확장이 CoreMark와 같은 특정 벤치마크에서 높은 처리량 증가를 가져왔으나, Dhrystone에서는 미미한 감소를 보였습니다. 또한, 파이프라인 깊이를 심화시키는 과정은 최대 주파수를 크게 향상시켰지만, 전력 효율성(per-MHz) 측면에서는 상당한 손실을 초래하는 등 복잡하고 벤치마크 의존적인 트레이드오프를 보여주었습니다. 궁극적으로 RV32가 절대 처리량 면에서 우위를 점할 수 있으며, 리소스 사용량 관점에서 볼 때 너비 확장의 비용이 효율성 증가분보다 클 수 있음을 입증하며 RISC-V 설계 공간 탐색에 중요한 지침을 제공합니다.
본 논문은 수백만 개의 큐비트에서 오류 내성을 구현하기 위해 확장 가능한 양자 오류 복호(decoding) 방법을 제안합니다. 핵심 방법론인 로또리 BP(Rotary Belief Propagation)는 기존의 복호 알고리즘 대비 높은 정확도와 효율성을 보여줍니다. 또한, 다중 라운드 측정 오류를 처리하는 Syndrome vote 전처리 단계와 PolyQec 구조 설계를 통해 시스템 전체의 성능을 향상시키고, PyTorch 기반의 모듈화된 시뮬레이터 Syndrilla를 개발하여 연구 환경을 개선했습니다.
본 기술 기사는 대규모 양자 오류 수정 시스템의 핵심 병목 현상인 디코딩 리소스 경쟁 문제를 해결하기 위한 새로운 접근 방식을 제시합니다. 기존 연구가 표면 코드에 국한되었던 것과 달리, 본 논문은 일반적인 qLDPC 코드를 지원하는 자동화된 프리디코더 생성 프레임워크를 소개하여 디코딩 작업을 효율적으로 분산시킵니다. 또한, 단일 FPGA 및 냉각 ASIC 구현을 통해 대규모 양자 오류 수정 코드(BB 코드 포함)의 동시 디코딩 능력을 크게 향상시키는 하드웨어 아키텍처 설계를 상세히 설명합니다.
본 기사는 최신 AI 가속기 시대에도 여전히 핵심적인 역할을 하는 CPU 성능을 평가하기 위해 SPEC CPU2026 벤치마크의 종합적인 특성 분석 결과를 제시합니다. 연구진은 SPEC CPU2026이 이전 버전 대비 명령어 부피와 메모리 푸트프린트를 증가시키고, 특히 인스트럭션 캐시 스트레스 같은 새로운 병목 현상에 초점을 맞추고 있음을 발견했습니다. 또한, 전체 벤치마크 소트의 대표성을 유지하면서 평가 비용을 크게 줄일 수 있는 클러스터링 기반의 컴팩트한 부분집합(subset)을 식별하고, SPEC CPU2026이 다양한 워크로드 대비 실용적인 아키텍처 연구에 유용한 새로운 기준점을 제공함을 입증합니다.
본 논문은 저가형 FPGA를 활용하여 Binary Neural Network (BNN) 기반의 YOLOv3-tiny 유사 객체 감지기를 구현한 내용을 다룹니다. 이 시스템은 1비트 가중치와 8비트 활성화 함수를 사용하는 컨볼루션 레이어를 특징으로 하며, 모든 하드웨어 로직이 Verilog RTL로 작성되었습니다. VOC 데이터셋에서 39.6%의 mAP50 성능을 달성했으며, 낮은 전력 및 연산량(0.098 GFLOPs)을 보여 저전력 임베디드 환경에서의 객체 감지 가능성을 입증했습니다.
LIPPEN은 메모리 안전성 위반을 막기 위해 개발된 경량 인장 지점 암호화 아키텍처입니다. 기존의 하드웨어 방어 기법들이 가진 오버헤드나 보안 취약점을 극복하며, 모든 지점을 암호화 블록으로 처리하여 실행 컨텍스트에 암호학적 결합을 합니다. LIPPEN은 64비트 지점 필드를 재사용하고 원본 주소 비트를 보존하지 않는 방식으로 엔트로피를 최대화함으로써 강력한 무결성과 기밀성을 제공하며, 기존 PAC(Pointer Authentication Code) 시스템과도 호환됩니다.