Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 연구는 멀티모달 파운데이션 모델(MFMs)을 가속화하기 위한 하드웨어 및 소프트웨어 공동 설계 방법론을 제시한다. 이 방법론은 트랜스포머 블록에 대한 양자화, 가지치기 등의 압축 기법과 더불어, 모델 캐스케이드 및 최적화된 데이터플로우를 결합하여 계산 및 메모리 요구사항을 획기적으로 줄인다. 궁극적으로 전용 하드웨어 가속기를 활용하고 다양한 워크로드를 공동 최적화함으로써 MFM의 효율적인 배포와 에너지 효율성을 달성하는 것을 목표로 한다.
본 기술 기사는 대수 연산 가속화를 위해 DigitsOnTurbo(DoT)라는 새로운 접근 방식을 제안합니다. DoT는 기존 알고리즘을 벡터화하는 대신, 독립적이고 데이터 병렬적인 연산을 중심으로 계산 구조를 재구성하여 SIMD의 이점을 극대화합니다. 그 결과, 덧셈 및 뺄셈에서 최대 1.85배, 곱셈에서 최대 2.3배의 속도 향상을 달성하며, 이는 과학 계산과 암호학 분야 전반에 걸쳐 상당한 성능 개선을 가져옵니다.
GR-Evolve은 대규모 언어 모델(LLM)을 활용하여 알고리즘 코드를 반복적으로 수정함으로써, ASIC 설계의 복잡성 증가와 기존 EDA 도구의 한계를 극복하는 '설계 적응형 (design-adaptive)' 전역 라우팅 프레임워크입니다. 이 시스템은 QoR 기반 피드백을 받아 LLM이 전역 라우터 소스 코드를 자동으로 진화시키고 최적화합니다. 벤치마크 테스트 결과, GR-Evolve는 기존 라우터 대비 와이어 길이(wirelength)를 최대 8.72%까지 감소시키는 성능 향상을 입증하며, LLM 기반의 설계 적응형 EDA 도구링의 잠재력을 보여줍니다.
본 연구는 고수준 합성(HLS)으로 생성된 RTL 설계의 기능적 버그나 보안 취약점을 형식 검증을 통해 확인하는 것을 목표로 합니다. 기존 모델 체킹은 큰 규모의 RTL 때문에 계산 시간이 오래 걸리는 문제가 있었습니다. 이에 본 논문은 HLS 설계의 특성을 활용하여, 가장 효과적인 '보조 명제(helper assertions)' 집합을 자동으로 생성하고 선택하는 프레임워크를 제안함으로써 검증 프로세스를 획기적으로 가속화했습니다.
본 기사는 GPU 자원의 과소 활용 문제를 해결하기 위한 NVIDIA의 두 가지 주요 기술인 MPS(Multi-Process Service)와 MIG(Multi-Instance GPU)를 비교 평가합니다. 연구 결과에 따르면, MPS는 유연성을 바탕으로 최적화된 시나리오에서 성능을 향상시키고 에너지 효율을 높일 수 있지만, 메모리 경쟁 상황에서는 심각한 성능 저하를 겪습니다. 반면, MIG는 완전한 하드웨어 격리를 제공하여 일관적인 성능 개선을 보장하지만, 높은 오버헤드와 경직성으로 인해 특정 상황에서 성능 저하가 발생할 수 있습니다.
본 논문은 양자 우위를 실현하기 위한 오류 허용 양자 컴퓨팅(FTQC) 아키텍처의 과도한 오버헤드 문제를 해결하는 새로운 설계를 제안합니다. 이 설계는 보조 큐비트 중심 영역 주변에 표면 코드 패치를 배치하여 모든 데이터 큐비트에 균일한 접근성을 제공하며, 부하 기반 배치 방법을 도입해 최적화된 레이아웃을 결정합니다. 또한, 워크로드별로 측정 지연을 줄이는 재구성 가능한 최적화를 통해 효율성과 동시 실행 능력을 크게 향상시켰습니다.
레트로 하드웨어 애호가가 30년 된 S3 그래픽 카드에서 발생하는 이미지 품질 문제를 해결하는 방법을 제시했습니다. 이 문제는 VBIOS 해킹을 통해 'pedestal bit'이라는 특정 비트를 제거함으로써 블랙 레벨(black level) 복구를 수행하여 화면의 흐릿함을 개선합니다.
본 논문은 응용 분야별로 상이한 네트워크 요구 사항(저지연 vs. 고처리량)에 대응하기 위해, 프로토콜과 아키텍처를 공동 최적화하여 맞춤형 FPGA 기반 네트워크 스위치를 자동 생성하는 SPAC(Switch and Protocol Adaptive Customization)라는 새로운 접근법을 제안합니다. SPAC는 DSL, 모듈형 HLS 라이브러리, DSE 엔진으로 구성된 통합 워크플로우를 통해 프로토콜-아키텍처 공동 설계를 자동화하며, 다중 충실도 시뮬레이션을 통해 최적의 설계를 신속하게 식별할 수 있습니다. 실험 결과에 따르면, SPAC가 생성한 맞춤형 스위치는 기존 고정 아키텍처 대비 리소스 사용량을 크게 줄이고 지연 시간을 효과적으로 감소시키는 것으로 나타났습니다.
본 논문은 자율 주행 등 혼합 중요도 시스템(MCSs)에서 AMD Versal SoC의 AI 엔진(AIE)을 활용하는 새로운 방법을 제안합니다. 기존 AIE는 정적 데이터플로우 매핑으로 인해 실시간 작업의 동적 할당이 어려웠으나, 본 연구에서는 런타임에 작업 스위칭이 가능한 '동적 작업 디스패칭 인프라'를 도입했습니다. 이 인프라는 시스템 중요도 모드 변화에 따라 서로 다른 중요도의 작업을 AIE 타일 풀로 유연하게 할당하여, 자율 주행 워크로드에서 높은 활용도와 낮은 오버헤드를 입증하며 AIE의 잠재력을 극대화합니다.
본 논문은 FPGA 환경에 최적화된 B+ 트리 기반 인덱스 검색 알고리즘을 제안합니다. 이 접근법은 레벨별 배치 처리를 통해 메모리 액세스를 줄이고 노드 재사용성을 높여, FPGA에서 병렬 검색 키 비교를 효율적으로 수행할 수 있게 합니다. 고수준 합성(HLS) 기법으로 구현된 커널은 실제 하드웨어 가속기에서 CPU 기반 알고리즘 대비 상당한 성능 향상을 입증했습니다.
메인주 주지사는 특정 지역의 대규모 신규 데이터센터 건설을 전면적으로 금지하는 법안에 거부권(veto)을 행사했습니다. 이 결정은 해당 법안이 일부 지원을 받는 데이터센터 프로젝트를 예외로 두어야 했다는 주장에 근거합니다.
JetStream은 대규모 언어 모델(LLM)의 추론 과정에 특화된 고성능 최적화 엔진입니다. 이 엔진은 XLA 디바이스, 특히 TPU 환경에서 LLM을 구동할 때 처리량과 메모리 사용량을 극대화하도록 설계되었습니다. 향후 GPU 지원도 계획되어 있어 다양한 하드웨어 환경에서의 효율적인 모델 서빙이 가능합니다.
전설적인 홈 컴퓨터 브랜드인 Commodore가 과거의 제3자 펌웨어 금지 정책을 변경했습니다. 이제 사용자가 직접 설치한 서드파티 펌웨어를 사용하는 것에 대해 더 이상 차단하지 않을 예정입니다. 다만, 사용자의 실수나 변조로 인해 기기가 손상(bricked)된 경우에 대해서는 무상 지원이나 교체를 제공하지 않는다는 점을 명확히 했습니다.
이 프로젝트는 CUDA를 활용하여 고성능 컴퓨팅(HPC)에 필요한 다양한 핵심 알고리즘과 기술들을 연습하고 구현하는 것을 목표로 합니다. GEMM, FlashAttention, Tensor Cores와 같은 주요 연산부터 양자화 및 KV 캐시 관리까지 포함하며, CUTLASS 라이브러리와 NCCL을 사용하여 최적의 성능을 달성할 수 있는 손실 없는 CUDA 커널과 성능 최적화 기법들을 다룹니다.
deep-recall은 LLM(대규모 언어 모델)을 위한 엔터프라이즈급 메모리 프레임워크입니다. 이 프레임워크는 GPU 최적화 추론, 벡터 저장소, 자동 확장을 특징으로 하며, 효율적인 컨텍스트 검색 기능을 제공합니다. 이를 통해 사용자 개개인에게 초개인화된 고품질의 응답을 생성할 수 있도록 돕습니다.
ByteDance에서 개발한 ByteTransformer는 BERT 트랜스포머 모델의 추론(inference) 속도를 최적화하는 라이브러리입니다. 이 도구는 NVIDIA GPU 환경에 특화되어 있어, 대규모 언어 모델을 실제 서비스 환경에서 효율적으로 구동할 수 있도록 설계되었습니다. 관련 연구 논문(arXiv:2210.03052)의 내용을 기반으로 성능 향상을 목표로 합니다.
FastFold는 GPU 클러스터 환경에서 AlphaFold의 학습 및 추론 과정을 최적화하는 프로젝트입니다. 이 도구는 특히 CUDA와 같은 병렬 컴퓨팅 기술을 활용하여 대규모 단백질 구조 예측 모델인 AlphaFold의 성능을 극대화합니다. 이를 통해 연구자들이 효율적으로 단백질 접힘 문제를 해결하고 관련 생명과학 연구를 진행할 수 있도록 지원합니다.
Triton Model Navigator는 NVIDIA GPU 환경에서 딥러닝 모델을 효율적으로 최적화하고 배포하기 위해 설계된 전문적인 추론(Inference) 툴킷입니다. 이 도구는 복잡한 딥러닝 모델의 성능 향상과 실제 서비스 환경에서의 안정적인 운영에 초점을 맞추고 있습니다.
NVIDIA/DALI는 심층 학습 훈련 및 추론 애플리케이션의 성능을 극대화하기 위해 설계된 GPU 가속 데이터 처리 라이브러리입니다. 이 라이브러리는 고도로 최적화된 빌딩 블록과 실행 엔진을 제공하여, 이미지 증강(data-augmentation)부터 오디오/데이터 전처리 파이프라인까지 전체 데이터 처리를 가속합니다. 이를 통해 개발자는 GPU의 잠재력을 최대한 활용하여 빠르고 효율적인 머신러닝 워크플로우를 구축할 수 있습니다.
exllamav3는 현대 소비자급 GPU 환경에서 대규모 언어 모델(LLM)을 효율적으로 로컬 구동할 수 있도록 설계된 최적화된 양자화 및 추론 라이브러리입니다. 이 라이브러리는 LLM의 실행 성능을 극대화하는 데 초점을 맞추고 있으며, 사용자가 고성능 하드웨어 없이도 강력한 AI 기능을 경험할 수 있게 돕습니다.