Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 기술 기사는 대형 언어 모델(LLM)이 긴 컨텍스트를 처리할 때 발생하는 계산 및 메모리 병목 현상을 해결하기 위한 하드웨어 가속기를 제안합니다. 소프트웨어적으로는 초저정밀도 양자화와 특징 희소성을 결합한 '이중 압축 동적 희소 어텐션'을 도입하고, 근사 Top-K 선택으로 복잡도를 최적화했습니다. 하드웨어 측면에서는 이러한 희소성 및 긴 컨텍스트의 상호작용에 맞춰 계산과 메모리 액세스를 깊이 있게 최적화한 ASIC 가속기를 설계하여, 기존 대비 월등히 높은 속도와 에너지 효율을 달성했습니다.
본 연구는 대형 언어 모델(LLM) 추론 시 메모리 대역폭 병목 현상을 완화하는 삼원 가중치 양자화(Ternary Weight Quantization, 예: BitNet b1.58)를 위한 새로운 하드웨어 아키텍처 설계를 제안합니다. 기존 방식의 비효율적인 디양자화 문제를 해결하기 위해 룩업 테이블(LUT) 기반 가속기 설계 공간을 형식화하고 오픈소스 생성기를 제공했습니다. 이 프레임워크는 전체 아키텍처 공간 탐색을 가능하게 하여, 다양한 설계를 체계적으로 비교 평가할 수 있는 공통 기반을 마련하며, 기존 대비 상당한 면적 감소 및 성능 향상을 입증합니다.
오픈AI 슈퍼 PAC와 연결된 뉴스 사이트가 자동화된 파이프라인을 통해 가짜 저널리스트 봇들을 이용해 실존 인물 인터뷰를 가장한 기사들을 대량으로 생산하고 배포했습니다. 이 과정에서 실제 인용구를 포함하여 총 94편의 기사를 게재했으며, 이는 콘텐츠가 완전히 자동화된 시스템을 거쳐 초안 및 검토 과정을 거쳤음을 보여줍니다.
본 논문은 클라우드 의존성 및 데이터 프라이버시 문제를 해결하기 위해, 하드웨어 가속기를 탑재한 싱글보드 컴퓨터(SBC)에서의 LLM 추론 성능을 다차원적으로 평가하는 새로운 벤치마킹 방법론을 제안합니다. 이 방법론은 NPU와 GPU 같은 다양한 가속기의 활용이 전력 효율성, 물리적 크기, 토큰 처리량 등 여러 요소에 미치는 트레이드오프를 정량화하여 보여줍니다. 이를 통해 무인 차량이나 현장 환경과 같이 연결성이 제한되고 프라이버시가 중요한 곳에 생성형 AI를 실용적으로 배포할 수 있는 지침을 제공합니다.
본 논문은 계산 복잡도가 높은 3D CNN의 한계를 극복하기 위해, 광자원자 공간-시간 홀로그래픽 상관기(STHC)를 활용하는 하이브리드 광전자 구조를 제안합니다. 이 시스템은 냉각 루비듐 원자 배열을 이용해 시간 정보를 저장하고, 이를 전통적인 2D 공간 상관기와 결합하여 공간 및 시간을 동시에 처리합니다. 실험 결과, 대규모 커널에서 높은 분류 정확도와 잠재적으로 매우 빠른 작동 속도를 달성하며, 비디오 분류 가속화에 새로운 방향을 제시했습니다.
본 논문은 강화학습(RL) 기반의 칩 배치 최적화가 전문가 수준의 레이아웃을 달성하는 데 어려움을 겪는 문제를 다룹니다. 기존 RL 방법들이 와이어 길이 같은 단일 목표에만 집중하여 성능 한계를 보인다고 지적하며, 이 문제의 핵심 원인을 보상 설계의 부족에서 찾았습니다. 이를 해결하기 위해, 본 연구는 전문가 레이아웃에서 직접 학습하여 암묵적인 보상을 포착하는 새로운 프레임워크를 제안합니다. 이 방법은 최종 결과물부터 단계별 전문가 궤적을 추론하고, 이를 데모나 선호도로 활용하여 성능과 일반화 능력을 크게 향상시킵니다.
FusionCIM은 대규모 언어 모델(LLM) 추론 가속화를 위해 오퍼레이터 퓨전 기반의 컴퓨팅-인-메모리(CIM) 아키텍처를 제안합니다. 이 아키텍처는 하이브리드 CIM 파이프라인, 데이터 재사용성을 극대화하는 QO-stationary 데이터플로우, 그리고 패턴 인식 온라인-softmax 메커니즘을 통합하여 효율성을 높였습니다. LLaMA-3 모델 테스트 결과, FusionCIM은 기존 SOTA 대비 에너지 절감 및 속도 향상에서 뛰어난 성능을 보여주었습니다.
본 논문은 사용자 데이터 증가로 인한 실시간 추천 시스템 처리의 어려움을 해결하기 위해 NAND 플래시 기반 저장 내 컴퓨팅(In-Storage Computing, ISC)을 활용한 고속 추천 추론 가속기인 RecFlash를 제안합니다. 기존 ISC 아키텍처는 추천 작업의 불규칙하고 랜덤한 메모리 액세스 패턴 때문에 내부 대역폭 이용 효율이 낮다는 문제가 있었습니다. RecFlash는 주파수 기반 데이터 매핑 알고리즘을 적용하여 이러한 비효율성을 개선함으로써, 지연 시간과 에너지 소비를 획기적으로 줄이는 성능 향상을 입증했습니다.
NVLLM은 에지 디바이스에서 대규모 언어 모델(LLM)의 추론을 가능하게 하는 혁신적인 3D NAND 중심 아키텍처입니다. 이 아키텍처는 FFN 계산을 플래시 메모리로 오프로드하고 어텐션 메커니즘을 경량 CMOS 로직으로 처리하며, 외부 DRAM 의 의존성을 최소화합니다. 웨이퍼 투 웨이퍼 스태킹 기술을 활용하여 3D NAND를 컴퓨트 파이프라인과 통합함으로써 페이지 레벨의 FFN 가중치 액세스를 구현하고, 기존 GPU 기반 또는 SSD 기반 시스템 대비 월등한 성능 향상을 달성했습니다.

생성형 AI 시장의 경쟁 구도가 단순한 '최첨단 모델(Frontier Model)' 개발 경쟁에서, 실제 비즈니스 가치를 창출하는 '에이전트 플랫폼' 구축 경쟁으로 전환되고 있습니다. 기업들은 에이전트 도입을 통해 생산성 향상과 예산 증액 계획을 밝히고 있으며, 구글 같은 하이퍼스케일러들은 통합된 에이전트 스택(칩-모델-데이터-애플리케이션)의 필요성을 강조하며 막대한 인프라 투자를 진행하고 있습니다. 이는 AI가 실험 단계를 넘어 실제 프로덕션 환경에서 광범위하게 적용되는 '변화'의 시대를 의미합니다.
본 논문은 복잡한 FPGA 로직 블록(LBs) 아키텍처에서 발생하는 패킹 적법성 체크의 높은 계산 비용 문제를 해결하기 위한 'Déjà Vu' 접근법을 제안합니다. 기존 CAD 플로우는 라우팅 가능성을 확인하는 데 많은 시간을 소요하며, 이 과정에서 중복되는 패턴 검사가 빈번하게 발생함을 분석했습니다. Déjà Vu는 재귀적인 패킹 패턴을 식별하고 그 적법성 체크 결과를 메모이제이션(memoization)할 수 있는 새로운 '패킹 서명 트리' 데이터 구조를 활용하여, VPR 런타임을 대폭 가속화합니다.
Tessera는 통합 메모리 아키텍처(UMA) 기반의 엣지 가속기에서 안전하게 근접 라인 단위로 모델 가중치를 스트리밍하기 위한 참조 아키텍처입니다. 기존의 페이지 단위 암호화 방식은 대역폭 병목 현상을 유발하는 반면, Tessera는 AXI 버스트를 가로채 DRAM 가져오기와 동시에 AES-256-CTR 키스트림을 계산하여 평문 가중치를 NPU SRAM으로 직접 스트리밍합니다. 이 설계는 메모리 암호화의 대역폭 페널티를 획기적으로 줄이고, 물리적 추출 및 DMA 공격 등 UMA 환경의 주요 보안 위협으로부터 모델을 보호하는 것을 목표로 합니다.
OpenAI가 내부 목표를 달성하지 못했다는 소식이 알려지면서 관련 기술주들이 큰 타격을 입었습니다. 이로 인해 NVIDIA, Oracle, AMD와 같은 주요 반도체 및 클라우드 기업뿐만 아니라 소프트뱅크(SoftBank)의 주가까지 하락세를 보였습니다. 특히 일본 도쿄 증권거래소에서 소프트뱅크는 가치의 9.9%를 잃을 정도로 큰 폭의 하락을 경험했습니다.
Nvidia가 메모리 부족(RAMpocalypse) 상황 속에서도 고용량의 12GB 버전 RTX 5070 노트북용 GPU를 출시했습니다. 이 새로운 제품은 기존의 8GB 모델 대비 VRAM 용량이 50% 증가하여, 메모리가 중요한 중급 모바일 게이밍 환경에 더 많은 자원을 제공할 것으로 기대됩니다.
본 기술 기사는 NVIDIA의 새로운 GPU 커널 개발 프레임워크인 CUDA Tile (CuTile)을 Hopper 및 Blackwell 아키텍처에서 다양한 AI 워크로드에 걸쳐 평가합니다. CuTile은 프로그래밍 단순화와 효율성 유지를 목표로 하며, GEMM 및 어텐션 작업 벤치마크를 통해 성능과 이식성을 측정했습니다. 결과적으로, CuTile은 최신 데이터센터급 Blackwell(B200)에서 매우 높은 성능을 보여주었으나, 구형 아키텍처에서는 상당한 성능 저하가 관찰되었고, Triton에 비해 포터빌리티 측면에서는 열세임을 입증했습니다.
쿨링 솔루션 전문 기업인 Noctua가 팬 및 액세서리 관련 3D CAD 파일을 무료로 공개하여 사용자들의 접근성을 높였습니다. 이로써 열성적인 하드웨어 애호가(enthusiasts)들은 직접 부품을 인쇄하고 필요에 따라 수정할 수 있게 되었습니다. 다만, Noctua는 자사의 지적재산권(IP) 보호를 위해 일부 미묘한 수정 조치를 취했음을 밝혔습니다.
최신 AGESA 업데이트를 통해 AM5 플랫폼의 800 시리즈 메인보드에서 EXPO 1.2 지원이 확대되고 있으나, CUDIMM(저전력 메모리)과의 완벽한 호환성에는 여전히 제한이 있습니다. Zen 4 및 Zen 5 아키텍처의 IMC 문제로 인해 CUDIMM은 현재 바이패스 모드로만 작동할 수 있는 경우가 많습니다. 다만, ASUS와 같은 제조사들은 기존 B650 및 X670 보드에도 EXPO 1.2 업데이트를 진행하여 지원 범위를 넓히고 있습니다.
Gigabyte X870E Aorus Xtreme X3D AI Top 메인보드는 플래그십급 하드웨어와 우수한 성능을 상대적으로 합리적인 가격에 제공하는 것이 특징입니다. 이 보드는 고급 기능, 포괄적인 연결성, 그리고 AM5 플랫폼의 프리미엄 빌드를 위한 최신 AI 중심 도구들을 균형 있게 탑재하고 있습니다.
마이크로소프트와 오픈아이의 전략적 동맹 관계가 재편되고 있습니다. 마이크로소프트는 더 이상 오픈아이에게 수익을 공유하지 않지만, 그 반대 방향으로의 흐름은 지속될 것으로 예상됩니다. 이 변화에 따라 오픈아이는 아즈어(Azure)를 넘어 다른 클라우드 서비스 제공업체(CSP)와 협력할 수 있는 유연성을 확보하게 되었습니다.
Canonical은 Ubuntu 운영체제에 인공지능(AI) 기능을 도입할 로드맵을 공개했습니다. 이번 AI 통합의 핵심 초점은 클라우드 추적이나 강제적인 시스템 변경이 아닌, 사용자가 직접 선택하는 옵트인 방식의 로컬 AI 추론 및 에이전트 시스템 도구 개발입니다. 특히 개인 정보 보호(프라이버시)를 최우선으로 고려하여 설계되었으며, 접근성 향상 기능에도 활용될 예정입니다.