Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
이 기술 기사는 웹 기반 운영체제(OS) 해킹 시뮬레이터와 가상 파일 시스템을 소개합니다. 이는 보안 연구 및 교육 목적으로 설계되었으며, 사용자가 실제 OS 환경과 유사한 조건에서 다양한 해킹 공격을 안전하게 연습하고 테스트할 수 있도록 돕습니다. 특히, 이 도구는 웹 브라우저 환경 내에서 작동하여 접근성이 높고, 실습 기반의 학습 경험을 제공하는 것이 특징입니다.
본 기사는 대규모 언어 모델(LLM)을 효과적으로 미세 조정(Fine-Tuning)할 수 있도록 설계된 6가지 핵심 오픈소스 라이브러리를 소개합니다. 각 라이브러리는 특정 목적과 장점을 가지고 있어, 사용자의 컴퓨팅 환경이나 원하는 훈련 방식에 맞춰 선택할 수 있습니다. Unsloth는 낮은 VRAM 환경에서 빠른 속도를 제공하며, Axolotl은 유연한 설정으로 복잡한 파이프라인을 구축하는 데 적합합니다.
본 논문은 대규모 양자 오류 수정 코드(QECC)의 실시간 디코딩을 위한 효율적이고 확장 가능한 알고리즘인 'Lottery BP'를 제안합니다. Lottery BP는 기존 확률적 전파(BP) 방식 대비 높은 정확도 향상을 제공하며, Syndrome vote 전처리 단계를 통해 다중 라운드 오류 측정의 지연 시간 및 백로그 문제를 해결합니다. 또한, 로컬 디코더와 글로벌 디코더를 결합한 'PolyQec' 아키텍처와 PyTorch 기반의 유연하고 빠른 시뮬레이터 'Syndrilla'를 개발하여 양자 컴퓨팅 분야의 실질적인 발전에 기여했습니다.
본 기술 기사는 디자인 검증(DV) 과정에서 발생하는 스펙 문서 해석의 어려움을 해결하기 위한 방법을 제시합니다. 특히, 산업 표준인 DRAM과 같은 자연어 메모리 칩 스펙을 형식적이고 검증 가능한 표현인 DRAMPyML로 자동 변환하는 시스템을 소개합니다. 또한, 하드웨어 자동 형식화 분야의 모델 성능 평가를 위해 새로운 벤치마킹 데이터셋인 DRAMBench도 공개하여 연구 커뮤니티에 기여합니다.
본 논문은 에지 디바이스에서 낮은 지연 시간이 요구되는 신경망 추론 가속화를 위해 DPU와 GPU를 결합하여 CNN을 분할 처리하는 'Split CNN Inference' 방법을 제안합니다. 이 방법은 데이터 소스 근처의 DPU가 초기 레이어를 처리하고, 파이프라인 방식으로 비동기적으로 GPU가 나머지 레이어를 처리함으로써 전체 시스템 지연 시간을 크게 줄입니다. 또한, 모델 구조를 자동으로 최적 분할하기 위해 GNN 기반의 분할 지수 예측 방법을 제시하여 높은 정확도와 성능 향상을 입증했습니다.
본 논문은 에너지 효율성이 높은 스파이킹 신경망(SNN)을 위해 PVT 내성을 갖춘 서브스레드 SRAM 기반 컴퓨팅-인메모리(CIM) 매크로를 제안합니다. 이 아키텍처는 인시투 전류 센서와 분산형 전압 조절기를 통합하여 에너지 오버헤드를 줄이고 공정 변동에 대한 내성을 높였습니다. 특히, 프로그래밍 가능한 메모리 셀 기반 발화 임계값을 사용하여 SNN의 PVT 민감도를 개선했으며, 28nm CMOS에서 높은 정확도와 뛰어난 TOPS/W 성능을 달성하여 고성능 엣지 컴퓨팅 솔루션으로 제시합니다.
VitaLLM은 엣지 디바이스에서 삼진(ternary) 가중치를 사용하는 대형 언어 모델(LLM) 추론을 효율적으로 수행하기 위해 설계된 다목적 소형 가속기입니다. 이 아키텍처는 곱셈 없는 TINT 코어와 BoothFlex 코어를 결합하여, 배열 복제 없이도 다양한 정밀도의 연산을 처리합니다. 또한, 예측 스텔스 어텐션 메커니즘과 시스템 레벨 최적화를 통해 KV 트래픽을 줄이고 전반적인 효율성을 극대화했습니다.
본 기술 기사는 대형 언어 모델(LLMs)의 에지 배포 시 발생하는 컴퓨팅, 메모리, 전력 제약을 해결하기 위해 'Tempus'라는 새로운 GEMM 스트리밍 프레임워크를 제안합니다. Tempus는 AMD Versal AI SoC의 AIE 코어를 고정된 블록으로 사용하고, 데이터 타일링 및 그래프 실행을 통해 공간적 확장 대신 시간적 확장성을 달성하는 것이 핵심입니다. 이 접근 방식은 기존 SOTA 방법론 대비 월등히 높은 시스템 효율성과 리소스 절감 효과를 보여주며, 에지 LLM 추론에 지속 가능하고 확장 가능한 기반을 제공합니다.
본 논문은 대규모 언어 모델(LLMs)의 효율적인 지원을 위해 도입된 워프 특화와 같은 새로운 GPGPU 아키텍처 기능을 반영하는 시뮬레이션 파이프라인, Sim-FA를 제안합니다. 기존 학술 도구들이 최신 GPU 기능(예: TMA)이나 작업 특성(예: DRAM 트래픽)을 정확하게 포착하지 못하는 한계를 극복하고자 합니다. Sim-FA는 FlashAttention-3 커널 인스트루멘테이션부터 사이클 정확도 시뮬레이션까지 통합하여, H800 대비 낮은 오차율로 높은 정확도를 입증했습니다.
이 기사는 Arduino, ESP32 및 Pi Pico와 같은 인기 있는 마이크로컨트롤러 보드를 위한 제작 준비가 완료된 KiCad 디자인을 소개합니다. GitHub 저장소(Easyduino)를 통해 접근할 수 있으며, 사용자들이 직접 전자 회로 설계를 쉽게 할 수 있도록 돕습니다. 이 리소스를 활용하면 하드웨어 프로토타입 개발 과정에서 설계 및 PCB 레이아웃 단계의 시간을 크게 단축하고 효율성을 높일 수 있습니다.
본 기술 기사는 사용자의 일상적인 컴퓨터 사용 패턴으로부터 그들의 근본적인 삶의 목표를 추론하는 새로운 '스트라이빙 공동 창작(striving co-creation)' 과정을 소개합니다. 이 시스템은 활동 이론과 개인적 스트라이빙 프레임워크에 기반하여, 단순한 행동 관찰을 넘어 사용자 활동의 계층적 구조와 그 목적까지 파악하려고 시도합니다. 특히, 사용자가 시스템이 자신을 이해하는 방식에 개입하고 수정할 수 있는 편집 인터페이스를 제공함으로써, 주도권을 부여하고 더 정확하며 개인화된 목표 추론을 가능하게 합니다.
최첨단 AI 시스템(frontier systems)을 벤치마킹하고 에이전트를 평가하는 비용이 매우 높아져, 이 과정 자체가 새로운 컴퓨팅 병목 현상으로 작용하고 있습니다. 특히 이러한 검증 권한과 자원이 소수의 주체에게 집중되는 경향이 있어, 더 넓은 연구 커뮤니티의 접근성과 참여에 부정적인 영향을 미칠 수 있다는 점을 지적합니다.
인텔과 AMD는 새로운 x86 명령어 집합 확장인 AI Compute Extensions (ACE)를 공동 개발하여 CPU 기반 AI 처리를 혁신하고자 합니다. ACE는 2D 타일 레지스터와 외적 알고리즘을 도입하여 기존 AVX 대비 월등히 높은 계산 밀도를 제공하며, GPU의 텐서 코어 기능을 표준 프로세서 아키텍처에 통합합니다. 이 기술은 낮은 전력 소모로 CPU에서 AI 워크로드를 실행하게 하여 데이터센터의 에너지 효율성과 지연 시간 문제를 해결하고, 주요 ML 프레임워크와의 호환성을 보장함으로써 미래 컴퓨팅 환경을 재정의할 잠재력을 가집니다.
Z.AI는 GLM-5 시리즈 모델을 고 부하 환경에서 빌드할 때 발생하던 간헐적인 글자 오류 및 예상치 못한 행동 문제를 해결했다고 발표했습니다. 이 문제는 모델 성능 저하가 아닌 인프라 문제였으며, 이를 수정하여 비정상적인 출력은 거의 0 수준으로 감소하고 피크 동시성 상황에서도 더 빠른 TTFT와 안정적인 서비스 제공이 가능해졌습니다.
본 논문은 세계 모델(World Models) 연구가 시각적 합성, 3D 재구성, 잠재 표현 등 여러 부분으로 분산되어 있어 물리적으로 신뢰할 수 있는 예측에 한계가 있음을 지적하며, 이를 해결하기 위해 해밀토니안 세계 모델(Hamiltonian World Models)을 제안합니다. 이 모델은 관찰을 구조화된 잠재 위상 공간에 인코딩하고, 제어, 감쇠, 잔류항이 포함된 해밀토니안 역학을 통해 상태를 진화시키며 예측 궤적을 생성하여 계획에 활용하는 물리 기반 접근 방식입니다. 이러한 해밀토니안 구조는 모델의 해석 가능성, 데이터 효율성, 그리고 장기적인 안정성을 크게 개선할 수 있습니다.
본 기술 기사는 대형 언어 모델(LLMs)의 메모리 및 컴퓨팅 요구사항 문제를 해결하기 위해 BWLA (Binarized Weights and Low-bit Activations)라는 새로운 양자화 프레임워크를 제안합니다. BWLA는 가중치를 1비트로 압축하는 동시에 활성화에 저비트 정밀도(예: 6비트)를 적용하여, 기존 방법들이 해결하지 못했던 활성화의 무거운 꼬리 문제를 극복하고 높은 정확도를 유지합니다. 이 프레임워크는 Qwen3-32B 모델에서 뛰어난 성능을 보여주었으며, 추론 속도 향상과 다양한 NLP 작업에서의 개선을 입증하며 LLM 경량화에 큰 잠재력을 제시합니다.
본 논문은 장기 지평 로봇 조작을 위해 명시적인 중간 표현인 '교차 시각-언어 추론 흔적(Interleaved Vision-Language Reasoning Trace)'을 활용하는 IVLR 프레임워크를 제안합니다. 이 프레임워크는 초기 관측과 지시사항에서 전역적인 의미-기하학적 단서를 생성하고, 이를 행동 디코더에 조건부로 제공하여 로봇의 계획 일관성을 높입니다. 시뮬레이션 벤치마크(LIBERO 등)에서 높은 성공률을 달성했으며, 특히 두 모달리티가 결합된 전역적인 흔적이 가장 효과적임을 입증했습니다.
본 논문은 AI 접근법을 활용하여 전통적인 CFD 시뮬레이션을 가속화하는 방법을 다루며, 특히 IPU-POD16 플랫폼에 최적화된 솔루션을 제시합니다. 연구진은 Poplar SDK와 커스텀 TensorFlow를 사용하여 CFD 응용 프로그램을 훈련시키고, 'popdist' 라이브러리를 통해 데이터 공급 병목 현상을 해결하여 최대 34%의 속도 향상을 달성했습니다. 또한, IPU 간 통신을 활용한 데이터 병렬성을 통해 처리량을 크게 개선할 수 있음을 입증했습니다.
본 연구는 부분 자동화 운전 시스템 환경에서 '의미 있는 인간 제어(MHC)'를 경험하는 정도를 평가하기 위한 새로운 방법을 제시했습니다. 24명의 운전자들을 대상으로 촉각 공유 제어 및 거래된 제어 모드 하에 시뮬레이터 실험을 진행하고, 행동 데이터와 주관적 설문조사를 결합하여 분석했습니다. 연구 결과, 자동화 차량의 이해도와 조향 토크 충돌 간의 음의 상관관계가 확인되었으며, 운전자 의도와 일치하는 미묘한 촉각 안내가 MHC를 높이는 긍정적인 효과를 가짐을 발견했습니다. 따라서 미래 시스템 설계는 무리 없는 개입과 자동화 의도의 투명한 전달에 중점을 두어야 합니다.
본 논문은 우주 데이터 센터에서 대규모 언어 모델(LLMs)을 효율적으로 분산 배포하는 'Space Network of Experts (Space-XNet)' 프레임워크를 제안합니다. 이 프레임워크는 MoE(Mixture-of-Experts) 모델의 특성을 활용하여, LLM의 구성 요소들을 여러 위성 네트워크에 최적화된 방식으로 배치하고 매핑하는 두 단계의 전략을 제시합니다. 실험 결과, Space-XNet은 기존 방식 대비 최소 3배의 지연 시간 감소 효과를 입증하며 우주 기반 AI 컴퓨팅의 실현 가능성을 높입니다.