Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 글은 LLM 추론 성능 향상을 위해 Continuous Batching의 한계점인 동기적(synchronous) 작동 방식을 개선하는 방법을 다룹니다. 기존 방식에서는 GPU 계산과 CPU 준비 작업이 순차적으로 진행되어 유휴 시간이 발생하며, 이는 전체 처리량 손실을 초래합니다. 이를 해결하기 위해 CPU와 GPU 워크로드를 분리하여 병렬로 실행할 수 있는 비동기 배치(asynchronous batching) 구현의 필요성과 기술적 접근 방식을 설명합니다.
Hugging Face는 새로운 전략적 파트너십을 통해 Google Cloud와의 협력을 강화하며, 모든 기업이 자신만의 AI를 구축하고 커스터마이징할 수 있는 환경을 제공합니다. 이 파트너십은 Vertex AI, GKE, Cloud Run 등 다양한 Google Cloud 서비스에서 Hugging Face의 방대한 오픈 모델(open models)을 쉽게 배포하고 사용할 수 있도록 지원하며, CDN Gateway와 같은 기술적 개선을 통해 모델 공급망의 안정성과 속도를 대폭 향상시킵니다. 또한, TPU 네이티브 지원 및 강화된 보안 기능을 통합하여 사용자들에게 최고의 성능과 안전성을 제공하는 것을 목표로 합니다.
Reachy Mini는 인간-로봇 상호작용(HRI), 창의적 코딩, AI 실험을 위해 설계된 오픈 소스 로봇입니다. Python 기반으로 프로그래밍이 가능하며, $299부터 시작하는 가격으로 누구나 접근할 수 있습니다. 이 키트형 로봇은 데스크톱 크기로, 최신 AI 모델을 활용하여 실제 애플리케이션 개발 및 테스트를 할 수 있도록 지원합니다. Reachy Mini는 표현력이 풍부한 움직임과 멀티모달 센싱(카메라, 마이크 등) 기능을 갖추고 있으며, Hugging Face 통합을 통해 오픈 소스 생태계의 이점을 극대화합니다. 또한 모든 하드웨어와 소프트웨어가 오픈 소스로 제공되어 커뮤니티 주도 성장이 가능합니다.
본 글은 생성형 AI 콘텐츠의 확산으로 인해 중요성이 커진 워터마킹 필요성을 언급하며, Hugging Face가 이를 쉽게 구현할 수 있는 '가시적 워터마킹(Visible Watermarking)' 기능을 Gradio 라이브러리에 추가했음을 소개합니다. 개발자는 단 한 줄의 코드를 사용하여 이미지, 비디오, 텍스트 등 다양한 형식에 워터마크를 적용할 수 있습니다.
HCompany는 가장 진보된 컴퓨터 사용 AI 모델인 Holo3를 출시하고, 이를 브라우저에서 사용할 수 있는 Chrome 확장 프로그램 'HoloTab'을 공개했습니다. HoloTab은 사용자가 원하는 작업을 설명하기만 하면, 별도의 기술적 설정 없이도 웹사이트 인터페이스 탐색, 필드 채우기, 의사 결정 등의 모든 과정을 자동화합니다. 이 도구는 반복적이거나 시간이 많이 소요되는 온라인 업무(예: 가격 비교, 구인 공고 검색 등)를 녹화하고 루틴으로 저장하여, 사용자가 필요할 때마다 자동으로 처리하게 합니다.

EMO는 인간이 정의한 사전 지식에 의존하지 않고 모듈 구조 자체가 데이터로부터 직접 창발되도록 종단 간(end-to-end)으로 사전 학습된 새로운 전문가 혼합(MoE) 모델입니다. EMO의 핵심은 '모듈성'을 일급 목표로 삼아, 특정 작업이나 도메인에 대해 전체 전문가 중 극히 작은 하위 집합만을 사용하여도 거의 전체 모델 수준의 성능을 유지할 수 있도록 하는 것입니다. 이는 대규모 LLM을 구성 가능한 아키텍처로 변환하여, 필요한 기능만 선택적으로 로드하고 배포함으로써 효율성과 유연성을 혁신적으로 개선합니다.
본 기술 기사는 AMD Instinct MI300X GPU와 ROCm 환경을 사용하여 임상 질문-답변 모델(MedQA)을 LoRA 방식으로 미세 조정하는 과정을 상세히 설명합니다. 이 프로젝트의 핵심은 기존 의료 AI 작업이 NVIDIA CUDA에 의존하던 관행을 깨고, 코드 변경이나 커스텀 커널 없이 순수하게 AMD ROCm 환경에서 HuggingFace 생태계(Transformers, PEFT 등)를 활용하여 성공적으로 구현했다는 점입니다. 이를 통해 192GB의 대용량 VRAM을 활용하여 Qwen3-1.7B와 같은 모델을 FP16으로 학습하고, LoRA 기법을 적용해 효율적이고 접근성이 높은 임상 AI 개발 파이프라인을 제시합니다.
Google이 온디바이스 환경에 최적화된 멀티모달 대규모 언어 모델(LLM)인 Gemma 3n을 오픈 소스 생태계에 공개했습니다. 이 모델은 이미지, 텍스트, 오디오, 비디오 입력을 모두 지원하며, 특히 메모리 효율성을 극대화하여 실제 파라미터 수보다 훨씬 적은 VRAM으로 구동할 수 있는 것이 특징입니다. Gemma 3n은 transformers, llama.cpp, ollama 등 주요 오픈 소스 라이브러리에 즉시 통합되어 사용 가능합니다.
IBM의 Granite 4.1은 약 15조 토큰을 사용하여 구축된 고성능 디코더 전용 LLM 제품군(3B, 8B, 30B)입니다. 이 모델들은 일반적인 사전 학습 외에도, 고품질 데이터 정제 및 다단계 강화학습 파이프라인을 거쳐 수학, 코딩, 명령어 수행 능력을 체계적으로 향상시켰습니다. 특히, 최대 512K 토큰까지 확장된 긴 컨텍스트 처리 능력과 효율적인 아키텍처 설계를 통해 이전 세대 모델 대비 성능 및 효율성을 높였습니다.
본 기술 기사는 AI 모델의 배포 및 운영에 필수적인 'Inference Endpoints' 분석 기능 개선 사항을 소개합니다. 주요 업데이트는 실시간 지표 제공, 커스터마이징 가능한 시간 범위 설정 및 자동 새로 고침 기능 추가, 그리고 리플리카(Replica) 라이프사이클 추적 뷰 도입입니다. 이러한 개선을 통해 사용자는 엔드포인트의 성능과 상태를 더욱 빠르고 정확하게 모니터링하고 디버깅할 수 있게 되었습니다.
구글이 새로운 오픈 웨이트 LLM 시리즈인 Gemma 3를 출시했습니다. 이 모델은 최대 128k 토큰의 긴 컨텍스트 창을 지원하며, 이미지와 텍스트를 모두 처리할 수 있는 멀티모달 기능을 갖추고 있습니다. 또한 140개 이상의 언어를 지원하여 다국어 성능이 크게 향상되었습니다. Gemma 3는 다양한 크기(1B~27B)로 제공되며, 특히 긴 컨텍스트와 멀티모달리티를 효율적으로 구현하기 위해 RoPE 업그레이드 및 KV 캐시 최적화 등 기술적인 개선을 이루었습니다.
본 기사는 로봇의 범용 지능을 구현하기 위한 Vision-Language-Action (VLA) 모델인 π0와 π0-FAST를 소개합니다. 이 모델들은 기존 LLM/VLM이 부족했던 물리적 세계와의 상호작용 능력을 보완하며, 대규모 사전 학습과 흐름 매칭 기반 액션 생성을 통해 다양한 로봇 플랫폼에서 정교한 조작 작업을 수행할 수 있도록 설계되었습니다. π0는 7개 로봇 플랫폼의 68가지 고유 작업 데이터로 훈련되어 범용적인 로봇 제어 능력을 입증했습니다.
아랍어 지원 LLM의 증가에 따라, 커뮤니티는 기존의 제한적이고 불투명했던 벤치마크 방식을 개선하기 위해 오픈 아랍어 LLM 리더보드(OALL)를 구축했습니다. 이 리더보드는 읽기 이해, 감정 분석 등 다양한 과제를 포함하는 여러 벤치마크를 통합하여 모델 평가의 투명성과 접근성을 높였습니다. 이후 SDAIA와 Inception 등의 주도 하에 Balsam Index, AraGen, SEAL과 같은 전문적이고 심층적인 아랍어 LLM 리더보드들이 연이어 등장하며 아랍어 AI 커뮤니티의 핵심 플랫폼으로 자리매김했습니다.
대규모 언어 모델(LLM)의 추론 과정은 'prefill' 단계와 'decode' 단계로 나뉘며, 이 두 단계는 계산 방식과 성능 최적화 전략이 다릅니다. Prefill 단계에서는 모든 입력 프롬프트 토큰을 병렬로 처리할 수 있어 GPU 연산 집약적이며 높은 컴퓨팅 활용도를 보입니다. 반면, Decode 단계는 개별 요청 수준에서 병렬화가 어려워 메모리 대역폭에 의해 속도가 제한되며, 이 경우 여러 요청의 배치 처리를 통해 GPU 활용도를 높이는 것이 중요합니다.
LeRobot v0.4.0은 오픈소스 로봇 학습 분야에 대규모 업그레이드를 제공하며, 확장성이 강화된 Datasets v3.0, 강력한 VLA 모델(LIBERO 등) 지원, 그리고 새로운 플러그인 시스템을 통해 하드웨어 통합이 용이해졌습니다. 또한, 데이터셋 편집 및 병합 기능을 추가하고, 데이터를 모델과 로봇 하드웨어 양쪽 모두에 맞게 처리하는 범용 'Processor' 파이프라인을 도입하여 전체적인 워크플로우의 효율성과 접근성을 극대화했습니다.
본 기술 기사는 NVIDIA Isaac for Healthcare 프레임워크를 활용하여 의료용 로봇을 시뮬레이션 환경에서 실제 하드웨어까지 배포하는 엔드투엔드 워크플로우를 소개합니다. 이 워크플로우는 데이터 수집(LeRobot), 모델 훈련(Isaac Lab), 정책 배포(RTI DDS)의 3단계 파이프라인으로 구성되어, 시뮬레이션과 실제 세계 데이터를 결합하여 로봇 자율성을 확보하는 것이 핵심입니다. 특히, 이 접근 방식은 합성적으로 생성된 데이터가 전체 훈련 데이터의 대부분을 차지할 수 있게 함으로써, 기존 의료 로봇 개발의 주요 병목이었던 '데이터 격차' 문제를 해결하고 프로토타입 개발 시간을 혁신적으로 단축시킵니다.
DeepSeek-V4는 에이전트 워크로드에 최적화된 100만 토큰 컨텍스트 창을 제공하며, 기존 모델의 긴 실행 과정에서의 불안정성 문제를 해결했습니다. 이 모델은 Compressed Sparse Attention (CSA)와 Heavily Compressed Attention (HCA) 같은 혁신적인 아키텍처를 통해 KV 캐시 메모리 사용량을 극적으로 줄이고, 단일 토큰 추론 FLOPs도 크게 절감하여 효율성을 높였습니다. 또한, V4는 도구 호출이 포함된 다중 턴 에이전트 워크플로우에서 전체 추론 역사를 일관되게 유지하는 능력을 갖추어 복잡한 장기 작업을 수행할 수 있게 합니다.
본 기술 기사는 Open LLM Leaderboard의 MATH-Hard 평가 과정에서 발견된 여러 문제점들을 개선한 'Math-Verify'라는 새로운 파서를 소개합니다. 기존 리더보드는 모델이 답변 형식을 지키지 않거나, 복잡한 수학적 표현(예: 매개변수 방정식, 행렬)을 정확히 파싱하지 못하는 등 심각한 오류를 안고 있었습니다. Math-Verify는 이러한 형식 준수 문제와 다양한 수학적 구조의 파싱 문제를 해결하여, LLM 모델들의 실제 수학 능력을 더욱 공정하고 견고하게 평가할 수 있도록 개선했습니다.
본 기술 기사는 고해상도 이미지 및 비디오 합성을 위한 잠재 공간 확산 모델 사용 시 발생하는 VAE 디코더의 높은 메모리 소비 문제를 해결하기 위한 방법을 제시합니다. 이 문제에 대한 해결책으로, 디코딩 프로세스를 원격 엔드포인트(Remote Endpoint)로 위임하는 실험적인 기능을 소개합니다. 이를 통해 사용자들은 로컬 GPU 환경에서 발생하던 메모리 제약이나 지연 시간 오버헤드를 피하고 안정적으로 모델을 구동할 수 있습니다. 이 기능은 `diffusers` 라이브러리에 추가되었으며, `remote_decode` 헬퍼 함수를 사용하여 다양한 확산 모델(Stable Diffusion, Flux 등)의 디코딩 과정에 적용할 수 있습니다. 또한, 원격 VAE 사용의 장점 중 하나로 여러 생성 요청을 대기열화(Queueing)하여 처리할 수 있다는 점을 강조합니다.
Hugging Face Hub의 업로드 및 다운로드 가속화를 위해 기존의 파일 중심 접근 방식에서 '청크(Chunk)' 기반 시스템을 넘어선 '블록(Block)' 기반 아키텍처로 진화합니다. 이 새로운 시스템은 데이터를 64MB 단위의 블록으로 그룹화하고, 이를 통해 콘텐츠 주소 지정 저장소(CAS)에 기록되는 항목 수를 대폭 줄입니다. 또한, 샤드(Shards)와 키 청크(Key Chunks)를 도입하여 데이터 전송 및 메타데이터 관리의 확장성 문제를 해결하며, 궁극적으로 AI 빌더들의 협업과 실험 속도를 획기적으로 개선하는 것을 목표로 합니다.