Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Fireworks.ai가 Hugging Face Hub의 공식 지원 Inference Provider로 합류했습니다. 이를 통해 사용자들은 HF 생태계 전반에서 번개 속도의 서버리스 추론을 더욱 쉽게 이용할 수 있게 되었습니다. 이제 DeepSeek-R1, Mistral-Small-24B 등 다양한 인기 모델들을 Fireworks.ai를 통해 서버리스 방식으로 실행할 수 있으며, `huggingface_hub` 라이브러리나 cURL 명령어를 사용하여 통합적으로 접근하는 방법을 안내하고 있습니다.
구글이 PaliGemma 2 Mix라는 새로운 시각 언어 모델(VLM)을 출시했으며, 이는 OCR, 긴/짧은 캡션 생성 등 다양한 시각 작업에 맞게 미세 조정되었습니다. 이 모델은 단순히 채팅 기능을 제공하기보다, 하위 작업에서 더 잘 학습할 수 있도록 설계된 사전 학습 체크포인트를 제공하는 데 중점을 둡니다. 사용자는 개방형 프롬프트와 특정 작업 접두사(예: `caption`, `ocr`, `answer`)를 사용하여 이미지 질문 답변, 문서 이해, 객체 감지 등 다양한 전문 작업을 수행할 수 있습니다.

SmolVLM2는 거대한 컴퓨팅 자원을 요구하는 기존의 비디오 이해 모델 패러다임을 전환하여, 스마트폰부터 서버까지 모든 기기에서 실행 가능한 효율적인 경량화 비디오 언어 모델입니다. 이 프로젝트는 256M, 500M, 2.2B 세 가지 크기의 모델을 제공하며, 특히 메모리 효율성 대비 뛰어난 성능으로 Video-MME와 같은 과학적 벤치마크에서 선두를 달리고 있습니다. 개발자들은 MLX 및 Python API를 통해 즉시 접근할 수 있으며, 이를 활용하여 로컬 기기 기반의 비디오 분석 앱(예: 아이폰 앱), 지능형 미디어 플레이어 통합, 장시간 영상 요약 도구 등 다양한 실용적인 애플리케이션을 구축할 수 있습니다.
Hugging Face는 JFrog와 파트너십을 맺고 Hugging Face Hub의 보안을 강화합니다. 이번 협력을 통해 JFrog의 강력한 스캐닝 기능을 통합하여, 모델 가중치에서 발생할 수 있는 임의 코드 실행(RCE)과 같은 잠재적인 악성 코드를 탐지하고 투명성을 높입니다. 이 기능은 모든 공개 모델 저장소에 자동으로 적용되어 커뮤니티가 안전하게 AI 모델을 공유하도록 돕습니다.

LeRobot 팀에서 발표한 L2D(Learning to Drive) 데이터셋은 독일의 30개 도시에서 수집된 90TB 이상의 초대형 오픈소스 자율주행 데이터셋입니다. 이 데이터셋은 HD 카메라 6대, GPS/IMU, CAN 인터페이스를 포함하는 다중 모달 데이터를 제공하며, 단순한 주행 기록을 넘어 자연어 지시와 미래 웨이포인트가 결합된 '에피소드' 단위로 구성되어 있습니다. L2D의 가장 큰 특징은 '전문가 정책(최적 주행)'과 '학생 정책(실수 포함 학습 과정)'이라는 두 가지 관점의 데이터를 모두 담고 있어, 자율주행 시스템이 단순한 경로 추종을 넘어 복잡하고 현실적인 운전 상황에서의 의사결정 능력을 훈련할 수 있도록 설계되었습니다.
Hugging Face는 Xet 스토리지를 Hugging Face Hub에 상용화하며 AI 빌더들이 거대 모델과 데이터셋을 더욱 효율적으로 관리하고 협업할 수 있도록 지원합니다. 기존 LFS(Large File Storage)가 파일 단위로 중복 제거 및 리비전을 생성하는 방식의 한계를 극복하기 위해, Xet은 콘텐츠 정의된 청킹(CDC)을 사용하여 바이트 수준에서 중복을 제거하고 변경된 데이터 조각만 전송할 수 있게 합니다. 이 마이그레이션 과정은 4.5TB 규모의 저장소를 성공적으로 전환했으며, 시스템 안정성과 성능 향상을 입증했습니다.
NVIDIA가 GTC 2025에서 물리 AI 개발자를 위한 혁신적인 오픈 모델과 데이터셋을 발표했습니다. 주요 내용으로는 가상 세계 장면 생성에 높은 제어력을 제공하는 'Cosmos Transfer'와 로봇 훈련용 대규모 데이터를 담은 'Physical AI Dataset'이 있습니다. 또한, 인간형 로봇의 추론 및 조작 기술을 위한 최초의 오픈 파운데이션 모델인 'Isaac GR00T N1'도 공개되어, 자율 시스템 개발에 새로운 지평을 열었습니다.
본 문서는 백악관의 AI 행동 계획 RFI에 대한 답변으로, 개방형(오픈소스) AI 개발 접근법이 성능, 투명성, 경제적 효율성 측면에서 상업적 API 기반 솔루션보다 우수함을 주장합니다. 오픈 가중치 모델과 오픈 인프라를 활용하는 것이 국가 차원의 AI 발전 및 채택에 필수적이며, 특히 의료와 같은 고위험 환경에서는 완전한 통제와 투명성을 제공하는 개방형 시스템이 보안 및 신뢰성 측면에서 가장 중요하다고 강조합니다.
본 연구는 뇌파(EEG), 근전도(EMG), 전도성 피부 반응(GSR) 등 다중 모달 생리학적 신호를 활용하여 운전자 행동을 분류하는 해석 가능하고 확장 가능한 프레임워크를 제안합니다. 이 접근법은 SHAP 기반의 특징 선택을 통해 고차원성을 관리하고, XGBoost와 LightGBM 모델에 대한 베이지안 최적화를 거친 가중치 소프트-보팅 앙상블을 구축했습니다. 그 결과, 단일 모달 대비 현저히 높은 정확도(80.91%)와 매크로-F1 점수(0.79)를 달성하며 다중 모달 융합의 우월성을 입증하고 모델 해석 가능성까지 확보했습니다.

Meta가 Llama 4 Maverick와 Scout라는 강력한 원생적 멀티모달 모델을 Hugging Face 생태계에 출시하며 AI 분야의 중요한 도약을 알렸습니다. 이 두 모델은 각각 대규모(Maverick) 및 효율성(Scout)에 초점을 맞추었으며, 최대 40조 토큰으로 훈련되어 200개 언어와 멀티모달 기능을 지원합니다. 특히 Scout는 온-더-플라이 양자화를 통해 접근성을 높였고, 두 모델 모두 Hugging Face의 `transformers` 및 TGI를 완벽하게 통합하여 프로덕션 환경에서의 사용이 용이합니다.
본 논문은 임베디드 AI(EAI) 시스템이 실제 환경에 적용되면서 발생하는 심각한 프라이버시 문제를 다룹니다. 기존 EAI 솔루션들은 각 구성 요소를 독립적으로 최적화하는 경향이 있어, 전체 라이프 사이클에서 발생할 수 있는 통합적인 프라이버시 위기를 간과하고 있습니다. 이를 해결하기 위해 저자들은 '안전한 프라이버시 통합(SPINE)'이라는 새로운 프레임워크를 제안하며, 프라이버시를 시스템 전반의 구조적 제약으로 다루어 EAI의 안전성과 기능성을 동시에 확보하는 방법을 제시합니다.
본 논문은 인도네시아 트위터 데이터셋을 활용하여 이분법적 혐오 표현 감지에 대한 두 가지 접근 방식, 즉 PyCaret AutoML과 CNN-BiLSTM의 성능을 비교합니다. 연구는 전통적인 TF-IDF 및 사전 기반 카운팅을 사용하는 모델링 분지와 밀도 토큰 학습 및 양방향 문맥 포착에 중점을 둔 신경망 분지를 비교했습니다. 그 결과, CNN-BiLSTM이 높은 정확도(83.8%)와 F1 점수(81.2%)를 달성하며 가장 우수한 성능을 보였고, 이는 전통적인 모델 대비 상당한 개선임을 입증합니다.
SPEC CPU 벤치마크가 약 10년 만에 새로운 버전인 SPEC CPU 2026을 출시했습니다. 이 업데이트된 스위트는 기존보다 두 배 이상 증가한 테스트 케이스와 현대화된 워크로드를 포함하며, Raspberry Pi부터 서버급 시스템까지 다양한 환경에서 실행될 수 있도록 포터빌리티를 고려하여 설계되었습니다. SPEC의 핵심 목표는 모든 준수 시스템에서 결정론적(Deterministic) 결과를 보장하는 것입니다. 이를 위해 벤치마크 코드는 C/C++/Fortran으로 통일하고, 운영체제나 하드웨어 아키텍처에 따른 비결정성을 제거하기 위해 광범위한 수정 과정을 거칩니다. SPEC CPU는 서버 환경을 목표로 하며, 성능 측정은 단일 실행의 '속도(Speed)'와 동시 다발적 처리를 측정하는 '처리량(Rate)' 두 가지 지표를 통해 이루어집니다.
Qwen3.6 27B Uncensored Heretic V2 Native MTP Preserved 모델이 출시되었습니다. 이 모델은 KLD 0.0021, 6/100 Refusals 및 전체 15 MTPs를 보존하며, 사용자가 다양한 형식(Safetensors, GGUFs, NVFP4s)으로 다운로드할 수 있도록 제공됩니다. 특히 모든 버전에서 15개의 MTPs가 유지되어 모델의 특성을 보존한 것이 특징입니다.
로컬 모델과 에이전트 해르네스 기술의 발전으로 인해, 이제 초급 IT 전문가 수준의 시스템 관리 및 운영 작업까지 AI가 효과적으로 처리할 수 있게 되었습니다. 필자는 Qwen3.6 27b와 같은 로컬 SLM을 사용하여 서버 업데이트, Docker 설치, 여러 저장소 설정 등 복잡한 초기 IT 인프라 구축 작업을 성공적으로 수행했음을 보고했습니다. 이는 관리자의 노동 절감과 효율성 증대를 가져올 것이며, 향후 AI 에이전트가 시스템 관리 영역에서 핵심적인 역할을 맡게 될 것임을 시사합니다.
본 기사는 llama.cpp의 PR #22673을 활용하여 Strix Halo MTP(Matrix Transfer Pattern) 기능을 AI Max 395 시스템에 적용한 성능 평가 결과를 다룹니다. MTP 기능 활성화 결과, 토큰 생성 속도가 기존 약 40 토크/초에서 60~80 토크/초로 크게 향상되는 것을 확인했습니다 (Vulkan 환경에서는 40~50 토크/초 수준). 이 테스트는 AI 가속기 성능 최적화에 있어 MTP 기능의 중요성을 보여줍니다.
SLYP는 Windows COM(Component Object Model) 바이너리의 경쟁 조건 취약점을 발견하고 검증된 PoC 코드를 생성하는 엔드 투 엔드 에이전트 기반 파이프라인입니다. 이 시스템은 바이너리 탐색, COM 점검, 동적 디버깅 기능을 재사용 가능한 도구 인터페이스로 제공하여 AI 에이전트가 취약점 발견부터 검증된 PoC 생성까지의 전 과정을 수행할 수 있도록 지원합니다. 벤치마크 결과와 실제 테스트에서 SLYP는 기존 코딩 에이전트보다 월등히 높은 성능을 보여주었으며, 미공개 취약점을 다수 발견하여 보안 가치를 입증했습니다.
CuBridge는 다양한 attention 변형을 지원하는 고품질의 CUDA attention 커널을 재구성하기 위한 새로운 프레임워크입니다. 이 프레임워크는 전문가가 작성한 CUDA 코드를 구조화된 lift-transfer-lower 워크플로우를 통해 추상화하고, 실행 가능한 중간 표현(IR)으로 승격시킵니다. 사용자가 PyTorch 사양만 제공하면 CuBridge가 최적화되고 정확성이 보장되는 CUDA 코드를 자동으로 생성하여, 기존 방법들의 성능 및 유연성 문제를 해결합니다.
UniVer는 조건부 최적 전송(Conditional Optimal Transport, COT) 문제를 활용하여 대형 언어 모델의 추측 해독(Speculative Decoding) 과정을 통합적으로 형식화하는 새로운 방법을 제안합니다. 기존 방식들이 다단계 및 다 드래프트 측면을 분리하여 처리했던 한계를 극복하고, 수직 의존성을 접두어 확률로 추상화하여 수평 드래프트 선택에 능동적으로 활용합니다. 이를 통해 UniVer는 트리 레벨 전체를 함께 최적화하는 검증 알고리즘을 구현하며, 기존 방식 대비 높은 효율성 개선과 정확도 유지라는 이점을 입증했습니다.
FAAST는 사전 학습된 모델의 효율적인 지도 학습 적응을 위해 제안된 새로운 방법론입니다. 이 방법은 단일 패스(single pass)로 라벨링된 예시들을 분석적으로 빠른 가중치(fast weights)로 컴파일하여, 메모리나 컨텍스트 의존성을 제거합니다. 그 결과, FAAST는 상수 시간 추론을 달성하고 기존의 역전파 기반 적응 방식과 동등하거나 더 나은 성능을 보이면서도 적응 시간을 90% 이상 단축하고 메모리 사용량을 크게 절감하는 효율적인 솔루션을 제공합니다.