Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 가이드는 React Native를 사용하여 스마트폰에서 LLM을 구동하는 방법을 안내합니다. DeepSeek R1이나 Qwen 2.5와 같은 소형 모델(1~3B 파라미터)을 활용하여, 사용자의 기기 내에서 완전히 오프라인으로 작동하는 개인 정보 보호에 초점을 맞춘 대화형 AI 앱을 구축할 수 있습니다. 핵심은 `llama.rn` 바인딩과 GGUF 파일을 효율적으로 로드하여 모바일 환경에 최적화된 LLM 추론 기능을 구현하는 것입니다.
Hugging Face와 IISc/ARTPARK의 파트너십으로 인도의 방대한 언어적 다양성을 포괄하는 오픈소스 멀티모달 데이터셋 'Vaani'가 구축되고 있습니다. 이 프로젝트는 773개 구에서 수집된 15만 시간 이상의 음성 및 전사 데이터를 포함하며, 주류 언어뿐 아니라 원격 지역의 방언까지 아우르는 독보적인 규모와 지리적 대표성을 자랑합니다. Vaani 데이터셋은 STT/TTS 모델 미세 조정, 발화자 식별, 언어 식별 등 다양한 AI 애플리케이션 개발에 활용될 수 있으며, 인도 전역을 커버하는 포용적이고 견고한 기초 음성 모델 구축의 핵심 자원이 될 것입니다.
본 기사는 Alibaba Cloud의 최신 Qwen-3 모델이 이전 버전에 비해 얼마나 정교하고 지능적인 채팅 템플릿을 갖추었는지 분석합니다. Qwen-3는 `enable_thinking` 플래그를 통해 사고(Chain-of-Thought) 과정을 선택적으로 활성화/비활성화할 수 있게 했으며, 'rolling checkpoint' 시스템을 도입하여 다단계 도구 호출 시 관련 컨텍스트를 효율적으로 유지하고 토큰 낭비를 줄입니다. 또한, 타입 검사를 강화하여 JSON 직렬화 오류 위험을 낮추고, 기본 시스템 프롬프트 없이도 정확한 역할을 수행하는 등 에이전트 워크플로의 신뢰성과 유연성을 크게 향상시켰습니다.
본 기사는 기존 OCR 엔진(olmOCR)이 헤더 및 푸터와 같은 레이아웃의 중요한 정보를 누락하는 문제를 다루고, 이 한계를 극복하기 위한 미세 조정 과정을 설명합니다. 저자들은 Qwen2.5-VL-72B-Instruct를 사용하여 8,000개의 문서 데이터셋으로 olmOCR을 재훈련시켰으며, 그 결과 헤더와 푸터의 중요한 정보까지 포함하여 포괄적인 정보 추출이 가능해졌음을 보여줍니다.

Microsoft와 Hugging Face는 Azure AI Foundry를 통해 협력을 대폭 확대하여, 기업 고객들이 200만 개 이상의 방대한 오픈 모델 생태계를 안전하고 쉽게 활용할 수 있도록 지원합니다. 이 새로운 프레임워크는 사용자가 사내 데이터와 결합하여 기술과 데이터를 완전히 통제하는 AI 애플리케이션 및 에이전트를 구축할 수 있게 합니다. 특히, Azure AI Foundry의 Hugging Face Collection에서는 텍스트, 오디오, 이미지를 아우르는 다양한 작업을 수행하는 검증된 모델들을 몇 번의 클릭만으로 배포할 수 있으며, 보안 테스트와 안전한 형식을 통해 기업 환경에 최적화되었습니다.
Falcon-Arabic은 70억 파라미터 규모의 다국어 언어 모델인 Falcon 3 아키텍처를 기반으로 개발된, 아랍어 NLP 분야의 혁신적인 모델입니다. 이 모델은 일반 지식, 복잡한 추론, 그리고 다양한 아랍어 방언을 포괄적으로 이해하고 생성하는 데 탁월하며, 기존 아랍어 LLM의 성능 한계를 뛰어넘습니다. 개발팀은 토크나이저를 확장하고 임베딩 초기화 전략을 적용하여 모델에 아랍어 전문 지식을 주입한 후, 고품질 원생 데이터셋으로 연속 전 훈련을 진행했습니다. 그 결과, Falcon-Arabic은 주요 아랍어 벤치마크에서 기존의 모든 아랍어 LLM을 능가하는 최첨단 성능을 입증하며 아랍어 AI 분야의 새로운 표준을 제시합니다.
Holo1은 딥 웹 UI 이해와 정밀한 로컬라이제이션을 위해 설계된 오픈 소스 Action VLM(Vision-Language Model) 패밀리입니다. 이 모델은 Qwen2.5-VL 아키텍처를 기반으로 하며, WebClick과 같은 표준화된 벤치마크에서 높은 정확도를 보여줍니다. Holo1에 의존하는 Surfer-H는 Policy, Localizer, Validator의 모듈식 아키텍처를 갖춘 웹 네이티브 에이전트로, 브라우저만 사용하여 인간처럼 복잡한 웹 작업을 수행할 수 있게 합니다.
SGLang이 Hugging Face transformers 라이브러리를 백엔드로 공식 통합하여, 개발자들이 기존의 유연한 transformers 생태계를 유지하면서도 고성능 추론 환경을 구축할 수 있게 되었습니다. 이 통합을 통해 SGLang은 자체적으로 지원하지 않는 다양한 커스텀 모델이나 최신 트렌드의 모델(예: Kyutai Helium)까지 자동으로 처리하여, 임베디드 및 프로덕션 환경에서 일관된 고성능 추론 경험을 제공합니다. 특히, SGLang의 핵심 강점인 RadixAttention과 같은 메모리 효율적인 메커니즘을 활용하면서도 transformers의 광범위한 호환성을 확보함으로써, 개발자는 모델 선택의 폭을 넓히고 엔지니어링 오버헤드를 크게 줄일 수 있습니다.
NVIDIA가 Llama Nemotron Nano VL이라는 최신 다중 모달(multimodal) VLM을 발표하며 Hugging Face Hub에 공개했습니다. 이 모델은 지능형 문서 처리(IDP)와 광학 문자 인식(OCR)의 경계를 확장하여, PDF, 이미지, 표, 차트 등 복잡한 시각적 요소를 높은 정확도로 이해하고 추출할 수 있습니다. 특히 OCRBench v2에서 뛰어난 성능을 보이며, 금융, 의료, 법률 등 다양한 산업의 문서 워크플로우 자동화에 최적화된 솔루션입니다. 이 모델은 Llama-3.1-8B-Instruct와 C-RADIOv2-VLM-H를 기반으로 하며, 고해상도 입력 처리 능력과 그라운딩(Grounding) 기능을 통해 문서의 지역 세부 사항과 전역 컨텍스트를 모두 보존합니다. 또한 2단계 훈련 체제(Pre-training 및 SFT)와 방대한 데이터셋을 활용하여 압도적인 정확도를 달성했습니다.
FilBench는 타갈로그(Tagalog), 필리핀어(Filipino), 세부아노(Cebuano) 등 필리핀 언어에 대한 대규모 언어 모델(LLM)의 성능을 종합적으로 평가하기 위해 개발된 포괄적인 벤치마크입니다. 이 벤치마크는 문화적 지식, 고전 NLP, 독해 이해, 생성 네 가지 주요 카테고리로 구성되어 있으며, 각 영역에서 LLM의 깊이 있는 능력을 측정합니다. 평가 결과에 따르면, 동남아시아 특화(SEA-specific) 모델들이 가장 높은 성능을 보였으나, 여전히 GPT-4o와 같은 최신 클로즈드소스 모델에는 미치지 못했습니다. 하지만 FilBench는 필리핀어/SEA 특화 데이터를 지속적으로 큐레이션하고 파인튜닝하는 노력이 여전히 매우 중요하며, 이 분야의 연구 방향을 제시합니다.

Hugging Face의 오픈소스 도구인 AI Sheets가 비전(Vision) 기능을 추가하여, 스프레드시트 내에서 이미지 기반 데이터 처리 능력을 혁신적으로 강화했습니다. 사용자는 영수증이나 문서 같은 이미지에서 데이터를 추출하고, 텍스트를 바탕으로 이미지를 생성 및 편집하며, 모든 시각 자료를 구조화된 워크플로우로 관리할 수 있습니다. 이 기능을 통해 제품 카탈로그 분석, 비용 추적, 콘텐츠 캘린더 제작 등 다양한 분야에서 비정형 이미지 데이터의 가치를 극대화하고, 텍스트와 이미지를 통합한 강력한 데이터셋을 구축할 수 있게 되었습니다.
Nemotron-Personas-India는 인도의 실제 인구 통계, 지리적, 문화적 분포를 반영하여 구축된 최초의 오픈 합성 데이터셋입니다. 이는 서양 중심의 기존 데이터셋이 포착하지 못했던 인도 특유의 다언어 및 다문화적 맥락을 AI 모델 훈련에 제공합니다. 이 데이터셋은 CC BY 4.0 라이선스로 공개되어, 개발자들이 프라이버시 위험 없이 인도의 복잡한 사회를 반영하는 주권(Sovereign) AI 시스템을 구축하고 다양한 지역별 전문 코파일럿 및 다언어 챗봇을 개발할 수 있도록 지원합니다.
Together AI가 Hugging Face Hub의 모든 LLM을 자신들의 플랫폼에서 쉽게 미세 조정할 수 있는 기능을 출시했습니다. 이 통합은 복잡하고 비쌌던 기존의 미세 조정 인프라 문제를 해결하며, 사용자는 이제 Meta나 개별 기여자 등 출처에 관계없이 Hub의 호환 가능한 모든 모델을 Together AI 환경에서 일관된 용이성과 신뢰성으로 훈련할 수 있습니다. 또한, 훈련 후에는 결과물을 다시 Hugging Face Hub로 자동 업로드하여 커뮤니티와 공유하는 양방향 워크플로우를 지원합니다.
비전-언어 모델(VLMs)의 발전으로 OCR 기술은 단순한 텍스트 변환을 넘어 문서 검색, 질문 답변 등 복잡한 영역으로 확장되었습니다. 최신 OCR 모델들은 손글씨, 다양한 스크립트, 수학 공식뿐만 아니라 표와 차트 같은 시각적 요소를 인식하고 이를 DocTags, HTML, Markdown 등의 구조화된 기계가 읽을 수 있는 형식으로 변환합니다. 사용 목적(디지털 재구성, LLM 입력/Q&A, 프로그램적 사용)에 따라 적절한 출력 형식을 가진 모델을 선택하는 것이 중요합니다.