Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Hugging Face를 통해 공개된 PP-OCRv6는 1.5M에서 34.5M 파라미터 규모의 경량 OCR 모델 제품군입니다. 50개 언어를 지원하며, 다양한 환경에 맞춰 tiny, small, medium 세 가지 계층으로 제공됩니다.
현재 가장 널리 사용되는 파라미터 효율적 파인튜닝(PEFT) 기술인 LoRA의 압도적인 점유율을 분석하고, 이를 능가하는 새로운 기술들의 필요성을 제기합니다. LoRA의 높은 가시성과 생태계 지원이 사용량을 강화하는 구조를 설명하며, 더 나은 성능을 위한 연구 동향을 다룹니다.

GLM-5.2는 1M 토큰의 견고한 컨텍스트를 지원하며 장기 작업(Long-Horizon Tasks)에 최적화된 오픈 소스 모델입니다. IndexShare 아키텍처와 개선된 MTP 레이어를 통해 효율성을 높였으며, 코딩 에이전트 벤치마크에서 최상위권 성능을 입증했습니다.
Cohere가 에이전트 소프트웨어 엔지니어링에 최적화된 30B MoE 모델인 North Mini Code를 출시했습니다. Apache 2.0 라이선스로 제공되며, 유사 규모의 모델 및 대형 모델들을 능가하는 코딩 성능을 보여줍니다.
이중 언어 사용자의 코드 스위칭(Code-switching) 음성을 처리하기 위한 새로운 ASR 벤치마크와 데이터셋을 소개합니다. HR 및 IT 지원 시나리오를 바탕으로 다양한 언어 쌍의 성능을 측정하며, AU-Harness를 통해 연구 데이터를 공개합니다.
다양한 아키텍처를 가진 소규모 모델들을 활용한 에이전트 기반 경제 시뮬레이션 실험을 다룹니다. 단일 모델의 성향에 의존한 창발적 행동과 이질적인 모델 집단이 만들어내는 실제 시장 반응의 차이를 분석합니다.

Persona Atlas는 유명 인물의 사고방식과 추론 스타일을 시각화하여 비교하는 연구 프로젝트입니다. 단순한 지식 측정을 넘어, 에이전트가 수집한 데이터를 바탕으로 페르소나 간의 관점과 어조 차이를 히트맵 형태로 보여줍니다.
음성 에이전트의 도메인 특화 능력을 평가하기 위한 EVA-Bench Data 2.0이 출시되었습니다. 항공, IT 서비스, 헬스케어 HR 등 3개 도메인과 213개 시나리오를 통해 에이전트의 실무 적응력을 정밀하게 검증합니다.

NVIDIA가 물리적 AI를 위한 최초의 오픈 옴니 모델인 Cosmos 3를 공개했습니다. MoT 아키텍처를 기반으로 텍스트, 이미지, 비디오, 행동 등 다양한 모달리티를 단일 모델에서 통합 처리하며 물리적 세계를 시뮬레이션합니다.

Artificial Analysis와 IBM Research가 에이전트 기반 기업 IT 작업을 평가하는 새로운 벤치마크인 ITBench-AA를 출시했습니다. 첫 번째 영역인 SRE(사이트 신뢰성 공학) 테스트에서 모든 프런티어 모델이 50% 미만의 낮은 점수를 기록하며 에이전트 성능의 한계를 보여주었습니다.
OlmoEarth v1.1은 기존 v1의 성능을 유지하면서도 연산 비용을 최대 3배까지 절감한 새로운 위성 이미지 분석 모델 제품군입니다. 트랜스포머 아키텍처의 효율성을 높이기 위해 모델 크기와 토큰 시퀀스 길이를 최적화하여, 대규모 원격 탐사 데이터 처리 시 발생하는 높은 비용 문제를 해결하고자 합니다.
Granite Embedding Multilingual R2는 32K 컨텍스트를 지원하는 두 가지 새로운 Apache 2.0 다국어 임베딩 모델을 출시했습니다. 이 모델들은 200개 이상의 언어를 지원하며, 특히 52개 주요 언어와 프로그래밍 코드에 대해 향상된 검색 품질을 제공합니다. 97M 파라미터의 컴팩트 모델과 311M 파라미터의 풀사이즈 모델이 제공되어, 성능과 효율성 사이에서 선택할 수 있습니다.
NVIDIA가 일본 문화적 특성과 인구 통계에 기반한 최초의 오픈 합성 데이터셋 'Nemotron-Personas-Japan'을 공개했습니다. 이 데이터셋은 개인 식별 정보(PII) 없이도 일본 사회를 반영하는 600만 건의 페르소나 데이터를 제공하며, 개발자들이 지역 특화 AI 모델을 구축할 수 있도록 지원합니다. 이는 주권 AI(Sovereign AI) 개발을 촉진하고, 언어 및 문화적 맥락에 맞는 고품질의 학습 데이터 접근성 문제를 해결하는 핵심 기반이 될 것입니다.
본 기사는 희소 임베딩 모델(Sparse Embedding Models)을 파인튜닝하는 과정과 구성 요소를 심층적으로 다룹니다. 일반적인 밀집 임베딩 모델이 저차원 벡터를 생성하는 것과 달리, 희소 임베딩 모델은 대부분의 값이 0인 고차원 벡터를 생성하며, 이는 각 토큰에 대한 해석 가능성을 제공합니다. 특히 SPLADE와 같은 신경망 기반 희소 모델은 원본 텍스트를 의미적으로 관련된 용어로 자동으로 확장(query/document expansion)하는 능력이 뛰어나며, 이를 통해 검색 및 유사도 계산의 정확도를 높일 수 있습니다.
본 기사는 OpenAI가 공개한 'DeepResearch' 시스템을 분석하고, 이를 오픈소스로 재현하려는 목표를 제시합니다. DeepResearch는 LLM과 에이전트 프레임워크를 결합하여 웹 검색 및 다단계 추론 능력을 극대화하며, 특히 GAIA와 같은 복잡한 벤치마크에서 단일 LLM보다 월등히 높은 성능을 보여줍니다. 필자들은 이 강력한 시스템의 핵심인 '에이전트 프레임워크'를 오픈소스로 공개하여 연구 커뮤니티가 이를 재현하고 발전시킬 수 있도록 하는 것을 목표로 합니다.
NVIDIA의 AI-Q Blueprint는 Llama 3.3 기반의 오픈소스 LLM과 검색 기능을 결합하여 DeepResearch Bench에서 최고 성능을 달성했습니다. 이 아키텍처는 Llama-3.3-Nemotron-Super-49B-v1.5와 같은 최적화된 모델을 사용하여 긴 컨텍스트 이해, 복잡한 에이전트 추론, 그리고 신뢰할 수 있는 다중 출처 합성 능력을 보여줍니다. AI-Q는 투명성(추론 과정 및 근거 제시)과 효율성을 유지하면서도 폐쇄형 대안에 필적하거나 능가하는 고급 연구 워크플로우를 오픈소스 환경에서 구현할 수 있음을 입증했습니다.
Open R1 프로젝트는 DeepSeek R1의 누락된 부분, 특히 훈련 파이프라인과 합성 데이터 구축에 초점을 맞추고 있습니다. 이번 업데이트에서는 수학적 추론을 위한 대규모 데이터셋인 OpenR1-Math-220k를 공개했습니다. 이 데이터셋은 Numina와 협력하여 512개의 H100 클러스터에서 로컬로 생성되었으며, 자동 필터링 및 고급 평가 시스템(Math Verify)을 통해 높은 품질의 추론 트레이스를 제공합니다. 또한, 최신 LLM 기술(SGLang 등)을 활용하여 데이터 생성 속도를 획기적으로 높이는 방법론도 공유했습니다.
본 기술 기사는 비디오 생성 모델을 미세 조정하기 위해 자체 데이터셋을 구축하는 과정을 안내하며, 이를 위한 개발 중인 툴링 파이프라인을 소개합니다. 이 파이프라인은 `yt-dlp`를 이용한 다운로드부터 시작하여, 'Video to Scenes' 스크립트를 통해 긴 비디오를 짧은 클립으로 분할하고, 워터마크 감지(LAION-5B), 미학 점수 예측, NSFW 콘텐츠 검사 등 다단계의 정교한 필터링을 적용합니다. 또한 Florence-2와 같은 모델을 활용하여 캡션, 객체 인식, OCR 등의 메타데이터를 추출함으로써 고품질의 커스텀 비디오 데이터셋 구축 방법을 제시합니다.
구글이 다국어 비전-언어 인코더인 SigLIP 2를 출시했습니다. 이 모델은 기존 SigLIP의 대조적 손실(contrastive loss)을 시그모이드 손실(sigmoid loss)로 확장하고, 위치 감지 및 로컬 세맨틱스 개선을 위한 여러 추가적인 훈련 목적을 통합하여 성능을 크게 향상시켰습니다. 특히, 동적 해상도 변형인 NaFlex를 도입하여 다양한 비율과 해상도의 다운스트림 작업에 유연하게 적용할 수 있는 것이 핵심입니다.
Aya Vision은 Cohere For AI가 개발한 오픈 웨이트 다국어 멀티모달 비전-언어 모델(VLM) 가족으로, 23개 언어에 걸친 강력한 언어 및 시각 이해 능력을 제공합니다. 이 모델은 합성 어노테이션, 번역/재구성 등을 통해 데이터 규모를 확장하고, 고해상도 이미지 처리를 위해 동적 리사이징과 Pixel Shuffle 다운샘플링 기법을 적용했습니다. Aya Vision 8B와 32B는 경쟁사 대비 뛰어난 성능을 보여주며, 연구 커뮤니티에 오픈 웨이트로 공개되어 다국어 멀티모달 AI 발전에 기여합니다.