Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Microsoft가 공개한 TRELLIS.2는 4B 파라미터 규모의 최첨단 image-to-3D 생성 모델입니다. 새로운 O-Voxel 구조를 통해 복잡한 기하학적 구조와 PBR 재질을 포함한 고충실도 3D 에셋을 매우 빠른 속도로 생성합니다.
Chandra OCR 2는 레이아웃 정보를 보존하며 이미지와 PDF를 HTML, Markdown, JSON 등 구조화된 데이터로 변환하는 최첨단 OCR 모델입니다. 90개 이상의 언어와 수학, 표, 필기체 등을 지원하며 olmocr 벤치마크에서 높은 성능을 입증했습니다.
CVPR 2024에 발표될 FoundationPose는 모델 기반 및 모델 프리 설정을 모두 지원하는 통합 6D 객체 포즈 추정 및 추적 파운데이션 모델입니다. 미세 조정 없이도 새로운 객체에 즉시 적용 가능하며, BOP 리더보드 1위를 기록하며 강력한 일반화 성능을 입증했습니다.

LingBot-Map은 스트리밍 3D 재구성을 위한 피드포워드 3D 파운데이션 모델입니다. 기하학적 컨텍스트 트랜스포머를 통해 장거리 드리프트 보정과 고효율 스트리밍 추론을 지원하며, 대규모 프레임 시퀀스에서도 안정적인 성능을 제공합니다.
slime은 RL 스케일링을 위한 LLM 사후 학습(post-training) 프레임워크로, Megatron과 SGLang을 결합하여 고성능 학습과 유연한 데이터 생성을 지원합니다. GLM 시리즈 모델 학습을 통해 검증된 이 프레임워크는 데이터 흐름의 정확성과 확장성에 최적화되어 있습니다.
STORM은 인터넷 조사를 통해 인용이 포함된 긴 글을 생성하는 연구 프레임워크입니다. 사전 작성 단계에서 주제에 대한 다양한 관점의 질문을 생성하고, 이를 바탕으로 체계적인 개요와 참고 문헌을 수집하여 기사를 작성합니다.
HippoRAG 2는 인간의 장기 기억 방식을 모방하여 LLM의 연상성 및 의미 파악 능력을 향상시키는 새로운 메모리 프레임워크입니다. 기존 GraphRAG 등과 비교해 오프라인 인덱싱 리소스를 적게 사용하면서도 멀티홉 검색 성능을 극대화합니다.
Microsoft가 컴퓨터 사용(Computer Use)에 특화된 에이전트형 소형 언어 모델(SLM)인 Fara-7B를 공개했습니다. WebTailBench V2 업데이트와 CUAVerifierBench 출시를 통해 에이전트 성능 평가를 위한 벤치마크와 유니버설 검증기 기술을 함께 선보였습니다.
Microsoft의 bitnet.cpp는 1-bit LLM(BitNet b1.58)을 위한 공식 추론 프레임워크입니다. CPU 및 GPU에서 손실 없는 고속 추론을 지원하며, 에너지 소비를 대폭 절감하여 로컬 장치에서의 효율적인 LLM 실행을 가능하게 합니다.
Surya는 650M 파라미터 규모의 최첨단 OCR 모델로, 레이아웃 분석, 표 인식, 다국어 지원 기능을 제공합니다. olmOCR-bench에서 높은 정확도를 기록하며, 91개 언어에 대해 강력한 성능을 보여줍니다.
stable-worldmodel은 World Model 연구의 데이터 수집, 훈련, 평가를 위한 통합 인터페이스를 제공하는 플랫폼입니다. 표준화된 환경과 베이스라인 구현체를 통해 연구자가 모델과 목적에만 집중할 수 있도록 지원합니다.
MOSI.AI와 OpenMOSS가 개발한 오픈 소스 음성 및 사운드 생성 모델 제품군인 MOSS-TTS를 소개합니다. 고충실도 음성 합성, 다중 화자 대화, 환경음 생성 및 실시간 스트리밍을 지원하며 다양한 최신 기술 보고서와 모델 업데이트를 포함하고 있습니다.
AutoResearchClaw는 인간과 AI의 협업을 통해 자율적으로 연구를 수행하는 자기 강화형 시스템입니다. 수학, 생물학, 물리학 등 다양한 도메인에서 실험 에이전트를 활용하며, 자율 연구 성능을 측정하기 위한 ARC-Bench 벤치마크를 제공합니다.
SANA는 고해상도 이미지 및 비디오 생성을 위한 효율성 중심의 코드베이스를 제공하며, 완전한 학습 및 추론 파이프라인을 지원합니다. 최근 업데이트로는 2.6B 제어 가능한 월드 모델인 SANA-WM 출시(720p, 1분 비디오 생성), Sol-RL을 통한 사후 학습 인프라 구축, 그리고 LTX-VAE를 사용한 2K 업스케일링이 포함된 SANA-Video 등이 있습니다. 또한, OpenAI 호환 API를 통해 SGLang에서 지원되는 등 지속적으로 기능과 성능이 확장되고 있습니다.
이 도구는 자연어를 사용하여 어떤 콘텐츠든 원하는 형식으로 변환하고, 다중 소스에서 콘텐츠를 자동으로 수집하는 기능을 제공합니다. 특히 NYT, WSJ 등 300개 이상의 유료 뉴스 사이트의 Paywall을 Googlebot UA 및 다양한 우회 기술을 통해 자동 감지하고 전문(Full text)을 확보하는 것이 핵심입니다. 획득한 콘텐츠는 NotebookLM에 업로드되어 팟캐스트, 마인드맵, PPT, Quiz 등 사용자가 지정한 목표 형식으로 AI가 자동으로 생성할 수 있습니다.
MinerU는 PDF, DOCX, PPTX, XLSX, 이미지 등 다양한 포맷의 문서를 구조화된 Markdown/JSON으로 변환하는 고정밀 문서 파싱 엔진입니다. VLM+OCR 듀얼 엔진과 109개 언어 지원을 통해 복잡한 레이아웃에서도 높은 정확도를 자랑하며, LangChain, Dify 등 주요 AI 워크플로우 솔루션과의 네이티브 통합을 제공합니다. 최근 업데이트를 통해 라이선스 개방성(Apache 2.0 기반)과 파싱 정확도 및 다중 형식 지원 범위가 크게 향상되어 프로덕션 환경 도입에 최적화되었습니다.
ARIS-Code는 AI 에이전트 기반의 기술 연구 워크플로우를 제공하는 독립형 CLI 도구입니다. 이 도구는 Claude Code, Cursor 등과 유사하게 사용되지만, LLM 소비에 최적화된 구조로 설계되었습니다. 최근 버전 업데이트에서는 시스템 시간 사용, 추론 모델 지원 강화, 그리고 다양한 AI 제공자(OpenAI 호환 포함)와의 통합 및 안정성 개선이 이루어졌습니다. 사용자는 이 CLI를 통해 연구 계획 수립, 지속적인 메모리 관리, 자기 진화 최적화 등의 고급 기능을 활용하여 마치 '잠든 동안'도 자율적으로 논문 작성 및 기술 연구 과정을 진행할 수 있습니다.
이 봇은 영상 편집이나 에셋 컴파일 과정 없이 Reddit의 콘텐츠를 활용하여 동영상을 제작하는 자동화 도구입니다. 사용자는 이 저장소를 클론하고 가상 환경을 설정한 후, 필요한 종속성을 설치하고 `python main.py` 명령어로 봇을 실행할 수 있습니다. 현재는 커뮤니티 가이드라인 준수를 위해 사용자가 직접 파일을 업로드해야 하는 방식으로 운영됩니다.
이 문서는 Anthropic의 Claude Agent용 Python SDK를 소개하며, 개발자들이 파이썬 환경에서 클로드 에이전트 기능을 쉽게 통합할 수 있도록 돕습니다. `pip install claude-agent-sdk` 명령어를 통해 설치할 수 있으며, 별도의 복잡한 설정 없이 바로 사용할 수 있습니다.
PaddleOCR은 PDF 문서와 이미지를 구조화된 JSON/Markdown 형식의 LLM 준비 데이터로 변환하는 최첨단 OCR 솔루션입니다. 최고 수준의 성능을 자랑하는 PaddleOCR-VL 시리즈는 왜곡, 스캔, 조명 등 실제 환경의 복잡한 시각 자료를 높은 정확도로 파싱하며, 표, 수식, 차트 같은 복합 요소 인식에 강점을 가집니다. 또한 100개 이상의 언어를 지원하고 다양한 하드웨어 백엔드를 통해 유연하게 배포할 수 있어 AI 에이전트 및 RAG 애플리케이션 구축의 핵심 인프라로 활용됩니다.