Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
본 패키지는 중국 연구자를 위해 논문 작성, 학술 문서 생성(PPT 등), 과학적 컴퓨팅 세 가지 시나리오를 통합한 AI 스킬 묶음입니다. Claude Code와 Codex에서 직접 사용 가능하며, 여러 코딩 어시스턴트의 기능을 연결하여 원활하게 협업하는 로컬 데스크톱 AI 에이전트 허브 역할을 합니다.
Xiaohongshu가 2B 파라미터 규모의 오픈 소스 음성 합성 모델인 dots.tts를 공개했습니다. 이 모델은 연속 신호에 의존하는 아키텍처를 통해 제로샷 클로닝과 다국어 및 감정 표현이 가능한 고성능 음성 합성을 구현했습니다.

컴퓨터 사용 에이전트의 안전성을 확보하기 위해 단일 명령어가 아닌 전체 조작 궤적을 분석하는 새로운 프레임워크를 제안합니다. 공개 정보를 기반으로 위협을 발굴하고 OpenClaw를 통해 실제 공격 궤적을 생성하여 안전 라벨링을 수행합니다.

SoulX-Transcriber는 다자간 대화에서 화자 식별, 타임스탬프 분할, 전사 내용을 동시에 처리하는 엔드투엔드 대형 오디오 언어 모델입니다. 음성이 겹치거나 대화 전환이 빠른 상황에서도 일관된 화자 귀속과 정확한 텍스트를 제공합니다.

ByteDance가 공개한 Bernini는 MLLM의 의미론적 계획과 DiT 렌더링을 결합하여 비디오 생성 및 편집을 통합한 프레임워크입니다. 상용 폐쇄형 모델과 대등한 성능을 보이며 텍스트/이미지 기반 비디오 작업을 지원합니다.
이 라이브러리는 Pure Rust로 구현되었으며, JPL급 정밀도로 행성 위치 계산을 제공하는 천문 역법(ephemeris) 도구입니다. 베다, 서양, 중국 등 12개 이상의 점성술 학파를 지원하며, 외부 데이터 다운로드 없이 높은 정확도를 자랑합니다.
사용자의 모호한 요구사항을 해결하기 위한 AI 검색 에이전트의 능력을 평가하는 VibeSearchBench를 소개합니다. 200개의 태스크를 통해 다회차 대화와 능동적 검색 능력을 지식 그래프 기반으로 측정합니다.
PySemBridge는 Python 정적 오염 분석 시 발생하는 동적 의미론적 공백을 해결하기 위한 실험적 프레임워크입니다. LLM이 제안한 의미론적 브릿징 방안을 분석 규칙으로 컴파일하여 소스-투-싱크 추적의 정확도를 높입니다.

ConceptSeg-R1은 컴퓨터 비전 분할 작업을 객체 수준에서 추상적 개념 수준으로 확장하는 연구입니다. 메타 강화학습을 통해 인스턴스, 범주, 관계 계층의 개념 분할을 수행하며, LLM의 추론 상태를 암시적 토큰으로 변환하여 SAM에 직접 입력합니다.

모바일 GUI Agent 연구를 위해 상태 제어와 결정론적 평가가 가능한 브라우저 기반 시뮬레이션 환경인 mobilegym을 소개합니다. 28개의 앱과 416개 태스크를 지원하며, 대규모 병렬 실행과 빠른 코드 기반 평가가 가능합니다.
Meta Research에서 개발한 ATLAS는 LLM을 활용해 교과서의 비형식적 수학을 Lean 4 코드로 자동 번역하는 프로젝트입니다. 해석학부터 이론 컴퓨터 과학까지 광범위한 수학 분야를 다루며 대규모 형식적 수학 라이브러리를 구축하는 것을 목표로 합니다.

SpatialBench는 깊이, 포즈, 궤적, 포인트 클라우드 등 다양한 공간 작업을 동일한 프레임워크에서 평가하는 통합 벤치마크입니다. 또한 VulnGym은 AI 에이전트의 코드 취약점 탐지 능력을 평가하기 위한 오픈 소스 벤치마크를 제공합니다.
HumanEgo는 대량의 시연 데이터 없이 1인칭 비디오만으로 로봇이 조작 작업을 학습할 수 있는 제로샷 학습 기술을 제안합니다. Project Aria 안경으로 촬영된 비디오에서 SLAM과 손 추적을 통해 동작을 추출하고 Flow Matching으로 학습합니다.
Tencent가 공개한 VulnGym은 실제 코드 저장소를 기반으로 AI 에이전트의 취약점 탐지 능력을 평가하는 오픈 소스 벤치마크입니다. 또한 Alibaba의 OpenCodeReview는 LLM 에이전트를 활용해 Git diff를 분석하고 구조화된 코드 리뷰를 수행하는 CLI 도구를 제공합니다.
AVTR-1은 사진 한 장과 오디오를 입력받아 입 모양이 동기화된 3D 아바타 비디오를 실시간으로 생성하는 모델입니다. 단일 GPU 환경에서도 25fps의 속도로 1인 및 2인 대화 시뮬레이션이 가능합니다.

FashionChameleon은 Wan2.2-TI2V-5B를 기반으로 단일 GPU에서 23.8 FPS의 실시간 인물 의상 비디오 커스텀을 구현합니다. 참조 이미지를 디자인 스타일 스킬로 자동 변환하여 일관된 디자인 언어를 유지할 수 있게 합니다.
Sheet as Token 프레임워크는 그래프 증강 방식을 활용하여 다중 테이블 스프레드시트의 이해와 검색을 구현합니다. 이중 인코더를 통한 테이블 표현 학습과 그래프 리트리버를 이용한 교차 테이블 검색의 2단계 과정을 거칩니다.
1T DNA 토큰으로 사전 학습된 새로운 게놈 기초 모델을 소개합니다. 기존 평가 방식의 한계를 극복하기 위해 통합된 제로샷 DNA 평가 벤치마크를 함께 제공하며, 500M부터 8B까지 다양한 모델 크기를 지원합니다.
코드를 에이전트의 실행 인터페이스로 활용하는 'Code as Agent Harness' 관련 연구 논문들을 주제별로 분류하여 소개합니다. 에이전트 디버깅, 멀티 에이전트 시스템, GUI/OS 에이전트 및 로보틱스 등 다양한 연구 분야를 다룹니다.
약 1,000달러의 저렴한 비용으로 1B 파라미터 규모의 기초 텍스트 생성 모델을 사전 학습하는 새로운 방법론을 소개합니다. HRM-Text는 계층적 재귀 구조를 활용하여 기존 방식 대비 연산량과 데이터 요구사항을 130~900배 절감했습니다. FlashAttention 3와 FSDP2 등 최신 기술을 결합하여 효율적인 분산 학습을 구현했습니다.