Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
X2SAM은 이미지와 비디오에 걸쳐 임의 분할(Any Segmentation) 기능을 확장하는 통합된 멀티모달 대규모 언어 모델(MLLM)입니다. 이 모델은 시간적 일관성을 유지하기 위해 Mask Memory 모듈을 지원하며, 일반적인 분할부터 지시 기반, 추론 및 상호작용 분할에 이르기까지 다양한 유형의 분할 작업을 수행할 수 있습니다.
독일어 LLM 개발에서, 다양한 소음이 많은 웹 코퍼스보다 반복적이고 고품질의 학습 데이터가 더 효과적인 것으로 나타났습니다. 특히 Boldt 모델은 적은 양의 토큰만으로도 경쟁 모델 대비 최상위 성능을 달성하며 효율성을 입증했습니다.
Map2World는 임의의 세그먼트 맵과 텍스트 설명을 입력받아 3D 월드를 생성하는 프레임워크입니다. 이 시스템은 광범위한 환경에서도 전역 규모의 일관성을 유지하며, 특히 디테일 엔핸서 네트워크를 통해 장면의 전체적인 일관성을 해치지 않으면서 세밀한 디테일까지 보존할 수 있습니다.
NVIDIA가 Hugging Face 플랫폼에 AETC(Automated Edge Traffic Computing)를 출시했습니다. 이 모델은 교통 이상 탐지(traffic anomaly detection)와 같은 복잡한 작업을 수행하기 위해 체인 오브 싱크 추론(chain-of-thought reasoning)을 포함하고 있습니다. 총 44,000개의 다중 작업 비디오 어노테이션 데이터셋을 기반으로 구축되어 실제 환경에서의 높은 성능을 기대할 수 있습니다.