© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
/api/search?q=검색어
MiniCPM 시리즈는 희소 어텐션(Sparse Attention)과 선형 어텐션(Linear Attention)을 결합한 혁신적인 하이브리드 아키텍처를 통해 장기 컨텍스트 모델링의 효율성과 성능을 극대화했습니다. MiniCPM-SALA는 백만 토큰 컨텍스트 처리를 위해 이 두 가지 메커니즘을 통합했으며, HyPE와 같은 기술적 개선을 통해 Qwen3-8B 대비 뛰어난 추론 속도와 메모리 효율성을 입증했습니다. OpenBMB는 NVIDIA와의 협력을 통해 9B 규모 모델의 1M 토큰 추론 한계에 도전하는 대규모 컴파일 최적화 경진대회를 개최하고 있습니다.