Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Colibri라는 단일 C 파일 기반 엔진을 통해 25GB RAM 노트북에서 744B 파라미터의 GLM-5.2 MoE 모델을 실행하는 데 성공했습니다. MoE 구조의 특성을 활용해 토큰당 활성화되는 파라미터만 스트리밍하는 방식으로 대규모 모델의 로컬 추론 가능성을 증명했습니다.
Andrew Feldman은 첫 회사인 SeaMicro를 AMD에 매각한 경험을 바탕으로, 대기업 환경에서는 자신의 야망과 불복종적인 성향을 펼치기 어렵다는 것을 깨달았습니다. 그는 GPU가 단순한 그래픽 칩의 전장 승진일 뿐임을 인식하고, 직접 하드웨어 개발에 뛰어들기로 결심했습니다.
현재 주류 LLM들이 사용하는 트랜스포머 아키텍처와 주의 메커니즘은 계산 비용이 높다는 단점을 가지고 있습니다. SubQ는 이러한 문제를 해결하기 위해 기존의 주의 메커니즘을 완전히 제거한 새로운 방식을 제시합니다. 이 방식은 'sub-quadratic sparse-attention'을 사용하여 실제로 중요한 관계에만 집중함으로써 효율성을 극대화했습니다.