Kimi K3 아키텍처 개요와 설계 노트
요약
Kimi K3 아키텍처는 기존의 RoPE 대신 NoPE(No Positional Embeddings)를 사용하는 독창적인 설계를 도입했습니다. KDA(Kimi Delta Attention) 계층이 RNN처럼 순차적 정보를 처리하며 암묵적인 위치 정보를 학습함으로써 위치 임베딩 없이도 높은 성능을 유지합니다.
핵심 포인트
- RoPE를 제거하고 NoPE를 사용하여 위치 정보 손실 방지
- KDA 계층이 RNN과 유사하게 작동하며 암묵적 위치 정보 제공
- 선형 계층과 KDA의 하이브리드 구조로 효율적인 위치 처리
- KV 캐시 구현 방식에 따른 추론 시 토큰 추가 발생 부작용
서구 연구소 수장들이 Kimi를 단순한 증류 공격의 산물로 몰아가는 것과 달리, 실제로는 새롭고 독창적인 접근법을 도입하고 있음
Sebastian Raschka는 뛰어난 대규모 언어 모델 연구자이자 저자이며, 그의 Substack을 강력히 추천함
전에는 몰랐지만, 핵심을 곧바로 짚으면서도 이해하기 쉽게 쓴다는 점에 감탄했음
대충 생성한 AI 요약이 넘치는 분야에서 보기 드문 보석 같아 RSS 피드에 추가했음
“흥미롭게도 Kimi K3는 모든 RoPE 계층을 없애고, 대신 모든 곳에서 NoPE(No Positional Embeddings) 를 사용한다”고 함
이게 작동한다는 사실 자체가 놀라움. 위치 정보가 없다면 토큰 수프가 되지 않는지, 두 번째 토큰이 임베딩 공간에 무언가를 누적하는 법을 학습하는 것만으로 자신이 두 번째임을 알아낼 만큼 어텐션이 정밀한지 궁금함
인과 마스킹을 통해 모델이 암묵적인 위치 임베딩을 학습할 수 있음. Transformer 블록이 순열 불변이라는 통념은 사실이 아님
디코더 전용 인과 Transformer에는 위치 임베딩이 반드시 필요하지 않지만, 원래 Transformer 논문의 인코더처럼 비인과 모델에는 확실히 필요함
누적이라는 직관도 적절함. 어텐션 헤드 일부가 잔차 스트림의 같은 영역에 계속 값을 기록하면, 입력 토큰이 늘어날수록 어텐션 합산으로 값이 누적되어 별도 위치 인코딩 없이도 일종의 인덱스로 기능할 수 있음
선형 계층은 FIR 필터 같은 감쇠를 사용해 자연스럽게 상대적 위치를 제공함. 그러면 완전 어텐션 계층은 거리에 관계없이 개념끼리 연결하는 데 집중할 수 있음
이런 하이브리드 어텐션 모델에서는 적어도 상태 공간 모델(SSM) 계층이 순환 구조를 통해 상대적 위치 임베딩을 내재하고 있을 것임
모든 곳에서 NoPE를 쓴 점이 흥미로움. 다른 모델들은 대개 로컬 계층에 RoPE를 남겨두는데, 여기서는 Kimi Delta 같은 선형 어텐션 계층이 조용히 위치 처리를 맡아 이를 생략할 수 있었던 듯함. 최첨단 규모에서도 유지될지 궁금함
이름과 달리 Kimi Delta Attention(KDA) 은 일반적인 의미의 어텐션이라기보다, 학습 시 효율적으로 병렬화할 수 있는 RNN에 가까움. 작은 편집 가능 어텐션 메모리처럼 동작하는 은닉 상태를 가진 RNN인 Gated DeltaNet을 약간 수정한 구조임
RNN과 비슷하므로 XYZ에서 X, Y, Z의 순서를 본질적으로 인식함. 기본 Transformer는 순서 없는 집합을 처리하므로 항목 간 위치를 별도로 알려줘야 함
어텐션 계층마다 KDA 계층이 3개 있고 첫 어텐션 계층 전에도 3개가 있으므로, 모든 토큰이 최초의 실제 어텐션 계층에 도달하기 전에 자신의 위치 정보를 학습할 수 있음 RoPE는 정보를 일부 훼손하므로 이렇게 생략할 수 있으면 유리함. Gemma-4도 전역 어텐션 계층 하나당 슬라이딩 윈도 어텐션(SWA) 계층 다섯 개를 두는 비슷한 5:1 구조임. SWA는 저렴하고 성능이 낮지만 지역 정보를 처리하며 강력한 전역 계층 사이를 채우고, 이 모델에서는 KDA가 같은 역할을 함
Gemma에서는 실제 어텐션인 SWA에만 RoPE가 필요하고 전역 어텐션에서는 생략함. KDA는 어텐션이 아니므로 위치 임베딩이 필요하지 않음
이보다 얼마나 더 최첨단 규모여야 하는지는 모르겠지만, 더 큰 규모에서도 작동하지 않을 이유가 없음. 매개변수가 많아질수록 KDA 계층이 위치 정보를 전달하기는 오히려 쉬워짐
Kimi K3는 벤치마크상 Opus와 Fable과 비슷한 범위인데, 이보다 더 큰 규모가 최첨단인지 의문임. 모두 2~4조 매개변수 범위이고 주요 차이는 학습 품질과 아키텍처일 것으로 예상함
다소 이상한 부작용도 있음. 사용해 본 제공업체들은 KV 캐시를 최신 입력 프롬프트까지만 저장하지 않고 1,024토큰 고정 증분 블록으로 구현했음. 그 결과 추론마다 캐시 미스 입력 토큰이 최대 1,023개까지 추가됨
AI 자동 생성 콘텐츠
본 콘텐츠는 GeekNews의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기