DeepSeek의 놀라운 새로운 아키텍처
요약
DeepSeek의 새로운 아키텍처(4.1 Flash)가 공개되었으며, 이는 Claude Opus나 Kimi K3 등 경쟁 모델을 능가하는 성능과 효율성을 보여줍니다. 특히 레이어 간 공유 메모리 구조를 도입하여 KV 캐시 크기를 획기적으로 줄였고, 이를 통해 로컬 환경에서의 구동 가능성을 높였습니다.
핵심 포인트
- DeepSeek 4.1 Flash는 Claude Opus 등 경쟁 모델을 능가하는 성능과 효율성을 입증했습니다.
- 레이어 간 공유 메모리 구조를 도입하여 KV 캐시 크기를 대폭 줄여 자원 효율성이 높아졌습니다.
- 이 기술은 오픈 모델로 공개되어 연구 커뮤니티의 접근성과 재현 가능성을 높였습니다.
- 향후 로컬 환경에서 구동 가능한 수준으로 발전할 잠재력이 매우 큽니다.
영상: DeepSeek의 놀라운 새로운 아키텍처
채널: Two Minute Papers
길이: 5분 10초
출처: 자막 (자동, 영어)
스크립트:
새로운 DeepSeek가 등장했습니다. 4.1 flash인데 정말 대단합니다. 보세요. 믿을 수 없을 만큼 빠릅니다. 그리고 저는 이것에 대해서도 깜짝 놀랐습니다. 보세요, 일부 테스트에서는 Claude Opus와 Kimi K3를 능가할 수 있습니다. 모든 것이 그런 것은 아닙니다. 나중에 알아보겠습니다. 하지만 함정이 하나 있습니다. 마지막에 보여드리겠습니다. 또한 DeepSeek 4.0 Pro보다 안정적으로 성능이 우수하며, 이는 엄청난 놀라움입니다. 제 말은, 그 시스템을 로컬에서 실행하는 데는 아마도 30만 달러가 들겠지만, 이것은 그 사분의 일로 실행할 수 있다는 것입니다. 음, 여전히 많은 돈이지만, 추세는 부인할 수 없습니다.
이것은 어쩌면 1년 안에 우리 주머니 속에서 작동하게 될지도 모릅니다. 또한 네이티브 시각적 이해 기능을 갖추고 있습니다. 따라서 마침내 상징적인 게임 메뉴 이미지를 제공하고 그것을 재현하는 게임을 작성하도록 할 수 있습니다. 다른 실험에 대해서는 나중에 더 말씀드리겠습니다. 그리고 이것은 동시에 크고 작습니다. 어떻게요? 자, 이제 논문을 붙잡으세요, 동료 학자 여러분. KV 캐시 덕분입니다. 여기에는 컨텍스트가 포함되어 있으며, 3년 전 V1보다 437배 작습니다. 하지만 이전의 4.0 flash보다도 네 배 더 작습니다.
하지만 그것은 불과 몇 달 전이었습니다. 그리고 그것을 4배 압축했습니다. 그게 뭐죠? 어떻게 그렇게 했나요? 저희는 아나요? 네, 알고 있습니다. 친애하는 동료 학자 여러분, 이것은 Dr. Károly Zsolnai-Fehér와 함께 하는 Two Minute Papers입니다. 왜냐하면 이것은 오픈 모델이며 [음악] 그것을 설명하는 무료 연구 논문이 있기 때문입니다. 저는 전문가가 아니라 단지 학생이지만, 제가 풀어보겠습니다. 그들은 이 기술을 CSA2라고 부르며, 마침내 무언가를 해냈습니다. 보세요, 신경망(neural network)은 많은 계층의 뉴런으로 구성되어 있으며, 정보가 이 계층들을 통과하면서 각 계층은 자체적인 KV 메모리를 갖게 됩니다.
하지만 여기는 그렇지 않습니다. DeepSeek 4.1 Flash가 마침내 레이어 간 공유 메모리를 제공합니다. 모든 것이 기억할 필요는 없습니다. 아니요. 그들은 메모리를 공유합니다. [기침 소리] 이것을 잘 구현하는 것은 악몽과 같습니다. 왜냐하면 서로 다른 레이어들이 동일한 히스토리의 다른 시각을 필요로 하기 때문입니다. 그리고 우리가 후드를 열고 더 자세히 들여다보면, 호호호, 보세요, 인코더-디코더 구조가 있습니다. 인코더는 공유 글로벌 메모리를 생성하고, 디코더는 거기서 읽습니다. 그리고 이것이 마침내 훨씬 더 작은 KV 캐시를 제공하며, 이는 제가 존재의 근심거리인데, 너무 많은 비디오 RAM을 필요로 하기 때문입니다.
놀라운 발전입니다. 이제 저는 또한 이것이 엄청나다고 말했습니다. 5,000억 개 이상의 파라미터가 있습니다. 그래서 집에서 이걸 실행할 기회가 전혀 없습니다. 그리고 제가 이 아름다운 벌집 모양 논문을 재현하려고 했을 때, GPT-6 Astra가 해냈습니다. 정말 놀랍습니다. 우와. Opus 5.1은 그렇게 놀랍지는 않지만, 물리적 성능이 상당히 강력합니다. 렌더링하는 정도는 조금 덜합니다. 이제 이것을 보세요. 음, 우리가 그것과 맞추려면 앞으로 몇 개의 논문을 더 살펴봐야 하지만, 일어날 것입니다. 저는 그것을 확신합니다. 그리고 보시다시피, 저는 헤드라인만 믿는 것이 아니라 진실을 보여주기 위해 여기에 있습니다.
그래서 정말 감사합니다. 인류에게 큰 기여입니다. 이것은 많은 의사와 과학자들이 그들의 작업을 하는 데 도움이 될 것입니다. 오픈 사이언스가 승리했습니다. 살기에 좋은 시대입니다. 저는 lambda를 사용하여 AI 연구 논문을 종종 몇 분 만에 재현합니다. 또한 자신만의 모델을 훈련하거나 기존 모델을 미세 조정하는 것도 좋습니다. 추론(inference)이나 텍스트-이미지 또는 비디오 생성을 실행하세요. 아주 쉽습니다. DeepSeek 챗봇이나 에이전트를 구동하는 것은 매우 빠르고, 매우 신뢰할 수 있습니다. Lambda는 자신만의 실험을 수행할 수 있는 강력한 Nvidia GPU를 제공합니다. 저는 제가 다루는 논문들에서 아이디어를 테스트하고, 몇 분 후 결과가 나옵니다.
마음에 듭니다. 진심으로, 지금 lambda.ai/papers에서 사용해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Two Minute Papers (AI 논문)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기