DeepSeek이 폐쇄형 AI를 우스꽝스럽게 만들다
요약
DeepSeek 4 Pro가 공개되면서 폐쇄형 AI 모델과의 성능 격차가 줄어들고 있습니다. 특히 DeepSeek은 전문 모델들을 조합하고 증류하는 과정을 거쳐 뛰어난 능력을 보여주며, V4 Pro의 경우 최대 78% 빠른 생성 속도를 보고했습니다. 이러한 개방적 접근 방식은 사용자들에게 큰 이점을 제공합니다.
핵심 포인트
- DeepSeek 4 Pro가 공개되어 폐쇄형 모델과의 격차를 줄임.
- 전문 모델들을 조합하고 증류하는 독특한 학습 방식을 사용함.
- V4 Pro는 최대 78% 빠른 생성 속도를 보여주어 실용적 성능 향상을 입증함.
- 모델 가중치(weights)가 무료로 제공되어 개방 과학의 이점을 누릴 수 있음.
네, DeepSeek 4 Pro가 여기 있습니다. 이번에는 진짜입니다. 혼란스러울 거라는 걸 압니다. 이전 버전은 'preview'라고 불렸고, 이것은 '0813'이라고 불립니다. 숫자를 보면 훨씬 작은 flash 버전보다 더 잘 작동한다고 합니다. 루빅스 큐브를 만들 때, flash는 물체의 3D 구조를 완전히 이해하지 못했습니다. 많은 부분이 빠져 있고, 검은색이 많습니다. 하지만 pro로 보세요. 구조에 대한 이해가 훨씬 좋습니다. 그러다가 저는 이것에 놀랐습니다. 세상에. 저것을 보세요. 전설적인 품질에 점점 가까워지고 있습니다.
네, 또 다른 경쟁자가 나타났고, 더 좋아집니다. 이 모든 것을 우리에게 무료로 제공한다는 것은 정말 믿기 힘든 일입니다. 좋습니다만, 이게 우리에게 무슨 의미일까요? 가중치(weights)는 우리 모두에게 무료로 이용 가능하지만, 아시다시피 몇몇은 집에서 호스팅할 하드웨어를 갖추지 못했습니다. 저도 하고 싶지만, 그런 종류의 하드웨어는 없습니다. 다른 옵션으로는 Lambda를 사용하거나 DeepSeek이 직접 호스팅하는 것을 사용하는 것이 있습니다. 하지만 그들은 가격을 극적으로 올렸습니다. 이전 가격의 약 2.5배에서 5배까지요. 이제 여러분은 이미
Károly Zsolnai-Fehér입니다. 다시 한번 말씀드리지만, 많은 마법은 사전 학습(pre-training) 이후에 일어납니다. 후속 훈련(post-training) 과정에서 DeepSeek은 수학, 코딩, 에이전트 작업(agentic work)을 위한 여러 전문 모델들을 만듭니다. 여기서 잠시 멈춰야 할 것 같습니다. 사람들은 이것을 전문가 혼합(mixture of experts)의 전문가들과 혼동합니다. 그것과는 완전히 다릅니다. 그것들은 하나의 신경망 내에 있는 작은 조각들입니다. 이것들은 그렇지 않습니다. 이것들은 별도로 훈련된 모델 체크포인트입니다. 좋습니다, 그럼 무엇이 남았을까요? 그다음은 증류(distillation)가 옵니다. 네. 그들은 이 전문 교사들 중 10개 이상을 가져와서 최종 모델 하나를 훈련시켜 그들의 능력을 흡수하게 합니다.
그래서 학생 모델이 '내가 이렇게 할 거야'라고 말하면, 선생님이 '음, 나는 이렇게 했을 텐데'라고 말합니다. 그러면 학생은 자신의 두뇌를 [기침 소리] 선생님과 더 비슷하게 조정합니다. 교사 10명으로 이것을 수행하면, 학생이 정말 미친 듯이 향상되는 것을 볼 수 있습니다. 그들은 또한 이 부분을 추가했습니다. 단순히 한 번에 하나의 토큰을 예측하는 대신, 여러 개의 토큰을 미리 초안 작성(drafts)합니다. 이전 기술보다 훨씬 더 잘 해냅니다. 그리고 학자 여러분들, 논문을 꼭 붙잡고 계세요. DeepSeek은 V4 Pro의 경우 최대 78% 빠른 생성을 보고했습니다.
실제 사용에서 지금 바로 얻고 이익을 볼 수 있는 실제 측정 가능한 속도 향상입니다. 그리고 여기는 정말 엄청난 것입니다. 이것은 연구 논문이었는데, 봅시다, 6주 전이었습니다. 그런데 이제 모두가 그것을 사용하고 있습니다. 다시 말씀드리지만, 단지 6주 전의 연구 논문입니다. 올해 최고의 논문 중 하나입니다. 그리고 그것이 바로 우리 손안에서 살아나고 있습니다. 무료로요. 믿기지 않습니다. 전체 분석 영상은 설명란에 있습니다. 그리고 잊지 마세요, 우리는 가중치(weights)를 소유하고 실행할 수 있다는 것입니다. 잘못된 키워드를 입력한다고 해서 아무도 우리를 다른 모델로 다운그레이드하지 못합니다.
게임은 없습니다. 정말 놀랍습니다. 집에서 실행할 수는 없더라도요. 물론 하고 싶지만요. 하지만 선택지가 있습니다. 살기 좋은 시대입니다. 이것은 개방 과학(open science)이자 최고의 개방 연구(open research)입니다. 그리고 우리가 이에 대해 이야기하는 것이 중요합니다. 왜냐하면 미래는 그것을 이해하는 사람들에게 속하기 때문입니다. DeepSeek과 DeepSpark를 사용하세요. 이를 활용하십시오. 아, 그리고 저는 DeepSeek의 놀라운 에이전트 하네스(agent harness)에 대해서도 이야기할 계획입니다. 정말 참신한 디자인이며 매우 강력합니다. 관심이 있으시다면 구독하고 벨을 눌러주세요.
저는 Lambda를 사용하여 AI 연구 논문을 종종 몇 분 만에 재현합니다. 또한 자신만의 모델을 훈련하거나 기존 모델을 미세 조정(fine-tune)하는 데도 좋습니다. 추론(inference)이나 텍스트-이미지 또는 비디오 생성을 쉽게 할 수 있습니다. DeepSeek 챗봇이나 에이전트를 실행하는 것도 매우 빠르고 신뢰성이 높습니다. Lambda는 자신만의 실험을 수행할 수 있도록 강력한 Nvidia GPU를 제공합니다. 저는 제가 다루는 논문들의 아이디어를 테스트하고 몇 분 후에 결과를 얻습니다. 정말 마음에 듭니다. 진심으로, 지금 바로 lambda.ai/papers에서 사용해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Two Minute Papers (AI 논문)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기