수십억 달러 규모의 AI 격차가 좁혀지고 있다
요약
본 영상은 Qwen 3.8 Flash Next와 같은 최신 오픈 웨이트 AI 모델의 혁신적인 성능을 소개하며, 기존 폐쇄형 시스템과의 격차 축소를 강조합니다. 특히 이 모델이 Mixture of Experts(MoE) 구조를 채택하고, 희소 어텐션(QSA), 게이티드 잔차 연결 등 여러 기술적 개선 사항을 통해 효율성과 확장성을 높인 점에 주목해야 합니다.
핵심 포인트
- 오픈 웨이트 AI의 발전으로 유료 폐쇄형 시스템과의 격차가 줄고 있음.
- Qwen 3.8 Flash Next는 MoE 구조를 사용하여 메모리 및 전력 효율성이 뛰어남.
- QSA(희소 어텐션)는 컨텍스트 증가에 따른 비용 문제를 해결하는 핵심 기술임.
- 게이티드 잔차 연결과 n-gram 기반 조회 메모리는 모델의 정보 유지와 검색 속도를 개선함.
Video: The Billion Dollar AI Gap Is Collapsing
Channel: Two Minute Papers
Duration: 4m 26s
Source: subtitle (auto, en)
Transcript:
이것은 새로운 Qwen 3.8 Flash Next AI이며, 첫 결과들이 환상적입니다. 놀라운 시스템이고, 이렇게 많은 오픈되고 무료인 AI 시스템을 얻게 되어 우리는 어느 것이 무엇인지 혼동하기 쉽습니다. 동료 학자 여러분, 이것은 매우 좋은 문제이고, 우리가 유료의 폐쇄형 시스템을 직접 다운로드하여 영원히 실행할 수 있는 오픈 웨이트(open weights) AI로 전환할 수 있다는 것 같습니다. 구독이 필요 없습니다. 그리고 저희는 논문도 가지고 있습니다. 우리는 정말 호사를 누리고 있고 저는 정말 감사합니다. 그래서 제가 가능한 한 많은 것을 계속 다루고 있습니다.
제가 어떻게 저와 동료 학자들이 이미 현장에서 사용하고 있는지 보여드리고 싶습니다. 지금은 Qwen 3.8 Max가 있는데, 엄청나게 크고, 그다음이 270억 개(billion)입니다. 이것은 매우 강력한 노트북이나 데스크톱에서 실행됩니다. 이것이 3.8 Flash Next입니다. 이것은 중간에 있지만, 매우 다릅니다. 작은 모델인 27B는 밀집형 모델(dense model)입니다. 반면, 이 모델은 전문가 혼합 모델(mixture of experts model)로, 매우 다릅니다. 이는 토큰마다 모델의 작은 부분만 사용한다는 것을 의미합니다. DGX Spark와 같은 많은 메모리와 느린 메모리 대역폭을 가진 시스템에 좋습니다.
저는 두 개의 Spark에서 실험을 진행하고 있습니다. 첫날에는 초당 약 38개의 토큰으로, 매우 인상적입니다. 하드웨어는 Nvidia의 Jensen, Brad, Mark에게 정말 감사합니다. 이제 여러분 같은 뛰어난 동료 학자들은 이것을 훨씬 더 온건한(modest) 하드웨어에서 실행하는 방법을 찾아냈습니다. 자, 3.8 Flash Next는 그들의 차세대 모델 중 첫 번째이며 상당한 혁신을 가지고 있습니다. 여기 세 가지가 있습니다. 친애하는 동료 학자 여러분, 이 영상은 Dr. Carola Zsolnai Feher와 함께 하는 Two Minute Papers입니다. 첫째, Qwen 희소 어텐션(sparse attention)입니다. 우리가 문서를 추가하거나 AI와 더 오래 대화할수록, 그 메모리, 즉 컨텍스트(context)가 차오르기 시작합니다.
이러한 과정과 함께, 비용 문제가 매우 커집니다. 이것을 '풀 어텐션(full attention)'이라고 부르며, 이는 이차 복잡도(quadratic complexity)를 가집니다. 따라서 컨텍스트 양을 두 배로 처리하는 것은 대략 네 배의 작업량을 필요로 합니다. DeepSeek은 DSA를 통해 이를 완화하려고 시도했는데, 이는 중요한 개별 토큰만 선택합니다. 하지만 Qwen의 새로운 QSA는 더 나아갑니다. 이 토큰들을 작은 블록으로 묶고, 오직 그 블록들만을 검색합니다. 왜냐하면 이것이 증가하는 컨텍스트를 더욱 저렴하게 만들기 때문입니다. 둘째로, 각 토큰에 대해 모델은 해당 토큰에 대한 추가 정보를 가지고 있습니다.
하지만 여기서는 레이어들이 서로의 발을 밟을 수 있는데, 모두 동일한 실행 정보(running information)를 계속 다시 쓰기 때문입니다. 이제 여기에서는 하나가 아니라 네 개의 브랜치를 사용합니다. 왜냐하면 여기서 정보는 그대로 유지될 수 있는 반면 나머지는 변경될 수 있기 때문입니다. 이를 게이티드 잔차 연결(gated residual)이라고 부릅니다. 그리고 셋째, 핫도그를 상상해 보세요. 맛있죠. 이제 두 단어 'hot'과 'dog'은 각각 상당히 다른 의미를 갖습니다. 'Hot'과 'Dog'이 합쳐져서 'Hot dog'을 만들지는 않습니다. 그래서 Qwen은 이러한 짧은 토큰 조합들을 묶어서, 빠르고 저렴하게 검색할 수 있는 조회 메모리(lookup memory)를 구축합니다.
이를 n-gram 임베딩이라고 부릅니다. 이는 DeepSeek이 이미 수행하는 것의 변형입니다. DeepSeek은 이 조회 메모리를 여러 레이어에 걸쳐 분산시키는 반면, Qwen은 이를 시작 근처 하나의 거대한 조회 레이어에 배치합니다. 그리고 이 세 가지 기능들은 이미 최고의 오픈 가중치 AI 시스템들, 어쩌면 훨씬 더 크고 강력한 DeepSeek 4 Pro보다도 뛰어난 시스템을 제공합니다. 게다가 모두 출시된 지 불과 며칠 만에 가능한 일입니다. 정말 놀랍습니다. 그리고 이 모든 것을 영원히 무료로 얻게 됩니다. 살기 좋은 시대가 아닐 수 없습니다. 우리는 LLM 시대를 위한 새로운 도구가 필요하며, weights and biases는 가벼운 툴킷을 개발하여 LLM 애플리케이션을 자신 있게 반복할 수 있도록 지원합니다.
트레이스(traces)를 사용하여 앱의 각 단계에서 데이터가 어떻게 흐르는지 디버깅하고, 평가(evaluations)를 사용하여 진행 상황을 측정하세요. 이것이 최고입니다. 지금 wnb.me/papers에서 사용해 보거나 아래 설명란의 링크를 클릭하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Two Minute Papers (AI 논문)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기