GLM 5.3: 강력한 AI가 거의 무료가 되다
요약
GLM 5.3 Flash와 GLM 5.3 모델이 공개되어 강력한 AI 성능을 저렴하게 제공하며 주목받고 있습니다. 이 모델들은 컴퓨팅 효율성을 높이기 위해 레이어 수를 줄이고, 선형 어텐션 및 인덱스 풀 같은 새로운 기술을 적용했습니다. 이를 통해 더 적은 자원으로도 긴 컨텍스트 처리와 높은 지능 수준을 유지할 수 있게 되었습니다.
핵심 포인트
- GLM 5.3 Flash/GLM 5.3 모델이 공개되어 강력한 AI 성능을 저렴하게 제공합니다.
- 모델 효율성을 위해 레이어 수를 절반으로 줄이고, 컴퓨팅 자원을 크게 절감했습니다.
- 선형 어텐션과 인덱스 풀 기술로 긴 컨텍스트 처리 능력을 향상시켰습니다.
- 오픈 웨이트 시스템이며 커뮤니티 기여를 통해 지속적인 개선이 기대됩니다.
저는 이 AI를 집에서 실행하고 있는데, 이런 아름다운 이미지를 계산하는 가벼운 시뮬레이션을 할 수 있습니다. >> [웃음] >> 저것 좀 보세요. 맛있는 캐스틱(caustics)도요. 오 마이 갓. 재미있는 전략 게임을 작성할 수도 있고, Blender 같은 무료 오픈 소스 소프트웨어에서 아름다운 전체 3D 장면을 모델링할 수도 있습니다. 믿기 어려울 정도로 좋고, 이 모든 것을 합쳐서, 음, 제가 보자... 아무것도 아닙니다. 네, 무료이고 오픈 소스입니다. 잠깐만요, 이것은 GLM 5.3 Flash라고 불립니다. 그리고 그 형제 격인 GLM 5.3도 마찬가지입니다. Flash는 원래 다른 이름으로 은밀하게 출시되었는데, 저는 말하자면, >> 뭐라고요?
저것 좀 보세요. DeepSeek보다 사용량에서 빠르게 앞질렀습니다. 신기함 같은 건 이해하지만, 이건 미쳤어요. 그리고 이제, 학자 여러분들, 주목하세요. 왜냐하면 잠시 생각할 시간을 주면, 더 크고 작은 모델 모두 일부 벤치마크에서는 Fable 수준에 근접할 수 있기 때문입니다. 제 생각에는 이게 전반적으로 Fable 수준이라고는 느껴지지 않지만, 몇몇 실험을 해보니 그리 멀지 않습니다. 제가 이런 말을 할 수 있다는 게 믿기지 않지만, 저는 올해 안에, 몇 달 안에, Fable이 무료 AI 시스템에 의해 능가될 것이라고 생각합니다.
살아있기에 정말 좋은 시대입니다. 자, 그럼 이 마법 같은 일이 어떻게 가능한 걸까요? 그들은 어떻게 해냈을까요? 친애하는 학자 여러분, 여기는 Dr. Károly Zsolnai-Fehér와 함께하는 Two Minute Papers입니다. GLM 3.5 Flash는 더 적은 컴퓨팅으로 더 많은 지능을 압축하는 것에 관한 것입니다. 200억 개의 매개변수(parameters)를 가지고 있으며, 토큰당 약 활성화됩니다. 이전에는 레이어 수가 92개였지만, 이제는 대략 절반으로 줄었습니다. 그리고 그들은 몇 가지 새로운 기술을 준비하고 있습니다. 모든 토큰을 다른 모든 토큰과 비교하는 대신, 주변 컨텍스트(context)를 작은 패키지로 요약할 수 있습니다.
이것을 선형 어텐션(linear attention)이라고 부르며 [기침 소리] 그들은 스파스 어텐션(sparse attention)에서도 사용하지만 이것보다 훨씬 저렴합니다. 또한, AI와 장시간 세션을 유지하며 대화해 본 경험이 있나요? 그리고 당신이 점점 더 오래 이야기할수록 상황이 점점 더 나빠지는 것을요? 네. 만약 문서 뭉치, 거대한 코드베이스, 또는 긴 논의가 있다면, 그 컨텍스트를 검색하는 것이 정말 비싸집니다. 이는 저장된 컨텍스트의 인덱스를 검색하기 전에 압축하여 모델이 훨씬 멀리까지 되돌아보고 더 적은 메모리와 컴퓨팅 자원을 사용할 수 있게 합니다.
그것을 인덱스 풀(index pool)이라고 부릅니다. 그리고 이 모든 것을 합치면, 빠르고, 스마트하며, 저렴하도록 처음부터 구축된 시스템을 갖게 됩니다. 물론 아직 수천 달러에 달하는 강력한 하드웨어가 필요하지만, 제가 여러분이라는 뛰어난 학자들에게서 좋아하는 점은 항상 지칠 줄 모르고 더 소박한 하드웨어에서도 작동하게 만들려고 노력한다는 것입니다. 이것은 다시 한번 오픈 웨이트(open weight) 시스템이며, 우리가 함께 작업하고 추가해야 할 프로젝트입니다. 그러니 개선에 기여해주시는 모든 분들, 저희와 공유하기 위해 실험을 실행하시는 모든 분들, 또는 단순히 이야기하며 입소문을 내주시는 모든 분들께 정말 감사드립니다.
저희 채널에는 가장 놀라운 청중들이 계시고, 여러분을 위해 이런 영상을 만들 수 있다는 것은 영광입니다. 이것은 페이퍼 비디오(paper video) 1,072편이며, 저는 그 어느 때보다 여러분과 즐거운 시간을 보내고 있습니다. 그래서 제가 저희 채널을 사려고 했던 수백만 달러 규모의 사모펀드 회사들을 거절했다고 말한 것입니다. 접근했던 다른 모든 곳들은 알고 들었는데, 팔렸지만 우리는 팔지 않았습니다. 비록 >> 저는 훨씬 더 좋은 하드웨어를 가졌겠지만, 그것은 확실합니다. 네, 맞아요. 그 점에 대해서는요. 여기서 저의 주요 제한 사항은 물론 하드웨어입니다.
이것을 실행하려면 많은 컴퓨팅 파워가 필요합니다. 더 이상 수십억 단위는 아니지만, 여전히 저렴하지는 않습니다. 또한 집에서 큰 모델 전체를 구동할 만큼의 하드웨어도 갖추고 있지 못합니다. 하지만 Lambda 덕분에 해결됩니다. 그래서 우리 중 다수는 작게 압축되고 양자화된(quantized) 버전을 사용할 것이며, 이런 버전들은 여기 제게 그랬던 것처럼 미친 듯이 루핑될 수 있습니다. 그러니 완벽함을 기대하지는 마시고, 가지고 노는 재미를 마음껏 누리시길 바라며, 저는 이 점에 대해 정말 감사합니다. 정말 너무 감사드립니다. 저는 Lambda를 사용해서 AI 연구 논문을 종종 몇 분 만에 재현합니다.
자신만의 모델을 훈련하거나 기존 모델을 미세 조정(fine-tune)하는 것도 좋습니다. 추론(inference)이나 텍스트-이미지 또는 비디오 생성이 쉽습니다. 깊은 바다의 챗봇이나 에이전트(agent)를 구동하는 것도 매우 빠르고, 매우 신뢰할 수 있습니다. Lambda는 자신만의 실험을 실행할 수 있도록 강력한 Nvidia GPU를 제공합니다. 저는 제가 다루는 논문들에서 아이디어를 테스트하고, 몇 순간 뒤에 결과가 나옵니다. 정말 마음에 듭니다. 진심으로, 지금 바로 lambda.ai/papers에서 사용해 보세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 YouTube Two Minute Papers (AI 논문)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기