AMD, 모델을 실리콘에 새기는 AI 칩 스타트업 Taalas 인수
요약
AMD가 AI 모델을 실리콘에 직접 내장하는 기술을 가진 스타트업 Taalas를 인수했습니다. 이는 모델을 하드웨어에 최적화하여 추론 속도를 높이고 비용을 낮추는 전략으로, 소비자 가전 및 특정 자동화 시장을 겨냥합니다.
핵심 포인트
- AMD의 Taalas 인수는 모델을 실리콘에 내장해 진입 장벽을 구축하려는 전략임
- 저비용·고속 추론을 통해 구형 모델을 활용한 특정 자동화 시장 공략 가능
- Apple의 온디바이스 AI와 유사하게 지연 시간과 배터리 효율을 극대화할 수 있음
- 데이터센터 중심의 경쟁에서 소량의 고성능 특화 칩 생산 경쟁으로 패러다임 전환 가능성
OpenAI나 Anthropic이 먼저 나서지 않은 게 의외임. 중국의 오픈 가중치 모델이 앞서가며 이들의 가치 제안을 범용화하고 있으니, 모델을 실리콘에 내장해 진입 장벽을 만드는 게 다음 수순이었을 것임
Google은 이미 TPU를 보유한 데다, 양자화한 Flash 모델을 개별 TPU에 넣어 추론하는 실험 프로젝트도 진행 중임
개인적으로 Apple이 인수했어야 한다고 봄. Gemma 4급 모델을 iPhone에 내장해 지연 시간과 배터리 소모를 극도로 낮춘다면 미래처럼 느껴질 것임
최첨단 지능은 아니더라도 매년 새 모바일 기기를 살 유인이 다시 생길 수 있음
모델 발전과 갈아타기 속도를 보면, 모델을 실리콘에 새기는 건 노후화를 앞당기는 길처럼 보임
이 방식이 성립하려면 몇 세대 전 모델을 구매할 고객부터 찾아야 함. 일반적인 LLM 업체보다 AMD가 그런 시장을 찾을 유인이 훨씬 큼
Bitcoin 채굴도 결국 ASIC이 장악했음. 모든 면에서 저렴하고, 추론용 Nvidia GPU보다 수명도 길게 가져갈 수 있음
주가에는 별 도움이 안 될 수도 있음. CPU 수량 증가처럼 단순한 이야기가 아니라 복잡하게 들리기 때문임
스마트폰 호황기에 모두가 화소 수 증가만 믿던 때, 메가픽셀 외의 요소를 설명하는 것과 비슷함
이 기술이 수많은 AI 데이터센터를 사실상 무용지물로 만든다면 꽤 아이러니할 것임. 다음 단계가 거대한 데이터센터와 전력 확보 경쟁이 아니라, 소량의 비싼 칩과 그 칩을 얼마나 빨리 생산하느냐의 경쟁이 될 수도 있음
몇 년 전 ChatGPT 최초 발표 이후 본 LLM 기술 중 가장 멋짐. 최첨단 모델의 소폭 성능 향상보다 훨씬 인상적임
이 데모는 정말 마음에 들며 마법처럼 느껴짐
진정한 의미에서 경이로운 속도임. 지식 질의와 기초 작업에는 뛰어나지만, 새로운 사실이나 다소 난해한 주제에서는 결과가 완전히 엉망임
다차원 배열을 처리하는 기본적인 C FFT 라이브러리를 생성시켰는데 즉시 완성됐음
모델 교체 주기가 이렇게 빠르면 실리콘이 출시될 때 이미 한 세대 이상 뒤처지지 않을지 의문임. 다만 충분히 저렴하다면 저비용 모델 추론 시장은 분명 생길 수 있음
AI 기업보다는 소비자용 하드웨어에 적합함. AI 기업은 모델과 요구 사항을 계속 바꾸지만, AI 식기세척기는 컴퓨터 비전으로 오염 부위를 정확히 겨냥하는 칩을 내장한 채 업데이트 없이 판매할 수 있음
현재 모델도 속도만 크게 빨라지면 판도가 바뀔 것임. 충분한 지시와 적절한 실행 환경, 여러 차례 피드백, 최대 추론을 제공하면 현 최첨단 모델이 못 하는 작업을 거의 찾기 어려움
하지만 추론에 한 시간 이상 기다리는 건 너무 번거로우며, 이를 저렴하게 몇 초 만에 끝낸다면 한 사람이 운영하는 대형 소프트웨어 회사가 곧 등장할 것 같음
진짜 가치는 고객용 에이전트나 챗봇보다 자동화 처리에 있음. 고객 피드백 이메일 분류처럼 단순한 작업은 더 좋은 모델의 이점이 작으므로, 약간 오래된 모델을 10배 저렴하게 돌릴 수 있다면 충분히 가치 있음
이미 성능보다 속도와 가격을 택해 Flash 모델을 쓰는 거의 모든 곳이 혜택을 볼 수 있음
애플리케이션마다 속도·비용·품질 사이의 절충점이 있음. 많은 용도에서는 6개월 지난 모델이 50배 빠르다면 기꺼이 선택할 것임
지금은 영리한 작업에 Opus, 빠른 작업에 Flash를 별 고민 없이 쓰며, 특히 지연 시간이 더 낮다면 더 둔한 모델도 받아들일 수 있음
이미 모델은 많은 작업에서 충분히 뛰어남. 10배 빠르고 저렴하다면 같은 모델을 1~2년 유지해도 만족할 사람이 많을 것임
새 실리콘 기반 모델은 높은 가격에 출시하고 구형 모델은 시간이 갈수록 저렴하게 만들면, 사용자에게 구형 모델을 계속 쓸 유인도 생김
모델이 내장된 PCIe나 M.2 카드를 워크스테이션이나 노트북에 꽂아 쓰려면 무엇이 더 필요한지 궁금함. 지능도 GPU처럼 되어, 대기업과 고급 사용자를 제외하면 대부분 설치된 성능에 만족하며 살게 될까? 몇 년 뒤인지, 10년 뒤인지도 궁금함
이미 그런 형태임. 지능이 GPU처럼 되는 것도 여러 구현 방식 중 하나가 될 수 있음
지금도 양산할 수 있지만, 모델 개선 속도가 너무 빨라 경제성이 없음
흥미롭지만 다소 무모해 보임. 모델 벤치마크와 AI 혁신 논의에서는 최고 성능과 신뢰 가능한 성능을 거의 구분하지 않음
최첨단 모델은 미해결 수학 문제나 대규모 코드베이스 분석까지 해내지만, 무작위 질문 100개를 던지면 적어도 몇 번은 틀리거나 어리석은 답을 할 가능성이 큼
더 과감하게 추론하거나 환각할수록 까다롭고 미묘한 해법을 찾을 가능성도 커지는 내재적 긴장이 있으며, 사람도 어느 정도 비슷해 보임. 하지만 그만큼 평범한 이메일 답장을 안정적으로 만들기는 어려워짐
코딩에는 늘 모델을 쓰지만 일상 서신을 맡기지는 않을 것임. 데이터센터에서 최첨단 모델을 고속 실행하는 건 유용할 수 있어도, 연구소가 하드웨어를 계속 교체할 비용까지 감수할지는 의문임. 신뢰하기 어려운 모델을 휴대전화의 저전력 추론 칩으로 굳혀 넣는 건 납득하기 어려움
표준적인 문제에서의 신뢰성과 그 정도 신뢰성이 주는 효용을 모두 과소평가하고 있다고 봄
100개 질문 중 틀리거나 어리석게 답한다는 구체적인 예가 궁금함
양쪽 모두에게 이득일 가능성이 큼. 팀은 보상받고, 정말 인상적인 아이디어와 아키텍처가 실제 제품으로 나올 가능성도 커짐
AMD에 의미 있는 규모의 인수라고 보기에는 팀이 너무 작음. 성과를 못 내는 조직에 흡수될 위험이 있고, 소비자가 감당할 만한 가격대의 제품이 나올 가능성도 사실상 사라졌음
암시장에서 뜨거운 칩을 구하며 “Mythos 9 가중치가 내장됐다”는 소문을 듣는 공상과학적 미래의 가능성이 커진 점은 마음에 듦
그 꿈은 끝난 듯함. 10~20년 뒤 eBay에서 기업 중고품으로 나온 칩을 개당 5천 달러 미만에 사게 될 날을 기대해야겠음
AMD는 돈을 아끼고 자체 하드웨어를 써도 됐을 것임. 이미 Xilinx Kria K26 SOM에서 언어 모델을 6만 토큰/초로 돌리고 있으며, 가중치를 URAM/BRAM에 넣어 토큰 처리 루프에서 DRAM을 전혀 사용하지 않음
Taalas와 같은 발상으로, 단일 스트림 디코딩은 메모리 대역폭에 제한되므로 먼 곳에서 가중치를 가져오지 않는 방식임
물론 제약은 많음. 매개변수는 316만 개이고 토큰은 문자 단위이며, 6만 기록은 각각 문맥 한 토큰만 기억하는 16개 스트림이라 아무 의미 없는 말을 엄청 빠르게 생성함. 전체 문맥과 KV 캐시를 쓰는 현실적인 구성도 단일 스트림에서 약 1만9천 토큰/초를 냄
실시간 데모가 포함된 블로그 글을 계속 손보고 있으며 하루나 이틀 안에 공개할 계획임
이 부분을 아무도 이야기하지 않아 놀라움. Taalas 설계는 대부분의 칩보다 물리적 캐시 용량에서 큰 우위를 지녔음
모델을 실제로 새기는 것과, 대형 칩 가장자리에 SRAM 같은 메모리를 대량으로 가깝게 붙이는 것 사이에 효과 차이가 얼마나 클지 궁금함
칩의 가장자리뿐 아니라 위아래 모든 면에 캐시를 접합할 수 있어야 함. 가장자리에만 붙이면 용량이 물리적으로 제한되며, 위아래 배치가 지연 시간에도 이점이 있을 수 있음
기술적으로는 이제 AMD의 하드웨어가 맞음
구현을 공개했다면 백만장자가 될 수도 있었을 텐데 왜 공개하지 않았는지 궁금함
특히 AMD가 Taalas와 같은 기술을 이미 보유했다면, 경쟁자를 시장에서 없애고 Intel, Huawei, Alibaba, NVIDIA 등의 인수를 막기 위해서라도 Taalas 인수는 충분히 타당함. BlackBerry 부활에도 훌륭한 인수가 됐을 수 있음
AI 자동 생성 콘텐츠
본 콘텐츠는 RSS: GeekNews (한국어)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기