
AMD, 모델 특화 AI 추론 칩을 위해 Taalas 인수
요약
AMD가 모델 특화 AI 추론 칩을 개발하는 Taalas를 인수하며 시장에 진출합니다. 이 방식은 일반적인 프로그래밍 가능 칩과 달리, 모델 가중치를 칩 자체에 직접 구워 넣어(burn) 높은 성능 향상을 목표로 합니다. 이를 통해 대규모 모델의 효율적이고 빠른 추론이 가능해집니다.
핵심 포인트
- 모델 특화 칩은 모델을 CMOS에 '구워 넣는' 방식으로 작동합니다.
- Taalas의 HC1 기술 시연기는 Llama 3.1 8B를 초당 최대 17,000 토큰으로 처리한다고 주장합니다.
- 이 방식은 여러 개의 칩을 다루는 복잡성을 줄여 제조 및 배포 효율성을 높입니다.
오늘 AMD는 색다른 방식의 AI 추론 (Inference) 칩을 위해 Taalas를 인수한다고 발표했습니다. 다양한 모델을 실행할 수 있는 고도의 프로그래밍 가능한 칩을 사용하고 프로그래밍 가능성을 이용해 모델을 변경하는 대신, Taalas는 그 반대입니다. 이는 모델당 하나의 칩, 또는 더 가능성 높게는 하나의 칩 세트입니다. 랙(Rack)에서 실행되는 모델을 변경하려면 모델 특화 AI 추론 (AI Inference) 칩이기 때문에 칩도 함께 변경해야 합니다.
AMD, 모델 특화 AI 추론 칩을 위해 Taalas 인수
Taalas의 기본 개념은 HBM과 같은 메모리로부터 거의 모든 모델 가중치 (Model weights)를 로드한 다음 칩의 프로그래밍 가능한 부분을 사용하여 모델의 특정 행렬 및 연산 요구 사항을 처리하는 대신, 모델을 CMOS에 직접 구워 넣는(burn) 것입니다. 이 방식의 이점은 더 프로그래밍 가능하도록 설계된 다른 솔루션에 비해 성능 향상이 엄청날 수 있다는 점입니다.

Taalas의 현재 세대 하드웨어는 HC1 기술 시연기 (Technology demonstrator)입니다. 이 회사는 HC1이 Llama 3.1 8B를 실행하는 것을 보여주었으며, 사용자당 초당 최대 17,000 토큰을 처리한다고 주장합니다. Taalas는 해당 칩을 TSMC 6nm 공정, 815 mm² 다이 (Die), 530억 개의 트랜지스터를 가진 것으로 명시하고 있습니다. Taalas는 HC1을 Nvidia H200 및 B200뿐만 아니라 Groq, SambaNova, Cerebras와 비교하고 있으나, 해당 수치는 Taalas 자체 측정값입니다.
하지만 현실적으로 이는 많은 최신 대규모 모델들이 전체 모델을 수용하기 위해서만 해도 여러 개의 레티클 크기 (Reticle-size) 칩을 필요로 한다는 것을 의미하며, 특히 대형 모델의 경우 더욱 그렇습니다. 10개, 수십 개, 혹은 그 이상의 서로 다른 유형의 칩을 제조하고, 패키징하고, 카드에 장착하고, 그 과정에서 모든 것을 테스트한 다음, 모든 부품을 하나로 묶어줄 소프트웨어를 확보해야 한다고 상상해 보십시오. 만약 10개의 서로 다른 칩이 필요한데, 마지막 10번째 칩에 문제가 생겨 돌아온다면, 마지막 칩을 기다리며 9개 배치(Batch)의 칩만 남게 된다면 어떻게 될까요? 이는 무섭게 들릴 수 있지만, 추론 (Inference)을 수행하는 매우 빠르고 주장하기로는 더 저렴한 방법입니다.
Taalas에 따르면 가중치(weights), 행렬 차원(matrix dimensions) 및 기타 중요한 비트만 변경하는 데는 단지 두 개의 마스크 레이어(mask layers)를 변경하는 것만 필요합니다. 이는 모델당 여러 개의 다른 칩이 필요한 경우에도, 예를 들어 두 개의 다른 GPU를 테이프아웃(tape out)해야 할 때 사용되는 것보다 훨씬 적은 수의 값비싼 마스크가 생산되어야 함을 의미합니다.

모델 특화 칩(model-specific chip)은 유연성(flexibility)을 효율성(efficiency)과 맞바꿉니다. 특화는 워크로드(workload)를 더 직접적인 데이터 흐름으로 줄여, 범용 설계(general-purpose designs)가 지니는 컴퓨팅 및 메모리 오버헤드를 절감할 수 있습니다. 그 대가로, 하나의 모델을 중심으로 구축된 랙은 해당 모델이 변경될 때 단순히 재타겟팅(re-targeted)될 수 없습니다. 이 때문에 이 접근 방식은 안정적이고 높은 볼륨의 추론(inference)에 가장 매력적이며, 이는 AMD가 AI 시장에서 가장 빠르게 성장하고 있다고 말하는 부분입니다. Patrick은 또한 다음과 같이 말했습니다. “또한 모델이 빠르게 채택되고, 워크플로우가 이를 중심으로 구축되며, 따라서 일정 기간 동안 기본 부하(base load)가 유지될 때 도움이 됩니다. 마치 gpt-oss-20b/ 120b가 크기 카테고리에서 최첨단(leading-edge)에 훨씬 뒤처져 있음에도 불구하고 오늘날까지 광범위하게 채택되어 사용되는 것처럼 말입니다. 모델 특화 칩을 더 오래 사용할 수 있을수록, 전용 하드웨어로 모델을 가속화하는 비즈니스 사례가 더욱 쉬워집니다.”
마지막 단어들 (Final Words)
AMD는 Taalas의 기술을 자체 가속기 로드맵(accelerator roadmap)에 통합하고, 이를 Instinct 가속기를 중심으로 시스템 레벨 제품을 구축할 것이라고 밝혔습니다. 이 움직임은 Helios 랙스케일 시스템, EPYC CPU, ROCm 소프트웨어를 아우르는 풀 스택 AI 플랫폼을 강화합니다. 자체 모델 특화 추론 엔진을 보유함으로써, AMD는 이미 판매하고 있는 범용 Instinct 가속기와 더불어 단일 안정적인 모델로 최대 효율성을 원하는 고객들에게 또 다른 선택지를 제공하게 됩니다. 가장 큰 미해결 질문은 Taalas의 시연기(demonstrator)가 얼마나 빨리 양산 부품으로 전환될 수 있는지, 그리고 단일 모델 실리콘이 시장의 나머지 부분이 판매하는 유연한 가속기에 맞서 의미 있는 워크로드 점유율을 확보할 수 있을지 여부입니다. 다른 것이 없다 하더라도, 이는 AMD에게 큰 움직임입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 ServeTheHome의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기