Google의 Gemma 2 출시: 오픈 모델의 중요한 전환점
요약
Google이 차세대 오픈 모델인 Gemma 2를 출시했습니다. 9B 및 27B 파라미터 모델로 구성되며, 하이브리드 어텐션 메커니즘을 통해 효율성과 성능을 극대화하여 단일 GPU에서도 강력한 성능을 발휘합니다.
핵심 포인트
- 27B 모델은 단일 GPU에서 실행 가능할 만큼 효율적이며 대형 모델과 경쟁 가능
- 하이브리드 어텐션 메커니즘을 통한 성능과 메모리 사용량의 최적화
- Llama 3 8B 등 동급 오픈 모델 대비 우수한 성능 제공
- Hugging Face, PyTorch 등 주요 프레임워크와 즉시 호환 가능
Google이 차세대 오픈 모델인 Gemma 2를 출시했으며, 이는 오픈 소스 AI를 활용해 구축하는 모든 이들에게 중요한 움직임입니다. 핵심 요점은 다음과 같습니다: 27B 파라미터(parameter) 버전은 자신의 크기보다 두 배 이상 큰 모델들과 경쟁할 수 있는 성능을 제공하면서도, 단일 GPU에서 실행될 수 있을 만큼 효율적입니다.
이것은 단순한 점진적 업데이트가 아닙니다. 자신의 스택(stack)을 직접 제어해야 하는 개발자들에게 실용적이고 고성능인 대안을 제공하는 데 중점을 둔 새로운 아키텍처(architectural) 설계입니다.
Gemma 2란 무엇인가
Gemma 2는 90억(9 billion) 및 270억(27 billion) 파라미터의 두 가지 크기로 출시되었습니다. 이전 모델과 달리, Gemma 2는 재설계된 아키텍처를 기반으로 구축되었습니다. 기술 보고서(technical report)에 따르면, 성능과 메모리 사용량의 균형을 맞추기 위해 로컬 어텐션(local attention)과 글로벌 어텐션(global attention)을 교차 사용하는 하이브리드 어텐션(hybrid attention) 메커니즘을 사용합니다.
27B 모델이 핵심입니다. Google은 이 모델이 해당 크기 대비 최고 수준의 성능을 제공하며, 훨씬 더 큰 폐쇄형(proprietary) 모델들과 경쟁할 수 있다고 주장합니다. 효율성 향상은 주목할 만합니다. 27B 모델은 단일 NVIDIA H100 또는 A100 80GB GPU, 또는 Google Cloud TPU 호스트에서 전정밀도(full precision)로 추론(inference)을 실행할 수 있습니다. 이는 이 정도의 역량을 가진 모델을 배포하는 데 있어 진입 장벽을 크게 낮춰줍니다.
더 작은 9B 모델 또한 Llama 3 8B와 같은 동일 체급의 다른 오픈 모델들을 능가하며 해당 카테고리의 선두주자로 자리매김하고 있습니다.
빌더들에게 중요한 이유
엔지니어와 소규모 팀에게 Gemma 2는 셀프 호스팅(self-hosting)의 계산 방식을 바꿉니다. 이 정도 수준의 성능을 가진 27B 파라미터 모델을 접근 가능한 단일 GPU에서 실행할 수 있다는 점은 비용과 복잡성 측면에서 큰 이점입니다. 이는 이전에는 이 정도의 강력한 성능을 위해 폐쇄형 모델 API를 기본적으로 사용해야 했을 상황에서, 셀프 호스팅을 더욱 실행 가능한 옵션으로 만들어 줍니다.
이는 다른 주요 연구소(major lab)로부터 강력하고 상업적으로 친화적인 오픈 모델을 제공합니다. 이는 오픈 소스 생태계에 더 많은 경쟁과 선택지를 도입합니다. 모델은 현재 Hugging Face, Kaggle, Google AI Studio에서 사용할 수 있으며, PyTorch, JAX, TensorFlow와 같은 프레임워크를 위한 통합 기능을 제공합니다.
Google은 또한 Gemma 모델을 위한 SynthID 텍스트 워터마킹 (text watermarking) 기술을 오픈 소스로 공개하기 위해 작업 중이라고 밝혔으며, 이는 AI 안전성 (AI safety) 및 콘텐츠 출처 (content provenance)에 관심이 있는 모든 이들에게 흥미로운 발전입니다.
gemma 2 시작하기
Hugging Face에서 모델을 직접 가져올 수 있습니다. 대부분의 채팅 및 지시 이행 (instruction-following) 작업에는 지시어 튜닝 (instruction-tuned, -it) 변형 모델이 필요할 것입니다. 다음은 transformers 라이브러리를 사용하여 9B 지시어 튜닝 모델을 로드하는 방법입니다.
import torch
from transformers import pipeline
...
이 코드 스니펫은 CUDA가 지원되는 GPU와 필요한 라이브러리가 설치되어 있다고 가정합니다. 핵심은 모델의 채팅 템플릿 (chat template)을 사용하여 지시어 튜닝 버전의 프롬프트 (prompt)를 올바르게 형식화하는 것입니다.
시사점 (the so-what)
Gemma 2는 오픈 모델 분야의 강력한 새로운 경쟁자입니다. 특히 27B 규모에서 압도적인 성능과 추론 효율성 (inference efficiency)의 매력적인 조합을 제공합니다. 거대한 클러스터의 비용과 인프라 복잡성 없이 대규모 모델의 힘을 원하는 빌더들에게 이번 출시는 주의 깊게 살펴봐야 할 소식입니다. 이는 사용자의 조건에 맞춰 정교한 AI 기능을 배포하는 장벽을 낮춰주는 실용적인 도구입니다.
출처
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기