
H100 여덟 장이 필요하던 모델을 두 장으로 줄였음
요약
노타가 업스테이지의 Solar Open2 모델을 경량화하여 필요한 GPU 메모리를 76.5% 절감했습니다. H100 8장이 필요하던 모델을 2장으로 줄이면서도 추론 성능과 툴 호출 안정성을 유지하는 데 성공했습니다.
핵심 포인트
- H100 8장에서 2장으로 GPU 요구 사양 대폭 감소
- 가중치 메모리를 500.6GB에서 117.8GB로 76.5% 절감
- 양자화 및 프루닝 기술을 통해 추론 성능 유지
- 온프레미스 환경에서의 오픈웨이트 모델 활용성 증대
H100 여덟 장이 필요하던 모델을 두 장으로 줄였음
노타가 업스테이지 솔라 오픈2를 경량화한 결과임. 가중치 메모리가 500.6GB에서 117.8GB로 76.5% 줄었고, 메모리 기준으로 H100 8장이 필요하던 게 2장 환경에서 돌아감. 추론 성능 평균 점수는 81.57에서 81.17로 거의 그대로였음.
솔라 오픈2는 매개변수가 2,500억 개인데 실제 작업에는 150억 개만 켜지는 MoE 구조임. 노타는 여기에 데이터 기반 양자화와 라우터 인지형 양자화, 비균일 전역 프루닝을 걸었음. 줄이고 나서도 에이전트의 핵심인 툴 호출은 안정적으로 유지됐다고 함.
이게 왜 중요하냐면, 기업이 클라우드 모델을 못 쓰는 이유가 데이터를 밖으로 내보내야 해서임. 오픈웨이트를 자기 서버에서 돌리면 그 문제가 사라지는데 걸림돌이 GPU 여덟 장이었음.
그게 두 장이면 얘기가 달라짐. 모델을 크게 만드는 경쟁과 별개로, 남의 모델을 자기 서버에 욱여넣는 기술이 따로 시장이 되고 있음.
AI 자동 생성 콘텐츠
본 콘텐츠는 X @j90236317 (검증됨)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기