
개인 개발로 AI 서버를 설계해 보았다 〜30명 동시 이용 시 어떤 구성이 될까?〜
요약
30명의 동시 이용자를 수용하는 법률 상담 AI 서비스를 목표로 개인 개발 환경에서의 AI 서버 설계 방안을 다룹니다. Qwen3 모델을 기반으로 필요한 VRAM, GPU 구성, 추론 속도 및 비용 산출 과정을 상세히 설명합니다.
핵심 포인트
- 30명 동시 이용 시 초당 2,400 Tokens/s의 추론 성능 필요
- Qwen3 모델과 INT4 양자화 방식을 활용한 효율적 설계
- VRAM 용량, GPU 대수, 소비 전력 등 하드웨어 요구사항 분석
- 서비스 요구사항(응답 시간, 토큰 수)에 따른 서버 견적 산출 방법
ChatGPT의 등장으로 「나도 직접 AI 서비스를 만들어보고 싶다」고 생각하는 사람들이 늘어났습니다.
하지만 실제로 운영을 시작하려고 하면,
- 어떤 AI 모델을 선택해야 하는가
- GPU는 몇 장이 필요한가
- 서버 비용은 얼마나 드는가
- 매달 어느 정도의 유지비가 필요한가
와 같은 현실적인 문제에 직면하게 됩니다.
이번에는 법률 상담 AI를 예로 들어, 개인 개발로도 운용을 목표로 할 수 있는 30명 동시 이용을 전제로 한 AI 서버를 설계해 보겠습니다.
-
법률 상담 AI
-
일본어 대응
-
채팅 형식
-
24시간 가동
-
동시 이용 30명
-
응답 시간 5초 이내
이번에는 다음 구성을 채택합니다.
| 항목 | 채택 |
|---|---|
| LLM | Qwen3 |
| ... |
이 조건으로 견적을 내보면 구성은 다음과 같습니다.
| 항목 | 결과 |
|---|---|
| 필요 VRAM | 약 90GB (KV Cache 포함) |
| ... |
뉴럴 네트워크 (Neural Network)는 일반적으로 노드 (Node)와 에지 (Edge)로 구성된 모델로 설명됩니다.
노드는 입력된 데이터를 계산하고 그 결과를 다음 층으로 전달합니다. 에지에는 학습을 통해 얻은 가중치 (Weight)가 저장되어 있으며, 그 값을 사용하여 정보를 변환합니다.
이번에 채택하는 14B 모델의 「14B」는 약 140억 개의 파라미터 (Parameter)를 가지고 있음을 나타냅니다. 이미지로 생각하면 약 140억 개의 에지에 가중치가 설정되어 있다고 생각하면 이해하기 쉽습니다.
또한, INT4는 각 파라미터를 4bit 정수로 표현하는 양자화 (Quantization) 방식을 의미합니다.
이번에는 사용자로부터의 질문으로서 다음과 같은 상담을 상정합니다.
저는 제조업을 운영하는 중소기업의 경영자입니다.
창업 이래 20년 이상 사업을 지속해 왔으며, 현재는 약 40명의 직원을 고용하고 있습니다.
최근에는 실적도 안정적이었으나, 원자재비와 인건비 상승으로 인해 이익률이 저하되어 경영 개선을 진행하고 있습니다.
...
약 1,000자 정도의 입력이므로, 약 1,000 토큰 (Token)으로 추정합니다.
입력은 약 1,000 토큰, 출력은 약 400 토큰을 상정합니다.
응답 시간을 5초 이내로 설정하면 필요한 생성 속도는
400 ÷ 5 = 80 Tokens/s
가 됩니다.
30명이 동시에 이용하는 경우에는
80 × 30 = 2,400 Tokens/s
가 되므로, 약 2,400 Tokens/s의 추론 성능이 필요합니다.
채택하는 LLM에 따라 필요한 VRAM이나 추론 속도, GPU 대수, 소비 전력, 서버 가격까지 달라집니다. 따라서 AI 서버 전체의 구성을 결정하는 데 있어 가장 중요한 요소 중 하나입니다.
대표적인 오픈 소스 (Open Source) LLM에는 다음과 같은 것들이 있습니다.
| 모델 | 특징 |
|---|---|
| Qwen | 일본어 성능이 높고 상업적 이용이 용이함 |
| ... |
이번에는 법률 상담 AI를 상정하고 있기 때문에, 일본어로 자연스러운 답변을 생성할 수 있는 점을 중시했습니다.
또한, 개인 개발을 전제로 하는 이상 상업적 이용이 쉽고 로컬 환경에서도 다루기 쉽다는 점도 중요합니다.
이러한 조건을 바탕으로 이번에는 Qwen3를 채택합니다.
Qwen3는 일본어 성능이 높고, 오픈 소스 LLM 중에서도 실용성이 높은 모델로서 널리 이용되고 있습니다.
이후의 VRAM 및 GPU 견적도 이 모델을 전제로 진행합니다.
LLM에는 다양한 사이즈가 있으며, 파라미터 수가 늘어날수록 성능도 높아지는 경향이 있습니다.
파라미터 수가 큰 모델은 복잡한 질문이나 긴 문맥을 다루기 쉬우며, 전문 분야에서도 답변 품질이 향상됩니다.
반면, 필요한 VRAM은 늘어나고 추론 속도는 저하되기 쉽습니다. GPU 대수도 늘어나기 때문에 소비 전력과 운용 비용도 커집니다.
이번에는 다음 후보들을 비교했습니다.
| 모델 | 특징 |
|---|---|
| 7B | 가볍고 구동하기 쉽지만, 전문 분야에서는 답변 품질에 불안함이 있음 |
| ... |
법률 상담 AI에서는 잡담 용도보다 문맥 이해나 답변 품질이 요구됩니다. 따라서 7B로는 다소 부족합니다.
한편, 32B 이상이 되면 필요한 GPU나 VRAM이 크게 늘어나 개인 개발로서는 초기 비용과 유지비 모두 부담이 됩니다.
그래서 이번에는 품질과 비용의 균형을 고려하여 14B를 채택했습니다.
LLM을 선택했다면 다음에 결정할 것은 추론 방식입니다.
학습된 모델은 FP16이나 BF16과 같은 고정밀 형식으로 저장되어 있지만, 그대로 추론하면 대량의 VRAM을 소비합니다.
그래서 이용되는 것이 모델의 가중치를 적은 비트 수로 표현하는 양자화입니다.
대표적인 방식은 다음과 같습니다.
| 방식 | 특징 |
|---|---|
| FP16 | 고정밀도이지만 VRAM 소비가 큼 |
| ... | |
| INT4를 채택하면 모델 사이즈를 작게 만들 수 있어 필요한 VRAM을 억제할 수 있습니다. 그 결과, 동일한 GPU에서 더 많은 사용자를 처리할 수 있으며, GPU 대수와 소비 전력도 절감할 수 있습니다. |
양자화 (Quantization)로 인해 답변 품질이 약간 저하될 수는 있지만, 최근의 기법에서는 그 영향이 작아 채팅 용도라면 충분히 실용적인 품질을 유지할 수 있는 케이스가 늘어나고 있습니다.
이번에는 운용 비용을 중시하여 INT4를 채택했습니다.
개략적인 수치는 다음과 같습니다.
- 모델 약 8GB
- Runtime 약 4GB
- KV Cache 약 2.6GB × 30명
합계하면 약 90GB가 됩니다.
GPU 후보는 다음과 같습니다.
| GPU | VRAM |
|---|---|
| RTX 5070 | 12GB |
| ... | |
| 가격과 성능의 균형을 고려하여, 이번에는 RTX 5090을 3장 이용하는 구성을 채택합니다. |
RTX 5090의 최대 소비 전력 (TBP)은 약 600W이지만, LLM 추론에서는 항상 최대 전력으로 동작하는 것은 아닙니다.
개략적으로 계산하면 다음과 같습니다.
| 기기 | 소비 전력 |
|---|---|
| RTX 5090 × 2~3 | 약 900~1,500W |
| ... | |
| 합계하면 서버 전체의 소비 전력은 약 1.5~2.0kW가 됩니다. |
개략적인 비용은 다음과 같습니다.
| 항목 | 개략적 비용 |
|---|---|
| RTX 5090 × 2~3 | 약 80~120만 엔 |
| ... | |
| 합계하면 초기 비용은 약 150~250만 엔이 됩니다. |
24시간 가동했을 경우의 소비 전력량은 약 1,080~1,440kWh/월입니다.
전기 요금을 30엔/kWh, PUE를 1.4로 계산하면 전기 요금은 약 4~6만 엔/월이 됩니다.
이번에는 30명 동시 이용을 상정한 AI 서버 구성을 견적 내 보았습니다.
결과는 다음과 같습니다.
- 초기 비용 약 150~250만 엔
- 전기 요금 약 4~6만 엔/월
AI 서비스를 자체적으로 운영하려면 일반적인 웹 서비스보다 더 큰 설비 투자가 필요합니다.
물론 클라우드 GPU를 이용하거나 더 작은 모델을 채택하면 초기 비용과 운용 비용을 억제하는 것이 가능합니다.
그럼에도 불구하고 AI 서비스는 모델을 선택한다고 해서 바로 운영할 수 있는 것이 아닙니다. 모델의 성능뿐만 아니라 GPU, VRAM, 전원, 운용 비용까지 포함하여 설계해야 합니다.
AI 서비스를 현실적인 형태로 운영하기 위해서는 필요한 설비와 비용을 파악한 상태에서 자신에게 맞는 규모부터 시작하는 것이 중요합니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기