Ollama를 사용하여 대규모 언어 모델 (LLMs) 배포하기
요약
Ollama를 사용하여 로컬 환경에서 Llama 3, DeepSeek R1 등 다양한 LLM을 설치하고 실행하는 방법을 설명합니다. Linux, macOS, Windows 각 운영체제별 설치 과정과 모델 관리 및 실행 가이드를 제공합니다.
핵심 포인트
- Ollama를 통한 로컬 LLM 실행으로 개인정보 보호 및 보안 강화
- Linux, macOS, Windows 환경별 설치 및 서비스 관리 방법
- ollama pull 명령어를 이용한 다양한 오픈 소스 모델 다운로드
- 터미널 기반의 대화형 프롬프트 및 모델 실행 인터페이스 활용
Ollama는 인터넷 연결이나 클라우드 API 없이도 로컬 환경에서 대규모 언어 모델 (LLMs) (Llama 3, DeepSeek R1, Mistral, Phi-4, Gemma 2 등)을 실행할 수 있는 오픈 소스 (open-source) 플랫폼입니다. 모델을 로컬에서 실행하면 개인정보 보호 (privacy)와 보안 (security)이 향상되며, 성능 튜닝 (performance tuning)에 대한 완전한 제어권을 가질 수 있습니다. 이 가이드는 Linux/macOS/Windows에 Ollama를 설치하고, 모델을 다운로드 및 실행하며, 관리 및 환경 변수 (environment-variable) 설정에 대해 다룹니다.
Ollama 설치
Linux
1. 공식 스크립트를 통한 설치:
$ curl -fsSL https://ollama.com/install.sh | sh
2. 확인 및 모델 목록 표시:
$ ollama -v
$ ollama list
3. Ollama는 systemd 서비스로 설치됩니다 — 상태 확인, 부팅 시 활성화, 재시작:
$ sudo systemctl status ollama
$ sudo systemctl enable ollama
$ sudo systemctl restart ollama
선택 사항 — AMD GPU (ROCm) 지원:
$ curl -L https://ollama.com/download/ollama-linux-amd64-rocm.tgz -o ollama-linux-amd64-rocm.tgz
$ sudo tar -C /usr/ -xzf ollama-linux-amd64-rocm.tgz
macOS
- ollama.com/download에서 패키지를 다운로드하고,
.zip파일의 압축을 푼 뒤,Ollama.app을 Applications 폴더로 드래그합니다. - 확인 및 시작:
$ ollama -v
$ ollama list
$ ollama serve
Windows
- ollama.com/download/windows에서
.exe파일을 다운로드하고 설치 프로그램을 실행합니다. - PowerShell에서:
> ollama -v
> ollama list
> ollama serve
모델 다운로드
1. 이름으로 모델 가져오기 (Pull):
$ ollama pull [model]
2. 예시:
$ ollama pull mistral
$ ollama pull deepseek-r1:1.5b
$ ollama pull llama3.3
Llama 3.3은 약 40GB입니다 — 가져오기 전에 디스크 공간이 있는지 확인하세요.
3. 로컬에 있는 모델 목록 표시:
$ ollama list
NAME ID SIZE MODIFIED
llama3.3:latest a6eb4748fd29 42 GB 21 seconds ago
deepseek-r1:1.5b a42b25d8c10a 1.1 GB 4 minutes ago
...
모델 실행
1. 모델 직접 실행:
$ ollama run qwen2.5:1.5b
2. >>> 대화형 프롬프트(interactive prompt)에 프롬프트 입력:
>>> 클라우드 컴퓨팅(cloud computing)에 대해 두 줄의 텍스트를 작성해줘
모델이 터미널에 응답을 스트리밍(stream)합니다. /bye를 입력하여 종료합니다.
3. DeepSeek R1과 같은 추론 모델(reasoning model) 실행 — 이 모델의 출력에는 최종 답변 전에 추론 과정(reasoning trace)을 보여주는 <think> 블록이 포함됩니다:
$ ollama run deepseek-r1:1.5b
모델마다 적합한 작업이 다릅니다. 동일한 프롬프트에 대해 여러 모델을 실행하여 사용자의 하드웨어에서 품질과 속도를 비교해 보세요.
모델 관리 (Manage Models)
$ ollama list # 로컬 모델 목록 표시
$ ollama show llama3.3 # 모델의 파라미터(params), 컨텍스트 길이(context length), 라이선스(license) 확인
$ ollama stop deepseek-r1:1.5b # 실행 중인 모델 중지
...
환경 변수 (Environment Variables)
주요 변수:
OLLAMA_HOST— 서버 바인드 주소 (server bind address)OLLAMA_GPU_OVERHEAD— GPU당 예약된 VRAM (바이트 단위)OLLAMA_MODELS— 사용자 정의 모델 저장 디렉토리OLLAMA_KEEP_ALIVE— 모델이 메모리에 로드된 상태로 유지되는 시간OLLAMA_DEBUG— 상세 로그 (verbose logging)OLLAMA_FLASH_ATTENTION— 실험적인 어텐션(attention) 최적화OLLAMA_NOHISTORY— readline 히스토리 비활성화OLLAMA_NOPRUNE— 시작 시 블롭(blob) 정리(pruning) 건너뛰기OLLAMA_ORIGINS— 서버에 허용된 Origin URL
Linux — systemd 유닛 편집:
$ sudo vim /etc/systemd/system/ollama.service
[Service]
Environment="OLLAMA_DEBUG=1"
Environment="OLLAMA_HOST=0.0.0.0:11434"
OLLAMA_HOST=0.0.0.0을 설정하면 네트워크상의 다른 호스트가 해당 포트의 Ollama에 접속할 수 있습니다.
$ sudo systemctl daemon-reload
$ sudo systemctl restart ollama
macOS:
$ launchctl setenv OLLAMA_HOST "0.0.0.0"
$ ollama serve
Windows: 시스템 변수 편집 (Edit the System Variables) → 환경 변수 (Environment Variables) → **새로 만들기 (New)**를 검색하여 이름/값을 설정한 후 **확인/적용 (OK/Apply)**을 클릭하세요.
다음 단계 (Next Steps)
Ollama가 설치되어 로컬에서 모델을 서비스하고 있습니다. 다음 단계로는:
- 채팅 스타일의 GUI를 위해 Open WebUI와 결합하세요
- 네트워크상의 다른 머신에 노출하려면
OLLAMA_HOST=0.0.0.0을 설정하세요 - 자신의 하드웨어에서 모델을 벤치마크(Benchmark)하기 위해 자체 프롬프트(Prompt)를 사용하여
ollama run/ollama pull을 스크립트화하세요
전체 가이드를 보려면 **Vultr Docs**의 원문 기사를 방문하세요.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기