
RTX 2060 SUPER로 시작하는 로컬 LLM 개발 환경 구축 시도
요약
RTX 2060 SUPER 사양의 PC에서 WSL2와 Ollama를 활용하여 로컬 LLM 개발 환경을 구축하는 과정을 다룹니다. VS Code의 Continue 확장 프로그램을 통해 Llama 3.1 및 Qwen2.5-Coder 모델을 연동하여 코딩 보조 도구로 활용하는 시도를 기록했습니다.
핵심 포인트
- WSL2 환경에서 Ollama를 설치하여 로컬 LLM 구동 가능
- Continue 확장 프로그램을 통한 로컬 모델과 클라우드 모델 연동
- 저사양 GPU(8GB VRAM) 환경에서의 로컬 LLM 구동 시 한계점 확인
- 로컬 모델의 파일 경로 인식 및 코드 수정 적용 시의 불안정성 경험
여러분 안녕하세요, CLB입니다.
로컬 LLM (Local LLM)을 테스트해 보고 싶어서 시도해 보았습니다. 생각보다 도입하는 것이 간단합니다.
(실용적이라고 말한 것은 아닙니다.)
- OS: Windows 11(WSL)
- CPU: Intel(R) Core(TM) i5-10400F
- GPU: NVIDIA GeForce RTX 2060 SUPER(8GB)
- 메모리 (RAM): 7.7 GiB (WSL2에 할당된 용량)
- PC 케이스: 약 10년 전 학생 시절에 샀던 추억의 물건
로컬 LLM을 구동하려면, 에러가 발생하기 어렵고 Python 등과의 연동도 쉬운 WSL (Windows Subsystem for Linux) 환경을 가장 추천합니다.
이번에는 간편하게 LLM을 관리할 수 있는 『Ollama』를 도입합니다.
그 외에 개발에는 VS Code를 이용하고 있습니다.
최근의 Ollama 설치 스크립트에는 zstd
(압축 해제 도구)가 필요하기 때문에, 미리 WSL (Ubuntu 등)에 설치해 둡니다.
sudo apt update && sudo apt install -y zstd
다음 명령어로 스크립트를 실행합니다. 자동으로 Windows 측의 NVIDIA 드라이버를 감지하여, GPU (CUDA)를 사용할 수 있는 상태로 셋업되었습니다.
curl -fsSL https://ollama.com/install.sh | sh
왜인지 daemon은 동작하지 않으므로, daemon이 시작되지 않는 경우에는
ollama serve
명령어를 실행하여 수동으로 서버를 띄웁시다.
VS Code의 확장 기능 마켓플레이스에서 「Continue」를 설치.
실행하면, 로컬 모델(Local Model) 혹은 Gemini나 OpenAI의 서버 모델을 이용할 수 있는 화면이 표시되므로
로컬 모델을 선택하고, 거기에 나온 명령어를 아무 생각 없이 실행합니다.
Chat: Llama 3.1 8B
Autocomplete: Qwen2.5-Coder 1.5B
Edit: Llama 3.1 8B
가 되었습니다.
Gemini에게 사양서를 작성하게 한다.
ToDo 앱의 사양서가 생성되었다.
작성해 준 사양서, 생성된 코드는 리포지토리를 참조
@spec.md
이 사양서를 바탕으로 코드를 작성해 주세요. 작성한 코드는 app.py를 생성하여 그곳에 기술해 주세요.
생성된 파일
...
왜인지 path/to/... 에 새로운 파일을 생성하려고 하는 사람.
코드 내용은 제법 OK.
lama 3.1 8B는 agents.md를 읽을 수 있나요?
> Continue read /path/to/agents.md
> (이 파일의 내용은 제공할 수 없습니다. 대신에 필요한 정보를 입력해 주세요)
범용적인 이용 방법에 대한 질문이지만, 코드로 순수하게 읽어들이려고 하고 있다.
왜 path/to/... 에 집착하는 것인가...
그건가, 폴더 경로라고 하면 path/to/... 로 학습해 버린 걸까...
@app.py를 프로젝트의 루트 디렉토리로 이동해서
생성된 파일 -> ./app.py
실패!
복사 명령어가 아니라, 생성하려고 해 버렸다...
코드
@app.py finally에서 DB 연결을 클ローズ(close)해야 하는 것 아닌가요?
** 변경 없음
실패!
수정 코드를 추가하려고 했지만, 적용되지 않는다!
아깝다!
4~5년 된 미들 스펙 PC(자칭)에서는 통상적인 이용은 거의 불가능합니다.
또한, 현행 AI는 GPU의 메모리를 한계까지 이용하기 때문에, Windows 측의 동작에도 영향을 줍니다.
(화면 묘사에도 GPU를 사용하고 있기 때문에 PC 자체가 불안정해진다.)
왜 GPU를 사용하고 있을 뿐인데 PC가 불안정해지는 거야 라고 생각했습니다만,
지금은 화면 묘사에 GPU를 이용하는 시대. XP의 시대는 끝났습니다.
시대가 느껴집니다.
필요한 「GPU (하드웨어)」 요구 사항
이것들을 쾌적하게 구동하려면 「16GB~24GB 이상의 VRAM」이 주전장이 됩니다.
【상(松)】 스트레스 제로 환경: RTX 4090 / 5090 (24GB~32GB VRAM)
30B 클래스의 모델이 VRAM에 완전히 들어가며, 긴 코드를 읽혀도 폭발적인 속도를 유지합니다. 최정상급 로컬 개발 환경입니다.
【죽(竹)】 가성비·실용 라인: RTX 4080 Super / 4060 Ti (16GB VRAM)
14B 전후의 매우 우수한 코드 특화 모델이 깔끔하게 들어가는, 개인 개발자에게 가장 추천하는 밸런스입니다.
【매(梅)】 최소한의 실용 라인: RTX 3060 / 4070 (12GB VRAM)
7B~8B 클래스를 여유롭게 구동할 수 있어, VS Code의 코드 보완(Code Completion) 등이 매우 쾌적해집니다.
(※ 만약 Windows 자체의 교체를 검토 중이고, Mac에 거부감이 없다면, 메모리를 많이 탑재한 Mac Studio (M4/M5 Max 등의 128GB 통합 메모리 버전) 등도 거대한 로컬 모델을 구동하는 개발자들 사이에서 매우 인기 있는 선택지입니다)
라는 내용이므로 검토해 보시기 바랍니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Qiita AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기