로컬 LLM 구축하기: Ollama 설치부터 모델 실행까지

목차

이 글은 Linux와 macOS에서는 터미널 명령으로, Windows에서는 설치 프로그램으로 Ollama를 설치한 뒤 로컬 LLM을 처음 실행하는 과정을 안내합니다. 로컬 실행은 프라이버시와 오프라인 사용 측면의 장점이 있지만, 실제로 사용하는 모델의 메모리 요구량과 연결된 앱의 데이터 전송 여부도 함께 확인해야 합니다.

시작 전 하드웨어 확인

하드웨어 요구 사항은 모델 크기에 따라 달라집니다. 아래 RAM 수치는 시작 전에 확인할 권장 기준입니다.

모델 크기 권장 RAM
3B 8GB 이상
7~8B 16GB 이상
13B 32GB 이상

자신의 RAM이 기준에 못 미치면 작은 모델부터 선택하세요.

Ollama 설치

Linux와 macOS에서는 터미널에서 설치 명령을 실행할 수 있습니다. Windows에서는 공식 설치 프로그램을 내려받아 실행한 뒤 터미널을 새로 열어야 합니다. 아래 명령은 Linux와 macOS용입니다.

curl -fsSL https://ollama.com/install.sh | sh

설치가 끝나면 명령이 인식되는지 확인합니다.

ollama --version
ollama list

버전 정보가 표시되지 않으면 Linux/macOS에서는 command -v ollama를 실행해 실행 파일 경로가 출력되는지 확인합니다. 아무것도 표시되지 않으면 터미널을 다시 열고 설치 명령을 다시 실행하세요. Windows에서는 설치 프로그램이 끝까지 완료되었는지 확인한 뒤 새 터미널에서 같은 명령을 실행합니다.

모델 다운로드와 실행

사용할 모델을 먼저 다운로드합니다. pull은 모델 파일을 내려받아 로컬에 준비하는 단계이고, run은 준비된 모델을 대화형으로 실행하는 단계입니다. 아래 예시는 3B급처럼 비교적 작은 모델부터 시작하는 경우에 사용할 수 있으며, 실제로 필요한 RAM은 앞의 표를 기준으로 판단하세요.

ollama pull llama3.2

다운로드가 끝나면 run 명령으로 로컬에 저장된 모델을 실행합니다. 따라서 먼저 pull로 다운로드해야 하며, 이미 같은 모델을 받아 둔 경우에는 run만 다시 실행하면 됩니다.

ollama run llama3.2

화면에 >>> 입력 프롬프트가 나타나면 질문을 입력합니다. 예를 들어 >>> 안녕하세요처럼 입력하고 Enter를 누르면 됩니다. 기본 종료 방법은 Ctrl+D이며, 환경에 따라 /bye를 입력해 종료할 수도 있습니다. 다른 모델을 사용하려면 해당 모델을 먼저 다운로드한 뒤 같은 형식으로 실행합니다.

예를 들어 다른 모델로 바꾸려면 다음처럼 두 명령을 순서대로 실행합니다.

ollama pull qwen3
ollama run qwen3

문제 해결과 운영 팁

메모리가 부족하거나 응답이 느리다면 앞의 표에서 더 작은 모델을 선택하고 동시에 실행 중인 프로그램을 줄여보세요. 모델 다운로드가 실패하면 Linux/macOS에서는 df -h로 디스크 여유 공간을 확인하고, 인터넷 연결과 방화벽 설정이 다운로드를 막고 있지 않은지 점검합니다. 설치된 모델을 삭제해 공간을 확보할 때는 모델 이름을 확인한 뒤 ollama rm 모델이름을 사용합니다.

df -h
ollama rm llama3.2

Ollama 자체와 별개로 연결한 웹 앱이나 자동화 프로그램이 외부 API로 내용을 전송할 수 있으므로, 민감한 정보를 입력하기 전 해당 앱이 외부 API를 사용하는지와 전체 연결 구조를 확인하세요.

결론

Ollama는 설치 후 ollama pull로 모델을 준비하고 ollama run으로 대화를 시작하는 방식입니다. 다음 단계에서는 ollama list로 설치된 모델을 관리하고, 필요하면 ollama rm 모델이름으로 삭제할 수 있습니다. 자동화나 웹 앱과 연결할 때는 Ollama API가 http://localhost:11434에서 제공된다는 점을 참고하되, 연결한 프로그램이 내용을 외부로 전송하는지도 확인하세요.

관련 글

댓글

이 블로그의 인기 게시물

UGREEN DXP4800PLUS NAS로 유튜브 쇼츠 자동화 시스템 구축기 (Docker · FastAPI · PostgreSQL · Edge-TTS)

YouTube Data API 쿼터 초과를 피하는 방법 (700개 쇼츠 수집 사례)

FastAPI app.mount 사용 후 API가 404가 되는 이유와 해결 방법