라벨이 로컬LLM인 게시물 표시

GPU 없이 로컬 AI를 실행할 수 있을까? CPU 기반 LLM 활용법

이미지
GPU 없이도 로컬 AI를 실행할 수 있지만, 모델 크기와 응답 속도 사이에서 타협이 필요합니다. 이 글은 Windows 또는 Linux에서 명령어를 실행할 수 있는 환경을 가정하고, GGUF 모델과 llama.cpp로 CPU에서 LLM을 돌리는 방법을 다룹니다. 목차 CPU 기반 LLM은 어떻게 추론할까? GGUF와 llama.cpp로 실행하기 RAM 사용량과 모델 성능 판단 결론 CPU 기반 LLM은 어떻게 추론할까? CPU 기반 LLM의 추론은 입력 문장을 토큰(작게 나눈 단위)으로 바꾼 뒤, 모델의 가중치(학습 결과를 담은 값)를 이용해 다음 토큰을 예측하는 과정입니다. GPU는 이 계산을 병렬로 처리해 속도를 높이고, CPU는 멀티코어(여러 CPU 코어)와 RAM을 활용해 같은 작업을 수행합니다. 따라서 CPU 실행에서는 속도와 메모리 사용량 사이의 타협이 핵심입니다. GGUF와 llama.cpp로 실행하기 CPU 환경에서는 양자화 모델을 주로 사용합니다. 양자화는 모델 가중치의 표현 정밀도를 낮춰 파일 크기와 메모리 사용량을 줄이는 방식입니다. 4비트와 8비트 계열이 흔히 쓰이며, 정밀도를 낮추면 실행 부담은 줄지만 답변 품질과 안정성은 떨어질 수 있습니다. GGUF는 모델 가중치와 실행에 필요한 정보를 함께 담는 파일 형식입니다. llama.cpp는 이 GGUF 모델을 CPU에서 실행하도록 최적화된 오픈소스 프로젝트이며, 별도의 AI 서버를 구축하지 않아도 명령어만으로 실행할 수 있습니다. 먼저 Windows 또는 Linux에서 명령어를 실행할 수 있는 환경을 마련하고, llama.cpp를 빌드하거나 실행 파일을 준비합니다. 이어서 GGUF 모델 파일을 내려받아 실행 파일과 모델 경로를 명령어에 지정하면 됩니다. ./llama-cli -m ./models/model.gguf -p "CPU 기반 로컬 AI의 장점을 설명해줘" -m 은 모델 파일 위치를 지정하고, -p 는 AI에게 전달할 프롬프트(입력 문...

로컬 LLM 구축하기: Ollama 설치부터 모델 실행까지

목차 시작 전 하드웨어 확인 Ollama 설치 모델 다운로드와 실행 문제 해결과 운영 팁 결론 이 글은 Linux와 macOS에서는 터미널 명령으로, Windows에서는 설치 프로그램으로 Ollama를 설치한 뒤 로컬 LLM을 처음 실행하는 과정을 안내합니다. 로컬 실행은 프라이버시와 오프라인 사용 측면의 장점이 있지만, 실제로 사용하는 모델의 메모리 요구량과 연결된 앱의 데이터 전송 여부도 함께 확인해야 합니다. 시작 전 하드웨어 확인 하드웨어 요구 사항은 모델 크기에 따라 달라집니다. 아래 RAM 수치는 시작 전에 확인할 권장 기준입니다. 모델 크기 권장 RAM 3B 8GB 이상 7~8B 16GB 이상 13B 32GB 이상 자신의 RAM이 기준에 못 미치면 작은 모델부터 선택하세요. Ollama 설치 Linux와 macOS에서는 터미널에서 설치 명령을 실행할 수 있습니다. Windows에서는 공식 설치 프로그램을 내려받아 실행한 뒤 터미널을 새로 열어야 합니다. 아래 명령은 Linux와 macOS용입니다. curl -fsSL https://ollama.com/install.sh | sh 설치가 끝나면 명령이 인식되는지 확인합니다. ollama --version ollama list 버전 정보가 표시되지 않으면 Linux/macOS에서는 command -v ollama 를 실행해 실행 파일 경로가 출력되는지 확인합니다. 아무것도 표시되지 않으면 터미널을 다시 열고 설치 명령을 다시 실행하세요. Windows에서는 설치 프로그램이 끝까지 완료되었는지 확인한 뒤 새 터미널에서 같은 명령을 실행합니다. 모델 다운로드와 실행 사용할 모델을 먼저 다운로드합니다. pull 은 모델 파일을 내려받아 로컬에 준비하는 단계이고, run 은 준비된 모델을 대화형으로 실행하는 단계입니다. 아래 예시는 3B급처럼 비교적 작은 모델부터 시작하는 경우에 사용할 수 있으며, 실제로 필요한 RAM은 앞의 표를 기준...