최근 검토: 2026-08-10. 설치 명령, 지원 OS와 모델 이름은 빠르게 바뀝니다. 실행 전 Ollama 공식 다운로드와 공식 모델 라이브러리를 확인하세요.
Ollama는 ChatGPT·Claude 없이 내 PC나 Mac에서 대형 언어 모델(LLM)을 실행할 수 있는 무료 오픈소스 도구입니다. 2026년 기준 Meta Llama 3, Google Gemma 3, Mistral 등 수십 개 모델을 터미널 명령 하나로 설치하고 인터넷 없이도 AI를 사용할 수 있습니다.
Mac: ollama.com에서 앱 다운로드 후 설치. 터미널에서 ollama pull llama3.2로 모델을 다운로드합니다.
Windows: 동일하게 ollama.com에서 Windows 설치파일 다운로드. WSL2 설치 없이도 동작합니다.
Linux: 터미널에서 curl -fsSL https://ollama.com/install.sh | sh 한 줄로 설치 완료.
설치 후 ollama run llama3.2 명령으로 바로 대화를 시작할 수 있습니다. 모델 크기에 따라 다운로드에 5~30분 소요됩니다.
Llama 3.2 (3B/8B): Meta의 최신 모델. 한국어 지원 우수, 8B 기준 RAM 8GB 이상 권장. 범용 대화에 가장 추천.
Gemma 3 (4B/12B): Google DeepMind 제작. 코딩과 수학에 강하고 한국어도 준수. 4B는 RAM 6GB로도 동작.
Mistral (7B): 유럽산 고성능 모델. 영어 기준 GPT-3.5 수준이며 가볍고 빠름.
Qwen 2.5 (7B/14B): 중국 알리바바 제작. 한국어·중국어 특화, 코딩 능력이 뛰어남.
RAM 8GB 이하라면 3~4B 모델, 16GB 이상이라면 8~14B 모델을 권장합니다.
터미널 대화가 불편하다면 Open WebUI로 웹 브라우저에서 ChatGPT와 동일한 UI를 사용할 수 있습니다. Docker가 설치되어 있다면:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main
이후 브라우저에서 localhost:3000 접속하면 Ollama에 설치된 모든 모델을 선택해 대화할 수 있습니다. 대화 기록 저장, 파일 업로드, 시스템 프롬프트 설정 등 ChatGPT Plus 수준의 기능을 무료로 사용합니다.
Ollama는 CPU만으로도 동작합니다. 다만 속도가 느려 3B 모델 기준 CPU에서 초당 5~15 토큰, GPU(RTX 3060 이상)에서 초당 30~80 토큰입니다. Apple Silicon Mac(M1/M2/M3/M4)은 통합 메모리 구조 덕분에 CPU 환경에서도 초당 20~50 토큰으로 빠릅니다. NVIDIA GPU 사용자는 CUDA가 자동으로 활성화되어 최고 성능을 냅니다. RAM 8GB 이상, 여유 저장공간 10GB 이상이면 실사용이 가능합니다.
로컬 실행도 모델 라이선스·하드웨어 요구량·출력 오류를 확인해야 합니다. AI 보고서 목록 · 공식 GitHub