Ollama로 로컬에서 대규모 언어 모델을 돌린다는 건 한 문장으로 정리된다. 거대 모델을 "클라우드 API 호출"에서 내 컴퓨터의 한 줄 명령어로 바꾸는 것이다. Ollama를 설치하고 ollama pull llama3.1로 모델을 내려받은 뒤 ollama run 한 줄이면 오프라인 대화, 코딩, 문서 읽기가 전부 가능하고, 데이터가 제3자 서버를 거치지 않는다. 해결하는 문제는 "모델이 충분히 똑똑한가"가 아니라 "모델을 사적으로, 오프라인으로, 추가 비용 없이 내 머신에서 돌릴 수 있는가"이다.
공식 저장소
프로젝트는 GitHub에 있으며 조직명은 Ollama, 프로젝트명은 ollama(저장소 경로 ollama/ollama), MIT 라이선스로 공개되어 있다. 2026년 중반 기준 스타 17만을 돌파해 로컬 LLM 런타임 분야 최고 관심 오픈소스 프로젝트다. 공식 설치 프로그램은 Windows, macOS, Linux를 지원하고 데스크톱 GUI 버전도 있다. OpenAI 호환 로컬 API 엔드포인트를 내장해 수많은 데스크톱 클라이언트와 에이전트 프레임워크가 로컬 모델 백엔드로 바로 연결한다.
실제로 해결하는 세 가지 문제
첫째는 프라이버시다. 민감한 문서와 코드를 제3자에게 올릴 필요가 없어진다. 둘째는 오프라인 사용으로, 비행기 안이나 불안정한 회선에서도 AI를 쓸 수 있다. 셋째는 비용이다. 모델은 한 번 내려받으면 이후 토큰당 과금이 없다. 대가도 분명하다. 로컬 7B/8B급 모델의 실력은 클라우드 플래그십 모델과 급이 다르며, 이 전제를 받아들인 뒤에 선택해야 한다.
도입 비용: 하드웨어와 디스크가 두 개의 관문
Ollama 자체 설치는 무료이며 진짜 비용은 하드웨어에 있다. 경험칙은 이렇다. 메모리 8GB면 3B급 소형 모델, 16GB면 7B/8B급, 30B급은 VRAM 약 24GB가 필요하다. NVIDIA 외장 GPU가 있으면 자동 가속되고, 없으면 CPU로만 돌아간다. 돌아가긴 하지만 속도는 몇 배 느리다. 두 번째 관문은 디스크 용량으로 자주 과소평가된다. 8B 모델 양자화 버전이 약 4~5GB, 70B급은 수십 GB에 달한다. 모델 저장소에는 수십 GB를 확보해 두는 것이 좋다.
실제 함정: 양자화, VRAM, 모델 이름
첫째, 양자화 버전을 잘못 고르면 다운로드가 헛수고가 된다. 같은 모델에 Q4, Q5, Q8 등 여러 양자화 버전이 있으며 숫자가 클수록 파일이 크고 정밀도 손실이 작다. VRAM이 빠듯하면 Q4_K_M 같은 4비트 버전을 고르고, VRAM이 넉넉하고 품질을 원할 때 Q8_0을 고려한다. 둘째, VRAM 부족은 에러가 나지 않고 그냥 느려진다. VRAM이 모자라면 Ollama는 조용히 CPU 추론으로 전환해 속도가 급락한다. "돌아간다"고 판단하기 전에 작업 관리자에서 GPU가 실제로 일하고 있는지 확인하자. 셋째, 모델 이름의 콜론을 무시하지 말 것. llama3.1과 llama3.1:70b는 용량도 능력도 완전히 다른 버전이며, 잘못 내려받는 것이 초보자의 가장 흔한 실수다.
메모리 16GB 이상에 괜찮은 GPU까지 갖춘 컴퓨터라면, Ollama는 지금 오픈소스 모델을 집으로 들이는 가장 손쉬운 입구다. VRAM과 디스크를 먼저 계산하고 어떤 모델을 받을지 정하면, 돌아가는 길의 대부분을 피할 수 있다.
Q: Ollama로 모델을 내려받은 뒤에도 인터넷 연결이 필요한가요?
A: 필요 없다. 모델 파일 다운로드가 끝나면 추론은 완전 오프라인으로 진행되며, 연결이 필요한 건 최초 다운로드와 업데이트 확인 때뿐이다.