ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 하드웨어
대형 모델을 로컬로 돌리려면 VRAM은 얼마나 필요할까? 8GB·16GB·24GB로 무엇을 돌릴 수 있나

대형 모델을 로컬로 돌리려면 VRAM은 얼마나 필요할까? 8GB·16GB·24GB로 무엇을 돌릴 수 있나

AI 하드웨어 • Admin • • 5 회 조회

대형 모델을 로컬로 돌릴 때 그래픽카드 VRAM이 충분한지는 모델을 다운로드하기도 전에 체감 상한을 정해 버리는 경우가 많습니다. 연산 성능만 보다가 모델이 들어가지 않거나, 들어가도 짧은 컨텍스트만 쓸 수 있다는 사실을 뒤늦게 깨닫는 사람이 적지 않습니다. VRAM은 하드 한계라 적게 사면 나중에 늘릴 수 없고 카드 전체를 바꿔야 합니다.

먼저 구간으로 보기: VRAM별로 돌릴 수 있는 모델

VRAM편안하게 돌릴 수 있는 모델어울리는 사람
8GBQ4 양자화 7B/8B 모델, 짧은 컨텍스트맛보기로 써 보고 싶은 사람, 가끔 오프라인으로 쓰는 사람
16GB14B는 편안하게, 32B는 컨텍스트를 아끼면 간신히로컬 배포를 진지하게 생각하는 대부분의 사람
24GB32B를 돌리고 컨텍스트 여유도 남김긴 컨텍스트와 안정적인 체감이 필요한 사람
32GB32B에는 여유 충분, 70B에는 여전히 부족예산에 여유가 있어 여유를 두고 싶은 사람
48GB 이상70B급 모델대형 모델을 만져 보고 싶은, 듀얼 카드나 플랫폼 교체도 감수하는 사람

이 표는 '간신히 집어넣기'가 아니라 '편안하게 돌리기' 기준입니다. Q4 양자화 기준으로 가중치는 7B/8B가 약 4.5~5.5GB, 14B가 약 9GB, 32B가 약 19~20GB, 70B가 40GB 이상을 차지합니다. 가중치 외에도 컨텍스트, KV 캐시, 시스템용 여유가 필요해서 여유가 적으면 메모리 부족이나 잦은 속도 저하가 생깁니다.

왜 연산 성능보다 VRAM이 먼저 막히는가

실행 중 VRAM을 쓰는 것은 가중치만이 아닙니다. 대화가 길어지고 컨텍스트가 커질수록 KV 캐시가 늘어납니다. 모델 파일은 분명 들어가는데 몇 차례 대화하면 오류가 나거나, 컨텍스트를 너무 줄여 앞 내용을 잊기 시작하는 경우가 그 예입니다. 연산이 부족한 것이 아니라 가중치와 캐시가 함께 VRAM을 채운 것입니다.

그래서 '가중치 크기 = VRAM'으로 카드를 고르면 안 됩니다. 14B는 가중치 9GB에 VRAM 16GB라야 숨통이 트이고, 32B는 가중치 19~20GB에 24GB가 합리적이며 16GB는 간신히 시도하는 수준입니다. RTX 5080처럼 연산은 강한데 VRAM이 16GB뿐인 카드가 자주 지적받는 이유도 여기에 있습니다. 속도가 아니라 용량이 먼저 한계에 닿습니다.

주요 모델로 보면 RTX 5060 Ti에는 16GB 버전이 있고, RTX 5070은 12GB, RTX 5070 Ti와 RTX 5080은 16GB, RTX 5090은 32GB, RTX 4090과 RTX 3090은 24GB입니다. 중고 RTX 3090이 가성비 틈새로 꼽히는 것은 그 24GB 때문이지만, 가격은 시세에 따라 달라지므로 상태와 소비전력을 확인해야 합니다.

세 부류의 구매법

맛보기로 써 보는 사람

지금 카드가 8GB나 12GB라면 서둘러 바꿀 필요 없습니다. Q4 양자화 7B/8B 모델로 로컬 채팅과 짧은 글쓰기는 충분히 체험할 수 있습니다. 쉬운 시작법으로 LM Studio: 대형 모델을 데스크톱 앱에 넣다, 다운로드해 바로 대화하는 간편함과 메모리·양자화·선택의 세 가지 대가 를 참고해 먼저 흐름을 돌려 본 뒤, 더 큰 모델에 돈을 쓸지 정하세요.

로컬 배포를 진지하게 하는 사람

목표는 14B~32B로 두면 16GB가 현재의 스위트 스폿이고 24GB가 더 안정적입니다. 일상적인 코딩, 문서 처리, 데이터를 내 기기에 두는 용도라면 14B로 대부분 해결되며 가장 큰 모델로 한 번에 뛸 필요가 없습니다. 긴 문서와 긴 컨텍스트를 자주 다룬다면 처음부터 24GB로 가서 파라미터를 반복 조정하는 수고를 줄이세요.

대형 모델을 만져 보는 사람

70B를 노린다면 비용 상승을 받아들여야 합니다. 소비자용 카드 한 장으로는 VRAM이 부족해 듀얼 카드나 통합 메모리가 큰 플랫폼을 고려해야 합니다. 40 시리즈와 50 시리즈 소비자용 카드에는 NVLink가 없어 멀티 카드 확장성과 소프트웨어 지원에 한계가 있으니, 두 장을 사면 단순히 두 배가 될 것이라 생각하지 말고 사용하는 추론 프레임워크의 멀티 카드 지원부터 확인하세요.

돈값을 못 하는 경우와 대안

채팅만을 위해 RTX 5090을 사는 것은 전형적인 낭비입니다. 32GB VRAM도 강한 연산도 다 쓰지 못하는데 냉각과 전원 비용은 따라옵니다. 반대로 나중에 대형 모델을 돌리겠다며 8GB 새 카드를 억지로 사는 것도 가성비가 나쁩니다. VRAM 부족은 설정으로 메울 수 없습니다.

대안은 두 가지입니다. 하나는 Apple Mac의 통합 메모리로, 64GB·128GB 모델은 더 큰 모델을 담을 수 있어 이미 Mac 생태계에 있는 사람에게 맞지만, 속도, 양자화 형식, 도구 생태계가 N카드와 달라 그래픽카드 경험을 그대로 적용할 수 없습니다. 다른 하나는 클라우드 API로, 가끔 쓰면서 품질을 중시하는 사람에게는 대용량 VRAM 카드를 사는 것보다 저렴한 경우가 많습니다. 로컬 배포의 가치는 프라이버시, 오프라인 사용, 호출량이 많을 때의 비용 통제에 있으며, 이 세 가지에 해당하지 않는다면 카드 구매를 서두를 필요가 없습니다.

추천 도구

더보기