무료 로컬 AI, 내 그래픽카드론 몇 B까지 돌까 — qwen2.5 0.5B~14B VRAM·속도·GPU 등급 실측 (2026)
"내 그래픽카드로 무료 로컬 AI, 대체 몇 B짜리까지 돌아가는 거야?" 구독료 안 내고 AI를 집에서 굴리려는 1인 기업가라면 여기서 막힙니다. 모델 이름 뒤에 붙은 0.5B·7B·32B가 뭔 뜻인지, 내 카드엔 뭘 올려야 하는지, 큰 걸 받았다가 컴퓨터가 멎지는 않을지 — 정보가 죄다 "카더라"뿐이거든요. 그래서 시네가 한 카드에 크기별로 줄줄이 올려 굴려봤습니다.
방식은 단순하게 잡았어요. 같은 계열(qwen2.5) 하나를 0.5B → 1.5B → 3B → 7B → 14B까지 크기만 바꿔 가며, VRAM을 얼마나 먹는지·초당 몇 토큰을 뽑는지·추론은 어디서부터 믿을 만한지를 쟀습니다. 같은 계열로 통일해야 "크기 때문에 갈린 차이"만 깔끔히 보이니까요. 측정 환경은 그래픽카드 RTX 4070 Ti Super(VRAM 16GB) 한 장에 qwen2.5(0.5B~14B) 모델을 Q4 양자화로 ollama 로컬 구동했습니다.
먼저 한 가지 못 박고 갑니다. 32B는 일부러 안 돌렸습니다. 32B는 VRAM만 20GB쯤 먹어 16GB 카드엔 안 들어가고, 억지로 올리면 부족한 만큼 CPU·메모리로 흘러넘쳐 시스템이 멎을 수 있거든요. 그래서 32B는 "왜 이 카드론 못 도는가"만 정직하게 다룹니다(지어낸 32B 숫자는 없습니다).
결과 ① 크기 → VRAM → 어느 GPU에 들어가나
가장 궁금한 것부터. 크기별로 카드에 얼마나 자리를 차지했는지, 그게 곧 "내 카드에 뭐가 들어가나"입니다.
| 크기 | 실측 VRAM | 프로세서 | 이 정도면 필요한 GPU | 예시 카드 |
|---|---|---|---|---|
| 0.5B | 0.8GB | 100% GPU | 2~4GB · 사실상 뭐든 | 내장그래픽·GTX 1650 |
| 1.5B | 1.4GB | 100% GPU | 4GB | GTX 1650, 노트북 GPU |
| 3B | 2.4GB | 100% GPU | 4GB | GTX 1650급 |
| 7B | 4.9GB | 100% GPU | 6~8GB | RTX 3060·4060·5060 (8GB) |
| 14B | 9.7GB | 100% GPU | 12GB | RTX 4070·5070 (12GB) · 5060 Ti·5070 Ti·5080 (16GB) |
| 32B | 약 20GB(추정·미실행) | — | 24GB↑ | RTX 3090·4090 (24GB) · 5090 (32GB) |
핵심은 이렇습니다.
- 7B까지는 문턱이 낮습니다. 7B가 5GB 남짓이라, 요즘 흔한 8GB 카드(RTX 3060·4060·5060)면 충분히 GPU에 통째로 올라갑니다(표의 '100% GPU' = CPU로 안 흘러넘치고 전부 그래픽카드에서 돎).
- 14B가 소비자용 카드의 실질 상한선입니다. 우리 16GB 카드에 9.7GB로 여유 있게 들어갔고, 12GB 카드(RTX 4070·5070)에도 올라갑니다. 여기까지가 "적당한 게이밍 PC로 되는" 구간이에요.
- 32B부터는 이야기가 달라집니다. 20GB쯤 필요해서 16GB 카드엔 안 들어가고, 24GB 이상 카드(RTX 3090·4090, 50 시리즈는 24GB를 건너뛰고 32GB인 RTX 5090) 영역입니다. 우리 카드로는 못 돌려 이번 실측에서 뺐습니다.
한 가지 주의. 이 VRAM은 짧은 프롬프트 기준입니다. 긴 문서(수천 토큰)를 물리면 문맥을 기억하는 KV 캐시로 VRAM이 더 붙어, 실제로는 표보다 한 등급 위 카드가 편할 수 있습니다. (표의 RTX 4070·5070은 12GB 모델 기준이에요.)
결과 ② 클수록 똑똑해질진 몰라도, 확실히 느려진다
공짜라고 크기만 키우면 될 것 같죠. 속도라는 대가가 따라옵니다.
| 크기 | 생성 속도 | 체감 |
|---|---|---|
| 0.5B | 723 토큰/초 | 눈 깜짝할 새 |
| 1.5B | 415 토큰/초 | 아주 빠름 |
| 3B | 244 토큰/초 | 빠름 |
| 7B | 127 토큰/초 | 읽는 속도보다 빠름 |
| 14B | 66 토큰/초 | 또박또박 나오는 게 보임 |
0.5B에서 14B로 가면 VRAM은 약 12배 늘고 속도는 11배 느려집니다. 같은 카드인데도요. 14B의 66토큰/초도 혼자 쓰기엔 충분히 빠르지만, 자동화 파이프라인에 수십 번 물리거나 여러 요청을 굴린다면 이 차이가 쌓입니다. "무조건 큰 모델"이 답이 아닌 이유예요.
결과 ③ 그래서 몇 B부터 '쓸 만'한가 — 추론 계단
속도·VRAM은 크기에 깔끔히 비례하지만, 정작 중요한 건 "이 크기가 실제로 똑똑하냐"죠. 정답이 명확한 문제 두 개를 각 크기에 똑같이 물어봤습니다.
- 비율 함정: "기계 5대가 부품 5개를 5분에 만든다. 100대가 100개를 만들면 몇 분?" (정답 5분 — 흔히 100분이라 답하는 함정)
- 다단계 계산: "어떤 수에 3을 곱하고 7을 더하니 34. 그 수에서 2를 뺀 값은?" (정답 7 — 두 단계를 거쳐야 함)
| 크기 | 비율 함정(정답 5) | 다단계 계산(정답 7) |
|---|---|---|
| 0.5B | ✗ | ✗ |
| 1.5B | ✗ | ✗ |
| 3B | ✗ | ✓ |
| 7B | ✓ | ✓ |
| 14B | ✓ | ✓ |
계단이 보입니다.
- 1.5B 이하는 둘 다 틀렸습니다. 이 크기대는 요약·분류·간단 변환처럼 '생각이 별로 안 필요한' 일에나 쓰고, 계산·추론을 맡기면 안 됩니다.
- 다단계 계산은 3B부터 붙기 시작했습니다.
- 함정 문제는 7B는 돼야 넘었습니다. 3B는 여기서 무너졌어요(작은 모델일수록 '그럴듯한 함정'에 잘 넘어갑니다).
즉 로컬로 추론까지 믿고 맡기려면 최소 7B, 안전하게는 14B가 기준입니다. 반대로 단순 작업이면 3B로도 충분하고 속도는 두 배로 빠르고요.
한 가지 정직하게. 이 추론 채점은 문항당 한 번씩(n=1) 잰 값입니다. AI는 같은 질문에도 실행마다 답이 흔들려서, 이 표는 '정확한 합격선'이 아니라 '작을수록 불안정하고, 커질수록 안정된다'는 경향으로 읽어주세요.
그래서 내 상황엔 몇 B, 어떤 카드
용도별로 잘라 봅니다.
- 8GB 카드(RTX 3060·4060·5060 등)를 이미 갖고 있다 → 7B가 스윗스폿. VRAM 5GB로 여유 있게 올라가고, 함정 추론까지 넘기며, 127토큰/초로 빠릅니다. 로컬 AI 입문에 가장 무난한 조합이에요.
- 12~16GB 카드가 있다 → 14B까지. 품질을 조금 더 쥐어짜고 싶을 때. 대신 66토큰/초로 느려지는 건 감수.
- 카드가 약하거나 노트북·내장그래픽이다 → 3B 이하. 요약·번역·분류 같은 단순 작업 전용으로. 추론은 기대하지 말 것.
- 32B 이상을 꼭 돌리고 싶다 → 24GB 이상 카드(RTX 3090·4090, 50 시리즈는 32GB인 RTX 5090)가 사실상 필수. 16GB로 억지로 올리면 시스템이 멎을 위험이 있어 권하지 않습니다.
굳이 하나만 고르라면, 저라면 오늘 로컬 AI를 시작하는 사람에게 8GB 카드 + 7B 조합을 권합니다. 돈은 제일 덜 쓰면서 함정 추론까지 넘고 속도도 빠른 — 가성비의 무게중심이 딱 거기 있거든요. 여윳돈이 있으면 중고 12GB 카드로 14B까지 열어두는 정도.
이 숫자, 이렇게 읽어주세요
- Q4 양자화·짧은 프롬프트 기준입니다. 양자화를 덜 하거나(FP16 등) 긴 문맥을 쓰면 VRAM은 눈에 띄게 더 붙습니다.
- 속도는 우리 카드(RTX 4070 Ti Super·16GB) 기준이라, 다른 카드에선 절대값이 달라집니다. 크기별 '비율'(클수록 느림)만 가져가세요.
- GPU 등급 매핑은 여유분을 감안한 가이드지 칼같은 최소치가 아닙니다. 같은 8GB라도 화면 출력·백그라운드에 VRAM을 나눠 쓰면 빠듯해질 수 있어요.
- 측정 시점은 2026년 7월. 모델·런타임은 갱신되니 시점 기준으로.
무료 로컬 AI의 지도는 결국 단순합니다. 가벼운 잡무는 3B(4GB 카드), 제대로 쓰려면 7B(8GB 카드), 품질 욕심은 14B(12~16GB 카드), 32B는 24GB 이상(RTX 5090은 32GB)의 세계. 내 카드가 어디쯤인지 알면, 살 모델도 살 카드도 헷갈릴 일이 없습니다.
이 글은 cinevyze 운영자가 각 크기 모델을 직접 로컬 카드에서 돌려 VRAM·속도·추론을 측정하고 결과를 정리·검수·편집했습니다. 무엇을 어떻게 테스트할지·판단·검증은 모두 사람이 했고, 글 다듬는 일부 과정에 AI 도구의 도움을 받았습니다.
참고자료
- qwen2.5 모델 계열(크기별) — ollama.com/library/qwen2.5
- 테스트 방법론 — cinevyze 표준 테스트셋(요약
TXT-01) + 크기별 VRAM(ollama ps실측)·생성 속도(토큰/초)·추론 2문항 - GPU VRAM 용량은 각 카드 제조사 공식 사양 기준(RTX 50 시리즈 포함 — nvidia.com/en-us/geforce/graphics-cards/50-series)
댓글
댓글 쓰기