무료 로컬 AI, 내 그래픽카드론 몇 B까지 돌까 — qwen2.5 7B는 VRAM 4.75GB, 14B는 9.7GB였습니다
같은 요약 요청을 넣었는데, 7월에 qwen2.5 7B가 내놓은 답은 이렇게 시작했습니다.
커피의 추출 방식은 드립, 에스프레소, 침지식으로 나分け,并用中文总结为以下五句话:
1. 咖啡的萃取方式决定了即使是同一种咖啡豆也能产生完全不同的口感……
한국어 문장이 끝나기도 전에 일본어 한 조각을 지나 중국어 요약으로 넘어갔습니다. 이 출력의 한글은 21자, 한자는 373자입니다. 7월에 같은 입력으로 두 번 돌렸고, 그중 한 번이 이랬습니다.
9월에 같은 모델 파일로 같은 요청을 세 번 다시 넣었을 때는 세 번 모두 한국어로 끝까지 답했습니다. 모델은 GPU 메모리 약 4.75GB를 차지했고, 초당 117토큰쯤을 뽑았습니다.
내 PC 그래픽카드로 무료 로컬 AI를 돌려 보려는 분이라면 몇 B짜리 모델까지 GPU에 올라가는지와, 크기를 키우면 얼마나 느려지는지가 궁금할 겁니다. 이번 9월 재측정과 같은 PC의 7월 기록을 합친 답은 이렇습니다. qwen2.5는 7B가 GPU 메모리 약 4.75~4.9GB, 14B가 9.7GB를 썼습니다. 크기가 두 배가 될 때마다 생성 속도는 대략 절반으로 줄었습니다. 저라면 VRAM 8GB 카드에서는 7B, 12GB 이상에서는 14B를 후보로 두겠습니다. 다만 7B에서도 답이 다른 언어로 새는 경우가 있으니 결과 언어는 한 번 훑어봅니다.
9월: 7B를 같은 요청으로 세 번 돌렸습니다
측정 PC의 그래픽카드는 RTX 4070 Ti SUPER(VRAM 16GB)입니다. 로컬 AI 실행 도구 Ollama로 qwen2.5:7b(Q4_K_M 양자화, 약 4.7GB 파일)를 올리고, 커피 추출 방식에 관한 976자 글을 「핵심 5문장으로 요약해 줘. 원문에 없는 내용은 추가하지 마」라는 요청과 함께 순서대로 세 번 넣었습니다. 7월에 쓴 입력과 바이트까지 같은 글입니다. 측정 시점은 2026년 9월입니다.
| 회차 | 요청 전체 시간 | 생성 시간 | 생성 속도 | GPU 메모리 |
|---|---|---|---|---|
| 1 | 5.245초 | 2.34초 | 117.45토큰/초 | 4.75GB |
| 2 | 1.976초 | 1.79초 | 117.08토큰/초 | 4.75GB |
| 3 | 2.097초 | 1.92초 | 117.49토큰/초 | 4.75GB |
첫 회만 5초가 넘은 것은 모델을 GPU에 처음 올리는 시간이 들어가서입니다. 한 번 올라간 뒤에는 요약 하나에 2초 안팎이었습니다. 세 번 모두 모델 전체가 GPU에 올라갔고(일부를 CPU로 넘기지 않았고), 생성 속도는 117토큰/초 근처에서 거의 흔들리지 않았습니다.
실행이 끝나는 순간 터미널 출력을 마커(측정 스크립트가 중요한 순간에 남기는 한 줄 표시)와 함께 저장해 렌더한 화면입니다. 맨 아래 줄을 보면 모델이 올라가 있는 동안 GPU 전체 사용량이 5,548MiB였습니다. 모델을 내린 뒤에는 738MiB였습니다. 모델 4.75GB 말고도 화면 출력 같은 기본 사용분이 0.7GB 남짓 깔려 있다는 뜻입니다. 내 카드에 모델이 들어갈지 따질 때 이 몫을 빼고 계산해야 합니다.
요약 자체는 가볍게만 봤습니다. 세 번 모두 한국어였고, 5문장을 요청했는데 6문장·6문장·5문장으로 답했습니다. 지시를 문장 수까지 정확히 지킨 것은 세 번 중 한 번입니다.
7월 기록: 0.5B부터 14B까지
9월에는 7B만 다시 쟀습니다. 같은 PC에서 7월에 qwen2.5 다섯 크기를 같은 요약 요청으로 두 번씩 돌린 기록이 있습니다. 맥락 길이는 4,096토큰이었습니다.
| 7월 기록 | GPU 메모리 | 생성 속도 | GPU 적재 |
|---|---|---|---|
| 0.5B | 755MB | 723~752토큰/초 | 100% GPU |
| 1.5B | 1.4GB | 413~415토큰/초 | 100% GPU |
| 3B | 2.4GB | 244~246토큰/초 | 100% GPU |
| 7B | 4.9GB | 127.3토큰/초 | 100% GPU |
| 14B | 9.7GB | 66~67토큰/초 | 100% GPU |
16GB 카드에서는 14B까지 다섯 크기 모두 전부 GPU에 올라갔습니다. 메모리는 크기에 비례해 늘었고, 속도는 크기가 두 배쯤 될 때마다 절반쯤으로 줄었습니다. 14B는 첫 요청에 19.9초가 걸렸는데, 모델을 올리는 시간이 대부분이었고 두 번째 요청은 0.9초였습니다.
이 표를 읽을 때 조심할 점이 두 가지 있습니다. 첫째, 7B 외의 네 크기는 호출별 원기록 없이 이 요약표만 남아 있습니다. 둘째, 같은 7B 모델 파일(ID 845dbda0ea48)이 7월에는 127.3토큰/초, 9월에는 117.45토큰/초로 약 8% 달랐습니다. 메모리 값도 7월 4.9GB, 9월 4.75GB로 달랐습니다. 날짜가 다르면 몇 퍼센트는 움직이는 숫자라, 이 표는 크기끼리의 순서와 자릿수를 보는 용도로 쓰는 게 맞습니다.
내 그래픽카드로 고를 때 저는 이렇게 하겠습니다
- 내 카드 VRAM에서 기본 사용분 약 0.7GB를 뺀 값과 모델 메모리를 비교합니다. 이번 PC에서 모델 없이 738MiB가 쓰이고 있었습니다.
- VRAM 8GB면 7B, 12GB 이상이면 14B를 후보로 둡니다. 7B는 4.75~4.9GB, 14B는 9.7GB를 썼습니다. 9.7GB는 8GB보다 크니 14B는 8GB 카드에 통째로 올라가지 않습니다.
- 속도가 급하면 한 단계 작은 크기부터 써 봅니다. 7월 기록에서 3B는 7B의 두 배 가까운 속도였습니다. 요약·분류처럼 짧은 일은 작은 모델로 먼저 시험해 보고, 답이 부족할 때 키웁니다.
- 첫 요청이 느린 것은 모델을 올리는 시간입니다. 7B는 첫 회 5초대, 이후 2초 안팎이었습니다. 한 번 올린 모델을 계속 쓰면 이 시간은 반복되지 않습니다.
- 답의 언어를 한 번 확인합니다. 7월에 7B가 두 번 중 한 번 중국어로 넘어갔습니다. 9월 세 번에서는 나오지 않았지만, 한국어로만 받아야 하는 작업이라면 출력 언어를 확인하는 단계를 둡니다.
재현과 원자료
9월 측정은 run_gpu_ladder_bench.py가 합니다. Ollama API가 돌려준 생성 토큰 수·생성 시간으로 속도를, 적재 상태 조회(/api/ps)의 GPU 메모리 값으로 메모리를 기록합니다. 이번 기록의 기준 파일은 test_runs/gpu-ladder-qwen2.5-7b-20260924/run.yaml이고, 같은 폴더에 회차별 출력(01-output.txt~03-output.txt), 호출 기록(NN-invocation.log), 결과표(results.csv), 문장 수·언어를 센 값(output_check.json)이 있습니다. 7월 다섯 크기 표는 옛 작업 폴더의 runs/ladder_results.json입니다. 이 경로들은 비공개 작업 폴더라 외부에서 열 수 없습니다. 본문의 집계 화면이 직접 확인할 수 있는 표본입니다.
재현: cinevyze-bench의 run_gpu_ladder_bench.py. 입력 글은 gpu_ladder_cases.json에 있고, 실행 기록은 공개하지 않습니다.
RTX 4070 Ti SUPER 16GB 한 장에서 qwen2.5 Q4_K_M 모델로 잰 값이라, 다른 그래픽카드나 다른 양자화 버전, 더 긴 맥락 길이에서는 메모리와 속도가 달라집니다.
측정은 로컬 PC의 GPU에서 Ollama로 실제로 돌렸습니다. 측정 코드 작성, 출력의 문장 수·언어 집계, 글 작성에 AI 도구를 썼습니다. 발행 전 검수는 제가 합니다.
시네 · cinevyze 운영자 — AI 도구의 출력을 원본과 판정 기준에 대조합니다. 이번 측정은 RTX 4070 Ti SUPER(16GB)가 있는 Linux PC에서 Ollama와 qwen2.5:7b(Q4_K_M)로 했고, 측정 시점은 2026년 9월입니다. 운영자 소개
댓글
댓글 쓰기