측정방법
cinevyze의 글 상당수는 "이 AI가 이걸 얼마나 하나"를 직접 돌려서 잰 기록입니다. 숫자를 어디서 어떻게 얻었는지 밝히지 않으면 믿을 이유가 없으니, 여기에 절차를 공개합니다.
무엇으로 재나
측정은 제 PC 한 대에서 돌립니다. 클라우드 대여나 대행이 아닙니다.
| 항목 | 값 |
|---|---|
| GPU | NVIDIA GeForce RTX 4070 Ti SUPER (16GB) · 드라이버 595.84 |
| CPU | AMD Ryzen 5 5600X (6코어 12스레드) |
| 메모리 | 30GB |
| OS | Ubuntu 26.04 LTS |
| 로컬 모델 구동 | ollama 0.32.1 |
"CPU만으로" 라고 쓴 글은 실제로 GPU를 쓰지 않은 실행입니다.
언제부터, 몇 번이나
2026년 6월 21일부터 2026년 9월 14일 기준 55건의 측정 기록이 남아 있습니다. 글 한 편이 보통 런 한 개 이상에 대응하고, 파일럿(소규모 예비 실행)이 따로 붙는 경우도 있습니다. 아래 수치는 모두 이 날짜 기준이며, 측정이 쌓이면 갱신합니다.
사용한 도구별 런 수:
| 도구 | 런 |
|---|---|
| ollama (로컬 LLM) | 40 |
| Whisper (음성 인식) | 5 |
| Gemini API | 4 |
| ComfyUI (이미지 생성) | 2 |
| Tesseract (OCR) | 2 |
| rembg (배경 제거) | 1 |
| 이미지 업스케일 | 1 |
주로 돌린 모델: gemma3:4b(25) · qwen3-vl:8b(9) · Gemini 3.1 Pro (High)(4) · animagine · qwen2.5-coder:7b · qwen2.5:7b 외 14종
어떻게 재나
1. 축을 먼저 정하고, 그 축만 바꿉니다. 런마다 run.yaml 에 "무엇을 비교하는가"(axis)와 비교군(arms)을 먼저 적고 시작합니다. 예를 들어 자가채점 측정의 축은 채점 방식 3종 × 답을 쓴 주체 2종 이었고, 비교군은 정답 비공개 / 먼저 풀고 비교 / 정답 공개 였습니다.
2. 채점은 사람 인상이 아니라 정답키 대조입니다. 정답이 하나로 정해지는 문항만 씁니다. 맞고 틀림은 정답키와 문자열·값 대조로 결정합니다. 모델이 모델을 채점하는 실험에서도, "누가 맞았나"의 최종 판정은 정답키가 합니다.
3. 실행 조건을 고정합니다.
keep_alive: 0— 모델을 VRAM에 물고 있지 않습니다. 매 호출이 같은 조건에서 시작합니다.request_parallelism: 1— 병렬로 던지지 않습니다. 순서가 결과에 섞이지 않게 합니다.
4. 실패한 응답도 셉니다. 파싱 실패(unparsed), 빈 답(blank_answer), 인프라 오류(infra_errors)를 집계에 별도 항목으로 남깁니다. 성공한 응답만 골라 비율을 계산하지 않습니다.
5. 원본 호출 기록을 남깁니다. 런 디렉터리마다 이렇게 남습니다.
run.yaml 방법·축·비교군 정의, 실행 조건
raw/ 호출 하나하나의 원본 요청·응답
results.json/.csv 문항별 결과
aggregate.json 집계 (실패 항목 포함)
model_metadata/ 그때 그 모델의 버전·수정일·파라미터
글에 실리는 "실행 결과" 이미지는 화면 사진이 아닙니다
일부 글 하단에 검은 배경의 터미널처럼 생긴 이미지가 있습니다. 이건 화면을 촬영한 스크린샷이 아니라, 실행 기록이 담긴 폴더에 명령을 걸어 나온 출력을 그대로 이미지로 렌더한 것입니다. 사이트 차원에서 미리 밝혀둡니다.
- 만드는 방법 —
ls -l --time-style=long-iso <런 폴더>,cat run.yaml같은 고정된 명령을 실행해 나온 표준 출력을 글자 그대로 렌더합니다. 사람이 손으로 고쳐 쓰지 않습니다. - 이미지 하단에 렌더 시점을 적습니다. 화면에 보이는 파일 시각(mtime)은 그 파일이 만들어진 때이고, 렌더 시점은 그림을 만든 날입니다. 둘은 다릅니다.
- 재연하지 않습니다. 이미 끝난 측정을 다시 돌리며 "실행 중" 장면을 찍는 일은 하지 않습니다. 사후에 찍은 것을 그때인 척하는 게 되니까요.
- 증명 범위 — 이 이미지가 보여주는 건 "현재 그 산출물이 보존돼 있다"까지입니다. 파일 기록 시각은 사후에 바꿀 수 있는 값이라, 이미지 한 장으로 "그 날짜에 실제로 돌렸다"가 증명되지는 않습니다. 그렇게 주장하지 않습니다.
- 출력이 길면 앞부분만 싣고, 그 사실을 이미지 안에 적습니다(예: "표시용 절단 — 전체 324줄 중 앞부분만"). 긴 줄을 접은 경우도 마찬가지로 밝힙니다.
- 앞으로 새로 측정하는 글에는 실제로 도는 동안 찍은 화면이 들어갈 수 있습니다. 그건 촬영본이라 "화면"이라고 부르고, 위의 렌더 이미지와 표기를 섞지 않습니다.
이 측정이 말하지 않는 것
- 표본이 작습니다. 대부분 수십~수백 회 규모입니다. 업계 벤치마크가 아니라 "내 환경에서 이랬다"입니다.
- 모델은 계속 바뀝니다. 같은 이름의 모델도 몇 달 뒤엔 다른 결과가 나올 수 있습니다. 그래서 런마다 모델 수정일을 함께 남깁니다.
- 로컬 소형 모델이 중심입니다.
gemma3:4b같은 4B~8B급이 많습니다. 대형 클라우드 모델의 성능을 대변하지 않습니다. - 한국어 기준입니다. 영어 환경에서는 다른 값이 나올 수 있습니다.
- 결과가 제 기대와 다르게 나온 경우에도 그대로 씁니다. 채점기 자체가 틀린 걸 발견하면 그것도 본문에 적습니다.
요금·한도를 다루는 글은 다릅니다
요금제·무료 한도를 정리한 글은 측정이 아니라 조사입니다. 성격이 달라서 표기를 나눕니다.
- 이런 글은 공식 요금 페이지·도움말 문서를 확인해 정리한 것이고, 본문에 확인한 날짜를 적습니다.
- 요금과 한도는 자주 바뀝니다. 결제 전에는 반드시 공식 페이지를 직접 보세요.
- 직접 결제해서 확인한 항목과, 문서만 보고 옮긴 항목을 구분해 적습니다.
누가 씁니까
- 운영·측정·최종 검수: 시네
- 글 작성 과정에서 AI 도구를 사용합니다. 초안 구성과 문장 다듬기에 씁니다. 숫자와 사실 판단은 위 절차로 얻은 것이고, 최종 검수는 사람이 합니다.
- 문의: cinevyze@gmail.com
틀린 것을 발견하셨다면
수치나 사실이 틀렸다면 위 메일로 알려주세요. 확인해서 본문을 고치고, 무엇을 언제 왜 고쳤는지 해당 글에 남깁니다.
실행 코드 공개
이 측정을 직접 재현하려면 — 실행 코드와 채점기를 공개해 뒀습니다. cinevyze-bench (GitHub) 의 run_*.py / *_score.py 입니다. 문항 파일도 같이 들어 있어 같은 조건으로 다시 돌려볼 수 있습니다.
이 절차로 잰 글 보기
위 절차를 실제로 적용한 글은 전체 글 목록에 주제별로 정리돼 있습니다.
주제별로 바로 가기: AI 글쓰기·챗봇 · AI 생산성·자동화 · AI 이미지·디자인 · AI 활용가이드
댓글
댓글 쓰기