무료 로컬 AI로 블로그 글 180회 실측 — 숫자는 지켰고, 분량과 말투는 어겼습니다
「코딩 없이 웹 자동화」 도입부를 부탁한 응답의 마지막 문단입니다.
저 역시 ‘코딩 없이 웹 자동화’ 기술을 통해 업무 효율성을 높이는 데 큰 도움을 받고 있으며, 여러분도 ‘클릭반복’을 통해 시간과 노력을 절약하고 원하는 목표를 달성할 수 있을 거라고 확신합니다.
요청에 넣은 글감 메모에는 이 서비스를 사용한 경험이 한 줄도 없습니다. 반복 클릭 녹화, 윈도우 전용, 무료 10단계, 연 59,000원, 실행 예약. 그게 전부였고, 프롬프트 첫 줄은 「아래 글감 메모만 사용해」였습니다. 이 문단을 그대로 블로그에 올리면 글쓴이가 해 보지 않은 경험을 해 본 것처럼 적는 셈이 됩니다.
다른 응답은 방향이 반대였습니다.
이러한 문제점을 해결하기 위해, 저희가 준비했습니다.
회의록 요약 앱 도입부입니다. 블로그 글을 부탁했는데 서비스를 만든 회사처럼 말합니다.
무료 로컬 AI에 블로그 글 조각을 맡기려 한다면, 어디까지 맡기고 발행 전에 무엇을 손으로 고칠지부터 정해야 합니다. 이번 테스트에서 gemma3:4b는 메모에 적힌 숫자를 벗어나지 않았습니다. 180회 가운데 메모 밖 숫자가 나온 회차는 한 번도 없었습니다. 어긴 쪽은 분량과 말투입니다. 도입부 60편 가운데 요청한 글자 수 안에 든 것은 없었고, 19편에는 「저희」나 「저 역시」 같은 1인칭 표현이 들어갔습니다.
1인칭 19편을 하나씩 읽었습니다
1인칭 표현은 채점기가 표면 표지로만 찾습니다. 「저희」, 「저 역시」, 「제가」 같은 말이 들어갔는지까지만 봅니다. 그래서 걸린 19편을 원문으로 다시 읽고 나눴습니다.
- 16편은 업체 말투였습니다. 「저희가 준비했습니다」, 「저희 자막뚝딱은」처럼 서비스를 만든 쪽의 목소리로 소개합니다.
- 2편은 경험을 지어냈습니다. 맨 위의 「저 역시 … 큰 도움을 받고 있으며」, 그리고 맞춤법 검사 도입부의 「저 역시 종종 그런 순간들을 경험하며 답답함을 느꼈습니다」입니다.
- 1편은 불분명했습니다. 「저희가 소개하고자 하는 서비스」는 소개하는 사람의 「저희」로도 읽힙니다.
두 조건의 차이는 거의 없었습니다. 기본 지시에서 9편, 숫자 금지 한 줄을 더한 지시에서 10편입니다. 이번 프롬프트에는 화자를 정하는 조건이 없었습니다. 누구의 목소리로 쓰라는 말이 없을 때 이 모델은 셋 중 한 번꼴로 업체나 체험자의 자리에 섰습니다.
블로그에 싣는다면 업체 말투는 광고 문안처럼 읽히고, 지어낸 경험은 글쓴이가 하지 않은 일을 한 것처럼 만듭니다. 둘 다 발행 전에 지워야 하는 문장입니다.
메모에 없는 숫자는 한 번도 나오지 않았습니다
글감 메모는 가상의 서비스 10개에 대해 다섯 줄씩 적었습니다. 줄마다 월 8,900원, 하루 5장, 최대 60분 같은 숫자를 섞었습니다. 채점기는 출력에 나온 아라비아 숫자를 모두 뽑아 메모의 숫자와 대조합니다. 조건에 적힌 글자 수와 메모의 항목 수는 허용했습니다.
결과는 두 조건 모두 0이었습니다. 한 조건에는 「메모에 없는 숫자(가격·기간·개수·통계·날짜)는 쓰지 않습니다」를 한 줄 더 넣었는데, 이번 기록에서는 그 한 줄이 막을 일이 생기지 않았습니다. 가격과 한도가 메모에 적혀 있으면 모델은 그 숫자를 가져다 썼습니다.
이 칸이 세는 것은 아라비아 숫자뿐입니다. 「세 가지」처럼 말로 쓴 수와 숫자가 아닌 지어낸 사실은 여기에 잡히지 않습니다. 위의 「저 역시 … 도움을 받고 있으며」가 바로 숫자 밖에서 지어낸 사실입니다.
분량은 60편 모두 넘었습니다
도입부 조건은 공백 포함 250~350자였습니다. 60편 모두 350자를 넘었습니다. 가장 짧은 도입부가 378자, 중앙값은 512.5자였습니다. 맨 위의 「코딩 없이 웹 자동화」 도입부는 616자로 가장 길었습니다.
검색 설명문도 비슷했습니다. 조건은 80~150자였고, 60편 가운데 58편이 150자를 넘었습니다. 중앙값은 187자입니다. 검색 결과 화면에 설명문이 얼마나 보일지는 검색엔진이 정하지만, 150자로 정해 둔 자리에 187자를 넣으면 뒤쪽이 잘릴 가능성을 안고 가는 셈입니다.
글자 수 지시가 목표 길이에 따라 어떻게 빗나가는지는 「300자로 써줘」가 통하는지 잰 기록에 따로 정리했습니다. 이번에는 다른 조건 네댓 개와 함께 준 글자 수였고, 결과는 한쪽으로만 넘쳤습니다.
제목은 형식을 지키고 키워드를 흘렸습니다
제목 후보는 60세트 모두 요청대로 다섯 줄이었고, 번호나 기호를 붙인 세트는 없었습니다. 형식 지시는 잘 따른 편입니다.
키워드가 문제였습니다. 조건은 「모든 제목에 키워드를 넣는다」였는데, 다섯 줄 모두에 키워드가 들어간 세트는 60개 중 32개였습니다. 「코딩 없이 웹 자동화」 세트 하나를 보면 이렇습니다.
클릭반복: 코딩 없이 웹 자동화 시작하기
웹사이트 자동화, 클릭반복으로 간편하게
코딩 없이 웹 자동화 - 클릭반복 사용법
간단한 웹 자동화? 클릭반복으로 해결!
클릭반복: 코딩 없이 웹 자동화 솔루션
둘째와 넷째 줄은 「웹 자동화」만 남기고 앞말을 뺐습니다. 뜻은 통합니다. 검색어를 그대로 제목에 넣어야 하는 자리라면 고쳐야 하는 줄입니다. 채점은 글자 그대로 일치할 때만 키워드가 있다고 봤고, 띄어쓰기만 다른 경우도 빠진 것으로 셌습니다.
이렇게 돌렸습니다
이번 테스트는 2026년 9월, RTX 4070 Ti SUPER가 있는 Linux PC의 Ollama 0.32.1에서 gemma3:4b(Q4_K_M)로 돌렸습니다.
- 글감 메모 10개는 모두 가상의 서비스입니다. 실제 제품 정보가 아닙니다.
- 과업은 셋입니다. 도입부(250~350자, 존댓말, 질문으로 마무리), 제목 후보 5개(줄마다 30자 이내, 번호 없이), 검색 설명문(한 문단, 80~150자). 셋 다 키워드를 넣고 과장하지 말라는 조건을 붙였습니다.
- 조건은 둘입니다. 기본 지시, 그리고 기본 지시에 메모 밖 숫자를 쓰지 말라는 한 줄을 더한 지시.
- 메모 10개 × 과업 3종 × 조건 2종을 세 번씩, 모두 180회 실행했습니다. 파일럿 12회로 진행 판정을 받은 뒤 나머지 168회를 이어 돌렸습니다.
- 온도와 seed는 요청에 넣지 않았습니다. 모델에 저장된 기본 설정(temperature 1)을 그대로 썼습니다.
채점은 writing_score.py가 합니다. 키워드, 존댓말(「…니다」가 아닌 「…다」로 끝나는 문장이 있는지), 글자 수, 마지막 문장의 물음표, 제목 줄 수와 번호, 설명문 문단 수, 메모 밖 숫자를 봅니다. 과장 표현은 단어 목록으로 따로 세기만 하고 통과·실패에는 넣지 않았습니다. 파일럿에서 목록이 「완벽하게 만들기가 쉽지 않으신」 같은 과장이 아닌 문장을 잡았기 때문입니다. 같은 파일럿에서 굵게 표시(**) 기호까지 글자 수에 세던 것도 고쳤습니다. 수정 전 채점기로 찍은 첫 파일럿은 버리고, 새 실행 폴더에서 파일럿부터 다시 돌렸습니다.
| 과업별 전체 통과 | 기본 지시 | 숫자 금지 한 줄 추가 |
|---|---|---|
| 도입부 | 0/30 | 0/30 |
| 제목 후보 5개 | 11/30 | 16/30 |
| 검색 설명문 | 1/30 | 1/30 |
| 메모 밖 숫자가 나온 회차 | 0/90 | 0/90 |
두 조건의 차이는 모두 제목 후보에서 나왔고, 그 차이는 숫자가 아니라 키워드와 글자 수 쪽이었습니다. 그래서 이 표를 숫자 금지 한 줄의 효과로 읽지 않습니다. 기록상 인프라 오류는 0건이었고, 응답 하나에 걸린 시간은 중앙값 1.34초였습니다. 180회 전체가 308.6초였습니다.
존댓말은 도입부와 설명문 전부에서 지켜졌습니다. 질문으로 끝나지 않은 도입부는 두 편이었습니다.
맡길 곳과 손으로 볼 곳
저는 이 모델에 제목 후보 뽑기와 도입부 초벌까지는 맡기겠습니다. 메모에 숫자를 적어 넘기면 이번 기록에서는 그 숫자가 그대로 쓰였고, 한 번에 1초 남짓이면 결과가 나옵니다.
다만 발행 전에 이 네 가지는 손으로 봅니다.
- 「저희」, 「저 역시」, 「제가」를 검색합니다. 업체 말투와 지어낸 경험이 이 단어 근처에 있었습니다. 찾으면 문장째 지우거나 내 관점으로 다시 씁니다.
- 글자 수를 셉니다. 도입부는 3분의 1가량 덜어낼 각오를 하고, 설명문은 150자 안으로 줄입니다.
- 제목마다 키워드가 그대로 있는지 봅니다. 다섯 줄 중 한두 줄은 빠진다고 보고 고릅니다.
- 메모에 숫자와 사실을 적어서 넘깁니다. 이번에 숫자가 메모 밖으로 나가지 않은 것은 가격·한도가 메모에 적혀 있을 때의 결과입니다.
더 큰 모델이 필요한지 가늠하려면 그래픽카드 메모리별로 몇 B 모델까지 도는지 잰 기록을 이어서 보시면 됩니다.
맨 위의 「저 역시 … 큰 도움을 받고 있으며」는 616자짜리 도입부 끝에 붙어 있었습니다. 글자 수를 줄이다가 그 문단을 통째로 지우게 될 수도 있습니다. 그렇게 지워지기를 기다리기보다, 1인칭 문장부터 찾아 지우고 나서 분량을 맞추는 순서가 이번 기록에 맞는 검수 순서입니다.
재현과 원자료
실행 파일은 run_writing_bench.py입니다. 글감 메모·조건은 writing_bench_cases.json, 채점기는 writing_score.py에 있습니다. --mode pilot으로 파일럿을 돌리고, 같은 실행 폴더에서 --mode full로 이어갑니다.
이번 기록의 기준 파일은 test_runs/ollama-gemma3-4b-writing-20260923b/run.yaml입니다. 조건별·과업별 집계는 같은 폴더의 aggregate.json, 회차별 판정은 results.csv, 요청과 응답 원문은 raw/, 1인칭 19편을 읽고 나눈 기록은 first_person_audit.json에 있습니다. 이 경로들은 비공개 작업 폴더라 외부에서 열 수 없습니다. 본문에는 이번 실행 중에 찍힌 터미널 화면 캡처 두 장을 실었습니다.
재현: cinevyze-bench의 run_writing_bench.py·writing_score.py·writing_bench_cases.json(글감 메모 10개 포함). 위 test_runs/… 실행 기록은 공개하지 않습니다.
이번 결과는 gemma3:4b Q4_K_M 한 모델, 가상 서비스 메모 10개, 과업 세 가지를 놓고 얻었습니다. 메모 없이 쓰게 하거나, 화자를 지정하거나, 더 큰 모델을 쓰면 결과가 달라질 수 있어 다시 재야 합니다.
글감 메모 10개로 만든 180회는 로컬 gemma3:4b로 실행했습니다. 하네스와 이 글을 쓰는 데에도 AI 도구를 활용했고, 조건 승인과 발행 전 검수는 제가 합니다.
시네 · cinevyze 운영자 — AI 도구의 응답을 원출력과 검사 기준으로 대조합니다. 이번 측정은 RTX 4070 Ti SUPER가 있는 Linux 환경에서 Ollama 0.32.1, gemma3:4b Q4_K_M으로 진행했습니다. 측정 시점은 2026년 9월입니다. 운영자 소개
댓글
댓글 쓰기