AI한테 일 시키는 법 — 프롬프트 4칸 공식(같은 모델에 18번 넣어 재봤습니다)

프롬프트를 자세히 쓰면 AI가 지시를 더 잘 따를까요?

저는 막연한 한 줄 지시와 역할·맥락·작업·출력형식으로 나눈 4칸 지시를 같은 모델에 넣어 비교했습니다. 결과는 과업에 따라 갈렸습니다.

이메일과 비교표에서는 네 칸이 정확히 먹혔습니다. 자유롭게 문장을 써야 하는 소개글에서는 글자수와 문단수를 세 번 모두 어겼습니다. 요구를 적어 주는 것과 그 요구가 지켜지는 것은 같은 일이 아니었습니다.

AI에게 프롬프트를 길게 쓸지 고민하는 분이라면, 4칸 공식이 잘 먹히는 작업과 별도 검사가 필요한 조건을 이번 18회 결과로 가를 수 있습니다.

42개 조건에서 과업별 차이가 드러났습니다

제가 사용한 네 칸은 다음과 같습니다.

칸 적는 내용 이번 테스트의 예
역할 어떤 입장에서 답할지 중소 제조업체 영업 담당자
맥락 독자·상황·제약 부품 수급 문제로 납품이 2주 지연됨
작업 무엇을 만들지 사과와 새 납품일을 담은 이메일 작성
출력형식 결과를 어떻게 검사할지 첫 줄 문구, 문단 수, 글자수, 날짜, 존댓말

앞의 세 칸은 모델이 무엇을 써야 하는지 좁힙니다. 마지막 칸은 결과를 받은 사람이 무엇을 확인할지 정합니다.

막연한 지시에는 결과물을 검사할 세부 조건이 거의 없었습니다. 4칸 지시에는 회차를 합쳐 42개의 검사 가능한 조건이 생겼습니다. 저는 두 지시 방식에 서로 다른 채점 기준을 적용했기 때문에 이를 하나의 향상률로 계산하지 않았습니다.

막연한 지시는 요청한 종류의 산출물이 나왔는지만 봤습니다. 소개글이면 소개글 형태의 글, 이메일이면 이메일로 보이는 글, 비교라면 두 개 이상의 도구를 언급한 글이 나오면 통과입니다.

4칸 지시는 지정한 글자수, 문단수, 날짜, 첫 줄, 표 개수와 열 이름까지 하나씩 검사했습니다. 오른쪽 두 칸을 나란히 보시면, 어떤 과업에서 명시 요구가 지켜졌고 어느 과업에서 완전준수가 깨졌는지 확인할 수 있습니다.

지시·과업 검사 결과 완전준수 출력
막연한 지시 전체 최소 형태 9/9 해당 없음
4칸 지시 전체 명시 요구 32/42 6/9
납품 지연 이메일 15/15 3/3
AI 글쓰기 도구 비교표 12/12 3/3
AI 활용 블로그 소개글 5/15 0/3

같은 시험지가 아니었습니다. 막연한 지시의 통과는 결과물의 종류를 확인한 기록이고, 4칸 지시의 점수는 미리 적은 조건을 실제 출력이 지켰는지 확인한 기록입니다.

이메일과 표는 세 번 모두 맞았습니다

2026년 9월 21일, 저는 로컬 Ollama에서 gemma3:4b를 실행했습니다. 과업은 세 종류였습니다.

  • 자영업자 대상 AI 활용 블로그 소개글
  • 거래처에 보내는 납품 지연 이메일
  • AI 글쓰기 도구 비교표

각 과업에 막연한 한 줄 지시와 4칸 지시를 세 번씩 넣었습니다. 호출은 한 번에 하나씩 실행했습니다. 기록된 소요시간은 합계 124.5초, 평균 6.92초였고 인프라 오류는 없었습니다.

이메일에는 첫 줄을 제목: 으로 시작하고, 본문을 3문단 이하와 공백 제외 300자 이하로 쓰며, 2026년 8월 10일을 그대로 넣으라고 했습니다. 문장도 모두 존댓말로 끝내게 했습니다.

첫 회차는 이렇게 시작했습니다.

제목: 납품 지연에 대한 사과 말씀

본문에는 지정한 날짜가 그대로 들어갔고 공백 제외 212자였습니다. 제목 아래 본문도 한 문단으로 처리됐습니다. 다른 두 회차까지 같은 검사표를 통과했습니다.

비교표에는 표 하나만 출력하고 설명 문장을 앞뒤에 붙이지 않으며, 열 이름을 도구 | 장점 | 단점으로 고정하고 데이터 행을 네 개만 쓰라고 했습니다. 세 출력 모두 그 구조로 나왔습니다.

출력 형식을 지정하고 파서로 그대로 읽히는지 따로 잰 기록이 AI 출력 형식 JSON·CSV·마크다운 비교에 있습니다. 이번 결과도 표라는 뼈대를 통째로 지정했을 때 형식 검사가 쉬워진 사례로 읽을 수 있습니다.

제목 접두어, 날짜 문자열, 표 열 이름처럼 출력에서 바로 찾을 수 있는 닫힌 요구는 이번 이메일과 표 출력에서 빠짐이 없었습니다.

소개글은 같은 지시에서 계속 길어졌습니다

소개글에는 다음과 같이 지시했습니다.

[역할] 당신은 소상공인 대상 실용 정보 블로그를 10년 편집한 에디터입니다.
[맥락] 독자는 IT에 익숙하지 않은 자영업자입니다. 전문용어가 나오면 바로 이탈합니다.
[작업] 'AI 도구 활용법' 블로그의 소개글을 쓰세요.
[출력형식] 공백 제외 250자 이상 400자 이하, 3문단 이하, 모든 문장은 존댓말, '자영업자' 포함, 마지막 줄은 한 줄 요약: 으로 시작

첫 출력은 요청에 맞아 보였습니다.

힘내세요, 자영업자님! AI 도구로 가게 운영 더 쉽게요!

필수 단어인 자영업자가 들어갔고 마지막 부분에는 요청한 문구도 있었습니다.

(…) 더 많은 매출과 행복한 고객 경험을 만들어나가시길 응원합니다! 한 줄 요약: AI 도구 활용으로 자영업자님의 가게 운영이 더욱 쉽고 스마트하게 변화할 수 있습니다.

제가 검사기에 넣어 보니 네 조건이 한꺼번에 깨졌습니다. 공백 제외 504자, 문단은 4개였습니다. 한 줄 요약: 도 별도의 마지막 줄이 아니라 앞 문장 뒤에 이어 붙었습니다. 존댓말 종결 검사 역시 통과하지 못했습니다.

F 명시요구 첫 실패 — PRM-01F-r1 · 요구=F01_CHAR_RANGE · 관측=공백 제외 504자

두 번째 소개글은 공백 제외 499자, 세 번째는 512자였습니다. 세 출력 모두 길이와 문단 조건을 놓쳤습니다. 존댓말 종결과 마지막 줄 형식도 각각 두 차례 실패했습니다. 자영업자 포함 조건만 빠짐없이 지켰습니다.

소개글 요구 실패 횟수
공백 제외 250~400자 3/3
3문단 이하 3/3
모든 문장을 존댓말로 끝내기 2/3
마지막 줄을 지정 문구로 시작하기 2/3
자영업자 포함 0/3

요구는 분명했고 모델도 그중 일부를 반영했습니다. 그러나 자유 서술을 이어 가는 동안 분량과 구조가 불어났고 마지막 줄 형식도 놓쳤습니다.

프롬프트에 적힌 조건은 곧바로 보증서가 되지 않았습니다.

막연한 지시도 결과물은 만들었습니다

AI 도구 활용법 블로그 소개글 써줘.라고만 입력해도 모델은 소개글을 냈습니다. 납품 지연 이메일을 요청하면 제목·인사·본문을 갖춘 이메일을 만들었고, AI 글쓰기 도구 비교를 요청하면 여러 도구를 나열했습니다.

즉, 산출물의 종류만 필요하다면 막연한 지시도 작동했습니다.

다만 그 지시에는 무엇이 성공인지 판정할 기준이 없습니다. 소개글이 1,211자인지, 표가 몇 개인지, 이메일에 실제 납품일이 들어갔는지는 원래 요청만으로 합격과 실패를 가를 수 없습니다. 막연한 지시의 점수는 품질 점수가 아니라 빈 답이나 거부 대신 요청한 종류의 결과가 나왔다는 기록입니다.

4칸 지시에서는 소개글과 이메일에 회차당 다섯 조건, 비교표에 네 조건을 뒀습니다. 세 번씩 반복하자 실패를 구체적으로 이름 붙일 수 있었습니다.

“글이 별로다”가 아니라 “400자를 넘겼다.” “형식이 마음에 안 든다”가 아니라 “표 밖에 설명을 붙였다.” “요청을 제대로 안 들었다”가 아니라 “마지막 줄의 시작 문구가 다르다.”

제가 이번 테스트에서 확인한 4칸 공식의 값은 모델을 무조건 더 잘 따르게 만드는 데 있지 않았습니다. 사람과 프로그램이 결과를 검사할 계약을 만드는 데 있었습니다.

두 달 전 원자료에서도 소개글이 막혔습니다

한 번의 실행에서 우연히 소개글만 길어졌을 가능성을 확인하려고, 저는 2026년 7월 26일에 저장한 원출력 18개도 같은 채점기로 다시 계산했습니다.

측정일 막연한 지시 최소 형태 4칸 명시 요구 4칸 완전준수 소개글 완전준수
2026년 7월 26일 재채점 9/9 33/42 6/9 0/3
2026년 9월 21일 9/9 32/42 6/9 0/3

오른쪽 결과를 보면 두 날짜 모두 이메일과 비교표는 완전준수했고 소개글에서만 실패가 반복됐습니다. 소개글의 명시 요구 점수는 7월 6/15, 9월 5/15였습니다.

두 날짜를 나란히 놓고 확인되는 것은 이것입니다. 같은 모델과 같은 세 과업을 두 날짜에 실행했을 때, 실패가 자유 서술형 소개글에 다시 모였습니다.

표 구조처럼 출력의 뼈대를 닫은 과업과, 문장을 쓰면서 글자수·문단수·종결형·마지막 줄을 동시에 맞춰야 하는 과업은 같은 방식으로 다루기 어려웠습니다.

출력형식 칸부터 검사 조건으로 쓰세요

4칸 프롬프트를 만들 때 저는 출력을 받은 뒤 확인할 수 있는 조건부터 출력형식 칸에 적겠습니다.

거래처 이메일이라면 이렇게 쓸 수 있습니다.

[역할]
중소 제조업체 영업 담당자

[맥락]
부품 수급 문제로 납품이 2주 늦어졌다.
새 납품일은 2026년 8월 10일이다.
상대는 3년 거래한 주요 고객사다.

[작업]
지연을 사과하고 새 납품일을 알리는 이메일을 작성한다.

[출력형식]
- 첫 줄은 "제목: "으로 시작
- 본문은 3문단 이하
- 본문은 공백 제외 300자 이하
- "2026년 8월 10일"을 정확히 포함
- 모든 문장은 존댓말로 끝냄

생성이 끝나면 같은 다섯 줄을 검사표로 다시 씁니다.

검사 항목 확인 방법
첫 줄 제목: 으로 시작하는지 확인
문단 빈 줄 기준으로 문단 수 계산
분량 공백을 제거한 뒤 글자수 계산
날짜 지정 문자열이 그대로 있는지 검색
종결 각 문장의 끝을 검사

표를 요청할 때도 같습니다. “보기 좋게 정리”보다 “마크다운 표 하나, 열 세 개, 데이터 행 네 개, 표 밖 문장 없음”처럼 확인 방법이 분명한 문장이 검사하기 쉽습니다.

소개글처럼 자유 서술이 필요한 작업은 한 번 더 끊는 편이 낫습니다. 먼저 초안을 받고 글자수와 문단수를 프로그램으로 센 다음, 어긴 항목만 알려 주며 다시 요청하는 방식입니다. 다만 첫 출력만 믿고 넘겼다면 소개글 세 건의 분량 초과를 모두 놓쳤습니다.

생성 결과를 사람에게 보내기 전에 한 번 더 끊어 검증하는 흐름 자체는 이전 측정들에서도 반복해서 확인한 패턴입니다.

채점기가 본 것

이번 채점기는 형식 이행만 봤습니다.

비교표의 만점은 표 하나, 지정한 열 세 개, 데이터 행 네 개, 표 밖 설명 없음이라는 조건을 지켰다는 뜻입니다.

측정 대상도 gemma3:4b 한 모델뿐입니다. 각 조합은 세 번씩 실행했습니다.

그래도 저는 프롬프트를 쓰는 기준 하나를 정할 수 있었습니다.

산출물의 종류만 필요하면 한 줄 지시로도 시작할 수 있습니다. 결과를 그대로 업무에 넘겨야 한다면 역할·맥락·작업·출력형식을 적고, 특히 네 번째 칸을 검사 가능한 문장으로 써야 합니다. 글자수, 문단수, 날짜, 열 이름처럼 기계로 셀 수 있는 조건은 생성 뒤 실제로 다시 확인해야 합니다.

4칸을 채웠다는 사실이 품질을 보증하지는 않았습니다. 대신 어디서 실패했는지를 정확히 보여 줬습니다.

집계 완료 — V 최소형태 9/9 · F 명시요구 32/42 · F 완전준수 6/9 · infra 0건


프롬프트 네 칸 비교는 로컬 Ollama의 gemma3:4b로 실행했습니다. 하네스와 원고 작성에는 AI 도구의 도움을 받았고, 시험 조건 승인과 발행 전 확인은 제가 합니다.

재현: cinevyze-bench의 run_prompt4_bench.py와 prompt4_bench_cases.json (문항 파일 포함). 본문에서 언급한 test_runs/… 원자료 경로는 비공개 작업 폴더라 외부에서 열 수 없습니다.

cinevyze 운영자 — 로컬 Ollama에서 gemma3:4b를 순차 실행해 프롬프트의 명시 요구 이행을 검사했습니다. 측정 시점은 2026년 9월 21일입니다. 운영자 소개

댓글

이 블로그의 인기 게시물

AI 프롬프트를 영어로 바꿔도 60쌍 중 우열이 갈린 건 9쌍뿐이었습니다

AI가 준 출처 링크 37개를 다시 열었더니, 판정 가능한 35개가 모두 깨졌습니다

AI 답변 재현성 실험: 온도 0에서 답은 고정됐고 오답도 반복됐습니다