21턴을 이어가도 AI는 지시를 놓지 않았습니다. 무너진 건 질문 쪽이었습니다
규칙 세 개를 걸고 21턴을 갔더니, 두 개는 189회 내내 한 번도 안 깨졌습니다.
대화가 길어지면 AI가 형식 지시를 놓는지, 매 턴 규칙을 다시 넣어줘야 하는지 정하려는 분을 위해 이번 9월에 다시 쟀습니다. 로컬에 gemma3:4b를 올리고 대화 세 본을 세 가지 방식으로 굴렸습니다.
건 규칙은 이렇습니다. 답변을 「요약:」으로 시작할 것. 영어 알파벳을 쓰지 말 것. 마지막 줄에 「— 가온다인 안내봇」을 붙일 것. 그러고는 규칙과 아무 상관 없는 질문을 스물한 번 이어서 던졌습니다. 회의실 예약은 며칠 전에 하나요, 파일 이름에 날짜를 어떻게 넣나요, 화분은 창가에 둬도 되나요.
접두도 서명도 한 번을 안 놓쳤습니다. 189회를 통째로.
깨진 건 영어 금지 하나였고, 그것도 여덟 번이었습니다.
세 가지 방식으로 나눠 걸었습니다
규칙을 언제 주느냐를 세 갈래로 갈랐습니다. 대화가 길어질수록 앞의 지시가 흐려진다면, 언제 어떻게 붙들어 두느냐가 갈림길이 되니까요.
- 첫 턴에만 — 1번 질문에 규칙을 붙여 주고 그 뒤로는 질문만 던집니다. 사람들이 실제로 챗봇을 쓰는 방식에 가장 가깝죠.
- 시스템 자리에 고정 — 대화 밖 시스템 메시지에 규칙을 박아 두고 매 턴 같이 보냅니다.
- 매 턴 다시 — 질문 끝에 규칙을 한 줄로 요약해 매번 덧붙입니다. 가장 번거롭고, 토큰도 가장 많이 씁니다.
대화는 세 본을 준비했습니다. 사무실 총무, 문서 정리, 생활 상식. 세 방식 × 세 대화 × 21턴 = 189회입니다. 채점은 프로그램이 합니다. 「요약:」으로 시작하는지, 영문자가 하나라도 있는지, 마지막 줄이 서명으로 끝나는지만 봅니다.
어느 방식이 나은지는 이 회차로 안 갈립니다
| 규칙 유지 방식 | 영어 금지 지킴 | 접두 | 서명 |
|---|---|---|---|
| 첫 턴에만 | 59/63 | 63/63 | 63/63 |
| 시스템 자리에 고정 | 60/63 | 63/63 | 63/63 |
| 매 턴 다시 | 62/63 | 63/63 | 63/63 |
가운데 칸만 세로로 훑으면 「매 턴 넣어주는 게 낫다」로 읽힙니다. 놓친 횟수가 네 번에서 한 번으로 줄어드니까요.
그런데 지난 8월에 같은 모델로 같은 189회를 돌린 기록이 있습니다. 그때는 이탈이 12회였고, 세 방식이 정확히 4회씩으로 똑같았습니다.
두 번 돌려서 한 번은 4·4·4, 한 번은 4·3·1. 방식을 바꿔서 생긴 차이라면 두 번 다 같은 방향으로 벌어져야 하는데, 8월엔 셋이 나란했고 9월엔 순서가 생겼으니 남는 설명은 그저 돌릴 때마다 몇 개가 어디로 떨어지느냐입니다. 세 방식의 차이는 이 회차 수에서 서지 않습니다. 378회를 합쳐 봐도 마찬가지입니다.
대신 다른 축이 두 번 다 같은 자리에서 걸렸습니다.
턴이 깊어져서 깨진 게 아니었습니다
턴 번호로 잘라 보면 이렇습니다.
| 몇 번째 턴 | 영어 금지 지킴 |
|---|---|
| 1턴 | 9/9 |
| 2~5턴 | 33/36 |
| 6~10턴 | 44/45 |
| 11~15턴 | 45/45 |
| 16~21턴 | 50/54 |
가운데 구간이 통째로 깨끗합니다. 그 앞 구간보다도, 그 뒤 구간보다도 낫습니다. 거리가 멀어질수록 규칙이 흐려진다면 나올 수 없는 모양이죠.
프롬프트가 잘려서도 아닙니다. 21턴을 다 쌓아도 프롬프트는 컨텍스트 창의 삼분의 일을 넘지 않았습니다. 규칙 문장이 창 밖으로 밀려난 회차는 0건입니다.
그럼 여덟 번은 어디서 났을까요.
문서 정리 대화에서만 여섯 번
대화별로 세면 선이 또렷해집니다.
| 대화 | 영어 금지 지킴 |
|---|---|
| 사무실 총무 | 62/63 |
| 문서 정리 | 57/63 |
| 생활 상식 | 62/63 |
여덟 번 중 여섯 번이 문서 정리 대화에서 나왔습니다. 8월 기록에서도 이 대화가 열두 번 중 여섯 번으로 가장 나빴습니다.
이 대화에서 던진 질문들을 보면 짐작이 가실 겁니다. 파일 이름에 날짜를 어떻게 넣느냐, 할 일 우선순위를 어떻게 정하느냐, 첨부 파일이 크면 어떻게 보내느냐.
20번째 턴의 질문은 이것이었습니다.
첨부 파일 용량이 크면 어떻게 보내나요?
세 방식이 각각 이렇게 답했습니다.
요약: 첨부 파일 용량이 크다면, 압축(zip) 파일을 만들어 보내는 것이 좋습니다. (…) — 가온다인 안내봇
요약: 첨부 파일 용량이 크다면, 압축(ZIP) 파일을 만들어 보내는 것이 좋습니다. 또한, 클라우드 서비스(Google Drive, Dropbox 등)를 활용하여 (…) — 가온다인 안내봇
요약: 첨부 파일 용량이 크다면, 압축(ZIP 등)을 통해 용량을 줄이는 방법을 사용해야 합니다. 또한, 클라우드 저장소 (Google Drive, Dropbox 등)를 활용하여 (…) — 가온다인 안내봇
세 번 다 「요약:」으로 시작했고 세 번 다 서명으로 끝났습니다. 규칙을 잊은 게 아닙니다. 스무 번째 턴이면 규칙을 준 지 한참 지난 시점인데도 같은 답 안에서 두 규칙은 멀쩡히 살아 있고, 영어를 쓰지 말라는 것 하나만 죽었습니다.
세 번째가 매 턴 다시 방식입니다. 그 턴 메시지에 「영어 알파벳 금지」를 한 줄 더 받고도 ZIP 과 Google Drive 를 썼습니다.
나머지 이탈도 같은 얼굴입니다. docx, Eisenhower Matrix, YYYYMMDD, 그리고 「약 1~2m 정도의 거리」의 m.
한국어로만 쓰라는 지시와, 한국어로 물었지만 답이 영문 이름을 요구하는 질문. 둘이 부딪히면 질문이 이깁니다.
여덟 번째는 채점기의 눈이 잡은 것입니다
여덟 번 중 한 번은 성격이 다릅니다.
요약: 사무실 냉방 온도는 보통 23~26℃ 사이로 맞추는 것이 좋습니다.
모델이 쓴 건 ℃ 한 글자입니다. 영문자를 타이핑한 적이 없죠. 그런데 채점기는 비교하기 전에 문자를 표준형으로 펴는데, 그 과정에서 ℃가 °C 두 글자로 갈라지고 거기 섞여 나온 C 가 걸렸습니다.
채점기 주석에 이미 「다음 테스트셋에서 터질 자리」라고 적혀 있던 경우가 이번에 나온 겁니다. 규칙 문면이 「한글과 숫자만 사용」이었으니 도 기호는 어느 쪽이든 규칙 밖이긴 합니다. 다만 사람이 눈으로 채점했다면 이걸 「영어를 썼다」고 세지는 않았을 겁니다.
채점기는 고치지 않았습니다. 고치면 8월 기록과 같은 자로 잰 게 아니게 되니까요. 대신 여덟 번의 내역을 갈라서 적습니다. 진짜 영문 표기 7회, 기호가 펴져서 잡힌 것 1회.
이 수치가 서 있는 조건
| 축 | 이번 측정의 조건 |
|---|---|
| 모델 | gemma3:4b 한 종(4.3B·Q4_K_M 양자화·로컬 구동) |
| 대화 길이 | 21턴 · 대화 3본 · 방식 3갈래 |
| 건 규칙 | 형식 규칙 3개(접두·영문 금지·말미 서명) — 답의 내용을 제한하는 지시는 여기 없습니다 |
| 컨텍스트 창 | 8,192토큰 고정(최대 사용 2,627토큰) |
| 생성 온도 | 기본값 1 |
| 회차 | 189회 · 하네스 오류 0건 |
| 측정 시점 | 2026년 9월 |
제가 축을 잘못 잡고 있었습니다
이 실험의 기록에는 축이 「경과 턴 × 규칙 유지 방식」으로 적혀 있습니다. 제가 그렇게 짰습니다. 대화가 길어질수록 앞의 지시가 흐려질 테고, 그렇다면 규칙을 언제 다시 넣어 주느냐가 답이 될 거라고 봤으니까요. 문항도 그 전제에 맞춰 규칙과 무관한 질문으로만 채웠습니다.
두 축 다 안 섰습니다. 유지 방식은 8월과 9월이 서로 다른 순서를 냈고, 턴 구간은 가운데가 제일 깨끗했습니다.
정작 두 번 다 같은 자리에서 걸렸습니다. 문서 정리 대화, 그리고 그 안에서도 파일 형식을 묻는 질문들. 제가 「규칙과 무관한 질문」이라고 골라 넣은 것들이 실은 무관하지 않았던 겁니다. 한국어로만 답하라는 규칙과 정면으로 부딪히는 질문을 제 손으로 섞어 놓고, 그게 흐려진 규칙이라고 부를 뻔했습니다.
오늘 하나만 한다면
매 턴 규칙을 다시 붙여 넣는 수고는 접으셔도 됩니다. 이 데이터로는 그게 낫다고 말할 수 없고, 토큰은 확실히 더 씁니다.
대신 쓰실 것은 규칙과 부딪히는 질문이 어디에 있는지 미리 훑어보는 일입니다. 지시를 어디에 두느냐는 이 회차로 갈리지 않았지만, 그 대화에서 나올 답이 애초에 그 지시를 지킬 수 있는 답인지는 여덟 번 중 일곱 번을 설명했습니다. 파일 형식이나 도구 이름을 물을 자리에 「한글만」을 걸어 두면 지키기 어려운 지시를 걸어 둔 겁니다.
빠져나갈 구멍을 지시문에 같이 적어 두는 것도 방법입니다. 다만 무엇을 열어 줄지는 그 대화에서 나올 답을 보고 정하셔야 합니다. 이번에 걸린 일곱 개만 해도 확장자(docx), 고유명사(Eisenhower Matrix), 형식 이름(ZIP), 서식 표기(YYYYMMDD), 단위(m)로 종류가 갈립니다. 「고유명사와 확장자는 원문 그대로」 한 줄로는 뒤의 둘이 안 걸립니다.
길이가 걱정이라면 순서가 반대입니다. 21턴까지는 형식 지시가 살아 있었습니다. 먼저 볼 것은 대화의 길이가 아니라 질문의 내용입니다.
지시 이행을 재는 실험은 이번이 처음이 아닙니다. 앞서 목표 글자수를 지키는지를 쟀고, 자기 답을 스스로 채점하게 하면 믿을 만한지도 따로 봤습니다. 이번은 그중 「대화가 길어져도 지키는가」만 떼어 본 것입니다.
이번 189회는 로컬 gemma3:4b로 실행한 기록이고, 원출력과 채점 원자료는 비공개 작업 폴더에 둡니다. 코드와 원고 작성에 AI 도구를 썼고, 조건을 승인하고 발행 여부를 판단하는 일은 제가 합니다.
재현: cinevyze-bench의 run_multiturn_bench.py (문항 파일 포함). 본문의 원자료 경로(test_runs/…)는 비공개 작업 폴더라 외부에서 열 수 없습니다.
cinevyze 운영자 — 로컬에서 AI 도구를 직접 돌려 재현 가능한 수치로 검증합니다. 이번 측정은 RTX 4070 Ti SUPER 한 장에 gemma3:4b를 올려 189회 실행한 것입니다. 운영자 소개
댓글
댓글 쓰기