로컬 AI 번역에 용어·문체를 함께 걸었더니 3/9가 같은 곳에서 실패했습니다

로컬 AI 번역에 용어표와 문체 지시를 함께 넣으면 더 안전해질까요?

이번 36회 측정에서는 그렇지 않았습니다. 기본 번역, 용어 고정, 문체 고정은 각각 9번 모두 미리 정한 계약을 통과했습니다. 두 지시를 함께 넣은 조건은 9번 중 6번만 통과했습니다.

실패는 아무 곳에서나 나오지 않았습니다. 기술 설명과 비즈니스 메일은 결합 조건에서도 모두 통과했고, 캐주얼 후기만 세 번 연속 같은 용어를 바꿨습니다.

계정이나 클라우드 API 없이 로컬에서 번역하려는 분이라면 결론은 간단합니다. 용어와 문체를 함께 지시해도, 중요한 용어는 출력 뒤에 다시 확인해야 합니다.

원문 3종에 지시 조건을 네 가지로 바꿨습니다

저는 2026년 9월 로컬 Ollama에서 gemma3:4b Q4_K_M을 순차 실행했고, 6월 측정에 썼던 영어 원문 세 종을 그대로 입력했습니다.

  • 기술 설명: 대규모 언어 모델의 대기 시간·처리량·묶음 처리·양자화
  • 캐주얼 후기: 설치 과정, 배터리, 2주 연속 사용 언급, 최종 추천
  • 비즈니스 메일: 배송 지연 원인, 영업일 기준 3일, 10% 크레딧

각 원문에는 네 가지 지시 조건을 적용했습니다. 지시문을 한국어와 영어로 바꿨을 때의 차이는 한영 프롬프트 지시 언어 실측에서 따로 확인할 수 있습니다.

조건 번역 지시
기본 자연스러운 한국어 번역, 번역문만 출력
용어 고정 기본 지시 + 핵심 영문을 지정한 한국어로 번역
문체 고정 기본 지시 + 원문에 맞춘 종결형 사용
결합 용어 고정과 문체 고정을 동시에 요구

세 입력에 네 조건을 적용하고 각각 세 번 반복해 36회가 됐습니다. 모든 요청은 temperature 0, seed 13으로 실행했습니다. keep_alive는 0이라 매 요청의 전체 대기시간에 모델 적재 시간이 포함될 수 있습니다.

저는 실행 로그와 집계표를 대조해 36회 모두 유효 응답이고 인프라 오류는 0건임을 확인했습니다.

여기서 "통과"는 번역이 아름답다는 뜻이 아닙니다. 원문의 여섯 조항, 핵심 용어, 숫자와 단위, 번역문만 출력하라는 형식, 지정한 문체를 모두 지켰다는 뜻입니다.

지시를 따로 주면 9/9, 함께 주면 6/9였습니다

완전통과 결과는 다음과 같습니다.

지시 조건 완전통과 생성속도 중앙값 전체 대기 중앙값
기본 9/9 149.4 tok/s 4.95초
용어 고정 9/9 147.8 tok/s 5.11초
문체 고정 9/9 146.0 tok/s 5.08초
용어+문체 결합 6/9 145.2 tok/s 5.20초

용어만 고정했을 때는 세 입력 모두 완전통과했습니다. 문체만 고정한 조건도 같았습니다.

결합 조건에서는 기술 설명과 비즈니스 메일이 세 번 모두 지켰습니다. 캐주얼 후기는 세 번 모두 실패했습니다.

따라서 이번 결과를 "지시가 두 개면 번역이 무너진다"로 읽으면 범위를 벗어납니다. 실패는 세 입력 중 하나, 그 안에서도 지정 용어 하나에 모였습니다.

내용 보존 첫 실패 — GS-C-r1 · 누락 조항 0/6 · 핵심 용어 3/4 · 숫자·단위 통과

여섯 조항은 남았지만 keeper가 바뀌었습니다

캐주얼 후기의 마지막 문장은 다음 뜻을 담고 있었습니다.

첫날의 힘든 과정을 넘길 수 있다면 계속 쓸 만한 제품이다.

결합 조건에는 keeper를 "계속 쓸 만한 제품"으로 정확히 번역하라는 용어표가 들어갔습니다. 문체는 모든 문장을 친근한 요체로 끝내도록 지정했습니다.

첫 응답의 마지막 문장은 이렇게 나왔습니다.

네, 첫날의 고통스러운 시간을 넘기면 정말 좋은 제품이에요.

문체 지시는 지켰습니다. 번역문 밖의 설명도 붙이지 않았습니다. 설치 과정, 연결에 걸린 한 시간, 배터리, 지난 2주, 추천 여부까지 여섯 조항도 모두 남았습니다.

그러나 "계속 쓸 만한 제품"은 사라지고 "정말 좋은 제품"이 들어갔습니다. 원문의 큰 줄거리를 보존한 번역이라도, 용어 계약으로 보면 실패입니다.

이 장면이 중요한 이유는 오류가 눈에 잘 띄지 않기 때문입니다. 문장은 자연스럽게 읽히고 뜻도 완전히 동떨어지지 않았습니다. 용어표와 한 줄씩 대조하지 않으면 그대로 넘기기 쉽습니다.

같은 누락이 세 번 그대로 반복됐습니다

결합 조건의 캐주얼 후기를 세 번 실행했더니 세 응답은 바이트 단위로 같았습니다. 세 번 모두 keeper만 지정 번역에서 벗어났고, 세 번 모두 "정말 좋은 제품"을 선택했습니다.

temperature 0과 seed 13에서 세 번 같은 결과가 나왔습니다. temperature 0에서 같은 프롬프트를 반복한 재현성 실측과 함께 보면, 같은 설정으로 다시 돌리는 것보다 출력 검사가 먼저입니다.

반면 용어 고정만 적용한 캐주얼 후기는 세 번 모두 통과했습니다. "계속 쓸 만한 제품"이라는 지정 표현도 모두 남았습니다. 문체 고정만 적용한 캐주얼 후기 역시 세 번 모두 통과했습니다.

여기까지 확인되는 사실은 좁습니다.

gemma3:4b가 이 캐주얼 문장에서 용어표와 요체 지시를 함께 받았을 때, 문체를 지키면서 keeper의 지정 번역을 세 번 모두 버렸습니다.

속도는 조건별 순위로 해석하기 어렵습니다

지시가 늘어날수록 생성속도 중앙값은 149.4에서 145.2 tok/s까지 조금씩 낮아졌습니다. 전체 대기시간 중앙값은 4.95초에서 5.20초로 늘었습니다.

하지만 각 조건의 실제 생성속도 범위는 겹쳤습니다.

  • 기본: 136.0~156.6 tok/s
  • 용어 고정: 138.9~157.4 tok/s
  • 문체 고정: 138.1~156.0 tok/s
  • 결합: 139.4~156.7 tok/s

각 조건의 생성속도 범위가 겹쳤으므로, 이번 36회 결과에서는 지시 조건별 속도 차이를 운영 기준으로 삼기 어렵습니다.

6월 원본 기록에는 같은 세 입력을 기본 지시로 한 번씩 번역한 결과가 있습니다. 다만 그때는 샘플이 세 개뿐이고 모델 digest와 실행 버전도 고정돼 있지 않습니다.

용어표는 생성 지시이자 검사표여야 합니다

이번 결과에서 바로 적용할 수 있는 방법은 용어표를 프롬프트 안에만 두지 않는 것입니다.

번역을 받은 뒤 지정한 한국어 표현이 실제 출력에 있는지 다시 검색해야 합니다. 예를 들어 keeper를 "계속 쓸 만한 제품"으로 정했다면 그 문자열이 남았는지 확인합니다. 제품명·계약 용어·부품명처럼 바뀌면 안 되는 항목은 같은 방식으로 검사할 수 있습니다.

검수 순서는 짧게 만들 수 있습니다.

  1. 번역 전에 반드시 유지할 용어와 숫자를 정합니다.
  2. 용어표와 필요한 문체를 함께 적어 번역합니다.
  3. 출력에서 지정 용어를 문자열로 다시 찾습니다.
  4. 누락된 항목이 있으면 원문 조항과 숫자도 함께 대조합니다.
  5. 사람에게 전달할 문서라면 마지막으로 자연스러움과 문맥을 읽어 확인합니다.

세 번째 단계는 이번 실패처럼 지정 용어가 다른 표현으로 바뀐 출력을 걸러냅니다. 누락이 발견되면 재요청 결과도 같은 용어표로 다시 검사합니다.

이번 결과를 적용할 수 있는 범위

이번 측정 입력은 영어에서 한국어로 옮기는 짧은 글 세 종입니다.

모델 digest는 이번 런에 남지 않았습니다. 이번 측정은 계정이나 클라우드 API 없이 로컬 Ollama로 요청을 처리한 실행입니다.

채점은 계약 준수만 다뤘습니다.

그 경계를 감안해도 결정에 쓸 수 있는 결과는 남습니다.

간단한 세 입력에서는 gemma3:4b가 기본 번역과 단일 지시를 모두 통과했습니다. 그러나 용어와 문체를 동시에 요구했을 때 특정 캐주얼 표현의 용어 고정이 3회 모두 깨졌습니다.

로컬 AI 번역을 초안으로 쓰는 것은 가능하지만, 중요한 용어가 있는 문서는 용어표 대조를 통과한 뒤에만 넘기는 편이 안전합니다.

36회 집계 완료 — 완전통과 기본 9/9·용어 9/9·문체 9/9·결합 6/9 · 생성속도 중앙값 149.4 tok/s · 전체 대기 중앙값 4.95s · infra 0건

재현: cinevyze-bench의 run_offline_translate_bench.py와 offline_translate_bench_cases.json (문항 파일 포함). 본문의 원자료 경로(test_runs/…)는 비공개 작업 폴더라 외부에서 열 수 없습니다.


번역 36회는 로컬 gemma3:4b로 실행한 결과입니다. 하네스와 글 작성에 AI 도구를 썼고, 시험 조건 승인과 발행 전 검수는 제가 합니다.

cinevyze 운영자 — 로컬 Ollama에서 gemma3:4b Q4_K_M의 영어→한국어 번역 지시 준수를 측정했습니다. 측정 시점은 2026년 9월입니다. 운영자 소개

댓글

이 블로그의 인기 게시물

AI 프롬프트를 영어로 바꿔도 60쌍 중 우열이 갈린 건 9쌍뿐이었습니다

AI가 준 출처 링크 37개를 다시 열었더니, 판정 가능한 35개가 모두 깨졌습니다

AI 답변 재현성 실험: 온도 0에서 답은 고정됐고 오답도 반복됐습니다