글

라벨이 AI 글쓰기·챗봇인 게시물 표시

AI 금지어를 늘리면 더 무너질까 — 무너진 게 아니라 놓칠 확률이 곱해집니다

이미지
스물두 번째였습니다. 무선 이어폰 상세페이지 문구를 써 달라고 했고, 프롬프트에는 이 줄이 들어 있었습니다. 절대 쓰면 안 되는 단어: "최고". 이 단어들은 어떤 형태로도 쓰지 말고, 뜻이 비슷한 다른 말로 바꿔 주세요. 돌아온 답은 이렇습니다. 가볍고 뛰어난 착용감의 무선 이어폰으로 (…) 오직 당신만을 위한 완벽한 몰입감을 선사합니다. 강력한 배터리 성능으로 (…) 여러분의 일상에 활력을 불어넣는 최고 의 선택이 될 것입니다. 뛰어난. 완벽한. 강력한. 세 번을 우회했습니다. 그러다 문단을 닫는 마지막 한 문장에서 「최고」가 돌아왔습니다. 금지어를 몇 개까지 걸어도 되는지, 그리고 그 지시를 믿고 사후 검사를 건너뛰어도 되는지 정하려는 분을 위해 다시 쟀습니다. 이번 9월에 로컬에서 gemma3:4b를 올려 같은 과제를 195회 돌렸습니다. 지난번 기록이 너무 깨끗했습니다 이 실험은 8월에도 돌렸습니다. 1개 0건. 3개 0건. 5개에서만 무너짐. 선이 아주 또렷했죠. 「3개까지는 안전하다」가 표에서 그냥 읽혔습니다. 결과가 이렇게 깨끗하면 보통은 좋은 신호인데, 그때 조건 하나당 돌린 횟수가 열한 번이었습니다. 그게 전부였습니다. 열한 번을 보고 한 번도 못 봤다는 건 「일어나지 않는다」는 뜻이 아니라 열한 번 보는 동안 한 번도 안 걸렸다 는 뜻일 뿐입니다. 그래서 다시 돌렸습니다. 문항도 금지어도 건드리지 않고, 회차만 다섯 배로. 무엇을 어떻게 쟀나 한국어 글쓰기 과제를 여덟 개 준비했습니다. 상품소개, 공지, 사과 메일, 블로그, 설명, 자기소개, 리뷰, 홍보. 장르마다 「이런 글이면 꼭 나오는」 상투어가 있죠. 사과 메일이면 죄송·양해·협조·조속·부득이, 자기소개면 열심히·노력·성장·최선·배우. 그 다섯 개씩을 금지어 후보로 미리 정해 뒀습니다. 같은 과제를 네 조건으로 돌렸습니다. 아무것도 금지하지 않기, 하나만 금지하기, 셋, 다섯. 금지 문장을 프롬프트 맨 앞에 놓은 경우와 맨 뒤에 놓은 경우도...

AI가 준 출처 링크 37개를 다시 열었더니, 판정 가능한 35개가 모두 깨졌습니다

이미지
HTTP 상태 코드가 200이면 출처 링크는 살아 있다고 봐도 될까요? 제가 첫 링크를 다시 열었을 때 서버는 실제로 200을 돌려줬습니다. 하지만 화면에 나온 것은 폭염주의보 기준이 아니었습니다. 서비스 이용에 불편을 준다는 안내와 함께, 해당 경로는 현재 운영하지 않는 페이지라는 설명이 나왔습니다. 도메인은 기상청이었고 주소 모양도 그럴듯했지만 근거로 인용할 내용은 없었습니다. 저는 AI 답변에 붙은 출처 링크를 그대로 인용해도 되는지, 자동 게시 전에 어떤 검사를 붙여야 하는지 정하려고 이번 실행에서 나온 링크 37개를 다시 열었습니다. 짧은 답부터 말씀드리면, 주소가 있다는 사실만으로 출처 칸을 통과시키면 안 됩니다. 이번 실행에서 판정 가능한 링크 35개는 전부 깨져 있었습니다. 살아 있는 근거는 하나도 없었습니다. 클릭되면 통과시키는 기준부터 막혔습니다 첫 장면의 링크는 모델 응답에 이렇게 들어 있었습니다. 출처: https://www.kma.go.kr/mlbd/anginfo/index.jsp?bmenu=SUSTAIN&bcn=A020101 기관 이름과 도메인이 맞고, 서버도 정상 응답했습니다. 여기서 상태 코드만 검사하면 통과입니다. 실제 페이지 내용을 읽으면 판정이 바뀝니다. 요청한 자료가 나온 게 아니라 서비스 장애 안내가 나왔습니다. 이런 주소를 이번 테스트에서는 soft 404로 셌습니다. 서버가 200을 보내더라도 찾던 문서가 없는 경우입니다. 기관의 대문이 살아 있는지도 따로 조회했습니다. 기상청 대문은 정상적으로 열렸습니다. 기관 사이트가 운영 중이라는 사실과 모델이 제시한 세부 경로의 생존은 별개였습니다. 출처 검사에는 최소 두 단계가 필요합니다. 주소가 실제로 응답하는지 봅니다. 열린 페이지가 해당 주장을 뒷받침하는지 읽습니다. 첫 단계만 자동화하면 이번 soft 404 열 개를 놓칩니다. 세 가지 지시로 54회를 돌렸습니다 이번 9월에는 웹 접근이 없는 로컬 gemma3:4b에 한국 제도 질...

21턴을 이어가도 AI는 지시를 놓지 않았습니다. 무너진 건 질문 쪽이었습니다

이미지
규칙 세 개를 걸고 21턴을 갔더니, 두 개는 189회 내내 한 번도 안 깨졌습니다. 대화가 길어지면 AI가 형식 지시를 놓는지, 매 턴 규칙을 다시 넣어줘야 하는지 정하려는 분을 위해 이번 9월에 다시 쟀습니다. 로컬에 gemma3:4b를 올리고 대화 세 본을 세 가지 방식으로 굴렸습니다. 건 규칙은 이렇습니다. 답변을 「요약:」으로 시작할 것. 영어 알파벳을 쓰지 말 것. 마지막 줄에 「— 가온다인 안내봇」을 붙일 것. 그러고는 규칙과 아무 상관 없는 질문을 스물한 번 이어서 던졌습니다. 회의실 예약은 며칠 전에 하나요, 파일 이름에 날짜를 어떻게 넣나요, 화분은 창가에 둬도 되나요. 접두도 서명도 한 번을 안 놓쳤습니다. 189회를 통째로. 깨진 건 영어 금지 하나였고, 그것도 여덟 번이었습니다. 세 가지 방식으로 나눠 걸었습니다 규칙을 언제 주느냐를 세 갈래로 갈랐습니다. 대화가 길어질수록 앞의 지시가 흐려진다면, 언제 어떻게 붙들어 두느냐가 갈림길이 되니까요. 첫 턴에만 — 1번 질문에 규칙을 붙여 주고 그 뒤로는 질문만 던집니다. 사람들이 실제로 챗봇을 쓰는 방식에 가장 가깝죠. 시스템 자리에 고정 — 대화 밖 시스템 메시지에 규칙을 박아 두고 매 턴 같이 보냅니다. 매 턴 다시 — 질문 끝에 규칙을 한 줄로 요약해 매번 덧붙입니다. 가장 번거롭고, 토큰도 가장 많이 씁니다. 대화는 세 본을 준비했습니다. 사무실 총무, 문서 정리, 생활 상식. 세 방식 × 세 대화 × 21턴 = 189회입니다. 채점은 프로그램이 합니다. 「요약:」으로 시작하는지, 영문자가 하나라도 있는지, 마지막 줄이 서명으로 끝나는지만 봅니다. 어느 방식이 나은지는 이 회차로 안 갈립니다 규칙 유지 방식 영어 금지 지킴 접두 서명 첫 턴에만 59/63 63/63 63/63 시스템 자리에 고정 60/63 63/63 63/63 매 턴 다시 62/63 63/63 63/63 가운데 칸만 세로로 훑으면 「...

AI에게 답을 다시 채점시켰더니, 정답을 보여주기 전까지 48번 중 13번 틀렸습니다

이미지
정답은 「8월 15일」이었습니다. 모델이 처음 낸 답도 「8월 15일」이었습니다. 그런데 같은 모델에게 정답인지 다시 물었더니 돌아온 마지막 줄은 이랬습니다. 판정: 오답 답이 바뀐 게 아닙니다. 질문도 바뀌지 않았습니다. 답을 만든 뒤 채점 역할만 맡겼는데, 맞았던 답에 X를 붙였습니다. AI가 만든 답을 같은 AI에게 다시 검사시켜도 되는지, 된다면 어떤 채점 지시를 붙여야 하는지 정하려는 분을 위해 다시 쟀습니다. 9월 17일에 로컬 모델 두 종으로 답안 48개를 만들고, gemma3:4b에 채점을 144회 맡겼습니다. 답안 생성까지 합치면 192회입니다. 채점 지시를 세 갈래로 나눴습니다 문항은 정답이 하나로 정해지는 24개입니다. 상식, 계산, 단위, 글자 조작을 섞었습니다. gemma3:4b와 qwen3-vl:8b가 각 문항에 한 번씩 답해 답안 48개를 만들었습니다. 그 답안을 gemma3:4b에 세 방식으로 다시 줬습니다. 채점 방식 모델이 받은 추가 정보 정답 비공개 질문과 채점할 답만 제공 먼저 풀고 비교 채점 전에 질문을 직접 풀라고 지시 정답 공개 정답 키를 함께 제공 진실값은 채점 모델의 설명으로 정하지 않았습니다. 프로그램이 미리 고정한 정답 별칭과 답안을 대조했습니다. 채점 모델은 마지막 줄에 판정: 정답 또는 판정: 오답 만 남겼고, 그 판정이 진실값과 같은지를 셌습니다. 하네스 오류는 0회였습니다. 생성 요청은 한 번에 하나씩 보냈고 모델은 응답 뒤 메모리에서 내리도록 keep_alive: 0 으로 실행했습니다. 답을 가리고 물으면 네 번 중 한 번 넘게 틀렸습니다 방식 일치 오판 일치율 정답 비공개 35/48 13 72.9% 먼저 풀고 비교 44/48 4 91.7% 정답 공개 46/48 2 95.8% 차이는 큽니다. 질문과 답만 던졌을 때는 48번 가운데 13번이 진실값과 달랐습니다. 먼저 직접 풀라고 한 줄을 붙...

AI 글자수 지시 12쌍, 「정확히」보다 범위가 11쌍 더 가까웠습니다

이미지
「정확히」라고 쓰면 정말 정확해질까요? [거래처 이름] 담당자님께, 갑작스럽지만, 납품 일정에 차질이 생겨 일주일 더 지연됩니다. ±10% 이내에서 조정하여 최대한 빠른 시일 내에 납품 드리겠습니다. 양해 부탁드립니다. AI에는 「100자 내외, ±10% 안」이라고 적었습니다. 길이는 거의 맞았습니다. 문제는 글자 수 조건이 거래처 메일 본문으로 새어 나왔다는 겁니다. 숫자만 보면 성공이고, 메일로 보내면 실패입니다. 저는 이 둘을 갈라 보기로 했습니다. AI에게 짧은 문구부터 긴 글까지 분량을 어떻게 지시해야 덜 빗나가는지 정하려는 분을 위해 다시 쟀습니다. 이번 9월에 로컬 gemma3:4b로 64회 실행했습니다. 짧은 답부터 드리면 이렇습니다. 세 글감의 짝비교에서는 「정확히 N자」보다 범위를 준 문구가 더 가까웠습니다. 다만 긴 목표에서는 범위를 줘도 허용 구간에 잘 들어오지 않았습니다. 입력칸처럼 상한이 단단한 곳은 생성 뒤 글자 수를 세는 단계가 필요합니다. 300자에서는 맞고, 800자에서는 벌어졌습니다 같은 글감에 짧은 문구부터 긴 글까지 네 단계로 목표를 바꿨습니다. 상품소개, 공지, 이메일, 블로그 글, 설명, 자기소개, 리뷰, 요약, 안내, 소식까지 열 가지 글감을 썼습니다. 공백을 포함해 셌고, 허용 범위 안이면 1차 통과로 잡았습니다. 아래 목표별 집계는 기본 문구 40회에, 상품소개·공지·이메일에만 붙인 「정확히」와 범위 문구 24회를 합친 값입니다. 목표 실제 글자 수 중앙값 목표 ±10% 안 100자 94자 7/16 300자 299자 10/16 500자 587자 4/16 800자 1,057자 3/16 짧은 목표에서는 통과 칸이 더 많고, 길어질수록 중앙값이 목표 위로 벌어집니다. 긴 분량에서 초과가 커지는 쪽 이 이번 결과의 가장 큰 갈림입니다. 위 화면은 본런이 돌던 시점에 찍혔습니다. 가장 긴 블로그 조건의 첫 회차가 목표를 크게 넘는 순간입니다. 부호...

AI 프롬프트를 영어로 바꿔도 60쌍 중 우열이 갈린 건 9쌍뿐이었습니다

이미지
첫 실패는 모양이 멀쩡했습니다. JSON으로 열렸고, 요구한 키도 빠짐없이 들어 있었습니다. 그런데 category 값 하나가 정답표와 달랐습니다. 한국어 지시문으로 돌린 문의 분류 과제였습니다. 형식이 깨진 게 아니라 다 읽히는데 값이 틀린 것 입니다. 한국어 프롬프트를 영어로 번역해야 답이 더 정확해지는지, 아니면 지시를 명확히 쓰는 데 시간을 써야 하는지 정하려는 분을 위해 다시 쟀습니다. 같은 구조화 과제 60개를 gemma3:4b에 두 번씩 줬습니다. 입력, 정답, 출력 형식은 고정하고 지시문만 한국어와 영어로 바꿨습니다. 총 120회입니다. 먼저 결론부터 놓겠습니다 지시문 언어 JSON 파싱 성공 스키마 준수 값까지 정답 한국어 60/60 60/60 36/60 영어 60/60 60/60 39/60 영어가 세 건 앞섰습니다. 하지만 이 숫자만 보고 「영어가 더 좋다」고 결론내리면 짝비교를 놓칩니다. API가 기록한 응답 토큰 중앙값은 두 언어 모두 76개였습니다. 지시문 쪽은 한국어 372토큰, 영어 314토큰이 중앙값이라 영어가 짧았지만, 출력 길이는 같았습니다. 같은 입력에서 두 언어 중 하나만 성공한 경우를 세니 한국어만 성공 3쌍, 영어만 성공 6쌍이었습니다. McNemar 정확검정 p값은 0.5078이었습니다. 이번 60쌍에서는 이 차이를 우연과 구분하지 못했습니다. 번역 비용을 들일 만큼 영어 우위가 확인된 결과가 아닙니다. 무엇을 같게 두고 무엇만 바꿨나 과제는 세 종류였습니다. 고객 문의를 허용된 카테고리로 분류 주문 문장에서 판매처·상품·수량을 추출 상품 설명에서 제품명·재질·재고 여부를 추출 각 과제에 입력 20개를 뒀습니다. 한국어 지시문과 영어 지시문은 같은 필드, 같은 허용값, 같은 JSON 규칙을 담았습니다. 입력 문장과 기대 정답은 바꾸지 않았습니다. 실행 순서도 한쪽으로 몰지 않았습니다. 절반은 한국어부터, 절반은 영어부터 돌려 예열이나 순서가 언어...

무료 로컬 AI 맞춤법 교정 60번 — 심어 둔 오류 50개, 세 번씩 돌려도 절반도 못 고쳤습니다

이미지
「다음 글의 맞춤법과 띄어쓰기만 고쳐 주세요. 문장 구조와 표현은 바꾸지 말고, 고친 글만 출력해 주세요.」 이 지시와 함께 「박서연 대리님께 다음 주에 뵈요라고 메시지를 보냈다.」가 든 초안을 넣었습니다. 무료 로컬 AI qwen3-vl:8b가 돌려준 문장은 이랬습니다. 박서연 대리님께 다음 주에 뵠요라고 메시지를 보냈다. 「뵈요」의 표준 표기는 「봬요」입니다. 모델은 틀린 글자를 지우고 없는 글자를 넣었습니다. 같은 조건의 다른 회차에서는 「왠만하면 무료 요금제로」가 이렇게 돌아왔습니다. Gwen만하면 무료 요금제로 버티려고 했다. 이 글은 무료 로컬 AI에 한국어 맞춤법 교정이나 문장 다듬기를 맡기려는 독자가 어떤 지시를 쓸지, 결과에서 무엇을 다시 확인할지, 기본 설정 그대로 돌려도 되는지를 정하도록 돕는 기록입니다. 결론부터 말하면 이번 테스트에서 맞춤법만 고치라고 했을 때 심어 둔 오류 50개를 세 번씩, 모두 150자리를 돌려 53자리를 고쳤고 71자리는 그대로 남겼습니다. 다듬어 달라고 했을 때는 30회 중 22회가 반말 초안을 「습니다」체로 바꿨습니다. 그리고 Ollama 서버 기본 설정 그대로는 대부분 빈 답이 나왔습니다. 오류 자리를 정해 두고 60번 교정시켰습니다 7월 첫 기록은 지문 하나를 「자연스럽게 다듬어줘」 지시로 4번 넣은 것이었습니다. 그래서는 모델이 무엇을 고치고 무엇을 놓쳤는지 셀 수 없습니다. 이번에는 자리를 정해 두고 셌습니다. 초안 10개 — 135~232자의 짧은 글입니다. 초안마다 흔히 틀리는 표준 맞춤법 오류를 5개씩 심어 모두 50자리를 만들었습니다. 첫 초안(D01)은 7월에 쓴 지문 그대로입니다. 조건 2개 — ①「맞춤법과 띄어쓰기만 고쳐 주세요. 문장 구조와 표현은 바꾸지 말고…」 ②「이 글을 자연스럽고 매끄럽게 다듬어줘. 의미는 바꾸지 말고.」(7월 지시문 그대로) 반복 3회 — 조건마다 초안 10개를 세 번씩, 모두 60회 돌렸습니다. 온도는 모델 기본값인 1이라 회차마다 답이 ...

AI 문서요약 정확도 실측: 3문장과 8문장의 차이

이미지
AI 문서요약에서 가장 먼저 정할 것은 모델이 아니었습니다. 몇 문장까지 허용할지였습니다. 2026년 9월 22일, 내가 로컬 gemma3:4b와 클라우드 Gemini 3.8 Flash High에 같은 문서들을 넣어 72회 요약했습니다. 채점 기준은 돌리기 전에 먼저 고정해 두었습니다. 완전통과는 로컬이 36번 중 6번, 클라우드가 36번 중 14번이었습니다. 클라우드가 더 많이 통과했지만, 세 문장으로 제한하자 양쪽 모두 12번 중 한 번도 핵심 다섯 항목을 전부 남기지 못했습니다. 핵심을 빠뜨리면 안 되는 문서를 요약하려는 분이라면 선택 기준은 여기서 갈립니다. 짧은 요약이 필요할수록 더 강한 모델만 찾기보다, 먼저 반드시 남길 항목과 최소 문장 수를 정해야 합니다. 내가 세운 기준으로 72회를 다시 훑어봤을 때 원문 밖의 숫자, 원문과 반대되는 주장, 폐기된 수치를 최종 사실처럼 쓴 사례는 양쪽 모두 0건이었습니다. 완전통과하지 못한 응답들은 모두 핵심 슬롯을 하나 이상 빠뜨렸습니다. 일부는 문장 수도 어겼지만, 공통으로 걸린 실패는 누락이었습니다. 자연스러운 세 문장이 핵심 세 덩어리를 지웠습니다 첫 응답부터 그 차이가 드러났습니다. 936자짜리 커피 설명문을 로컬 모델에 주고 세 문장으로 요약하라고 요청했습니다. 응답에는 이런 문장이 들어 있었습니다. "커피 추출 방식에 따라 같은 원두라도 다양한 맛을 낼 수 있으며, 드립, 에스프레소, 침지식 등이 대표적이다." 이어지는 두 문장도 문법상 자연스러웠습니다. 드립은 깔끔한 맛, 에스프레소는 농축된 맛, 프렌치프레스는 묵직한 맛이라고 정리했고 마지막에는 분쇄도·온도·시간을 조절해야 한다고 썼습니다. 문장 수 역시 정확히 세 개였습니다. 원문에 없는 숫자도 보태지 않았습니다. 그래도 내가 세운 항목표와 대조한 채점 결과는 실패였습니다. 세부 항목을 대조하자 드립의 추출 원리, 에스프레소의 압력 특성, 침지식과 함께 설명된 콜드브루가 빠져 있었습니다. 핵심 슬롯 다섯 개 ...

무료 로컬 RAG로 내 문서에 질문 228번 — 조각을 6개로 늘리자 정답이 줄었습니다

이미지
시정명령이 몇 건인지 물었습니다. 법 위반 행위에 부과된 시정명령은 몇 건인가요? 검색기는 정답 문장이 든 조각을 1순위로 가져왔습니다. 그 조각 안에는 이 줄이 있습니다. ▸법 위반 행위(537개 기관)에 대해 과징금·과태료 1,997억원, 시정명령 259건 부과 모델의 답은 이랬습니다. 537건 기관 수에 「건」을 붙인 답입니다. 정답 259건은 같은 문장 안에 있었죠. 조각 3개를 넘기는 조건에서 세 번 물었고, 세 번 다 537건이었습니다. 조각을 6개로 늘리자 세 번 다 259건으로 바뀌었습니다. 그럼 조각을 늘리면 될까요. 반대 방향도 나왔습니다. 표본 설계 표에서 허용오차 1.0에 대응하는 표본 크기를 물은 질문입니다. 조각 3개일 때는 세 번 모두 정답인 6,436을 답했습니다. 6개일 때는 세 번 모두 6,500이었습니다. 두 조건 모두 같은 조각이 1순위였고, 그 조각에는 표의 6,436과 바로 뒤 「최종 표본의 크기는 허용오차가 1.0% 내외가 되도록 6,500개로 결정함」이 나란히 있습니다. 내 PC에서 무료로 문서 질의응답을 꾸리려 한다면, 몇 조각을 넘길지와 어떤 답을 그대로 믿을지부터 정해야 합니다. 이번 228회에서 조각 3개 조건은 답이 있는 질문 96회 중 81회를 맞혔습니다. 6개로 늘린 조건은 74회였습니다. 조각 수를 바꾸면 고쳐지는 답과 틀어지는 답이 함께 나왔고, 검색이 정답 문장을 못 가져온 질문은 조각을 늘려도 그대로 남았습니다. 스캔 PDF는 점수에 잡히지도 않았습니다 넣은 문서는 넷입니다. 개인정보보호위원회 2025년 업무계획 PDF, 2024 정보보호 실태조사 보고서 PDF, 1996년 관보를 스캔한 PDF, 개인정보위 보도자료 HWPX 파일. 모두 공공기관이 공개한 자료입니다. 첫 단계인 텍스트 추출에서 관보가 사라졌습니다. 21,510KB짜리 스캔 PDF에서 pdftotext가 꺼낸 글자는 0자였습니다. 이 실패는 아래 어느 점수에도 나타나지 않습니다. 관보에서 답을 찾는 질문을 이...

무료 로컬 AI로 블로그 글 180회 실측 — 숫자는 지켰고, 분량과 말투는 어겼습니다

이미지
「코딩 없이 웹 자동화」 도입부를 부탁한 응답의 마지막 문단입니다. 저 역시 ‘코딩 없이 웹 자동화’ 기술을 통해 업무 효율성을 높이는 데 큰 도움을 받고 있으며, 여러분도 ‘클릭반복’을 통해 시간과 노력을 절약하고 원하는 목표를 달성할 수 있을 거라고 확신합니다. 요청에 넣은 글감 메모에는 이 서비스를 사용한 경험이 한 줄도 없습니다. 반복 클릭 녹화, 윈도우 전용, 무료 10단계, 연 59,000원, 실행 예약. 그게 전부였고, 프롬프트 첫 줄은 「아래 글감 메모만 사용해」였습니다. 이 문단을 그대로 블로그에 올리면 글쓴이가 해 보지 않은 경험을 해 본 것처럼 적는 셈이 됩니다. 다른 응답은 방향이 반대였습니다. 이러한 문제점을 해결하기 위해, 저희가 준비했습니다. 회의록 요약 앱 도입부입니다. 블로그 글을 부탁했는데 서비스를 만든 회사처럼 말합니다. 무료 로컬 AI에 블로그 글 조각을 맡기려 한다면, 어디까지 맡기고 발행 전에 무엇을 손으로 고칠지부터 정해야 합니다. 이번 테스트에서 gemma3:4b는 메모에 적힌 숫자를 벗어나지 않았습니다. 180회 가운데 메모 밖 숫자가 나온 회차는 한 번도 없었습니다. 어긴 쪽은 분량과 말투입니다. 도입부 60편 가운데 요청한 글자 수 안에 든 것은 없었고, 19편에는 「저희」나 「저 역시」 같은 1인칭 표현이 들어갔습니다. 1인칭 19편을 하나씩 읽었습니다 1인칭 표현은 채점기가 표면 표지로만 찾습니다. 「저희」, 「저 역시」, 「제가」 같은 말이 들어갔는지까지만 봅니다. 그래서 걸린 19편을 원문으로 다시 읽고 나눴습니다. 16편은 업체 말투였습니다. 「저희가 준비했습니다」, 「저희 자막뚝딱은」처럼 서비스를 만든 쪽의 목소리로 소개합니다. 2편은 경험을 지어냈습니다. 맨 위의 「저 역시 … 큰 도움을 받고 있으며」, 그리고 맞춤법 검사 도입부의 「저 역시 종종 그런 순간들을 경험하며 답답함을 느꼈습니다」입니다. 1편은 불분명했습니다. 「저희가 소개하고자 하는 서비스」는 소개하는 사람의...

챗GPT·클로드·제미나이 비교 — 같은 업무 3개, 틀린 건 휴대폰 번호 한 줄이었습니다

이미지
+821012345678 휴대폰 번호를 공백 없이 국가번호째 붙여 적은 한 줄입니다. 이 값을 ChatGPT가 짜 준 함수에 넣자 돌아온 답은 None 이었습니다. 기대한 값은 010-1234-5678 이었습니다. 같은 문장으로 부탁한 Claude와 Gemini의 함수는 이 줄을 제대로 바꿨습니다. 챗GPT·클로드·제미나이 중 무엇을 결제할지 고민하는 분이라면, 개인 요금표와 같은 업무 3개의 채점 결과를 나란히 보고 내 일에 맞는 쪽과 결과를 따로 검사해야 할 지점을 고를 수 있습니다. 짧은 답부터 적습니다. 쉬운 표 집계는 셋 다 맞혔습니다. 차이는 "그럴듯한 코드와 수식을 그대로 붙여 넣어도 되는가"에서 났고, 그 답은 세 곳 모두 "시험해 보기 전에는 모른다"였습니다. 이번 결과에서 차이를 가른 것은 받은 코드를 돌려 볼 시험 케이스가 먼저 있는가였습니다. 세 곳에 같은 문장 세 개를 넣었습니다 2026년 9월 25일, 세 서비스의 웹 화면에서 새 대화를 열고 같은 과제 문장을 하나씩 넣었습니다. 과제는 정답을 기계로 확인할 수 있는 것만 골랐습니다. 과제 부탁한 일 채점 방법 T1 표 집계 매출 12줄(환불 2줄 포함)을 지역별로 합산 정답표와 숫자 대조 T2 엑셀 수식 날짜 일부가 텍스트로 저장된 시트에서 2026년 9월 합계 수식 1개 시험 시트에 넣고 LibreOffice로 계산 T3 파이썬 함수 한국 휴대폰 번호를 010-1234-5678 형식으로 바꾸는 함수 입력 11건을 실제로 실행 모델과 추론 설정은 손대지 않았습니다. 화면에 떠 있던 기본값이 ChatGPT는 gpt-5-6-thinking(매우 높음), Claude는 Opus 5.5(중간), Gemini는 Flash(Extended)였습니다. 셋의 설정이 서로 다르니 이 글은 모델 순위표가 아닙니다. 평소 여는 화면 그대로 일을 맡겼을 때의 기록입니다. 채점은 응답을 받은 뒤 PC에서 따로...

로컬 AI 번역에 용어·문체를 함께 걸었더니 3/9가 같은 곳에서 실패했습니다

이미지
로컬 AI 번역에 용어표와 문체 지시를 함께 넣으면 더 안전해질까요? 이번 36회 측정에서는 그렇지 않았습니다. 기본 번역, 용어 고정, 문체 고정은 각각 9번 모두 미리 정한 계약을 통과했습니다. 두 지시를 함께 넣은 조건은 9번 중 6번만 통과했습니다. 실패는 아무 곳에서나 나오지 않았습니다. 기술 설명과 비즈니스 메일은 결합 조건에서도 모두 통과했고, 캐주얼 후기만 세 번 연속 같은 용어를 바꿨습니다. 계정이나 클라우드 API 없이 로컬에서 번역하려는 분이라면 결론은 간단합니다. 용어와 문체를 함께 지시해도, 중요한 용어는 출력 뒤에 다시 확인해야 합니다. 원문 3종에 지시 조건을 네 가지로 바꿨습니다 저는 2026년 9월 로컬 Ollama에서 gemma3:4b Q4_K_M을 순차 실행했고, 6월 측정에 썼던 영어 원문 세 종을 그대로 입력했습니다. 기술 설명: 대규모 언어 모델의 대기 시간·처리량·묶음 처리·양자화 캐주얼 후기: 설치 과정, 배터리, 2주 연속 사용 언급, 최종 추천 비즈니스 메일: 배송 지연 원인, 영업일 기준 3일, 10% 크레딧 각 원문에는 네 가지 지시 조건을 적용했습니다. 지시문을 한국어와 영어로 바꿨을 때의 차이는 한영 프롬프트 지시 언어 실측 에서 따로 확인할 수 있습니다. 조건 번역 지시 기본 자연스러운 한국어 번역, 번역문만 출력 용어 고정 기본 지시 + 핵심 영문을 지정한 한국어로 번역 문체 고정 기본 지시 + 원문에 맞춘 종결형 사용 결합 용어 고정과 문체 고정을 동시에 요구 세 입력에 네 조건을 적용하고 각각 세 번 반복해 36회가 됐습니다. 모든 요청은 temperature 0, seed 13으로 실행했습니다. keep_alive는 0이라 매 요청의 전체 대기시간에 모델 적재 시간이 포함될 수 있습니다. 저는 실행 로그와 집계표를 대조해 36회 모두 유효 응답이고 인프라 오류는 0건임을 확인했습니다. 여기서 "통과"는 번역이 ...

Gemini 3.1 Pro에 코딩·요약·번역 54번 시켜봤습니다 — 생각 수준을 low로 내려도 채점 결과는 떨어지지 않았습니다

이미지
커피 추출 방식을 다룬 글을 주고 「핵심 5문장으로 요약해줘. 원문에 없는 내용은 추가하지 마」라고 했습니다. 다섯 번째 반복에서 돌아온 답의 첫 줄과 넷째 문장입니다. 원문을 바탕으로 요약한 핵심 5문장입니다. 4\. 이러한 커피의 추출 결과를 좌우하는 3가지 핵심 변수는 원두의 분쇄도, 물의 온도, 물과 원두가 닿는 시간입니다. 두 군데가 걸립니다. 요약만 달라고 했는데 요약 앞에 머리말이 붙었습니다. 그리고 「3가지」는 원문에 없는 숫자입니다. 원문은 변수 세 개를 나열만 했고, 모델이 그것을 세어 붙였습니다. 이번 테스트에서 채점기에 걸린 것은 이 「3가지」가 전부입니다. Gemini 3.1 Pro에 코딩·요약·번역 과제를 생각 수준 high와 low로 9번씩, 모두 54번 넣었고, 채점 결과가 어긋난 회차는 요약 두 번뿐이었습니다. 그 두 번도 생각을 더 많이 하는 high 쪽에서 나왔습니다. 그래서 짧은 실무 과제를 맡길 때 생각 수준을 어디에 둘지는 품질보다 시간과 토큰 으로 정하게 됩니다. low는 과업마다 채점 결과가 떨어지지 않았고, 번역은 응답 시간 중앙값이 34% 줄었습니다. 대신 받은 답을 그대로 붙여 넣기 전에 지울 것이 과업마다 하나씩 있었습니다. 요약 18번, 머리말은 18번 다 붙었습니다 요약은 조건을 잘 지켰습니다. 18번 모두 번호 붙은 다섯 문장이었고, 원문의 추출 방식 네 가지(드립·에스프레소·침지식·콜드브루)와 핵심 변수 세 가지를 빠뜨린 요약은 없었습니다. 다만 18번 모두 요약 앞에 한 줄이 먼저 나왔습니다. 「원문에서 추출한 핵심 5문장 요약입니다」, 「원문을 바탕으로 요약한 핵심 5문장입니다」처럼 문구만 조금씩 달랐습니다. 채팅 창에서 읽을 때는 아무 문제가 없습니다. 이 답을 보고서나 스크립트로 그대로 옮기는 자리라면 매번 첫 줄을 지워야 합니다. 채점기는 번호 붙은 줄만 요약으로 세도록 짜서 이 머리말을 점수에 넣지 않았습니다. 원문 밖 숫자는 채점기가 요약 본문의 아라비아 숫자를 모두 뽑아 원문...