챗GPT·클로드·제미나이 비교 — 같은 업무 3개, 틀린 건 휴대폰 번호 한 줄이었습니다
+821012345678
휴대폰 번호를 공백 없이 국가번호째 붙여 적은 한 줄입니다. 이 값을 ChatGPT가 짜 준 함수에 넣자 돌아온 답은 None이었습니다. 기대한 값은 010-1234-5678이었습니다.
같은 문장으로 부탁한 Claude와 Gemini의 함수는 이 줄을 제대로 바꿨습니다.
챗GPT·클로드·제미나이 중 무엇을 결제할지 고민하는 분이라면, 개인 요금표와 같은 업무 3개의 채점 결과를 나란히 보고 내 일에 맞는 쪽과 결과를 따로 검사해야 할 지점을 고를 수 있습니다.
짧은 답부터 적습니다. 쉬운 표 집계는 셋 다 맞혔습니다. 차이는 "그럴듯한 코드와 수식을 그대로 붙여 넣어도 되는가"에서 났고, 그 답은 세 곳 모두 "시험해 보기 전에는 모른다"였습니다.
이번 결과에서 차이를 가른 것은 받은 코드를 돌려 볼 시험 케이스가 먼저 있는가였습니다.
세 곳에 같은 문장 세 개를 넣었습니다
2026년 9월 25일, 세 서비스의 웹 화면에서 새 대화를 열고 같은 과제 문장을 하나씩 넣었습니다. 과제는 정답을 기계로 확인할 수 있는 것만 골랐습니다.
| 과제 | 부탁한 일 | 채점 방법 |
|---|---|---|
| T1 표 집계 | 매출 12줄(환불 2줄 포함)을 지역별로 합산 | 정답표와 숫자 대조 |
| T2 엑셀 수식 | 날짜 일부가 텍스트로 저장된 시트에서 2026년 9월 합계 수식 1개 | 시험 시트에 넣고 LibreOffice로 계산 |
| T3 파이썬 함수 | 한국 휴대폰 번호를 010-1234-5678 형식으로 바꾸는 함수 |
입력 11건을 실제로 실행 |
모델과 추론 설정은 손대지 않았습니다. 화면에 떠 있던 기본값이 ChatGPT는 gpt-5-6-thinking(매우 높음), Claude는 Opus 5.5(중간), Gemini는 Flash(Extended)였습니다. 셋의 설정이 서로 다르니 이 글은 모델 순위표가 아닙니다. 평소 여는 화면 그대로 일을 맡겼을 때의 기록입니다.
채점은 응답을 받은 뒤 PC에서 따로 했습니다. 하네스(같은 조건으로 채점을 반복하는 스크립트)가 응답 원문을 읽어 T1은 숫자를 대조하고, T2는 수식을 시트에 넣어 계산하고, T3는 함수를 불러 시험 11건을 돌립니다.
표 집계는 셋 다 맞혔습니다
T1은 차이가 없었습니다. 세 곳 모두 서울 430,000, 부산 351,900, 대구 157,300, 전체 939,200을 내놓았습니다. 환불 두 줄(음수)까지 반영된 합계였습니다.
Gemini는 답 위에 "코드 표시" 버튼을 달았습니다. 암산이 아니라 코드를 실행해 합산했다는 표시입니다. 결과는 같았습니다. 이 정도 표 한 장에서는 세 곳의 차이가 드러나지 않았습니다.
엑셀 수식은 세 가지 방식으로 갈렸습니다
T2의 함정은 날짜 열에 진짜 날짜와 '2026-09-15' 같은 텍스트 날짜가 섞여 있다는 점이었습니다. 세 서비스는 이 문제를 서로 다른 방식으로 풀었습니다.
- Claude:
=SUMPRODUCT((LEFT(TEXT(A2:A13,"yyyy-mm"),7)="2026-09")*B2:B13)— 날짜든 텍스트든 앞 7글자로 맞춰 비교 - Gemini:
=SUMPRODUCT((TEXT(--A2:A13, "yyyy-mm")="2026-09")*B2:B13)—--로 텍스트 날짜를 숫자로 바꾼 뒤 비교 - ChatGPT:
=LET(d,IF(ISNUMBER(A2:A13),A2:A13,DATEVALUE(A2:A13)),SUMPRODUCT(...))— LET으로 날짜 열을 한 번 정리한 뒤 합산
시험 시트에는 진짜 날짜 8칸과 텍스트 날짜 4칸을 넣었고, 8월·10월·11월과 작년 9월 행을 섞어 두었습니다. 2026년 9월 정답은 814,024입니다.
Claude와 Gemini의 수식은 814,024를 냈습니다. ChatGPT의 수식은 오류가 났습니다.
여기서 바로 "ChatGPT가 틀렸다"고 적으면 안 됩니다. 하네스가 원인을 한 번 더 쪼갰습니다. LET만 쓴 아주 짧은 식 =LET(x,5,x*2)도 이 LibreOffice에서는 #NAME?이 났습니다. 반대로 ChatGPT 수식에서 LET만 풀어 같은 논리를 그대로 적자 814,024가 나왔습니다.
즉 이번에 걸린 것은 이 계산 환경이 LET을 못 읽은 것입니다. ChatGPT 수식의 논리 자체는 정답과 같았습니다. 엑셀에 붙여 넣을 분은 쓰는 버전이 LET을 지원하는지부터 보세요.
그래도 쓸모 있는 교훈이 남습니다. 회사 PC의 엑셀이 오래된 버전이거나 LibreOffice·구글 시트로 옮겨 쓸 계획이라면, 더 짧고 최신 함수를 쓴 답이 오히려 먼저 막힐 수 있습니다. CSV를 여러 개 합칠 때 인코딩에서 막히는 사례는 엑셀 CSV 취합 자동화 실측에 따로 정리했습니다.
휴대폰 번호 한 줄에서 버그가 나왔습니다
T3는 입력 11건으로 시험했습니다. 공백·하이픈·괄호가 섞인 번호, +82 10-…처럼 국가번호가 붙은 번호, 그리고 02-123-4567이나 0101234567처럼 바꾸면 안 되는 값입니다.
Claude와 Gemini는 11건을 모두 통과했습니다. ChatGPT는 10건을 통과하고 한 건을 놓쳤습니다.
원인은 코드 한 줄에 있었습니다. ChatGPT의 함수는 국가번호를 r"^\+82\b"로 찾습니다. \b는 글자와 글자 아닌 것 사이의 경계라서, +82 10…처럼 뒤에 공백이 오면 잡히지만 +8210…처럼 숫자가 바로 붙으면 경계가 생기지 않습니다. 그래서 국가번호를 못 알아보고 821012345678 전체를 번호로 읽다가 None을 돌려줬습니다.
눈여겨볼 대목이 하나 더 있습니다. ChatGPT의 코드 블록에는 "실행됨" 표시가 붙어 있었습니다. 서비스 안에서 코드를 한 번 돌려 봤다는 뜻입니다. 그런데도 이 입력은 걸러지지 않았습니다. 돌려 본 입력에 이 형태가 없었다면 실행 표시는 그 버그를 막아 주지 못합니다.
전화번호처럼 형식이 제각각인 개인정보를 AI로 정리하는 일이 잦다면, 형식을 지정해도 값이 남는 경우를 잰 AI 개인정보 마스킹 실측도 함께 보시면 좋습니다.
세 과제를 모두 채점한 결과는 이렇게 모였습니다.
집계의 ChatGPT T2 X는 LibreOffice 계산값이 정답과 달랐다는 기록입니다. 위에서 적은 대로 그 원인은 LET을 못 읽은 계산 환경에 있었습니다.
개인 요금제는 이렇게 다릅니다 (2026년 9월 25일 기준)
요금은 세 서비스의 한국어 공식 요금 페이지에서 개인 요금제의 월간 가격을 옮겼습니다.
| 구간 | ChatGPT | Claude | Gemini |
|---|---|---|---|
| 무료 | Free US$0 | Free $0 | 무료 ₩0 |
| 가벼운 유료 | Go US$8 | — | Google AI Plus ₩7,500 |
| 대표 유료 | Plus US$20 | Pro $22(월별) · 연간 시 월 $18 | Google AI Pro ₩29,000 |
| 상위 | Pro US$100부터 | Max $110부터 | Ultra 최저가 ₩119,000 |
ChatGPT 요금 페이지는 개인 탭에 Free부터 Pro까지 네 구간을 달러로 보여 줍니다.
Claude 요금 페이지는 Pro를 연간 구독 기준 월 $18로 크게 쓰고, 월별 결제 $22를 작은 글씨로 붙입니다. 페이지 아래에 "Prices include 10% VAT"라고 적혀 있습니다.
Gemini 구독 페이지는 원화로 표시합니다. 캡처한 날에는 머리말에 "Google AI Pro 연간 요금제 40% 할인"이 걸려 있었고, 아래 표는 월간 탭의 가격입니다.
대표 유료 구간은 두 곳이 달러, 한 곳이 원화로 표시됩니다. Claude는 VAT 포함을 밝혔지만, ChatGPT와 Gemini의 요금 화면 발췌에는 부가세 표기가 없었습니다. 결제 직전 화면의 최종 금액을 한 번 더 보시길 권합니다.
무엇을 결제할지 — 이번 결과로 가를 수 있는 것
| 이런 일이 많다면 | 이번 테스트에서 본 것 | 결제보다 먼저 준비할 것 |
|---|---|---|
| 표 합계·간단한 집계 | 세 곳 모두 정답 | 가장 싼 구간이나 무료로 먼저 써 보기 |
| 엑셀 수식 받아 쓰기 | 풀이 방식이 세 갈래, 한 식은 계산 환경에서 막힘 | 내 엑셀·시트 버전에서 쓸 수 있는 함수인지 확인 |
| 코드 받아 바로 쓰기 | 11건 중 1건 버그가 실행 표시를 지나 남음 | 이상한 입력을 섞은 시험 케이스 5~10개 |
과제 셋을 한 번씩 돌린 이번 결과에서 분명해진 것은 순서입니다. 어느 서비스를 고르든 받은 결과를 검사할 도구가 먼저였습니다.
오늘 해 볼 체크
- 자주 맡기는 일 하나를 골라 정답을 미리 만들어 둡니다. 표라면 합계, 코드라면 입력과 기대값 몇 줄이면 됩니다.
- 세 서비스에 같은 문장을 새 대화로 넣습니다. 앞 대화의 맥락이 섞이지 않게 합니다.
- 코드와 수식은 실제 환경에서 돌립니다. "실행됨" 표시나 자신 있는 설명은 검사를 대신하지 못했습니다.
- 실패한 입력은 목록에 남깁니다. 이번의
+821012345678같은 한 줄이 다음 검사의 시험 케이스가 됩니다. - 요금은 결제 화면의 최종 금액으로 비교합니다. 달러·원화, 연간·월간, 부가세 표기가 서비스마다 다릅니다.
이번 테스트는 과제 3개를 서비스마다 한 번씩 실행한 결과입니다. 모델 설정은 화면 기본값이라 서로 달랐고, 엑셀 수식은 LibreOffice 26.2로만 계산했습니다.
재현: cinevyze-bench의 run_big3_same_task_grade.py(채점 하네스)와 big3_same_task_cases.json(과제 문장·정답표·시험 11건). 세 서비스의 응답 원문과 채점 원자료(test_runs/…)는 비공개 작업 폴더라 외부에서 열 수 없고, 같은 문장을 넣어 받은 응답을 같은 형식으로 옮기면 하네스가 채점합니다.
세 서비스의 응답은 2026년 9월 25일 크롬에서 로그인한 계정으로 받은 원문이고, 채점은 PC에서 파이썬 시험과 LibreOffice로 다시 했습니다. 과제 설계와 하네스·원고 작성에 AI 도구를 썼고, 시험 조건 승인과 발행 전 검수는 제가 맡습니다.
cinevyze 운영자 — 챗GPT·클로드·제미나이에 같은 업무 3개를 같은 문장으로 맡기고, 응답을 PC에서 다시 채점했습니다. 측정 시점은 2026년 9월 25일입니다. 운영자 소개
댓글
댓글 쓰기