글

6월, 2026의 게시물 표시

챗GPT·클로드·제미나이 비교 — 같은 업무 3개, 틀린 건 휴대폰 번호 한 줄이었습니다

이미지
+821012345678 휴대폰 번호를 공백 없이 국가번호째 붙여 적은 한 줄입니다. 이 값을 ChatGPT가 짜 준 함수에 넣자 돌아온 답은 None 이었습니다. 기대한 값은 010-1234-5678 이었습니다. 같은 문장으로 부탁한 Claude와 Gemini의 함수는 이 줄을 제대로 바꿨습니다. 챗GPT·클로드·제미나이 중 무엇을 결제할지 고민하는 분이라면, 개인 요금표와 같은 업무 3개의 채점 결과를 나란히 보고 내 일에 맞는 쪽과 결과를 따로 검사해야 할 지점을 고를 수 있습니다. 짧은 답부터 적습니다. 쉬운 표 집계는 셋 다 맞혔습니다. 차이는 "그럴듯한 코드와 수식을 그대로 붙여 넣어도 되는가"에서 났고, 그 답은 세 곳 모두 "시험해 보기 전에는 모른다"였습니다. 이번 결과에서 차이를 가른 것은 받은 코드를 돌려 볼 시험 케이스가 먼저 있는가였습니다. 세 곳에 같은 문장 세 개를 넣었습니다 2026년 9월 25일, 세 서비스의 웹 화면에서 새 대화를 열고 같은 과제 문장을 하나씩 넣었습니다. 과제는 정답을 기계로 확인할 수 있는 것만 골랐습니다. 과제 부탁한 일 채점 방법 T1 표 집계 매출 12줄(환불 2줄 포함)을 지역별로 합산 정답표와 숫자 대조 T2 엑셀 수식 날짜 일부가 텍스트로 저장된 시트에서 2026년 9월 합계 수식 1개 시험 시트에 넣고 LibreOffice로 계산 T3 파이썬 함수 한국 휴대폰 번호를 010-1234-5678 형식으로 바꾸는 함수 입력 11건을 실제로 실행 모델과 추론 설정은 손대지 않았습니다. 화면에 떠 있던 기본값이 ChatGPT는 gpt-5-6-thinking(매우 높음), Claude는 Opus 5.5(중간), Gemini는 Flash(Extended)였습니다. 셋의 설정이 서로 다르니 이 글은 모델 순위표가 아닙니다. 평소 여는 화면 그대로 일을 맡겼을 때의 기록입니다. 채점은 응답을 받은 뒤 PC에서 따로...

AI한테 일 시키는 법 — 프롬프트 4칸 공식(같은 모델에 18번 넣어 재봤습니다)

이미지
프롬프트를 자세히 쓰면 AI가 지시를 더 잘 따를까요? 저는 막연한 한 줄 지시와 역할·맥락·작업·출력형식으로 나눈 4칸 지시를 같은 모델에 넣어 비교했습니다. 결과는 과업에 따라 갈렸습니다. 이메일과 비교표에서는 네 칸이 정확히 먹혔습니다. 자유롭게 문장을 써야 하는 소개글에서는 글자수와 문단수를 세 번 모두 어겼습니다. 요구를 적어 주는 것과 그 요구가 지켜지는 것은 같은 일이 아니었습니다. AI에게 프롬프트를 길게 쓸지 고민하는 분이라면, 4칸 공식이 잘 먹히는 작업과 별도 검사가 필요한 조건을 이번 18회 결과로 가를 수 있습니다. 42개 조건에서 과업별 차이가 드러났습니다 제가 사용한 네 칸은 다음과 같습니다. 칸 적는 내용 이번 테스트의 예 역할 어떤 입장에서 답할지 중소 제조업체 영업 담당자 맥락 독자·상황·제약 부품 수급 문제로 납품이 2주 지연됨 작업 무엇을 만들지 사과와 새 납품일을 담은 이메일 작성 출력형식 결과를 어떻게 검사할지 첫 줄 문구, 문단 수, 글자수, 날짜, 존댓말 앞의 세 칸은 모델이 무엇을 써야 하는지 좁힙니다. 마지막 칸은 결과를 받은 사람이 무엇을 확인할지 정합니다. 막연한 지시에는 결과물을 검사할 세부 조건이 거의 없었습니다. 4칸 지시에는 회차를 합쳐 42개의 검사 가능한 조건 이 생겼습니다. 저는 두 지시 방식에 서로 다른 채점 기준을 적용했기 때문에 이를 하나의 향상률로 계산하지 않았습니다. 막연한 지시는 요청한 종류의 산출물이 나왔는지만 봤습니다. 소개글이면 소개글 형태의 글, 이메일이면 이메일로 보이는 글, 비교라면 두 개 이상의 도구를 언급한 글이 나오면 통과입니다. 4칸 지시는 지정한 글자수, 문단수, 날짜, 첫 줄, 표 개수와 열 이름까지 하나씩 검사했습니다. 오른쪽 두 칸을 나란히 보시면, 어떤 과업에서 명시 요구가 지켜졌고 어느 과업에서 완전준수가 깨졌는지 확인할 수 있습니다. 지시·과업 검사 결과 완전준수 출력 ...

로컬 AI 번역에 용어·문체를 함께 걸었더니 3/9가 같은 곳에서 실패했습니다

이미지
로컬 AI 번역에 용어표와 문체 지시를 함께 넣으면 더 안전해질까요? 이번 36회 측정에서는 그렇지 않았습니다. 기본 번역, 용어 고정, 문체 고정은 각각 9번 모두 미리 정한 계약을 통과했습니다. 두 지시를 함께 넣은 조건은 9번 중 6번만 통과했습니다. 실패는 아무 곳에서나 나오지 않았습니다. 기술 설명과 비즈니스 메일은 결합 조건에서도 모두 통과했고, 캐주얼 후기만 세 번 연속 같은 용어를 바꿨습니다. 계정이나 클라우드 API 없이 로컬에서 번역하려는 분이라면 결론은 간단합니다. 용어와 문체를 함께 지시해도, 중요한 용어는 출력 뒤에 다시 확인해야 합니다. 원문 3종에 지시 조건을 네 가지로 바꿨습니다 저는 2026년 9월 로컬 Ollama에서 gemma3:4b Q4_K_M을 순차 실행했고, 6월 측정에 썼던 영어 원문 세 종을 그대로 입력했습니다. 기술 설명: 대규모 언어 모델의 대기 시간·처리량·묶음 처리·양자화 캐주얼 후기: 설치 과정, 배터리, 2주 연속 사용 언급, 최종 추천 비즈니스 메일: 배송 지연 원인, 영업일 기준 3일, 10% 크레딧 각 원문에는 네 가지 지시 조건을 적용했습니다. 지시문을 한국어와 영어로 바꿨을 때의 차이는 한영 프롬프트 지시 언어 실측 에서 따로 확인할 수 있습니다. 조건 번역 지시 기본 자연스러운 한국어 번역, 번역문만 출력 용어 고정 기본 지시 + 핵심 영문을 지정한 한국어로 번역 문체 고정 기본 지시 + 원문에 맞춘 종결형 사용 결합 용어 고정과 문체 고정을 동시에 요구 세 입력에 네 조건을 적용하고 각각 세 번 반복해 36회가 됐습니다. 모든 요청은 temperature 0, seed 13으로 실행했습니다. keep_alive는 0이라 매 요청의 전체 대기시간에 모델 적재 시간이 포함될 수 있습니다. 저는 실행 로그와 집계표를 대조해 36회 모두 유효 응답이고 인프라 오류는 0건임을 확인했습니다. 여기서 "통과"는 번역이 ...

엑셀 CSV 12개 취합, AI가 짠 스크립트 10개로 돌려봤습니다 — 한글 CSV(CP949) 앞에서 8개가 멈췄습니다

이미지
AI가 짠 첫 스크립트는 원본 CSV 12개를 합쳐 정답과 한 행도 다르지 않은 결과를 냈습니다. 같은 스크립트에 같은 내용의 파일을 인코딩만 바꿔 넣자 첫 파일의 첫 데이터 행에서 멈췄습니다. UnicodeDecodeError: 'utf-8' codec can't decode byte 0xc7 in position 32: invalid continuation byte 바꾼 것은 글자를 저장하는 방식 하나입니다. UTF-8 대신 한국어 윈도우 환경의 한글 인코딩인 CP949로 다시 쓴 파일이었습니다. 0xc7은 첫 데이터 행의 상품명 「USB허브」에서 한글이 시작되는 바이트입니다. 스크립트는 파일을 UTF-8로만 읽게 짜여 있었습니다. 반복되는 엑셀 취합을 AI 스크립트로 자동화하려 한다면, 스크립트를 받은 뒤 어떤 파일로 먼저 시험할지부터 정해 두는 편이 낫습니다. 이번 테스트에서 Gemini 3.1 Pro가 짠 스크립트 10개는 UTF-8 파일에서는 10개 모두 정확했고 한 번 도는 데 0.03초대였습니다. CP949 파일을 읽은 스크립트는 10개 중 2개였고, 그 2개는 모두 지시문에 「이 CSV들은 엑셀에서 저장한 파일이다」 한 줄을 더했을 때 나왔습니다. UTF-8 파일에서는 10개 모두 정답이었습니다 과제는 6월 첫 기록의 지시문 그대로입니다. 월별 매출 파일 12개(컬럼 date·item·amount)를 합쳐 ①완전히 같은 행을 중복 제거하고 ②날짜순으로 정렬해 ③merged.csv로 저장하고 ④월별 합계를 출력하는 파이썬 스크립트를, 표준 라이브러리만으로 짜 달라는 요청입니다. 정답은 스크립트와 따로 계산했습니다. 12개 파일은 모두 12,991행이고, 완전히 같은 행 957개를 빼면 12,034행이 남습니다. 채점은 스크립트를 임시 폴더에서 실행한 뒤 merged.csv의 행이 정답 12,034행과 하나하나 같은지, 날짜순인지, 헤더가 맞는지, 콘솔에 찍힌 12개월 합계가 정답과 같은지 봅니다. 원본 파일에서는...

무료 AI 이미지 업스케일러(APISR) 실측 — 점수는 단순 확대가 이겼고, 차트 숫자는 AI가 지웠습니다

이미지
왼쪽이 원본, 가운데가 단순 확대, 오른쪽이 AI 업스케일러입니다. 오른쪽이 가장 또렷해 보입니다. 선이 진하고 격자도 선명합니다. 그런데 세로축을 보면 원본의 「4」, 「50」, 「36」, 「27」이 오른쪽에서는 짧은 막대와 점으로 바뀌었습니다. 흐릿한 가운데 그림에는 숫자 모양이 남아 있습니다. 작은 그림을 키워 블로그에 올리려는 분이라면 무료 AI 업스케일러를 쓸지, 이미지 편집기의 기본 확대로 충분할지가 궁금할 겁니다. 이번에 무료 로컬 업스케일러 APISR 4x로 일러스트 3장을 키워 본 답은 이렇습니다. 원본과 얼마나 같은지를 재는 점수로는 3장 중 2장에서 단순 확대가 이겼습니다 . 눈으로 보면 AI 쪽이 또렷했지만, 차트처럼 작은 숫자가 있는 그림에서는 그 숫자를 지웠습니다. 저라면 마스코트 같은 단순한 그림에는 AI 업스케일러를 쓰고, 숫자나 글자가 있는 그림에는 쓰지 않겠습니다. 원본을 줄였다가 다시 키워 비교했습니다 비교 기준이 있어야 해서, 원본이 있는 그림으로 시험했습니다. 로컬에서 직접 생성한 1024px 일러스트 3장(마스코트, 파스텔톤 차트 화면, 스티커가 많은 구름 캐릭터)을 256px로 줄였습니다. 이 작은 그림을 두 방식으로 다시 1024px로 키웠습니다. Lanczos : 이미지 편집기에서 흔히 쓰는 단순 확대 방식입니다. 픽셀 사이를 계산으로 메웁니다. APISR 4x : 애니메이션·일러스트 복원용으로 공개된 무료 업스케일 모델입니다. RTX 4070 Ti SUPER에서 로컬로 돌렸습니다. 그다음 두 결과를 원본과 비교했습니다. 점수는 두 가지입니다. PSNR은 픽셀 값이 원본과 얼마나 가까운지(높을수록 가깝습니다), SSIM은 밝기·대비·구조가 얼마나 닮았는지(1에 가까울수록 닮았습니다)를 봅니다. 측정 시점은 2026년 9월입니다. 점수: 마스코트만 AI가 이겼습니다 원본 대비 Lanczos PSNR APISR PSNR Lanczos SSIM APISR SSIM 마스코트 27....

로컬 AI 이미지 생성(SDXL)으로 블로그 일러스트 12장 — 장당 6초, 아이콘으로 바로 쓸 건 0장이었습니다

이미지
「귀여운 구름 캐릭터, 작은 번개, 흰 배경, 앱 아이콘 스타일」을 주문하고 받은 그림입니다. 구름은 가운데에 있고 배경도 하얗습니다. 그런데 주변을 하트, 버튼 모양 조각, 작은 고양이 얼굴이 빼곡히 채웠습니다. 이번 테스트의 자동 판정은 이 장을 통과 로 셌습니다. 네 모서리가 흰색이었기 때문입니다. 무료 로컬 이미지 AI로 블로그 삽화를 뽑으려는 분이 궁금한 건 대개 세 가지입니다. 한 장에 얼마나 걸리는지, 바로 쓸 수 있는 그림이 나오는지, 마음에 든 그림을 다시 뽑을 수 있는지. 이번에 RTX 4070 Ti SUPER에서 SDXL 체크포인트 하나로 12장을 뽑아 본 답은 이렇습니다. 첫 장을 빼면 장당 6초 남짓 이었고, 마스코트와 책상 썸네일은 절반 넘게 그대로 쓸 만했지만 앱 아이콘은 4장 중 한 장도 그대로 쓸 수 없었습니다. 같은 시드로 3개월 전에 뽑은 그림은 거의 그대로 다시 나왔습니다. 주문 세 가지를 네 장씩 뽑았습니다 체크포인트는 애니메이션·일러스트 계열 SDXL 모델인 Animagine XL 4.0 Opt 하나입니다. 로컬 ComfyUI에서 1024×1024, 26단계, CFG 6.5, Euler ancestral로 고정하고 프롬프트만 바꿨습니다. 네거티브 프롬프트에는 저해상도·손 뭉개짐 같은 흔한 항목과 함께 「text, watermark, signature」를 넣었습니다. 마스코트 : 렌치를 든 친근한 로봇, 플랫 벡터, 굵은 외곽선, 흰 배경, 가운데 배치 블로그 썸네일 : 차트가 뜬 노트북, 머그컵, 작은 화분이 있는 아늑한 책상, 파스텔톤 앱 아이콘 : 작은 번개를 단 웃는 구름 캐릭터, 스티커 스타일, 흰 배경 주문마다 시드를 하나씩 올려 가며 네 장씩, 모두 12장입니다. 자동 판정은 흰 배경을 요청한 8장에 대해서만 했습니다. 네 모서리 조각의 절반 이상이 흰색이면 통과입니다. 12장은 원본 크기로 한 장씩 열어 요청 조건과 대조했습니다. 이 대조의 1차 분류는 AI 도구가 했고, 발행 전 검수에서...

로컬 AI gemma3를 어디까지 믿을까 — Gemini와 같은 날 18번 재봤습니다

이미지
"침지식 중 프렌치프레스는 굵게 간 원두를 오래 담가 묵직한 바디감을 제공한다." 정확히 다섯 문장이었습니다. 드립, 에스프레소, 침지식, 분쇄도와 온도까지 들어갔습니다. 얼핏 보면 제법 잘 압축한 요약입니다. 그런데 원문에 있던 콜드브루 한 장면이 통째로 사라졌습니다. 로컬 AI로 코딩·요약·번역을 처리해도 될지 고민하는 분이라면, gemma3:4b에 바로 맡길 일과 클라우드 또는 후처리 검사가 필요한 일을 이번 같은 날 대조로 가를 수 있습니다. 먼저 짧은 답부터 말하겠습니다. 작고 빠른 로컬 모델도 단순 코딩에서는 클라우드와 나란히 통과했지만, 빠뜨리면 안 되는 내용을 압축하거나 정해진 용어로 번역하는 일에서는 검사가 필요했습니다. 저는 이 결과를 보고 사내에서 쓰는 작은 스크립트는 로컬로 돌리기로 했습니다. 검사가 붙는 요약과 번역은 통과할 때까지 다시 돌리거나 클라우드로 넘깁니다. 그 차이는 문장이 자연스러운지만 읽어서는 잘 보이지 않았습니다. 첫 실패는 5문장 안에 숨어 있었습니다 2026년 9월 21일, 저는 로컬 gemma3:4b와 구독형 Gemini 3.1 Pro (High)에 같은 세 과업을 맡겼습니다. 코딩, 요약, 번역을 각각 세 번씩 실행해 모두 18개 응답을 얻었습니다. 세 과업의 순서는 한쪽이 늘 먼저 나오지 않도록 회전했습니다. 로컬 요청은 Ollama의 HTTP API로 보냈고, 매번 keep_alive=0 을 적용했습니다. 따라서 로컬 시간에는 모델을 다시 불러오는 콜드 로드도 들어갑니다. 첫 계약 실패는 세 번째 응답에서 나왔습니다. 로컬 모델의 첫 요약이었습니다. "커피의 추출 방식에 따라 같은 원두라도 다른 맛을 낼 수 있으며, 드립, 에스프레소, 침지식 등이 대표적이다." "침지식 중 프렌치프레스는 굵게 간 원두를 오래 담가 묵직한 바디감을 제공한다." "추출 결과는 분쇄도, 물 온도, 추출 시간 등 변수 조절을 통해 원하는 맛에 맞게 결정...

Gemini 3.1 Pro에 코딩·요약·번역 54번 시켜봤습니다 — 생각 수준을 low로 내려도 채점 결과는 떨어지지 않았습니다

이미지
커피 추출 방식을 다룬 글을 주고 「핵심 5문장으로 요약해줘. 원문에 없는 내용은 추가하지 마」라고 했습니다. 다섯 번째 반복에서 돌아온 답의 첫 줄과 넷째 문장입니다. 원문을 바탕으로 요약한 핵심 5문장입니다. 4\. 이러한 커피의 추출 결과를 좌우하는 3가지 핵심 변수는 원두의 분쇄도, 물의 온도, 물과 원두가 닿는 시간입니다. 두 군데가 걸립니다. 요약만 달라고 했는데 요약 앞에 머리말이 붙었습니다. 그리고 「3가지」는 원문에 없는 숫자입니다. 원문은 변수 세 개를 나열만 했고, 모델이 그것을 세어 붙였습니다. 이번 테스트에서 채점기에 걸린 것은 이 「3가지」가 전부입니다. Gemini 3.1 Pro에 코딩·요약·번역 과제를 생각 수준 high와 low로 9번씩, 모두 54번 넣었고, 채점 결과가 어긋난 회차는 요약 두 번뿐이었습니다. 그 두 번도 생각을 더 많이 하는 high 쪽에서 나왔습니다. 그래서 짧은 실무 과제를 맡길 때 생각 수준을 어디에 둘지는 품질보다 시간과 토큰 으로 정하게 됩니다. low는 과업마다 채점 결과가 떨어지지 않았고, 번역은 응답 시간 중앙값이 34% 줄었습니다. 대신 받은 답을 그대로 붙여 넣기 전에 지울 것이 과업마다 하나씩 있었습니다. 요약 18번, 머리말은 18번 다 붙었습니다 요약은 조건을 잘 지켰습니다. 18번 모두 번호 붙은 다섯 문장이었고, 원문의 추출 방식 네 가지(드립·에스프레소·침지식·콜드브루)와 핵심 변수 세 가지를 빠뜨린 요약은 없었습니다. 다만 18번 모두 요약 앞에 한 줄이 먼저 나왔습니다. 「원문에서 추출한 핵심 5문장 요약입니다」, 「원문을 바탕으로 요약한 핵심 5문장입니다」처럼 문구만 조금씩 달랐습니다. 채팅 창에서 읽을 때는 아무 문제가 없습니다. 이 답을 보고서나 스크립트로 그대로 옮기는 자리라면 매번 첫 줄을 지워야 합니다. 채점기는 번호 붙은 줄만 요약으로 세도록 짜서 이 머리말을 점수에 넣지 않았습니다. 원문 밖 숫자는 채점기가 요약 본문의 아라비아 숫자를 모두 뽑아 원문...