글

7월, 2026의 게시물 표시

AI 이미지에 한글 글자 넣기 — 무료 로컬 SDXL로 72장, 한글을 요청한 36장에 한글은 없었습니다

이미지
「행복」을 넣은 포스터를 그려 달라고 했더니, 초록 바탕 한가운데에 이런 글자가 찍혀 나왔습니다. 「おまなちのけします。」 한글이 아니라 일본 히라가나처럼 생긴 문장입니다. 그런데 이 그림을 한국어 설정의 OCR(이미지 속 글자를 읽는 프로그램)에 넣으면 「ㅜ310104바초리」가 나옵니다. 판독에 한글 자모가 섞였으니, 자동 집계는 이 장을 「한글 글자가 나온 그림」으로 셉니다. 무료 로컬 이미지 AI로 한글 제목이 들어간 썸네일을 뽑을 수 있는지 보려고 이번에 두 SDXL 체크포인트로 포스터 72장을 그렸습니다. 짧게 답하면 안 됩니다. 요청한 문구가 정확히 나온 그림은 한글 0장, 영문 1장이었습니다. 원본을 한 장씩 분류해 보니 한글을 요청한 36장 어디에도 한글처럼 생긴 글자가 없었습니다. 이 두 모델로 한글 썸네일을 만든다면 저는 배경만 뽑고 글자는 편집기에서 얹겠습니다. 위 그림은 이 글의 다른 문제도 보여 줍니다. 저는 7월에 같은 주소에 「정답률은 둘 다 0이지만 한글 요청이 글자조차 덜 읽힌다」고 썼습니다. 그 근거가 방금 본 것 같은 OCR 문자 판정이었습니다. 7월에 쓴 결론은 이번에 재현되지 않았습니다 7월 기록(같은 두 체크포인트, 같은 요청문, 같은 생성 설정)에서 요청한 문자 체계의 글자가 OCR에 잡힌 그림은 한글 9장, 영문 23장이었고, 짝지어 비교하면 우연으로 보기 어려운 차이(p=0.0043)였습니다. 이번에는 시드만 새로 뽑아 72장을 다시 그렸습니다. 같은 문자 체계 글자가 읽힌 그림 (각 36장) 한글 요청 영문 요청 짝비교 p 7월 기록 · 한 줄 판독 9 23 0.0043 이번 72장 · 7월과 같은 한 줄 판독 19 14 0.27 이번 72장 · 네 가지 판독 중 가장 가까운 값(빈 값 포함) 20 14 0.15 이번 72장 · 비어 있지 않은 판독 우선(최종 집계) 33 35 0.63 7월과 똑같이 읽어도 방향이 뒤집혔고, 판독 규칙만 바...

AI 프롬프트를 영어로 바꿔도 60쌍 중 우열이 갈린 건 9쌍뿐이었습니다

이미지
첫 실패는 모양이 멀쩡했습니다. JSON으로 열렸고, 요구한 키도 빠짐없이 들어 있었습니다. 그런데 category 값 하나가 정답표와 달랐습니다. 한국어 지시문으로 돌린 문의 분류 과제였습니다. 형식이 깨진 게 아니라 다 읽히는데 값이 틀린 것 입니다. 한국어 프롬프트를 영어로 번역해야 답이 더 정확해지는지, 아니면 지시를 명확히 쓰는 데 시간을 써야 하는지 정하려는 분을 위해 다시 쟀습니다. 같은 구조화 과제 60개를 gemma3:4b에 두 번씩 줬습니다. 입력, 정답, 출력 형식은 고정하고 지시문만 한국어와 영어로 바꿨습니다. 총 120회입니다. 먼저 결론부터 놓겠습니다 지시문 언어 JSON 파싱 성공 스키마 준수 값까지 정답 한국어 60/60 60/60 36/60 영어 60/60 60/60 39/60 영어가 세 건 앞섰습니다. 하지만 이 숫자만 보고 「영어가 더 좋다」고 결론내리면 짝비교를 놓칩니다. API가 기록한 응답 토큰 중앙값은 두 언어 모두 76개였습니다. 지시문 쪽은 한국어 372토큰, 영어 314토큰이 중앙값이라 영어가 짧았지만, 출력 길이는 같았습니다. 같은 입력에서 두 언어 중 하나만 성공한 경우를 세니 한국어만 성공 3쌍, 영어만 성공 6쌍이었습니다. McNemar 정확검정 p값은 0.5078이었습니다. 이번 60쌍에서는 이 차이를 우연과 구분하지 못했습니다. 번역 비용을 들일 만큼 영어 우위가 확인된 결과가 아닙니다. 무엇을 같게 두고 무엇만 바꿨나 과제는 세 종류였습니다. 고객 문의를 허용된 카테고리로 분류 주문 문장에서 판매처·상품·수량을 추출 상품 설명에서 제품명·재질·재고 여부를 추출 각 과제에 입력 20개를 뒀습니다. 한국어 지시문과 영어 지시문은 같은 필드, 같은 허용값, 같은 JSON 규칙을 담았습니다. 입력 문장과 기대 정답은 바꾸지 않았습니다. 실행 순서도 한쪽으로 몰지 않았습니다. 절반은 한국어부터, 절반은 영어부터 돌려 예열이나 순서가 언어...

AI 출력 형식 JSON·CSV·마크다운 180회 비교: 파싱을 통과한 오답

이미지
코튼 파우치 C1이 CSV 응답에서는 cotton pouch C1로 나왔습니다. 파일은 문제없이 읽혔습니다. 열도 맞았고, 헤더도 맞았습니다. 같은 상품을 JSON으로 받았을 때는 한국어 이름이 그대로 남았습니다. 출력 형식을 바꿔 요청한 두 응답에서, 상품명까지 달라진 것입니다. AI 출력을 스프레드시트나 자동 처리 프로그램에 넘기려면 어떤 형식을 골라야 할까요. 이번 기록에서 JSON과 CSV는 읽어 들이는 단계까지 안정적이었습니다. 세 형식 모두 값 검사가 필요했습니다. 마크다운 표는 그보다 앞선 구조 검사에서도 실패했습니다. 이름이 바뀌어도 CSV는 읽혔습니다 상품 속성 과제 P01의 입력에는 이렇게 적혀 있습니다. 코튼 파우치 C1, 색상 베이지, 크기 20x15cm, 면 소재, 현재 재고 있음. 상품명·색상·크기·재질·재고 여부를 각각 정해진 칸으로 나누는 작업입니다. JSON 응답의 상품명 부분은 다음과 같습니다. "product": "코튼 파우치 C1", CSV 응답의 데이터 행은 달랐습니다. P01,cotton pouch C1,베이지,20x15cm,면,Y 색상부터 재고 여부까지는 같은 값이 남았습니다. 바뀐 건 상품명. 영어로 나왔습니다. 헤더와 데이터의 열 수는 맞아 CSV 파싱과 필드 검사를 모두 통과했습니다. 정답표와 값을 대조하는 단계에서 걸렸습니다. 사람이 읽으면 같은 물건을 가리킨다고 이해할 수 있습니다. 이번 과제에서는 입력에서 상품명을 추출해 지정된 값으로 남겨야 했습니다. 표기까지요. 상품명을 기준으로 다른 자료와 대조하는 작업이라면, 이런 표기 변경을 허용할지부터 정해야 합니다. 이 사례로 확인한 것은 같은 입력의 값이 형식별 응답에서 달라졌다는 사실 입니다. 사례마다 각 형식으로 한 번씩 요청했고, 생성 온도와 seed를 요청에 따로 고정하지 않았습니다. 저장된 모델 설정의 온도는 1입니다. JSON 안의 「상품문의」도 오답이었습니다 P01의 상품명은 JSON...

AI 답변 재현성 실험: 온도 0에서 답은 고정됐고 오답도 반복됐습니다

이미지
기본값과 온도 0을 같은 프롬프트에 나란히 놓았습니다. 그 옆에는 고정 시드 조건. 출력이 어디서 고정되고 어디부터는 차이를 가르기 어려운지 함께 확인했습니다. AI 답변을 자동 분류·추출 작업에 넣기 전에, 온도 0과 시드가 어디까지 결과를 고정하고 무엇을 따로 검증해야 하는지 판단하실 수 있습니다. 이번 9월의 결과는 과제마다 달랐습니다. 자유 생성에서는 선명한 차이. 분류에서는 기본값도 전부 같게 나온 칸이 있었고, 고정 시드를 더해도 온도만 낮춘 조건을 넘어서는 변화는 나타나지 않았습니다. 비교 조건을 같은 자리에 놓았습니다 gemma3:4b에 넣은 과제는 세 개. 고객 문의 10건을 다섯 분류로 나누기 발주 이메일에서 업체·담당자·품목·수량·단가·납기일·총금액 뽑기 자영업자용 블로그 제목 다섯 개 만들기 모든 과제를 같은 횟수로 반복했습니다. gemma3:4b가 72회입니다. 교차확인용 qwen3-vl:8b에는 문의 분류만 같은 방식으로 24회 돌렸습니다. 전체 96회에서 생성 실패는 없었습니다. 재현성의 기준은 하나였습니다. 출력 문자열이 서로 완전히 같은가. 구조화 과제는 JSON을 파싱한 뒤 라벨과 필드 값까지 따로 비교했고, 발주 총금액은 반복 여부와 별개로 검산했습니다. 기본값과 온도 0의 차이는 과제에 따라 갈렸습니다 과제·모델 기본값 온도 0 온도 0+시드 42 문의 분류 · gemma3:4b 100% 100% 100% 발주 추출 · gemma3:4b 100% 100% 100% 자유 제목 · gemma3:4b 0% 100% 100% 문의 분류 · qwen3-vl:8b 75% 100% 100% 주의. 이 표에서 가장 조심해서 봐야 할 칸은 발주 추출입니다. 문자열 재현율만 보면 가장 깨끗한 성공처럼 보이는 칸. 자유 생성에서는 온도 0의 역할이 선명했습니다 자영업자용 블로그 제목 다섯 개를 만드는 과제는 가능한 답의 폭이 넓었습니다. 기본값에서는...

로컬 AI 양자화 Q4 vs Q8 — 메모리 1.6배 쓴 Q8, 한국어 상식은 그대로였습니다

이미지
백두산 꼭대기 칼데라호의 이름을 물었더니, 9월에 다시 돌린 qwen2.5 7B Q4는 이렇게 답했습니다. 5. 백두산 정상에 있는 화산호의 이름은 청평사이다. 청평사는 절 이름입니다. 정답은 천지입니다. 그럼 메모리를 더 쓰는 Q8은 나았을까요. 7월에 같은 질문을 받은 Q8의 답입니다. 5. 백두산 정상에 있는 화산호(칼데라호)의 이름은 '백조 호수' 또는 '백두산 칼데라 호수'로 알려져 있습니다. 공식 명칭은 아직 확실하지 않으며, (…) 틀린 이름에 "공식 명칭은 확실하지 않다"는 말까지 붙였습니다. 두 버전, 두 달, 답 일곱 개를 통틀어 천지라는 단어는 한 번도 나오지 않았습니다. 16GB 이하 그래픽카드로 qwen2.5 7B를 돌리려는 분이 Q4_K_M과 Q8_0 사이에서 고민한다면, 이번 기록으로 드릴 수 있는 답은 이렇습니다. Q8은 GPU 메모리를 약 1.6배 쓰고 속도는 Q4의 60% 남짓이었지만, 한국사·지리 다섯 문항에서 틀리는 자리는 Q4와 같았습니다. 저라면 Q4_K_M을 받고, 남는 메모리를 Q8에 쓰지 않겠습니다. 다만 두 버전 모두 고유명사를 자신 있게 지어냈으니, 어느 쪽을 쓰든 이름·연도는 따로 확인해야 합니다. 양자화 두 단계, 무엇이 다른가 양자화는 모델 안의 숫자를 낮은 비트 수로 저장하는 방식입니다. Q4_K_M은 4비트대, Q8_0은 8비트로 줄인 버전이고, 7월에 받은 qwen2.5 7B 파일은 Q4_K_M이 4.68GB, Q8_0이 8.1GB였습니다. 비트를 많이 남길수록 원래 모델에 가깝고, 대신 메모리를 더 씁니다. 여기까지는 일반론이고, 궁금한 건 그 차이가 한국어 답에서 실제로 보이느냐입니다. 그래서 세 가지 고정 과제를 두 버전에 똑같이 넣었습니다. 커피 추출 방식에 관한 글을 핵심 5문장으로 요약하기, 중복을 지우고 내림차순 정렬하는 파이썬 함수 짜기, 그리고 한국사·지리 다섯 문항입니다. 다섯 문항 중 두 개는 일부러 틀린 전제를 깔았습니...

로컬 비전 AI 실측 — 메뉴·차트·표는 둘 다 맞혔고, 원 세기에서 갈렸습니다

이미지
흰 바탕에 빨간 원 셋, 파란 원 하나, 파란 네모 둘, 초록 세모 하나가 흩어진 그림을 보여 주고 "이 그림에 빨간색 원은 몇 개 있어?"라고 물었습니다. 로컬 비전 AI qwen2.5vl 7B의 답은 이랬습니다. 이 그림에는 총 4개의 빨간색 원이 있습니다. 세 번 물었고 세 번 모두 같은 문장이었습니다. 같은 그림을 받은 qwen3-vl 8B는 세 번 모두 3개라고 답했는데, 답을 내기 전에 이런 메모를 따로 남겼습니다. 1. Top left: red circle. 2. Middle right: red circle (the one between blue squares). 3. Bottom right: red circle. Wait, let me check again. (…) So three red circles. 내 PC의 무료 로컬 비전 AI로 메뉴판·차트·표 같은 이미지를 읽히려는 분이라면, 두 모델 중 무엇을 받을지와 어떤 질문은 믿으면 안 되는지가 궁금할 겁니다. 이번 결과로 드릴 수 있는 답은 이렇습니다. 또렷하게 인쇄된 글자와 숫자를 읽는 질문은 두 모델 모두 9번 중 9번 맞혔습니다. 개수를 세는 질문에서만 갈렸습니다. qwen2.5vl은 빠르지만 세기를 틀렸고, qwen3-vl은 맞혔지만 답마다 3배쯤 오래 걸렸습니다. 저라면 읽기용은 qwen2.5vl, 세기·비교처럼 틀리면 곤란한 질문은 qwen3-vl로 나누겠습니다. 네 장의 이미지, 네 개의 질문 이미지는 정답을 미리 알 수 있게 직접 만든 합성 그림 4장입니다. 각 이미지에 질문 하나씩을 고정했습니다. 이미지 질문 정답 카페 메뉴판(메뉴 6개와 가격) 가장 비싼 메뉴와 그 가격은? 콜드브루 6,000원 1~6월 매출 막대차트 매출이 가장 높은 달은? 4월(90만원) 두 팀의 국어·영어·수학 점수표 총점이 더 높은 팀과 두 팀 총점은? B팀(A팀 250, B팀 265) 도형 7개가 흩어진 그림 빨간색 원은...

무료 로컬 AI 맞춤법 교정 60번 — 심어 둔 오류 50개, 세 번씩 돌려도 절반도 못 고쳤습니다

이미지
「다음 글의 맞춤법과 띄어쓰기만 고쳐 주세요. 문장 구조와 표현은 바꾸지 말고, 고친 글만 출력해 주세요.」 이 지시와 함께 「박서연 대리님께 다음 주에 뵈요라고 메시지를 보냈다.」가 든 초안을 넣었습니다. 무료 로컬 AI qwen3-vl:8b가 돌려준 문장은 이랬습니다. 박서연 대리님께 다음 주에 뵠요라고 메시지를 보냈다. 「뵈요」의 표준 표기는 「봬요」입니다. 모델은 틀린 글자를 지우고 없는 글자를 넣었습니다. 같은 조건의 다른 회차에서는 「왠만하면 무료 요금제로」가 이렇게 돌아왔습니다. Gwen만하면 무료 요금제로 버티려고 했다. 이 글은 무료 로컬 AI에 한국어 맞춤법 교정이나 문장 다듬기를 맡기려는 독자가 어떤 지시를 쓸지, 결과에서 무엇을 다시 확인할지, 기본 설정 그대로 돌려도 되는지를 정하도록 돕는 기록입니다. 결론부터 말하면 이번 테스트에서 맞춤법만 고치라고 했을 때 심어 둔 오류 50개를 세 번씩, 모두 150자리를 돌려 53자리를 고쳤고 71자리는 그대로 남겼습니다. 다듬어 달라고 했을 때는 30회 중 22회가 반말 초안을 「습니다」체로 바꿨습니다. 그리고 Ollama 서버 기본 설정 그대로는 대부분 빈 답이 나왔습니다. 오류 자리를 정해 두고 60번 교정시켰습니다 7월 첫 기록은 지문 하나를 「자연스럽게 다듬어줘」 지시로 4번 넣은 것이었습니다. 그래서는 모델이 무엇을 고치고 무엇을 놓쳤는지 셀 수 없습니다. 이번에는 자리를 정해 두고 셌습니다. 초안 10개 — 135~232자의 짧은 글입니다. 초안마다 흔히 틀리는 표준 맞춤법 오류를 5개씩 심어 모두 50자리를 만들었습니다. 첫 초안(D01)은 7월에 쓴 지문 그대로입니다. 조건 2개 — ①「맞춤법과 띄어쓰기만 고쳐 주세요. 문장 구조와 표현은 바꾸지 말고…」 ②「이 글을 자연스럽고 매끄럽게 다듬어줘. 의미는 바꾸지 말고.」(7월 지시문 그대로) 반복 3회 — 조건마다 초안 10개를 세 번씩, 모두 60회 돌렸습니다. 온도는 모델 기본값인 1이라 회차마다 답이 ...

무료 로컬 AI 한국 상식 함정질문 144번 — 전제는 바로잡고 또 지어냈습니다

이미지
「한국은행 만 원권 앞면에 그려진 인물은 누구인가요?」 정답은 세종대왕입니다. 무료 로컬 AI qwen3-vl:8b는 이 질문에 네 번 답했고, 네 번 모두 다른 사람을 댔습니다. 한국은행 만 원권 앞면에 그려진 인물은 이순신 입니다. 한국은행 만 원권(10,000 원권) 앞면에 그려진 인물은 박정희 입니다. … 현재 한국은행 발행의 만 원권은 그의 초상이 앞면에 배치되어 있으며, 이는 2013년 재설계 이후에도 유지되고 한국은행 만 원권(10,000 원권) 앞면에 그려진 인물은 성종 (King Seongjong)입니다. 성종은 조선 Dynasty의 제5대 왕으로, 1468년부터 1495년까지 재위했습니다. 한국은행 만 원권(10,000원권) 앞면에 그려진 인물은 김종숙 (Kim Jong-suk)입니다. … 이 정보는 한국은행 공식 자료 및 역사적 기록에 따르는 내용입니다. 뒤의 두 답은 「모르거나 존재하지 않는 전제가 깔린 질문이면 지어내지 말고 '모른다'고 정직하게 답해 주세요」라는 지시를 붙인 뒤에 나왔습니다. 그 한 줄을 넣고도 「모른다」 대신 재위 연도와 출처까지 붙인 답이 돌아왔습니다. 무료 로컬 AI에 한국 상식이나 역사 질문을 맡길 생각이라면, 답을 그대로 써도 되는 경우와 따로 대조해야 하는 경우부터 갈라 두는 편이 낫습니다. 이번 테스트에서 qwen3-vl:8b는 틀린 전제는 대부분 알아챘지만, 바로잡는 답 안에 또 다른 사실을 지어 넣었습니다. 정직 지시 한 줄은 그 지어냄을 줄였고, 대신 맞는 질문 몇 개를 「모른다」로 버리게 했습니다. 질문 24개를 두 가지 지시로 세 번씩 물었습니다 질문은 두 종류입니다. 하나는 정답이 정해진 한국 상식 12개로, 한글을 만든 왕, 백두산 칼데라호의 이름, 광복절 날짜 같은 것입니다. 정답은 한국민족문화대백과사전과 한국은행 자료로 확인해 문항 파일에 출처와 함께 적었습니다. 다른 하나는 사실과 다른 전제를 깐 함정 12개입니다. 「임진왜란이 발발한 1682년 당시의 국왕...

무료 로컬 AI, 내 그래픽카드론 몇 B까지 돌까 — qwen2.5 7B는 VRAM 4.75GB, 14B는 9.7GB였습니다

이미지
같은 요약 요청을 넣었는데, 7월에 qwen2.5 7B가 내놓은 답은 이렇게 시작했습니다. 커피의 추출 방식은 드립, 에스프레소, 침지식으로 나分け,并用中文总结为以下五句话: 1. 咖啡的萃取方式决定了即使是同一种咖啡豆也能产生完全不同的口感…… 한국어 문장이 끝나기도 전에 일본어 한 조각을 지나 중국어 요약으로 넘어갔습니다. 이 출력의 한글은 21자, 한자는 373자입니다. 7월에 같은 입력으로 두 번 돌렸고, 그중 한 번이 이랬습니다. 9월에 같은 모델 파일로 같은 요청을 세 번 다시 넣었을 때는 세 번 모두 한국어로 끝까지 답했습니다. 모델은 GPU 메모리 약 4.75GB를 차지했고, 초당 117토큰쯤을 뽑았습니다. 내 PC 그래픽카드로 무료 로컬 AI를 돌려 보려는 분이라면 몇 B짜리 모델까지 GPU에 올라가는지와, 크기를 키우면 얼마나 느려지는지가 궁금할 겁니다. 이번 9월 재측정과 같은 PC의 7월 기록을 합친 답은 이렇습니다. qwen2.5는 7B가 GPU 메모리 약 4.75~4.9GB, 14B가 9.7GB를 썼습니다. 크기가 두 배가 될 때마다 생성 속도는 대략 절반으로 줄었습니다. 저라면 VRAM 8GB 카드에서는 7B, 12GB 이상에서는 14B를 후보로 두겠습니다. 다만 7B에서도 답이 다른 언어로 새는 경우가 있으니 결과 언어는 한 번 훑어봅니다. 9월: 7B를 같은 요청으로 세 번 돌렸습니다 측정 PC의 그래픽카드는 RTX 4070 Ti SUPER(VRAM 16GB)입니다. 로컬 AI 실행 도구 Ollama로 qwen2.5:7b(Q4_K_M 양자화, 약 4.7GB 파일)를 올리고, 커피 추출 방식에 관한 976자 글을 「핵심 5문장으로 요약해 줘. 원문에 없는 내용은 추가하지 마」라는 요청과 함께 순서대로 세 번 넣었습니다. 7월에 쓴 입력과 바이트까지 같은 글입니다. 측정 시점은 2026년 9월입니다. 회차 요청 전체 시간 생성 시간 생성 속도 GPU 메모리 1 5.245초 2.34초 117.45토큰/초...

AI 문서요약 정확도 실측: 3문장과 8문장의 차이

이미지
AI 문서요약에서 가장 먼저 정할 것은 모델이 아니었습니다. 몇 문장까지 허용할지였습니다. 2026년 9월 22일, 내가 로컬 gemma3:4b와 클라우드 Gemini 3.8 Flash High에 같은 문서들을 넣어 72회 요약했습니다. 채점 기준은 돌리기 전에 먼저 고정해 두었습니다. 완전통과는 로컬이 36번 중 6번, 클라우드가 36번 중 14번이었습니다. 클라우드가 더 많이 통과했지만, 세 문장으로 제한하자 양쪽 모두 12번 중 한 번도 핵심 다섯 항목을 전부 남기지 못했습니다. 핵심을 빠뜨리면 안 되는 문서를 요약하려는 분이라면 선택 기준은 여기서 갈립니다. 짧은 요약이 필요할수록 더 강한 모델만 찾기보다, 먼저 반드시 남길 항목과 최소 문장 수를 정해야 합니다. 내가 세운 기준으로 72회를 다시 훑어봤을 때 원문 밖의 숫자, 원문과 반대되는 주장, 폐기된 수치를 최종 사실처럼 쓴 사례는 양쪽 모두 0건이었습니다. 완전통과하지 못한 응답들은 모두 핵심 슬롯을 하나 이상 빠뜨렸습니다. 일부는 문장 수도 어겼지만, 공통으로 걸린 실패는 누락이었습니다. 자연스러운 세 문장이 핵심 세 덩어리를 지웠습니다 첫 응답부터 그 차이가 드러났습니다. 936자짜리 커피 설명문을 로컬 모델에 주고 세 문장으로 요약하라고 요청했습니다. 응답에는 이런 문장이 들어 있었습니다. "커피 추출 방식에 따라 같은 원두라도 다양한 맛을 낼 수 있으며, 드립, 에스프레소, 침지식 등이 대표적이다." 이어지는 두 문장도 문법상 자연스러웠습니다. 드립은 깔끔한 맛, 에스프레소는 농축된 맛, 프렌치프레스는 묵직한 맛이라고 정리했고 마지막에는 분쇄도·온도·시간을 조절해야 한다고 썼습니다. 문장 수 역시 정확히 세 개였습니다. 원문에 없는 숫자도 보태지 않았습니다. 그래도 내가 세운 항목표와 대조한 채점 결과는 실패였습니다. 세부 항목을 대조하자 드립의 추출 원리, 에스프레소의 압력 특성, 침지식과 함께 설명된 콜드브루가 빠져 있었습니다. 핵심 슬롯 다섯 개 ...

무료 로컬 코드 AI, 전용 모델이 꼭 필요할까 — qwen2.5-coder vs gemma3 파이썬 48사례 실측

이미지
코드 전용 모델 qwen2.5-coder:7b에게 버그가 있는 함수를 주고 고쳐 달라고 했습니다. 요청은 이랬습니다. 다음 파이썬 함수의 버그를 고쳐줘. 두 딕셔너리의 같은 키 값은 더하고, 한쪽에만 있는 키도 남겨야 해. 입력 left와 right는 바꾸지 않고 새 dict를 반환해. 수정한 함수 코드를 보여줘. ```python def merge_counts(left, right): result = left for key, value in right.items(): result[key] = value return result ``` 첫 번째 답은 코드보다 설명을 먼저 내놓았습니다. 주어진 함수는 right 딕셔너리의 모든 키-값 쌍을 left 딕셔너리에 덮어쓰기 때문에, 같은 키 값은 더해지지 않고 대신 덮어써집니다. 또한, right 딕셔너리에만 있는 키도 left 딕셔너리에 포함되지 않습니다. 두 번째 문장은 틀렸습니다. 원래 코드의 result[key] = value 는 right에만 있는 키도 그대로 넣습니다. 원래 코드의 결함은 값을 더하지 않고 덮어쓴다는 것과, result = left 때문에 입력 left를 직접 바꾼다는 것입니다. 그런데 이 답이 내놓은 코드( left.copy() 로 복사한 뒤 같은 키는 더하는 코드)는 채점 사례 5개를 모두 통과했습니다. 코드는 맞고, 코드 앞의 설명이 틀린 답이었습니다. 내 PC에서 무료 로컬 AI로 짧은 파이썬 함수를 짜려는데 코드 전용 모델을 따로 받아야 하는지 고민이라면, 이번 테스트의 답은 이렇습니다. 범용 모델 gemma3:4b와 코드 전용 qwen2.5-coder:7b 모두 파이썬 과제 3개의 고정 사례 48개를 전부 통과했습니다. 이 범위에서 전용 모델의 정확도 우위는 보이지 않았습니다. qwen2.5-coder가 응답을 더 빨리 끝냈지만, 토큰을 더 빨리 뽑아서가 아니라 답을 짧게 써서였습니다. 저라면 이미 gemma3:4b를 쓰고 있을 때 짧은 함수 작성만을 위해 코드...