글

라벨이 AI 이미지·디자인인 게시물 표시

AI 이미지에 한글 글자 넣기 — 무료 로컬 SDXL로 72장, 한글을 요청한 36장에 한글은 없었습니다

이미지
「행복」을 넣은 포스터를 그려 달라고 했더니, 초록 바탕 한가운데에 이런 글자가 찍혀 나왔습니다. 「おまなちのけします。」 한글이 아니라 일본 히라가나처럼 생긴 문장입니다. 그런데 이 그림을 한국어 설정의 OCR(이미지 속 글자를 읽는 프로그램)에 넣으면 「ㅜ310104바초리」가 나옵니다. 판독에 한글 자모가 섞였으니, 자동 집계는 이 장을 「한글 글자가 나온 그림」으로 셉니다. 무료 로컬 이미지 AI로 한글 제목이 들어간 썸네일을 뽑을 수 있는지 보려고 이번에 두 SDXL 체크포인트로 포스터 72장을 그렸습니다. 짧게 답하면 안 됩니다. 요청한 문구가 정확히 나온 그림은 한글 0장, 영문 1장이었습니다. 원본을 한 장씩 분류해 보니 한글을 요청한 36장 어디에도 한글처럼 생긴 글자가 없었습니다. 이 두 모델로 한글 썸네일을 만든다면 저는 배경만 뽑고 글자는 편집기에서 얹겠습니다. 위 그림은 이 글의 다른 문제도 보여 줍니다. 저는 7월에 같은 주소에 「정답률은 둘 다 0이지만 한글 요청이 글자조차 덜 읽힌다」고 썼습니다. 그 근거가 방금 본 것 같은 OCR 문자 판정이었습니다. 7월에 쓴 결론은 이번에 재현되지 않았습니다 7월 기록(같은 두 체크포인트, 같은 요청문, 같은 생성 설정)에서 요청한 문자 체계의 글자가 OCR에 잡힌 그림은 한글 9장, 영문 23장이었고, 짝지어 비교하면 우연으로 보기 어려운 차이(p=0.0043)였습니다. 이번에는 시드만 새로 뽑아 72장을 다시 그렸습니다. 같은 문자 체계 글자가 읽힌 그림 (각 36장) 한글 요청 영문 요청 짝비교 p 7월 기록 · 한 줄 판독 9 23 0.0043 이번 72장 · 7월과 같은 한 줄 판독 19 14 0.27 이번 72장 · 네 가지 판독 중 가장 가까운 값(빈 값 포함) 20 14 0.15 이번 72장 · 비어 있지 않은 판독 우선(최종 집계) 33 35 0.63 7월과 똑같이 읽어도 방향이 뒤집혔고, 판독 규칙만 바...

로컬 비전 AI 실측 — 메뉴·차트·표는 둘 다 맞혔고, 원 세기에서 갈렸습니다

이미지
흰 바탕에 빨간 원 셋, 파란 원 하나, 파란 네모 둘, 초록 세모 하나가 흩어진 그림을 보여 주고 "이 그림에 빨간색 원은 몇 개 있어?"라고 물었습니다. 로컬 비전 AI qwen2.5vl 7B의 답은 이랬습니다. 이 그림에는 총 4개의 빨간색 원이 있습니다. 세 번 물었고 세 번 모두 같은 문장이었습니다. 같은 그림을 받은 qwen3-vl 8B는 세 번 모두 3개라고 답했는데, 답을 내기 전에 이런 메모를 따로 남겼습니다. 1. Top left: red circle. 2. Middle right: red circle (the one between blue squares). 3. Bottom right: red circle. Wait, let me check again. (…) So three red circles. 내 PC의 무료 로컬 비전 AI로 메뉴판·차트·표 같은 이미지를 읽히려는 분이라면, 두 모델 중 무엇을 받을지와 어떤 질문은 믿으면 안 되는지가 궁금할 겁니다. 이번 결과로 드릴 수 있는 답은 이렇습니다. 또렷하게 인쇄된 글자와 숫자를 읽는 질문은 두 모델 모두 9번 중 9번 맞혔습니다. 개수를 세는 질문에서만 갈렸습니다. qwen2.5vl은 빠르지만 세기를 틀렸고, qwen3-vl은 맞혔지만 답마다 3배쯤 오래 걸렸습니다. 저라면 읽기용은 qwen2.5vl, 세기·비교처럼 틀리면 곤란한 질문은 qwen3-vl로 나누겠습니다. 네 장의 이미지, 네 개의 질문 이미지는 정답을 미리 알 수 있게 직접 만든 합성 그림 4장입니다. 각 이미지에 질문 하나씩을 고정했습니다. 이미지 질문 정답 카페 메뉴판(메뉴 6개와 가격) 가장 비싼 메뉴와 그 가격은? 콜드브루 6,000원 1~6월 매출 막대차트 매출이 가장 높은 달은? 4월(90만원) 두 팀의 국어·영어·수학 점수표 총점이 더 높은 팀과 두 팀 총점은? B팀(A팀 250, B팀 265) 도형 7개가 흩어진 그림 빨간색 원은...

무료 이미지 배경 제거(누끼) — 로컬 rembg, CPU로 한 장 0.5초 안쪽

이미지
왼쪽이 원본, 오른쪽이 무료 배경 제거 도구 rembg가 배경을 지운 결과입니다. 체크무늬로 보이는 곳이 투명해진 부분입니다. 인물은 잘 떨어져 나왔는데, 인물 앞의 노란 꽃 몇 송이도 같이 남았습니다. 왼쪽 아래에는 지워지다 만 꽃이 반투명하게 떠 있고, 바람에 날리는 긴 머리카락 끝은 흐릿하게 사라집니다. 같은 도구로 흰 배경의 로봇 마스코트를 돌렸을 때는 결과가 달랐습니다. 외곽선 바깥으로 얇은 회색 테두리가 남은 것 말고는 손댈 곳이 거의 없었습니다. 무료로 이미지 배경을 지우려는(누끼를 따려는) 분이라면, 설치해서 돌릴 만한지와 어떤 그림에 믿고 쓸 수 있는지가 궁금할 겁니다. 이번 기록으로 드릴 수 있는 답은 이렇습니다. rembg의 u2net 모델은 그래픽카드 없이 CPU만으로 1024×1024 그림 한 장을 0.5초 안쪽에 처리했습니다. 배경이 단순하고 윤곽선이 뚜렷한 그림은 거의 그대로 쓸 수 있었고, 배경과 피사체가 겹쳐 있거나 머리카락이 흩날리는 그림은 손질이 남았습니다. 저라면 스티커·썸네일용 캐릭터처럼 흰 배경 그림은 rembg로 바로 처리하고, 풍경 속 인물은 결과를 확대해 가장자리를 보고 나서 쓰겠습니다. 무엇을 어떻게 돌렸나 rembg는 이미지 배경을 지워 투명 PNG로 저장하는 오픈소스 파이썬 도구입니다. 여러 분할 모델 중 기본 모델인 u2net을 골랐고, GPU는 쓰지 않고 CPU로만 실행했습니다. 측정 시점은 2026년 9월입니다. 입력은 1024×1024 그림 3장입니다. 셋 다 이미지 생성 AI로 만든 일러스트라 저작권 걱정 없이 결과를 그대로 보여 드릴 수 있습니다. 그림 어려운 점 처리 시간 투명해진 비율 꽃밭 속 긴 머리 인물 머리카락이 배경으로 흩날리고, 꽃이 인물 앞뒤에 겹침 0.351초 57.0% 풀밭 위 강아지 캐릭터 발밑에 그림자와 풀이 닿아 있음 0.446초 59.1% 흰 배경 로봇 마스코트 배경이 단색이고 검은 외곽선이 뚜렷함 0.485초 7...

무료 AI 이미지 업스케일러(APISR) 실측 — 점수는 단순 확대가 이겼고, 차트 숫자는 AI가 지웠습니다

이미지
왼쪽이 원본, 가운데가 단순 확대, 오른쪽이 AI 업스케일러입니다. 오른쪽이 가장 또렷해 보입니다. 선이 진하고 격자도 선명합니다. 그런데 세로축을 보면 원본의 「4」, 「50」, 「36」, 「27」이 오른쪽에서는 짧은 막대와 점으로 바뀌었습니다. 흐릿한 가운데 그림에는 숫자 모양이 남아 있습니다. 작은 그림을 키워 블로그에 올리려는 분이라면 무료 AI 업스케일러를 쓸지, 이미지 편집기의 기본 확대로 충분할지가 궁금할 겁니다. 이번에 무료 로컬 업스케일러 APISR 4x로 일러스트 3장을 키워 본 답은 이렇습니다. 원본과 얼마나 같은지를 재는 점수로는 3장 중 2장에서 단순 확대가 이겼습니다 . 눈으로 보면 AI 쪽이 또렷했지만, 차트처럼 작은 숫자가 있는 그림에서는 그 숫자를 지웠습니다. 저라면 마스코트 같은 단순한 그림에는 AI 업스케일러를 쓰고, 숫자나 글자가 있는 그림에는 쓰지 않겠습니다. 원본을 줄였다가 다시 키워 비교했습니다 비교 기준이 있어야 해서, 원본이 있는 그림으로 시험했습니다. 로컬에서 직접 생성한 1024px 일러스트 3장(마스코트, 파스텔톤 차트 화면, 스티커가 많은 구름 캐릭터)을 256px로 줄였습니다. 이 작은 그림을 두 방식으로 다시 1024px로 키웠습니다. Lanczos : 이미지 편집기에서 흔히 쓰는 단순 확대 방식입니다. 픽셀 사이를 계산으로 메웁니다. APISR 4x : 애니메이션·일러스트 복원용으로 공개된 무료 업스케일 모델입니다. RTX 4070 Ti SUPER에서 로컬로 돌렸습니다. 그다음 두 결과를 원본과 비교했습니다. 점수는 두 가지입니다. PSNR은 픽셀 값이 원본과 얼마나 가까운지(높을수록 가깝습니다), SSIM은 밝기·대비·구조가 얼마나 닮았는지(1에 가까울수록 닮았습니다)를 봅니다. 측정 시점은 2026년 9월입니다. 점수: 마스코트만 AI가 이겼습니다 원본 대비 Lanczos PSNR APISR PSNR Lanczos SSIM APISR SSIM 마스코트 27....

로컬 AI 이미지 생성(SDXL)으로 블로그 일러스트 12장 — 장당 6초, 아이콘으로 바로 쓸 건 0장이었습니다

이미지
「귀여운 구름 캐릭터, 작은 번개, 흰 배경, 앱 아이콘 스타일」을 주문하고 받은 그림입니다. 구름은 가운데에 있고 배경도 하얗습니다. 그런데 주변을 하트, 버튼 모양 조각, 작은 고양이 얼굴이 빼곡히 채웠습니다. 이번 테스트의 자동 판정은 이 장을 통과 로 셌습니다. 네 모서리가 흰색이었기 때문입니다. 무료 로컬 이미지 AI로 블로그 삽화를 뽑으려는 분이 궁금한 건 대개 세 가지입니다. 한 장에 얼마나 걸리는지, 바로 쓸 수 있는 그림이 나오는지, 마음에 든 그림을 다시 뽑을 수 있는지. 이번에 RTX 4070 Ti SUPER에서 SDXL 체크포인트 하나로 12장을 뽑아 본 답은 이렇습니다. 첫 장을 빼면 장당 6초 남짓 이었고, 마스코트와 책상 썸네일은 절반 넘게 그대로 쓸 만했지만 앱 아이콘은 4장 중 한 장도 그대로 쓸 수 없었습니다. 같은 시드로 3개월 전에 뽑은 그림은 거의 그대로 다시 나왔습니다. 주문 세 가지를 네 장씩 뽑았습니다 체크포인트는 애니메이션·일러스트 계열 SDXL 모델인 Animagine XL 4.0 Opt 하나입니다. 로컬 ComfyUI에서 1024×1024, 26단계, CFG 6.5, Euler ancestral로 고정하고 프롬프트만 바꿨습니다. 네거티브 프롬프트에는 저해상도·손 뭉개짐 같은 흔한 항목과 함께 「text, watermark, signature」를 넣었습니다. 마스코트 : 렌치를 든 친근한 로봇, 플랫 벡터, 굵은 외곽선, 흰 배경, 가운데 배치 블로그 썸네일 : 차트가 뜬 노트북, 머그컵, 작은 화분이 있는 아늑한 책상, 파스텔톤 앱 아이콘 : 작은 번개를 단 웃는 구름 캐릭터, 스티커 스타일, 흰 배경 주문마다 시드를 하나씩 올려 가며 네 장씩, 모두 12장입니다. 자동 판정은 흰 배경을 요청한 8장에 대해서만 했습니다. 네 모서리 조각의 절반 이상이 흰색이면 통과입니다. 12장은 원본 크기로 한 장씩 열어 요청 조건과 대조했습니다. 이 대조의 1차 분류는 AI 도구가 했고, 발행 전 검수에서...