이미지·PDF 에서 글자 추출 (OCR)
그림이나 스캔한 PDF 안의 글자를 읽어 복사할 수 있는 텍스트로 돌려줍니다. 인식은 이 기기에서 일어납니다.
여기에 이미지나 PDF 를 놓으세요
PNG · JPG · WebP · PDF — 한 번에 하나
제 파일은 어디로 가나요?
어디로도 가지 않습니다. 그림을 읽는 일이 이 브라우저 탭 안에서 일어나고 파일은 올라가지 않습니다. 오가는 것은 인식 엔진뿐이고, 그것은 공개 CDN 에서 이쪽으로 내려옵니다 — 방향이 반대입니다.
시작 전에 왜 몇 MB 를 받나요?
OCR 에는 엔진과 그 언어로 학습된 모델이 필요하기 때문입니다. 둘을 합쳐 대략 4~6MB 입니다. 버튼을 누른 그 순간에 받고 그 전에는 받지 않으며, 한 번 받으면 브라우저가 갖고 있어서 두 번째 문서는 곧바로 시작합니다.
글자가 왜 완벽하지 않나요?
작은 모델을 씁니다. 정확한 모델은 5~10배 큽니다(영어 2MB 대 11MB, 일본어 1.5MB 대 16MB). 깨끗한 스캔에서는 차이가 작지만 흔들린 휴대폰 사진에서는 드러납니다. 그걸 확인하자고 16MB 를 받게 하고 싶지 않았습니다. 종이를 반듯하게 놓고 밝게 찍으면 많이 좋아집니다.
PDF 도 읽나요?
네, 한 번에 30쪽까지 읽습니다. 각 쪽을 그림으로 먼저 그린 뒤 읽습니다. PDF 안에 이미 진짜 글자가 들어 있다면 아무 뷰어에서 복사하는 편이 더 빠르고 정확합니다 — OCR 은 종이를 찍은 그림뿐인 PDF 를 위한 것입니다.
서식은 그대로 남나요?
아니요. 읽는 순서대로 글자만 나옵니다. 단이나 표, 제목 구조는 살리지 못합니다. 글자보다 서식이 더 중요하다면 이 도구는 맞지 않습니다.