이미지와 PDF에서 텍스트 추출(OCR)
WebAssembly로 컴파일한 Tesseract가 당신의 기기에서 돕니다. 사진이나 스캔한 PDF를 끌어다 놓으면 텍스트를 뽑아 주고, 원본과 똑같아 보이는 검색 가능한 PDF도 만들어 줍니다.
- 브라우저 안에서 전부 처리됩니다
- 오프라인에서도 작동합니다
- 업로드 없음
- 가입 없음
- 워터마크 없음
도구를 불러오는 중…
작동 방식
- 이미지나 PDF를 끌어다 놓으세요.
- 문서에 들어 있는 언어를 체크하세요. 적게 고를수록 빠르고 정확합니다.
- OCR을 실행한 뒤 텍스트를 복사하거나 검색 가능한 PDF를 내려받으세요.
왜 아무것도 업로드되지 않는가
이 페이지가 하는 모든 작업은 브라우저 탭 안에서 도는 코드가 처리합니다. 웹 페이지를 그리는 그 엔진을 그대로 씁니다. 파일은 디스크에서 탭의 메모리로 읽어 들여 거기서 변환한 뒤 다시 다운로드 파일로 내보냅니다. 어디로도 전송되지 않습니다. 우리에게도, 제3자에게도.
직접 확인해 보세요
- 브라우저 개발자 도구(F12)를 열고 네트워크(Network) 탭을 선택합니다.
- 파일을 올리고 도구를 실행합니다.
- 보이는 요청은 도구 자체의 코드를 받아 오는 것뿐입니다. 무거운 몇몇 도구는 공개 CDN에서 오픈소스 엔진을 함께 받아 옵니다. 여기에 loreatec.jp로 가는 작은 방문 집계 신호 하나(페이지 주소와 제목, 그 이상은 없습니다)가 더해집니다. 어느 것도 당신의 파일을 실어 나르지 않습니다.
자주 묻는 질문
일본어 세로쓰기도 되나요?
됩니다. 세로쓰기 전용 모델을 씁니다. 가로쓰기 모델과 함께 고르지 말고 이것만 고르세요. 둘을 같이 돌리면 레이아웃 분석이 헷갈려서 행이 뒤섞여 나옵니다.
검색 가능한 PDF가 뭔가요?
원본 페이지 이미지 뒤에 보이지 않는 텍스트 레이어를 겹쳐 놓은 파일입니다. 문서는 이전과 똑같아 보이지만 검색할 수 있고 텍스트를 선택해 복사할 수도 있습니다. 문서 스캐너가 내놓는 표준 결과물이며, 여기서는 스캐너 없이 만듭니다.
정확도는 어느 정도인가요?
300 DPI로 깨끗하게 인쇄된 글자라면 아주 좋습니다. 페이지에 그림자가 진 휴대폰 사진이라면 그저 그렇습니다. 손글씨는 나쁩니다. 이 OCR 엔진은 손글씨용으로 만들어지지 않았고, 설정을 아무리 바꿔도 나아지지 않습니다. 여기 있는 어떤 옵션보다 해상도와 고른 조명이 더 중요합니다.
언어 데이터는 어디서 오나요?
OCR 엔진의 공개 데이터 CDN에서 가져옵니다. 언어당 몇 메가바이트이며 처음 쓴 뒤에는 캐시에 보관됩니다. 이미지 자체는 어디로도 전송되지 않습니다. 스캔한 문서는 대개 대외비인 문서이므로, 그 점이 가장 중요한 도구가 바로 이것입니다.