toolsmith

アップロードなし · すべてブラウザ内で処理

画像・PDF から文字を抽出 (OCR)

画像やスキャンした PDF の中の文字を読み取り、コピーできるテキストにして返します。認識はこの端末で行われます。

ここに画像か PDF をドロップ

PNG · JPG · WebP · PDF — 1 つずつ

ファイルはどこへ行きますか?

どこへも行きません。画像を読む処理はこのブラウザタブの中で行われ、ファイルはアップロードされません。行き来するのは認識エンジンだけで、それは公開 CDN からこちらへ降りてきます — 向きが逆です。

開始前に数 MB を受信するのはなぜですか?

OCR にはエンジンと、その言語で学習したモデルが必要だからです。合わせておよそ 4〜6MB です。ボタンを押したその瞬間に取得し、それ以前には取得しません。一度取得すればブラウザが保持するので、二つ目の文書はすぐに始まります。

文字が完璧でないのはなぜですか?

小さいモデルを使っています。高精度なモデルは 5〜10 倍の大きさです(英語 2MB に対し 11MB、日本語 1.5MB に対し 16MB)。きれいなスキャンでは差は小さいですが、手ぶれした写真では出ます。それを確かめるために 16MB を受信させたくありませんでした。紙をまっすぐ置いて明るく撮ると大きく改善します。

PDF も読めますか?

はい、一度に 30 ページまで読みます。各ページをまず画像として描いてから読みます。PDF に本物の文字が入っているなら、どのビューアーでもコピーした方が速く正確です — OCR は紙を撮った画像だけの PDF のためのものです。

レイアウトは保たれますか?

いいえ。読む順に文字だけが出ます。段組みや表、見出しの構造は再現できません。文字よりレイアウトが重要なら、この道具は向きません。

ほかの道具

読んでおくと役に立つ記事