[OCR] 画像→テキスト化総合at SOFTWARE
[OCR] 画像→テキスト化総合 - 暇つぶし2ch447:446
07/01/13 08:13:51 txbwSWm00
>>446のサイズが変わる件、自己解決。
○○○、捨てないでとっておいてよかった。

今回、色々体験版を使ってみたが・・・ずいぶん認識率に差があるな。
今回使った原稿では、S>e>>>>>ry だった。
とくに、ある特定の文章において文字認識(95%以上の認識率)ができるソフトと、どう設定を変えても文字認識できなかったソフトがあるのはびっくりだった。

448:名無しさん@お腹いっぱい。
07/01/13 18:25:01 ZKON0N9L0
英文OCRエンジンを搭載してるかどうか

449:446
07/01/13 20:49:48 txbwSWm00
>>448
>>447に対してかな?
ならば・・・・対象文章の詳細。
現物は、黒に近い灰色の地に縦書き日本語白抜きのゴシック文字で2.2mm角位。
それを360dpi bmpファイルにして読ませた。
この文字の他、カラーを使った図や表が沢山あったのだが、Sとeはそれらの図表中の数字(縦2.5~3mm)も一応読み取ってくれたが、他2はry

もっと高解像度で試せという声が聞こえてきそうだが・・・
印刷の関係上画像ファイルは360dpiでほぼ統一してあり、現物がすでにないファイルも沢山あるので、俺にとっては360dpiでないと意味はない。

450:名無しさん@お腹いっぱい。
07/01/14 22:06:26 gDvAo02g0
デフォルトの精度よりも
使い勝手で選んだ方がいいよ
学習させないとどれも使い物にならないんだし
学習させたらどれも同じレベルになる

たまにしかOCR使わない人ならデフォルトの精度だけで選ぶのも手だけどさ


451:名無しさん@お腹いっぱい。
07/01/14 23:27:20 6UO6XDK00
>>450
最初は何をやっても(注)画像としか認識しないのでも、学習により文字認識可能になるのかね?

(注)自動認識だけではなく縦書き横書き・また認識枠を使って強制的な認識を試した。
もちろん、体験版だからちょろっと触った程度である。
でも、各ソフトのスタートラインが違いすぎる。

452:名無しさん@お腹いっぱい。
07/01/21 11:01:20 If32Oo320
革体験
 傾き補正・自動の精度が悪い。
 傾き補正・手動の操作性が悪い。

453:名無しさん@お腹いっぱい。
07/01/24 17:43:47 ucWpj8mf0
160GB SATAHDDがカッコヨスぎてwarota

キヤンヘ凸-ンはこのFAXを受取られた従業員数1~400名規模の事業者の方が対象となります。
rl ノ     ■=■            伽凹lTl⊇■:≡:l▲へ′lヨJ■_止□∥亡!■lコ′hザdb■■■
 ′つn M      刑同MR月巳の侍仏洞i肌同ロロりし乗lq
 エロまで!(一部を除く場合かあり打9また本フ・ロモーションの適用は、1′29までにこ注文を頂いた場合に剛打※)
AMDCPU搭載PCDimensionC521今週のおすすめ!発注] ̄ド=19788581
・AMDSempronTMプロセッサ3400+
・Windows㊥xpHomeEdition正規版
・5†2〃β(512MBxl)DDR2-SDRAMメモリ
.†6∂GβS∧mJのβ
・サムスン製†タインデ丁打液晶モニタ(フサソク)
・内蔵NVIDIA㊥Ge†0rCeTM6150LEGPUクーラフイツクス
・DVD-ROMドライブ
・1年間引き取り修理サービス(保守ハD-ツ含む)
・12時間テクニカル電話サポートくE・メールサホ■-ト付)
大容量160GBHDD槻
さらに大画面19’モニ附!

454:名無しさん@お腹いっぱい。
07/01/24 18:14:50 ucWpj8mf0
元ネタです。(FAXモデムでダイレクト受信)
URLリンク(www.uploda.org)

みなさんの環境でコレをOCRかけたら、どれだけ正確に取り込めますか?

ちなみに上で試したのは 7年前のソフト 読んdeココVer2.11 全自動です。
いま出回っているソフトを使ったらどれだけ進化してるか興味があります。


455:名無しさん@お腹いっぱい。
07/01/24 21:46:12 LSNalub20
>>454
e.Typist V11。自動認識で453までの文章結果。
範囲指定してやればもう少しマシだとは思うが。

>キャンペーンはこのFAXを受取られた従業員数1-400名規模の事業者の方が対象となります。
>1/29要!
>期間限定お得な特別商品のご案内
>(一部を除く場合があります。また本プロモーションの適用は、1/29までにご注文を頂いた場合に限ります※)
>AMDCPU搭載PCDimensionC521今週のおすすめ!
>発注コード
>・AMDSempronTMフロセッサ3400+
>・Windows回XPHomeEdition正規版
>・512ル擢∋(512MBx1)DDR2-sDRAMメモリ
.>160GBSA7酒HDD
>・サムスン製19"チTFr液晶モニタ(ブラック)
>・内蔵NVIDIA回Ge拍rceTM6150LEGPUゲラフィックス
>・DVD-ROMドライブ
>・1年間引き取り修理サービス(保守パーツ含む)
>・12時間テクニカル電話サボート(E・メールサボ.一ト付〉
>大容量160GBHDD搭載
>さらに大画面19,モニタ付1

456:名無しさん@お腹いっぱい。
07/01/24 23:08:02 ovSgjl0P0
>>454
読んココ12、いきなり認識させて

キヤンヘe-ンはこのFAXを受取られた従業員数1-4m名規模の事業者の方が対象となります。



期間限定お得な特月
商品のご案内
(一部を隙く場合があります。また本プロモーションの適用は、1/29までにこ注文を頂いた場合に限ります※)

・AMDSempronTMプロセッサ3400+
・Windows@xpHomeEd血m正規版
・512MB(512MBxl)DDR2-SDRAMメモリ
.160GβSA7乃11DD
・サムスン製19ルゲm液晶モニタ(ブカク)
・内蔵NVIDLA@GeforceTM6150LEGPUゲラフィックス
・DVD-ROMトうイブ
・1年間引き取り修理サービス(保守バーツ含む)
・12時間テク二カバ電扇滑ボート(Eメールサポート付)
発注コードこ
州田




9

457:名無しさん@お腹いっぱい。
07/01/26 09:32:20 WPLblaIx0
今、読取革命の最新版の体験版使って、縦書きの文章を処理しているんだが。
コピーを繰り返して、人間様は困難があるものの読み取れるが、ソフトの方では判断に迷うような原稿の場合・・・
一括修正で、「首が痛くなる」ぞw

修正前の確認として、縦書きをそのまま左に90度倒したのがたくさん出てくる。
(横書きはそのまま)
個々の似たような文字形を一緒に修正するかどうか選べる。
そこで取捨選択するのは、当然人間様のお仕事。
その確認作業では、文字がかすれていればいるほど、間違いなく読み取るには首を傾ける必要がある。

せめて、どちら向きで表示させるか選べればいいのにな。

458:名無しさん@お腹いっぱい。
07/01/27 23:08:02 t4gJ+ZZy0
s

459:名無しさん@お腹いっぱい。
07/02/01 23:38:35 of0mcj9v0
>>455 に感動し、e.typistを買うことにした。
実際試用版つかってみたけど、全然優秀だったし。
読んでココだと、tiffのカラー版はよめないとか言われたし・・

460:名無しさん@お腹いっぱい。
07/02/02 07:52:29 8CCYdWQc0
e.Typistと読んde!!ココ両方持ってるけど
>459
同意するようなそうでもないような。
誤認識の所を再認識させるのはがやりやすい。
前、試した時は読んde!!ココの方が
元文書のレイアウトに近かった。

461:名無しさん@お腹いっぱい。
07/02/10 17:26:39 7v8Omm3H0
ここでSmartOCR

462:名無しさん@お腹いっぱい。
07/02/11 19:03:49 CU4bnzbg0
e.typist¥2万か・・・もうちっと安くならんかな・・・

463:名無しさん@お腹いっぱい。
07/02/12 01:20:06 ov2QAPy90
>>459
あのまま読み込むのではなく
フィルタかけてからのほうがいいよ
そうすれば広告の認識率に近くなる

464:名無しさん@お腹いっぱい。
07/02/20 17:35:07 R0Pvtepc0
>>404
㌧。これ、Copyじゃない方がいいのかな?

465:名無しさん@お腹いっぱい。
07/02/20 17:45:40 R0Pvtepc0
あ、今気付いた。コピーの3つは落としやすくするためと、予備か

466:名無しさん@お腹いっぱい。
07/03/06 15:17:55 wiKC1IMb0
あげちょる

467:名無しさん@お腹いっぱい。
07/03/11 14:10:41 BmeVkgEa0
現時点で落とせる所キボン

ついでにあげ

468:名無しさん@お腹いっぱい。
07/03/12 11:24:47 rV9/0Wky0
>404で普通に落とせるよ。
ダウンロードのリンクが表示されるまでに時間が掛かるだけ。

469:名無しさん@お腹いっぱい。
07/03/12 13:20:19 NPUsZQVC0
>>468
ちょwマジだw

ありがと&うp主THX!

470:名無しさん@お腹いっぱい。
07/04/03 10:58:15 jcDWAVO40
 

471:名無しさん@お腹いっぱい。
07/04/04 23:47:30 5pEd6gF3O
URLリンク(itpro.nikkeibp.co.jp)

472:名無しさん@お腹いっぱい。
07/04/07 02:59:49 Mb5vzdo40
本格読取2、英語の読み取り精度が悪いと思ったら、辞書自体省かれてたのね・・・
platinum版は初版ベースなの?2ベースなの?

473:名無しさん@お腹いっぱい。
07/04/07 11:26:38 k8qrpDmi0
OCRソフトでテキスト化したデータに、
さらに、これ使えば、読み取りミスを発見できるのでは?!

文章校正支援ツール Just Right!2 オンラインカタログ
URLリンク(www.justsystem.co.jp)

474:名無しさん@お腹いっぱい。
07/04/07 16:10:22 3tCIEtVy0
WinReaderPROの 中古版だと安いし2~3万円のおもちゃより、
認識度はダントツに違う 探せば掘り出し物はある。
図書館から借りてきて、テレビを観ながら自動スキャンして
満員電車の中でパームを使って読んでいる。

 

475:名無しさん@お腹いっぱい。
07/04/07 23:33:39 Tk1ABTk/0
スレ違いだけど借りてきた本を自動スキャンってどうやるの?
裁断できないよね?

476:名無しさん@お腹いっぱい。
07/04/08 00:17:50 iQtddhHD0
文化の荒廃の序章

477:名無しさん@お腹いっぱい。
07/04/08 08:14:55 ilEa/RWS0
>>475
下のどっちか
いずれにしてもお金持ち

URLリンク(atiz.com)
URLリンク(www.kirtas-tech.com)

478:名無しさん@お腹いっぱい。
07/04/08 09:09:31 ISzvp7710
ちょっとしたロボットみたいな感じだね

479:名無しさん@お腹いっぱい。
07/04/08 12:57:03 tTmtr51s0
1冊300円くらいで画像化してくれる所あるし
そういうの利用してるんじゃないかな。

480:名無しさん@お腹いっぱい。
07/04/15 21:45:33 NsGlMjxe0
英文オンリーでOCRソフト使いたいんですが、一番認識率いいのは
どれなんでしょうか。
海外のフリーソフトとかありますかね??

481:名無しさん@お腹いっぱい。
07/04/15 22:24:51 Oyanpx/80
値段によってだいぶ違う。
とっつきやすいのは、本格翻訳 SUPER(\2900)についてくるOCRとか。

482:名無しさん@お腹いっぱい。
07/04/17 01:11:41 UnFTo7Bd0
>>480
FineReader Pro
二ページ続きの画像を自動分割してくれる。本をOCRして
PDF保存するときに便利。
英語だけだと役不足かもしれない。欧文多言語認識につよい。

483:名無しさん@お腹いっぱい。
07/04/22 03:11:18 WC4lxGTB0
縦書きのルビを誤認識しないソフトはありますか?

484:名無しさん@お腹いっぱい。
07/04/22 18:39:06 gRg6gkbq0
>>483
体験版を使って判断したら?
やった上での質問なら使ったことのあるソフト名書いてくれ

扱う原稿の状態などによっても違うし一概には言えないからさ

485:名無しさん@お腹いっぱい。
07/04/22 22:40:54 H0dJsJl6O
>>484
分からないならスルーすりゃいいのに

486:名無しさん@お腹いっぱい。
07/04/22 22:52:32 NTiyhGlr0
つかルビなんて確実に認識できるソフトなんてあるか?

487:名無しさん@お腹いっぱい。
07/04/23 00:37:51 4t8hsufJ0
読取革命の体験版使わせてもらってます。
小説をテキスト化しようとすると、
ページのすみのページ数まで取り込んでしまうため
崩れてしまうので選択範囲で囲んで認識するのですが、
これ毎ページごとにしない方法ってあるでしょうか?
上1cmを読み取らないようにしたいのですが……

とりあえずフォトショップで全部切ってから読み込ませようと思ってますが

488:名無しさん@お腹いっぱい。
07/04/24 19:33:20 GMXFIsi/0
読取革命はわかんないけど、e.Typistなら読み取り範囲設定する機能があるよ。
読み取り範囲を自動じゃなく手動で設定する場所ない?
矩形で範囲指定して順番も任意に変えられるから、頁数が本文に混じったりすることはうちではないな

489:名無しさん@お腹いっぱい。
07/04/24 19:34:13 GMXFIsi/0
補足。一ページごとじゃなくて全ファイルに設定を適用できるという意味

490:名無しさん@お腹いっぱい。
07/04/25 17:47:15 72dBCul00
URLリンク(no722.cocolog-nifty.com)

小説画像再配置ツールのとこ。モバ板で開発されてたけど、公開サイトできた。
画像からOCRするときに、これで先に処理しておくと、本文位置なんかをほぼ正確に
設定できる。
読んde!!ココの枠情報ファイルを使った一括認識でも読み取り枠をかなり精密に
指定できるようになる。

491:名無しさん@お腹いっぱい。
07/04/25 20:56:34 1/DHbGJL0
だれか電話帳からひとりでデータベース作った奴居る?
うちの村は人口少ないけど1ページだけで疲れて諦めた。

492:名無しさん@お腹いっぱい。
07/04/26 01:43:03 GYa4q+ck0
無差別DB化って、なんか金儲け目的でやってるような気が・・・
マトモな人間ならやらんように思うんだけど

493:名無しさん@お腹いっぱい。
07/04/26 01:46:06 aXKryLXTO
>>492
だろうね

494:名無しさん@お腹いっぱい。
07/04/26 07:31:38 hsKdtYm00
>>491
手が後ろに回るぞ!
警察に報告しました、逃げるなよ


495:名無しさん@お腹いっぱい。
07/04/27 05:48:50 qJ7wVrGj0
>>491
nyで流れてる

496:名無しさん@お腹いっぱい。
07/04/27 20:16:56 TyEfRJXl0
>>490
トン
まだ試してないがスクショを見て感動した。
神っているもんだな

497:名無しさん@お腹いっぱい。
07/04/30 01:51:22 sLkYqs0k0
>>487
体験版はどうか知らないけど、
適当なページを手動で範囲指定して「テンプレートに保存」
一括認識で「テンプレートを使う」でいける
ただ、全く融通が利かないので注意

498:名無しさん@お腹いっぱい。
07/04/30 05:59:12 5pL5s8yV0
>497
>490ので処理すると画像内の本文位置を相当正確に統一できるよ。
読んde!!ココもv12まではテンプレ(枠情報ファイル)で設定した認識範囲は固定だったけど、
v13で自動微調整してくれるようになったみたい。


499:名無しさん@お腹いっぱい。
07/05/06 20:41:05 G03gIUz/0
漫画とかの目次の読み取り制度の高いOCRソフトって何?
自炊した漫画に目次とか手打ちしてくの怠過ぎ。


500:名無しさん@お腹いっぱい。
07/05/09 13:57:21 99QB49QB0
tes

501:名無しさん@お腹いっぱい。
07/05/19 17:34:20 MJYxjg3x0
e.typistのエントリーを持っているのですが、製品版にしようか迷っているしだいです。
エントリー版だと精度優先が選択できず、常に速度優先なのですが、
速度優先と、精度優先はどのくらい違うものなのでしょうか?

502:名無しさん@お腹いっぱい。
07/05/19 23:46:09 PB2nZC+o0
スクリプトによる自動読み取りを考えているのですが、
コマンドラインから呼び出せるようなOCRを探してます。

ソフト.EXE < 画像.JPG > 結果テキスト.txt

みたいな感じで読めるソフトありますか?

503:名無しさん@お腹いっぱい。
07/05/20 00:19:18 X0rH5ysl0


504:名無しさん@お腹いっぱい。
07/05/20 01:06:51 1nypUcOf0
>>501
最新版の体験版が公式サイトにあるから
ダウンロードして試せば?

ちなみに最新版だと
速度優先と精度優先の設定自体無かった様な気がする。

505:名無しさん@お腹いっぱい。
07/05/20 01:57:05 fXVBB8f40
>>504
そうしてみます。どうもです。

506:名無しさん@お腹いっぱい。
07/05/24 00:05:13 m6D0J+hE0
スレ汚し申し訳ありません。
私、これまでeTypistをつかっていました。
単にキヤノンスキャナについてたというだけのきっかけで
それなりにつかってきました。

この度WindowsをVista化して、
eTypistがいつまでもVista対応にならないので
見切りをつけて「読んde」か「革命」あたりに
乗り換えねばと考えてます。
が、いろいろググったり本スレの過去のカキコを
読んでみても決め手に欠けて選びかねています。

体験版で試せばいいのかもしれませんが、
極力Windows環境を汚したくない気持ちもあります。

和文・英文ともにOCRします。新聞・雑誌の記事が
中心ですが、PDF化されたものも対象、
というのが私の使用状況です。
ヒントいただければありがたく思います。よろしくお願いします。

507:名無しさん@お腹いっぱい。
07/05/24 00:07:21 JtoWD+i20
eTypist>>>革命>>>>>>>>よめやここ

508:名無しさん@お腹いっぱい。
07/05/24 00:17:03 IP3+408H0
>極力Windows環境を汚したくない気持ちもあります。
あほかw
体験版試したあとOSクリーンインストールでもしろ

509:名無しさん@お腹いっぱい。
07/05/24 00:20:54 JtoWD+i20
↑まちがい

↓正解
RegSeeker

510:名無しさん@お腹いっぱい。
07/05/24 00:27:13 oQsTBG6L0
>>506
つ[Acronis True Image]

511:名無しさん@お腹いっぱい。
07/05/24 00:39:28 2EuU9Ihu0
TotalUninstall

512:名無しさん@お腹いっぱい。
07/05/26 20:26:38 95PnN5Qd0
e.typistの12っていつぐらいに出ると予想されます?
11買おうかとも思うんですが、
11は、結構古いんで、買ってすぐ新しいのでたらやだなと思いまして。

513:名無しさん@お腹いっぱい。
07/05/29 20:35:52 KKC/xjSJ0
URLリンク(plusd.itmedia.co.jp)
「本格読取 2 Deluxe」、6月29日発売。2970円。


なんだかんだ言って、また英文OCRは省かれるんだよな。
英文OCR付きプラチナは、いつ電気屋の店頭に並ぶんだろう・・・
参考: URLリンク(www.google.co.jp)

514:名無しさん@お腹いっぱい。
07/05/30 21:21:07 pTXU8GzB0
読んdeココ for EPSON Ver.4.07の直リンわかる方いませんか?


515:名無しさん@お腹いっぱい。
07/05/31 18:16:10 qsHbord50
>>506
smartお勧め

516:名無しさん@お腹いっぱい。
07/05/31 22:33:58 YxAzCzkf0
>>514
スキャナー付属の物ならまずwebに無いだろう

517:名無しさん@お腹いっぱい。
07/06/03 14:19:19 RWdiD0XW0
>>514
EPSONのHPにあるよ

518:名無しさん@お腹いっぱい。
07/06/07 12:28:22 +k6s2B/y0
>>506
 いま読んでここと、etypsit比べているが、認識制度は日英混在なら読んでここのほうが
ずっといい。etypistはなぜか英語がみんな全角になっちゃうし、単語の切れ目もきちんと
認識できていない。
 読んではインターフェースがイマイチなんだけど、この認識精度の差は埋めがたい。
純英語同士だとあまり差は感じない。

 やっぱり試用して、同じものスキャンしてみるといいよ。

519:名無しさん@お腹いっぱい。
07/06/07 13:32:08 c6qqyJBg0
最初の頃は認識精度で選んでたけど
学習させたらどれも大差なくなってくるから
編集しやすいのを選んだ方がいいとおもう。

520:名無しさん@お腹いっぱい。
07/06/07 15:48:24 rTQM8Q420
英も自我全角になるのは何の問題も無いだろ。
簡単に直せる市。

521:名無しさん@お腹いっぱい。
07/06/07 19:50:55 QT4A944M0
>>518
 自己レス。etypistは、デフォルトの設定から一部変えたら、
英単語がきちんと認識されるようになりました。
これでインターフェースで選んでもOKそうです。

522:名無しさん@お腹いっぱい。
07/06/10 12:44:19 Bn9+OI/80
>>521
後続の者のために、どのように変えたら良くなったか書いてくれ

523:名無しさん@お腹いっぱい。
07/06/10 21:47:17 O+MyPhJK0
>>522

文字認識のメニューから
 言語を:日本語(英語混在)にする。
 そして、空白文字挿入指定を「空白出力」にする。
これは改行コード指定を「ブロック改行」にするとで
きなくなるので、それ以外の改行コード指定にする。

 いろいろいじっていたので、どの設定がデフォかは
忘れたけど、これをやると英単語の間をきちんと認識する。

 とにかく「空白出力」を有効にすることが必須。

 本文が日本語で、要旨や図の説明が英語になっている
技術論文は、この設定を間違ってしまうと悲惨なことに。



524:名無しさん@お腹いっぱい。
07/06/11 22:57:26 fi0mIOzn0
>>523


525:名無しさん@お腹いっぱい。
07/06/12 21:14:17 TmZVwJCw0
縦書きで、英語部分のみ90度回転(本を横にして読む)してる部分を認識する方法ってあるかな?
読み取り範囲に横書き/縦書きどっちを指定しても画像の上が文字の上と一致しなきゃいけないのは変わらないし、、、
一箇所二箇所なら手打ちで何とかできても、一ページ数箇所とかだと途方に暮れる
ちなみに使ってるのはetypist10です

526:名無しさん@お腹いっぱい。
07/06/14 18:16:13 MZzFuaL20
すみません、学術論文をスキャンして、それを画像からテキストに変換したいのですが、
問題は、論文の中にドイツ語やフランス語も入っているということなんですけど、
さすがにドイツ語やフランス語まで認識してくれるOCRソフトはないですよね?

527:名無しさん@お腹いっぱい。
07/06/14 20:02:32 /i8UfP/C0
>>526
> ないですよね?
という問い掛けをいやらしく感じるのは漏れだけ?
URLリンク(www.google.com)

528:名無しさん@お腹いっぱい。
07/06/14 21:57:48 MZzFuaL20
>>527
いやらしいと思いつつも、回答していただきありがとうございます。
本当に悪意はないのでw
非常に助かりました。

529:名無しさん@お腹いっぱい。
07/06/16 00:36:41 d8IXz+hf0
>>525
メジャーな機能じゃないかも
俺が知ってるのは読取革命くらいしか出来ない

>>528
>本当に悪意はないのでw
最後のwもやめたほうがいいよ
「ないですよね?」や「w」が
自然に出てくるようだとちと怖い

530:名無しさん@お腹いっぱい。
07/06/16 01:17:24 VQaiHJ1E0
>>529
読取革命できるんだ! 超さんくす
早速体験版落としてくる
OCRってなかなか一ソフトだけじゃすまないよなー

531:名無しさん@お腹いっぱい。
07/06/16 12:00:27 Mq2PXuOr0
スレリンク(bsoft板)

532:名無しさん@お腹いっぱい。
07/06/18 09:30:58 puvoa998O
URLリンク(p20.fileseek.net)
だれか試して

533:名無しさん@お腹いっぱい。
07/06/20 10:49:02 JlYS+vI+O
>>532ミスってた
URLリンク(ocr.rossa.cc)

534:名無しさん@お腹いっぱい。
07/06/22 14:20:21 7iUFwDnD0
試した。
フツーーーのOCRソフトだった。

532=533は何が聞きたかったのかな?

535:名無しさん@お腹いっぱい。
07/07/08 22:17:19 WDaFYbIE0
聞いてみて

536:名無しさん@お腹いっぱい。
07/07/10 11:00:58 R3FyXrqI0
グーグルブック検索。
検索に使わない数式なども丁寧に直している出版社の方が多いけれど、OCR結果を
全く修正しないで登録している出版社が何社かあるな。「工」と「エ」くらいならかわいい
もので全く意味不明のものもある。著者がかわいそう。

537:名無しさん@お腹いっぱい。
07/07/21 16:18:17 e2ZhIFOP0
最近ocrを始めましたがこれってスキャンの解像度が悪いと
影響大きいですか?私の光学解像度1,200×2,400dpi性能では
ほとんどうまくテキスト化できませんでした。
どの程度の解像度が必要でしょうか???

538:名無しさん@お腹いっぱい。
07/07/21 16:23:32 e2ZhIFOP0
最近ocrを始めましたがこれってスキャンの解像度が悪いと
影響大きいですか?私の光学解像度1,200×2,400dpi性能では
ほとんどうまくテキスト化できませんでした。
どの程度の解像度が必要でしょうか???


539:名無しさん@お腹いっぱい。
07/07/21 16:25:09 e2ZhIFOP0
スレ間違えました。失礼しました。

540:名無しさん@お腹いっぱい。
07/07/21 18:11:53 fXjgR9V20
300dpiあれば十分だろ
あとはコントラストとかの問題

541:名無しさん@お腹いっぱい。
07/07/22 00:46:45 0rh6CBEo0
300dpiでは低いよ。
400dpi以上。試せばわかるはず。

542:名無しさん@お腹いっぱい。
07/07/22 01:00:59 TRo+FmNZ0
文字を拡大すれば問題ない。
マメ本だと400dpiでも無理。

543:名無しさん@お腹いっぱい。
07/07/22 04:29:14 9fsxREmx0
300dpiから上は認識率は変わらないと思う。
200dpiと300dpiでもほとんど差がない。
俺の環境(ScanSnapS500でハードカバーや雑誌スキャン)では少なくともそうだ。

認識率に一番響くのは原稿の状態。
汚れていたり黄ばみが酷かったり印刷が悪かったりすると認識率がガタオチ。

「ほとんどできない」ってのは手書き原稿とか
写真背景に文字が刷り込んであるとか
コミックの吹き出しの中とかかな。

200dpi相当くらいまで縮小しちゃった物で構わないので
スキャン画像のサンプルをアップすれば的確な回答が来るのでは?>質問者

544:名無しさん@お腹いっぱい。
07/07/23 00:57:09 JoRSkVg70
一般的な印刷物って300dpiではなかったっけ?
だったら300dpiで十分だし、400dpiあればより安心って感じでないか。


545:名無しさん@お腹いっぱい。
07/07/23 02:04:22 2Cew43Yn0
よっぽどクセのあるフォントとか文字が小さいとかじゃない限り
300dpiあれば十分

あとは文字がクッキリとコントラスト等が調節できてるかによる

546:名無しさん@お腹いっぱい。
07/07/23 03:45:50 lorVcd360
そんな原稿なら手入力した方が現実的だな。

547:名無しさん@お腹いっぱい。
07/07/27 09:36:49 BD0S29j10
etypist12はどうですか?

548:名無しさん@お腹いっぱい。
07/08/05 01:40:32 5939Ae+P0
Google製の多言語OCRエンジンを搭載した「Softi FreeOCR」
URLリンク(oshiete.new-akiba.com)


でも日本語未対応

549:名無しさん@お腹いっぱい。
07/08/29 20:36:32 HhJFBICD0
ここで大人気のSmartOCRってそんなに性能いい?

試しにLiteを使ってるんだけど、いくら学習させてもXを×と誤認識するし、
段組関係はお話にならないレベル。

X1
ってのが
X一になったりするしw

1を右クリックしてもほかの選択肢が出ないし、そもそもの段組の位置が滅茶苦茶。

せめて学習機能が使い物になればエンロールと割り切って使って、
脳みそ鍛えるんだが。

何かいい方法無いかなあ。

550:名無しさん@お腹いっぱい。
07/08/29 21:15:24 j//B3kLA0
タダなんだからそんなもんだろ
品質に不満ならe-typistでも買った方が早い

バージョンアップ版は大昔に買ったスキャナに
付いてたのでもOKだし安いからオススメ

551:名無しさん@お腹いっぱい。
07/08/29 21:41:29 vQuDIF5d0
ID変わったけど

>>550
e.Typistが一番いい?
読んでココの古いバージョンユーザーなんでうpグレードはこれが一番安いんだが。

質がいいのならそちらに乗り換えます。

メジャー系の全種体験版使って判断すべきだけど、最近のはレジストリ汚しまくりなんで。


552:名無しさん@お腹いっぱい。
07/08/29 22:21:48 ne9cS2rk0
背景に画像があるやつ(CDについてる歌詞)を
デフォ設定でやったら読み取り革命が一番まともだった。
まあ学習させてなんぼのソフトみたいだから初期設定って意味ないんかもね

553:名無しさん@お腹いっぱい。
07/08/30 02:31:45 YMqPcJox0
学習にあんまり期待しない方がいいかと。
デフォルトでは想定されていないような
一文字のスペースに二文字を突っ込んだような文字とか
(句読点とカッコ類を一文字分スペースにまとめてたり)
そんな感じのはあまり遭遇しない類の例外処理の追加でしかないよ。
ごくごく当たり前の原稿の認識率は上がらない。

色つき背景に対応しだしたのは最近のverからだね。
柄つき背景はまだどこのもぜんぜんだめっぽい。

554:名無しさん@お腹いっぱい。
07/08/30 04:17:48 8cX5+Y+i0
背景が英字新聞の場合は?

555:名無しさん@お腹いっぱい。
07/08/30 19:34:15 MBF2Q0dn0
553はまともに使ったことなさそうだな


556:名無しさん@お腹いっぱい。
07/08/31 19:28:40 X8mRf/wg0
>555
縦書きで、本文とルビを混ぜて1文字として認識しているような場合はどう学習させて、どうすれば
次回似たような情況でうまく判定できるようにできるのか教えてくれ。

557:名無しさん@お腹いっぱい。
07/09/01 01:18:08 RaqlnS0/0
>>556
置換すればいいじゃん。

558:名無しさん@お腹いっぱい。
07/09/02 00:04:55 /ShAfiy40
>557はまともにOCR使ったことなさそうだな。


559:名無しさん@お腹いっぱい。
07/09/02 00:31:24 NVGVE2w40
>>556
話変わってるじゃんw


560:名無しさん@お腹いっぱい。
07/09/02 00:33:33 NVGVE2w40
>縦書きで、本文とルビを混ぜて1文字として認識しているような場合
よく分からん
詳しく説明してほしい

561:名無しさん@お腹いっぱい。
07/09/02 02:37:28 kK0TPrWk0
>>558
OCRなど30年前から使ってるが。
ただし真面目には使ってない。

562:名無しさん@お腹いっぱい。
07/09/02 08:36:01 S2LE2C0F0
> OCRなど30年前から使ってるが。

認知症ですか。かわいそうに。

563:名無しさん@お腹いっぱい。
07/09/02 10:02:13 kK0TPrWk0
>>562
URLリンク(inu.ei.meisei-u.ac.jp)

564:名無しさん@お腹いっぱい。
07/09/02 19:22:06 b21q+l2y0
>>562

かわいそうに。

565:名無しさん@お腹いっぱい。
07/09/02 19:46:38 mZ3rWXVo0
>>562
脳内認識エンジンのチューン不足ですか。かわいそうに。

566:名無しさん@お腹いっぱい。
07/09/03 20:33:46 CzULmAqY0
>>562かわいそうに。

567:名無しさん@お腹いっぱい。
07/09/03 22:36:28 PyWafQ3J0
苛めよくない。

568:名無しさん@お腹いっぱい。
07/09/04 06:11:03 UdHs+6dV0
プレイなんだよきっと

569:名無しさん@お腹いっぱい
07/09/08 16:53:07 bG+CAb9F0
預金通帳を拡大コピーせずダイレクトにテキスト変換(エクセル等で使いたい)したいのですがうまくいきません。
預金通帳をトライした人いますか?
ちなみに使用ソフトは「読取革命」、スキャナーは300dpiです。

570:名無しさん@お腹いっぱい。
07/09/08 19:33:58 6fbD8CNm0
解像度を上げて試してみようと思わないのかねぇ……

571:名無しさん@お腹いっぱい。
07/09/08 20:25:51 mRd7ARAC0
>スキャナーは300dpi
って書いてあるからハードウェアの光学解像度上限が300dpiなのでは?
ならばそんなゴミは窓から投げ捨てて新しいスキャナ買え! としか言えない。

572:名無しさん@お腹いっぱい。
07/09/08 21:03:57 bG+CAb9F0
>>570,571
レス、サンキュー
正解です。300dpiが限度なのです。
どの位ならいいのでしょうか?

573:名無しさん@お腹いっぱい。
07/09/08 21:31:28 qzHioSaW0
画像の前処理が必要なんだと思う。

通帳って紙の地に模様が刷り込んであるよな。
灰色とか黄色とか薄い赤とかで。銀行のマークなんかが。

あれがOCRに読み取られてしまうと滅茶苦茶になるので
その模様をうまく消す画像のレタッチが必要なんだろう。
例えば背景が赤系の模様ならばRGBのRチャンネルだけ真っ白に飛ばしてから
残りの色だけで白黒化し、記帳されている数字だけ残るようにしてやる。

自分で思いつけない人は↑もちんぷんかんぷんかもしれんが
用は画像レタッチの知識が必要です、ということ。

スキャン解像度は300dpiあれば十分だと思うよ。

574:名無しさん@お腹いっぱい。
07/09/08 22:21:40 9kXomqHo0
・減色するとき閾値を上げる
・特定チャネルだけを使う(Rが入ってるならBだけとか)


575:名無しさん@お腹いっぱい。
07/09/09 04:18:08 Wayz4dwa0
OCRよりお前の目で見た方が遥かに認識能力が高い。
なにもわざわざコンピュータにたよらなくとも
お前にはそれだけの能力があるんだ。
自分にもっと自信をもちなさい。

576:名無しさん@お腹いっぱい。
07/09/09 04:25:08 YeApTPNwP
tesseract、3を5と見間違えるんですが
トレーニングで何とかなりますか

577:名無しさん@お腹いっぱい。
07/09/09 10:37:07 TJ6TdM9A0
>>573
職業がら200通位×ページ数
データ入力を目視、手入力では、時間が掛かり、転記ミスも発生。
人を雇うほど余裕はない。
画像レタッチ使用すれば黒と白のみと要らないデータは消せる。
しかし必要なデータと同じ色ならその部分のカットしかないし、時間が掛かりそう。
しばらく、考えて見ます。レス、サンキューです。






578:名無しさん@お腹いっぱい。
07/09/09 11:32:57 nU6AA3X+0
仕事で継続的にやることがわかってるんならネットバンギング登録すれば?
今時は都市銀でもやってるんだしアグリッパなりなんなり使えばExcelへの流し込みも簡単だろ

579:名無しさん@お腹いっぱい。
07/09/09 12:20:35 p37oIG6b0
banging?

580:名無しさん@お腹いっぱい。
07/09/09 12:38:40 TJ6TdM9A0
顧客すべてにネットバンキング入れる?
IT弱者の事も考えないのかなぁ?
ソフト使い方、セキュリティとかいろんな問題が出るでしょ。
よけいに手間が掛かるし老人や障害者もいるのでね。
ところでアグリッパ(PDF?)てなんでしょうか?ヒントになるかもしれない。




581:名無しさん@お腹いっぱい。
07/09/09 14:08:06 b4CWqVib0
> 顧客すべてにネットバンキング入れる?
> IT弱者の事も考えないのかなぁ?
> ソフト使い方、セキュリティとかいろんな問題が出るでしょ。
> よけいに手間が掛かるし老人や障害者もいるのでね。
> ところでアグリッパ(PDF?)てなんでしょうか?ヒントになるかもしれない。

おまいさんが廃業すればいいんじゃねーの?

582:名無しさん@お腹いっぱい。
07/09/09 14:27:05 nU6AA3X+0
スマソ、バンキングね。

>>580
客をネットバンクに入れさせる必要がどこにあるの?
要は取引明細をテキスト化できりゃいいんでしょ?
アンタが使ってる銀行で、アンタの口座をネットでも使えるように登録しとけば
ログインしてPCから明細見れるようになるんだからコピペでExcelに貼っつければいい
相手がどんな方法で振込んでこようが関係ない。

アグリッパは複数の金融機関の明細を一度に参照できるシステムだが
上の手順で済ませるのなら別に必要ない。知りたかったらググって調べろ

583:名無しさん@お腹いっぱい。
07/09/09 14:28:52 pF0za8zm0
画像レタッチしなくてもたいがい取り込み時の設定で
カラーバランスやコントラスト弄れるでしょ

必要なデータと背景の色が似てようが濃度や色味
違えば設定でどうにでもなるだろうし

あとはOCRで一番大事なスキャン品質を一定に保つ為
スキャナのパネルに枠貼り付けたりして位置ズレを徹底
してなくす努力だけ

584:名無しさん@お腹いっぱい。
07/09/09 15:58:38 6WtPLdEA0
システム作るなら、最初からocrエンジンを借りてきて、画像処理くらい自前で用意するだろ
犯罪のにおいしかしない

585:名無しさん@お腹いっぱい。
07/09/09 16:09:19 TJ6TdM9A0
あ、スマン、
顧客の日々の取引(入金、出金 残高、相手先)
のデータ作成を請け負っている仕事なので
ぜんぜん自分の口座と関係ないので乙。
カラーバランス、コントラスト いろいろやってみますね。
レス ありが㌧。




586:名無しさん@お腹いっぱい。
07/09/09 21:00:43 XLgeQDJm0
URLリンク(www.sii.co.jp)

587:名無しさん@お腹いっぱい。
07/09/09 22:55:58 0TmXydc30
既存の会計ソフトで通帳や出納簿に特化したOCRができるものもあるみたいだぞ。
ってかプロなのかyo
ドシロウトの俺が「会計 通帳 OCR」と検索してあたりがつけられるようなことを
知らないのってやばいんでねーの。

588:名無しさん@お腹いっぱい。
07/09/09 23:20:35 TJ6TdM9A0
これでしょ。
実際に拡大コピーしないとダメだったのですが・・・。
URLリンク(www.z-irazu.jp)

589:名無しさん@お腹いっぱい。
07/09/10 23:46:17 tLXqJKXQ0
>>588
>>571

590:名無しさん@お腹いっぱい。
07/09/11 08:00:32 Homl5X9v0
> 顧客の日々の取引(入金、出金 残高、相手先)
> のデータ作成を請け負っている仕事なので
> ぜんぜん自分の口座と関係ないので乙。

頭足りてないなら、とっとと廃業するべきだ。

591:名無しさん@お腹いっぱい。
07/09/22 12:38:33 IN/2021F0
e.typist12.0で ルビを文中に挿入を選択して文庫本をスキャン>認識すると
一部の行が左端の最後の行に重複して表示されてしまうのですが
どう対処したらよいのでしょうか?

592:名無しさん@お腹いっぱい。
07/09/25 17:38:23 Pnv4wn/K0
>591
たぶん傍点なんかで起きる現象と同じじゃないかな。結果のテキスト見ると複数の文章が混ざって
しまってる状態。
認識時に文章が赤くマークされるけど、こういうのが起きるときは赤いところが反転して白くなる。
それを見て、ファイル名をメモしておいて、あとから修正モードで傍点を削除してから別途認識
してる。それしか対処の方法はなさそう。
傍点が大量になければ、テキストになった段階で修正するだけ。

傍点以外でも、一部のルビ、ゴミ、……なんかで起きることもあるみたい。
ルビなしで傍点が大量にあるんなら、ルビは無視してしまうと思う。e.Typistの傍点挿入位置は
いつでもずれてるから。

593:名無しさん@お腹いっぱい。
07/09/28 00:49:01 kO0WhpSR0
>>575
んまあ、人間の脳って余分な作業も多いのか基本的に遅いからね
OCRに関してはまだ信頼性が微妙だからどの道人目チェックは必要だが
それでも手入力で全部やるよりはOCR+人手チェックの方が早い

と、マジレスしてみる

594:名無しさん@お腹いっぱい。
07/09/28 02:22:27 FG/hllZY0
>>593
お前は自分の能力に自信を無くしている。
しばらく山へ篭って自分を取り戻すべきだ。

595:名無しさん@お腹いっぱい。
07/09/28 06:42:17 JinZJTny0
ダイバダッダの魂宿りますた。
世界平和のために無償労働するっす。

596:名無しさん@お腹いっぱい。
07/09/30 05:12:31 fVlDcJAE0
>職業がら200通位×ページ数

これ見ると、ふつうの稼業じゃあないな
かたぎなら弁護士、司法系、税務・会計系か
やばいのなら斗一か事務所だな、と考えてみる。
だが、>>585か 税務資料か

「読取革命」、スキャナーは300dpiです → 最新版にする、解像度は最低400dpi(最新本ソフトの最低要件)でスキャン


597:ご参考まで
07/09/30 05:50:09 fVlDcJAE0
旧ヴァージョン アップデート(以下からたどる):
URLリンク(panasonic.co.jp)

最新版(V1.1.1)の特長:
・FAX文書などのかすれ文字にも強い日本語OCRエンジン
・レイアウトをそのまま再現
・縦書き・横書きテキスト、画像、図などが混在した原稿も、レイアウトをそのままに再現
・複雑な表の罫線やセルの背景色も、再現、また、認識結果で得た数字を数値としてExcelに出力でき、そのまま計算式に使用可
・英数字の一行手書き文字にも対応し、品番やメモ書きなどの手書き文字を認識

解像度 50~2,400dpi(400dpiを推奨)
>>596を一部訂正

URLリンク(panasonic.co.jp)
体験版(10日間)DL:
URLリンク(panasonic.co.jp)

598:名無しさん@お腹いっぱい。
07/10/01 23:00:54 ZJSIv2Sr0
記帳代行で乙。

599:名無しさん@お腹いっぱい。
07/10/03 02:48:08 lW4nXSBZ0
>>598
ご本人は正にその仕事をされているように思うのだがw

600:名無しさん@お腹いっぱい。
07/10/03 03:30:28 5xTbDZcD0
名簿データ取り込み?

601:名無しさん@お腹いっぱい。
07/10/03 04:51:39 9DUfmmoQO
URLリンク(imepita.jp)

602:名無しさん@お腹いっぱい。
07/10/03 05:07:51 ZwtirfFY0
下は簡単なCaptcha画像ですが、
URLリンク(ja.wikipedia.org)
ランダムな線が入っていたり、色が違っていても認識出来るような
ソフトは無いでしょうか?

603:名無しさん@お腹いっぱい。
07/10/03 07:43:43 nJglqY7H0
犯罪者乙!

604:名無しさん@お腹いっぱい。
07/10/03 09:58:49 lW4nXSBZ0
>>600
んや、税務会計関係

605:名無しさん@お腹いっぱい。
07/10/03 13:07:59 La1Wx76N0
>>602
スパム業者死ね

606:名無しさん@お腹いっぱい。
07/10/03 23:56:14 H4AdpPJY0
キャプチャってcaptureじゃなかったっけ

607:名無しさん@お腹いっぱい。
07/10/03 23:59:02 H4AdpPJY0
あー、全然別もんなんだ。俺が悪かった

608:名無しさん@お腹いっぱい。
07/10/12 22:47:53 SrJh6grm0
office2003に入ってる「microsoft office image document」が、
すごく使いやすかったんだけど、office2007になったら無くなってるね。
2003から持ってくることは出来ないのかな。

609:名無しさん@お腹いっぱい。
07/10/13 17:16:36 nepRO5lX0
読取革命だが、2つの文字を1つと間違えてしまう問題を学習機能によって解決できるの?
解決できるソフトはある?

610:名無しさん@お腹いっぱい。
07/10/13 17:39:44 GAhJKdKe0
学習機能は文字だけでしょ


611:名無しさん@お腹いっぱい。
07/10/14 06:29:53 VQe2G2hR0
間違えるのも認識するのも全て文字だけだが?

612:名無しさん@お腹いっぱい。
07/10/19 13:49:13 Ziv6Jg4J0
SmartOCR liteeditionのヘルプキャッシュってどこかにない?
com経由で利用したいんだけどまったく資料がなくてイミフ。
よろしくたのんます。

613:名無しさん@お腹いっぱい。
07/10/21 12:42:36 YC+r/lRo0
今現在 読取革命のVer.7を使って 英文と画像しかない物をスキャンかけてるんだけど
大体ミスが1ページにつき10文字位あるんだけどこれってVer.11 にすればもう少し改善される?
あとVer.11の方はアクティベーションあったりする?

614:名無しさん@お腹いっぱい。
07/10/21 13:20:42 zf4XBilV0
>>613
原稿の精度に左右される。
[K]ものだなw
悪知は無かったと思う(あってもクリア)
検証後DELしてしまったので

615:名無しさん@お腹いっぱい。
07/10/21 17:28:13 YC+r/lRo0
>>614
一般的な英語のテキストに対して使ってます
[K]もの? 体験版?それともクラックのことでしょうか?


616:名無しさん@お腹いっぱい。
07/10/24 10:50:55 S7BJ2he10
613
10文字ぐらいだったら、たいした手間じゃないからそのままでいいんじゃないの
それが5文字になったとしてもあまり変わらないような気がする


617:名無しさん@お腹いっぱい。
07/10/24 17:12:22 PvY78B8J0
>>613
英語のOCRはよほどスキャン状態が悪くなければ
単語DBとの照合なんかもしてくれるので
99.99%くらいの認識率まで行ってると思う。

英語圏のソフトの最新体験版を試してみては?

618:名無しさん@お腹いっぱい。
07/11/08 01:17:26 kSzZVbgV0
原稿にもよるけど英語OCRもまだまだ改良の予定があるよ。
段組なし(1ブロック)、フォント1種類、スタイル1種類、
罫線類なし、みたいな原稿だったらかなりの精度が出るけど、
そういう原稿って実際はあまりないし。

OCRが持ってる綴り辞書との照合もオートでやらせちゃうと
後で間違いを発見するのがかえって難しくなるので、結局
フラグがたったものを1つずつ確認してくしかない。


619:618
07/11/08 01:24:35 kSzZVbgV0
>>618
>改良の予定があるよ。

(正)改良の余地があるよ。

620:名無しさん@お腹いっぱい。
07/11/09 04:45:42 kwRwnBQS0
OCR機能のついたPDFビューア「クセロReader ZERO」
URLリンク(xelo.jp)

621:名無しさん@お腹いっぱい。
07/11/21 00:51:16 4YWhz3M30
>>620
URLリンク(xelo.jp)
ここを見ると、色々制限あるな

622:名無しさん@お腹いっぱい。
07/11/24 16:52:47 vQJ6YjAl0
期間中にクリック数の一番多い国が優勝
URLリンク(www.clickclickclick.com)


623:名無しさん@お腹いっぱい。
07/11/24 17:45:26 /M81SGwoP
>>622
独自OCRなんてあるんだ。。。

624:名無しさん@お腹いっぱい。
07/12/10 03:27:04 oguiPK7L0
紙にある表の枠を、
Excelで再現させるのは何のソフトがおすすめですか?

625:名無しさん@お腹いっぱい。
07/12/10 05:33:02 hQNhfr3P0
特打

626:名無しさん@お腹いっぱい。
07/12/10 15:20:26 mc4o5/AO0
簡単フォーム

627:名無しさん@お腹いっぱい。
07/12/10 16:48:47 gWDyiZys0
兆安い


628:名無しさん@お腹いっぱい。
07/12/22 22:02:42 aoTjNDiZ0
>>621
制限がファイル単位ってのは実はかなり緩いんじゃないか?
SmartOCRは制限は無かったけどページ単位でしか処理できなかったからなあ
こいつなら必要なファイルを一括してPDFに変換してそれを一気に処理させれば良さそう
精度うんぬんはまだ試してないから分からんのだけど

629:名無しさん@お腹いっぱい。
07/12/26 12:05:39 rr6NJUoQ0
上のほうでocr.rossa.ccのスパイウェアの話題をしてましたが...
ダウンロードボタンを押したけど、直ぐにブラウザ閉じた。
スパイウェア貰っちゃったかな?
大丈夫ですかね?

630:名無しさん@お腹いっぱい。
07/12/26 15:31:38 ieaMIqGT0
あそこからリンクしてるSmartOCRLite107.zipの中身は
ウェブ魚拓で2006年4月26日 02:44(日本時間)に記録された URLリンク(download.vector.co.jp)の魚拓
と同じ。zipファイル内のSmartOCRLite107.EXEの
CRC32:5e81c645
MD5:929502ab3f674b03e1551893507a0997
SHA-1:20321d496c76a335d649e170100f2f4771be384b

631:名無しさん@お腹いっぱい。
08/01/08 01:02:12 tmDGCBY80
ほっしゅ

632:名無しさん@お腹いっぱい。
08/01/14 23:05:37 KbHOKl/s0
        /⌒ヽ ,, - ─‐ - 、        
   , < ̄7⌒、_ノ::::::::::::::::::::::::::::::::::::::::::`ヽ       
 /:::::::::::::::乂 ノ:::::::::::::::::::::::::::::::::::::::::::::::::::::::\    
/:::::::::::::>‐7:: ̄::::::::::::::::∧:::::::::ト.:::::::::::::::::::::::::::::::ヽ   
:::::::::/  /::::::::::::::::::::::::/. V::::::|.ヽ:::::::::::::::::::::::::::::::::',.  
//   /::::::::::::::::::::::::/   V:::::.i ヽ.:::::::::::::::::::::::::::::::', 
     ,::::::::::::::::::::::__/.    V::i!::i  ',::::::::::::::::::::::::::::::::i. 
    i:::::::::::::::/ ̄/   `  ',::i',::', ─- 、.::::::::::::::::::::| 
.   |:::::::::::/:::::./ ,      ',.i ' ,、  ∨::\::::::::::::::::::| 
   |::::::::::::::::./  !_      `  \ V::::ヽ::::::::::::::::| 
.   |:::::::::::::::/ /示え、      二_、、 V、::::::::::::::::| 
.   |八::/⌒ / ん;;;;;;;|       /う ヾ、 ',:::::::::::::,  
    |/{ ∧  弋二ソ       |;;乂メ;| | |>k:::::/  
     k ⊥    ̄        弋二ン  /、iヽ/   
.      `‐|       '       ̄  /_ `/   <早くVIPに帰ろうよお兄ちゃん
        `、              メ__/    
         > _   r‐、    /ヾ       
      ,, -''´  |!ヽ| >-- ‐ r<´.         
   rヽ´  /  /       〈ニ ヽ          , -、
   |/ヽ\'  ./| ヽ      У \      / /                かわいいは正義
  ./   \ヽ { ヽ、   ´  /    ヽ ./´γ/ /                 URLリンク(afox.2ch.net)
 /   /  ヽ\ヽ  ̄` ─'/   |  ∨Y彡ヽ,〈 

633:名無しさん@お腹いっぱい。
08/02/05 14:27:51 j7DtTZgo0
本格読取2を購入して使ってみたけど、
さすが値段が安いだけあって辞書やパターン登録しても精度がよくないな。
読取革命11の体験版を使ってみようとインストールしてみたが、起動時にエラーが発生して試せなかった。
e.Typist12の体験版を試したら1日で何故か試用期間が終わった……orz

e.Typistはルビの埋め込みができるので、手持ちの小説をテキストに落とすのには良さそうだけど
もう少し認識率と領域指定を試してみたかったのにな。
手持ちの小説を青空形式でテキストにしている方で、お勧めのOCRソフトってありますか?

634:名無しさん@お腹いっぱい。
08/02/05 19:54:01 4B5oC2/T0
>>633
WinReader PRO テキスト作成ならばチョット昔のがいい
pdf作成ならば今のがいいけれど、OSがVistaでなければ安く中古で出回っている
図書館で借りてテレビを見ながらスキャン&テキスト化、約1時間でP250は楽に作成
その後ClieTH55で電車の中やチョットした時間で小説を読んでいる、家中本だらけにならずにすむ
また重い本を持ち歩かなくてすむし、返却も気にしなくてもすむ、今は流行のチョットエコな感じ





635:名無しさん@お腹いっぱい。
08/02/05 23:33:02 n6V+PtBt0
読取革命の体験版使ってみたけど何度直しても同じ文字ばっかり間違えて
一向に識字率が上がる気配が無いんですが、仕様ですか?

636:名無しさん@お腹いっぱい。
08/02/06 00:01:06 X1PyioH/0
>>635
読取革命は知らんけど
普通はユーザー辞書みたいに
この文字はこうなんだyoって教え込む機能があんじゃねえの?

637:名無しさん@お腹いっぱい。
08/02/06 01:29:31 ZvtDlRuB0
そういう機能があっても、間違えるものは間違えるのが読み取り革命

638:名無しさん@お腹いっぱい。
08/02/06 14:55:56 nDxnu5rf0
>>634
すまんが値段の段階で無理だ……
なにか方法を考えてみるよ。

639:名無しさん@お腹いっぱい。
08/02/06 22:27:32 yNcr4Ry/0
結局、読取革命はあきらめた。使う側のことがぜんぜん考慮されて無さ杉。
テンプレート一回一回あてさせるつもりか?しかも数行おきに認識されるってどーよ

それにしてもe.Typistの精度には驚いた。

640:名無しさん@お腹いっぱい。
08/02/07 02:16:50 mZYJX8l40
アドビAcrobat PRO CS3に付いているOCRはどうですか?


641:名無しさん@お腹いっぱい。
08/02/09 13:22:11 kx6Thi940
>>633
小説用途に限った場合の話だけど

e.Typistは比較的領域判定が優秀なのでほとんどの場合は自動でおk
小説再配置ツールやeTilTranで文字領域を切り出すだけで十分すぎるほど
認識率は読取革命よりはだいぶ上
ただ、感嘆符や―、……、ーのような記号をよく間違えたり読み飛ばしたりする
まれに同じページを不完全な状態で二重認識する(上半分だけとかそんな感じで)
ここがネック

ユーザー辞書は読取革命で何回教えても治らなかった経験から、全く使っていない
後で間違えやすい文字だけ一括置換してる

642:名無しさん@お腹いっぱい。
08/02/13 20:01:46 PDD8kYVFO
英単語帳を読み取ってエクセルのデータにして
P‐STUDYシステムに問題集として読み込ませようと思っているのですが
英単語帳にむいているOCRソフトってありますか?

643:名無しさん@お腹いっぱい。
08/02/13 20:04:16 zrpzYaHV0
>>641
規制されていたので、お礼が遅れました。
e.Typist12を購入して使っています。
おっしゃるように! ―、ー、一あたりの誤認識が多いですね。
…に関しては点線処理の縦点線ありにしたら、かなりよくなりました。
一括置換も100個が限度という所からエディタでするようにしました。
なかなか難しい所ですね。

644:名無しさん@お腹いっぱい。
08/02/28 09:23:33 NWfNaQSi0
保守

645:名無しさん@お腹いっぱい。
08/03/04 22:44:36 I6sGMd1z0
e.Typistでルビの部分の行を本文として処理してしまうことがたまにある。
eTilTranで傾き補正はかけた後なんだけど、これって解決する方法ないのかな?

ex)
正解:黄昏(たそがれ)が迫(せま)る道を

誤認識:たそがれ  せま
      黄昏が迫る道を

646:名無しさん@お腹いっぱい。
08/03/07 00:49:49 i9ecjhLU0
読取革命12、買おうかな。

647:名無しさん@お腹いっぱい。
08/03/07 21:40:57 jfB3M2/r0
読取革命12と読んdeココ13を単行本の読み取りで比較してみたけど、読んdeココの方がよかった。
読取革命は文字以外の部分を無理矢理、認識しようとして意味不明の文字列を連発する。
読んdeココは認識できないものはスッパリ諦めて無視する傾向がある。
この方がむしろ修正の手間がかからないから楽なんだよね。

648:名無しさん@お腹いっぱい。
08/03/10 09:02:26 1MG90Ymy0
そうかもしれないね。
でも読取革命のがしがし読む感じがいいんだよね(笑)
まあまとまったゴミを消去する機能があってもいいよね。

649:名無しさん@お腹いっぱい。
08/03/21 11:14:49 usFTg7Jp0
以前から疑問だったんだが・・・
スキャナとかコピーとかしたとき、
原稿の一部だけ、字がにじんだり、潰れたりするのは何が原因なの?
途中で動いたってことなのかな?
しっかり押さえたつもりで、自覚症状が無いことがほとんどなんだが。

650:名無しさん@お腹いっぱい。
08/03/21 14:03:36 vs8oaQ7S0
>>649
そうだと思います。
やっぱり、カード類なんかはプラスチックで滑りやすいんで、画像が
ボケたり、片側だけが広がったりしてますね。


651:名無しさん@お腹いっぱい。
08/03/22 22:33:23 26pq4wpB0
読んでココ13を使い始めたばかりの者です。
英文混じりの書籍を認識させるとき、小文字のc,o,sが頻繁に大文字に認識されます。
候補文字から修正してると自動的にユーザー辞書に追加されていきますが、
このまま同じ文字ばかり追加していって、認識率は上がるのでしょうか?
まだそれほど認識速度は落ちていませんが。
ほかにもっと上手いやり方がありますか?

652:名無しさん@お腹いっぱい。
08/03/22 23:31:46 B1KQW1w80
読取革命liteからver.12へのバージョンアップ、インストールがうまくできないのですが、この場合liteにver.12が上書きされることになるのですか?

653:名無しさん@お腹いっぱい。
08/03/24 11:50:59 Sg3HQnEQ0
ライトも12も残るよ。

654:名無しさん@お腹いっぱい。
08/03/24 21:33:37 RpC75rJB0
>>653
652です。レスありがとうございます。何度インストールしても辞書の読み込みに失敗、ということになり、どうやらliteインストール後にマイドキュメントをDディスクに移動させたのが原因ではないかと。Cに戻してから再度やってみます。

655:名無しさん@お腹いっぱい。
08/03/24 23:38:54 RpC75rJB0
>>653
辞書ファイルも、ライトと12と両方残るのですか?

656:名無しさん@お腹いっぱい。
08/03/25 10:13:15 UKwYieMD0
>651
それ以上認識率は変わらない。やりすぎると重たくなるだけ。
むしろ、テキスト出力して正規表現置換で小文字にしてしまうほうが
簡単じゃないかな。

657:名無しさん@お腹いっぱい。
08/03/25 20:01:55 6dsHcr8U0
当然残るよ。

658:名無しさん@お腹いっぱい。
08/04/02 18:09:26 PsFZJM1O0
etypist使っとけ

659:名無しさん@お腹いっぱい。
08/04/06 18:08:29 O2A1ix0/0
>>548
プリンタ付属の古い読んde!!ココ パーソナル(Ver.4.01)を使ってたが,
英文の認識だとこっちのほうがいいね

660:名無しさん@お腹いっぱい。
08/04/07 13:46:50 d5ef102Q0
eTypistて透明テキストつきpdfで出力できないの?


661:名無しさん@お腹いっぱい。
08/04/08 10:20:28 /9Ax63ok0
pdfをrtfかodfに変換する時に使えそうなのない?

662:名無しさん@お腹いっぱい。
08/04/09 18:14:29 wF5n2yAm0
つadobe acrobat

663:名無しさん@お腹いっぱい。
08/04/10 11:21:55 0U+ttj0K0
>>660 可能
>>661 e.typistで可能
URLリンク(mediadrive.jp)

664:名無しさん@お腹いっぱい。
08/04/10 15:03:50 pNf6kXbz0
読んでココでpdfを読み込むと、一から画像をOCRしてしまって、
元の透明テキスト情報は無くなってしまうのな?
元の透明テキストをそなまま読み込んで、修正のために、
テキストエディタ的な使い方って出来ないものかな?

665:名無しさん@お腹いっぱい。
08/04/11 23:10:11 Gt2UltzU0
画像ビューワとテキストエディタを左右に並べればいいだけでは?

666:名無しさん@お腹いっぱい。
08/04/11 23:10:57 Gt2UltzU0
画像ビューワじゃねーや
PDFのビューワな

667:名無しさん@お腹いっぱい。
08/04/13 03:10:25 CMPBLWQF0
それが器ホンダが、図とか写真とかレイアウトとか書式を設定したりするのが面倒くさいだろ。

668:名無しさん@お腹いっぱい。
08/04/13 05:37:43 C/qukH7P0
>>667
それのどこが「テキストエディタ的な使い方」なんだ?

669:名無しさん@お腹いっぱい。
08/04/13 21:11:39 CMPBLWQF0
テキストエディタ的って誰が言ったんだよ?

670:名無しさん@お腹いっぱい。
08/04/14 11:14:54 dJXYpbuD0
>>664
つadobe acrobat

671:名無しさん@お腹いっぱい。
08/04/15 21:11:34 3OAKXwi90
>>669
おまえ話の見えない奴だな~

672:名無しさん@お腹いっぱい。
08/04/16 01:45:53 TQ1X288s0
>>664
使うソフトを間違えてる
OCRは画像をテキスト化するソフト
PDF関係のソフトをあたるのが正解

PDF作成・変換ソフト。Part 5
スレリンク(software板)

673:名無しさん@お腹いっぱい。
08/04/23 21:47:14 q2B+fOBS0
英文しかない場合は、外国産の方が認識率高いの?
ヨンデココがどうもダメ、領域を正しく抽出する所から
ちゃんとやってくれない、かすれてないのに。
ネットで落としたものだから、コピーし直すとか出来ない。

674:名無しさん@お腹いっぱい。
08/04/24 08:00:33 34xibooz0
>>673
SmartOCRLこれは? 文字がはっきり写ってるなら 高確率で認識してくれるよ?

675:名無しさん@お腹いっぱい。
08/04/24 10:21:13 LqECzoR50
>>673
ちゃんと英語モードにしてからやってる?

676:673
08/04/25 20:14:31 SRLFiK0c0
一応、漢字は無し、英文字記号数字のみの
設定で読み込ませてはいます。
あとSmartOCRはぐぐってみたけど、
サイトが閉鎖してました。

677:名無しさん@お腹いっぱい。
08/04/27 16:15:02 lWgL7JQt0
>>676
SmartOCR - フリーウェアのOCRソフト
URLリンク(ocr.rossa.cc)

678:名無しさん@お腹いっぱい。
08/04/27 19:31:23 8zNLeoOp0
エクセルファイル⇔一太郎ファイル⇔ワードファイル
が出来るフリーソフトありませんかね?
一太郎で作った表を自動計算させたいのでエクセルファイルに変えたいのですが・・・。
ご存知でしたら教えていただけないでしょうか?

679:名無しさん@お腹いっぱい。
08/04/27 20:09:38 gFFqjIH80
URLリンク(q.hatena.ne.jp)

680:名無しさん@お腹いっぱい。
08/04/27 22:14:55 gVL4KMxz0
>>673
ABBYY社のFineReaderの最新版使うといいよ。
お試し版もあったはず。以前試してみて認識率の高さに感動した。
読んdeココも一応ABBYY社のエンジン使ってるけどたぶん古い。

681:名無しさん@お腹いっぱい。
08/04/27 23:06:11 D4XQ9+0+0
ソフト形式を変換とかじゃなくて表の(ハイパー?)リンクだけで出来そうだが

682:蕪木ら某 ◆Googl8RmwA
08/04/28 04:38:47 kpMp0cZ40
>>678-679>>681
+ URLリンク(faq.justsystem.co.jp)
 URLリンク(faq.justsystem.co.jp)
 URLリンク(faq.justsystem.co.jp)
 ...
 URLリンク(faq.justsystem.co.jp)
 ...
 スレリンク(bsoft板)
 ...

683:名無しさん@お腹いっぱい。
08/04/28 08:03:53 KHm4WEpd0
>>682
はいはい かしこいかしこい
なにもしなくても一太郎だけでできますよっと

684:名無しさん@お腹いっぱい。
08/05/06 12:37:25 TWTA7jP10
読んでココで認識結果をpdf出力するとき、
認識結果は透明テキストに反映されるわけだが、
2行を1行に間違えて認識してしまった場合、
上の行にしか貼り付けされないのな。
結果編集で改行入れても、その行は無いことになってしまう。
認識段階または結果編集段階で行を挿入できないのだろうか?


685:名無しさん@お腹いっぱい。
08/05/14 14:04:19 LzErthzGP
>>680
英文なら認識率いいのか…日本語の認識率の悪さに辟易したが。

686:名無しさん@お腹いっぱい。
08/05/14 17:49:48 nAAoVTJI0
だって文字の数や複雑さからして違うっていう

687:名無しさん@お腹いっぱい。
08/05/21 15:12:27 3tPMVg6y0
購入した本や図書館で借りた本を、OCRソフトで
テキスト化して個人的にノートパソコンかPDFで使用は、
著作権の違法に当たりませんか、またこの本を第三者に売却したら?

688:名無しさん@お腹いっぱい。
08/05/21 15:34:52 IB0cb+yL0
どう考えても売却はマズいだろ

689:名無しさん@お腹いっぱい。
08/05/21 15:37:22 3tPMVg6y0
図書館で借りた本はいいのかな

690:名無しさん@お腹いっぱい。
08/05/21 16:06:43 rcBGeT790
個人的な使用ならおkじゃ?
コピーとるのと同じでしょ

691:名無しさん@お腹いっぱい。
08/05/21 16:34:23 3tPMVg6y0
理屈ぽっくてすみません
友人から借りた多くの本でも

692:名無しさん@お腹いっぱい。
08/05/21 19:23:56 xmMzdCDf0
>>691
理屈の前に日本語勉強しる

693:名無しさん@お腹いっぱい。
08/05/23 02:21:36 dy5Q840K0
>>692
便所の落書き2chに何を興奮してんだよ、
変な物見てんじゃないぞ

694:名無しさん@お腹いっぱい。
08/05/23 08:39:24 qndHTxug0
>>687
借りた本を売ったらいかんだろ
ってのはともかく、
自分で買った本なら別に法には触れないだろ。

695:名無しさん@お腹いっぱい。
08/05/24 16:45:05 zkuID2AP0
PDF画像からテキストに変換で色々調べて準備終わった。
いざ実行してみるとPDFに画像コピー禁止の権限が・・ ヽ(`Д´)ノ オレノジカンカエセー

696:名無しさん@お腹いっぱい。
08/05/25 01:29:44 aA4ZumvxO
e.Typist ver.12を使ってみたんだけど、ルビを埋め込み設定にしたにも関わらず、認識結果は埋め込みとそのままが表示された。
ver.11だと普通に埋め込みのみなんだけど、原因がわからん。
設定同じなんだけどなぁ。なんか設定いじくる必要があるのかな。
どなたか解決策ご存じありませんか。

697:名無しさん@お腹いっぱい。
08/05/27 01:48:16 /mEeoUdB0
>>695
互換PDFビューアの過去バージョンで権限無視でコピーできるって話が昔あったような。


698:名無しさん@お腹いっぱい。
08/05/29 03:56:45 uFnsPlIH0
ビジネス書とかの単行本をテキスト化してるが、
e.Typist>>読んdeココ>>>>>>>>読取革命
だな。
読んdeココは多機能で使いやすくてバランスが取れた製品だと思うけど、
純粋に文字認識の精度だけを比べるとe.Typistが一番優れてる。

699:名無しさん@お腹いっぱい。
08/06/03 23:17:38 mqE/evSE0
>>680
ABBYY社のFineReaderはスゴイ
日本語化出来ないんだろうか?

700:名無しさん@お腹いっぱい。
08/06/03 23:47:39 WQ9oBg400
>>699
e.typistと比べてどっちが認識率が高い?

701:名無しさん@お腹いっぱい。
08/06/04 02:49:03 0YcMkrT10
>>700
英語ならFineReader、日本語ならe.Typistに決まってるだろ。

702:名無しさん@お腹いっぱい。
08/06/06 08:28:43 St1jBd+t0
FineReaderってOmnipageよりいい?

703:名無しさん@お腹いっぱい。
08/06/06 15:13:42 bjY5yxxP0
いい場合も悪い場合もある
URLリンク(www.ocrreview.com)

704:名無しさん@お腹いっぱい。
08/06/14 03:46:01 3uX8P8rx0
>>703
このサイト初めて見た。認識率だとやっぱりOmniPageが優れてるね。
FineReaderもそれに近い値だけど、時間も遅いので、なんだかこれを
使うメリットがにくい。


705:名無しさん@お腹いっぱい。
08/06/23 21:24:23 fdvf+v9p0
警察は宗教に目を光らせている、盲信によって罪悪感のない犯罪を
起こしやすい、教祖の出来不出来でその人の人生が決まる

教祖だけに罪はない、似たもの同士がお見合いするのかも知らない、
騙す人間が悪いが、騙される人間も同類か


706:名無しさん@お腹いっぱい。
08/06/23 22:00:12 KvQHOAny0
これまた激しい誤爆だな。

707:名無しさん@お腹いっぱい。
08/06/24 00:35:24 kDEQN6+m0
>>705
OCR誤認識がひどいな。


708:名無しさん@お腹いっぱい。
08/06/25 08:59:23 DKou2GCA0
読んでココはpdf出力するとき、追加保存が出来ないんだな。
wardやhtmlならできるのに・・・
仕方ないから新規ファイルで保存した後、いちいちpdfエディタ立ち上げて
結合させてるけど、マンドクセ。

709:名無しさん@お腹いっぱい。
08/06/25 15:04:00 OJ8SNbTv0
見開き表示とか綴じ方(右から左)の設定もできないから不便だよね。

710:名無しさん@お腹いっぱい。
08/06/30 17:17:28 nNrhDlkb0
ominipage 16が$79.99で買えるキャンペーン中

URLリンク(www.digitalriver.com)


711:名無しさん@お腹いっぱい。
08/06/30 19:37:06 5LpB7fyT0
>>710
↑クレカの番号と所有者名を収集してるんか?
トップページに行けないぞ?

712:名無しさん@お腹いっぱい。
08/06/30 19:38:03 5LpB7fyT0
Domain Name: NUANCESTORE.COM
Registrar: NETWORK SOLUTIONS, LLC.
Whois Server: whois.networksolutions.com
Referral URL: URLリンク(www.networksolutions.com)
Name Server: PDNS1.ULTRADNS.NET
Name Server: PDNS2.ULTRADNS.NET
Name Server: PDNS3.ULTRADNS.ORG
Name Server: PDNS4.ULTRADNS.ORG
Status: clientTransferProhibited
Updated Date: 16-oct-2006
Creation Date: 01-feb-2006
Expiration Date: 01-feb-2009

713:名無しさん@お腹いっぱい。
08/06/30 19:38:43 5LpB7fyT0
Registrant:
Digital River, Inc.
9625 W. 76th Street
Eden Prairie, MN 55344
US

Domain Name: NUANCESTORE.COM

------------------------------------------------------------------------
Promote your business to millions of viewers for only $1 a month
Learn how you can get an Enhanced Business Listing here for your domain name.
Learn more at URLリンク(www.NetworkSolutions.com)
------------------------------------------------------------------------

Administrative Contact, Technical Contact:
Digital River, Inc. hostmaster@digitalriver.com
9625 W. 76th Street
Eden Prairie, MN 55344
US
952-253-1234 fax: 952-253-8497


Record expires on 01-Feb-2009.
Record created on 01-Feb-2006.
Database last updated on 30-Jun-2008 06:31:44 EDT.



714:名無しさん@お腹いっぱい。
08/07/01 08:23:46 AL20YzVU0
はあ?
ieでもsafariでもいけるよ

715:名無しさん@お腹いっぱい。
08/07/09 09:25:33 tqR/hLP70
手書きの文字が認識できるOCRソフトってありますか?

716:名無しさん@お腹いっぱい。
08/07/25 18:03:44 nsfqqXyN0
TextSS

717:名無しさん@お腹いっぱい。
08/07/31 12:46:10 KkyDCbb60
文字じゃなくて、表などの枠線をスキャナから認識ってできますか?

718:名無しさん@お腹いっぱい。
08/07/31 14:14:49 kYKcm3m90
できます
URLリンク(jp.fujitsu.com)

719:名無しさん@お腹いっぱい。
08/07/31 23:49:10 mcLkMUjo0
>>717
e.Typistってのを使ってるけど、できますん

720:名無しさん@お腹いっぱい。
08/08/01 10:40:29 DLLVnu+y0
>>718
終了だから"できた"でつね

721:名無しさん@お腹いっぱい。
08/08/07 00:06:40 BSuE1Slo0
SubRipでbmp化した字幕データをテキスト化したくて、
読んでココv9と最新体験版、革命v12、タイピストv12、
スマートライトを試しました。スマートライトは画像読むだけで落ちるので
インストールに問題があったようなので別として、のこりでも、
見事に一文字たりとも認識されません。おまけにココだと、解像度エラー
といわれてしまいます。
吸い出し時に設定を変えてみましたが、白地に黒縁かその逆かはともかく
フチ付きの絵になり、それが誤認識の原因ではないかと考えていますが、
あまり自信がありません。どういう手順で、またどんなソフトを使って
(bmpは1500あるので、ひとつずつ開かなくてすむように)色などの
調整を試すのがよいか、どなたか教えてくださいませんでしょうか?

722:名無しさん@お腹いっぱい。
08/08/07 18:58:58 eM6AkDyu0
前に画像処理ソフトで処理してから読み込ませた方がいいかも。

ネガ反転や、解像度変更、ノイズ除去、余白やいらない部分の削除、カラー画像であればグレースケールや白黒画像に変換など、

一括処理できるソフトもたくさん有りますから、やってみるといいかもね。



723:名無しさん@お腹いっぱい。
08/08/13 00:32:22 IzZ40ACA0
どうしても小文字(ぁぃぅぇぉやゃゅょなど)が弱い
どこのソフトも駄目だ

724:名無しさん@お腹いっぱい。
08/08/13 09:31:08 v6VOgDwN0
e.Typist ver12買ってOCR作業中。
正 。 → o・O・0・0 これは許す。すっごいイヤだけど難しいだろうから。
正 I →1 これも当然許す。すっごい難しいだろうから。英語領域にしていすればかなり改善するし。
正 - → 1・I これはなに? なにしてるの? バカなの?('A`)

725:名無しさん@お腹いっぱい。
08/08/13 09:36:20 QnPzfkJy0
>>724
OCRにマジになるとか時間の無駄

726:名無しさん@お腹いっぱい。
08/08/13 12:13:34 jZK0Tj450
>>724
そんなに嫌なら文字種いじれよ

727:名無しさん@お腹いっぱい。
08/08/14 04:33:00 bB/191pD0
設定が悪いんじゃないの(笑)

728:名無しさん@お腹いっぱい。
08/08/14 10:08:20 +Lwt0Ob70
同じくeTypsit使ってるけど、ScanSnapでPDFに→OCR→透明テキスト付きPDFにすると画像がかなり劣化する。
Scan直後のPDFの画質を守る方法ってないのかな?(´・ω・`)
Acrobat Pro持ってるけど、画像が劣化したあとのPDFを編集しても意味ないよね…

729:名無しさん@お腹いっぱい。
08/08/14 16:13:43 BarBaXMw0
透明テキストつけるだけなのに
画像が痛むのか

730:名無しさん@お腹いっぱい。
08/08/14 17:14:00 yeyKQnnw0
OCRソフトのpdf入力は一端仮想プリンタに出しちゃって画像にして
文字認識してから改めてpdfに仕立て直してるからな。

最初からjpgでスキャン出力してそれをOCRソフトにかけるか
pdfにしちゃってたものは一度画像として書き出してからOCRソフトにかければいい。

731:名無しさん@お腹いっぱい。
08/08/14 22:51:59 d+q5/K3K0
実家にある本でもテキスト化してみるかと思って読んでココの体験版入れてみたけど
使い方もわかんねえし、結構めんどくさいんだな
小説なんかをちゃんと設定してやると誤認識1ページにどれくらいになるの?

732:名無しさん@お腹いっぱい。
08/08/15 02:20:36 UA5Ln4AC0
きちんとやればほとんどご認識なんかないよ。
どうしても読めない漢字とかってあるけど。
たとえば解像度600dpiとか、試しにやってみれば。


733:名無しさん@お腹いっぱい。
08/08/15 06:10:09 3bwMrQBM0
読んdeココのOCRファクトリー便利だぜ。
一度設定すればアイコンをダブルクリックするだけで全部自動でやってくれる。

734:名無しさん@お腹いっぱい。
08/08/16 21:12:32 BBpdl85r0
>>731
元の本のフォントと組版、スキャンの解像度にもよるけど
最良の時で大体1~2頁に1字前後
酷いと1頁に10字以上とかあるね

1頁に誤字一字の割合だと読でてかなり気になるレベルだから
結局全編目を通して修正することになるね

735:名無しさん@お腹いっぱい。
08/08/17 10:35:23 EfKqQDE+0
e.Typist使ってみたけど、たまに一文字を勝手に分離して認識してしまう。
「え」が「、」と「λ」とかになる。
二文字に認識してるから学習しようがない。
細い所とかかすれるとだめ。
まだまだって感じだなあ。

736:名無しさん@お腹いっぱい。
08/08/17 21:14:50 NNvDk3xe0
何様だよw

737:名無しさん@お腹いっぱい。
08/08/17 21:44:41 a9bB+bqN0
読んでココの開発者だろ

738:名無しさん@お腹いっぱい。
08/08/18 01:00:46 v0mRsvdB0
>>732
ああ普段使わないからスキャナの設定なんか全く見てなかったわ
画像データだけ持ってきたけど、だめかもシンネ

OCRファクトリーでまとめて読み込んだ後って読んでココ上で誤字とか確認してる?
画像勝手に追いかけてくれるし、学習しなきゃだけど、エディターが使い

739:名無しさん@お腹いっぱい。
08/08/19 14:17:41 m4W/W6650
読んでココを試用してますが、
原稿では2行になってるはずなのに、1行の文として認識してしまい、
わけ分からない文字列を出してくるとき、これを2行に修正することは出来ませんか?
ただテキストを起こすだけなら、認識結果画面で改行して手打ちすれば良いだけですが、
当方、画像が重要な資料を扱ってるため、PDFで透明テキストで貼り付ける必要があり、
ただ改行しただけでは、透明テキストにはその追加した行が反映されていないのです。


740:名無しさん@お腹いっぱい。
08/08/19 14:32:14 pZKp1XtT0
AcrobatってOCRソフトとしてどんなもんなんだろう?
アカデミック版Standardで1万ちょいだから買ってみようかな?

741:名無しさん@お腹いっぱい。
08/08/19 14:37:27 9YTtEXub0
AcrobatのOCRは糞
よんでここ>>e.typist>読み取り革命>>>>AcrobatOCR

742:名無しさん@お腹いっぱい。
08/08/19 20:34:17 aPjCwCOs0
acrobat ocr≒ヨンデココ

ヨンデココ工作員市ね

743:名無しさん@お腹いっぱい。
08/08/19 22:10:18 ThYcLLsW0
e.Typist>読んでココだろ。

744:名無しさん@お腹いっぱい。
08/08/20 11:54:34 5xCLDVVM0
e.TypistのHP見てきたけど、
取り込んだ画像の補正機能について何も書いてないようなんだが、
見開きの傾き自動補正とか出来るのかな?

745:名無しさん@お腹いっぱい。
08/08/21 02:30:37 VsRH2oEP0
ここにはe.Typist使ってる奴はいないってことか

746:名無しさん@お腹いっぱい。
08/08/21 10:04:41 piDQE/Jd0
5cm身長アップが50m身長アップになった
これで俺も51m56cmだぜ

747:名無しさん@お腹いっぱい。
08/08/21 12:47:35 Q0h/A3Xy0
>>744
見開き手動補正はできる。
自動の傾き補正は見開きには対応してない。

748:名無しさん@お腹いっぱい。
08/08/21 15:39:21 Gdf1OOpi0
>>747
そっかー手動なのか。
こういうのは機械任せがありがたいんだけどなー。
サンキュー

749:名無しさん@お腹いっぱい。
08/08/21 17:31:48 ksXciaP30
smartOCRはいつも「事」を「夢」と認識する
後からテキストエディタで一括修正した方がいいのか

750:名無しさん@お腹いっぱい。
08/08/24 06:25:03 h6cmS6A40
>749
認識辞書で対応すべきではある
「夢」と「事」じゃ、正規表現使ってもまともに修正するのは難しいし、
一括置換すると間違ってないところまで間違えてしまいかねん、一つ一つ
修正するのはどっちもそれなりの数がありそうだから面倒

>745
e.Typistも読んdeココも使ってる。
個人的な感想としては、OCR結果を縮小してあるような画像だと、e.Typistのが
認識率はかなり高い。画像がでかくなるほど両者の認識率は近づいていくけど、
OCR直後のでかい画像だと読んdeココのが多少いいような気はする。

>739
不可能だな。1文字の区切りがきちっとできている状態で、それがどの文字なのかを
学習させることは可能だが、1文字の範囲がどこからどこまでかは学習させようが
ない。本文とルビをごっちゃにして1文字にしてしまうような場合と同様で、ずっと
以前からこういう状態だから、技術革新がないと無理じゃね

751:名無しさん@お腹いっぱい。
08/08/24 09:59:49 rHvUrtQk0
>>750
ピントのずれた、無駄に長い、タイミングの悪いレス、どうもありがとう。


752:名無しさん@お腹いっぱい。
08/08/24 10:12:44 MGOLjeef0
別にずれてないんじゃね

753:名無しさん@お腹いっぱい。
08/08/24 10:58:32 b29yVzjt0
正解率99% ネット認証技術、書籍のデジタル化に威力
URLリンク(www.asahi.com)

754:名無しさん@お腹いっぱい。
08/08/25 17:48:36 5eaoBiak0
うーん、99.1% ってほぼ自動ってのにはまだまだ程遠いね・・・

755:名無しさん@お腹いっぱい。
08/08/25 18:00:07 GHGOAqBa0
つかこれ英語限定じゃないの

756:名無しさん@お腹いっぱい。
08/08/25 18:50:29 kMvnDz2o0
人間の正解率てのは元々どのくらいなんだろうな。
俺なんて入力ミスもしてたんだろうが再入力の経験が何度もあるぞ。
人力OCRだから英語以外は対象地域を絞らないと無理だろうね。

757:名無しさん@お腹いっぱい。
08/08/25 20:00:55 JUspXpDS0
>>753
結構いいアイデアだな。
日本語だと厳しいが、まあ2chとかの日本語コミュニケーション限定サイトに
置くなら何とかなるかもしれん。

・・・と書いてて今気付いたんだが、難読文字を読んで貰って、それが正しいかどうかの
答え合わせは誰がやってるんだ?
読んだ結果が正しいと判って、それで初めて認証として成立するんだろ?

758:名無しさん@お腹いっぱい。
08/08/25 22:11:40 pBM6iPT60
>>753
よくこんなこと思いついてしかも実行したよなww

759:名無しさん@お腹いっぱい。
08/08/26 11:13:56 3pII43Sm0
>>757
二つのOCRで一致した部分は正解、ちがった部分は不明として
正解と不明が含まれたものを表示して入力させ
正解の部分は認証として使い、不明部分を入力結果から拾う

とかかね

760:名無しさん@お腹いっぱい。
08/08/29 05:58:38 PUHS2H7P0
多数決

761:名無しさん@お腹いっぱい。
08/08/30 16:48:15 UobhjFbi0
ケツ多数

762:名無しさん@お腹いっぱい。
08/08/31 00:12:15 xOEiIMAi0
どんなに正答率が上がったところで人による目視チェックは必須だろう。

763:名無しさん@お腹いっぱい。
08/09/07 09:56:23 9RYOriMs0
>>762
>人による目視チェックは必須

そうです。そしてそこが一番手間と時間がかかる部分。

上に出てたAcrobatのOCRはこのプロセスがないし、埋め込まれた
透明テキストを後から修正するのも事実上困難(不可能では
ないが、OCRソフトでオンタイムに修正していくような訳にはいかない)。
一カ所でも間違いあると困るというOCR作業もあるでしょうが、そうでない
場合には割り切って使うと便利とも言える。特にScanSnapとの組み合わせ
で大量の文書を処理する時など。

OCRエンジンも7で読んde! ココ(の世代落ち)になってるが、8や9で
どうなってるのか分からない。

764:名無しさん@お腹いっぱい。
08/09/10 11:38:25 H8/lfHgO0
OCR使ってて感じるのは、誤変換の原因はほとんど「切り出し間違い」。
文字列に占める空白の割合なんかから一意に決めてるんだろうけど、
カスレの多い原稿だと区切るところがめちゃくちゃ・・・
きっちり区切りなおせば正しく認識できるのに・・・
ユーザー辞書や単語認識かけて文字列にならないときとか、
この切り出しを見直して再認識処理してくれないのかね?
処理時間がべらぼうにかかりそうだけど。

765:名無しさん@お腹いっぱい。
08/09/10 12:42:49 8eNIWm0W0
GPUで処理できるようになったら何でも有りになるな。

766:名無しさん@お腹いっぱい。
08/09/10 18:20:58 8r86j5IT0
読んでココ使ってるんだけど、「~」が認識されず空欄になってることが多い。
ユーザー辞書にも1文字だけど登録してるのに。何とかならないのかな?

767:名無しさん@お腹いっぱい。
08/09/10 18:22:38 aAaEuFR10
>764
小説みたいに同じ大きさの文字が延々と続いているのであれば、文字の大きさを
手動指定するモードとかあっても良さそうだよな。
見出し、本文、ルビの大きさを指定して、そこから文書を解析して認識するのなら
そんなに難しくはないような気もする。新聞とか広告文みたいにいろんな大きさの
文字が混在するのには無力だろうけど

768:名無しさん@お腹いっぱい。
08/09/12 17:59:53 BkRq8OtC0
URLリンク(code.google.com)
NHocr is a command line OCR (Optical Character Recognition) program for Japanese language

769:名無しさん@お腹いっぱい。
08/09/21 20:05:56 CcopwTiy0
素人で失礼ですが
OCRソフトは、10万円以上の価格でないと、7割文字認識できませんか?


770:名無しさん@お腹いっぱい。
08/09/21 22:19:11 m2yjq4Bi0
原稿の状態によっては何万出しても変わらない。
認識エンジン自体は1万前後の製品とはそんなに変わらなくて、内蔵辞書を持つとか、そういうところが変わってくる

771:名無しさん@お腹いっぱい。
08/09/24 01:41:38 KwoBHrO90
既存のPDFファイル(複合機でスキャン)に透明テキストを乗せようと
読んdeココ!!と読取革命の体験版、クセロReaderZeroを試してみたのですが、
完成後のファイルサイズがとんでもなくマチマチになるのはどうしてでしょうか?
クセロで約3倍、読取革命で約5倍、読んdeココ!!で約17倍にもなってしまいました。

同じ読んdeココ!!で、自動処理ではなく手動で作業を進めていくと
元々のファイルとほとんど変わらないサイズのものができあがるので、
これと同様の処理をなんとか自動でしてもらえたらいいのですが。

772:名無しさん@お腹いっぱい。
08/09/24 09:25:41 NU0TD4QW0
複合機の一部では、カラーやグレイスケール画像をJPEGの数分の1に圧縮するものがある

OCRで画像を読んで保存するときに、
1 読み込んだ画像を通常のJPEGで保存→ファイルサイズが数倍に
2 元の高圧縮画像のまま保存→ファイルサイズは元のまま

というケースに遭遇したことがある。今回のケースに当てはまるか分からんが。

773:名無しさん@お腹いっぱい。
08/09/24 15:57:00 j94B8AKB0
ソフト(と手順)によっちゃ画像をビットマップに展開して
再度圧縮してしまう場合もある

OCRソフトって文字認識に関しては強くてもPDFや画像の
扱いがなんでここまで糞なのってのが多い

774:名無しさん@お腹いっぱい。
08/09/24 16:30:47 NU0TD4QW0
非可逆圧縮で何度も圧縮・伸張したらひどいことになるんじゃ...
と思ったら手動の場合はちゃんとやっているのか

775:名無しさん@お腹いっぱい。
08/09/24 18:09:51 v43+h7ws0
いったい何を言っているんだ?

776:名無しさん@お腹いっぱい。
08/09/24 20:46:29 j94B8AKB0
>>774
結構その「ひどいこと」になっちゃうOCRソフトが多い

777:771
08/09/25 01:44:15 VosBAVv30
レスありがとうございます。

>>773さんの書かれているところが問題のようですね。
試しに複合機で作成したPDFファイルをAcrobat Pro(の体験版)でTIFFに変換し、
それをOCRで自動処理し透明テキストPDF出力としたところ、
サイズの変動がほとんどなくなりました。
次からは複合機でのスキャン時にPDFではなくTIFFで保存することにします。

あとは見開きの傾き自動補正がどのソフトでもできないようなので、
これについてはTIFFファイルをどうにか処理してみようと思います。

マンガのスキャン技術スレはマニアックな深みにはまってるようですが、
検索用に本をPDF形式でため込むだけならかなりよい感じですね。

778:名無しさん@お腹いっぱい。
08/09/25 08:14:14 A9ZTqUPm0
>>777
>マンガのスキャン技術スレはマニアックな深みにはまってるようですが

そのスレ教えてください。

779:名無しさん@お腹いっぱい。
08/09/25 14:59:37 6Td5Al990
>あとは見開きの傾き自動補正がどのソフトでもできないようなので
読んでココはできるっしょ?

780:名無しさん@お腹いっぱい。
08/09/26 13:37:29 yFUJpsc5O
e.Typist使ってるんだけど、だんだん操作するのが面倒になってきたので、
ファイル名を渡して連続自動処理を開始させたいんだけど、
どうやれば可能なの?


781:名無しさん@お腹いっぱい。
08/09/26 18:17:08 z9c8uZzd0
>>778
【初めての】スキャン職人養成スレ 七【自炊】
スレリンク(download板)
とか
【コミック】 自炊技術スレッド 30冊目 【書籍】
スレリンク(download板)
とか見てると画質と作業時間のトレードオフで無闇に画質よりにしすぎてるような気がするのですが。

>>779
最初に読ませるファイルと最後の出力ファイル名以外は全自動でさせるモードだと、
普通の傾き補正しか選べなかったように思うのですが、もう一度見てみますね。
「見開きのラインを認識できないなら仕方ない」と漠然と考えていたのですが。

782:名無しさん@お腹いっぱい。
08/09/26 18:39:15 Dg2t2hyN0
>最初に読ませるファイルと最後の出力ファイル名以外は全自動でさせるモードだと、
ああ、OCRファクトリーのことか。
それは使ったこと無いからわかんないや。
読んでココで見開き自動補正というと、センターを手動で指定すると、
あとは自動で傾き検出、補正してくれるってことだから。

783:名無しさん@お腹いっぱい。
08/09/26 20:07:07 z9c8uZzd0
>>782
はい、そういう名前でしたね。
本をガンガン処理していきたいので手動センター指定を全ページというのがちょっと重荷なので。
もっとも、修正をかけなくてもOCR処理自体は問題なくしてくれるのでそれなりに満足です。

784:名無しさん@お腹いっぱい。
08/09/26 20:13:45 z9c8uZzd0
>>782
はい、そういう名前でしたね。
本をガンガン処理していきたいので手動センター指定を全ページというのがちょっと重荷なので。
もっとも、修正をかけなくてもOCR処理自体は問題なくしてくれるのでそれなりに満足です。

785:名無しさん@お腹いっぱい。
08/09/26 20:31:24 z9c8uZzd0
>>782
はい、そういう名前でしたね。
本をガンガン処理していきたいので手動センター指定を全ページというのがちょっと重荷なので。
もっとも、修正をかけなくてもOCR処理自体は問題なくしてくれるのでそれなりに満足です。

786:名無しさん@お腹いっぱい。
08/09/26 20:32:42 z9c8uZzd0
うわああ連投してしまってた。 申し訳ないですorz

787:RQJgKKUofecPPwugoiK
08/10/21 00:23:09 HUr/ledZ0
More about mesothelioma at <a href="URLリンク(www.webng.com)">mesothelioma cancer lawyer</a>
URLリンク(www.webng.com)
[URL=URLリンク(www.webng.com) cancer lawyer[/URL]

788:bBDymJSOLg
08/10/21 00:23:09 TK425olO0
More about mesothelioma at <a href="URLリンク(www.webng.com)">mesothelioma cancer lawyer</a>
URLリンク(www.webng.com)
[URL=URLリンク(www.webng.com) cancer lawyer[/URL]

789:kIEszFhHEH
08/10/21 00:23:19 E+wJqkJG0
More about mesothelioma at <a href="URLリンク(www.webng.com)">mesothelioma cancer lawyer</a>
URLリンク(www.webng.com)
[URL=URLリンク(www.webng.com) cancer lawyer[/URL]

790:lqhDyZkYU
08/10/21 00:23:25 IPLca0TN0
More about mesothelioma at <a href="URLリンク(www.webng.com)">mesothelioma cancer lawyer</a>
URLリンク(www.webng.com)
[URL=URLリンク(www.webng.com) cancer lawyer[/URL]

791:rLrwTcsIAjZpfNgSA
08/10/21 00:24:59 Ps1bh35Y0
NSr3Vk This pearl has a programmable grind and brew feature, it holds a quarter pound of coffee beans and it has a filter indicator to tell you when your water filter is pooched, URLリンク(frespmesh.cn) Vons Weekly Ad
, :[[, URLリンク(fresnmesh.cn) Protran
, 843, URLリンク(fresnmesh.cn) Ludo Game Programming In C
, jii, URLリンク(fresimesh.cn) Snug Harbor Marina Chautauqua Ny
, enlfg, URLリンク(fresimesh.cn) Jardine Technical Services
, 8], URLリンク(freshmesfsdfh.cn) Lightbearers
, fvfm, URLリンク(fresimesh.cn) Safest Prescription Eyeglasses Fda Approved
, 966151, URLリンク(fresjmesh.cn) Female Pudenda
, 8-(, URLリンク(fresqmesh.cn) Sacagawea Dollar Quarter Machined
, 6948, URLリンク(fresmmesh.cn) Hydrolux
, :PPP, URLリンク(freskmesh.cn) Dvop
, 8-PPP,

792:名無しさん@お腹いっぱい。
08/10/28 07:01:10 2UwgvcQp0
読んでココ、早くunicode文字に対応してくれ!

793:名無しさん@お腹いっぱい。
08/10/29 19:21:47 GUt1EgdT0
OCRソフトって、前後の文字から推測するアルゴリズムにすれば
熟語とかの認識率が格段に上がるはずなのになんでやらないんだろう?
どうみても1文字ずつ単体でしか認識しようとしてないよな。

794:名無しさん@お腹いっぱい。
08/10/29 20:30:23 K8CjuoRX0
OCRって、元々の用途を考えると文章には不向きなんだよね。
申し込み用紙など決まった書式の中に住所、氏名書くようなものとか葉書(送り先を読み取って自動仕分けする機械がある)とか。
一語一句(誤字脱字も異字体も)正確に読み取るような用途向けだったはず。

それに、1文字でも誤認識があると、熟語全体を誤認識する可能性すらある。(だから「格段に上がるはず」という想定が通用しない。)
それを自動でどうにかするのが逆に難しい。1文字の区切りや行、列の方向を誤認識する事すらあるくらいなのに、複数文字組み合わせで
判定しようとすると辞書に無い熟語は認識率が上がらないし、辞書に無い熟語を「辞書にある熟語」で誤認識する可能性もある。
辞書の語彙を増やすと似たような文字を誤認識した場合に熟語ごと誤認識する可能性も高まる。

結局は1文字ずつちゃんと認識できないと辞書があっても誤認識率が上がるか大して変わらないからあまり意味が無いのでは?と思う。(人間の曖昧情報の認識力って優秀だよね、と思える部分)
かな漢変換エンジン(今で言うIME)のメーカーとOCRメーカーが組んで作ったところで・・・1文字誤認識しただけで1文丸々誤認識とか勘弁して欲しい事態になることも。

795:名無しさん@お腹いっぱい。
08/10/30 11:25:27 6UKMxSSc0
そこまでいく文字認識じゃなくて人工知能だからね。
コンピュータに一般常識やら駆け引きやらを実行させなくてはならない問題だ。
膨大なデータベースと高速演算が出来れば可能なのかもしれないが。

796:793
08/10/30 18:26:59 wNT2JRDf0
いやいや人工知能ってほど大げさなものじゃなくてさ。
例えば「微細」っていう言葉を認識するのに、ソフトは1語ずつ第一候補・第二候補…と
候補の語をいくつか持っていると思うんだよ。
それで2つの語の候補がそれぞれ、[1:徴 2:微 3:徹] [1:細 2:紳 3:組]だったとすると
この語句の組み合わせ(3x3=9通り)で熟語として成り立つのは「微細」だけ。
1語ずつ認識すると「徴細」という誤った結果になるけど、語の組み合わせで辞書と照合
すれば正しく「微細」となる。
単純に、辞書で照合できた熟語だけ優先的に出力するということ。
活字のOCRならこの方法が有効だと思うんだけどなあ。

797:名無しさん@お腹いっぱい。
08/10/30 18:37:13 1mZmHH950
>>793
実際高い製品ではそういうのができるものもあるよ。
というかスペルチェッカや文法チェッカのような技術は確立してるし、日本語の形態素解析も、再変換の技術がある程度確立してるから、技術的な困難はない。
ただデータベースのサイズが格段に上がるうえ、認識に極端な時間がかかる、辞書に載ってない言い回しや単語に弱い、言語が固定されてしまう(外来語に弱い)等の問題がある。


798:名無しさん@お腹いっぱい。
08/10/30 20:28:12 /oREtNdF0
そういう機能って、E.
とか読とかにだって最初からついてるよ。
マニュアルちゃんと読んで使えるようになってください。

799:名無しさん@お腹いっぱい。
08/10/30 21:45:34 MMyq2Afv0
英語のような分かち書きする言語だと比較的対応してるよな

800:793
08/10/31 18:17:48 JCWTUkt60
>>798が言ってるのはおそらくよく間違えて認識する単語を予め手動で登録しておく
ユーザー辞書のことを言ってるんだと思う。
俺が言ってるのはそうじゃなくて、国語辞典並みの20万語くらいの辞書をソフトが
持っていてその辞書を使って認識させることを言ってる。確かに>>797が言うように
極端に時間がかかる可能性があるし、メモリも食うと思う。今まで1時間程度で
終わってた処理がもしかしたら10時間くらいかかるかもしれない。でもそれだけ
かかっても認識の精度の方を選びたいという需要はあると思うんだよな。速度重視と
認識率重視の2つのモードがあってもいい。現在95~99%と言われる認識率が1~2%
上がるだけでも十分価値がある。最近のマルチコアのCPUを有効に活用できると思うし。

801:名無しさん@お腹いっぱい。
08/10/31 20:11:39 bCRz+lPk0
時間のかかるOCRソフトに用はありません
昔の3D処理ソフトじゃあるまいし


802:名無しさん@お腹いっぱい。
08/10/31 20:29:59 xBhEoWYg0
>>800
長文書く前にOCRを使ってみてはどうか?
お望みの辞書がついてると思う。
が、お望みの価値は見出せないだろう。

803:名無しさん@お腹いっぱい。
08/10/31 21:12:56 JLOd34LC0
>>800
先ずワードのスペルチェッカや文法チェッカを使えよ
道具を使えないんじゃチンパンジー以下だぞ

804:名無しさん@お腹いっぱい。
08/11/01 03:50:42 SFh3NAV80
>>800

URLリンク(mediadrive.jp)
URLリンク(mediadrive.jp)


805:名無しさん@お腹いっぱい。
08/11/01 13:09:12 A6vJWRwI0
e.typistのバージョン上がってたから一応
001408DE : 11→00

eTyp12mem.dllは一緒

806:名無しさん@お腹いっぱい。
08/11/02 13:02:46 AJubgEGf0
たぶんOCR使ったこと無くて、想像で言ってるんだろうね。
現状、認識処理に1時間もかかるわけがないw


807:名無しさん@お腹いっぱい。
08/11/02 16:11:17 SxT+me9H0
OCRだって自然言語処理してるよ
認識候補に対して辞書を使って絞り込みとかやってる

808:名無しさん@お腹いっぱい。
08/11/02 16:15:31 9MBAetAc0
認識処理は昔から早いけど、
結局は結果確認と誤認識や体裁の修正は必ずしないといけない。
その修正作業がどれだけ楽になるかがOCRソフトの一番大事なところ。

809:名無しさん@お腹いっぱい。
08/11/02 17:28:07 cwzkfA700
>>805
kwsk

810:名無しさん@お腹いっぱい。
08/11/02 17:31:04 poJP7dLr0
>>809
いや駄目だろ、それは

811:名無しさん@お腹いっぱい。
08/11/08 08:38:05 ZMhDwSXi0
素人ですみません。
OCRソフトを探しています。
透明テキストの機能を使って、文書の全文検索に使えるようにしたいと考えています。
PDFに変換してから、ちょこちょこといじりたいのですが、acrobatのOCR機能ってどうなんでしょうか?
OCR機能の点からみたacroatのメリット・デメリットは、>>763以外になにかありますか?(認識率が格段に低いなど)
SmartOCRは現在のOCRのシェアウェアやacrobatよりもどんな点で劣る(あるいは優れている)か教えてください。

812:名無しさん@お腹いっぱい。
08/11/09 12:45:08 EZAsVtJx0
PDFのOCR機能は画像OCRの付け焼き


813:名無しさん@お腹いっぱい。
08/11/12 02:08:52 6OQUopCS0
>>805
差分ファイルで

814:名無しさん@お腹いっぱい。
08/11/16 04:24:48 4vajSCcA0
読んde!!ココの次期バージョンは当分ないのだろうか?
ブラザーA3複合機買ったんだけど、OCRソフトは何買ったらいいか迷う。
Acrobat8持ってるから充分なのか、読んde!!ココ 13にアップグレードするか。
それともe.Typistを使ってみるか。
最終出力はテキスト付きPDFにしたいんだけど。
イチオシのワークフローあるかな?

815:名無しさん@お腹いっぱい。
08/11/16 05:27:56 0tZlWar00


816:名無しさん@お腹いっぱい。
08/11/16 06:36:32 0tZlWar00


817:名無しさん@お腹いっぱい。
08/11/16 15:06:04 kMc8Bxa00
読取革命12体験版を使ってみたんだが・・・・。
表編集モードにおいて、誤認識された罫線の削除のコツがよくわからない。
はさみのアイコンでなぞっても、消えない事が圧倒的に多い。
まるで出来ないかというとそうでもなく、あーでもないこーでもないとやっているといきなり消えることもある。
エロイ人、どうかこつを教えてくれ。

818:名無しさん@お腹いっぱい。
08/11/23 14:26:28 vpMal3Xl0
「本格読取 2」と「本格読取 2 Deluxe」って
何が違うんですか?


819:名無しさん@お腹いっぱい。
08/12/01 15:15:27 LWVSjDCk0
これまで何の疑問もなく「読んde!!ココ」 のバージョン10.01を使ってきた。
バージョン上げると読み取り精度は上がるのだろうか?
俺が使うのは英文ばかりだけどfの読み取りが悪くてイライラ。

820:名無しさん@お腹いっぱい。
08/12/02 11:26:40 j5O/upWL0
英文ならomnipageとか使え

821:名無しさん@お腹いっぱい。
08/12/02 14:14:45 u3ql/6+p0
FineReaderの最新版は抜群の精度

822:名無しさん@お腹いっぱい。
08/12/03 01:16:37 tni9wAEC0
>>817
ハサミの左の先端で消したい罫線をなぞると良いよ。

ってもう試用期間終わってるかな?

823:名無しさん@お腹いっぱい。
08/12/03 14:02:21 7DjjIJfp0
>>818
回答こないね


824:jrOORvtvExkE
08/12/04 06:23:20 eYjGu4xE0
Useful info about <a href="URLリンク(mesothelioma-disease.blog.ca)">mesothelioma cancer</a>
URLリンク(mesothelioma-disease.blog.ca)
[URL=URLリンク(mesothelioma-disease.blog.ca) cancer[/URL]

825:BPCEZIWpAquwwspfZk
08/12/04 06:23:22 VbG12Y6T0
Useful info about <a href="URLリンク(mesothelioma-disease.blog.ca)">mesothelioma cancer</a>
URLリンク(mesothelioma-disease.blog.ca)
[URL=URLリンク(mesothelioma-disease.blog.ca) cancer[/URL]


次ページ
最新レス表示
レスジャンプ
類似スレ一覧
スレッドの検索
話題のニュース
おまかせリスト
オプション
しおりを挟む
スレッドに書込
スレッドの一覧
暇つぶし2ch