@wankyu

Are you sure you want to delete the question?

Leaving a resolved question undeleted may help others!

pythonによるPDFファイルの読み込みについて

Q&A

Closed

解決したいこと

仕事で、弥生の見積納品請求書 というソフトを使っています。
このソフトにはデータのCSV出力機能がないので、PDF出力したものから、pythonで読み取りCSVを作成しています。
既存のPDF出力ドライバーでは読み取り出来なかったので、CubePDFを使っています。
弥生のソフトを最新版にアップグレードしたところ、CubePDFが今まで通りのPDFを作成しなくなり、データが取れなくなり困っています。
弥生のリリースノートには、
製品の基盤となるしくみを「.NET Framework 3.5」から「.NET Framework 4.8」に変更しました。この変更によって、旧製品と比べて画面表示や印刷結果が異なる場合があります
とありました。

pytnonで読み取りのできるpdfを出力する方法をご存知の方がいらっしゃったら、教えていただきたいです。

自分で試したこと

既存のPDFドライバーで出力したもを、OCR処理して読み込むpythonプログラムも作成してみましたが、OCRの結果にムラがあり、満足のいく結果は得られませんでした。

0 likes

5Answer

全く未検証&こちらも駄目な可能性は高いですが、Microsoft Print to PDFで出力したPDFを試してみるのはどうでしょうか?

0Like

Comments

  1. @wankyu

    Questioner

    回答ありがとうございます。
    試してみましたが、読み込みできませんでした🙇‍♀️

Comments

  1. @wankyu

    Questioner

    PDFMinerを使用しています。

このソフトにはデータのCSV出力機能がない

CSVにエクスポートできるとありますが、なぜこれを使用しないのでしょうか?

0Like

Comments

  1. @wankyu

    Questioner

    回答ありがとうございます。
    csvエクスポートできる項目がごく一部であり、こちらの要望を満たすものではありませんでした。

  2. そういう事情でしたか。
    ただこちらとしては現物(相当するPDFファイル)を持ち合わせていませんので憶測での回答になります。

    アップグレードした際にPDFの内部バージョンが変わっていると仮定するなら、それに対応するPythonモジュールも変えないと読み取れない可能性はあります。

    pypdfを使ってみてはどうでしょう。

    こちらにテキストを抽出するヒントがあります。
    https://pypdf.readthedocs.io/en/latest/user/extract-text.html

    ただpypdfに限らず、どのようなPythonモジュールを使ってもテキストを整形する必要性は必ず出てくることになるでしょう。

  3. @wankyu

    Questioner

    ありがとうございます。
    pypdfを試しましたが、読み取りできませんでした。
    検索可能なPDFじゃないと、読み取りできないのではと考えています。
    弥生に問い合わせた返答としては、基盤の.NetFrameworkの変更の影響とのことでした。
    現在、Cube PDFに問い合わせ中です。

Cube PDFから回答いただけました。
弥生のアプリから印刷の際、文字情報が消えてしまってるのではないか、とのことでした。
PDF経由でのデータ吸い上げは、諦めようと思います。
ありがとうございました。

0Like

This answer has been deleted for violation of our Terms of Service.

Your answer might help someone💌