はじめに
OpenDataloaderを利用した時のメモを公開します。
この記事の内容は、次の通り。
- javaのインストール
- uvでのopendataloaderのインストール
- よく使うコマンドの紹介
リンク:
- OpenDataLoader
- opendataloader-pdf on GitHub.com
javaの準備
ハイブリッドモードでJavaを必要するとするため、インストールします。
java -version
which java
これらのコマンドを実行し、インストール状況を確認する。
JavaをMacにインストールする場合
brew install openjdk
Javaを手動でWindowsにインストールする場合
- jdk.java.net にアクセスし、windows用のzipファイルを入手する。
-
openjdk-<version>_windows-x64_bin.zipを、C:\openjdk-<version>などに展開する。 - 環境変数を設定する。
- 変数名:
JAVA_HOME - 変数名:
C:\openjdk-<version>
- 変数名:
-
Pathにbinを追加- 変数名:
Path - 追加する値:
%JAVA_HOME%\bin
- 変数名:
- コマンドプロンプトを新規起動し、OpenJDKが認識されていることを確認する。
java -versionjavac -version
インストール
動作にはJava 11以上のインストールが必要
# 標準版
uv add opendataloader-pdf
pip install -U opendataloader-pdf
# ハイブリッドモード対応版
uv add "opendataloader-pdf[hybrid]"
pip install -U "opendataloader-pdf[hybrid]"
スクリプトの例
import opendataloader_pdf
opendataloader_pdf.convert(
input_path=["report.pdf", "manual.pdf", "documents/"],
output_dir="output/",
format="markdown,json"
)
使い方の例
# ハイブリッドサーバーの起動
opendataloader-pdf-hybrid --port 5002
# クライアント側でPDFを変換
opendataloader-pdf --hybrid docling-fast file1.pdf file2.pdf documents/
# OCR(スキャンPDF)の場合
opendataloader-pdf-hybrid --port 5002 --force-ocr --ocr-lang "ja,en"
# 例1
opendataloader-pdf-hybrid --format markdown,tagged-pdf --markdown-with-html --table-method cluster --image-output external --image-format png --hybrid docling-fast --hybrid-url http://localhost:5002
# 例2
uv run opendataloader-pdf --format markdown --markdown-with-html --image-output external --image-format png --hybrid docling-fast --hybrid-mode full --hybrid-url http://localhost:5002 --markdown-page-separator %page-number%
# 例3
uv run opendataloader-pdf --format markdown --markdown-with-html --hybrid docling-fast --hybrid-url http://localhost:5002 --markdown-page-separator %page-number%
# 例4
uv run opendataloader-pdf --format markdown --markdown-with-html
数式抽出の場合
# サーバー側(数式抽出モードで起動)
opendataloader-pdf-hybrid --port 5002 --enrich-formula
# クライアント側(フルモード指定)
opendataloader-pdf --hybrid-mode full file.pdf