「御託はいいから、まずはサンプルを見せて!」という方はこちら👇
ダウンロードサイト(LP)はこちら
「無料プラグインをダウンロード」ボタンから今すぐ試せます。
💡 開発背景
ふと、「本当のAI OCR」を作りたいと思いました。
巷にはAI OCRが溢れていますが、AI OCRと名乗っていても、AI OCRと聞いて想像するものとは程遠いものがほとんどです。皆さんもそんな経験ありませんか?
具体的には、識字率が低かったり、事前の設定(主にテンプレート)が面倒だったり…。書類を読み込ませれば思った通りに出力できると思っていたら、心がくじけます…。
ただ、OCRの仕組みを調べると、これがなかなか難しいことだと気づきます。正直、単純なルールベースの考え方では不可能です。
しかし、救世主となるLLM(大規模言語モデル)の登場によって、本当のAI OCRを作れるのではないかと思いました!✨
🛠️ 本当のAI OCRの実現プロセス
まず、「本当のAI OCR」という抽象的な概念を手順ごとに具体的に考えました。
①画像データの文字を認識して変換する。
②①で取得した文字情報を(座標等の情報から)つなぎ合わせて単語を作る。
③②で作った単語の意味を理解し、値と項目に整理する。
④項目のなかから、ユーザーが必要としているものを抽出する。
⑤ユーザーが求める形式(書式)で④を返す。
この中で①と②はディープラーニングの発達によりかなりの高水準で実現できていました。特にGoogle社のVision APIは手書き文字を含めて高精度です。
ただ、③以降についてはまだ難しく、ここにLLMを組み合わせることで実現したいと思いました。
🎨 UIはkintoneを選定
UI選定基準は以下の通りです。
①ユーザーが直感的に操作できる。
②構造(操作結果)を簡単に取得できる。
③開発工数を抑えて構築できる。
以上の点から kintone を採用しました。
kintoneならユーザー側で「アプリ構築=取得したいデータ」と仮定でき、アプリの構造もAPIで簡単取得可能。プラグインで手軽にカスタマイズもでき、低予算・早期開発が可能です。
kintoneについて:kintone公式サイト
🔍 LLMエンジンはGeminiを採用
LLMエンジン選定にあたり、ChatGPT・Claude・Geminiの3つを比較しました。
| LLM | 文字認識精度 | レスポンスの正確性 | APIでの使い勝手 |
|---|---|---|---|
| ChatGPT | ⭕️ | △(JSONに難あり) | △ |
| Claude | ⭕️ | ❌(JSONに制限あり) | ❓(実用難) |
| 🌟 Gemini | ⭕️ | ⭕️ | ⭕️ |
ChatGPTはレスポンスの安定性が低く、ClaudeはプロンプトでしかJSON制限できなかったため、Geminiを採用しました。
📐 システム構成概要
構成は以下の通りです。
①kintoneでアプリ構築または既存アプリ選定(ユーザーがOCRで取得したい情報を特定)。
②アプリの構造データを取得。
③OCR対象ファイルと構造データをLLM(Gemini)へ送信。
④結果を構造データに合わせて取得。
⑤結果をkintoneアプリに登録。
🚩 結果まとめ
🎉 個人的には大成功です!
下記、当初要件は網羅できたと思います。
事前設定なしの取得や追加項目の自動取得、テーブル内データの取得も想像以上でした。
*詳細なプログラムコードや省略した部分(PDF→画像変換)は別の記事で紹介していきたいと思います。
📥 サンプル公開中!
実際に試したい方は無料プラグインをご利用ください。
- 1ドメインあたり ファイル20枚またはGemini利用100万トークンまで 無料。
- 複数ファイルや複数ページの場合は1ファイル目・1ページ目のみ変換。
ぜひ業務効率化にお役立てください🚀✨