0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

食べログスクレイピングをAI×MCPで自動化するには?Octoparse MCP・Python・データ抽出を比較

0
Posted at

食べログスクレイピングをAI×MCPで自動化するとは、AIにWebデータ収集ツールを接続し、取得から構造化、比較、要約までを会話形式で進める考え方です。ただし、技術的に取得できることと、規約上利用してよいことは別問題です。食べログは営利目的の利用・アクセスや、口コミの無断利用に厳しい制限を設けています。実行前に必ず最新の利用規約と権利関係を確認し、必要に応じて許諾を得るか、利用可能な別のデータソースを選んでください。

結論を先にまとめると、単発の学習や細かな処理を自分で制御したいならPython、継続収集をノーコードで管理したいならOctoparse、さらに取得結果をAIで分類・比較し、定期レポートまでつなげたいならOctoparse MCPが候補になります。MCPは規約を回避する仕組みではなく、許可されたデータ取得処理とAIを安全に接続するための標準的なインターフェースです。

目的 最初に検討する方法 理由
プログラムの学習・小規模な検証 Python 処理内容をコード単位で確認できる
定期的な店舗データ収集 Octoparse ページ送り、待機、クラウド実行などを画面で管理できる
取得後の分類・要約・比較まで自動化 Octoparse MCP + AI AIチャットからタスク実行と構造化データの利用をつなげられる
食べログの口コミを営業・収益目的で利用 実行前に許諾確認 食べログ利用規約上の制限が大きい

食べログスクレイピングは実行してもよいのでしょうか?

食べログからのデータ抽出を検討するとき、コードやツールを選ぶ前に確認すべきなのは利用目的です。2026年9月8日に確認した食べログ利用規約では、食べログの全部または一部について、営業活動その他の営利目的やその準備行為を目的とした利用・アクセスを制限しています。また、投稿された口コミの無断転載・無断利用も禁止しています。

特に口コミについては、本人または第三者が利益を得る目的、営業活動その他の営利目的で利用した場合に関する金銭請求の規定もあります。したがって、「公開ページだから自由に集められる」「アクセス間隔を空ければ問題ない」とは判断できません。

実行前に少なくとも次の順番で確認します。

  1. 対象サイトの最新の利用規約を読む
  2. 取得目的が個人学習か、社内分析か、営業・再配布かを明確にする
  3. 店舗情報、評価値、口コミ本文、投稿者情報を分けて権利を確認する
  4. robots.txt、アクセス負荷、ログインの有無も確認する
  5. 判断できない場合は運営者または専門家に確認する
  6. 許可を得られない場合は、公式API、オープンデータ、自社データ、利用可能な別ソースへ切り替える

robots.txtはクローラーに対する技術的な意思表示の一つですが、利用規約への同意や著作物の利用許諾を与えるものではありません。反対に、robots.txtで許可されているように見えても、利用規約や法律上の検討は別途必要です。

食べログのデータを抽出する一般的な方法は?

食べログスクレイピングを調べると、手作業、Python、ブラウザ自動化、ノーコードツールという方法が見つかります。ここでは食べログへの実行コードではなく、各方式がどのような仕組みかを比較します。

検索では「食べログ スクレイピング python」「食べログ データ抽出」のような語句も使われますが、読者が確認すべきポイントは同じです。必要なのはコードだけではなく、利用許可、保守、検証、分析まで含む設計です。なお、「食べ ログ スクレイピング 口コミ」のように空白を含む検索でも、口コミ本文の利用条件を最初に確認する必要があります。

手作業で表に転記する

数店舗だけを調べる場合は、必要な項目を目視で確認し、ExcelやGoogleスプレッドシートへ転記する方法が最も単純です。開始は早い一方、件数が増えると入力ミス、表記揺れ、更新漏れが発生します。同じ地域を毎週確認するような用途には向きません。

PythonとBeautifulSoupを使う

静的HTMLを取得できる許可済みページでは、requestsでHTMLを取得し、BeautifulSoupで要素を選び、pandasでCSVへ保存する構成が一般的です。

# 許可を得たWebページや自社管理ページを対象にした概念例
import requests
from bs4 import BeautifulSoup

response = requests.get(AUTHORIZED_URL, timeout=20)
response.raise_for_status()

soup = BeautifulSoup(response.text, "html.parser")
records = [
    {"name": node.get_text(strip=True)}
    for node in soup.select(".permitted-item")
]

コードを自由に設計できる反面、HTML構造が変わればCSSセレクタを修正する必要があります。リトライ、ログ、文字コード、ページ送り、重複排除、保存先、スケジュール実行も自分で実装しなければなりません。

SeleniumやPlaywrightを使う

JavaScriptで後から表示されるページでは、SeleniumやPlaywrightでブラウザを操作する方法があります。クリック、スクロール、待機を再現できますが、ブラウザとドライバーのバージョン管理、タイムアウト、画面差分、例外処理が増えます。動いたコードを作ることより、半年後も安定して動かすことのほうが難しいケースも少なくありません。

ノーコードツールを使って食べログデータを簡単かつ安定にスクレイピングする

Octoparse(オクトパース・オクトパス)は、内蔵ブラウザ上で取得項目やページ送りを設定できるノーコードのWebスクレイピングツールです。コードを書かずにワークフローを確認でき、CSV、Excel、JSONなどへ出力できます。

ただし、ノーコードは「規約確認が不要」「どのサイトでも設定なしで動く」という意味ではありません。複雑な動的表示、ログイン、CAPTCHA、サイト変更では調整が必要です。対象サイトの許可を確認する責任も利用者にあります。

Python・Octoparse・Octoparse MCPは何が違う?

食べログスクレイピングの方法を比較するときの違いは、データを一度取得できるかどうかではなく、保守、再実行、AI連携まで誰が管理するかにあります。

比較項目 Python / Selenium Octoparse Octoparse MCP
処理の作成 コードで自由に実装 画面操作とテンプレート 既成テンプレートまたは既存クラウドタスクをAIから呼び出す
データ範囲 実装と許可範囲による 設定した公開・許可済み項目 呼び出したテンプレート/タスクの出力項目
保守 セレクタ、依存関係、実行環境を自分で管理 ワークフローを画面で確認 テンプレート検索・実行・結果取得を会話から管理
継続実行 cronやクラウド環境を構築 対応プランでクラウド・スケジュール実行 クラウド対応タスクをAIから開始・監視
データ出力 自由だが実装が必要 CSV、Excel、JSONなど JSON、CSV、AIチャット内の表
AI分析 APIや処理を別途実装 出力後に別ツールへ渡す 取得後の分類、比較、要約を同じ会話で続行しやすい
主な制限 開発・保守工数が大きい 高度な画面では設定学習が必要 新規タスクの作成・編集、ローカル専用タスクの実行は不可
向いている人 細部をコードで制御したい開発者 ノーコードで継続収集したい担当者 WebデータをAI業務フローへ組み込みたいチーム

Pythonは自由度が最も高く、独自ロジックや研究用途に向きます。Octoparseは、繰り返し処理を画面で管理し、担当者間で引き継ぎたい場合に有効です。Octoparse MCPは、すでに用意された収集処理をAIから再利用し、その後の分析まで短い指示でつなぎたい場合に価値が出ます。

Octoparse MCPで食べログをスクレイピングする

Octoparse MCPとは、ChatGPT、Claude、Cursor、VS Code、Gemini CLIなどのMCP対応クライアントから、OctoparseのWebデータ収集機能を利用するための接続機能です。Octoparse MCP Serverの公式ドキュメントによると、AIから次の操作を行えます。

食べログでは、店舗名、ジャンル、住所、評価、口コミ件数、営業時間、予算、最寄り駅など、店舗調査や競合分析に使える情報を確認できます。ただし、複数店舗の情報を手作業で集めると時間がかかり、公式APIだけでは取得できる項目や利用条件に制約がある場合があります。

Octoparseなら、食べログのページから必要な情報をノーコードでまとめて取得でき、さらにMCPを使えば、ChatGPTやClaudeなどのAIから「渋谷の焼肉店を50件集めて、評価・価格帯・口コミ数を比較して」と自然言語で指示し、データ収集から整理まで一連の流れを効率化できます。

また、一般的なスクレイピングコードでは、ページ構造の解析、JavaScript対応、データ整形、実行環境の準備などが必要ですが、Octoparseでは既存テンプレートやクラウドタスクを活用できるため、プログラミング知識がなくても始めやすい点が大きなメリットです。収集したデータはCSVやJSONで出力できるだけでなく、MCP経由でそのままAIに渡して、エリア別の人気店比較、競合店舗の特徴分析、価格帯や口コミ傾向の要約まで続けて行えます。単に食べログの情報を取得するだけでなく、「取得→整理→比較→分析」までを1つのワークフローにまとめたい場合に、Octoparse MCPは特におすすめです。

ここでは、Claude Desktopを例に接続の基本手順を説明します。

  1. Octoparseアカウントを作成する
  2. Claude Desktopで**Settings(設定)を開き、左側のサイドバーにあるConnectors(コネクタ)**セクションを選択します。
    claude-desktop-mcp-setting.jpg
  3. 「Browse connectors(コネクタを参照)」ボタンをクリックすると、人気のコネクタ一覧が表示されます。そこから接続したいコネクタを選択できます。
  4. もし上記の「Browse connectors」セクションに目的のソフトウェアが見つからない場合は、「Add custom connector(カスタムコネクタを追加)」をクリックします。
  5. 次に、接続したいツールが提供する「Remote MCP server URL(リモートMCPサーバーURL)」を入力します。Octoparseを接続する場合は、標準のMCPサーバーURLとして https://mcp.octoparse.com を使用します。
  6. 「Add(追加)」ボタンをクリックすると、MCPサーバーがコネクタダッシュボードに追加されます。その後、「Connect(接続)」をクリックして接続を開始します。
    octoparse-mcp.jpg
  7. その後、OAuth認証の案内に従ってOctoparseアカウントにサインインし、必要なアクセス権限を承認します。
    設定方法はクライアントによって異なるため、公開時点の画面はOctoparse MCPの設定ガイドで確認してください。その後、自然言語でデータの収集を始めます。

関連記事:
食べログのスクレイピングは違法?禁止事項を確認して飲食店リストを自動作成する方法

Octoparseの600以上のテンプレートはMCPでも使える?

Octoparseのテンプレートライブラリ全体には、地図、口コミ、店舗情報、EC、求人、不動産、SNSなどを対象とする600以上のプリセットテンプレートがあります。一方、Octoparse MCPの日本語製品ページは、MCPで利用できる既成テンプレートを「200以上」と案内しています。

つまり、「Octoparse全体に600以上ある」ことと、「現在MCPから直接実行できるテンプレートが200以上ある」ことは別の数字です。MCPから開始できるのはクラウド実行対応のテンプレートです。テンプレートを選ぶときは件数だけでなく、次の項目を確認してください。

  • 対象サイトと取得項目
  • Cloud、Local only、Cloud and localのどれか
  • 入力方法がキーワードかURLか
  • 1回に入力できる件数
  • 結果単価または利用プラン
  • 最終更新日
  • 対象サイトの利用規約

AI×MCPでデータ収集から分析までつなぐには?

MCPの効果が大きいのは、「取得したCSVを人がダウンロードして別のAIへアップロードする」という分断を減らせる点です。実務では次の五段階に分けると、責任範囲と失敗箇所が分かりやすくなります。

  1. 許可を確認する:対象サイト、項目、目的、保存期間を確認する
  2. 収集する:クラウド対応テンプレートまたは許可済みの既存タスクを実行する
  3. 検証する:件数、欠損、重複、取得日時を確認する
  4. 分析する:AIが分類、集計、比較、要約を行う
  5. 共有する:CSV、JSON、社内レポートとして必要な人へ届ける

そのまま使えるMCPプロンプト例

対象サイト名だけを伝えるのではなく、目的、地域、必要項目、件数、出力形式を一緒に伝えると、AIがテンプレートを選びやすくなります。

東京都渋谷区のラーメン店について、利用可能なクラウド対応テンプレートを探してください。店名、評価、口コミ数、住所、電話番号、営業時間が取得できる候補だけを比較し、実行前に利用条件と出力項目を提示してください。

取得済みの店舗データを、エリア、評価帯、口コミ数の3軸で集計してください。欠損値と重複店舗は別表にし、元データにない内容は推測しないでください。

前回と今回の店舗一覧を比較し、新規掲載、閉店候補、評価変化を整理してください。判断根拠となる列と取得日時を残し、確認が必要な行にはフラグを付けてください。

重要なのは、「人気店を教えて」のような曖昧な依頼だけで終わらせないことです。評価の高低、口コミ件数、対象期間、欠損処理など、判断基準を先に指定すると再現性が上がります。

なぜPythonだけでは継続運用が難しくなる?

Pythonで食べログスクレイピングを調べる読者の多くは、コードそのものより、店舗一覧を繰り返し更新したいと考えています。単発スクリプトと継続的なデータ基盤では、必要な設計が異なります。

HTML変更のたびに保守が発生する

CSSクラスやページ構成が変わると、昨日まで動いていたセレクタが空配列を返します。エラーになれば気づけますが、空欄のまま正常終了するケースはより危険です。取得件数と必須列の検証を自動化しなければなりません。

実行環境も管理対象になる

Python、ライブラリ、Chrome、WebDriver、OSの組み合わせによって動作が変わります。担当者のPCでだけ動くスクリプトは、休暇、異動、端末交換で止まりやすくなります。

取得後の仕事が残る

データ抽出はゴールではありません。重複排除、住所の正規化、カテゴリ分類、前回値との比較、レポート作成が必要です。MCPを使う価値は、この後工程をAIと同じ会話の中でつなげやすくする点にあります。

ただし、独自アルゴリズム、厳密なテスト、社内基盤への深い統合が必要ならPythonが適しています。Octoparse MCPが常にPythonの上位互換というわけではありません。

食べログを直接利用できない場合の代替案は?

利用規約や目的が合わない場合、技術的な回避策を探すのではなく、データソースを見直すべきです。

  • 食べログまたは権利者から必要な利用許諾を得る
  • 自社店舗、自社顧客、自社アンケートなど保有データを分析する
  • 提供条件が明確な公式APIやオープンデータを利用する
  • Google Maps、iタウンページなど別サービスを検討し、それぞれの最新規約を確認する
  • 複数ソースを使う場合は、出典、取得日時、利用条件を列として残す

データ量が多いことより、継続して利用でき、意思決定の根拠を説明できることのほうが重要です。AIに分析させる場合も、出典と取得日時を残さなければ、結果の正しさを後から検証できません。

AIとMCPを使う前のチェックリスト

  • 最新の利用規約を確認した
  • 取得目的と利用者を明記した
  • 口コミ本文と店舗の基本情報を区別した
  • 必要な許諾を取得した、または許可された別ソースを選んだ
  • テンプレートのCloud/Local対応を確認した
  • 取得項目、件数、料金、最終更新日を確認した
  • 欠損、重複、取得日時を検証するルールを決めた
  • AIが推測した値と取得した事実を区別できるようにした
  • 保存期間と共有範囲を決めた
  • 最初は小件数で結果を検証した

よくある質問

質問1:食べログのスクレイピングは違法ですか?

食べログスクレイピングという技術行為だけを見て一律に違法とは判断できませんが、食べログでは営利目的の利用・アクセスや口コミの無断利用などが利用規約で制限されています。目的、取得項目、保存・公開方法によって判断が変わるため、最新規約を確認し、必要なら許諾や専門家の確認を得てください。

質問2:食べログの口コミをAIに要約させても問題ありませんか?

AIで要約する前の取得、保存、外部サービスへの送信、要約結果の商用利用がそれぞれ問題になります。「要約だから自由」ではありません。口コミの無断利用を制限する規約と、利用するAIサービスのデータ取扱条件を確認してください。

質問3:食べログスクレイピングはPythonなら無料ですか?

Pythonと主要ライブラリは無償で利用できますが、開発、保守、実行環境、プロキシ、監視、障害対応には費用や時間がかかります。また、無料で実装できることは対象サイトの利用許可を意味しません。

質問4:Octoparse MCPは食べログを直接取得できますか?

本記事の調査時点では、ログイン済みMCP環境で食べログ専用テンプレートの現行Cloud対応を確認できていません。Octoparse全体の過去記事には関連テンプレートの記載がありますが、実行前にMCPのテンプレート検索で提供状況と実行モードを確認してください。利用可能なテンプレートがあっても、食べログの規約や必要な許諾は別途確認が必要です。

質問5:MCPとAPIは何が違いますか?

APIはプログラム同士が定められた形式で通信する仕組みです。MCPはAIクライアントが外部ツールの機能やデータを発見し、呼び出すための共通プロトコルです。Octoparse MCPでは、AIがテンプレート検索、クラウドタスク実行、結果取得を会話の流れから利用できます。

質問6:プログラミング経験がなくても利用できますか?

既成テンプレートが目的に合えば、キーワードやURLを入力して実行できます。ただし、利用規約の確認、取得項目の選定、結果の品質確認は必要です。複雑な独自ページではデスクトップ版でのタスク作成や調整が必要になる場合があります。

まとめ

この記事では、食べログスクレイピングをAI×MCPで自動化する方法と注意点について詳しく紹介しました。食べログスクレイピングを検討するときは、Python、ノーコード、MCPのどれを選ぶかより先に、対象データをその目的で利用できるか確認してください。食べログの口コミや営利目的のアクセスには明確な制限があり、AIやOctoparseを使ってもその条件は変わりません。

許可されたデータソースで継続収集を行う場合、Pythonは自由度、Octoparseはノーコードでの運用、Octoparse MCPはAI分析までつなぐ点に強みがあります。特に、テンプレート検索、クラウド実行、構造化結果の取得、比較レポートを一つの会話で進めたいチームには、Octoparse MCPを試す価値があります。

まずは無料アカウントでMCPを接続し、許可されたデータソースを対象に小件数で試してください。最初の確認では、取得件数よりも「必要な列が正しいか」「出典と取得日時を説明できるか」を基準にすると、本番運用への移行判断がしやすくなります。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?