0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

データ収集におすすめのMCPツール5選|Webスクレイピング・検索・ブラウザ操作を比較

0
Posted at

MCPツールとは、AIエージェントから外部サービスの機能やデータを共通の方法で呼び出すための接続手段です。Webデータ収集向けのMCPツールを選ぶ際は、単に「ページを開けるか」ではなく、構造化データを取得したいのか、本文をMarkdown化したいのか、ブラウザを操作したいのかを先に分ける必要があります。

先に結論を示すと、定型サイトから商品・店舗・求人などの項目を継続的に集めたい場合はOctoparse(オクトパース・オクトパス) MCP、WebページをLLM向けのMarkdownに変換したい場合はFirecrawl、既製のクローラーを開発ワークフローに組み込みたい場合はApifyが有力です。アクセス基盤やプロキシを重視するならBright Data、クリックやフォーム入力を含むブラウザ操作ならPlaywright MCPが向いています。

やりたいこと 最初に検討したいMCPツール
EC商品、店舗、求人などを項目別の表として集める Octoparse MCP
URLやサイトをMarkdownへ変換する Firecrawl MCP
既製のクローラーを探して実行する Apify MCP
Web Unlocker、プロキシ、地域別アクセスを使う Bright Data MCP
ログイン、クリック、フォーム入力を自動化する Playwright MCP

この記事では、データ収集ツールとして使える5つのMCPを、機能、制限、継続実行、出力方法、利用者像の観点から比較します。

MCPとは?データ収集で果たす役割

MCP(Model Context Protocol)とは、AIアプリケーションと外部ツール・データソースを接続するためのオープンなプロトコルです。

従来は、AIにWebデータを渡すために次の作業が必要でした。

  1. スクレイピングツールを開く
  2. データを収集する
  3. CSVやJSONをダウンロードする
  4. AIへファイルをアップロードする
  5. 分析用の指示を出す

データ収集に対応したMCPサーバーを接続すると、AIは利用可能なツールと入力形式を確認し、ユーザーの依頼に合わせて収集処理を呼び出せます。たとえば「東京都内のカフェ情報を集め、評価件数で並べて」のような依頼を、テンプレート検索、収集、結果取得、分析へつなげられます。

ただし、MCP自体がスクレイピングを行うわけではありません。実際にページへアクセスし、データを抽出するのは接続先のWebスクレイピングツールやブラウザ自動化ツールです。MCPはAIとそれらをつなぐ共通の窓口です。

MCPとAPIの違いは?

MCPとAPIの違いは、どちらか一方がもう一方を置き換えるという話ではありません。APIはアプリケーション同士が機能やデータをやり取りするためのインターフェースであり、MCPはAIが外部ツールを発見・選択・実行しやすくするための共通ルールです。

比較項目 MCP 一般的なWeb API
主な呼び出し元 AIエージェント、AI対応IDE、チャット アプリ、スクリプト、バックエンド
機能の見つけ方 ツール名と入力スキーマをAIへ提示 開発者が仕様書を読んで実装
実行判断 AIが会話内容からツールを選択できる プログラムに呼び出し処理を書く
入力 自然言語から構造化引数へ変換 コードから所定のパラメータを送信
向いている用途 対話型調査、AIエージェント、試行錯誤を含む処理 安定した定型処理、大量バッチ、サービス組み込み
注意点 AIの誤選択、権限、Prompt Injection 認証情報、レート制限、実装と保守

裏側では、MCPツールがサービス固有のAPIを利用している場合もあります。したがって、「MCPかAPIか」ではなく、人やAIとの対話から実行したいならMCP、固定された処理をアプリに実装したいならAPIという使い分けが現実的です。

データ収集におすすめのMCPツール5選

ここからは、MCP Webスクレイピングや情報収集に利用できる代表的なツールを紹介します。料金・無料枠・機能は2026年8月14日時点で各社公式情報を確認しています。

ツール 主なデータ範囲 具体的な制限 継続・自動化 出力・利用方法 適した利用者
Octoparse MCP 既成テンプレート/クラウド対応タスクから得る構造化データ ローカル専用タスク不可、MCP上でタスクの新規設計・編集不可 クラウドタスクの実行・監視・開始停止 MCPはJSON/CSV、製品全体ではExcel・DB等にも対応 ノーコードで表データを収集したい担当者
Firecrawl MCP 任意URL、サイトクロール、検索結果、Markdown クラウド版はクレジット制。複雑な処理は消費量確認が必要 バッチ、クロール、Deep Research Markdown、構造化抽出、API連携 RAG・AIアプリ開発者
Apify MCP Store上のActor、RAG Web Browser、Actorの結果 Actorごとに料金・品質が異なる。Rental/フル権限ActorはMCP対象外 Actorの実行、スケジュール、ストレージ Dataset、JSON、CSV、API等(Actor依存) 多様な既製クローラーを使いたい開発者
Bright Data MCP 検索、ページ取得、100以上のドメイン向け構造化データ、ブラウザ 高度な機能は従量課金。用途によって設定が専門的 大量処理、プロキシ、地域別アクセス Markdown、構造化結果、ブラウザ操作 企業向けアクセス基盤が必要なチーム
Playwright MCP ブラウザで表示・操作できるページ 大量の構造化収集や定期配信は自分で設計。実行・トークンコストに注意 エージェントによる操作ループ Accessibility snapshot、画面操作、ファイル UI操作を自動化したい開発者

無料枠も性質が異なります。OctoparseはMCP抽出レコード、Firecrawlはクレジット、Apifyは金額ベースの利用枠、Bright DataはMCPリクエスト数で管理されます。数字だけを横並びにせず、自分の1タスクが何を消費するのかを確認してください。

1. Octoparse MCP:構造化データをノーコードで取得したい場合

Octoparse MCPは、AIから既成スクレイピングテンプレートを検索し、クラウドタスクの実行・監視、結果の取得まで行えるデータ収集ツールです。

公式MCPドキュメントによると、ChatGPT、Claude、Cursor、VS Code、Gemini CLIなどに対応し、OAuth 2.1またはAPIキーで接続できます。無料・Basicユーザーには、MCP経由の抽出に毎週2,000レコードの無料枠があります。

取得対象が商品一覧、店舗一覧、求人一覧のように「1行1件、列ごとに項目が分かれたデータ」である場合に使いやすい設計です。AIにページ本文を渡すだけでなく、商品名、価格、評価、URLなどを構造化した状態で取得し、そのまま比較や集計へ進められます。

一方、公式ドキュメントには次の制限も明記されています。

  • MCPから実行できるのは既成テンプレートまたはクラウド対応タスク
  • ローカル専用タスクはデスクトップアプリで実行する必要がある
  • MCP上ではタスク設定の新規作成・編集ができない
  • 既成テンプレートなしで任意のURLを即座に収集できるわけではない

エクスポートはMCP経由ではJSONまたはCSVに対応します。デスクトップ/クラウド製品全体ではExcel、CSV、HTML、JSON、XML、Google Sheets、各種データベースなどにも出力できます。

向いている人: コードを書かずに、ビジネスで使える表形式のデータを収集し、AIで続けて分析したい人。

2. Firecrawl MCP:WebページをLLM向けに整えたい場合

Firecrawl MCPは、Webページのスクレイピング、クロール、検索、構造化抽出、バッチ処理、Deep ResearchをAIから呼び出せるMCPサーバーです。

公式ドキュメントでは、単一URLの取得だけでなく、サイト内クロールやコンテンツ探索にも対応しています。特に、広告やナビゲーションを除いた本文をMarkdownへ変換し、RAGやAIコーディングエージェントに渡したい用途と相性がよいツールです。

クラウド版とセルフホスト版があり、クラウド利用にはAPIキーが必要です。公式料金ページでは、無料プランに月1,000クレジットが含まれています。ページ数だけでなく、クロールや各機能の消費クレジットを確認して運用する必要があります。

Octoparseが「既定の列を持つ表データ」を得意とするのに対し、Firecrawlは「ページやサイトをLLMが読みやすいコンテンツへ変換する」用途が中心です。

向いている人: 技術文書、企業サイト、記事群をMarkdown化し、RAG・検索・要約へ投入したい開発者。

3. Apify MCP:Actorエコシステムを利用したい場合

Apify MCPは、Apify Storeに公開されているActorをAIエージェントから検索・実行し、ストレージや結果へアクセスするためのMCPサーバーです。Actorは、特定サイトや用途のために作られた再利用可能なクローラー/自動化プログラムです。

Apify公式ドキュメントでは、ホスト型MCPをOAuthで接続する方法と、APIトークンまたはローカルのstdioサーバーを使う方法が案内されています。Actorの検索、詳細・料金の確認、実行、結果取得に加え、RAG Web Browserも利用できます。

無料プランは月額$0で、毎月$5分のプラットフォーム利用枠が付与されます。ただしActorごとに課金方式や消費量が異なり、Rental Actorとフル権限ActorはMCPからの検索・実行対象外です。また、MCPサーバー全体にはユーザー当たり毎秒30リクエストの上限があります。

利用できるActorの幅が大きな魅力ですが、Actorごとの品質、入力形式、出力形式、料金を個別に確認する必要があります。

向いている人: 開発者向けの既製クローラーを探し、APIやAIエージェントから組み合わせて使いたい人。

4. Bright Data MCP:アクセス基盤とWeb Unlockingを重視する場合

Bright Data MCPは、検索、Webページ取得、Markdown抽出、ブラウザ操作、Web Unlocking、地域別アクセスなどを提供するWebデータ基盤です。

公式料金ページでは、新規MCPユーザー向けに月5,000リクエストの無料枠が案内されています。有料の従量課金は検索・取得・抽出が1,000結果当たり$1.5、ブラウザ操作は$8/GBからです。100以上の主要ドメイン向け構造化データ、プロキシネットワーク、Web Unlockerを同じ基盤から利用できます。

単に公開ページの本文を読むだけなら機能が過剰になる場合があります。一方、複数地域からの取得、動的ページ、アクセス安定性、企業向け運用を重視する場合は検討価値があります。

向いている人: プロキシ、地域指定、動的ページ、アクセスの安定性まで含めたWebデータ基盤が必要なチーム。

5. Playwright MCP:Webサイトを操作したい場合

Playwright MCPは、Microsoftが提供するブラウザ自動化用MCPサーバーです。AIは画面のピクセルではなく、ページのAccessibility Treeを構造化スナップショットとして読み、要素をクリックしたり、フォームへ入力したりできます。

公式リポジトリでは、Chrome、Firefox、WebKit、Edge、永続セッション、スクリーンショット、フォーム操作などに対応しています。パッケージ自体はオープンソースで、npx @playwright/mcp@latestから起動できます。ただし、対象サイトやAIモデルの利用料、実行環境のコストは別途発生します。

Playwright MCPはブラウザ操作に強い一方、商品1,000件を安定した列構造で定期収集するための専用データ基盤ではありません。AIがページ状態を確認しながら操作を繰り返すため、実行時間とトークン消費も考慮する必要があります。

向いている人: クリック、検索条件入力、ページ遷移、ログイン後の許可された操作など、対話的なブラウザ作業を自動化したい開発者。

目的別にMCPツールを選ぶには?

構造化データをノーコードで収集したい

EC商品、店舗、求人、レビューなどを、決まった列を持つデータとして取得したい場合はOctoparse MCPが候補です。テンプレートに入力項目と出力項目が定義されているため、AIへ返った結果をそのまま表、CSV、JSONとして扱いやすいからです。

ただし、利用したいサイトにクラウド対応テンプレートまたはタスクがあるかを先に確認します。テンプレートがなければ、デスクトップアプリでタスクを準備するか、別のツールを検討します。

WebページをMarkdownに変換したい

ニュース記事、技術文書、企業サイトなどをLLMに読ませることが目的ならFirecrawlが分かりやすい選択です。列構造より本文の意味を維持したMarkdownが重要な場面に向いています。

大量・定期収集を自動化したい

既製のActorと開発者向けエコシステムを重視するならApify、ノーコードのタスクとクラウド実行を重視するならOctoparseを比較します。対象サイト専用のActor/テンプレートがあるか、期待する出力項目が含まれるか、実行単価を事前に確認することが重要です。

ブラウザを操作したい

検索フォームへの入力、ボタンのクリック、ページ遷移など、データ取得までに操作が必要ならPlaywright MCPが向いています。ただし、許可なくログイン後データを取得したり、アクセス制限を回避したりしてよいわけではありません。

プロキシとアクセス基盤を重視したい

地域別アクセス、Web Unlocking、動的ページ、企業向けの大量処理まで必要ならBright Dataが候補です。単純な数ページの取得ではなく、アクセス基盤そのものが要件になっているかで判断します。

MCPの使い方|OctoparseでWebデータを収集する流れ

ここでは、Octoparse MCPを例に基本的なMCPの使い方を確認します。実際の画面名や設定方法はクライアントによって異なるため、最新手順はOctoparse MCPの公式ガイドも参照してください。

  1. Claude DesktopでSettings(設定)に移動し、左側のサイドバーからConnectors(コネクタ)セクションを見つけます。
    octoparse-mcp.jpg
  2. 「Browse connectors(コネクタを参照)」ボタンをクリックすると、人気のコネクタ一覧が表示され、接続したいものを選択できます。
  3. 次に、接続したいツールが提供する「Remote MCP server URL(リモートMCPサーバーURL)」を貼り付けます。Octoparseの場合、標準的なMCPサーバーURLは https://mcp.octoparse.com となります。
  4. 「Add(追加)」ボタンをクリックします。これでMCPサーバーがコネクタダッシュボードに表示されます。次に「Connect(接続)」をクリックします。
  5. AIに収集したいサイト、条件、必要な項目を伝える
  6. AIが候補テンプレートを検索したら、対象サイトと出力項目を確認する
  7. クラウド実行に対応していることを確認してタスクを開始する
  8. 完了後、結果を表で確認するか、JSON/CSVとして取得する

Octoparseの通常画面でテンプレートを利用する場合は、用途に応じてクラウド収集またはローカル収集を選びます。MCPから直接開始できるのはクラウド実行対応のものです。ローカル専用テンプレートは、Octoparseデスクトップアプリ側で実行してください。

関連記事:MCP とは?3分で設定完了:非エンジニア向けの仕組みと設定ガイド

そのまま使えるデータ収集プロンプト例

AIへ指示するときは、対象、条件、取得項目、件数、出力形式を一文に含めると確認の往復を減らせます。

Amazon.co.jpで「ワイヤレスイヤホン」を検索し、商品名、価格、評価、レビュー件数、URLを20件取得して表にしてください。
東京都新宿区のカフェ情報を収集し、店舗名、住所、評価、口コミ件数、WebサイトURLをCSVで出力してください。
求人サイトから「データアナリスト」の求人を収集し、会社名、勤務地、給与、必要スキルを整理して、頻出スキルを集計してください。

テンプレートが見つからない、入力項目が合わない、ローカル専用である場合は、AIに無理に実行させず別の方法を選びます。MCPツールの応答に含まれるテンプレート名、実行モード、入力スキーマを確認してから開始するのが安全です。

MCP Webスクレイピングの注意点

利用規約・robots.txt・著作権を確認する

Webスクレイピングという技術自体が一律に禁止されているわけではありませんが、対象サイトの利用規約、robots.txt、著作権、個人情報、データベースに関する権利を個別に確認する必要があります。詳しい判断項目はスクレイピングの基礎と注意点も参考になります。

公開ページであっても、収集した文章や画像をそのまま転載してよいとは限りません。必要な項目だけを取得し、利用目的、保存期間、共有範囲を明確にします。

アクセス負荷と継続実行を管理する

AIエージェントは目標を達成するために同じ処理を繰り返す場合があります。件数上限、対象ドメイン、実行間隔、タイムアウトを設定し、短時間に大量のリクエストを送らないようにします。

MCPサーバーへ与える権限を最小化する

APIキーやOAuthには、必要な操作だけを許可します。開発・検証用と本番用の認証情報を分け、ログへ秘密情報を残さないことも重要です。

また、取得先ページに書かれた命令文をAIが正規の指示と誤認するPrompt Injectionにも注意が必要です。Webページの内容は信頼できない入力として扱い、外部送信、ファイル操作、購入、投稿などの副作用を伴う処理は人間が確認する設計にします。

よくある質問

MCPとは簡単にいうと何ですか?

MCPとは、AIと外部ツール・データソースを共通の方法で接続するためのプロトコルです。データ収集では、AIがスクレイピングツールの機能と入力形式を把握し、会話から収集タスクを呼び出すために使われます。

MCPとAPIの違いは何ですか?

APIはプログラム同士が機能やデータをやり取りするための窓口です。MCPはAIが利用可能なツールを発見し、会話内容に応じて選択・実行するための共通仕様です。MCPツールの内部でAPIが使われることもあります。

MCPを使えばどのWebサイトでもスクレイピングできますか?

いいえ。対応範囲は接続するMCPツール、テンプレート、Actor、ブラウザ機能によって異なります。技術的に取得できる場合でも、対象サイトの規約や権利、アクセス負荷を確認する必要があります。

無料で使えるMCPデータ収集ツールはありますか?

あります。ただし無料の単位は異なります。2026年8月14日時点で、Octoparseは無料・BasicユーザーにMCP抽出を毎週2,000レコード、Firecrawlは月1,000クレジット、Apifyは月$5相当、Bright Dataは新規MCPユーザーに月5,000リクエストを案内しています。Playwright MCPのパッケージはオープンソースですが、AIモデルや実行環境の費用は別です。

データ収集に最もおすすめのMCPツールはどれですか?

表形式の構造化データをノーコードで取得するならOctoparse(オクトパース・オクトパス) MCP、ページ本文のMarkdown化ならFirecrawl、既製クローラーの幅ならApify、アクセス基盤ならBright Data、ブラウザ操作ならPlaywright MCPが候補です。「何を、どの形式で、何回集めるか」で選ぶのが適切です。

MCPの使い方にプログラミング知識は必要ですか?

必須ではありません。Octoparse MCPのようにOAuthとサーバーURLで接続し、自然言語から利用できるサービスもあります。一方、セルフホスト、独自Actor、ブラウザ操作の安定化、アプリへの組み込みには開発知識が必要です。

まとめ

データ収集向けのMCPツールは、すべて同じ役割ではありません。本文やドキュメントをAIへ渡すツール、ブラウザを操作するツール、項目が整理されたデータを継続収集するツールでは、選定基準が異なります。

  • 構造化データとノーコード運用:Octoparse MCP
  • Markdown、クロール、RAG:Firecrawl MCP
  • Actorと開発者エコシステム:Apify MCP
  • プロキシ、Web Unlocking、企業向け基盤:Bright Data MCP
  • クリックやフォーム操作:Playwright MCP

なかでも、商品・店舗・求人などのデータを表として取得し、そのままAIで比較・集計したい場合は、Octoparse MCPが試しやすい選択肢です。まずは小さな件数で出力項目を確認し、対象サイトのルールとアクセス負荷に配慮しながら運用してください。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?