◆本記事の位置づけ
【記載内容】
・構築したRAGにおけるClaude および GPT-5 のLLMモデル別の
回答精度/ハルシネーション耐性を検証
【取り組んだテーマ】
・Copilot Studioから外部ナレッジソースをRAGとして活用し、AIによる回答生成
(Web検索やMicrosoft 365サービス以外のデータ活用)
【この記事は、全6回のうち第5回】
- 1.Copilot Studio と Entra IDで、ユーザー認証情報の取得
- 2.Agent OrchestrationによるQiita投稿
- 3.Copilot×iPaaS の API連携手順
- 4.iPaaS×Box 特定ユーザの参照権限でデータ探索
- 5.Copilot Studio RAGの検証結果/LLMモデルによる出力特性比較
- 6.【Copilot専門資格】Microsoft AB-900受験記録
◆本編 :
はじめに
本記事では、Microsoft Copilot StudioとiPaaS製品「HULFT Square」を連携させ、
RAG(本記事シリーズの第1,3,4回で構築したもの)の性能検証を実施しています。
APIによる階層探索のイメージ
ポイント:
- 使用API: List Folder APIでフォルダ・ファイル一覧を取得し、Get Text APIでファイル内容を文字列として取得する2つのAPIを組み合わせて疑似検索を実現
- 検索プロセス: フォルダ名・ファイル名からファイルIDを特定後、テキスト内容をCopilotに渡し、不十分な場合は再度APIを実行するループ構造
- 実装上の制約: フォルダ名・ファイル名のみで検索するため、ベクトル検索・全文検索は未実装
検証概要
ゴール
- Copilot ~ HULFT Square ~ クラウドストレージ : 一気通貫でRAGから回答を得られること
- Copilotが返す回答について、複数シナリオから回答精度を検証する
実施テーマ
| テーマ分類 | 主な検証項目 | 成果物 |
|---|---|---|
| RAG性能検証 | RAGの回答精度確認 | Claude Sonnet 4.5とGPT-5 Chatの性能比較 |
RAG性能検証 〜テストシナリオ〜
4つのテストケースで、検索精度と回答精度を確認しました。
テストケース一覧
| 項番 | ユーザープロンプト | File形式 | ケース前提 および 狙い |
|---|---|---|---|
| 1 | 遠隔地勤務の適用条件 について教えて |
フォルダ名/ファイル名が明瞭な場合 | |
| 2 | 出張精算について教えて | Word | フォルダ名/ファイル名に解釈の余地がある場合 |
| 3 | 企業Aと当社との 取引状況を整理して |
Text PPT |
複数フォルダに複数ファイルが存在する場合、適切に探索・統合が完了する。 |
| 4 | 企業Bが過去に参加した すべてのセミナーとアンケート結果を教えて |
Excel | 複数フォルダの構造化データ(表)の中から部分抽出で結果を取得・統合できる。 |
性能検証結果
検証方法
各テストケースをモデルごとに5回ずつ実施し、以下2つの指標で評価:
- 検索精度 〜ファイル発見能力〜
- 回答精度 〜ハルシネーション耐性〜
検証結果サマリ
※ 本表における「C4.5」はAnthropic社のClaude Sonnet 4.5、
「G5」はOpenAI社のGPT-5 Chatの略称を指します。
- Claude Sonnet 4.5
| LLMモデル | C4.5 | C4.5 | C4.5 | C4.5 |
|---|---|---|---|---|
| ケース | 1 | 2 | 3 | 4 |
| 検索精度 | 100% | 100% | 100% | 100% |
| 回答精度 | 100% | 100% | 100% | 100% |
- GPT-5 Chat
| LLMモデル | G5 | G5 | G5 | G5 |
|---|---|---|---|---|
| ケース | 1 | 2 | 3 | 4 |
| 検索精度 | 100% | 100% | 100% | 100% |
| 回答精度 | 100% | 100% | 80% | 60% |
詳細な所見
検索精度: 全モデルで 100% 達成
一度に全ファイルを読み取れないケースあり。
(ただし、深堀すれば想定ファイルを検索・回答することを確認)
回答精度の課題 (GPT-5 Chatで確認)
| ケース | 発生内容 |
|---|---|
| ケース3 | 不要な文字列が文章に含まれて回答 |
| ケース4 | ハルシネーション(想定と異なる企業情報) |
Claude Sonnet 4.5: ハルシネーション報告なし(全ケースで100%精度)
⇒上記結果はLLMの優劣ではなく、AI特有のハルシネーションは推論の中で発生し得る。
まとめ
検証で得られた知見
✅ 実現/確認
- Copilot ~ HULFT Square ~ クラウドストレージの一気通貫RAG構築が実現可能
- フォルダ階層探索によるファイル検索は機能する
- Claude Sonnet 4.5は一度の回答で、多くの情報をまとめて返す傾向がある
⚠️ 課題
- フォルダ名・ファイル名による検索のみでは大規模利用で限界がある
次のステップ
実装を視野に入れ、以下の選択肢も検討することで大規模データに対応:
- SharePoint連携で検索精度向上
- 長期目標: ベクトル検索サービス導入で本格RAG化
検証内容は以上となります。
次回は、【番外編】として
MS資格 AI Businessシリーズ~AB-900~ Copilot & Agent Administration Fundamentals
の資格取得について書きたいと思います。 ※合格できていればですが汗
特に
・資格勉強で良かった教材
・勉強する中での気づき
・AB-900 取得は「こんな人におすすめ」
について記載できればと思っています。
本記事をご覧いただき、ありがとうございました。


