
たまたまもらったおまけクーポンが余っていたので、Claude Fableを使ってみた。
せっかくなので、当時ちょうど進行していた企業間トラブルについて、
「こちらが見落としているリスクを徹底的に洗い出してほしい」
と頼んでみた。
これが、地味に面白い事故を起こした。
結論から言うと、
AIが現実の相手を勝手に有能化して、ゲーム難易度をハードへ変更していた。
という話である。
人類滅亡とかAI反乱とか、そんな大層な話ではない。
もっと地味で、たぶん実務ではこっちの方が頻繁に遭遇するタイプのAIリスクだと思う。
返ってきた分析は、むしろかなり優秀だった
具体的な会社名や案件内容は伏せるが、問題には、
- 契約
- 金銭
- 会社運営
- 相手方との交渉
など複数の論点があった。
そこでAIには、
- 相手側が取り得る行動
- こちらの弱点
- 最悪の場合に起こり得ること
- その場合の損失
- 対抗策
などをかなり広く検討させた。
返ってきた回答は立派だった。
制度上可能な手段が列挙され、
「相手が合理的ならこう動く」
というシナリオが組まれ、
こちらへの影響まで整理されている。
一部には発生確率らしき数字まで付いていた。
読んでいると、
なるほど、そこまで考えておかないといけないのか
という気になる。
しかも困ったことに、個々の論点はそれほど間違っていない。
むしろ筋が通っていた。
だから少し身構えた。
数か月後、妙なことに気付いた
ところがその後、現実の相手を観察していると違和感が出てきた。
AIが想定した相手は、
- 自分たちの置かれた状況を正確に理解し
- 利用可能な制度を把握し
- 自分に有利な選択肢を比較し
- 必要なら専門家を使い
- 組織内の意思決定をまとめ
- 手続きを準備し
- 途中で止まらず最後まで実行する
という人物・組織だった。
一方、現実から観測される情報はもっと地味だった。
- 説明が整理されていない
- 前回と話が微妙に変わる
- 期限を過ぎても動かない
- 対応が途中で止まる
- 戦略的というより、その場ごとに処理しているように見える
そこでようやく気付いた。
AIの中の相手、現実よりだいぶ優秀じゃないか?
AIは嘘をついたわけではない
ここが今回のポイント。
これは典型的なハルシネーションとは少し違う。
AIが、
- 存在しない法律を作った
- 架空の制度を捏造した
- 事実関係を完全に取り違えた
という話ではない。
AIの提示した手段は、
「理論上は可能」
だった。
しかし、
可能であること
と、
その相手が実際にやること
の間には巨大な距離がある。
たとえば制度上ある手段が利用できるとしても、実行までには、
選択肢の存在に気付く
↓
自分に有利だと判断する
↓
必要な情報を調べる
↓
専門家に相談する
↓
関係者をまとめる
↓
必要な手続きを行う
↓
途中で面倒にならず継続する
↓
最後まで実行する
という工程がある。
AIは最初の、
制度上できる
から、
相手が実際にやる
までをかなり滑らかにつないでしまった。
AIは相手の「能力値」を勝手に補完する
生成AIは、
相手側ならどう動くか?
と聞かれると、かなり合理的なプレイヤーを作る。
チェスならそれでいい。
相手も最善手を探しているからだ。
しかし実世界の人間や組織は、
- 最善手を知らない
- 知っていても面倒だからやらない
- 社内調整できない
- 責任を負いたくない
- 別件で忙しい
- 感情で方針が変わる
- 単純に忘れる
といったことが普通にある。
つまりAIが生成したのは、
現実の相手
ではなく、
与えられた条件下で合理的に行動する仮想プレイヤー
だった。
ここを混同すると、こちらが頼んでもいないのにゲーム難易度が上がる。
高性能なAIほど、この事故は見つけにくい
これが一番面白かった。
性能の低いAIなら、回答が雑なのでこちらも疑う。
しかし高性能なAIは、
- 前提
- 制度
- 因果関係
- リスク
- 対抗策
をきれいにつなげてくる。
つまり、
前提が少しズレたまま、高品質な分析だけが完成する
ことがある。
これは雑な間違いより厄介だ。
論理が破綻していないから、読み手側が、
これだけ整った分析なら現実にも当てはまるだろう
と思ってしまう。
でも、
論理的整合性 ≠ 現実への適合性
である。
「難しい情報」ほど価値が高いわけではない
AIを使っていると、もう一つ錯覚しやすいことがある。
法律。
契約。
組織論。
財務。
複雑なシナリオ分析。
こういうものは難しい。
一方、
- 返事が来ていない
- 期限を守らない
- 説明が毎回変わる
- 前回から何も進んでいない
という情報は簡単だ。
ところが、
知的に難しい情報ほど、意思決定価値が高いとは限らない。
次に相手が何をするかを考えるなら、
高度な制度論を10個調べるより、
その相手が過去3か月で実際に何をしたか
を見る方が有効な場合がある。
自分の中では今回、
知的難易度 ≠ 意思決定価値
というのがかなり重要な発見だった。
数字が付くと、さらに危ない
AIのリスク分析では、
発生確率30%
のような数字が出ることがある。
数字になると急に分析っぽく見える。
しかし、
- 類似ケースを何件観測したのか
- 母集団は何なのか
- 基準率はあるのか
- モデルは校正されているのか
が存在しない30%なら、
それは実測値とは意味が違う。
場合によっては、
文章だった推測を数字に書き換えただけ
である。
文章なら、
可能性はあるが、どの程度起きるかは不明
と読める。
しかし30%と書かれると、なぜか測定結果に見える。
つまり、
数値化によって不確実性が減るのではなく、不確実性が見えなくなる
場合がある。
では、AIに最悪ケースを考えさせない方がいいのか
そういう話でもない。
今回も、
そんな手段が存在するのか
と知ることには価値があった。
AIは、
- 見落とした可能性を探す
- 反対側の立場から考える
- 反論を作る
- 最悪ケースを洗い出す
という仕事には非常に強い。
問題は、
可能性の発見と、可能性の優先順位付けを同時にやらせること
だと思う。
今はこう分けて聞くようにしている
重要な判断では、AIへの質問を少し分解するようにした。
1. 理論上可能な行動を列挙する
ここでは広く出してもらう。
この条件下で相手が取り得る行動を、
実現可能性を問わず列挙してください。
2. 各行動に必要な前提を出す
各行動を実行するために必要な
知識、権限、資金、専門家、社内調整、時間、
継続的な実行能力を分解してください。
これを入れるだけで、
「制度上できる」
と、
「この相手ができる」
を少し分離できる。
3. 観測事実を別枠にする
以下を、
・確認済み事実
・推論
・仮説
に分離してください。
4. 確率を無理に出させない
根拠がないなら、
高 / 中 / 低
要監視
現時点では優先度低
くらいの順序尺度で十分な場合もある。
5. 「最善手」と「この相手がやりそうな手」を分ける
これは特に重要だった。
A. 合理的な相手が取る最善戦略
B. 現在の観測事実から、この相手が実際に取りそうな行動
を分けて評価してください。
これだけでもかなり変わる。
AIは「答えを出す機械」より「異様に有能な部下」と考える
最近はAIを、
異様に有能だが、現場を直接見ていない部下
くらいに考えるとしっくりくる。
大量の資料を読む。
論点整理する。
コードを書く。
反論を考える。
こちらが気付かなかった穴を探す。
ここまではかなり強い。
一方、
- 相手の癖
- 組織文化
- 誰が本当に意思決定しているか
- 面倒な処理を最後までやり切れるか
- 表向きの制度と実運用の差
などは、現場側で観測する必要がある。
AIが高性能になるほど任せられる仕事は増える。
同時に、
どこまでAIへ任せて、どこから人間が判断するか
という境界設計も重要になる。
建設DXでも同じことが起きる
自分は建設DX周辺の仕事も扱っているが、ここでも似た問題がある。
理論だけなら、
API連携すればいい
マスタを統一すればいい
現場で一度入力すれば二重入力はなくなる
SaaSに業務を合わせればいい
という答えが作れる。
でも現実には、
- 発注者指定Excelを変えられない
- 元請ごとに様式が違う
- 過年度成果が大量に残っている
- 担当者しか知らないExcelがある
- 現場ごとに運用が違う
という事情がある。
ここでも、
現実の組織を勝手に有能化するとDX導入の難易度を間違える。
理論的な最適解と、その会社が実際に実装・運用できる解は別物である。
まとめ
タイトルでは「AIにダマされた」と書いたが、AIが意図的に嘘をついたわけではない。
正確には、
AIが構築した、論理的には非常に整合的な仮想世界を、現実の世界だと思ってしまった。
AIの中では相手が、
- 選択肢を知っている
- 合理的に比較できる
- 必要な手続きを調べられる
- 人を動かせる
- 最後まで実行できる
という能力を持っていた。
現実では、必ずしもそうではない。
だから今は、
可能性の列挙
↓
必要条件の分解
↓
現実の観測事実との照合
↓
優先順位付け
を分けて考えている。
高性能なAIほど、雑な間違いは減っていく。
その代わり、
少し違う前提から、ものすごく上手に正論を作る
という間違い方は見つけにくくなる。
人類を滅亡させるほどではない。
でもたまに、
頼んでもいないのに敵のステータスを盛って、
こちらのゲームをハードモードにしてくる。
実務でAIを使うなら、こういう地味な事故も結構大事なんじゃないかと思っている。