0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

金融データサイエンス基礎Part 8. なぜそう判定したのかに答えられなければなりません:解釈可能性と公平性、規制

0
Posted at

原文: han-co.com ·「金融データサイエンス」連載の「基礎」編、Part 8 です。(原文には手描きの図も載せています。)

Part 7まで、良いモデルを作り(Part 4)、正直に評価し(Part 5)、因果で政策を立て(Part 6)、そのモデルを検証して長く守り抜く(Part 7)話をしてきました。いよいよ信頼の最後の軸が残りました。なぜそう判定したのかを説明できなければならず、その判定が公平かにも答えられなければならない、ということです。

Part 0で、この分野が一般的なMLと違う理由として「解釈可能性は選択ではなく義務」であることと、「規制とガバナンスが常に下に敷かれている」ことを挙げましたが(6番と7番)、この回はその二つを正面から扱う場です。ほかの分野では「なぜ?」に答えられるのは嬉しいボーナスですが、信用ではそれがないと違法だったり、リリース自体が止まったりします。

説明はボーナスではなく義務です

まず、なぜ解釈可能性が義務なのかから。信用ではモデルが一人の融資を断り、限度額を削り、金利を上げます。こうした決定を下すモデルは、なぜそう判断したのかを説明できなければなりません。ただ、誰に説明しなければならないかは国によって違います。

一方の端には米国があります。否決された申込者に主な否決理由を通知しなければならない要件があり、説明義務が消費者に向きます。反対の端に日本があります。カード会社の審査基準は非公開で、否決された申込者に理由を知らせる義務はありません。申込者にできるのは、CICのような信用情報機関に自分の信用情報の開示を請求して確かめるくらいです。

とはいえ、消費者に理由を通知しないからといって説明が要らないわけではありません。向きが違うだけです。日本でもモデルは監督当局に説明できなければならず、割賦販売法の支払可能見込額のようにモデルがそのまま法的根拠になる場面では、その判断を弁明できなければならず、内部の検証と監査(Part 7)も「このスコアの根拠は何か」を問います。だから信用においてブラックボックスは、かっこいい最新技術ではなく、それ自体がリスクです。性能がどれほど良くても、なぜそうなったのかを言えなければ使えないのですから。

透明なモデルと事後説明

説明可能にする道は、大きく二つです。

一つは、はじめから透明なモデルを使うことです。スコアカードやロジスティック回帰、浅い決定ルールのようなものは、構造そのものが説明になります。Part 4と5で見たWOEとスコアカードが代表的で、どの特性がスコアを何点上げ下げするかが表のまま見えます。こうしたモデルをよくホワイトボックス(説明可能なAI)と呼びます。

もう一つは、性能のために複雑なモデルを使いつつ、事後説明を添えることです。代表がSHAPです。ゲーム理論に基づいて、この予測に各特性がどれだけ寄与したかを一貫した形で分解して見せてくれます。同じようにLIMEや部分依存、順列重要度といった道具もあります。

ここで二種類の説明を区別しておくとよいです。大域的な解釈はモデル全体が何を重視するかを見るもので、局所的な解釈はまさにこの人がなぜこのスコアになったのかを見るものです。信用では局所的な解釈がとくに重要です。否決理由を通知するには、結局は個人一人ひとりの単位で「あなたはこれらの理由で否決されました」と言えなければならないからです。

一つ正直に付け加えると、事後説明はブラックボックスの中身を本当に開くのではなく、外から近似するものです。SHAP値も完璧な真実ではありません。だからできれば初めから解釈可能な構造を好み、複雑なモデルを使うとしても、説明を後から慌てて付けるのではなく、最初から一緒に設計します。

ここによく重ねる仕掛けが単調性制約です。「所得が高いほどスコアが下がってはいけない」のように、常識と規制に合う向きをモデルに必ず守らせるものです(Part 0で単調性を安定性の条件として触れました)。性能を少し譲っても、筋の通った向きを守るほうが、説明と信頼の面ではかえって得なことが多いのです。

使わないだけでは公平になりません

次は公平性です。出発点は明確です。性別、人種、宗教のような保護属性で人を差別してはいけません。これは法律で禁じられていて、その変数をモデルに直接入れるのは明白な差別です。

落とし穴は、その変数を外しても公平にはならない、という点です。郵便番号、職業、消費パターンといった別の変数が保護属性と相関していれば、モデルはその代理変数を通じて同じ差別を迂回して学びます。たとえば郵便番号が人種と強く結びついた社会なら、人種を使わず郵便番号だけを使っても、結果として人種差別になります。これを代理変数による差別といいます。

根をたどればPart 0につながります。私たちの持つデータには、過去の審査ポリシーと社会のバイアスがすでに染み込んでいます。モデルはそのデータを学ぶので、何も考えずに学習させれば、過去の差別をそのまま受け継いで再生産します。だから「保護変数さえ外せば公平だ」というのは素朴な考えで、代理変数まで見なければなりません。

公平性は一つに定まりません

では公平かどうかをどう測るのでしょうか。問題は、公平性の定義が一つではないということです。

いくつか挙げるだけでも、集団の間で承認率を同じにそろえようという定義があり(人口統計学的パリティ)、実際にきちんと返す人たちの中で承認率をそろえようという定義があり(機会均等)、予測確率の補正を集団ごとに同じにそろえようという定義があります(集団ごとの補正、Part 5のあの補正です)。どれももっともらしいのに、互いに別のことを言います。

一つ目、集団の間で承認率を比べる感覚には、米国で長く使われてきた経験則が一つあります。5分の4ルール、よく80%ルールと呼ばれるものです。ある集団の承認率が最も高い集団の80%に満たなければ、不利益な影響の兆候とみなす、という基準です。もともとは採用選考から出たものですが、融資の差別の判断でもしばしば参照されます。ただしこれは差別を確定する物差しではなく、もっと調べるべきだという一次的なサインに近いものです。80%を超えても実質的には差別でありうるし、届かなくても正当な理由で説明できることがあります。

そして、数学的に知られた不都合な事実があります。集団の間で基準率、つまり実際の貸し倒れ率が違うと、これらの定義を同時にすべて満たすことはできません。一つをそろえると別の一つがずれます。だから「何を公平とみなすか」は技術が代わりに決めてくれない価値判断であり、文脈と法域に合わせて人が選ばなければならない問題です。

精度とも衝突しえます。公平性をそろえようと手を入れると、性能をいくらか譲ることになる場合が多いです。緩和の手法は、学習前のデータで、学習中の目的関数で、学習後の出力で、それぞれ手を入れられますが、どれもタダではありません。

だからここでも正直な態度はPart 6と同じです。どの公平性基準をなぜ選んだのかを明かし、その選択が何を譲るのかを自覚することです。そしてこの領域は必ず法務・コンプライアンスと一緒に進めなければなりません。技術的に公平だからといって、法的に適法とは限らないからです。

規制がこのすべてを支えます

ここまでの説明の要件と公平性の要求は、ただの善意の勧めではありません。かなりの部分が法と規制で強制されます。

地域ごとに形は違います。米国は公正融資に関する法で否決理由の通知と差別の禁止を求め、欧州は個人情報の規則で自動化された決定への説明を扱い、新しいAI規制は信用評価を高リスクに分類します。日本は割賦販売法の支払可能見込額の算定義務がカード発行と限度額にかかり、モデルがそのまま法的根拠になり(Part 0で触れました)、個人情報保護法がデータ利用を規律します。韓国は信用情報法と個人情報保護法が、自動化された決定への説明と異議申立てを扱います。

ここにプライバシーが重なります。どの変数をモデルに入れるかは、そのまま個人情報をどう使うかの問題です。利用目的の制限、同意、最小限の収集、保存期間、アクセス制御が、すべて特徴量の選択と絡み合っています。だから特徴量を一つ選ぶことが、データガバナンスの決定になります。

結局、Part 0で述べた「モデルを自由にリリースできない」とPart 7のガバナンスが、ここで出会います。規制とガバナンスは、常にこのすべての下に敷かれています。

だから、信頼です

こうして基礎シリーズで、信用データサイエンスがなぜ違うのかの最後のピースまで来ました。予測がうまいのは入場券であり(Part 5)、因果を扱えるのが実力であり(Part 6)、作ったモデルを正直に検証して長く守り抜くことが信頼の一つの軸であり(Part 7)、なぜそう判定したのかを説明し、その判定が公平かに責任を持つことが信頼のもう一つの軸です。

Part 0で、生成AIがこれを全部代わってくれるのではという問いに、むしろもっと必要になると答えました。説明できなければならず、公平でなければならず、規制を通らなければならないという要件の前で、ブラックボックスは構造的に行き詰まるからです。だから、なぜ説明が必要で、何が公平で、どう検証するのかを知っている人が、自動で作られた結果を判定する席に残ります。

ここまでが概念編です。次回からは、これらの概念を実際に動かす側へ移ります。モデルは結局パイプラインの上でしか生きられず、再現性と整合性が性能より先だという話、データエンジニアリングとツールへとつなげていきます。


この記事は han-co.com で最初に公開し、韓国語と日本語で連載しています。原文とメール購読 → https://han-co.com/ja/blog/part8-interpretability-fairness

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?