はじめに
統計学、あるいはその土台となる数学を学ぶ中で、「突然に定義や数式が与えられ、なぜ必要で何に使うのかわからない」、という経験をすることが少なくありません。そこで、定義や数式をただ並べるのではなく、それぞれが何を表していて、どのようにつながっているのかを意識しながら整理しました。
この記事で扱う内容
本記事では、統計学の土台となる測度の概念と確率論を扱います。ただし、測度論や確率論そのものには深入りせず、統計学への応用上必要な知識に焦点をあてて記述します。
- $\sigma$-加法族
- 確率測度と確率空間
- 条件つき確率と独立性
- その他の事項
事象と確率
長さは区間に対して数をわりあてたもの、面積は平面に対して数をわりあてたものです。一般に、集合に対して数を対応させるような関数を測度 measure といいます。統計学で扱う集合については、その測度が確率という形で与えられます。
標本空間と事象
同じ条件でくり返すことができる実験や観測を試行 trial といいます。試行によって起こりうる結果の一つひとつを標本点 sample point といい $\omega$ で表します。標本点をすべて集めてできる集合を標本空間 sample space といい $\Omega_{}$ で表します。
確率を測る対象となる集合は、標本空間の部分集合です。しかし、そのような集合は数学的に測ることができるのかを厳密に考える必要があります。そのために、$\sigma$-加法族を導入します。
定義($\sigma$-加法族) 標本空間 $\Omega_{}$ があり、その部分集合からなる集合族 $\mathcal{F}_{}$ が以下の条件をすべてみたすとき、$\mathcal{F}_{}$ を $\sigma$-加法族 $\sigma$-field という。
(F1)$\Omega \in \mathcal{F}$
(F2)$A \in \mathcal{F} \implies A^{c} := \Omega \setminus A \in \mathcal{F}$
(F3)$A_{k} \in \mathcal{F},\ k = 1,\, 2,\, \ldots \implies \bigcup_{k=1}^{\infty}A_{k} \in \mathcal{F}$
各条件について、平易な表現で言い換えると次のようになります:
(F1)$\Omega_{}$ そのものが $\mathcal{F}_{}$ の要素でなければならない
(F2)$A_{}$ の確率を測ることができるならば、$A_{}$ が起こらないことも測ることができる
(F3)いくつかの集合を選び、それらをまとめて確率を測ることができる
条件 F1 が最もイメージしづらいかもしれません。直感的な比喩表現にはなりますが、(例えば、4次元空間が認識できないとその空間内にあるものを正確に捉えることはできないように)、標本空間そのものが測定可能な対象でなければならないと解釈しています。条件 F2 は、測定の可否の境界を要請する条件です。
$\sigma$-加法族の定義をみたす $\mathcal{F}_{}$ が確率を測ることのできる集合の集まりで、 $\mathcal{F}_{}$ の要素となっている集合を事象 event といいます。
確率を測る対象として認められる事象は、標本空間の部分集合で、かつ$\sigma$-加法族 $\mathcal{F}_{}$ の要素となっている集合です。標本空間の任意の部分集合ではありません。
また、条件 F1, F2 より $\Omega^{c} \in \mathcal{F}$ です。$\Omega^{c}_{}$ は標本点をひとつも含まない事象、すなわち決して起こらない事象です。これを空事象 empty event といい $\varnothing$ で表します。
実際には、確率を測りたい集合の候補が先にあることがあります。このとき、その集合が $\sigma$-加法族の要素であるとは限らないので、必要な集合を集めて$\sigma$-加法族を構成します。
確率を求めたい集合の候補の集まりを $\mathcal{A}_{} \subset 2^{\Omega}$ とします。 $\sigma$-加法族 $\mathcal{G} \subset 2^{\Omega}$ があり、
\sigma(\mathcal A)
= \bigcap_{\substack{\mathcal{G} \supset \mathcal{A} \\ \mathcal{G}\,:\,\sigma\text{-加法族}}}
\mathcal G
とします。$\sigma(\mathcal{A})$ は $\mathcal{A}_{}$ を含むすべての$\sigma$-加法族 $\mathcal{G}_{}$ を集めて、それらすべてに共通して含まれる集合を集めたものです。よって、$\sigma(\mathcal{A})$ は $\mathcal{A}_{}$ を含む最小の$\sigma$-加法族になります。
確率空間
$\sigma$-加法族を導入することで、確率を測ることのできる集合(事象)が明らかになりました。そこでいよいよ、事象に確率を割りあてる関数を定義します。
定義(確率測度) 可測空間$(\Omega,\, \mathcal{F})$1があり、関数 $P : \mathcal{F} \to [0,\, 1]$ が
(P1)$P(\Omega) = 1$
(P2)($\sigma$-加法性) $A_{k} \in \mathcal{F}\ (k = 1,\, 2,\, \ldots)$ かつ $A_{i} \cap A_{j} = \varnothing\ (i \neq j)$2に対して
P\left( \bigcup_{\,k=1}^{\infty}{A_{k}} \right) = \sum_{k=1}^{\infty}{P(A_{k})}
をすべてみたすとき、関数 $P_{}$ を確率測度 probability measure という。また、3つ組 $(\Omega,\, \mathcal{F},\, P)$ を確率空間 probability space という3。
確率測度と、われわれが日常用いる確率 probability という語は同等のものを表しており、特別に区別する必要はありません。あえていえば、事象に数値を割りあてる対応規則 $P_{}$ という文脈で語れば確率測度であり、実際の値 $P(A)$ は確率、とイメージすればわかりやすいかもしれません。
ここで、確率空間の「空間」という表現に戸惑うかもしれません。確率空間は、いわゆる三次元空間のような図示できる幾何学的な空間ではなく、3つの要素をひとまとめにして扱っているに過ぎません。
簡単のために、以降は断りなく、確率空間 $(\Omega,\, \mathcal{F},\, P)$ があり、常に $\mathcal{F}_{}$ の要素である事象を扱うものとします。
条件つき確率と独立性
条件つき確率
定義(条件つき確率) $P(B) > 0$ をみたす事象 $B_{}$ が起こると事前にわかっているとき、事象 $A_{}$ が起こる確率は、
P(A \,|\, B) = \frac{P(A \cap B)}{P(B)}
で与えられ、これを条件つき確率 conditional probability という。
$A_{},\, B_{}$ を入れ替えた $P(B\,|\,A)$ は、結果 $A_{}$ が観測されたことの原因が $B_{}$ であることが成立する確率です。以下のようにして求められます:
条件つき確率の定義から、
P(B \,|\, A) = \frac{P(A \cap B)}{P(A)}
であり、もう一度条件つき確率の定義より $P(A \cap B) = P(A \,|\, B)P(B)$ であるから
P(B \,|\, A) = \dfrac{P(A \,|\, B)P(B)}{P(A)}\,.
このような条件つき確率 $P(B \,|\, A)$ は、事後確率 posterior probability といい、しばしば原因の確率と表現されます4。
原因の確率は、原因として考えられる事象の候補が複数あるような一般の場合に拡張することができます。まず、標本空間 $\Omega_{}$ が複数の原因 $B_{k}\ (k = 1,\, 2,\, \ldots)$ で分割されることを保証します。$B_{1},\, B_{2},\, \ldots \in \mathcal{F}$ は互いに排反な事象の列で $P(B_{k}) > 0,\ \bigcup_{k=1}^{\infty}B_{k} = \Omega$ をみたすものとします。このとき、結果 $A_{}$ の起こる確率は
P(A) = \sum_{k=1}^{\infty}{P(A \cap B_{k})} = \sum_{k=1}^{\infty}{P(A \,|\, B_{k})P(B_{k})}\, .
これを全確率の公式といいます。これを用いると、原因の確率 $P(B_{j} \,|\, A)$ は
P(B_{j} \,|\, A) = \dfrac{P(A \,|\, B_{j})P(B_{j})}{P(A)} = \dfrac{P(A \,|\, B_{j})P(B_{j})}{\sum_{k=1}^{\infty}P(A \,|\, B_{k})P(B_{k})}
と表現されます。これをベイズの定理 Bayes' theorem といいます。
独立性
2つの事象 $A,\, B$ が無関係であるとは、$B_{}$ の生起によって $A_{}$ の起こる確率が変化しないことを意味します。そこで、$P(B)>0$ のときには $P(A\,|\,B) = P(A)$ が成り立つことにします。条件つき確率の定義から
P(A \cap B) = P(A)P(B)
であり(これは $P(B) = 0$ でも成り立つ)、これは独立性 independence の定義そのものです。
一般に、$A_{k} \in \mathcal{F},\ k = 1,\, 2,\, \ldots,\, n$ として、$n$ 個の事象 $\left\{ A_{k} \right\}_{k = 1,\,2,\,\ldots,\,n}$ について、任意の $1 \leq l \leq n$ と任意の $1 \leq k_{1} < k_{2} < \cdots < k_{l} \leq n$ に対して
P\left( \bigcap_{\,j=1}^{l}{A_{k_{j}}} \right) = \prod_{j=1}^{l}P(A_{k_{j}})
であるとき、$A_{1},\, A_{2},\, \ldots$ は独立 independent であるといいます。
少し書き下すと、$l_{}$ は独立性を考える事象の個数、$k_{j}$ は対象となる事象の番号を表しています。そして、$l_{}$ を指定すれば選ばれた集合を(1つめが$k_{1}$、2つめは$k_{2}$のように)順に処理すれば独立性が確かめられます。
その他の事項
上述した内容と関連し、有用な性質を紹介します。本節に限り、統計学の知識を前提とした記述を含みます。
Boole の不等式
任意の事象 $A_{k} \in \mathcal{F},\ (k = 1,\, 2,\, \ldots)$ について
P\left( \bigcup_{\,k=1}^{\infty}A_{k} \right) \le \sum_{k=1}^{\infty}P(A_{k})
が成り立つ。これを Boole の不等式といいます。不等式をみての通り、事象 $A_{1},\, A_{2},\, \ldots$ の少なくとも1つが起きる確率を、上から抑えることができます。多重比較問題において、Bonferroni 法による有意水準の調整で用いられます。
Bonferroni 補正
$m$ 個の帰無仮説 $H_{i} : \theta \in \Theta_{0,i}\ (i = 1,\, \ldots,\, m)$ を検定するとき、第一種の誤りの事象を$E_{1},\, E_{2},\, \cdots,\, E_{m}$ とし、真(棄却してはならない)の帰無仮説のインデックスを表す集合を $I_{0} \equiv \left\{ i \in \left\{ 1,\, \ldots,\, m \right\} \mid \theta \in \Theta_{0,i} \right\}$ とする。Bonferroni の不等式より
P\left(\bigcup_{i \in I_{0}}E_{i}\right) \le \sum_{i \in I_{0}}P(E_{i})
ここで、全体の有意水準 $\alpha$ に対して、各検定では
\sup_{\theta \in \Theta_{0,i}}{P_{\theta}(E_{i})} \le \alpha / m \ (i = 1,\, \ldots,\, m)
が成り立つので、
\begin{align*}
P_{\theta}\left(\bigcup_{\,i \in I_{0}}E_{i}\right) &\le \sum_{i \in I_{0}}P_{\theta}(E_{i})
\\
&\le \sum_{i \in I_{0}}\dfrac{\alpha}{m} = |I_{0}|\dfrac{\alpha}{m}
\\
&\le \alpha
\end{align*}
したがって、各検定の有意水準を $\alpha / m$ とすれば、全体の有意水準は $\alpha$ 以下に抑えられることがわかります。
参考文献
書籍
舟木直久(2004)確率論 朝倉書店
久保川達也(2017)現代数理統計学の基礎 共立出版
Webサイト
多重比較法の基礎的な話(Qiita)
ブールの不等式(Wiki)
-
一般に、集合 $S_{}$ とその $\sigma$-加法族 $\mathcal{A}_{}$ の組 $(S,\, \mathcal{A})$ を可測空間という。 ↩
-
$A_{1},\, A_{2},\, \ldots \in \mathcal{F}$ が $A_{i} \cap A_{j} = \varnothing\ (i \neq j)$ をみたすとき、$\left\{ A_{k} \mid k \in \mathbb{N} \right\}$ を排反事象列という。 ↩
-
一般に、集合 $S_{}$ とその $\sigma$-加法族 $\mathcal{A}_{}$ について、 条件 P2 をみたす非負関数 $\mu : \mathcal{A} \to [0,\, \infty]$ を測度といい,3つ組 $(S,\, \mathcal{A},\, \mu)$ を測度空間という。 ↩
-
原因の確率と表現されますが、因果関係を求めるものではありません。 ↩