Quantitative Analysis / 定量分析 の構成要素
Quantitative Analysis
│
├─ 4. 確率・統計(Probability & Statistics)
│
├─ 5. 統計的推論(Statistical Inference)
│
├─ 6. 回帰分析(Regression Analysis)
│
├─ 7. 時系列分析(Time Series)
│
├─ 7. 金融統計(Financial Statistics)
│
├─ 7. シミュレーション(Simulation)
│
└─ 7. 機械学習(Machine Learning)
4. 確率・統計(Probability & Statistics)
4. 確率・統計(Probability & Statistics)
│
├─ 確率変数: 確率によって値が決まる①変数
│ │
│ ├─ 離散型確率変数: 飛び飛びの値をとる確率変数
│ ├─ 連続型確率変数: 連続した値をとる確率変数
│ │
│ ├─ 確率質量関数(PMF): 離散型確率変数の確率を表す関数
│ ├─ 確率密度関数(PDF): 連続型確率変数の密度を表す関数
│ ├─ 累積分布関数(CDF): ある値以下になる確率を表す関数
│ └─ 分位関数: CDFの逆関数
│
├─ 分布の特徴量: 確率分布の性質を表す指標
│ │
│ ├─ 期待値: 確率分布の平均値
│ ├─ 分散: 期待値からのばらつきの大きさ
│ ├─ 標準偏差: 分散の平方根
│ ├─ 歪度: 分布の左右非対称性
│ ├─ 尖度: 分布の裾の厚さ
│ ├─ 共分散: 二つの確率変数の同時変動
│ └─ 相関係数: 共分散を標準化した尺度
│
├─ 一変量確率分布: 一つの確率変数の確率分布
│ │
│ ├─ 離散型分布: 離散型確率変数の確率分布
│ │ ├─ ベルヌーイ分布: 一回の成功・失敗を表す分布
│ │ ├─ 二項分布: ベルヌーイ分布を②独立に繰り返した分布
│ │ └─ ポアソン分布: 単位時間・空間当たりの発生回数を表す分布
│ │
│ └─ 連続型分布: 連続型確率変数の確率分布
│ ├─ 一様分布: 全ての値が等しい密度を持つ分布
│ ├─ 正規分布: 左右対称な鐘形の分布
│ ├─ 対数正規分布: 対数を取ると正規分布となる分布
│ ├─ t分布: 母分散未知の平均推定に用いる分布
│ ├─ カイ二乗分布: 分散の推定・検定に用いる分布
│ ├─ F分布: 二つの分散比を扱う分布
│ ├─ 指数分布: ③待ち時間を表す分布
│ ├─ ベータ分布: ④確率や割合を表す分布
│ └─ 混合分布: 複数の分布を組み合わせた分布
│
└─ 多変量確率分布: 複数の確率変数を同時に扱う確率分布
│
├─ 同時分布: 複数の確率変数が同時に生じる分布
├─ 周辺分布: 一部の確率変数だけを取り出した分布
├─ 条件付き分布: 他の確率変数を条件とした分布
├─ 二変量モーメント: 二変量分布の特徴量
├─ 共分散: 二変量分布の線形関係を表す指標
├─ 相関係数: 共分散を標準化した指標
└─ 独立同分布(i.i.d.): ②独立かつ同じ分布に従う確率変数
① 変数:
観測ごとに値が変化する量
② 独立:
一方の結果が他方の確率に影響しないこと
③ 待ち時間:
ある事象が初めて発生するまでの時間
④ 確率:
事象が発生する可能性を0~1で表した値
5. 統計的推論(Statistical Inference)
5. 統計的推論(Statistical Inference)
│
├─ 標本統計量: 標本から計算される統計量
│ │
│ ├─ 標本平均: 標本データの平均
│ ├─ 標本分散: 標本データの分散
│ ├─ 標本標準偏差: 標本分散の平方根
│ └─ 標本モーメント: 標本から計算される分布の特徴量
│
├─ 推定: 標本から母集団の特徴量を求める方法
│ │
│ ├─ 点推定: 母数を一つの値で推定する方法
│ ├─ 区間推定: 母数が含まれる範囲を推定する方法
│ ├─ 信頼区間: 母数が含まれると期待される区間
│ └─ 標準誤差: 推定量のばらつきを表す指標
│
└─ 仮説検定: 標本から仮説の妥当性を判断する方法
│
├─ 帰無仮説(H₀): 正しいと仮定する仮説
├─ 対立仮説(H₁): 帰無仮説に対立する仮説
├─ 有意水準: 第一種過誤を許容する確率
├─ 検定統計量: 標本から計算される判定指標
├─ 臨界値: 帰無仮説を棄却する境界値
├─ p値: 帰無仮説の下で現在以上の結果が得られる確率
│
├─ 仮説検定の誤り
│ ├─ 第一種過誤: 真の帰無仮説を棄却する誤り
│ └─ 第二種過誤: 偽の帰無仮説を棄却できない誤り
│
├─ 平均の検定
│ ├─ Z検定: 母分散既知の場合の平均の検定
│ ├─ t検定: 母分散未知の場合の平均の検定
│ ├─ 対応のあるt検定: 対応する二標本の平均差を検定する方法
│ └─ Welch検定: ①等分散を仮定しない二標本平均の検定
│
└─ 検定結果の解釈
├─ 棄却: 帰無仮説を採用しない判断
└─ 棄却できない: 帰無仮説を否定できない判断
① 等分散:
複数の母集団の分散が等しいこと
6. 回帰分析(Regression Analysis)
6. 回帰分析(Regression Analysis)
│
├─ 線形回帰: 目的変数を説明変数で表す回帰分析
│ │
│ ├─ 単回帰分析: 一つの説明変数を用いる線形回帰
│ ├─ 重回帰分析: 複数の説明変数を用いる線形回帰
│ │
│ ├─ 回帰モデル: 説明変数と目的変数の関係を表す数式
│ ├─ 回帰係数: 説明変数が目的変数へ与える影響
│ ├─ 切片: 説明変数が0のときの目的変数
│ ├─ 残差: 実測値と予測値の差
│ ├─ 誤差項: ①モデルで説明できない変動
│ └─ ダミー変数: カテゴリ変数を0と1で表した説明変数
│
├─ パラメータ推定: 回帰係数を推定する方法
│ │
│ ├─ 最小二乗法(OLS): 残差平方和を最小化する推定方法
│ ├─ 残差平方和(RSS): 残差の二乗和
│ └─ OLSの前提条件: OLSが②BLUEとなるための条件
│
├─ モデル評価: 回帰モデルの性能を評価する方法
│ │
│ ├─ 総平方和(TSS): 目的変数全体の変動
│ ├─ 説明平方和(ESS): モデルが説明した変動
│ ├─ 残差平方和(RSS): モデルが説明できない変動
│ ├─ 決定係数(R²): モデルが説明できた割合
│ ├─ 調整済み決定係数: 説明変数数を考慮した決定係数
│ │
│ ├─ 回帰係数の検定
│ │ ├─ t値: 回帰係数の有意性を判定する統計量
│ │ ├─ p値: 回帰係数の有意性を示す確率
│ │ └─ 信頼区間: 回帰係数が含まれると期待される区間
│ │
│ └─ モデル全体の検定
│ └─ F検定: 全ての回帰係数を同時に検定する方法
│
└─ 回帰診断: 回帰モデルの問題点を調べる方法
│
├─ 異分散性: 残差の分散が一定でない状態
│ ├─ 無条件異分散性: 説明変数に依存しない異分散
│ ├─ 条件付き異分散性: 説明変数に依存する異分散
│ ├─ 異分散性の検出: 異分散の有無を確認する方法
│ └─ 異分散性の補正: 異分散の影響を小さくする方法
│
├─ 多重共線性: 説明変数同士の相関が高い状態
│ ├─ 多重共線性の検出: 多重共線性を確認する方法
│ └─ 多重共線性の補正: 多重共線性を改善する方法
│
├─ モデル仕様
│ ├─ 省略変数バイアス: 必要な説明変数を除外したことによる偏り
│ ├─ 生存バイアス: 生き残ったデータだけを分析する偏り
│ ├─ 同時性バイアス: 相互に影響する変数を扱う偏り
│ ├─ 減衰バイアス: ③測定誤差により係数が過小評価される偏り
│ └─ 残差プロット: 残差からモデルの妥当性を確認する方法
│
└─ モデル設計
├─ バイアス・バリアンストレードオフ: モデルの単純さと複雑さの均衡
└─ BLUE: 最良線形不偏推定量
① モデル:
現象を数式で表したもの
② BLUE:
Best Linear Unbiased Estimator(最良線形不偏推定量)の略
③ 測定誤差:
観測値が真の値からずれる誤差
7. 時系列分析(Time Series Analysis)
7. 時系列分析(Time Series Analysis)
│
├─ 時系列データ: 時間順に並んだ観測データ
│
├─ 定常時系列: 統計的性質が時間によって変化しない時系列
│ │
│ ├─ 共分散定常性: 平均・分散・共分散が一定である性質
│ │ ├─ 平均一定: 時間によらず期待値が一定
│ │ ├─ 分散一定: 時間によらず分散が一定
│ │ └─ 共分散一定: 共分散が①ラグだけで決まる
│ │
│ ├─ ホワイトノイズ: 予測できない完全にランダムな時系列
│ ├─ 自己相関(ACF): 各ラグとの相関を表す指標
│ └─ 偏自己相関(PACF): 他のラグの影響を除いた自己相関
│
├─ 時系列モデル: 定常時系列を表現するモデル
│ │
│ ├─ 自己回帰モデル(AR): 現在値を過去の観測値で表すモデル
│ ├─ 移動平均モデル(MA): 現在値を過去の誤差で表すモデル
│ ├─ 自己回帰移動平均モデル(ARMA): ARとMAを組み合わせたモデル
│ │
│ ├─ モデル識別
│ │ ├─ ACF: モデル種類を判定する指標
│ │ └─ PACF: モデル次数を判定する指標
│ │
│ └─ モデル診断
│ ├─ 残差分析: 残差がホワイトノイズか確認する方法
│ ├─ Box-Pierce検定: 残差の自己相関を検定する方法
│ └─ Ljung-Box検定: Box-Pierce検定を改良した方法
│
└─ 非定常時系列: 統計的性質が時間とともに変化する時系列
│
├─ 時間トレンド: 平均が時間とともに変化する現象
├─ 季節性: 一定周期で繰り返す変動
│
├─ 単位根: ARモデルの係数が1となる状態
├─ ランダムウォーク: 単位根を持つ代表的な時系列
│
├─ 定常化
│ └─ 差分化: 前期との差を取って定常系列へ変換する方法
│
└─ 単位根検定
└─ ADF検定: 単位根の有無を検定する方法
① ラグ:
現在から何期前のデータかを表す時間差
7. 金融統計(Financial Statistics)
7. 金融統計(Financial Statistics)
│
├─ リターン: 金融資産の収益率
│ │
│ ├─ 単純リターン: 投資額に対する収益率
│ ├─ 対数リターン: リターンを対数で表した収益率
│ └─ 累積リターン: 複数期間のリターンをまとめた収益率
│
├─ ボラティリティ: リターンのばらつき
│ │
│ ├─ 分散: ボラティリティの二乗
│ ├─ 標準偏差: 分散の平方根
│ ├─ 年率化: ボラティリティを一年単位へ換算する方法
│ ├─ インプライドボラティリティ: ①オプション価格から推定される将来のボラティリティ
│ ├─ VIX: S&P500の予想ボラティリティを表す指数
│ └─ BSMモデル: ②オプション価格を計算するモデル
│
├─ リターン分布: リターンが従う確率分布
│ │
│ ├─ 正規分布: 左右対称なリターン分布
│ ├─ 非正規分布: 正規分布から外れたリターン分布
│ ├─ ファットテール: 正規分布より極端な値が発生しやすい性質
│ └─ パワーロー分布: 非常に厚い裾を持つ分布
│
├─ 分布の評価: リターン分布の性質を評価する方法
│ │
│ ├─ 歪度: 分布の左右非対称性
│ ├─ 尖度: 分布の裾の厚さ
│ ├─ 超過尖度: 尖度から3を引いた値
│ └─ Jarque-Bera検定: 正規分布への適合性を検定する方法
│
└─ 相関と依存性: 二つの金融変数の関係
│
├─ Pearson相関: 線形関係を測る相関係数
├─ Spearman相関: 順位の相関を測る相関係数
├─ Kendall順位相関: 順位の一致度を測る相関係数
└─ 依存性: 線形以外も含めた変数間の関係
① オプション:
将来あらかじめ決めた価格で売買する権利
② オプション価格:
オプションの市場価格
7. シミュレーション(Simulation)
7. シミュレーション(Simulation)
│
├─ シミュレーション: 仮定した条件で多数の結果を生成し分析する方法
│
├─ モンテカルロシミュレーション: 確率分布から乱数を発生させて結果を推定する方法
│ │
│ ├─ データ生成過程(DGP): データが生成される仕組み
│ ├─ 入力変数: シミュレーションへ与えるデータ
│ ├─ 出力変数: シミュレーションから得られる結果
│ ├─ レプリケーション: シミュレーションを繰り返す回数
│ │
│ ├─ 推定結果
│ │ ├─ 期待値: シミュレーション結果の平均
│ │ ├─ 分散: シミュレーション結果のばらつき
│ │ ├─ 分位点: 確率に対応する境界値
│ │ ├─ VaR: ①一定確率で発生しうる最大損失
│ │ └─ 標準誤差: 推定値のばらつき
│ │
│ └─ 分散削減法: 推定精度を改善する方法
│ ├─ 対立変数法: 負の相関を利用して分散を減らす方法
│ └─ コントロール変数法: 既知の情報を利用して推定値を補正する方法
│
├─ ブートストラップ: 実データを再標本化して推定する方法
│ │
│ ├─ 復元抽出: 抽出後に元へ戻して再抽出する方法
│ ├─ i.i.d.ブートストラップ: 独立同分布を仮定するブートストラップ
│ ├─ 円形ブロックブートストラップ(CBB): 時系列依存を保持するブートストラップ
│ ├─ ブロックサイズ: 一度に抽出する観測値数
│ └─ 構造変化: データ生成過程が変化する現象
│
├─ 乱数生成: シミュレーションで利用する乱数を生成する方法
│ │
│ ├─ 疑似乱数生成器(PRNG): 計算機で乱数列を生成する方法
│ ├─ 一様乱数: 全ての値が等確率で発生する乱数
│ ├─ シード値: 乱数列を決定する初期値
│ └─ 再現性: 同じ乱数列を再生成できる性質
│
└─ シミュレーションの課題: シミュレーション結果へ影響する要因
│
├─ DGPの仕様ミス: データ生成過程の仮定が誤っている状態
├─ サンプリング誤差: 標本抽出による偶然の誤差
├─ 計算コスト: 高精度化に必要な計算量
├─ 分布仮定: 仮定した確率分布による影響
└─ 過去データ依存: 過去データだけでは将来を十分表現できない問題
① VaR(Value at Risk):
一定の信頼水準で予想される最大損失額
7. 機械学習(Machine Learning)
7. 機械学習(Machine Learning)
│
├─ 機械学習: データから規則性を学習し予測や分類を行う方法
│
├─ 学習の種類: 学習データの与え方による分類
│ │
│ ├─ 教師あり学習: 正解データを用いて学習する方法
│ ├─ 教師なし学習: 正解データを用いず特徴を発見する方法
│ └─ 強化学習: 報酬を最大化するように学習する方法
│
├─ データ前処理: 学習前にデータを加工する工程
│ │
│ ├─ データクリーニング: 欠損値や異常値を処理する工程
│ ├─ 標準化: 平均0・分散1へ変換する方法
│ ├─ 正規化: 値を一定範囲へ変換する方法
│ ├─ カテゴリ変数: 数値でない変数
│ ├─ ダミー変数: カテゴリ変数を0・1で表した変数
│ └─ サンプル分割: 学習用・評価用へデータを分割する方法
│
├─ モデル学習: モデルを構築する工程
│ │
│ ├─ Trainデータ: モデル学習に使用するデータ
│ ├─ Validationデータ: モデル選択に使用するデータ
│ ├─ Testデータ: モデル性能を評価するデータ
│ ├─ Cross Validation: 学習と評価を繰り返す方法
│ ├─ Underfitting: モデルが単純すぎる状態
│ ├─ Overfitting: モデルが複雑すぎる状態
│ └─ Bias-Variance Tradeoff: ①バイアスと分散の均衡
│
├─ 教師なし学習: ラベルを持たないデータを分析する方法
│ │
│ ├─ 次元削減
│ │ └─ 主成分分析(PCA): 情報を保ったまま変数を削減する方法
│ │
│ └─ クラスタリング
│ └─ K平均法(K-means): 類似データをグループ化する方法
│
├─ 教師あり学習: 入力と正解から予測モデルを学習する方法
│ │
│ ├─ 線形モデル
│ │ └─ ロジスティック回帰: 確率を予測する分類モデル
│ │
│ ├─ 木構造モデル
│ │ ├─ 決定木: 条件分岐で分類・予測するモデル
│ │ └─ アンサンブル学習: 複数モデルを組み合わせる方法
│ │ ├─ バギング: 複数モデルの平均を利用する方法
│ │ ├─ ランダムフォレスト: 決定木を多数組み合わせたモデル
│ │ ├─ ブースティング: 誤差を順次補正する方法
│ │ └─ AdaBoost: ブースティングの代表的手法
│ │
│ └─ その他の分類モデル
│ ├─ K近傍法(KNN): 近いデータから分類する方法
│ └─ サポートベクターマシン(SVM): ②マージンを最大化して分類する方法
│
├─ ニューラルネットワーク: 人工神経回路を模した学習モデル
│ │
│ ├─ 入力層: 入力データを受け取る層
│ ├─ 隠れ層: 特徴量を学習する層
│ ├─ 出力層: 予測結果を出力する層
│ ├─ 重み: 各入力の重要度
│ ├─ 活性化関数: 出力を非線形へ変換する関数
│ ├─ 順伝播: 入力から出力を計算する処理
│ ├─ 誤差逆伝播法: 誤差から重みを更新する方法
│ ├─ 勾配降下法: 誤差が小さくなる方向へ重みを更新する方法
│ └─ Early Stopping: 過学習を防ぐため学習を途中終了する方法
│
├─ 強化学習: 試行錯誤から最適行動を学習する方法
│ │
│ ├─ 状態(State): 環境の状況
│ ├─ 行動(Action): 選択可能な操作
│ ├─ 報酬(Reward): 行動による評価
│ ├─ 方策(Policy): 行動を選択する規則
│ ├─ Q値: 将来報酬を含めた価値
│ ├─ モンテカルロ法: エピソード終了後に価値を更新する方法
│ └─ TD学習: 毎時点で価値を更新する方法
│
├─ 自然言語処理(NLP): 人間の言語を扱う機械学習
│ │
│ ├─ Tokenization: 文を単語へ分割する処理
│ ├─ Stopword Removal: 不要語を除去する処理
│ ├─ Stemming: 語尾を切り落とす処理
│ ├─ Lemmatization: 基本形へ変換する処理
│ ├─ N-gram: 連続単語を特徴量とする方法
│ ├─ Bag of Words: 単語出現回数で文章を表現する方法
│ └─ Sentiment Analysis: 感情を分類する方法
│
└─ モデル評価: 学習モデルの性能を評価する方法
│
├─ 混同行列: 分類結果を整理した表
├─ Accuracy: 全体の正解率
├─ Precision: 陽性予測の正確さ
├─ Recall: 実際の陽性を検出する割合
├─ ROC曲線: 真陽性率と偽陽性率の関係
└─ AUC: ROC曲線下面積による性能指標
① バイアス・分散:
モデル誤差を構成する二つの要素
② マージン:
異なるクラス間の境界からデータまでの距離
Knowledge Tree作成ルール
Knowledge Tree 作成ルール
① 各ノードは
単語: 一文で説明
の形式で記載する。
例
OLS: 残差平方和を最小化する推定方法
---
② 説明文では、
親・祖先・子孫に存在する用語
はそのまま利用してよい。
例
回帰分析
└─ OLS
であれば、
OLS:
回帰分析の係数を推定する方法
のように説明してよい。
---
③ Tree内に存在しない用語を使用する場合
番号を付ける。
例
OLS:
残差平方和を最小化する①推定方法
① 推定方法:
データから未知の母数を求める方法
---
④ 同じ番号は同じ意味で使う。
① 推定方法
であれば、
以後すべて①で統一する。
---
⑤ 数式中の記号
μ
σ
β
などは番号付けしない。
---
⑥ 金融専門用語
VaR
VIX
BSM
などTree外の概念は番号を付ける。
---
⑦ Tree内に存在する用語は、
別の場所で再説明しない。
Knowledge Tree全体で
一つの辞書となるよう管理する。
---
⑧ 一つの説明は
一文(30文字程度)を目安とする。
詳細は別ノートへ記載する。