はじめに
数年前、自分は業務で需要予測のモデルを回していた。精度はそれなりに出ていたし、ダッシュボードにもきれいなグラフが並んだ。ところがレビューで「この特徴量、なんで効いてるの」と聞かれて何も答えられなかった。コードは書けていた。中で何が起きているかは、ほとんど説明できなかった。
そこからしばらく、ライブラリのドキュメントを読み漁る日々が続いた。使い方はわかる。けれど正則化を強めるとなぜ汎化するのか、交差検証の分割を変えると結果がぶれる理由はどこにあるのか、そういう問いには届かない。手を動かした量と理解の深さは、残念ながら比例しない。
結局効いたのは紙の本だった。薄い本で全体の地図を手に入れ、厚い本で数式に潜り、実装書でコードに戻る。この順で一周したとき、ようやく自分の言葉でモデルの挙動を語れるようになった。
ここで挙げるのは3冊だけだ。どれも日本語で読めて、手元に置いて何度も開ける。役割がはっきり分かれているので内容の重複が少なく、積ん読になりにくいのも選んだ理由である。
① 機械学習 100+ページ エッセンス — Andriy Burkov
著者のBurkovは人工知能の博士号を持ち、企業のデータサイエンスチームを率いてきた実務家だ。研究と現場の両方を見てきた人の整理は、無駄が削ぎ落とされている。
タイトルどおり本編は100ページ強しかない。教師あり学習、教師なし学習、ニューラルネットワーク、強化学習まで、機械学習の主要な枠組みをひととおり通す。各トピックは数ページで切り上げる潔さがある。
数式は出てくるが必要最小限で、記号の意味は丁寧に添えられている。特徴量エンジニアリング、ハイパーパラメータの探索、不均衡データの扱いといった現場で詰まる話題も短い章で押さえてある。
自分にとって一番の価値は読み返しやすさだった。新しい手法を触るとき、まずこの本の該当章を数分で眺めてから本題に入る。概念の置き場所がわかっていると、未知の論文やドキュメントが急に読めるようになる。
逆にゼロから学ぶ一冊目には向かない。各章は圧縮された要約なので、初見の概念はあとで別の資料で補う前提で読むほうがいい。
こんな人に: 断片的に覚えた知識を一度地図の上に並べ直したい人。
② パターン認識と機械学習 上 — C. M. ビショップ
著者のビショップはMicrosoft Researchで長年研究を率いてきた研究者で、ニューラルネットワークとベイズ推論の分野で知られている。いわゆるPRMLとして定番になっている一冊だ。
上巻は確率論の基礎から入り、線形回帰と線形識別モデル、ニューラルネットワーク、カーネル法までを扱う。全体がベイズの視点で一貫しているので、個々の手法がばらばらの道具ではなく同じ原理の変形として見えてくる。
事前分布と事後分布の関係を追っていくと、正則化の正体がすっきり理解できる。自分が最初に答えられなかった「なぜこの項を足すと汎化するのか」という疑問は、ここでようやく腑に落ちた。
図版の質も高い。多項式フィッティングの次数を変えたときの挙動や、カーネルの形が予測分布に与える影響が視覚的に示されていて、数式を追い切れなくても手触りは残る。
線形代数、微積分、確率の基礎は前提になる。通読しようとすると挫折しやすいので、自分は気になる章だけ1日数ページのペースで進めた。それで十分に元が取れる。
こんな人に: 手法の裏側にある原理を数式で確かめたい人。
③ scikit-learn、Keras、TensorFlowによる実践機械学習 第3版 — Aurélien Géron
著者のGéronは元GoogleでYouTubeの動画分類に携わったエンジニアで、自身で会社を立ち上げた経験も持つ。説明の重心が常に動くコードに置かれているのは、その経歴ゆえだと思う。
前半はscikit-learnで古典的な手法を一周する。回帰、分類、サポートベクターマシン、決定木、アンサンブル、次元削減。データの読み込みから評価指標の選び方、パイプラインの組み方まで、プロジェクトの流れがそのまま追体験できる構成だ。
後半はKerasとTensorFlowによる深層学習に移る。畳み込みネット、再帰型ネット、Transformer、生成モデル、強化学習、さらに学習済みモデルの配信まで射程に入っている。第3版では比較的新しいトピックが補強され、APIの書き方も現行の流儀に揃っている。
章末の演習とGitHubのノートブックが強力で、写経しながら読むと進みが速い。自分は前処理とハイパーパラメータ調整の章を何度も開き直した。実務で効く小技が地味に多い。
分量はかなりある。頭から順に読もうとすると息切れするので、必要な章だけ抜き出して使う辞書的な運用が現実的だ。
こんな人に: 動くコードを起点に、古典的手法から深層学習まで一本の線でつなぎたい人。
まとめ
| ステップ | 読む本 | 得られるもの |
|---|---|---|
| 全体像をつかむ | 機械学習 100+ページ エッセンス | 用語と手法の地図、読み返せる索引 |
| 原理に潜る | パターン認識と機械学習 上 | ベイズの視点と正則化の数学的な根拠 |
| 実装に落とす | scikit-learn、Keras、TensorFlowによる実践機械学習 第3版 | 前処理から配信までの実務フロー |
今の課題に合わせて1冊選ぶなら、こう考える。
- 用語の定義があいまいで会話についていけない: 100+ページ エッセンスを数日で通す
- 手法を選ぶ理由を説明できない: パターン認識と機械学習 上の線形モデルの章から入る
- コードが書けず手が止まる: 実践機械学習の該当章をノートブックごと動かす
- モデルは動くが改善の勝ち筋が見えない: 実践機械学習で手順を固め、理屈はPRMLで裏取りする
3冊を同時に進める必要はない。地図、原理、実装のどこが欠けているかを見極めて、足りないところから埋めていくのが結局一番速い。