取組のきっかけ
「うちにも scRNA-seq のデータが来てるんだけど、解析できる人いなくて。君、できる?」
PI からそう聞かれた瞬間、頭の中で同時に走った思考:
- 「scRNA-seq って細胞単位の RNA-seq だっけ…?」
- 「Scanpy って聞いたことある、Python の何か」
- 「閾値とか正規化とか、論文 Methods で見たけど、自分で書ける気がしない」
「ちょっと調べてやってみます」と返事をして、その日の夜に Scanpy のチュートリアルを開きました。英語、関数名がずらり、サンプルコードが並ぶ — 5 分で閉じました。
あなたにも、心当たりがありませんか?
過去 1 年、私は同じような苦しみを抱えるウェット研究者を 20名ほど 伴走サポートしてきました(ココナラで個別相談を提供しています)。最初の相談メッセージのほぼ全員が、似たことを書いてきます:
- 「バイオインフォの解析を頼まれたが、何から始めればいいか分からない」
- 「Scanpy をインストールしようとしてエラーで詰まった」
- 「閾値の決め方、論文ごとに違う」
- 「専用業者に頼むと数十万、研究費が足りない」
- 「自分で勉強しろと言われても、参考書を読み切る時間がない」
そこ、私も詰まりました。学部時代も、社会人になってからも。
そもそも、なぜ scRNA-seq を解析するのか
教授が「scRNA-seq できる?」と聞いてきた、その裏には研究的な問いがあります。
バルク RNA-seq は「組織全体を 1 本のチューブに溶かして測る」技術。平均値しか見えない。
一方 scRNA-seq は「組織を細胞 1 個ずつバラして測る」技術。これで初めて見えるのが:
- 組織内のヘテロ性:同じ "T 細胞" でも CD4 / CD8 / 制御性 / 細胞傷害性 / 疲弊型 が混在
- 稀少細胞集団:全体の数 % しかいない MAIT 細胞・幹細胞様集団・特殊サブ型
- 状態変化:同じ細胞型でも活性化・静止・アポトーシス前 で発現が変わる
- 疾患・治療応答の細胞レベルの違い:健常 vs 患者、治療前 vs 後 を細胞集団ごとに比較
「うちのサンプル(患者検体・疾患モデル・治療応答)を、細胞集団ごとにプロファイリングしたい」ということ。私の役目は、まずその設計図をパイプラインとして組むこと。
今回は学習デモとして公開データの PBMC 3k(健常人の末梢血単核細胞) を使います。これは:
- 文献で正解(主要 6-7 細胞型の構成、典型的な CD4:CD8 比)が確立している
- 結果が "妥当か" を即座に検証できる
- 同じパイプラインを患者検体に切り替えれば、研究本番に直結する
「デモでパイプラインを完成 → 自施設データに移植」が、研究室の解析環境を立ち上げる最短ルート
4 時間で得た「研究成果」 — デモから見えた 3 つのこと
結論から書きます。下記は scRNA-seq 解析の最初の関門「QC(細胞品質チェック)」 + クラスタリング + 細胞型アノテーションを、AI と協働で 4 時間で完了させた結果です。
まず数値:QC が通った細胞
| やったこと | 数値結果 |
|---|---|
| PBMC 3k(末梢血単核細胞、入門用標準データ)取得 | 2,700 細胞 × 32,738 遺伝子 |
| QC 指標を計算 | UMI 数 / 遺伝子数 / ミトコンドリア比率 |
| 閾値を データに教えてもらった(MAD ベース) | 自動算出された 3 つの値 |
| フィルタを通した | 2,611 細胞 通過(96.7%) |
そして得られた QC の図はこちら:
縦軸は各 QC 指標、上に長い尾は「2 細胞が同じ液滴に入った "doublet" 候補」、下に長い尾は「死細胞・空ドロップレット候補」。
緑/黄色(ミトコンドリア比率高)が左下に集中している = 死細胞の典型パターン。MAD ベースの cutoff(赤・橙の点線)が、それらを除外する位置に自動配置されている。
この図を見ながら、何を判断したか:
- 「PBMC は元々ミトコンドリア比率が低い組織だから、median 2% で妥当」
- 「上に長い尾があるから、高い側を切る閾値が要る」
- 「データ駆動の MAD は適切に閾値を計算してくれているように見える」
→ 「自分で書いた」のではなく「自分で判断した」。コードを書いたのは AI。
問いと期待
ここからが本番。QC で 2,611 細胞に絞ったあと、研究的な問いを立てます。
- 問い:PBMC 3k 中の免疫細胞型を分離・同定し、構成比を求める
- 期待(文献ベース):T 細胞 / B 細胞 / 単球 / NK が主、CD4:CD8 比は健常人で ~2:1 程度
成果 1:主要 6 細胞型を分離、文献と整合
「正規化 → 高変動遺伝子 → PCA → クラスタリング → UMAP → マーカー遺伝子 → 細胞型アノテーション」を AI 駆動で走らせた結果:
| 細胞型 | 数 | 割合 | 文献ベース妥当性 |
|---|---|---|---|
| CD4 T cell | 1,104 | 42% | 健常人 PBMC で 30-50% 多い、整合 |
| CD14 Mono | 471 | 18% | 単球 10-20%、整合 |
| CD8 T cell | 356 | 14% | CD4:CD8 ≈ 3:1、健常人としてやや CD4 寄りだが正常範囲 |
| B cell | 344 | 13% | 末梢血 5-15%、整合 |
| FCGR3A Mono | 181 | 7% | 非古典単球、整合 |
| NK cell | 155 | 6% | 末梢血 5-15%、整合 |
→ 「健常人 PBMC として、文献記述と矛盾しない構成比が得られた」。パイプラインは正しく動いている、と上司に報告できる根拠。
左の塊 = リンパ球(B、T、NK)、右の塊 = 単球。免疫学的に妥当な配置。アノテーションは既知マーカー(IL7R、CD79A、GNLY 等)で自動スコアリング、「研究者は判断者、AI は実装者」を最後まで貫いた。
成果 2:バルクでは絶対見えない発見 — CD8 T 内に MAIT 細胞が混入していた
ここが scRNA-seq の真価です。
別の自動分類器(CellTypist、98 免疫細胞型を識別する pre-trained モデル)を当てると、CD8 T クラスタの内訳が:
- MAIT 細胞 33%
- NK様 32%
- Cytotoxic T 22%
→ 「CD8 T」と一括りにしていたクラスタに、機能的に違う 3 種類が混ざっていた。
MAIT 細胞は末梢血の数 % しか存在しない稀少集団。バルク RNA-seq では平均化されて完全に埋もれる。scRNA-seq + 自動分類器 で初めて浮かび上がる集団です。
「古典の rule-based(マーカー手動)」は粗いが解釈しやすい、「自動分類器」は細粒度だが zero-shot 誤分類リスクあり。両方走らせて食い違いに目を凝らすと、生物学的な発見が浮上する(MAIT 細胞の存在を示唆)。「古典 + AI のハイブリッドが現実解」というのは机上の話ではなく、ベンチで 1 時間追加すれば見える結論でした。
成果 3:細胞型ごとに振る舞いが違う — B cell の doublet 偏り
Scrublet で 2 細胞混入(doublet)を検出すると、全体 1.34%(35 / 2,611)に対し:
- B cell クラスタだけ 4.65%(他細胞型の 51 倍)
→ B 細胞は他細胞種と doublet を作りやすい(細胞接着特性、採取手順依存)。実験プロトコル側にフィードバックできる情報。Scanpy の数字は、自分で実験してないと気づかないラボワーク特有のクセを教えてくれる。
この成果は、何に応用できるか
PBMC 3k はデモですが、得たパイプラインはそのまま使えます:
- 患者検体への移植:健常 vs 疾患群の比較で、細胞集団の崩れ(CD4:CD8 比、MAIT 増減、B cell 異常)を 疾患指標として検出
- 治療応答研究:治療前後で「どの細胞集団が応答したか」を特定
- 稀少集団の発見:数 % の MAIT のような集団を見落とさず捉える設計が、今回のデモで確立した
→ 4 時間のデモが、研究室の解析資産になる。
「scRNA-seq の解析、頼まれて夜に開いて 5 分で挫折した」あの私が、4 時間で PBMC の典型結果 + 研究応用への接続点 を出せる状態になっていた。Seurat / Scanpy の公式チュートリアルで何時間もかけて学ぶ流れを、AI と一緒なら 頭の中の判断ロジック側だけ集中して 走破できる。
ここで気づいたんです。
「実は、研究者がやるのは判断だけでよかったんだ」
正直に言うと、scRNA-seq 解析は コーディングが本質ではないんです。Scanpy の関数名を覚えても、解析が「正しく」なるわけではない。
研究者の本当の仕事は判断:
- このデータは何の組織か?(→ 閾値、マーカーセット、解像度のすべての判断材料)
- 「クラスタリング解像度 0.5」で 6 つに分けるか、もっと細かく分けるか?(→ 生物学的に意味のある粒度)
- このマーカー遺伝子(IL7R, CD79A, ...)で自動アノテーションした結果が 生物学的に妥当か?(→ 文献照合と直感的判断)
- doublet が混入していそうか?(→ 別ツールが必要)
- このクラスターは生物学的に意味があるか?(→ マーカー遺伝子と既知文献で照合)
- このパス率は健全か?(→ 60% を切ったら何かおかしい)
これら 判断は AI には完全には任せられない。研究者の生物学的知識・実験背景・組織理解が要る。
逆に、関数の使い方・閾値の自動計算・図の生成・コード全体の構成 — これらは AI に任せられる。
→ 「研究者は判断者、AI は実装者」。これが理解できると、研究室の上司にも説明しやすくなります。
上司への説明、こうしました
「scRNA-seq の QC を完了させました」と伝えるとき、こう説明しました:
- 公開データ(PBMC 3k)で、まず動く形を作りました
- 細胞 2,700 個のうち、低品質 89 個を AI に提案された閾値で除外しました
- 閾値はデータに合わせて自動計算するロジック(MAD ベース)を採用、組織依存性に強いです
- プロットを 3 種類見て、生物学的に妥当な分布だと確認しました
- うちの研究室データでも、同じパイプラインで動かせます。違いは組織の特性で、心筋ならミトコンドリア閾値を変える等の調整が必要です
PI の反応: 「ちゃんと考えて回してるね」
— ここに来るまで 4 時間。「scRNA-seq できます」と言える状態を、4 時間で作れるんです。
4 時間で何を組んだのか(超駆け足)
詳細は別の記事で(後述)、ここでは 4 工程だけ:
- 環境構築(WSL Ubuntu + Pixi、初回 1 時間)
-
データ取得(
sc.datasets.pbmc3k()の 1 行) - QC スクリプト(AI に依頼、結果のレビュー、合計 1.5 時間)
- 図と数値の解釈(自分で考える、1.5 時間)
実装コードは AI が書いてくれます。例えば、「ミトコンドリア比率の閾値はデータから自動算出して」と AI に頼むと、こんなロジックを返してきます:
# AI が書いた閾値ロジックの一部
def mad_bounds(x, n_mad=5, log_transform=False):
arr = np.log1p(x) if log_transform else np.asarray(x)
med = np.median(arr); mad = np.median(np.abs(arr - med))
lo, hi = med - n_mad*mad, med + n_mad*mad
return (np.expm1(lo), np.expm1(hi)) if log_transform else (lo, hi)
→ 「これは何のロジックか」「なぜこの設計か」を AI に説明させて、自分は判断するだけ。
あなたが、明日から踏み出すには
ここまで読んで、「自分にもできそう」と思えたなら半分勝ちです。
実は、研究者がドライ解析を始めるときの 最大の壁は「これは難しすぎる」という心理的バリア です。そこを越えれば、後は手順とパターンの問題です。
自分のデータで実際に動かしたい方へ
私(著者)は、ウェット研究者向けの個別オーダーメイド伴走サポート をココナラで提供しています。
- 過去 21 件の伴走実績
- メッセージ無制限の Q&A
- データの解析委託も対応(9,000-30,000 円)
- 専用業者の数十万円より、はるかに低い負担で「自分で理解できる」状態に伴走
**「scRNA-seq、自分の研究データで動かしたい」「上司に説明できる状態にしたい」**方は、まずメッセージで相談を:
もっと体系的に学びたい方へ
実装の 0 から 100 まで をすべて解説した詳細記事(本書第6章)を執筆中です。
- WSL / Pixi の環境構築から
- Scanpy の各関数の意味
- MAD ロジックの詳細実装
- 組織別の推奨閾値表
- 失敗回避チェックリスト
- 論文 Methods に書ける文言テンプレ
→ 公開予定
研究室・企業向け
製薬R&D / アカデミア研究室向けに、ドライ解析環境構築 + 研究員向け研修 + カスタムスキル開発を提供します(月 10-30 万円 / 期間 3-6 ヶ月)。
→ 準備中
著者について
学部はバイオインフォマティクス、AIコンサル 3 年目。学生時代に Scanpy のチュートリアルを 5 分で閉じた経験があり、その後の独学と試行錯誤で「研究者は判断者、AI は実装者」というスタイルに辿り着きました。
同じ道を歩むあなたを、できる限り早く「上司に説明できる状態」へ伴走するのが私の仕事です。
一読いただき、ありがとうございました
- ❤️ 共感した方は、記事に「いいね」 or X でシェアしていただけると嬉しいです
- 💬 「自分はこんな状況で詰まっている」という方はコメント or DM へどうぞ
- 📬 ニュースレター登録(無料)で、続編を見逃さずに
— 2026 年も、あなたの研究が、もっと早く・もっと自由に進みますように。


