0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

『scRNA-seq できる?』と 聞かれて固まった私が、4 時間で上司に説明できるようになるまで

0
Posted at

取組のきっかけ

「うちにも scRNA-seq のデータが来てるんだけど、解析できる人いなくて。君、できる?」

PI からそう聞かれた瞬間、頭の中で同時に走った思考:

  • 「scRNA-seq って細胞単位の RNA-seq だっけ…?」
  • 「Scanpy って聞いたことある、Python の何か」
  • 「閾値とか正規化とか、論文 Methods で見たけど、自分で書ける気がしない」

「ちょっと調べてやってみます」と返事をして、その日の夜に Scanpy のチュートリアルを開きました。英語、関数名がずらり、サンプルコードが並ぶ — 5 分で閉じました。


あなたにも、心当たりがありませんか?

過去 1 年、私は同じような苦しみを抱えるウェット研究者を 20名ほど 伴走サポートしてきました(ココナラで個別相談を提供しています)。最初の相談メッセージのほぼ全員が、似たことを書いてきます:

  • 「バイオインフォの解析を頼まれたが、何から始めればいいか分からない」
  • 「Scanpy をインストールしようとしてエラーで詰まった」
  • 「閾値の決め方、論文ごとに違う」
  • 「専用業者に頼むと数十万、研究費が足りない」
  • 「自分で勉強しろと言われても、参考書を読み切る時間がない」

そこ、私も詰まりました。学部時代も、社会人になってからも。

そもそも、なぜ scRNA-seq を解析するのか

教授が「scRNA-seq できる?」と聞いてきた、その裏には研究的な問いがあります。

バルク RNA-seq は「組織全体を 1 本のチューブに溶かして測る」技術。平均値しか見えない。
一方 scRNA-seq は「組織を細胞 1 個ずつバラして測る」技術。これで初めて見えるのが:

  • 組織内のヘテロ性:同じ "T 細胞" でも CD4 / CD8 / 制御性 / 細胞傷害性 / 疲弊型 が混在
  • 稀少細胞集団:全体の数 % しかいない MAIT 細胞・幹細胞様集団・特殊サブ型
  • 状態変化:同じ細胞型でも活性化・静止・アポトーシス前 で発現が変わる
  • 疾患・治療応答の細胞レベルの違い:健常 vs 患者、治療前 vs 後 を細胞集団ごとに比較

「うちのサンプル(患者検体・疾患モデル・治療応答)を、細胞集団ごとにプロファイリングしたい」ということ。私の役目は、まずその設計図をパイプラインとして組むこと。

今回は学習デモとして公開データの PBMC 3k(健常人の末梢血単核細胞) を使います。これは:

  • 文献で正解(主要 6-7 細胞型の構成、典型的な CD4:CD8 比)が確立している
  • 結果が "妥当か" を即座に検証できる
  • 同じパイプラインを患者検体に切り替えれば、研究本番に直結する

「デモでパイプラインを完成 → 自施設データに移植」が、研究室の解析環境を立ち上げる最短ルート

4 時間で得た「研究成果」 — デモから見えた 3 つのこと

結論から書きます。下記は scRNA-seq 解析の最初の関門「QC(細胞品質チェック)」 + クラスタリング + 細胞型アノテーションを、AI と協働で 4 時間で完了させた結果です。

まず数値:QC が通った細胞

やったこと 数値結果
PBMC 3k(末梢血単核細胞、入門用標準データ)取得 2,700 細胞 × 32,738 遺伝子
QC 指標を計算 UMI 数 / 遺伝子数 / ミトコンドリア比率
閾値を データに教えてもらった(MAD ベース) 自動算出された 3 つの値
フィルタを通した 2,611 細胞 通過(96.7%)

そして得られた QC の図はこちら:

QC 指標 3 種(UMI数 / 遺伝子数 / ミトコンドリア比率)の violin プロット

縦軸は各 QC 指標、上に長い尾は「2 細胞が同じ液滴に入った "doublet" 候補」、下に長い尾は「死細胞・空ドロップレット候補」。

total_counts × n_genes_by_counts、色 = pct_counts_mt

緑/黄色(ミトコンドリア比率高)が左下に集中している = 死細胞の典型パターン。MAD ベースの cutoff(赤・橙の点線)が、それらを除外する位置に自動配置されている。

この図を見ながら、何を判断したか:

  • 「PBMC は元々ミトコンドリア比率が低い組織だから、median 2% で妥当」
  • 「上に長い尾があるから、高い側を切る閾値が要る」
  • 「データ駆動の MAD は適切に閾値を計算してくれているように見える」

→ 「自分で書いた」のではなく「自分で判断した」。コードを書いたのは AI。

問いと期待

ここからが本番。QC で 2,611 細胞に絞ったあと、研究的な問いを立てます。

  • 問い:PBMC 3k 中の免疫細胞型を分離・同定し、構成比を求める
  • 期待(文献ベース):T 細胞 / B 細胞 / 単球 / NK が主、CD4:CD8 比は健常人で ~2:1 程度

成果 1:主要 6 細胞型を分離、文献と整合

「正規化 → 高変動遺伝子 → PCA → クラスタリング → UMAP → マーカー遺伝子 → 細胞型アノテーション」を AI 駆動で走らせた結果:

6 細胞型に分かれた PBMC の UMAP

細胞型 数 割合 文献ベース妥当性
CD4 T cell 1,104 42% 健常人 PBMC で 30-50% 多い、整合
CD14 Mono 471 18% 単球 10-20%、整合
CD8 T cell 356 14% CD4:CD8 ≈ 3:1、健常人としてやや CD4 寄りだが正常範囲
B cell 344 13% 末梢血 5-15%、整合
FCGR3A Mono 181 7% 非古典単球、整合
NK cell 155 6% 末梢血 5-15%、整合

→ 「健常人 PBMC として、文献記述と矛盾しない構成比が得られた」。パイプラインは正しく動いている、と上司に報告できる根拠。

左の塊 = リンパ球(B、T、NK)、右の塊 = 単球。免疫学的に妥当な配置。アノテーションは既知マーカー(IL7R、CD79A、GNLY 等)で自動スコアリング、「研究者は判断者、AI は実装者」を最後まで貫いた。

成果 2:バルクでは絶対見えない発見 — CD8 T 内に MAIT 細胞が混入していた

ここが scRNA-seq の真価です。

別の自動分類器(CellTypist、98 免疫細胞型を識別する pre-trained モデル)を当てると、CD8 T クラスタの内訳が:

  • MAIT 細胞 33%
  • NK様 32%
  • Cytotoxic T 22%

→ 「CD8 T」と一括りにしていたクラスタに、機能的に違う 3 種類が混ざっていた。

MAIT 細胞は末梢血の数 % しか存在しない稀少集団。バルク RNA-seq では平均化されて完全に埋もれる。scRNA-seq + 自動分類器 で初めて浮かび上がる集団です。

「古典の rule-based(マーカー手動)」は粗いが解釈しやすい、「自動分類器」は細粒度だが zero-shot 誤分類リスクあり。両方走らせて食い違いに目を凝らすと、生物学的な発見が浮上する(MAIT 細胞の存在を示唆)。「古典 + AI のハイブリッドが現実解」というのは机上の話ではなく、ベンチで 1 時間追加すれば見える結論でした。

成果 3:細胞型ごとに振る舞いが違う — B cell の doublet 偏り

Scrublet で 2 細胞混入(doublet)を検出すると、全体 1.34%(35 / 2,611)に対し:

  • B cell クラスタだけ 4.65%(他細胞型の 51 倍)

→ B 細胞は他細胞種と doublet を作りやすい(細胞接着特性、採取手順依存)。実験プロトコル側にフィードバックできる情報。Scanpy の数字は、自分で実験してないと気づかないラボワーク特有のクセを教えてくれる。

この成果は、何に応用できるか

PBMC 3k はデモですが、得たパイプラインはそのまま使えます:

  • 患者検体への移植:健常 vs 疾患群の比較で、細胞集団の崩れ(CD4:CD8 比、MAIT 増減、B cell 異常)を 疾患指標として検出
  • 治療応答研究:治療前後で「どの細胞集団が応答したか」を特定
  • 稀少集団の発見:数 % の MAIT のような集団を見落とさず捉える設計が、今回のデモで確立した

→ 4 時間のデモが、研究室の解析資産になる。

「scRNA-seq の解析、頼まれて夜に開いて 5 分で挫折した」あの私が、4 時間で PBMC の典型結果 + 研究応用への接続点 を出せる状態になっていた。Seurat / Scanpy の公式チュートリアルで何時間もかけて学ぶ流れを、AI と一緒なら 頭の中の判断ロジック側だけ集中して 走破できる。

ここで気づいたんです。



「実は、研究者がやるのは判断だけでよかったんだ」

正直に言うと、scRNA-seq 解析は コーディングが本質ではないんです。Scanpy の関数名を覚えても、解析が「正しく」なるわけではない。

研究者の本当の仕事は判断:

  • このデータは何の組織か?(→ 閾値、マーカーセット、解像度のすべての判断材料)
  • 「クラスタリング解像度 0.5」で 6 つに分けるか、もっと細かく分けるか?(→ 生物学的に意味のある粒度)
  • このマーカー遺伝子(IL7R, CD79A, ...)で自動アノテーションした結果が 生物学的に妥当か?(→ 文献照合と直感的判断)
  • doublet が混入していそうか?(→ 別ツールが必要)
  • このクラスターは生物学的に意味があるか?(→ マーカー遺伝子と既知文献で照合)
  • このパス率は健全か?(→ 60% を切ったら何かおかしい)

これら 判断は AI には完全には任せられない。研究者の生物学的知識・実験背景・組織理解が要る。

逆に、関数の使い方・閾値の自動計算・図の生成・コード全体の構成 — これらは AI に任せられる。

→ 「研究者は判断者、AI は実装者」。これが理解できると、研究室の上司にも説明しやすくなります。


上司への説明、こうしました

「scRNA-seq の QC を完了させました」と伝えるとき、こう説明しました:

  1. 公開データ(PBMC 3k)で、まず動く形を作りました
  2. 細胞 2,700 個のうち、低品質 89 個を AI に提案された閾値で除外しました
  3. 閾値はデータに合わせて自動計算するロジック(MAD ベース)を採用、組織依存性に強いです
  4. プロットを 3 種類見て、生物学的に妥当な分布だと確認しました
  5. うちの研究室データでも、同じパイプラインで動かせます。違いは組織の特性で、心筋ならミトコンドリア閾値を変える等の調整が必要です

PI の反応: 「ちゃんと考えて回してるね」

— ここに来るまで 4 時間。「scRNA-seq できます」と言える状態を、4 時間で作れるんです。


4 時間で何を組んだのか(超駆け足)

詳細は別の記事で(後述)、ここでは 4 工程だけ:

  1. 環境構築(WSL Ubuntu + Pixi、初回 1 時間)
  2. データ取得(sc.datasets.pbmc3k() の 1 行)
  3. QC スクリプト(AI に依頼、結果のレビュー、合計 1.5 時間)
  4. 図と数値の解釈(自分で考える、1.5 時間)

実装コードは AI が書いてくれます。例えば、「ミトコンドリア比率の閾値はデータから自動算出して」と AI に頼むと、こんなロジックを返してきます:

# AI が書いた閾値ロジックの一部
def mad_bounds(x, n_mad=5, log_transform=False):
    arr = np.log1p(x) if log_transform else np.asarray(x)
    med = np.median(arr); mad = np.median(np.abs(arr - med))
    lo, hi = med - n_mad*mad, med + n_mad*mad
    return (np.expm1(lo), np.expm1(hi)) if log_transform else (lo, hi)

→ 「これは何のロジックか」「なぜこの設計か」を AI に説明させて、自分は判断するだけ。


あなたが、明日から踏み出すには

ここまで読んで、「自分にもできそう」と思えたなら半分勝ちです。

実は、研究者がドライ解析を始めるときの 最大の壁は「これは難しすぎる」という心理的バリア です。そこを越えれば、後は手順とパターンの問題です。

自分のデータで実際に動かしたい方へ

私(著者)は、ウェット研究者向けの個別オーダーメイド伴走サポート をココナラで提供しています。

  • 過去 21 件の伴走実績
  • メッセージ無制限の Q&A
  • データの解析委託も対応(9,000-30,000 円)
  • 専用業者の数十万円より、はるかに低い負担で「自分で理解できる」状態に伴走

**「scRNA-seq、自分の研究データで動かしたい」「上司に説明できる状態にしたい」**方は、まずメッセージで相談を:

→ サービスページ(ココナラ)

もっと体系的に学びたい方へ

実装の 0 から 100 まで をすべて解説した詳細記事(本書第6章)を執筆中です。

  • WSL / Pixi の環境構築から
  • Scanpy の各関数の意味
  • MAD ロジックの詳細実装
  • 組織別の推奨閾値表
  • 失敗回避チェックリスト
  • 論文 Methods に書ける文言テンプレ

→ 公開予定

研究室・企業向け

製薬R&D / アカデミア研究室向けに、ドライ解析環境構築 + 研究員向け研修 + カスタムスキル開発を提供します(月 10-30 万円 / 期間 3-6 ヶ月)。

→ 準備中


著者について

学部はバイオインフォマティクス、AIコンサル 3 年目。学生時代に Scanpy のチュートリアルを 5 分で閉じた経験があり、その後の独学と試行錯誤で「研究者は判断者、AI は実装者」というスタイルに辿り着きました。

同じ道を歩むあなたを、できる限り早く「上司に説明できる状態」へ伴走するのが私の仕事です。


一読いただき、ありがとうございました

  • ❤️ 共感した方は、記事に「いいね」 or X でシェアしていただけると嬉しいです
  • 💬 「自分はこんな状況で詰まっている」という方はコメント or DM へどうぞ
  • 📬 ニュースレター登録(無料)で、続編を見逃さずに

— 2026 年も、あなたの研究が、もっと早く・もっと自由に進みますように。

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?