1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

元DeepMind曹原との対話:AI for Science爆発、新しい時代が到来した

1
Posted at

Jeff Dean が Google を辞めて作った会社の名前は Discovery Loop という。

Lab でもない。AI でもない。Loop だ。

その発表の翌日に収録された、109 分のインタビューを見た。相手は曹原、元 Google DeepMind のシニアリサーチサイエンティストで、今は Unreasonable Labs AI の共同創業者。表向きは AI for Science の話なのだが、実際に答えているのは自分がここ数週間つまずいていた別の問いだった——同じ loop なのに、なぜ速く回るものと、どう押しても動かないものがあるのか。

ボトルネックは賢さではない

技術的にどこが一番難しいかと聞かれて、曹原は迷わず答える。検証(verification) だ。

論証は coding のほうから逆算して進む。なぜ今 AI の中で coding agent が最も成功した商業ループで、指数関数的に伸びているのか。閉じているからだ。プログラムを書けばその場で検証できる。待たなくていい、外部の誰かも要らない。検証できるからこそ、ユーザーはタスク全体を渡す気になる。

科学にはそれがない。検証が物理世界にあるからだ。

そして、頭から離れなくなった一文。

理想的に一分で一回の実験検証が得られるなら、この問題は解ける。

無限にデータを生成して、コードや数学と同じようにそのまま学習させればいい。

つまり科学を止めているのは、AI が賢くないことではない。フィードバックが遅くて高いことだ。曹原はさらに踏み込む。宇宙の基本要素は情報・物質・エネルギーであり、AI for math も coding も情報の層にいる。AI for Science が出す仮説もシミュレーションも、まだ情報の層だ。しかし科学をやるなら物質の層まで降りなければならない。湿式実験をやらなければならない。

これは科学の話ではなく、会社の話でもある

事業が回る速さは、モデルの強さでは決まらない。検証がどれだけ速く、どれだけ安いかで決まる。

自分たちの例で言う。Flatkey のゲートウェイのコードはほぼ全部 Claude が書いている。一行変えて、テストを回して、ダッシュボードを見れば、数分で正否が分かる。だから agent に大きく触らせている。一方、広告運用のラインは、クリエイティブ一本の良し悪しを判定するのに三日分のデータが要る。同じモデル、同じ agent で、反復速度は二桁違う。

広告側の agent が馬鹿なのではない。広告側の検証が高いのだ。

品質ゲートは loop の第四層だと以前書いた。この回で修正されたのは、その層の役割の理解だ。ゴミを止めるフィルタであるだけでなく、そのループの回転数を決めている歯車でもある。

検証を情報の層に引き戻す二つの道

ボトルネックがそこにあるなら、打ち手は二つしかない。曹原は両方を挙げた。

一つは物理実験の自動化。 手順が標準的なら人手をロボットに置き換える。いわゆる AutoLab、Cloud Lab で、API を叩けば遠隔のロボットがピペットを動かす。彼はローレンス・バークレー国立研究所との A-Lab を挙げ、司会が数字を補う——17 日で 353 回の実験、57 の目標のうち 36 を達成。より新しい例は OpenAI が GPT-5 と Ginkgo Bioworks(ケンブリッジのロボット実験施設)を組み合わせたもので、GPT が新しいタンパク質を作る配合を提案し、ロボットが実験し、結果が戻る。彼はこれを現時点で最も説得力のある閉ループ実験だと言う。

もう一つは実験の回数を減らすこと。 ボトルネックが物理実験なら、一回一回を当てにいくしかない。以前は要求を満たすタンパク質構造に十回の実験が必要だったなら、二回で届くところまで知能を上げる。そしてその要求は具体的な能力に落ちる——過去の失敗の履歴を分析して、次の一手をより良く選ぶ能力だ。

だから彼はこの分野を AI for Science ではなく AI and Science と呼ぶべきだと言う。十分強い AI に科学を応用として渡すのではなく、AI 自身の能力と科学の能力を同時に伸ばす。さらに一歩進めて、科学は AI の応用ではなく AI 自身の発展の触媒だとも言う。これほど難しい問題を解ける模型なら、他の領域でも今より強いはずだ、と。

証明の過剰

司会がテレンス・タオの最近の言い方を持ち出す。数学は 証明が希少な時代 から 証明が過剰な時代 に入った。

絵は具体的だ。未解決問題を集めたサイトでは、各問題の下に AI が生成した解答が数十件積み上がっている。そして誰一人、人間の専門家がそれを引き受けて検証しようとしない。 すでに答えが出ている難問は多いのかもしれない。人間の側に時間も帯域も気力も、あるいは能力もない。

曹原が足す半分のほうが重い。結果が正しいことと、正しいことは同じではない。 自動検証が「成り立つ」と言っても、人はそれを理解して評価しなければならない。人には価値判断がある。

そして、ソフトウェアを作る人なら誰でも分かる例が来る。今 AI は確かに大量のコードを書くし、その多くは正しい。それでいてコードを保守するコストと時間はむしろ上がった。 エンジニアが読めないからだ。結果は合っているのだろうが、バグが出たとき、まず読解から始めなければ場所すら分からない。

では AI に debug させれば?——できる、ただしその反復でコードはさらに散らかる。言語モデルは確率的な機械であり、同じタスクを二度回せば違うコードが出る。この不確実性が信頼の問題になる。

結論は率直だ。信頼性と説明可能性が低い AI は、経済全体の運用コストを上げる。 もし AI が経済的に価値のある活動の 80% をこなせるようになったとして、その一つ一つに人間の検証が必要なら、やらせないほうがマシだ。

リポジトリに溜まったレビューされない PR も、フォルダに積まれた誰も読まない AI の原稿も、同じ現象だ。審査だけがボトルネックのとき、産出を増やすのは純粋な無駄になる。

ピアノを弾くロボット

「結果が正しければ十分か」に続いて、曹原はこの回で最良の比喩を出す。

ピアノのコンサートに行くとする。そのピアノはロボットが弾きます、打鍵の強さも長さも作曲家の指定どおり完璧です、と私が保証する。

それでも聴きに行くだろうか。

司会は行かないと答える。

音色が完璧でも行かないかもしれない、と彼は言う。だがピアニストが弾くなら行く。聴きたいのは結果でも音色でもなく、その人が自発的に出している情動——共鳴するものだからだ。

科学に写す。証明の結果はもちろん重要だ。しかし論証の過程を検めて、面白いものが何もない、解釈できるものが何もないなら、どれだけ正しくても数学者にとってはロボットのピアノでしかない。

人間に理解できない発見は無意味かと問われて、彼の答えは抑制的だ。部分的な意味——道具としての意味はある。 例に挙げるのは四色定理。1970 年代に計算機で証明された。結論は確実に正しく、地図を塗るのに使える。だが証明はほぼ列挙で、新しい深い洞察は生まなかった。価値があるかどうかは、道具として見るのか、認識として見るのかで完全に変わる。

最後の一マイルは、新しい概念を抽象すること

彼は人間の知識生産を三段に分ける。

  1. 知覚。 人が台車を押して、台車が動く。これは表面の現象にすぎない。
  2. 概念。 そこから「力」を取り出し、F と記号化する。
  3. 形式化。 F = ma。

今の AI は既存の表現空間の中で、既にある概念を組み替え、探索している。曹原はそれが人間よりはるかに効率的で、大きな部分を解けることは認める。だが新しい概念を作ってはいない。

AlphaGo の 37 手目は発見か。発見だ、間違いなく新しい、と彼は言う。ただしその発見の様式は既存の内部表現を並べ替え、稀なパスをサンプリングしたことだ。発見であって、新しい概念の創造ではない。

反例のほうが鋭い。数学を一度も学習していない言語モデルを想像する。三羽の鵞鳥、四羽の鳥、五本の木を見た原始人は 「数」 という概念を抽象でき、その概念はあらゆる対象に適用できる。同じ感覚入力を AI に与えても、「数」は出てこない。

だから——概念の抽象化は AGI の最後の一マイルであり、その一マイルは永遠に越えられないかもしれない。 彼はこの過程がチューリング計算可能かどうかすら疑っており、それが人間の脳が根底でチューリング機械と等価ではないと考える理由でもある。

現実的なチェックが一つ付く。研究に AI を使うかと問われたノーベル賞受賞者の Jennifer Doudna は、使う、と答えた上でこう言った——AI が出した提案の中に、私たちが知らなかったものは一つもなかった。 普段見落としているものはあったが、どれも既存の論文にあるものだった。

agent プロダクトを作っている人は、この一文を机の上に貼っておいたほうがいい。

持ち帰った三つ

一つ目。検証コストは、受け入れる天気ではなく、設計できる変数として扱う。 ループの速度が検証で決まるなら、事業が動かないときの正しい問いは「もっと強いモデルを試す」ではなく「これを三日から三時間にできないか」だ。自動実験室がやっているのはまさにそれで、AI を賢くするのではなく、物理世界のフィードバックを情報の層へ引き戻している。普通の会社に訳せば——モデルを替える前に、監視を直し、A/B を直し、段階的リリースを直す。これは優先順位を付けられる判断であって、正しいだけの標語ではない。

二つ目。証明の過剰は、AI を使っているどの会社でもすでに起きている。誰もそう呼んでいないだけだ。 数学問題の下の未検証の解答と、リポジトリのレビューされない PR は同じ出来事だ。自分たちの対処は敵対的なゲートで、ある agent に別の agent の出力の粗を探させ、粗が出なければ人間に回す。だがこれはボトルネックを一段後ろに押しただけで、消してはいない。何段まで押せるのかは、まだ分からない。

三つ目。「結果が正しければ正しいわけではない」は採用基準になる。 ピアノの比喩は美学の話に聞こえるが、実際に言っているのは、結果の外側——過程の中に理解可能で再利用可能な洞察があるかどうか自体に価値がある、ということだ。AI が結果を出したあと、人に残る仕事は結果の正誤の再確認ではない。計算はあちらのほうが正確だ。人に残るのは、その結果が持つに値するかを判断することだ。 産出量が爆発するほど、それだけが値上がりし続ける。

会社の名前に戻る。四人が Google を出て、AI に自分で科学をやらせる会社を作り、名前を Discovery Loop にした。

Lab でもなく、AI でもなく、Loop。

偶然だとは思わない。


出典:2026-08-15 公開の動画ポッドキャスト(約 1 時間 49 分)。ゲストは曹原、元 Google DeepMind シニアリサーチサイエンティスト、Unreasonable Labs AI 共同創業者。上記で曹原に帰属させた主張はすべて同回における本人の見解。テレンス・タオの整理、および A-Lab の数字(17 日で 353 回、57 目標中 36 達成)は司会による。冒頭ナレーションで触れられた OpenAI Astra と未公開の研究版 Claude の数字は本稿では独自検証していない(同回で曹原自身が Astra の結果に議論があると述べている)。Doudna の発言は曹原による伝聞。筆者自身のゲートウェイと広告運用に関する記述は一次情報。

1
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?