はじめに
2026年7月15日、元OpenAI CTOのMira Murati氏が率いるThinking Machines Labから、初の自社開発モデル「Inkling」が公開されました。オープンウェイトのマルチモーダルLLMで、公開直後からかなり話題になっています。
以前 Sakana AIについて調べた記事 を書きましたが、今回も同じノリで「まず調べて、その後に実際に触ってみる」の二本立てでいきます。前半は公式発表ベースの情報整理、後半は無料公開中の「Inkling Playground」を触ってみた体験レポートです。
Inklingとは何か
開発元:Thinking Machines Lab
Thinking Machines Labは、ChatGPTの開発を主導した元OpenAI CTOのMira Murati氏が2025年に設立したAIスタートアップです。約18ヶ月のステルス期間を経て、満を持して出してきた初のモデルがInklingです。
同社の戦略は「万能な完成品モデルを売る」のではなく、「各組織が自分用に調整するための出発点となるモデルを提供する」という思想を掲げています。Inklingはその思想を体現したモデルで、同社のファインチューニング基盤「Tinker」で自由にカスタマイズすることが前提の設計になっています。
AIに例えをお願いしたら以下のように答えてくれました。
例えるなら、OpenAIやAnthropicが「完成したお弁当」を売っているのに対し、Thinking Machinesは「下ごしらえ済みのミールキット」を配っているイメージです。味付け(ファインチューニング)は各社が自分の好みに合わせてどうぞ、という発想ですね。
なるほど。
モデルの基本スペック
公式発表から主要スペックを整理します。
| 項目 | 内容 |
|---|---|
| アーキテクチャ | Mixture-of-Experts (MoE) Transformer |
| 総パラメータ数 | 975B(9,750億) |
| アクティブパラメータ数 | 41B(410億) |
| コンテキスト長 | 最大100万トークン |
| 事前学習データ | テキスト・画像・音声・動画を含む45兆トークン |
| 対応入力 | テキスト・画像・音声をネイティブ推論 |
| ライセンス | オープンウェイト(Hugging Faceで重み公開) |
| 軽量版 | Inkling-Small(総276B / アクティブ12B、プレビュー中) |
MoEって何?(例え話)
「総パラメータ975Bなのにアクティブは41B」というのがMoE(エキスパート混合)の特徴です。これもAIに例えてもらいました。
例えるなら、975人の専門家を抱える巨大なコンサル会社のようなものです。質問が来るたびに全員が会議室に集まるのではなく、その質問に関係のある41人だけが招集されます。会社全体としては膨大な知識を持ちつつ、1回の相談にかかるコスト(計算量)は41人分で済む、というわけです。
コンテキスト100万トークンの感覚
Gemini並みですね。
「ネイティブマルチモーダル」の意味
テキストで学習したモデルに後から画像認識を接ぎ木したのではなく、最初からテキスト・画像・音声・動画を混ぜて事前学習しています。
注目機能その1:Thinking Effort(思考量の制御)
Inklingの一番の特徴は、推論時に「どれだけ深く考えるか」を0.2〜0.99の範囲で数値指定できることです。思考量を上げれば精度が上がり、下げればトークン消費と応答時間が減ります。
公式によると、コーディング評価「Terminal Bench 2.1」において、NVIDIAのNemotron 3 Ultraと同等のスコアを約1/3のトークン消費で達成したとのことです。
注目機能その2:キャリブレーション(「わからない」と言える)
Inklingは「不確実なときは推測せず、不確実だと表明する」よう訓練されています。予測精度を測る「ForecastBench」(Brier Index)では61.1を記録し、GPT-5.5(59.1)やClaude Opus 4.8(54.6)を上回ったと報告されています。
分からないと答えてくれるのは、個人的にありがたいですね。
Geminiとか割と平気で嘘つくので・・・笑
主要ベンチマーク
公式発表のベンチマーク結果を抜粋します。
| ベンチマーク | スコア | 備考 |
|---|---|---|
| AIME 2026(数学) | 97.1% | |
| SWE-Bench Verified(コーディング) | 77.6% | |
| HLE(Humanity's Last Exam、推論) | 46.0% | |
| ForecastBench(予測・Brier Index) | 61.1 | GPT-5.5: 59.1、Claude Opus 4.8: 54.6 |
| Design Arena(Web開発) | 1257 | 業界上位 |
ベンチマークはあくまで開発元の自己申告です。第三者による再現評価はこれから出てくる段階なので、鵜呑みにせず「触って確かめる」のが今回の後半パートの目的でもあります。
どんなシーンで使われる想定?
公式発表やHugging Faceのドキュメントを読むと、Inklingは「チャットで何でも答える万能アシスタント」というより、組織が自分たちの用途に合わせて作り込むための素材として位置づけられています。想定されている利用シーンを整理すると:
- ドメイン適応(ファインチューニング前提の業務特化AI): 公式ドキュメントに "intended for domain adaptation via fine-tuning" と明記。自社の業務データや専門領域に合わせてTinkerで調整して使うのが本来の姿。オープンウェイトなのでオンプレ運用もでき、機密データを外部APIに出せない業界(金融・医療・官公庁など)でも選択肢になります
- 文書処理・音声タスク: 公式が "document processing or audio tasks" に特に適しているとしています。帳票や図面の読み取り、議事録・コールセンター音声の処理といった、マルチモーダル入力が活きる業務です
- エージェント用途: コーディングエージェントや、MCP(Model Context Protocol)対応のツール連携を使った業務エージェント。SWE-Bench Verified 77.6%というスコアもこの文脈で見ると納得です
- 予測・意思決定支援: 「わからないことをわからないと言える」キャリブレーション特性は、市場予測やリスク評価のように過信が事故につながる領域でこそ効きます
- 大量処理のコスト最適化: Thinking Effortを絞れば、大量のリクエストを捌くバッチ処理やリアルタイム応答では安く速く、難問だけ深く考えさせる、といった使い分けができます
要するに「そのまま使う」より「育てて組み込む」モデルです。
入手方法・利用方法
- 重みのダウンロード: Hugging Faceで公開(BF16版に加え、NVIDIA Blackwell向けのNVFP4版もあり)。transformersでday-0サポート、vLLMやSGLangなど主要推論エンジンにも対応
- API利用: Together AI、Fireworks、Modal、Databricks、Basetenなどが公開初日から提供
- ブラウザで試す: Tinkerコンソール内の「Inkling Playground」が期間限定で無料公開中(Web検索統合のチャットUI)
- ファインチューニング: 同社のTinkerプラットフォームで可能(現在50%割引とのこと)
Playgroundで触ってみた
ここからが本番です。当初はマルチモーダルモデルらしく画像・音声入力も試すつもりだったのですが……
執筆時点(2026年7月)では、Playgroundの画像アップロードと音声認識は「Coming soon」となっており利用できませんでした。モデル自体はネイティブマルチモーダルですが、Playground側のUIがまだ追いついていないようです。今回はチャットベースでの検証を行います。
Playgroundは期間限定無料です。試すなら早めをおすすめします(無料期間の終了日は執筆時点で明示されていませんでした)。
アクセス手順
Thinking Machines公式サイト から「Tinker」に進み、Sign upします。登録フォームは日本語表示で、Google / GitHub / Appleアカウントでも登録できます。
登録するとTinkerコンソールのHomeに「Open weights, ready to tinker.」というInklingの案内が出るので、「Try in Playground」から起動します。
Playgroundの画面はこんな感じです。
右ペインに設定が集まっています。
- Reasoning effort(=Thinking Effort)はスライダーで、None / Min / Low / Medium / High / XHigh の段階と数値(0.2〜0.99)が表示される
- Web search のON/OFFトグルがある(回答中にWeb検索させるか)
-
システムプロンプトが丸見え。中身を読むと
Knowledge cutoff: April 2026、Context window: 256,000 tokensと書かれています。公称の100万トークンに対してPlayground上は256Kトークン運用のようです - 画面上部に「Chats are never stored.」(チャットは保存されない)と明記されている
システムプロンプトを隠さず見せてくれるのは、オープンさを掲げる同社らしくて好印象でした。
検証1:日本語での対話(まずは自己紹介)
海外の記事では日本語性能に触れているものが見当たらなかったので、まず普通に日本語で会話してみます。「こんにちは。あなたについて教えてください。」と聞いてみました。
返ってきた自己紹介の要点はこうです(Reasoning effortはHigh 0.9)。
- 「私はInkling(インクリング)というAIモデルで、Thinking Machines Labによって開発された、同社初のオープンウェイトモデルです」
- 知識のカットオフは2026年4月
- コンテキストウィンドウは256,000トークン(トレーニング時には最大100万トークンまで対応)
- 「テキスト、画像、音声をネイティブに処理できるマルチモーダルモデルですが、このプラットフォームでは画像や音声の入力には対応していないため、それらを直接処理することはできません」
自分のスペックも制約も正確に把握していて、聞いてもいないのに「このPlaygroundでは画像・音声は使えません」と正直に申告してきました。冒頭の「Coming soon」の件をモデル自身が裏付けてくれた形です。日本語も文法・語彙ともに自然で、違和感はありませんでした。
応答速度も他の主要AIエージェントと特に変わらないものでした。
検証2:日本語の理解を試す「破天荒」(+Web検索の動きも見えた)
次に、日本語ネイティブでないと引っかかりやすいネタとして「破天荒」の意味を聞いてみました。この言葉、本来は「前人未到のことを初めて成し遂げる」という称賛の言葉ですが、「乱暴・型破り」の意味で誤用されがちです。
結果は文句なしでした。本来の意味を正しく説明した上で、語源(中国・唐代の荊州で科挙合格者が出ず「天荒」と呼ばれ、劉蛻が初合格して「天荒を破った」)まで正確に出してきました。
さらに「しばしば誤った使い方をされます。どのような誤用がされているのか例を用いて教えてください」と続けると、文化庁の調査に触れつつ、誤用パターンを例文つきで整理し、最後は正しい使い方と誤用の対比表まで作ってくれました。
このときの挙動で、Web searchをONにしていたところ、思考過程(英語)で「検索結果で裏を取ってから答えよう」と判断し、日本語の語源解説サイトを開いて確認してから回答していました。エージェント的なツール使用が思考の中に自然に組み込まれている感じです。
比較としてChatGPTにも同じ質問を投げてみました。こちらも本来の意味と語源は正しく説明しましたが、「型破り・常識にとらわれない」という用法を「現在よく使われる意味」として比較的中立に紹介したのに対し、Inklingは誤用と明確に位置づけて解説する構成でした。
ChatGPTは誤用について聞いてない段階で、誤用についても言及してきました。
この辺はエージェントの差なのかな。
回答の仕方は使う側の好みかなと。
検証3:バグ探し × Thinking Effortの効き具合
本命の検証です。SWE-Bench Verified 77.6%というスコアの実力を、チャットでできる範囲で確かめます。ECサイトの在庫・注文管理を模したPythonコード(約250行)に、難易度の異なる5つのバグを意図的に仕込み、Reasoning effortを変えて2回、同じプロンプトで精査を依頼しました。
仕込んだバグは以下の5つです。
| 難易度 | バグ | 種別 |
|---|---|---|
| 初級 ★ | 割引計算の対象ミス(小計でなく先頭商品の単価に割引率を乗算) | ロジックエラー |
| 中級 ★★ | ミュータブルデフォルト引数(cart: list = []) |
Python特有の落とし穴 |
| 上級 ★★★ | スナップショットが浅いコピー(copy.copy) |
データ整合性 |
| プロ級 ★★★★ | 整数丸めの順序依存(floorを明細ごと/一括で二重計算して比較) |
数値計算・間欠的バグ |
| 理不尽級 ★★★★★ |
Unicodeホモグリフ(tаx_rateの「а」がキリル文字で別変数) |
視覚的に検出ほぼ不可能 |
プロンプトはこうです。バグの数も種類も教えていません。
以下貼り付けるコードを実行したところ、期待した結果が得られませんでした。
どこが間違っているか分からないため、精査してください。
すべてのバグを特定し、それぞれについて以下の形式で報告してください:
- バグの場所(行番号またはメソッド名)
- バグの内容
- 修正方法
- 影響の深刻度(低/中/高/致命的)
結果
| Reasoning effort | 検出結果 | 応答の特徴 |
|---|---|---|
| 低(0.2) | 5/5 全検出 | 簡潔な箇条書き。修正方針も的確 |
| 高(0.9) | 5/5 全検出 + 追加指摘2件 | 行番号・再現例・修正優先順位つきの詳細レポート |
正直、結果には驚きました。キリル文字のホモグリフ(見た目ではラテン文字と完全に同一)を、effort最低の0.2でも一発で見つけてきたのです。人間のコードレビューではまず検出できない類のバグである「理不尽級」も余裕の検出でした。
effortによる差は「見つけられるか」ではなく「報告の深さ」に出ました。0.2は要点だけを淡々と列挙するのに対し、0.9は各バグに再現例と影響分析をつけ、最後に修正優先順位まで提示してきます。さらに0.9では、こちらが仕込んでいない「返金処理と売上レポートが注文割引を考慮していない」という整合性の指摘が2件追加されました。仕込んだバグではないものの、コード全体を通して読むと確かに筋の通った指摘で、単なる過剰検出とも言い切れません。
コード自体は横着してAIに書かせたので、過剰とも言い切れないところですね。
今回試せなかったこと
- 画像・音声入力: 冒頭のとおりPlaygroundでは「Coming soon」。対応されたら再検証したいところです
- キャリブレーション(「わからない」と言えるか)の意地悪テスト: 分かりません。となるような質問を考えられなかったです。存在しない情報の質問や、未来の情報などを聞いてみましたが、「そんなのないよ」や「未来のことなので答えられないよ」って返されました。これだけでも成果と言えば成果かも。
まとめ
公開翌日のInklingをPlaygroundで触ってみた結論です。
- 日本語は実用レベル。自己紹介から「破天荒」の語源・誤用解説まで、文法も知識も破綻なし。日本語性能を心配する必要は今のところなさそうです
- コード読解は本物。仕込んだ5つのバグを全検出、しかもUnicodeホモグリフをeffort最低でも見抜いてきたのは衝撃でした。コードレビューの相棒としては十分すぎる実力です
- Thinking Effortの効き方は「検出力」より「報告の深さ」。低effortでも精度が大きく落ちないなら、普段は低く・ここぞで高く、という使い分けは現実的だと感じました
- マルチモーダルは「Coming soon」待ち。モデル自体はネイティブ対応なので、Playground側のUIが追いつくのを待ちたいところです
「そのまま使う」より「育てて組み込む」思想のモデルですが、素の状態でもこれだけ動くなら、カスタマイズもそこまで苦労せずにできそうに思いました。今度は自分でカスタマイズして何かに特化したモデルを作ってみようかと思います。無料期間のうちに、ぜひ一度触ってみてください。










