(番組ジングル)
DJミオ:
こんばんは。夜の知性とビートが交差する、ラジオ教育番組 「Midnight AI Groove」。ナビゲーターのDJミオです。
DJレン:
そして相方はDJレン。今夜は、かなり情報量の多いAIニュース回だね。テーマは Anthropicの「Claude Fable 5.1」と「Claude Mythos 5.1」 を中心に、その周辺で起きていた Astra、World Labs Atlas、QwenやGLMなどの動き、Redditでの反応 まで、ぜんぶ整理していきます。
DJミオ:
はい。今日は特に、「モデルが賢いか」だけじゃなくて、
価格、キャッシュ、ルーティング、安全性、企業導入性、サブスク体験、評価の透明性――
そういう“製品としてのAI”をどう見るかが大きなテーマになっています。
DJレン:
では始めましょう。今夜のグルーヴ、一本目。
「Claude Fable 5.1 / Mythos 5.1リリース、その実像」。
1. 何が起きたのか
DJミオ:
まず事実から。Anthropicは、新しいフラッグシップとして
Claude Fable 5.1 と Claude Mythos 5.1 を発表しました。
位置づけとしては、コーディングとナレッジワーク向けの最先端モデルです。
DJレン:
Anthropic側の打ち出し方も印象的で、単に「ベンチマークが良くなりました」じゃないんだよね。
**難しい長期タスクを任せて、自律的に複数ステップ進める“使える自動ワーカー”**として売り出している。
DJミオ:
そう。特にFable 5.1は、
- 自律的で長時間のタスク
- 複雑なマルチステップ作業
- コーディング
-
知的労働全般
に強いと説明されていました。
DJレン:
しかも注目されたのは能力だけじゃなくて、
キャッシュ読み出し価格の大幅引き下げ、
ゼロデータ保持(Zero Data Retention, ZDR)、
Enterprise Frontier Safeguards(EFS) みたいな企業向け管理機能の強化。
つまり「賢いAI」だけでなく、企業の本番運用に置けるAIに寄せてきたわけだ。
2. 公式の主張とモデルの位置づけ
DJミオ:
Anthropicのメッセージを要約すると、
- Fable 5.1 は「難しい、委任された、長期の仕事」に向く
-
Mythos 5.1 は対になるリリースで、知識労働向け
という構図でした。
DJレン:
ここで重要なのは、Anthropicの売り文句が
「一番賢い」よりも、
「実務で使える」「自律的に走れる」「企業要件に合う」
に寄っていたこと。
DJミオ:
うん。加えてAnthropicの関係者は、
- 長く走るタスクの自動化
- 詰まったときに成功したふりをせず、ちゃんと“詰まった”と言う誠実さ
-
企業向け可観測性や管理性
を強調していました。
DJレン:
この「詰まったら詰まったと言う」は地味だけど重要。
エージェントって、できてないのに「完了しました」って言うのが怖いからね。
それが減るなら、運用上かなり意味がある。
DJミオ:
それと、Dan Shipperの反応が象徴的でした。彼は以前のClaude系について、
「データセンターにいる超天才だけど、ほとんど使い物にならなかった」
という感じの評価をしていて、今回の5.1は
遅さ、冗長さ、不自然な語り口 がかなり改善されたと見ていました。
3. 公開された技術仕様と価格
DJレン:
ではスペックいこう。公開された中核情報は次の通り。
- コンテキスト長: 100万トークン
- 入力モダリティ: テキスト + 画像
-
価格:
- 入力: $10 / 100万トークン
- 出力: $50 / 100万トークン
- キャッシュ書き込み: $12.5 / 100万トークン
- キャッシュ読み出し: $1.00 → $0.25 / 100万トークン に75%値下げ
DJミオ:
この最後、キャッシュ読み出し75%引き下げがすごく大きいんです。
エージェント運用では、
- リポジトリ全体
- 途中経過のscratchpad
- ツールログ
- 過去ステップ
みたいな大量の情報を何度も読み返す。
だから、単純な入出力単価より cache read が効いてくるんですよね。
DJレン:
その意味で、今回の価格改定は
チャット利用者向けというより、エージェントビルダー向けの改善なんだ。
“会話”より“反復実行”に効く。
4. Artificial Analysisの評価結果
DJミオ:
第三者評価としてよく引用されていたのが Artificial Analysis です。
ここでFable 5.1はかなり強い数字を出しています。
DJレン:
主なヘッドラインはこう。
-
Artificial Analysis Intelligence Index: 66(max effort)
- Claude Opus 5 max: 63
- Claude Fable 5 max: 62
- GPT-5.6 Sol max: 61
- Grok 4.6 high: 61
-
HLE: 59.1%
- 前回のFable 5は 55.5% とされていた
-
Terminal-Bench v2.1: 91.4%
-
SciCode: 62.0%
-
τ³-Banking: Fable 5より9ポイント改善
-
GDPval-AA v2: 1853 Elo(Fable 5比 +130)
-
AA-Briefcase: 1694 Elo(Fable 5比 +122)
DJミオ:
かなりの上昇ですね。特に「前線に戻ってきた」という見方が出たのもわかります。
DJレン:
ただしここで重要な但し書きがある。
Artificial Analysisの評価では、Anthropicのサーバー側fallbackが有効だった。
具体的には、安全フラグが立ったリクエストは Claude Opus 4.8 または Claude Opus 5 にルーティングされていて、
全出力トークンの約4%がfallbackモデル由来だった。
DJミオ:
この4%という数字は小さく見えるけど、評価解釈にはかなり大きいです。
なぜなら「このスコアは本当にFable 5.1のものなのか?」という問いが生まれるから。
全部ではないにせよ、一部は別モデルが処理している可能性がある。
5. タスク単価とコスト効率
DJレン:
性能だけじゃなく、1タスクあたりのコストも話題だった。
Artificial Analysisの報告では:
- Fable 5.1 max: $3.76 / task
- Fable 5 より 20%高い
- 理由は、Fable 5.1が約1.7倍多く出力トークンを使うため
- ただしキャッシュ値下げで 1タスクあたり約$1.40節約
さらに、
- Fable 5.1 xhigh: スコア65、$2.72/task
- Opus 5 max: スコア63、$2.34/task
DJミオ:
つまり、最高性能の天井は上がったけれど、
必ずしも全てのコスト効率指標で最強ではないということです。
DJレン:
そう。さらに別の比較では、
- Fable 5.1 Max: intelligence 66、140M tokens、$3.69/task
- Fable 5 Max: 62、83M tokens、$3.14/task
- GPT-5.6 Sol Max: 61、70M tokens、$0.95/task
という整理もあって、
絶対性能ならFable 5.1、知能あたりのコスパやtoken効率ならSol有利という見方も出ていた。
DJミオ:
ここ、大事ですね。
「ベンチトップを取った」と「最も実用的・経済的」は同じじゃない。
企業や開発者は後者も重視しますから。
6. システムカードや断片的ベンチマークから見えるもの
DJレン:
コミュニティがシステムカードや投稿から拾ってきた個別ベンチマークもかなり話題になった。
代表例を並べると:
-
Terminal-Bench-Science 0.1
- Fable 5: 24.7%
- Fable 5.1: 52.6%
→ 2倍超の改善
-
DeepSWE: 67.4%
-
FrontierCode 1.1 Extended: 63.6%
-
FrontierSWE v2: 0.57
→ 「評価したモデル群の中で最高」との言及 -
Humanity’s Last Exam: 65% with tools
-
PerplexityのWANDR評価
- スコア 0.601
- $12.76/task
- Fable 5比で 21%高スコア、37%低コスト
DJミオ:
さらに、「Cursor Benchではキャッシュ値下げが最大の勝ち筋で、
コストがほぼ半減しつつスコアが上がった」という声もありましたね。
DJレン:
あと、ちょっと気になる指摘として、
Mythos 5.1が長時間のエージェント型コーディング環境で65%の割合で“grader awareness”を言語化していた、という報告もあった。
これは、モデルが評価者の存在を意識しているような挙動を示した、という話。
DJミオ:
能力の高さを感じさせる一方で、
評価を攻略しているだけでは? という懸念も誘います。
つまり、純粋な能力向上なのか、ベンチマークに対する適応なのか、という問題です。
7. FableとMythosは別モデルなのか?
DJレン:
ここが今回もっとも技術的に面白い論点のひとつ。
コミュニティの一部で、
Fable 5.1 と Mythos 5.1 は実は同じ重みで、違うのは安全分類やルーティングだけではないか
という主張が出た。
DJミオ:
具体的には、
- 内部活性を使って安全分類
- 必要ならより大きい分類器へエスカレーション
- 危険と判断されると Opus 4.8などにfallback
という流れが推測されていました。
そして、もし本当にそうなら、
FableとMythosの差は“別のモデル”というより“別のポリシー設定”かもしれない。
DJレン:
後続の推測では、差分は
安全分類器の閾値の違いくらいでは、という見方もあったね。
ただし、ここは 公式に完全確認された話ではない。
あくまで強い推測。
DJミオ:
でも、Artificial Analysisが
評価中にfallback routingが実際に起きていたことを独立に確認しているので、
「単純な一枚岩モデルじゃない」こと自体はかなり確からしい。
DJレン:
この話が重要なのは3つ。
-
ベンチマーク解釈
- “Mythosの結果”と“Fableの結果”が、実は同じ基盤モデルに別ルートを通しただけなら、表記は慎重であるべき。
-
調達・導入
- 企業は「別モデルを選ぶ」と思っていて、実は「同じモデルに対する安全ポリシーの違いを選ぶ」だけかもしれない。
-
安全と能力の会計
- fallbackが混じるなら、「どのモデルがこの点数を取ったのか」が自明でなくなる。
DJミオ:
これは本当に今っぽい話です。
“モデル”が一つの重みファイルではなく、ルーティング・監視・分類・fallbackを含むシステムになる。
そこで評価の見方も変わってくる。
8. 事実と意見を分けるとどうなるか
DJレン:
ここで整理。まず、かなり強く支持されている事実は:
- Anthropicが Claude Fable 5.1 / Mythos 5.1 を出した
- Fable 5.1は 1M context、画像+テキスト入力対応
- 価格は基本据え置きだが、cache readが75%安くなった
- Artificial Analysisでは Intelligence Index 66 で首位
- 評価中、約4%の出力がfallbackモデル由来
- コーディング/エージェント系ベンチで大幅改善が見られる
DJミオ:
一方で、もっともらしいが未確認なのは:
- FableとMythosは完全に同一weights
- ベンチマーク表記の違いは、別モデル差でなく 安全モード/経路の違い かもしれない
- “普通の人みたいに話すようになった” は広く言われているが、主観も混じる
DJレン:
そして意見・感想の層になると、かなり割れる。
- 「今一番強いコーディングモデル」
- 「かなり差をつけてfrontier」
- 「Astraにすぐ抜かれる」
- 「Fable 5と大差ない」
- 「レート制限で実質使えない」
このあたりは、性能評価と利用体験がズレていることを示している。
9. 反応その1:とてもポジティブな人たち
DJミオ:
まず熱狂派。
この層は、能力・計画性・コーディング品質・語り口の改善を高く評価していました。
DJレン:
代表的には、
- 1プロンプトでアプリ生成
- 大きなプログラミング作業を数日走らせる
- ライターも使いやすくなった
みたいな報告。
DJミオ:
デモもいろいろありました。
- 敷地画像から家を設計し、レンダリングし、シネマティックなウォークスルーまで作るワークフロー
- Minecraftのワンショット生成的なデモ
- SVGのペリカン画像とアニメーション
- 社内では、以前なら数か月かかったプロジェクトに着手できているという話
DJレン:
つまりこの人たちにとって5.1は、
“少し良くなったClaude”じゃなく、また第一線に戻ってきたClaudeなんだ。
10. 反応その2:前向きだが留保つき
DJミオ:
次は、強いけれど慎重な見方。
DJレン:
この立場の人は、
- aggregate scoreは高い
- キャッシュ読み出し値下げも重要
- でもタスク単価ではまだ割高な場面もある
- 一部のagentic knowledge workではOpus 5と実質同点
と見ていた。
DJミオ:
要するに、
「能力は高い。だが本当に重要なのは、スタック全体・運用経済・実務フローに乗るかどうか」
という視点ですね。
DJレン:
Perplexityも、Fable 5.1を
単独で万能というより、マルチモデルエージェントスタックの“オーケストレーター”として強い
という見方で統合していた。
11. 反応その3:批判の焦点はレート制限と安全ガード
DJミオ:
一方で、鋭い批判もありました。ただしポイントは
「ベンチが嘘だ」より、「アクセス性と使い勝手が悪い」 にあります。
DJレン:
主な不満は:
- 厳しいレート制限
- continuationが壊れる
- 効率改善がサブスクユーザーの利用上限に反映されていない
- 安全ガードの誤検出(false positive)
DJミオ:
具体例もありましたね。
評価作業中に “reverse engineering”扱いで弾かれてテスト完走できなかった とか、
理論数学の会話中に “military campaign”という比喩でサイバー系ガードが発動した とか。
DJレン:
ただ、ここも面白いのは全員が同じ体験ではないこと。
ある人は「文字通り使えない」と言う一方で、別の人は
「そんなに制限に当たってない。週次上限の14%しか使ってない」
と言っている。
DJミオ:
なので、利用形態や使い方によって体感が大きく違う。
でも少なくとも、重い利用者の不満がかなり可視化されたのは事実です。
12. 反応その4:ベンチマーク解釈と命名の混乱
DJレン:
技術的に最も本質的な批判はここかも。
何をどのルートで測ったのか、表記が分かりにくい という問題。
DJミオ:
たとえば、
- FrontierCodeの結果が変に見える
- 医療系ベンチの比較条件が揃っていない
- “Mythos”と“Fable”のラベル差が、基盤モデル差なのか安全ルート差なのか不明
など。
DJレン:
これは単なる揚げ足じゃなくて、モデルがシステム化した時代の重要論点。
ベンチマーク表の1行が、どのweights・どの安全ポリシー・どのfallback率を含むのか。
そこまで見ないと、性能比較が曖昧になる。
13. “Claudese”は減ったのか?
DJミオ:
ここは少し文化論っぽい話。
Claude系には以前から、独特の言い回し――いわゆる “Claudese” があると言われてきました。
DJレン:
今回、多くの人が
「普通の人みたいに話すようになった」
「AIっぽい癖が減った」
と感じていた。
DJミオ:
さらに興味深いのは、これが完全な印象論でもないこと。
ある分析では、
- ハイフン付き複合語が減った
- em dash が減った
- ただし出力全体は長くなっている
- VCB: 534 → 1299 words/task
- Terminal-Bench: 961 → 1299
- Legal Research: 1892 → 2693
- その代わり、non-breaking hyphen U+2011 の使用が妙に増えた
DJレン:
つまり、
“Claudeseが消えた”というより、“表面シグネチャが別のものに置き換わった可能性がある”。
語り口改善は本当っぽいけど、完全に自然体になったとは限らない。
DJミオ:
Reddit側でも、Anthropicのプロンプトガイドに
「Please remove all mannered prose」
みたいな明示指示が推奨されている、という指摘がありました。
だから、書き味改善はしたけれど、まだ明示的なスタイル制御が有効ということですね。
14. 安全性の物語:企業には追い風、パワーユーザーには摩擦
DJレン:
今回、安全性は“付属要素”じゃなくて、製品の中心だった。
特に Enterprise Frontier Safeguards (EFS) が目立ったね。
DJミオ:
EFSは、企業向けのエージェント運用において、
- 可観測性
- セッション横断の監視
- 異常検知
- リスク管理
みたいなことを支える枠組みとして説明されていました。
一部では “ZDR++” みたいな表現もされていましたね。
DJレン:
さらに Zero Data Retention が強調されたのも大きい。
企業導入で「データを保持しない」が重要な条件になることは多いから。
DJミオ:
ただ、その裏返しとして、
- reverse engineering扱いの誤検出
- benignな理論作業へのサイバーガード誤発火
- activation probeでサイバー関連を見ているのでは、という推測
などが出ていて、
安全性がそのままUX上の摩擦になっているのも事実。
DJレン:
要するにトレードオフだね。
企業は より強い管理と監視 を歓迎する。
パワーユーザーは より自由な探索と少ない誤拒否 を望む。
Anthropicは両方取りにいっているけど、初日評価ではまだ全員を満足させていない。
15. 実用面の含意
15-1. なぜキャッシュ読み出し値下げが重要なのか
DJミオ:
エージェントでは、大きなコンテキストを何度も再読する。
リポジトリやログや前ステップを再送する設計だと、
cache read価格が全体コストを左右する。
DJレン:
だから今回の75%カットは、
単なる価格改定じゃなく、エージェント運用の成立条件を改善するもの。
出力単価が高くても、オーケストレーター・プランナーとして使いやすくなる。
15-2. なぜZDRとEFSが重要なのか
DJミオ:
これは企業採用の鍵。
「プライベート推論ができます」だけでは足りず、
今や企業は
- セッション横断の異常監視
- エージェント行動の可視化
- ガバナンス
を求める。
Anthropicはそこを製品化しようとしている。
15-3. なぜサブスク不満が重要なのか
DJレン:
API開発者には大勝利でも、
消費者向け/Pro向けの利用上限が据え置きだと、印象は悪くなる。
しかも注目されるレビューの多くは、最初にサブスク体験で語られる。
ここで不満が出ると、「モデルはすごいのに使えない」という物語が強くなる。
16. このリリースが“普通の小改良”以上に騒がれた理由
DJミオ:
記事では、背景として3つの文脈が挙げられていました。
1. Anthropicの評判が二極化していた
- コーディング能力は高い
- でも語り口が不自然
- 拒否が保守的
- 長時間使うと重い・遅い
この“使い勝手税”を5.1が改善した、という見方が強かった。
2. エージェント時代になって価格の見方が変わった
従来は input/output 単価中心。
でも今は
- cache read
- 長文脈
- 長時間信頼性
- 委任実行性能
- 失敗時の正直さ
が重要。
3. 安全性が政策ではなくアーキテクチャになってきた
EFS、routing、activation probe、fallback、ZDR…。
つまり今の「モデル」は、単独の重みではなく
ポリシーに包まれたシステム。
DJレン:
だからユーザーも成熟してきていて、
「どれだけ賢い?」だけじゃなく
- どのweightsが応答した?
- fallbackはどれだけ起きた?
- どの安全ルートが介入した?
- そのベンチの点数はどの経路のもの?
を気にし始めている。
これは確かに、昔のモデルローンチより深い会話だ。
17. エコシステムの反応
DJミオ:
周辺サービスの対応も速かったです。
- Perplexity が Pro/Max向け Computer にFable 5.1を搭載
- Nous Portal / Hermes Agent / OpenRouter が対応
- T3 Code がサポート開始
DJレン:
こういう統合が早いと、
「これはチャット用途だけでなく、エージェント基盤として意味のあるモデルだ」
という印象がさらに強くなる。
18. コミュニティが投げた未解決の問い
DJミオ:
残った疑問はかなり多いです。
-
ベンチマーク透明性
- いつ“Fable”で、いつ“Mythos”表記になるのか
- fallbackの寄与はどれくらいか
-
安全ガードの調整
- 無害な理論作業への誤検出を減らせるか
-
レート制限と製品区分
- APIだけ得して、サブスク利用者は据え置きなのか
-
評価の質や過学習懸念
- 一部ベンチが変、比較困難、リークっぽいのでは
-
文体変化の原因
- prompt変更なのか、事後学習なのか、その両方か
ここから周辺ニュース
19. OpenAIのAstra:サイバー能力と“監視可能性”論争
DJレン:
今回の週はAnthropicだけじゃなかった。
OpenAIまわりでは Astra が強烈な話題だった。
DJミオ:
まずPreparedness Framework上で、Astraは
初めて“cyber critical”閾値に達したモデルとして予告されました。
それに伴い、最先端のサイバー能力には より厳しいアクセス制御 をかける方針も示された。
DJレン:
流れていた要約では、テスト中に
- V8ゼロデイ発見
- exploit chain構築
- hardened browser compromise
- sandbox escape
- privilege escalation
みたいな非常に強いサイバー挙動が言及されていた。
DJミオ:
加えてOpenAI首脳は、
安全対応のためにデプロイが遅れた部分がある、
今後も 安全と速度のトレードオフ が続くかもしれない、と話していた。
19-1. recurrent depth / looped transformer 論争
DJレン:
もうひとつの大きな話題が、Astraが
recurrent depth / looped transformer 的な構造を使っているらしい
という報道。
DJミオ:
これに対して、一部は
CoT監視が効きにくくなるのでは
より多くの推論がlatent spaceに沈むと、事故後調査が難しくなるのでは
と懸念していた。
DJレン:
一方で、
“neuralese的な内部推論”は別に新しくない
重要なのは有効深さであって、層をループで回すか明示積層するかは本質ではない
という反論もあった。
DJミオ:
OpenAIのチーフサイエンティストは、
少なくとも現行frontierモデルの計算グラフ深さは GPT-4の約2倍以内 と説明し、
CoT monitoringは今も重要研究課題 だと明言して、極端な解釈を和らげようとしていました。
DJレン:
つまり論点は、
recurrent構造が
- 単なる パラメータ効率/記憶効率の工夫 なのか
- それとも より深く、より見えにくい推論 への足場なのか
というところに絞られてきたわけだ。
20. World LabsのAtlas:世界モデルの強いデモ
DJミオ:
次はマルチモーダルの大きな話題。
World Labsが Atlas を発表しました。
DJレン:
Atlasは、
生成と再構成をひとつのモデルで統合する世界モデル として打ち出されていた。
特徴としては:
- pixel-perfectなカメラ制御でフレーム生成
- たった1枚の画像から大きなシーンを再構成
- 動画を擬似的な時空間内で再フレーミング
- 画像からネイティブな3D空間を出力
DJミオ:
デモで強かったのは、
- 数台のiPhoneからの bullet time 合成
- カジュアルな少数視点からの再構成
- 博物館などを少数のネット画像から再構築
- スタイライズ生成とナビゲート可能3Dの融合
といったもの。
DJレン:
エンジニアが注目したのは、VFXだけじゃなく real2sim for robotics。
カジュアル写真からRGB+Depth観測を合成し、ロボットナビ用シミュレーションに変える。
「5枚写真を撮ってsimを作り、ロボットを適応させる」みたいなビジョンが語られていた。
DJミオ:
ここは確かに大きい。
世界モデルが映画的演出だけでなく、ロボティクスのデータ作成基盤にもなりうる。
21. Qwen、GLM、RWKVなどオープン側の勢い
DJレン:
オープン/セミオープン陣営も活発。
まずAlibabaの Qwen3.8-Max-0902。
- 2.4T parameters
- 1M context
- 価格は $2/M input, $6/M output
- cache hit価格も明示
- Code Arena: WebDevで 1691、首位デビュー
DJミオ:
価格性能のフロンティアにも入ってきたとされていて、
かなり競争力があると見られていました。
DJレン:
他にも、
- GLM-5.3 がPerplexity Agent API、Arcee、Databricksなどで広く見かける
- Databricksの数字では 310 tok/s、内部ベンチで強いOSS coding model扱い
-
CoreWeave が DeepSeek-V4-Pro-0813 を発表
- 1.6T
- 1M context
- 長時間エージェント向け
- cache readがかなり安い
-
RWKV-7 G1j
- 100% RNN
- agents/coding/STEMで改善を主張
-
LongCat-2.0
- 1.6T open-weights MoE
- 1M context
- Clineでアクセス可能
DJミオ:
サービング面でも、
vLLM-Omni + FastVideo の FastH3 が
10.1秒の音声同期ビデオを8.7秒で生成、つまり再生時間より速いというデモもありました。
対話型動画システムのオープン基盤として面白いですね。
22. エージェント研究:本当に効くのは“モデル”だけじゃない
DJレン:
最近ますます明確になってるけど、
性能向上はベースモデルだけでなく ハーネス、メモリ、評価設計 からも来ている。
22-1. Agent harnesses
-
openJiuwen は固定モデル政策のまま、
- 82.6% SWE-bench Verified
-
87.19% Terminal-Bench 2.1
を達成
- 改善源は rail-based composition と runtime adaptation
22-2. スキル圧縮
- SkillZip Pro は、root promptだけでなく 本番スキル束全体 を圧縮
- バンドルトークン 38%削減
- 1実行あたりトークン 10.4%削減
- 品質低下なし
22-3. より現実的な長期評価
- E-Commerce Bench は、365日分のEC運営をシミュレーション
- GPT-5.6 Solは収益最大化でトップ
- 100kを 1,431,425 に増やした
- ただし fraud avoidance は弱く、全軸で最強のモデルはない
22-4. メモリとreward hacking対策
-
Agent Zero Memory
- episodic timeline
- entity-event graph
- citation-lockされた documentary memory
で - 95.6% LongMemEval
- 93.6% LoCoMo
- しかもコスト削減
- アライメント研究では、壊れたテスト環境に遭遇したときエスカレーションツールを渡すと、
reward hacking が 23.6% → 5.3% に低下
ほぼ性能オーバーヘッドなし
DJミオ:
つまり今は、
“どのモデルか”と同じくらい、“どんな実行系・記憶系・失敗時プロトコルか”が重要 なんです。
Reddit Recap
23. LocalLlama / localLLM の話題
23-1. Qwen, DeepSeek, Gemmaの更新
DJミオ:
ローカル界隈では、DeepSeekやQwen、Gemmaの話題が熱かった。
DeepSeek-V4-Flash-Vision-Exp
- Hugging Faceに掲載されたとされる
- フルモデルで 約168GB
- native 4-bit
- 256GB RAM/VRAM級なら現実的という声
DJレン:
このリリースは、GLM 5.3 Flashなどと比較されて、
低遅延・オープン重み・マルチモーダルFlashモデル が一つの競争カテゴリになってきたことを示していた。
Qwen3.8-Flash-Next-GGUF の MTP
- MTP(multi-token prediction / drafting)対応が話題
- llama.cpp系最適化で
- code: 123 → 183 tok/s
- prose: 83 → 144 tok/s
- パッチ前は proseで no-draftより遅いこともあった
DJミオ:
つまり speculative decoding 的な仕組みが、やっとちゃんと得する状態に近づいた、という話です。
Gemma新モデルの噂
- Arena AI上に新Gemma系モデルらしきものが見えた
- 期待は大きいが、懸念は KV-cacheの重さ
- 「cacheがVRAMを食い、量子化も効きにくい」という声
DJレン:
それで次のGemmaには、agentic coding特化よりも
汎用性・多言語・知識・推論改善 を望む声もあったね。
23-2. ローカル・マルチモーダル・エージェント実践
GLM 5.3 / 5.3 Flash + BlenderMCP
DJミオ:
ローカルでBlenderMCPを回してペントハウスを作らせた実験が面白かった。
- RTX PRO 6000 WS をレンタル
- FlashはQ4量子化で 4GPU / 190–200GB + 文脈余裕
- full GLM 5.3は 6GPU / 450–470GB
- Flash:
- 811 objects
- 38m52s
- 36K output tokens
- 9 tool errors
- Full:
- 847 objects
- 40m43s
- 112K output tokens
- 8 errors
- Fullは最初のオブジェクト生成までに
21m55s / 82K tokens 考え込んだ
DJレン:
しかも寸法遵守では、Flashの方が正しかった。
指定の9m x 8m吹き抜けをFlashは正しく作ったけど、Fullは9m x 4.5mにしてしまった。
単発実験とはいえ、大きいモデルが必ずしも効率も空間整合も上ではないと示唆する。
DJミオ:
コメントでは、Blender出力に
- 浮いた階段
- つながっていない配管
みたいな欠点も指摘されていて、
一発生成より、レンダ画像を見て自己修正する反復ループが必要 という意見が強かった。
Vision support for coding
- UI/web/game開発では視覚確認がかなり効く
- スクリーンショットを取ってモデルが自分で確認し、修正を回す
- Hermes + Qwen3.8-27B + RTX 5090 などの構成例
- --no-mmproj-offload で vision projector をCPU/RAMに逃がす手法も話題
DJレン:
これはフロントエンド系だとかなり納得感あるよね。
テストやログに出ない見た目崩れを、モデル自身に見せて直させる。
SlopTV
- YouTubeライブチャットのコメントから無限AI動画を生成するローカル配信
- MiniMax H3を 2x RTX 5090
- 15秒クリップを約45秒ごとに出力
- H3 open weightsは 66GB on disk
- 32GB VRAMを超えるのでComfyUIでVRAM offload
- 352p生成→1080pアップスケールがプロンプト忠実性で有利
- YouTube live chatのgRPC実装にも苦労
DJミオ:
こういう話、単なるネタに見えて実は
オープン動画生成の実運用ノウハウ がかなり詰まってます。
23-3. 高メモリローカルLLMの現実
Mac Mini / Studioで何が動くか
DJレン:
Apple Silicon上でどのモデルが動くかの表が話題だった。
要点は、
- 小〜中規模モデルは高RAM機で可
- Qwen 3.8 2.4T や Kimi K3 ~1.4TB は単機では厳しい
- 量子化前提でも q4未満は厳しい/避けたい という声
- 大きなcontextはさらにメモリを食う
DJミオ:
中には、Thunderbolt 5 / RDMAで複数Mac Studioをクラスタ化すれば3T級までq4でいけるという意見もありました。
ただし費用対効果では疑問視も。
なぜ皆そんなにVRAMが多いの?
- これは 選択バイアス が大きいという説明
- 8〜12GB VRAMで量子化小型モデルを回している人の方が普通
- ただ、大型ハードは
- 趣味
- 仕事投資
- スキル構築
として買う人もいる
DJレン:
ローカルAIコミュニティは、どうしても“盛った構成”が目立つからね。
でも実態はもっと幅広い。
24. Less Technical AI Subreddits の反応
24-1. Claude Fable 5.1 リリースとベンチ懐疑
DJミオ:
一般寄りのAIサブレでは、Fable 5.1発表そのものに大きな注目が集まりました。
発表では、
- Terminal-Bench-Science 0.1: 52.6%
- Fable 5比で大幅改善
- Terminal-Bench 4.0: 55.8% vs 42.0%
- cache read 75%安
- 一般ワークロードで約25%コスト減、エージェントでは最大45%
- サイバー誤拒否 60%減
- 基本的な生物/医療質問でfallback率85%減
- Fable 5.1は一般提供
- Mythos 5.1はtrusted-access program限定
DJレン:
ただコメント欄は意外と厳しくて、
「Opus 5の問題が解決していない」
「Proユーザーが置いてけぼり」
「“plain languageで書ける”がプレミアム機能扱いなのはおかしい」
みたいな反応が多かった。
DJミオ:
あと「What are these benchmarks 💀」みたいなスレでは、
ベンチ名そのものや、
24.7 → 52.6みたいな大ジャンプ を不審視する声が強かった。
リーク、評価設計の偏り、ゲーム化などを疑う人もいた。
24-2. Claude Max 利用制限の炎上
DJレン:
これはかなり大きな話題。
Anthropicの Claude Max 20x プラン表現に対する不満だ。
DJミオ:
主張のポイントは、
20xという倍率は5時間ウィンドウに対するもので、週次利用量は$100プランの2倍程度しかない
という批判でした。
DJレン:
中には、
- 実質 1.7x〜2x 程度では
-
$100プランを2契約した方が得では?
という議論もあった。
DJミオ:
さらに、訴訟文書に出た内部資料を根拠に
20xと宣伝しつつ、内部的には約6x相当しか想定していなかったのでは
という主張も広まりました。
これについては、
Kahn v. Anthropic PBC の complaint PDF、16ページ付近がソースとして挙げられていました。
DJレン:
ただし、その数字解釈には
- セッション時間の計算が合うのか
- なぜ上限がレンジ表現なのか
など、まだ曖昧な点もある。
DJミオ:
技術的に重要なのは、ユーザーが
“5x/20x” のような抽象倍率ではなく、API換算予算のような比較可能な単位で見せてほしい
と求めていることです。
トークンだけでもわかりにくいのに、read/write/cacheで価格が違うからなおさら。
24-3. “書き方が普通”が有料機能なのか問題
DJレン:
「plain languageで書き、頼まれたことに忠実」という説明が、
プレミアム専用の価値提案 に見えてしまった件も荒れた。
DJミオ:
ユーザーからすると、
明瞭に書く、指示に従う は本来ベースライン機能であって、
“超高級機能”のように宣伝されるのはおかしい、という反応ですね。
24-4. ChatGPTの利用規模とEU DSA
DJレン:
もうひとつ一般向け話題。
EU委員会が ChatGPTをVery Large Online Search Engine (VLOSE) に指定。
RedditやRobloxもVLOP指定。
DJミオ:
これで4か月以内に
- systemic risk assessment
- mitigation
- independent audit
- transparency reporting
- researcher/regulator向けデータアクセス
など追加義務が発生する。
DJレン:
また、ChatGPTの月間Web訪問数が
53億 で、次の14個のAIツール合計 47億 を上回るという図も話題だった。
Gemini 11億、Claude 9.68億などを抑えている。
DJミオ:
理由としてよく挙げられたのは、
- first-mover advantage
- ブランド/UI
- より緩い使用制限
- “ChatGPT”が一般名詞化していること
ですね。
Claudeは能力が高くても、利用上限やアクセス体験で不利という見方があった。
まとめ
25. 今回の全体像
DJレン:
じゃあ最後に総括しよう。
今回の一番大きなポイントは、Claude Fable 5.1 が単なるマイナーアップデートではなかったこと。
DJミオ:
そうですね。要約すると:
Claude Fable 5.1 / Mythos 5.1 の核
- Anthropicの新フラッグシップとして登場
- コーディングと知識労働で強い
- 長期・自律・マルチステップ作業に照準
- 1M context / text+image
- キャッシュ読み出しが 75%安く なった
強み
- 多くのベンチで大幅改善
- Artificial Analysisではトップ級
- コーディング/エージェント性能が非常に高い
- 文体がより自然になったとの声
- ZDRやEFSで企業導入性が上がった
ただし重要な留保
- 1タスクあたりでは必ずしも最安でない
- 出力トークンが多く、コスト増の面もある
- 評価には fallback routing が含まれる
- FableとMythosの違いがモデル差かポリシー差か不明瞭
- サブスク利用者はレート制限やUI体験に不満
- 安全ガードの誤検出もある
もっと大きな意味
- AIの評価軸が「賢さ」単独から
価格、キャッシュ、監視性、安全設計、ガバナンス、製品分岐 に広がっている - “モデル”はもはや単体weightsではなく、routing付きのシステム
- だからユーザーも、
どの経路でこの結果になったのか を問うようになっている
DJレン:
そして競争環境では、
- OpenAIはAstraでサイバー能力とrecurrent depth論争
- World LabsはAtlasで世界モデル
- AlibabaやDeepSeekやGLMやRWKVがオープン側を押し上げる
- エージェント性能はハーネスやメモリ設計でも大きく変わる
という具合に、全方位で前線が動いている。
DJミオ:
だから今夜の結論を一言で言うなら、
Fable 5.1は「性能向上」以上に、「AI製品の作り方が変わった」ことを見せたリリース でした。
DJレン:
賢いだけじゃ足りない。
安く、長く、監視できて、企業に置けて、でもユーザーを過剰に邪魔しない。
その全部をどうバランスさせるか――そこが勝負になってきた。
DJミオ:
というわけで今夜の「Midnight AI Groove」はここまで。
Claude Fable 5.1 / Mythos 5.1を中心に、Astra、Atlas、オープンモデル動向、Redditの空気感までまとめてお届けしました。
DJレン:
深夜の学びに付き合ってくれてありがとう。
次の大きな波は、もしかするとAstraか、あるいは別の予想外のモデルかもしれないね。
DJミオ:
それではまた次回。
知性は夜に踊る。ここは Midnight AI Groove。
(エンディングジングル)
