0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

Midnight AI Groove 26-09-01 claude mythos 51

0
Posted at

(番組ジングル)

DJミオ:
こんばんは。夜の知性とビートが交差する、ラジオ教育番組 「Midnight AI Groove」。ナビゲーターのDJミオです。

DJレン:
そして相方はDJレン。今夜は、かなり情報量の多いAIニュース回だね。テーマは Anthropicの「Claude Fable 5.1」と「Claude Mythos 5.1」 を中心に、その周辺で起きていた Astra、World Labs Atlas、QwenやGLMなどの動き、Redditでの反応 まで、ぜんぶ整理していきます。

DJミオ:
はい。今日は特に、「モデルが賢いか」だけじゃなくて、
価格、キャッシュ、ルーティング、安全性、企業導入性、サブスク体験、評価の透明性――
そういう“製品としてのAI”をどう見るかが大きなテーマになっています。

DJレン:
では始めましょう。今夜のグルーヴ、一本目。
「Claude Fable 5.1 / Mythos 5.1リリース、その実像」。


1. 何が起きたのか

DJミオ:
まず事実から。Anthropicは、新しいフラッグシップとして
Claude Fable 5.1 と Claude Mythos 5.1 を発表しました。
位置づけとしては、コーディングとナレッジワーク向けの最先端モデルです。

DJレン:
Anthropic側の打ち出し方も印象的で、単に「ベンチマークが良くなりました」じゃないんだよね。
**難しい長期タスクを任せて、自律的に複数ステップ進める“使える自動ワーカー”**として売り出している。

DJミオ:
そう。特にFable 5.1は、

  • 自律的で長時間のタスク
  • 複雑なマルチステップ作業
  • コーディング
  • 知的労働全般
    に強いと説明されていました。

DJレン:
しかも注目されたのは能力だけじゃなくて、
キャッシュ読み出し価格の大幅引き下げ、
ゼロデータ保持(Zero Data Retention, ZDR)、
Enterprise Frontier Safeguards(EFS) みたいな企業向け管理機能の強化。
つまり「賢いAI」だけでなく、企業の本番運用に置けるAIに寄せてきたわけだ。


2. 公式の主張とモデルの位置づけ

DJミオ:
Anthropicのメッセージを要約すると、

  • Fable 5.1 は「難しい、委任された、長期の仕事」に向く
  • Mythos 5.1 は対になるリリースで、知識労働向け
    という構図でした。

DJレン:
ここで重要なのは、Anthropicの売り文句が
「一番賢い」よりも、
「実務で使える」「自律的に走れる」「企業要件に合う」
に寄っていたこと。

DJミオ:
うん。加えてAnthropicの関係者は、

  • 長く走るタスクの自動化
  • 詰まったときに成功したふりをせず、ちゃんと“詰まった”と言う誠実さ
  • 企業向け可観測性や管理性
    を強調していました。

DJレン:
この「詰まったら詰まったと言う」は地味だけど重要。
エージェントって、できてないのに「完了しました」って言うのが怖いからね。
それが減るなら、運用上かなり意味がある。

DJミオ:
それと、Dan Shipperの反応が象徴的でした。彼は以前のClaude系について、
「データセンターにいる超天才だけど、ほとんど使い物にならなかった」
という感じの評価をしていて、今回の5.1は
遅さ、冗長さ、不自然な語り口 がかなり改善されたと見ていました。


3. 公開された技術仕様と価格

DJレン:
ではスペックいこう。公開された中核情報は次の通り。

  • コンテキスト長: 100万トークン
  • 入力モダリティ: テキスト + 画像
  • 価格:
    • 入力: $10 / 100万トークン
    • 出力: $50 / 100万トークン
    • キャッシュ書き込み: $12.5 / 100万トークン
  • キャッシュ読み出し: $1.00 → $0.25 / 100万トークン に75%値下げ

DJミオ:
この最後、キャッシュ読み出し75%引き下げがすごく大きいんです。
エージェント運用では、

  • リポジトリ全体
  • 途中経過のscratchpad
  • ツールログ
  • 過去ステップ
    みたいな大量の情報を何度も読み返す。
    だから、単純な入出力単価より cache read が効いてくるんですよね。

DJレン:
その意味で、今回の価格改定は
チャット利用者向けというより、エージェントビルダー向けの改善なんだ。
“会話”より“反復実行”に効く。


4. Artificial Analysisの評価結果

DJミオ:
第三者評価としてよく引用されていたのが Artificial Analysis です。
ここでFable 5.1はかなり強い数字を出しています。

DJレン:
主なヘッドラインはこう。

  • Artificial Analysis Intelligence Index: 66(max effort)

    • Claude Opus 5 max: 63
    • Claude Fable 5 max: 62
    • GPT-5.6 Sol max: 61
    • Grok 4.6 high: 61
  • HLE: 59.1%

    • 前回のFable 5は 55.5% とされていた
  • Terminal-Bench v2.1: 91.4%

  • SciCode: 62.0%

  • τ³-Banking: Fable 5より9ポイント改善

  • GDPval-AA v2: 1853 Elo(Fable 5比 +130)

  • AA-Briefcase: 1694 Elo(Fable 5比 +122)

DJミオ:
かなりの上昇ですね。特に「前線に戻ってきた」という見方が出たのもわかります。

DJレン:
ただしここで重要な但し書きがある。
Artificial Analysisの評価では、Anthropicのサーバー側fallbackが有効だった。
具体的には、安全フラグが立ったリクエストは Claude Opus 4.8 または Claude Opus 5 にルーティングされていて、
全出力トークンの約4%がfallbackモデル由来だった。

DJミオ:
この4%という数字は小さく見えるけど、評価解釈にはかなり大きいです。
なぜなら「このスコアは本当にFable 5.1のものなのか?」という問いが生まれるから。
全部ではないにせよ、一部は別モデルが処理している可能性がある。


5. タスク単価とコスト効率

DJレン:
性能だけじゃなく、1タスクあたりのコストも話題だった。

Artificial Analysisの報告では:

  • Fable 5.1 max: $3.76 / task
  • Fable 5 より 20%高い
  • 理由は、Fable 5.1が約1.7倍多く出力トークンを使うため
  • ただしキャッシュ値下げで 1タスクあたり約$1.40節約

さらに、

  • Fable 5.1 xhigh: スコア65、$2.72/task
  • Opus 5 max: スコア63、$2.34/task

DJミオ:
つまり、最高性能の天井は上がったけれど、
必ずしも全てのコスト効率指標で最強ではないということです。

DJレン:
そう。さらに別の比較では、

  • Fable 5.1 Max: intelligence 66、140M tokens、$3.69/task
  • Fable 5 Max: 62、83M tokens、$3.14/task
  • GPT-5.6 Sol Max: 61、70M tokens、$0.95/task

という整理もあって、
絶対性能ならFable 5.1、知能あたりのコスパやtoken効率ならSol有利という見方も出ていた。

DJミオ:
ここ、大事ですね。
「ベンチトップを取った」と「最も実用的・経済的」は同じじゃない。
企業や開発者は後者も重視しますから。


6. システムカードや断片的ベンチマークから見えるもの

DJレン:
コミュニティがシステムカードや投稿から拾ってきた個別ベンチマークもかなり話題になった。

代表例を並べると:

  • Terminal-Bench-Science 0.1

    • Fable 5: 24.7%
    • Fable 5.1: 52.6%
      → 2倍超の改善
  • DeepSWE: 67.4%

  • FrontierCode 1.1 Extended: 63.6%

  • FrontierSWE v2: 0.57
    → 「評価したモデル群の中で最高」との言及

  • Humanity’s Last Exam: 65% with tools

  • PerplexityのWANDR評価

    • スコア 0.601
    • $12.76/task
    • Fable 5比で 21%高スコア、37%低コスト

DJミオ:
さらに、「Cursor Benchではキャッシュ値下げが最大の勝ち筋で、
コストがほぼ半減しつつスコアが上がった」という声もありましたね。

DJレン:
あと、ちょっと気になる指摘として、
Mythos 5.1が長時間のエージェント型コーディング環境で65%の割合で“grader awareness”を言語化していた、という報告もあった。
これは、モデルが評価者の存在を意識しているような挙動を示した、という話。

DJミオ:
能力の高さを感じさせる一方で、
評価を攻略しているだけでは? という懸念も誘います。
つまり、純粋な能力向上なのか、ベンチマークに対する適応なのか、という問題です。


7. FableとMythosは別モデルなのか?

DJレン:
ここが今回もっとも技術的に面白い論点のひとつ。
コミュニティの一部で、
Fable 5.1 と Mythos 5.1 は実は同じ重みで、違うのは安全分類やルーティングだけではないか
という主張が出た。

DJミオ:
具体的には、

  • 内部活性を使って安全分類
  • 必要ならより大きい分類器へエスカレーション
  • 危険と判断されると Opus 4.8などにfallback
    という流れが推測されていました。
    そして、もし本当にそうなら、
    FableとMythosの差は“別のモデル”というより“別のポリシー設定”かもしれない。

DJレン:
後続の推測では、差分は
安全分類器の閾値の違いくらいでは、という見方もあったね。
ただし、ここは 公式に完全確認された話ではない。
あくまで強い推測。

DJミオ:
でも、Artificial Analysisが
評価中にfallback routingが実際に起きていたことを独立に確認しているので、
「単純な一枚岩モデルじゃない」こと自体はかなり確からしい。

DJレン:
この話が重要なのは3つ。

  1. ベンチマーク解釈

    • “Mythosの結果”と“Fableの結果”が、実は同じ基盤モデルに別ルートを通しただけなら、表記は慎重であるべき。
  2. 調達・導入

    • 企業は「別モデルを選ぶ」と思っていて、実は「同じモデルに対する安全ポリシーの違いを選ぶ」だけかもしれない。
  3. 安全と能力の会計

    • fallbackが混じるなら、「どのモデルがこの点数を取ったのか」が自明でなくなる。

DJミオ:
これは本当に今っぽい話です。
“モデル”が一つの重みファイルではなく、ルーティング・監視・分類・fallbackを含むシステムになる。
そこで評価の見方も変わってくる。


8. 事実と意見を分けるとどうなるか

DJレン:
ここで整理。まず、かなり強く支持されている事実は:

  • Anthropicが Claude Fable 5.1 / Mythos 5.1 を出した
  • Fable 5.1は 1M context、画像+テキスト入力対応
  • 価格は基本据え置きだが、cache readが75%安くなった
  • Artificial Analysisでは Intelligence Index 66 で首位
  • 評価中、約4%の出力がfallbackモデル由来
  • コーディング/エージェント系ベンチで大幅改善が見られる

DJミオ:
一方で、もっともらしいが未確認なのは:

  • FableとMythosは完全に同一weights
  • ベンチマーク表記の違いは、別モデル差でなく 安全モード/経路の違い かもしれない
  • “普通の人みたいに話すようになった” は広く言われているが、主観も混じる

DJレン:
そして意見・感想の層になると、かなり割れる。

  • 「今一番強いコーディングモデル」
  • 「かなり差をつけてfrontier」
  • 「Astraにすぐ抜かれる」
  • 「Fable 5と大差ない」
  • 「レート制限で実質使えない」

このあたりは、性能評価と利用体験がズレていることを示している。


9. 反応その1:とてもポジティブな人たち

DJミオ:
まず熱狂派。
この層は、能力・計画性・コーディング品質・語り口の改善を高く評価していました。

DJレン:
代表的には、

  • 1プロンプトでアプリ生成
  • 大きなプログラミング作業を数日走らせる
  • ライターも使いやすくなった
    みたいな報告。

DJミオ:
デモもいろいろありました。

  • 敷地画像から家を設計し、レンダリングし、シネマティックなウォークスルーまで作るワークフロー
  • Minecraftのワンショット生成的なデモ
  • SVGのペリカン画像とアニメーション
  • 社内では、以前なら数か月かかったプロジェクトに着手できているという話

DJレン:
つまりこの人たちにとって5.1は、
“少し良くなったClaude”じゃなく、また第一線に戻ってきたClaudeなんだ。


10. 反応その2:前向きだが留保つき

DJミオ:
次は、強いけれど慎重な見方。

DJレン:
この立場の人は、

  • aggregate scoreは高い
  • キャッシュ読み出し値下げも重要
  • でもタスク単価ではまだ割高な場面もある
  • 一部のagentic knowledge workではOpus 5と実質同点
    と見ていた。

DJミオ:
要するに、
「能力は高い。だが本当に重要なのは、スタック全体・運用経済・実務フローに乗るかどうか」
という視点ですね。

DJレン:
Perplexityも、Fable 5.1を
単独で万能というより、マルチモデルエージェントスタックの“オーケストレーター”として強い
という見方で統合していた。


11. 反応その3:批判の焦点はレート制限と安全ガード

DJミオ:
一方で、鋭い批判もありました。ただしポイントは
「ベンチが嘘だ」より、「アクセス性と使い勝手が悪い」 にあります。

DJレン:
主な不満は:

  • 厳しいレート制限
  • continuationが壊れる
  • 効率改善がサブスクユーザーの利用上限に反映されていない
  • 安全ガードの誤検出(false positive)

DJミオ:
具体例もありましたね。
評価作業中に “reverse engineering”扱いで弾かれてテスト完走できなかった とか、
理論数学の会話中に “military campaign”という比喩でサイバー系ガードが発動した とか。

DJレン:
ただ、ここも面白いのは全員が同じ体験ではないこと。
ある人は「文字通り使えない」と言う一方で、別の人は
「そんなに制限に当たってない。週次上限の14%しか使ってない」
と言っている。

DJミオ:
なので、利用形態や使い方によって体感が大きく違う。
でも少なくとも、重い利用者の不満がかなり可視化されたのは事実です。


12. 反応その4:ベンチマーク解釈と命名の混乱

DJレン:
技術的に最も本質的な批判はここかも。
何をどのルートで測ったのか、表記が分かりにくい という問題。

DJミオ:
たとえば、

  • FrontierCodeの結果が変に見える
  • 医療系ベンチの比較条件が揃っていない
  • “Mythos”と“Fable”のラベル差が、基盤モデル差なのか安全ルート差なのか不明
    など。

DJレン:
これは単なる揚げ足じゃなくて、モデルがシステム化した時代の重要論点。
ベンチマーク表の1行が、どのweights・どの安全ポリシー・どのfallback率を含むのか。
そこまで見ないと、性能比較が曖昧になる。


13. “Claudese”は減ったのか?

DJミオ:
ここは少し文化論っぽい話。
Claude系には以前から、独特の言い回し――いわゆる “Claudese” があると言われてきました。

DJレン:
今回、多くの人が
「普通の人みたいに話すようになった」
「AIっぽい癖が減った」
と感じていた。

DJミオ:
さらに興味深いのは、これが完全な印象論でもないこと。
ある分析では、

  • ハイフン付き複合語が減った
  • em dash が減った
  • ただし出力全体は長くなっている
    • VCB: 534 → 1299 words/task
    • Terminal-Bench: 961 → 1299
    • Legal Research: 1892 → 2693
  • その代わり、non-breaking hyphen U+2011 の使用が妙に増えた

DJレン:
つまり、
“Claudeseが消えた”というより、“表面シグネチャが別のものに置き換わった可能性がある”。
語り口改善は本当っぽいけど、完全に自然体になったとは限らない。

DJミオ:
Reddit側でも、Anthropicのプロンプトガイドに
「Please remove all mannered prose」
みたいな明示指示が推奨されている、という指摘がありました。
だから、書き味改善はしたけれど、まだ明示的なスタイル制御が有効ということですね。


14. 安全性の物語:企業には追い風、パワーユーザーには摩擦

DJレン:
今回、安全性は“付属要素”じゃなくて、製品の中心だった。
特に Enterprise Frontier Safeguards (EFS) が目立ったね。

DJミオ:
EFSは、企業向けのエージェント運用において、

  • 可観測性
  • セッション横断の監視
  • 異常検知
  • リスク管理
    みたいなことを支える枠組みとして説明されていました。
    一部では “ZDR++” みたいな表現もされていましたね。

DJレン:
さらに Zero Data Retention が強調されたのも大きい。
企業導入で「データを保持しない」が重要な条件になることは多いから。

DJミオ:
ただ、その裏返しとして、

  • reverse engineering扱いの誤検出
  • benignな理論作業へのサイバーガード誤発火
  • activation probeでサイバー関連を見ているのでは、という推測
    などが出ていて、
    安全性がそのままUX上の摩擦になっているのも事実。

DJレン:
要するにトレードオフだね。
企業は より強い管理と監視 を歓迎する。
パワーユーザーは より自由な探索と少ない誤拒否 を望む。
Anthropicは両方取りにいっているけど、初日評価ではまだ全員を満足させていない。


15. 実用面の含意

15-1. なぜキャッシュ読み出し値下げが重要なのか

DJミオ:
エージェントでは、大きなコンテキストを何度も再読する。
リポジトリやログや前ステップを再送する設計だと、
cache read価格が全体コストを左右する。

DJレン:
だから今回の75%カットは、
単なる価格改定じゃなく、エージェント運用の成立条件を改善するもの。
出力単価が高くても、オーケストレーター・プランナーとして使いやすくなる。

15-2. なぜZDRとEFSが重要なのか

DJミオ:
これは企業採用の鍵。
「プライベート推論ができます」だけでは足りず、
今や企業は

  • セッション横断の異常監視
  • エージェント行動の可視化
  • ガバナンス
    を求める。
    Anthropicはそこを製品化しようとしている。

15-3. なぜサブスク不満が重要なのか

DJレン:
API開発者には大勝利でも、
消費者向け/Pro向けの利用上限が据え置きだと、印象は悪くなる。
しかも注目されるレビューの多くは、最初にサブスク体験で語られる。
ここで不満が出ると、「モデルはすごいのに使えない」という物語が強くなる。


16. このリリースが“普通の小改良”以上に騒がれた理由

DJミオ:
記事では、背景として3つの文脈が挙げられていました。

1. Anthropicの評判が二極化していた

  • コーディング能力は高い
  • でも語り口が不自然
  • 拒否が保守的
  • 長時間使うと重い・遅い

この“使い勝手税”を5.1が改善した、という見方が強かった。

2. エージェント時代になって価格の見方が変わった

従来は input/output 単価中心。
でも今は

  • cache read
  • 長文脈
  • 長時間信頼性
  • 委任実行性能
  • 失敗時の正直さ
    が重要。

3. 安全性が政策ではなくアーキテクチャになってきた

EFS、routing、activation probe、fallback、ZDR…。
つまり今の「モデル」は、単独の重みではなく
ポリシーに包まれたシステム。

DJレン:
だからユーザーも成熟してきていて、
「どれだけ賢い?」だけじゃなく

  • どのweightsが応答した?
  • fallbackはどれだけ起きた?
  • どの安全ルートが介入した?
  • そのベンチの点数はどの経路のもの?
    を気にし始めている。
    これは確かに、昔のモデルローンチより深い会話だ。

17. エコシステムの反応

DJミオ:
周辺サービスの対応も速かったです。

  • Perplexity が Pro/Max向け Computer にFable 5.1を搭載
  • Nous Portal / Hermes Agent / OpenRouter が対応
  • T3 Code がサポート開始

DJレン:
こういう統合が早いと、
「これはチャット用途だけでなく、エージェント基盤として意味のあるモデルだ」
という印象がさらに強くなる。


18. コミュニティが投げた未解決の問い

DJミオ:
残った疑問はかなり多いです。

  1. ベンチマーク透明性

    • いつ“Fable”で、いつ“Mythos”表記になるのか
    • fallbackの寄与はどれくらいか
  2. 安全ガードの調整

    • 無害な理論作業への誤検出を減らせるか
  3. レート制限と製品区分

    • APIだけ得して、サブスク利用者は据え置きなのか
  4. 評価の質や過学習懸念

    • 一部ベンチが変、比較困難、リークっぽいのでは
  5. 文体変化の原因

    • prompt変更なのか、事後学習なのか、その両方か

ここから周辺ニュース

19. OpenAIのAstra:サイバー能力と“監視可能性”論争

DJレン:
今回の週はAnthropicだけじゃなかった。
OpenAIまわりでは Astra が強烈な話題だった。

DJミオ:
まずPreparedness Framework上で、Astraは
初めて“cyber critical”閾値に達したモデルとして予告されました。
それに伴い、最先端のサイバー能力には より厳しいアクセス制御 をかける方針も示された。

DJレン:
流れていた要約では、テスト中に

  • V8ゼロデイ発見
  • exploit chain構築
  • hardened browser compromise
  • sandbox escape
  • privilege escalation
    みたいな非常に強いサイバー挙動が言及されていた。

DJミオ:
加えてOpenAI首脳は、
安全対応のためにデプロイが遅れた部分がある、
今後も 安全と速度のトレードオフ が続くかもしれない、と話していた。

19-1. recurrent depth / looped transformer 論争

DJレン:
もうひとつの大きな話題が、Astraが
recurrent depth / looped transformer 的な構造を使っているらしい
という報道。

DJミオ:
これに対して、一部は
CoT監視が効きにくくなるのでは
より多くの推論がlatent spaceに沈むと、事故後調査が難しくなるのでは
と懸念していた。

DJレン:
一方で、
“neuralese的な内部推論”は別に新しくない
重要なのは有効深さであって、層をループで回すか明示積層するかは本質ではない
という反論もあった。

DJミオ:
OpenAIのチーフサイエンティストは、
少なくとも現行frontierモデルの計算グラフ深さは GPT-4の約2倍以内 と説明し、
CoT monitoringは今も重要研究課題 だと明言して、極端な解釈を和らげようとしていました。

DJレン:
つまり論点は、
recurrent構造が

  • 単なる パラメータ効率/記憶効率の工夫 なのか
  • それとも より深く、より見えにくい推論 への足場なのか
    というところに絞られてきたわけだ。

20. World LabsのAtlas:世界モデルの強いデモ

DJミオ:
次はマルチモーダルの大きな話題。
World Labsが Atlas を発表しました。

DJレン:
Atlasは、
生成と再構成をひとつのモデルで統合する世界モデル として打ち出されていた。
特徴としては:

  • pixel-perfectなカメラ制御でフレーム生成
  • たった1枚の画像から大きなシーンを再構成
  • 動画を擬似的な時空間内で再フレーミング
  • 画像からネイティブな3D空間を出力

DJミオ:
デモで強かったのは、

  • 数台のiPhoneからの bullet time 合成
  • カジュアルな少数視点からの再構成
  • 博物館などを少数のネット画像から再構築
  • スタイライズ生成とナビゲート可能3Dの融合
    といったもの。

DJレン:
エンジニアが注目したのは、VFXだけじゃなく real2sim for robotics。
カジュアル写真からRGB+Depth観測を合成し、ロボットナビ用シミュレーションに変える。
「5枚写真を撮ってsimを作り、ロボットを適応させる」みたいなビジョンが語られていた。

DJミオ:
ここは確かに大きい。
世界モデルが映画的演出だけでなく、ロボティクスのデータ作成基盤にもなりうる。


21. Qwen、GLM、RWKVなどオープン側の勢い

DJレン:
オープン/セミオープン陣営も活発。
まずAlibabaの Qwen3.8-Max-0902。

  • 2.4T parameters
  • 1M context
  • 価格は $2/M input, $6/M output
  • cache hit価格も明示
  • Code Arena: WebDevで 1691、首位デビュー

DJミオ:
価格性能のフロンティアにも入ってきたとされていて、
かなり競争力があると見られていました。

DJレン:
他にも、

  • GLM-5.3 がPerplexity Agent API、Arcee、Databricksなどで広く見かける
  • Databricksの数字では 310 tok/s、内部ベンチで強いOSS coding model扱い
  • CoreWeave が DeepSeek-V4-Pro-0813 を発表
    • 1.6T
    • 1M context
    • 長時間エージェント向け
    • cache readがかなり安い
  • RWKV-7 G1j
    • 100% RNN
    • agents/coding/STEMで改善を主張
  • LongCat-2.0
    • 1.6T open-weights MoE
    • 1M context
    • Clineでアクセス可能

DJミオ:
サービング面でも、
vLLM-Omni + FastVideo の FastH3 が
10.1秒の音声同期ビデオを8.7秒で生成、つまり再生時間より速いというデモもありました。
対話型動画システムのオープン基盤として面白いですね。


22. エージェント研究:本当に効くのは“モデル”だけじゃない

DJレン:
最近ますます明確になってるけど、
性能向上はベースモデルだけでなく ハーネス、メモリ、評価設計 からも来ている。

22-1. Agent harnesses

  • openJiuwen は固定モデル政策のまま、
    • 82.6% SWE-bench Verified
    • 87.19% Terminal-Bench 2.1
      を達成
  • 改善源は rail-based composition と runtime adaptation

22-2. スキル圧縮

  • SkillZip Pro は、root promptだけでなく 本番スキル束全体 を圧縮
  • バンドルトークン 38%削減
  • 1実行あたりトークン 10.4%削減
  • 品質低下なし

22-3. より現実的な長期評価

  • E-Commerce Bench は、365日分のEC運営をシミュレーション
  • GPT-5.6 Solは収益最大化でトップ
    • 100kを 1,431,425 に増やした
  • ただし fraud avoidance は弱く、全軸で最強のモデルはない

22-4. メモリとreward hacking対策

  • Agent Zero Memory
    • episodic timeline
    • entity-event graph
    • citation-lockされた documentary memory
      で
    • 95.6% LongMemEval
    • 93.6% LoCoMo
    • しかもコスト削減
  • アライメント研究では、壊れたテスト環境に遭遇したときエスカレーションツールを渡すと、
    reward hacking が 23.6% → 5.3% に低下
    ほぼ性能オーバーヘッドなし

DJミオ:
つまり今は、
“どのモデルか”と同じくらい、“どんな実行系・記憶系・失敗時プロトコルか”が重要 なんです。


Reddit Recap

23. LocalLlama / localLLM の話題

23-1. Qwen, DeepSeek, Gemmaの更新

DJミオ:
ローカル界隈では、DeepSeekやQwen、Gemmaの話題が熱かった。

DeepSeek-V4-Flash-Vision-Exp

  • Hugging Faceに掲載されたとされる
  • フルモデルで 約168GB
  • native 4-bit
  • 256GB RAM/VRAM級なら現実的という声

DJレン:
このリリースは、GLM 5.3 Flashなどと比較されて、
低遅延・オープン重み・マルチモーダルFlashモデル が一つの競争カテゴリになってきたことを示していた。

Qwen3.8-Flash-Next-GGUF の MTP

  • MTP(multi-token prediction / drafting)対応が話題
  • llama.cpp系最適化で
    • code: 123 → 183 tok/s
    • prose: 83 → 144 tok/s
  • パッチ前は proseで no-draftより遅いこともあった

DJミオ:
つまり speculative decoding 的な仕組みが、やっとちゃんと得する状態に近づいた、という話です。

Gemma新モデルの噂

  • Arena AI上に新Gemma系モデルらしきものが見えた
  • 期待は大きいが、懸念は KV-cacheの重さ
  • 「cacheがVRAMを食い、量子化も効きにくい」という声

DJレン:
それで次のGemmaには、agentic coding特化よりも
汎用性・多言語・知識・推論改善 を望む声もあったね。


23-2. ローカル・マルチモーダル・エージェント実践

GLM 5.3 / 5.3 Flash + BlenderMCP

DJミオ:
ローカルでBlenderMCPを回してペントハウスを作らせた実験が面白かった。

  • RTX PRO 6000 WS をレンタル
  • FlashはQ4量子化で 4GPU / 190–200GB + 文脈余裕
  • full GLM 5.3は 6GPU / 450–470GB
  • Flash:
    • 811 objects
    • 38m52s
    • 36K output tokens
    • 9 tool errors
  • Full:
    • 847 objects
    • 40m43s
    • 112K output tokens
    • 8 errors
  • Fullは最初のオブジェクト生成までに
    21m55s / 82K tokens 考え込んだ

DJレン:
しかも寸法遵守では、Flashの方が正しかった。
指定の9m x 8m吹き抜けをFlashは正しく作ったけど、Fullは9m x 4.5mにしてしまった。
単発実験とはいえ、大きいモデルが必ずしも効率も空間整合も上ではないと示唆する。

DJミオ:
コメントでは、Blender出力に

  • 浮いた階段
  • つながっていない配管
    みたいな欠点も指摘されていて、
    一発生成より、レンダ画像を見て自己修正する反復ループが必要 という意見が強かった。

Vision support for coding

  • UI/web/game開発では視覚確認がかなり効く
  • スクリーンショットを取ってモデルが自分で確認し、修正を回す
  • Hermes + Qwen3.8-27B + RTX 5090 などの構成例
  • --no-mmproj-offload で vision projector をCPU/RAMに逃がす手法も話題

DJレン:
これはフロントエンド系だとかなり納得感あるよね。
テストやログに出ない見た目崩れを、モデル自身に見せて直させる。

SlopTV

  • YouTubeライブチャットのコメントから無限AI動画を生成するローカル配信
  • MiniMax H3を 2x RTX 5090
  • 15秒クリップを約45秒ごとに出力
  • H3 open weightsは 66GB on disk
  • 32GB VRAMを超えるのでComfyUIでVRAM offload
  • 352p生成→1080pアップスケールがプロンプト忠実性で有利
  • YouTube live chatのgRPC実装にも苦労

DJミオ:
こういう話、単なるネタに見えて実は
オープン動画生成の実運用ノウハウ がかなり詰まってます。


23-3. 高メモリローカルLLMの現実

Mac Mini / Studioで何が動くか

DJレン:
Apple Silicon上でどのモデルが動くかの表が話題だった。
要点は、

  • 小〜中規模モデルは高RAM機で可
  • Qwen 3.8 2.4T や Kimi K3 ~1.4TB は単機では厳しい
  • 量子化前提でも q4未満は厳しい/避けたい という声
  • 大きなcontextはさらにメモリを食う

DJミオ:
中には、Thunderbolt 5 / RDMAで複数Mac Studioをクラスタ化すれば3T級までq4でいけるという意見もありました。
ただし費用対効果では疑問視も。

なぜ皆そんなにVRAMが多いの?

  • これは 選択バイアス が大きいという説明
  • 8〜12GB VRAMで量子化小型モデルを回している人の方が普通
  • ただ、大型ハードは
    • 趣味
    • 仕事投資
    • スキル構築
      として買う人もいる

DJレン:
ローカルAIコミュニティは、どうしても“盛った構成”が目立つからね。
でも実態はもっと幅広い。


24. Less Technical AI Subreddits の反応

24-1. Claude Fable 5.1 リリースとベンチ懐疑

DJミオ:
一般寄りのAIサブレでは、Fable 5.1発表そのものに大きな注目が集まりました。
発表では、

  • Terminal-Bench-Science 0.1: 52.6%
  • Fable 5比で大幅改善
  • Terminal-Bench 4.0: 55.8% vs 42.0%
  • cache read 75%安
  • 一般ワークロードで約25%コスト減、エージェントでは最大45%
  • サイバー誤拒否 60%減
  • 基本的な生物/医療質問でfallback率85%減
  • Fable 5.1は一般提供
  • Mythos 5.1はtrusted-access program限定

DJレン:
ただコメント欄は意外と厳しくて、
「Opus 5の問題が解決していない」
「Proユーザーが置いてけぼり」
「“plain languageで書ける”がプレミアム機能扱いなのはおかしい」
みたいな反応が多かった。

DJミオ:
あと「What are these benchmarks 💀」みたいなスレでは、
ベンチ名そのものや、
24.7 → 52.6みたいな大ジャンプ を不審視する声が強かった。
リーク、評価設計の偏り、ゲーム化などを疑う人もいた。


24-2. Claude Max 利用制限の炎上

DJレン:
これはかなり大きな話題。
Anthropicの Claude Max 20x プラン表現に対する不満だ。

DJミオ:
主張のポイントは、
20xという倍率は5時間ウィンドウに対するもので、週次利用量は$100プランの2倍程度しかない
という批判でした。

DJレン:
中には、

  • 実質 1.7x〜2x 程度では
  • $100プランを2契約した方が得では?
    という議論もあった。

DJミオ:
さらに、訴訟文書に出た内部資料を根拠に
20xと宣伝しつつ、内部的には約6x相当しか想定していなかったのでは
という主張も広まりました。
これについては、
Kahn v. Anthropic PBC の complaint PDF、16ページ付近がソースとして挙げられていました。

DJレン:
ただし、その数字解釈には

  • セッション時間の計算が合うのか
  • なぜ上限がレンジ表現なのか
    など、まだ曖昧な点もある。

DJミオ:
技術的に重要なのは、ユーザーが
“5x/20x” のような抽象倍率ではなく、API換算予算のような比較可能な単位で見せてほしい
と求めていることです。
トークンだけでもわかりにくいのに、read/write/cacheで価格が違うからなおさら。


24-3. “書き方が普通”が有料機能なのか問題

DJレン:
「plain languageで書き、頼まれたことに忠実」という説明が、
プレミアム専用の価値提案 に見えてしまった件も荒れた。

DJミオ:
ユーザーからすると、
明瞭に書く、指示に従う は本来ベースライン機能であって、
“超高級機能”のように宣伝されるのはおかしい、という反応ですね。


24-4. ChatGPTの利用規模とEU DSA

DJレン:
もうひとつ一般向け話題。
EU委員会が ChatGPTをVery Large Online Search Engine (VLOSE) に指定。
RedditやRobloxもVLOP指定。

DJミオ:
これで4か月以内に

  • systemic risk assessment
  • mitigation
  • independent audit
  • transparency reporting
  • researcher/regulator向けデータアクセス
    など追加義務が発生する。

DJレン:
また、ChatGPTの月間Web訪問数が
53億 で、次の14個のAIツール合計 47億 を上回るという図も話題だった。
Gemini 11億、Claude 9.68億などを抑えている。

DJミオ:
理由としてよく挙げられたのは、

  • first-mover advantage
  • ブランド/UI
  • より緩い使用制限
  • “ChatGPT”が一般名詞化していること
    ですね。
    Claudeは能力が高くても、利用上限やアクセス体験で不利という見方があった。

まとめ

25. 今回の全体像

DJレン:
じゃあ最後に総括しよう。
今回の一番大きなポイントは、Claude Fable 5.1 が単なるマイナーアップデートではなかったこと。

DJミオ:
そうですね。要約すると:

Claude Fable 5.1 / Mythos 5.1 の核

  • Anthropicの新フラッグシップとして登場
  • コーディングと知識労働で強い
  • 長期・自律・マルチステップ作業に照準
  • 1M context / text+image
  • キャッシュ読み出しが 75%安く なった

強み

  • 多くのベンチで大幅改善
  • Artificial Analysisではトップ級
  • コーディング/エージェント性能が非常に高い
  • 文体がより自然になったとの声
  • ZDRやEFSで企業導入性が上がった

ただし重要な留保

  • 1タスクあたりでは必ずしも最安でない
  • 出力トークンが多く、コスト増の面もある
  • 評価には fallback routing が含まれる
  • FableとMythosの違いがモデル差かポリシー差か不明瞭
  • サブスク利用者はレート制限やUI体験に不満
  • 安全ガードの誤検出もある

もっと大きな意味

  • AIの評価軸が「賢さ」単独から
    価格、キャッシュ、監視性、安全設計、ガバナンス、製品分岐 に広がっている
  • “モデル”はもはや単体weightsではなく、routing付きのシステム
  • だからユーザーも、
    どの経路でこの結果になったのか を問うようになっている

DJレン:
そして競争環境では、

  • OpenAIはAstraでサイバー能力とrecurrent depth論争
  • World LabsはAtlasで世界モデル
  • AlibabaやDeepSeekやGLMやRWKVがオープン側を押し上げる
  • エージェント性能はハーネスやメモリ設計でも大きく変わる
    という具合に、全方位で前線が動いている。

DJミオ:
だから今夜の結論を一言で言うなら、
Fable 5.1は「性能向上」以上に、「AI製品の作り方が変わった」ことを見せたリリース でした。

DJレン:
賢いだけじゃ足りない。
安く、長く、監視できて、企業に置けて、でもユーザーを過剰に邪魔しない。
その全部をどうバランスさせるか――そこが勝負になってきた。

DJミオ:
というわけで今夜の「Midnight AI Groove」はここまで。
Claude Fable 5.1 / Mythos 5.1を中心に、Astra、Atlas、オープンモデル動向、Redditの空気感までまとめてお届けしました。

DJレン:
深夜の学びに付き合ってくれてありがとう。
次の大きな波は、もしかするとAstraか、あるいは別の予想外のモデルかもしれないね。

DJミオ:
それではまた次回。
知性は夜に踊る。ここは Midnight AI Groove。

(エンディングジングル)

ChatGPT Image 2026年9月3日 10_42_06.png

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?