Meta Muse Spark 1.1:エージェンティックコーディングの新たなリーダー
Metaは今週、Muse Spark 1.1 をリリースし、Mark Zuckerberg自身が3年ぶりにXに投稿して発表した。このモデルは、エージェント性能とコーディング能力において市場最強を主張しており、OpenAIのGPT-5.6やAnthropicのClaude Opus 4.8に正面から挑む。
その数字は無視できない:Muse Spark 1.1はMCP Atlas、JobBench、Humanity's Last Exam、Finance Agent V2で#1を獲得。Vals AI Harvey法務エージェントベンチマークでは20%(Claude Fable 5の11%に対して)を記録し、競合をほぼ倍のスコアで上回る。100万トークンのコンテキストウィンドウを持ち、デスクトップ、ブラウザ、モバイルでのコンピュータ操作をサポートする。
価格設定は攻撃的で、入力トークン100万あたり$1.25、出力トークン100万あたり$4.25。現在はクローズドソースで提供される。Alexandr Wang(Scale AI創業者、現Meta Super Intelligence Lab長)は「エージェントタスクとコーディングにおいて最強のモデル」と評した。
— Meta Blog · ThursdAI
🔗 Meta Blog · ThursdAI Coverage · Zuckerberg on X
NVIDIA Vera Rubin:量産開始をJensen Huangが確認
Jensen Huangは、NVIDIAの次世代AIチッププラットフォームVera Rubinがすでに量産段階に入ったことを確認し、延期の噂を一蹴した。KeyBanc Capital MarketsとSemiAnalysisは熱問題やHBM認証の遅延を懸念していたが、Huang本人が「それらの報道は誤りだ」とBloombergに語った。
並行してNVIDIAは全米でダークファイバーの買い占めを進めている。Wolfe Researchによると、100ペアの双方向ファイバー(計200本)を確保し、DWDM技術により総帯域7.6Pb/sを達成——毎秒200万本の1080p映画を転送できる規模だ。3年間の総投資額は50〜100億ドルと見積もられている。
一方、NVIDIAの中国市場シェアは2023年の95%から推定8%に急落。米国の輸出規制とDF1000(14nmプロセス、BF16で520TFLOPS、完全国産サプライチェーン)のような国内代替品の台頭が競争環境を一変させた。
— NVIDIA (Bloomberg) · Wolfe Research · Bernstein Research
🔗 Bloomberg: Vera Rubin Mass Production · Wolfe Research · Bernstein Research
OpenAI GPT-Live:リアルタイム全二重音声が変える対話体験
OpenAIはGPT-Liveをリリースした。従来のターンベース方式(話す→待つ→応答を聞く)ではなく、全二重通信を実現し、モデルは聞きながら話すことができる。割り込み、間の理解、「うんうん」「わかった」といったフィラーフレーズによる傾聴表現、考え込んだときの待機までも自然にこなす。
GPT-Live-1(有料ユーザー向け)とGPT-Live-1 mini(無料ユーザー向け)の2バリエーションで、Web、iOS、Androidに順次展開中。OpenAIは週間1.5億人以上がChatGPTの音声機能を利用していると発表しており、これは今月最大のコンシューマーAI製品ローンチと言える。
GPT-Liveはテキストモデルの上に音声インターフェースを乗せるのではなく、ストリーミングモデルとしてゼロから設計されており、毎秒複数回の判断で発話・聴取・中断・ツール呼び出しを切り替えられる。バックグラウンドではGPT-5.5が複雑な推論を担当する。
— OpenAI
🔗 OpenAI GPT-Live Announcement · OpenAI Newsroom
Anthropic、Claudeの「意識的処理空間」J-Spaceを発見
Anthropicは7月6日、Claudeモデルの内部に人間の脳の「グローバルワークスペース」に酷似した認知構造が存在することを明らかにした。J-Spaceと名付けられたこの神経パターンの集合は、マルチステップ推論や主観記述タスク、高次思考を処理する際に活性化されるもので、モデルの大部分の自動的・無意識的な演算とは明確に区別される。
Google DeepMindの解釈可能性チームリーダーNeel Nandaは、Qwen3.6-27Bモデルで全てのコア結論を再現したことを確認し、「LLMが内部に認知空間を持つことの強力な証拠を提供する極めて価値のある論文」と評価した。
J-SpaceはClaudeの推論プロセスをリアルタイムで監査することを可能にする。金融や医療のような高規制業界にとって、これはAI説明可能性の聖杯だ。Anthropicはコードをオープンソース化し、Neuronpediaと協力してインタラクティブデモを提供している。
— Anthropic Research · Google DeepMind
🔗 Anthropic J-Space Paper · DeepMind Replication
Mistral Leanstral 1.5:形式検証を100%達成、1問題あたり$4
Mistral AIは7月2日、Leanstral 1.5をリリースした。Lean 4形式検証に特化したモデルで、Apache 2.0ライセンスで公開されている。119BパラメータMoE(活性化6B)、miniF2Fで検証・テストセットともに**100%**を達成。PutnamBenchでは672問中587問を解決し、大学院レベルの代数ベンチマークFATE-H(87%)とFATE-X(34%)で新記録を樹立した。
最も注目すべきはコストだ:PutnamBenchの問題あたり約**$4**で、競合の高予算定理証明器の$300+と比較して75倍のコスト削減を実現している。
実際の影響も大きい。57のオープンソースリポジトリをスキャンし、47のプロパティ違反と11の本物のバグを発見。そのうち5件は未報告だった。発見の一例:varintデコードライブラリの符号関数における整数オーバーフローで、デバッグモードではクラッシュ、リリースモードではデータを静かに破壊するものだった。
— Mistral AI · HuggingFace
🔗 Mistral Leanstral 1.5 Announcement · HuggingFace Model
NVIDIA + HuggingFace:ロボティクスAIをオープン化、エージェント向け10兆トークンを公開
NVIDIAとHuggingFaceは、ロボティクス向けオープンソース基盤モデルの共同開発を発表した。Isaac GR00T 1.7推論ビジョン言語行動モデルとIsaac Teleopデータ収集フレームワークをHuggingFaceのLeRobotエコシステムに統合する。
同時にOpen Data for Agentsイニシアチブも発表:エージェント構築のために特別に設計された10兆以上の事前学習トークンと数百万のポストトレーニングサンプルを公開。地域固有の合成ペルソナやNemotron Post-Training v3 Prompt Atlasも含まれ、組織がプロプライエタリデータを公開せずにエージェントモデルをファインチューニングできるようにする。
これらの動きは、ヒューマノイドロボティクスとAIエージェント開発の両方における最大のボトルネック——高品質で多様な訓練軌跡へのアクセス——に取り組むものだ。
— NVIDIA · HuggingFace
🔗 NVIDIA + HuggingFace Robotics · HuggingFace Open Data for Agents
バイトダンス EdgeBench:AIエージェントの学習速度が四半期ごとに倍増
バイトダンスのSeedチームは7月7日、衝撃的な発見を発表した:AIエージェントの環境内学習速度は約3ヶ月ごとに倍増している。
論文arXiv:2607.05155で紹介されたEdgeBenchは、134の実世界長期タスクをカバーするベンチマークプラットフォーム。5つのフロンティアモデルにわたる累計38,000時間のエージェント環境インタラクションデータを分析した結果、学習の進展がロジスティックシグモイド曲線に従い、R² = 0.998のほぼ完全な適合を示した。
2025年9月から2026年4月にかけて、エージェントが環境インタラクションから学習する速度は四半期ごとに倍増した。この傾向が続けば、本番デプロイされたエージェントが新しい状況に適応するために必要な人間の監督が劇的に減少する可能性がある。
— ByteDance Seed · arXiv