0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

AIエージェントは「画面専用」を卒業する? Holo4がGUI・コード・MCP・APIを1モデルで横断

0
Posted at

Holo4記事サムネイル

2026年9月28日、フランス発のAI企業H Company(H社)が、コンピューター操作向けモデル群「Holo4」を公開しました。

この発表で面白いのは、単に「画面をクリックできるAI」が強くなったことではありません。Holo4は、同じモデルが状況に応じてGUI操作・コード実行・MCP・API呼び出しを横断する設計です。

人間の仕事は、ブラウザーだけでも、APIだけでも終わりません。画面しかない古い業務ソフトを触り、必要なら端末でデータを加工し、MCPやAPIで別システムへ渡す。Holo4は、この混ざり合った現実の仕事へ寄せてきました。

何が変わったのか

従来のコンピューター操作AIは、「画面を見るのは得意だがAPIを使えない」「ツール呼び出しは得意だが画面しかないアプリで止まる」といった分断がありました。

Holo4は、次の4つを同じモデルで扱います。

  • GUI:スクリーンショットを見てクリックや文字入力を行う
  • コード:端末でコードを生成・実行する
  • MCP:共通規格を通して外部ツールを呼ぶ
  • API:サービスへ直接アクセスする

Holo4が横断する4つの操作面

H社は、Web・デスクトップ・Android・コードサンドボックス・業務APIで、同じモデルを同じ呼び方で使えると説明しています。操作面ごとに別モデルを選ぶ手間を減らせる点は、複数AI協働や業務自動化で大きな意味があります。

2つのモデルと、見落とせないライセンス差

Holo4には、27BのDenseモデルと、総パラメーター35B・稼働3BのMoEモデルがあります。両方ともH社のAPIで利用でき、重みもHugging Faceで公開済みです。

ただし、ライセンスが違います。

  • Holo4 27B:CC BY-NC 4.0。重みの商用利用には制約がある
  • Holo4 35B-A3B:Apache License 2.0

Holo4の2モデルとライセンス

公式サイト記載のAPI価格は、100万トークン当たり次の通りです。

モデル 入力 キャッシュ入力 出力
Holo4 27B $0.40 $0.04 $3.00
Holo4 35B-A3B $0.30 $0.03 $2.00

最大コンテキスト長は、どちらも設定上262,144トークンです。無料枠では旧モデルが案内され、Holo4のAPI利用はクレジット追加が必要と公式Quickstartに記載されています。

性能はどこまで確認できたのか

H社の発表では、長時間のコンピューター操作を測るOSWorld 2.0で、Holo4 27Bが61.7%、35B-A3Bが30.9%とされています。27Bは、H社が引用するGPT-5.6 Solの66.2%に近い数字です。

しかし、ここは慎重に読む必要があります。

H社自身も、モデルごとにリリース、ハーネス、タスク部分集合が異なると明記しています。さらに、AutomationBenchではHolo4を自社ハーネスの公開セットで測り、他モデルは非公開セットの公式順位を参照しています。数字を横一列に並べても、完全な同条件比較ではありません。

一方で、H社は公開ベンチマークの全実行軌跡を公開しました。最終スコアだけでなく、各ステップを再生・ダウンロードできるのは、AIエージェントの評価を「自己申告」から検証可能なEvidenceへ近づける動きです。

Holo4で確認できたEvidenceの境界

なお、モデルカードにあるOSWorldの85.2%/80.8%と、OSWorld 2.0の61.7%/30.9%は別の評価です。記事内では混同していません。

どうやって作ったのか

H社は、製品マニュアルやWeb画面、公開ソフトウェアから、検証器つきの操作課題を自動生成する「Agentic Task Factory」を構築しました。

公開情報では、約1万件の課題を作成し、内訳はWebアプリ約4,000件、MCPサーバー約3,000件、デスクトップ/OS約3,000件です。手つかずの初期状態では失敗し、正解状態では成功し、惜しい誤答を拒否できる検証器だけを残す設計です。

学習は、1270億トークンの教師あり学習に加え、長時間タスクの強化学習を実施。デスクトップ/Web担当と、端末/MCP/API担当の2つのLoRA専門家を作り、最後に1モデルへ統合したと説明しています。

ここでも重要なのは、モデル単体ではありません。数百ステップの文脈を管理するメモリや、デスクトップ上のシェルを含む実行ハーネスも作り直しています。

MORIにとって、なぜ面白いのか

Human OSで重視してきた「役割に合わせてモデルを選ぶ」「モデルとハーネスを分離する」「完了をEvidenceで検証する」という考え方と、Holo4はよく響き合います。

特に面白いのは、Work Pattern Portabilityです。操作先がGUIからMCPへ変わっても、仕事の目的と検証条件を持ったまま同じモデルが移動できるなら、人間がツール間をつなぐ負担を減らせます。

一方で、モデルが多くの操作面を横断できるほど、権限境界は重要になります。Holo4が「何でも触れる」ことと、「触ってよい」ことは別です。外側のハーネスで、許可されたファイル・通信・API・認証情報だけに絞り、操作ログと結果を検証する設計が必要です。

まとめ

Holo4の新しさは、GUI専用モデルのスコア更新ではありません。画面・コード・MCP・APIを、1つのモデルと共通ハーネスで横断しようとしたことです。

さらに、重み、API、ハーネス、評価軌跡まで公開されました。これは、実装と検証を始められる状態になったという意味があります。

ただし、性能値は主にH社の測定で、独立した再現検証はまだ確認できていません。この記事ではモデルカードと公開資料を読みましたが、重みのダウンロードやローカル実行、API課金・導入は行っていません。

「1つのAIが仕事の道具を渡り歩く」未来は、かなり近づきました。次に問われるのは、どこまで動けるかだけでなく、誰が権限を与え、何をEvidenceに完了と認めるかです。

出典

0
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
0
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?