1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?

【速報】GPT-6 Astraのロボット制御ベンチマーク結果が公開! Fable 5.1と比較して成功率95%、かつコスト・トークン数を大幅削減

1
Posted at

先週の木曜日にリリースされた GPT-6 Astra について、早くも初の実機ベンチマーク数値が公開されました。

既存モデルである Fable 5.1 との比較において、Astra は単なる性能向上だけでなく、出力トークン数と実行コストの劇的な削減を実現していることが明らかになっています。

本記事ではその詳細な結果をまとめます。

🎥 デモ動画
(※ここにデモ動画のURLまたは埋め込みコードを挿入してください)

Demo: https://youtu.be/FqZ3ypFx9I4

📊 テスト条件

  • 比較モデル: GPT-6 Astra vs Fable 5.1
  • 試行回数: モデル・タスクあたり 20回ずつ
  • 評価指標: 成功率、1回あたりの出力トークン数、1回あたりの実行コスト

🏆 ベンチマーク結果

1. ブロックをボウルに入れるタスク(Block into bowl)

基本的なロボット制御タスクにおいて、Astraは圧倒的な性能と効率性を示しました。

指標 GPT-6 Astra Fable 5.1 改善幅
成功率 95% (19/20) 40% (8/20) +55% pt
出力トークン数 6.2倍 少ない 基準 大幅削減
実行コスト 2.3倍 低い 基準 大幅削減

2. パズルトイタスク(Puzzle toy / 高精度制御タスク)

より難易度が高く、精密な操作が要求されるタスクでは両モデルとも苦戦しましたが、ここでも Astra の効率性の高さが際立ちました。

指標 GPT-6 Astra Fable 5.1 改善幅
成功率 10% (2/20) 10% (2/20) 同率
出力トークン数 3.9倍 少ない 基準 大幅削減
実行コスト 1.6倍 低い 基準 削減

💡 考察・所感

今回の結果から読み取れる最大のポイントは、「次世代モデルは単に賢くなるだけでなく、リソース効率の最適化が徹底されている」 という点です。

  • 簡単なタスクでは成功率を劇的に向上させつつ、コストとトークンを桁違いに削減できている。
  • 難易度の高いタスクで成功率が頭打ちになる状況下でも、無駄な推論(トークン生成)を省き、コストを抑えた実行が可能である。

これは、エッジデバイスやリアルタイム性が求められるロボット制御の現場において、Astra のアーキテクチャが非常に大きなアドバンテージを持つことを示唆しています。


🔗 参考情報

本記事の数値は、以下の X (旧Twitter) スレッドを参考にしています。詳細な議論や追加のコンテキストはこちらをご確認ください。


タグ: #AI #ロボット制御 #GPT6 #Astra #機械学習 #LLM #パフォーマンス最適化


The uploaded file format is not supported.

1
0
0

Register as a new user and use Qiita more conveniently

  1. You get articles that match your needs
  2. You can efficiently read back useful information
  3. You can use dark theme
What you can do with signing up
1
0

Delete article

Deleted articles cannot be recovered.

Draft of this article would be also deleted.

Are you sure you want to delete this article?