新しい生成AIの発表には、数字の並んだ比較表が付いてきます。比較表を読むときに見るところは2つです。
しかし、表に並ぶ英語の名前が何を測っているのかは、表のどこにも書かれていません。
Googleが2026年9月30日に発表したGemini 4 Argonの比較表を例に、18のベンチマークの中身と、表の読み方を並べます。
生成AIのベンチマークとは、決まった課題でAIを採点した点数
生成AIのベンチマークは、同じ課題をどのAIにも解かせて比べる試験です。ベンチマークの%は、用意された課題のうち、AIが合格した割合です。
たとえばDeepSWE v1.1は113問のプログラム修正課題で、Gemini 4 Argonの77.9%は約88問で合格したことを示します。課題を作るのは、Vals AIやZapierのような外部の会社や大学です。
Gemini 4 Argonの比較表に並ぶ18のベンチマーク
18のベンチマークは、それぞれ別の仕事を測っています。以下のとおりです。GraphWalksだけは文章の長さ別に2行あります。
| ベンチマーク | 分野 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | 何を測っているか |
|---|---|---|---|---|---|---|
| Vals Index | 知識労働 | 68.9% | 63.1% | 65.8% | 67.0% | 金融・プログラミング・法務・税務の8つの試験をまとめた総合点(Vals AI) |
| AutomationBench | 知識労働 | 51.3% | 41.4% | 31.4% | 42.5% | 複数の業務アプリをまたぐ営業・人事などの事務作業を、最後までこなせるか(Zapier) |
| Vals Finance Agent v2 | 知識労働 | 65.4% | 53.5% | 58.9% | 58.6% | 企業の開示書類を検索して読み、数字を計算して答える財務アナリストの仕事(Vals AI) |
| Harvey’s Legal Agent Benchmark | 知識労働 | 19.6% | 5.4% | 6.7% | 3.8% | M&Aや知財の法務案件で成果物を仕上げる。採点項目を全部満たした案件だけが合格(Harvey) |
| DeepSWE v1.1 | コーディング | 77.9% | 74.1% | 67.4% | 74.2% | 実在するプログラム113件の修正課題で、公開していないテストに通るか(Datacurve) |
| FrontierSWE v2 | コーディング | 55.0% | 65.5% | 56.3% | 62.3% | 1問に20時間かける長い開発課題。出来に応じて部分点(Proximal Labs) |
| Vibe Code Bench | コーディング | 91.9% | 89.6% | 90.3% | 90.3% | 仕様書からWebアプリを一から作り、実際に動くか(Vals AI) |
| Terminal-bench 4.0 | コーディング | 57.4% | 58.2% | 57.9% | 66.4% | コマンドを打つ画面で、実務の課題を解けるか(Terminal-Bench) |
| PostTrainBench | 機械学習 | 45.3% | 44.3% | 40.2% | 49.3% | 小さいAIモデルを10時間で鍛え、どれだけ伸ばせたか(テュービンゲン大学など) |
| Terminal-Bench Science 0.1 | 科学・数学 | 57.6% | 68.1% | 52.6% | 63.3% | 生命科学や物理などの研究作業を、コマンドを打つ画面で解く(スタンフォード大学など) |
| LABBench2 | 科学・数学 | 88.8% | 85.4% | 68.6% | 73.1% | DNA配列の設計など、生物学研究の作業(Edison Scientific) |
| RiemannBench | 科学・数学 | 76.0% | 72.0% | 65.6% | 69.6% | 博士レベルの未公開の数学問題の正解率(Surge AI) |
| GraphWalks(12.8万トークンまで) | 長文の読み取り | 99.7% | 98.7% | 91.4% | 90.6% | 長い文章に埋め込んだ大量のつながりをたどり、条件に合う項目を漏れなく挙げられるか(OpenAI) |
| GraphWalks(25.6万〜100万トークン) | 長文の読み取り | 84.2% | 71.8% | 65.0% | 66.8% | 同じ課題を、さらに長い文章で解く |
| Agent’s Last Exam | パソコン操作 | 39.5% | 34.2% | — | 38.2% | 55業種の実務を、専門ソフトを操作して満点で仕上げられたか(カリフォルニア大学バークレー校など) |
| OSWorld-2.0 | パソコン操作 | 69.2% | 72.6% | — | — | 人がやると1時間半ほどかかる業務を、パソコン操作でこなす。部分点あり(香港大学など) |
| Chartography | 画像・動画 | 71.6% | 71.0% | 46.2% | 66.3% | 医療・金融・工学の専門的なグラフを、道具を使わずに読み取る(Surge AI) |
| LVBench | 画像・動画 | 91.7% | 87.5% | 79.7% | 83.7% | 1時間を超える長い動画を見て、4択問題に答える(清華大学など) |
| CWE-bench v1 | セキュリティ | 68.0% | 68.0% | 58.0% | 67.0% | 実在するソフトの脆弱性を自力で見つけ、機能を壊さずに直せるか(Collinear AI) |
数値はGoogleが発表した比較表、測り方はGoogleの評価方法の資料と各ベンチマークの公式ページによります。「—」は数値が載っていない欄です。
比較表は、自分の仕事に近い行だけを比べる
見るところの1つ目です。モデルどうしは、自分の仕事に近い行の数字だけで比べます。Gemini 4 Argonは19行のうち14行でいちばん高い数値ですが、プログラム開発を測るTerminal-bench 4.0では、Claude Opus 5.5の66.4%がGemini 4 Argonの57.4%を9.0ポイント上回っています。
仕事ごとに見る行は、以下のとおりです。
| やりたい仕事 | 見る行 |
|---|---|
| 業務アプリをまたぐ事務作業の自動化 | AutomationBench |
| 決算書や開示資料の読み取り | Vals Finance Agent v2 |
| 契約書などの法務文書の作成 | Harvey’s Legal Agent Benchmark |
| プログラムの修正や開発 | DeepSWE v1.1、Terminal-bench 4.0 |
| 長い資料をまとめて読ませる | GraphWalks |
| グラフや図表の読み取り | Chartography |
| 会議の録画など、長い動画の要約 | LVBench |
比較表は、数字の測り方も確かめる
見るところの2つ目です。同じ表の中に、Googleが自分で測った数字と、外部の順位表から取った数字が混ざっています。比較に影響しやすいものは、以下のとおりです。
| ベンチマーク | Googleの資料に書かれた測り方 |
|---|---|
| Terminal-bench 4.0 | Gemini 4 Argonだけ、Googleが自分で測った値 |
| Terminal-Bench Science 0.1 | Gemini 4 Argonは、採点の待ち時間を6倍にして測った値 |
| OSWorld-2.0 | Gemini 4 Argonは、3回測った中の最大値 |
| LVBench | 読ませた動画のコマ数がモデルごとに違う |
条件がそろっていない行では、数ポイントの差を実力の差と言い切れません。
候補を絞ったら、自分の業務で試す
候補を2つに絞ったら、自分の業務の同じ作業を10件ずつ任せ、人が手を貸さずに終わった件数を比べます。ベンチマークの課題には、自分の会社の書類や手順が入っていないからです。
よくある疑問
Q:点数がいちばん高いAIを選べば、仕事で失敗しないのでしょうか。
A:失敗しないとは言えません。法務を測るHarvey’s Legal Agent Benchmarkでは、いちばん高いGemini 4 Argonでも19.6%で、5件のうち4件は採点項目のどれかを満たせていません。
Q:比較表の「—」は何を意味しますか。
A:そのモデルの数値が載っていない欄です。その仕事が得意か苦手かは読み取れません。
Q:名前の後ろの「v2」や「4.0」は何ですか。
A:試験の版の番号です。版が変わると問題や採点のしかたが変わるので、版の違う点数どうしは比べられません。
まとめ
比較表は、自分の仕事に近い行を選び、その行の数字と測り方を見て比べます。次に新しいモデルの比較表を見たときは、まず自分の仕事に近い行を1つ選んでみてはいかがでしょうか。
