生成AIのベンチマークってそもそも何?

新しい生成AIの発表には、数字の並んだ比較表が付いてきます。比較表を読むときに見るところは2つです。

しかし、表に並ぶ英語の名前が何を測っているのかは、表のどこにも書かれていません。

Googleが2026年9月30日に発表したGemini 4 Argonの比較表を例に、18のベンチマークの中身と、表の読み方を並べます。

目次

生成AIのベンチマークとは、決まった課題でAIを採点した点数

生成AIのベンチマークは、同じ課題をどのAIにも解かせて比べる試験です。ベンチマークの%は、用意された課題のうち、AIが合格した割合です。

たとえばDeepSWE v1.1は113問のプログラム修正課題で、Gemini 4 Argonの77.9%は約88問で合格したことを示します。課題を作るのは、Vals AIやZapierのような外部の会社や大学です。

Gemini 4 Argonの比較表に並ぶ18のベンチマーク

18のベンチマークは、それぞれ別の仕事を測っています。以下のとおりです。GraphWalksだけは文章の長さ別に2行あります。

ベンチマーク分野Gemini 4 ArgonGPT-6 AstraClaude Fable 5.1Claude Opus 5.5何を測っているか
Vals Index知識労働68.9%63.1%65.8%67.0%金融・プログラミング・法務・税務の8つの試験をまとめた総合点(Vals AI)
AutomationBench知識労働51.3%41.4%31.4%42.5%複数の業務アプリをまたぐ営業・人事などの事務作業を、最後までこなせるか(Zapier)
Vals Finance Agent v2知識労働65.4%53.5%58.9%58.6%企業の開示書類を検索して読み、数字を計算して答える財務アナリストの仕事(Vals AI)
Harvey’s Legal Agent Benchmark知識労働19.6%5.4%6.7%3.8%M&Aや知財の法務案件で成果物を仕上げる。採点項目を全部満たした案件だけが合格(Harvey)
DeepSWE v1.1コーディング77.9%74.1%67.4%74.2%実在するプログラム113件の修正課題で、公開していないテストに通るか(Datacurve)
FrontierSWE v2コーディング55.0%65.5%56.3%62.3%1問に20時間かける長い開発課題。出来に応じて部分点(Proximal Labs)
Vibe Code Benchコーディング91.9%89.6%90.3%90.3%仕様書からWebアプリを一から作り、実際に動くか(Vals AI)
Terminal-bench 4.0コーディング57.4%58.2%57.9%66.4%コマンドを打つ画面で、実務の課題を解けるか(Terminal-Bench)
PostTrainBench機械学習45.3%44.3%40.2%49.3%小さいAIモデルを10時間で鍛え、どれだけ伸ばせたか(テュービンゲン大学など)
Terminal-Bench Science 0.1科学・数学57.6%68.1%52.6%63.3%生命科学や物理などの研究作業を、コマンドを打つ画面で解く(スタンフォード大学など)
LABBench2科学・数学88.8%85.4%68.6%73.1%DNA配列の設計など、生物学研究の作業(Edison Scientific)
RiemannBench科学・数学76.0%72.0%65.6%69.6%博士レベルの未公開の数学問題の正解率(Surge AI)
GraphWalks(12.8万トークンまで)長文の読み取り99.7%98.7%91.4%90.6%長い文章に埋め込んだ大量のつながりをたどり、条件に合う項目を漏れなく挙げられるか(OpenAI)
GraphWalks(25.6万〜100万トークン)長文の読み取り84.2%71.8%65.0%66.8%同じ課題を、さらに長い文章で解く
Agent’s Last Examパソコン操作39.5%34.2%—38.2%55業種の実務を、専門ソフトを操作して満点で仕上げられたか(カリフォルニア大学バークレー校など)
OSWorld-2.0パソコン操作69.2%72.6%——人がやると1時間半ほどかかる業務を、パソコン操作でこなす。部分点あり(香港大学など)
Chartography画像・動画71.6%71.0%46.2%66.3%医療・金融・工学の専門的なグラフを、道具を使わずに読み取る(Surge AI)
LVBench画像・動画91.7%87.5%79.7%83.7%1時間を超える長い動画を見て、4択問題に答える(清華大学など)
CWE-bench v1セキュリティ68.0%68.0%58.0%67.0%実在するソフトの脆弱性を自力で見つけ、機能を壊さずに直せるか(Collinear AI)

数値はGoogleが発表した比較表、測り方はGoogleの評価方法の資料と各ベンチマークの公式ページによります。「—」は数値が載っていない欄です。

比較表は、自分の仕事に近い行だけを比べる

見るところの1つ目です。モデルどうしは、自分の仕事に近い行の数字だけで比べます。Gemini 4 Argonは19行のうち14行でいちばん高い数値ですが、プログラム開発を測るTerminal-bench 4.0では、Claude Opus 5.5の66.4%がGemini 4 Argonの57.4%を9.0ポイント上回っています。

仕事ごとに見る行は、以下のとおりです。

やりたい仕事見る行
業務アプリをまたぐ事務作業の自動化AutomationBench
決算書や開示資料の読み取りVals Finance Agent v2
契約書などの法務文書の作成Harvey’s Legal Agent Benchmark
プログラムの修正や開発DeepSWE v1.1、Terminal-bench 4.0
長い資料をまとめて読ませるGraphWalks
グラフや図表の読み取りChartography
会議の録画など、長い動画の要約LVBench

比較表は、数字の測り方も確かめる

見るところの2つ目です。同じ表の中に、Googleが自分で測った数字と、外部の順位表から取った数字が混ざっています。比較に影響しやすいものは、以下のとおりです。

ベンチマークGoogleの資料に書かれた測り方
Terminal-bench 4.0Gemini 4 Argonだけ、Googleが自分で測った値
Terminal-Bench Science 0.1Gemini 4 Argonは、採点の待ち時間を6倍にして測った値
OSWorld-2.0Gemini 4 Argonは、3回測った中の最大値
LVBench読ませた動画のコマ数がモデルごとに違う

条件がそろっていない行では、数ポイントの差を実力の差と言い切れません。

候補を絞ったら、自分の業務で試す

候補を2つに絞ったら、自分の業務の同じ作業を10件ずつ任せ、人が手を貸さずに終わった件数を比べます。ベンチマークの課題には、自分の会社の書類や手順が入っていないからです。

よくある疑問

Q:点数がいちばん高いAIを選べば、仕事で失敗しないのでしょうか。

A:失敗しないとは言えません。法務を測るHarvey’s Legal Agent Benchmarkでは、いちばん高いGemini 4 Argonでも19.6%で、5件のうち4件は採点項目のどれかを満たせていません。

Q:比較表の「—」は何を意味しますか。

A:そのモデルの数値が載っていない欄です。その仕事が得意か苦手かは読み取れません。

Q:名前の後ろの「v2」や「4.0」は何ですか。

A:試験の版の番号です。版が変わると問題や採点のしかたが変わるので、版の違う点数どうしは比べられません。

まとめ

比較表は、自分の仕事に近い行を選び、その行の数字と測り方を見て比べます。次に新しいモデルの比較表を見たときは、まず自分の仕事に近い行を1つ選んでみてはいかがでしょうか。

  • URLをコピーしました!
  • URLをコピーしました!
目次