Enterprise-Benchの紹介:エンタープライズAIベンチマーク

Enterprise-Benchは、エンタープライズAIエージェント向け初の標準ベンチマークです。データが現実的な規模に拡大する中で、精度・効率・安全性を評価します。

ベンチマークとは何か — そしてなぜエンタープライズAIに必要だったのか

信頼できるベンチマークは公平な競争環境を実現します。同じタスク、同じデータ、同じスコアリングで標準化されたテストモデルにプラットフォームをかけることで、完全な透明性と信頼をもって比較できるようになります。1990年代にデータベース業界が「誰もが最速だと主張する」問題を解決したのが、TPCによる共通の監査可能な基準でした。

AIモデルには推論やコーディング、ツール使用をテストするベンチマークが豊富にあります — ほとんどが単一ユーザー規模のものです。しかし、AIエージェントが実際の企業の複雑さの中で動作できるかどうかをテストするものは、ひとつもありませんでした。

エンタープライズ環境はAIに固有の問題を突きつけます。データは広範囲に分散しサイロ化され、権限とセキュリティプロトコルは不可欠です。単純な質問に答えるだけでも、サポートチケットを営業記録に、さらにエンジニアリングの課題に接続する必要があるかもしれません。

これまで、エンタープライズAI向けの標準化された信頼できるベンチマークは存在しませんでした。

Enterprise-Benchの仕組み

Enterprise-BenchはLaude Instituteと共同で開発され、UCバークレー教授でBespoke Labs共同創業者、DevRev取締役のAlexandros Dimakisによって検証されました。Harborを通じて公開されており、GitHubで検査・貢献が可能です。

Enterprise-Benchのすべてのタスクには正解がひとつだけあります。その正解は常に同じです — データセットが小さくても、256倍に拡大しても。変わるのは、正解がどれだけ埋もれているかです。

最小スケールでは、データの40%が特定のタスクに関連しています。最大スケール(256倍)では、わずか0.16%だけです。質問自体は難しくなりません — しかし、増え続ける無関係なデータの海の中から正しい答えを見つけることは、確実に難しくなります。

私たちはこれを「正解保存型データスケーリング」と呼んでいます。データが増えるにつれてエージェントの精度が低下するなら、それはモデルの問題ではなく、検索アーキテクチャの問題です。

正解は固定されたまま、周囲のノイズがより現実的なエンタープライズのデータ量に近づいていく

Professor Alexandros Dimakis

Professor, EECS Department, UC Berkeley

Enterprise-Benchは3つの軸を同時に評価します(本番対応のAIにはすべてが必要だからです):

精度(Precision) — 正しい答えを、正しいソースから、毎回導き出す。

効率(Efficiency) — 使用するトークン数、そしてスケール時にそのコストが維持されるか。

安全性(Safety) — 権限を遵守し、操作を監査可能にする。

タスクはL1〜L4の自律性レベルに分類されます。決定論的な検索から、複数ステップの統合、さらには自律的な運用までの進行です。

重要な知見は、「単純な」検索であっても、異なるスキーマを持つ複数システムにまたがる場合、アーキテクチャ的に高い要求が発生するということです — 私たちはこれを「ワイドL1」と呼んでいます。さらに、整備されたツールから現実的なAPIサーフェスに移行するだけで、精度が18〜19ポイント低下することがわかっています。

これらすべてを支える発見:検索アーキテクチャは、基盤モデルの選択よりも、本番環境のパフォーマンスをより強く予測する因子である。

結果が出ました

DevRevのComputerとClaude Codeを直接対決させました。同一のL1〜L2タスクで、現実的なB2B企業(42の顧客アカウント、40の製品パーツ、5つの相互接続されたエンタープライズシステム)をモデルに。同じOpus 4.8モデル、同じデータ、同じ独立した審査員。

精度 — Computer: 94.3% vs. Claude: 63.6%。

効率 — 正答あたりのトークン数: Computer: 約5,598 vs. Claude: 約24,461(正答あたり4.4倍少ないトークン)。

スケール時のコスト — データセットが拡大するにつれ、Computerのトークン使用量はほぼ横ばいを維持。一方、Claude Codeは29%増加。

重要なニュアンス:Claude Codeはシンプルな単一ユーザーの検索や抽出では優れたパフォーマンスを発揮しました。しかし、エンタープライズレベルの作業 — たとえばチケットをエンジニアリング課題に結合したり、サポート記録を商談リスクに接続したり、複数システムにまたがる情報を統合したりする場合に、差が大きく開きました。

証明、そして挑戦状

構築方法 — そしてその理由 — の詳細は、こちらの完全な方法論をご覧ください。

完全な方法論、テストデータセット、評価ハーネス、スコアリング基準、およびすべてのトレースが公開されています。

そして私たちは声を大にして言います:すべてのベンダー、研究者、顧客がEnterprise-Bench上で自社のAIプラットフォームを実行し、Harbor上のリーダーボードに結果を提出すべきです。なぜなら、私たちはComputerが無敵であると心から信じているからです。

Enterprise-Benchの完全なデータセット、評価ハーネス、クエリ、判定基準、および初期結果は、こちらで公開されています。

Frequently Asked Questions

DEVREV

See Computer work for you

Your AI teammate that finds answers, takes action, and gets work done across every tool.