AI導入で最初にツールを決める会社が、一番損をする

UC Berkeley と Arena の研究が、7モデル×3ハーネスの21通りを同じタスクで比較した。成功率の差は±2〜5%にとどまる一方、同じモデルでもコストは平均2倍、条件によって最大5倍に開く。さらに12通り中9通りで、純正ではないハーネスのほうが成功率が高かった。ここから導かれるのは「AI導入とはツールの選定ではなく、切り替えられる状態を作ること」という結論。

動画で見る

同じAI、同じ成功率、コストだけ2倍

同じAIモデルに、同じ仕事をさせました。成功率の差は2パーセント。ところがコストは2倍でした。何が違ったかというと、モデルではありません。その外側です。今日はその外側の話をします。

解説する人:胡田 昌彦

胡田昌彦です。Microsoft MVPを14年連続で受賞しています。今日は研究の紹介から入りますが、最後は自分の運用の話に着地します。

モデルは頭脳、ハーネスは手足

前提をそろえます。コーディングエージェントは2つの部品でできています。1つはモデル。頭脳です。もう1つがハーネス。モデルにどんな道具を持たせ、どんな情報を渡し、どういう順番で実行させるかを管理する側です。Claude Code、Codex CLI、こういったものがハーネスです。私たちは普段「どのモデルを使うか」だけを話していますが、実際には必ずセットで選んでいます。

誰が、何を測ったのか

研究の素性です。UC BerkeleyとArenaのチーム。著者にはSparkやDatabricksで知られるIon StoicaとMatei Zahariaが入っています。7つのモデルと3つのハーネス、合計21通りの組み合わせを、SWE-bench LiteとTerminal-Bench 2.0からそれぞれ30タスク抜き出して、1タスクにつき3回ずつ走らせています。価格は2026年9月1日時点の直販APIの価格表で統一。素性としては十分です。

発見1:効くのは正確さではなく、コスト

1つ目の発見。ハーネスを変えても成功率はほとんど変わりません。SWE-bench Liteで±2パーセント、Terminal-Bench 2.0で±5パーセント程度。ところがコストは大きく動きます。同じモデルで比べて、Claude CodeはPiのおよそ2.0倍、Codexのおよそ1.6倍。Terminal-Benchでは1.5倍。見出しとしては最大5倍という表現も出てきますが、平均で見ると2倍前後、と理解するのが正確です。研究チームはこれをハーネス税、Harness Taxと呼んでいます。

具体例:成功率1.1%の差に、2倍の価格

具体例です。Fable 5というモデルで見ると、成功率はClaude Codeで97.8パーセント、Codexで96.7、Piで96.7。ほぼ同じです。ところがコストは1回あたり1.33ドルと0.67ドル。約2倍です。しかもターン数はほぼ同じ、15.3回と15.4回。同じ回数のやりとりで、倍のお金がかかっている。つまり1ターンあたりの単価が違うということです。

発見2:単純なハーネスが強い

2つ目。Piというハーネスは、read、write、edit、bashの4つしか道具を持っていません。そのPiが両方のベンチマークでパレート最適の線に乗りました。理由の一端も測られています。最初のモデル呼び出しで渡しているコンテキストの量が、Claude CodeはPiの10倍以上。長い指示と大きなツール定義が、毎回のやりとりに乗ってくる。ハーネス税は、1回目の呼び出しから始まっているわけです。

発見3:純正が最適とは限らない

3つ目が一番おもしろい発見です。AnthropicとOpenAIの6モデル、2つのベンチマーク、合わせて12通りの比較のうち、9通りで「自社製ではないハーネス」のほうが成功率が高くなりました。たとえばSonnet 4.6は、Claude Codeで66.7パーセント、Codex CLIで68.9パーセント。ほぼ同じコストで、他社のハーネスのほうが上です。GPT-5.6 Solは、Codexで78.9パーセントに対してPiで83.3パーセント、しかもコストは0.76ドルに対して0.42ドル。成功率が上がって、値段が半分になっています。

この研究の限界も、言っておきます

大事な留保です。これは研究チーム自身が書いています。テストに使った2つのベンチマークは公開されていて、モデルが学習の過程で見ている可能性がある。だから他のワークロードでは結果が変わりうる。タスクは各30問で、3回ずつ。決して大規模な検証ではありません。数字を「絶対」として持ち歩くのではなく、「こういう差が存在しうる」という事実として持ち帰ってください。

ここから、私の話

研究の紹介はここまでです。ここからは私がどう受け取ったかを話します。

AI導入を「選定」にすると損をする

私がこの研究から受け取った結論はこれです。AI導入というときに、何かを固定的にするのはよくない。多くの会社は、AI導入を「ツール選定」として稟議に通します。比較表を作って、うちはこれを使う、と決める。決めた瞬間は正しいかもしれません。でも今日見たとおり、最適な組み合わせは半年で入れ替わります。固定した会社は、その差を取りに行けなくなる。導入とは選定ではなく、切り替えられる状態を作ることです。

私は最初から固定していません

言うだけでは弱いので、自分の環境の話をします。私はClaudeとCodexを、同じ入口から切り替えて使える仕組みを自分で作って運用しています。どちらか一方に寄せていません。だからこういう研究が出てきても、何も困らない。明日から比率を変えるだけです。逆に言うと、固定していたら、この研究を読んでも「困ったな」で終わっていたはずです。

稟議の書き方が変わる

経営の話に落とします。AI導入の稟議を「どのツールを使うか」で書くと、決裁が下りた瞬間に固定されます。そうではなく、「切り替えコストをいくらに抑えるか」で書いてください。具体的には3つ。1つ、入口を1本にして、後ろのモデルとハーネスを差し替えられるようにする。2つ、同じ仕事のコストを組み合わせ別に測れるようにしておく。3つ、全社標準を決めるのは、測れるようになってからにする。順番が逆になっている会社が、とても多いです。

today's takeaway

まとめます。1つ、ハーネスを変えても成功率はほぼ変わらないが、コストは平均2倍動く。2つ、単純なハーネスが強い場面がある。3つ、純正の組み合わせが最適とは限らず、12通り中9通りで他社製が勝った。4つ、だからAI導入は選定ではなく、切り替えられる状態を作ることです。

出典

出典です。研究はHarnessTaxとして公開されています。URLは概要欄に置きます。数字は私が一次情報に当たって確認したものです。

CTA

収録用カンペはこの後ろのスライドにあります。

Ebisuda Presentations のトップへ