AIサービスの利用料金を抑えようとして単価の安いモデルを選んだ結果、かえって支払いが高くなってしまう現象が報告されています。複数の大学と研究機関による検証により、全体の約3割で総コストの逆転が起きている実態が報じられています。
この記事の結論
スタンフォード大学やMicrosoft Researchなどの共同研究によると、6,800件以上のタスク検証において32%のケースで低価格AIモデルの方が総コストが高くなる「価格逆転現象」が確認されました。複雑なタスクにおいて安価なモデルが思考や行動を過剰に繰り返し、ステップ数や思考トークン数が膨らむことが主な原因です。単価の安さだけで判断すると総費用が増加する恐れがあります。

単価が安いモデルを選ぶと、なぜ総コストが跳ね上がるのか
AIモデルの利用料金は通常、高性能な上位モデルが高く、処理を軽量化した下位モデルが安く設定されています。そのため、予算を抑えたい場面では低価格モデルを選ぶのが一般的な判断とされてきました。しかし、実行するタスクの内容によっては、単価が高いモデルを使った方が最終的な請求額を安く抑えられるケースが存在します。
スタンフォード大学、カーネギーメロン大学、カリフォルニア大学バークレー校、そしてMicrosoft Researchからなる共同研究チームは、このコスト構造を解明するための実験を行いました。研究チームは最先端のAIモデル8種類を対象に、数学、プログラミング、科学などの分野にわたる6,800以上のタスクを実行させ、低価格モデルと高価格モデルの挙動を比較しています。
GIGAZINEが報じた研究内容によると、検証全体の32%におよぶケースで、低価格モデルを使用したときの方が最終的な総コストが高くなる現象が見られました。この現象は研究論文において「価格逆転現象(The Price Reversal Phenomenon)」と名付けられています。
Gemini 3 FlashとGemini 3.1 Proで生じた14倍の費用差
研究チームが示した具体的な例のひとつに、「YouTube動画を毎フレーム分析する」というタスクがあります。この作業を高価格モデルである「Gemini 3.1 Pro」と、低価格モデルである「Gemini 3 Flash」の双方に与えて実行結果を測定しました。
検証の結果、高価格モデルのGemini 3.1 Proは85ステップでタスクを完了させ、かかった費用は1ドル(約158円)でした。これに対して低価格モデルのGemini 3 Flashは、1,000ステップ以上を費やしてもタスクを完了させることができず、途中で費やした費用は14ドル(約2,211円)に達しました。
| 測定項目 | Gemini 3.1 Pro(高価格モデル) | Gemini 3 Flash(低価格モデル) |
|---|---|---|
| 検証タスク | YouTube動画の毎フレーム分析 | YouTube動画の毎フレーム分析 |
| 所要ステップ数 | 85ステップ | 1,000ステップ以上 |
| タスクの成否 | 完了 | 未完了 |
| 発生した費用 | 1ドル(約158円) | 14ドル(約2,211円) |
トークンあたりの利用単価はGemini 3 Flashの方が安価に設定されています。しかし、タスク完了を目指す過程での行動回数が過剰に膨らんだことで、結果として14倍もの費用差が生じる結果となりました。

思考トークンが6万に膨らむ低価格モデルと25トークンで解く上位モデル
低価格モデルで総コストが高騰してしまう要因について、研究チームはAIの「考えすぎ」と「行動しすぎ」を挙げています。ここでいう思考トークンとは、AIが最終的な回答を出力する前に、内部で推論や論理の組み立てを行う過程で消費される計算単位のことです。
複雑な問題に直面した際、能力の劣るモデルは解決の糸口を掴めず、思考や試行錯誤を延々と繰り返してしまう傾向があります。幅広い分野を対象としたテストでは、Gemini 3 Flashがひとつの課題に対して6万トークンを超える思考トークンを消費した事例がありました。その一方で、より高性能なモデルである「GPT-5.4」は、同じ課題をわずか25トークンで解決したと報告されています。
1トークンあたりの単価がどれほど安くても、消費するトークン数が数百倍から数千倍に跳ね上がれば、最終的な利用料の合計額は上位モデルを大きく上回ってしまいます。
同じ指示を繰り返しても実行費用は最大9.7倍にばらつく
この研究では、AIのコスト予測を難しくしている別の要因も浮き彫りになりました。同一のプロンプト(指示文)を同じモデルに対して繰り返し実行した場合でも、毎回同じコストで完了するとは限らないという点です。
研究チームが同一の指示を同じモデルで繰り返し実行したところ、最も費用が高かった試行と最も安かった試行との間で、最大9.7倍もの価格差が生じた例が確認されました。AIの確率的な挙動によって推論経路や必要なステップ数が変動し、実行ごとにコストが大きくブレることが示されています。
米紙ウォール・ストリート・ジャーナルでも「AIの支出計画を立てることはほぼ不可能」と報じられており、単価表から単純計算した予算と実際の請求額が乖離しやすい構造が浮き彫りになっています。研究論文の筆頭著者であるリンジャオ・チェン氏は、「価格だけを見て、どのモデルが安いのかを判断すべきではありません」と指摘しています。

タスクの複雑さとステップ数がモデル選定の分かれ目になる
研究で判明した事実から整理すると、AIモデルの選定においては「タスクの性質」に応じた見極めが重要になります。
定型的な文章の要約やシンプルなデータ変換のように、AIが迷わずに1回の処理で完結できる平易な作業であれば、トークン単価の安いモデルを使うことで順当にコストを抑えられます。思考トークンが肥大化せず、ステップ数も増えないためです。
一方で、複数ステップにわたる調査、複雑なプログラミング、動画フレームの連続分析のように推論と反復行動を伴うタスクでは、状況が一変します。初期単価が高くても、少ないステップと思考トークンで確実に完了させられる上位モデルを選んだ方が、結果として総支払額を低く抑えられ、失敗による費用の無駄遣いも避けられます。
カタログ上のAPI単価表だけに頼るのではなく、実際のタスクで何ステップかかり、どれだけの思考トークンを消費して完了に至るのかを事前に小規模なテストで把握することが、費用高騰を回避するための客観的な判断材料となります。
あわせて読みたい関連記事
おすすめ AIコーディングの費用対効果、文脈を削ると逆に高くつく理由
安価なモデルを選んでも総コストが高騰する現象に対し、コスト削減を狙って文脈を削ることでかえって費用が増加する仕組みを解説しており、AIコーディングの費用対効果を検討する上で共通する背景を把握できるため。
PR(当サイト運営者のサービス)





コメント