アマゾンの180万ドルClaude超過:AIエージェントのコストが制御不能になる理由

AIエージェントは、通常のソフトウェアではほとんど見られない形で失敗することがあります。それは、彼らが試行を続けるということです。障害に直面した人間の従業員は、最終的には疲れ果て、助けを求め、帰宅するか、翌朝まで待つものです。しかし、自律型エージェントは、数時間または数日間にわたって、モデルを呼び出し続け、自身の出力を読み取り、ツールを再試行し、プランを書き直し、別のループを開始し続けることができます。タスクが困難な場合、この粘り強さは有用です。タスクがうまくいかない場合、その代償は非常に高くつきます。2026年7月のフィナンシャル・タイムズ紙の報道によると……

发布于 2026年8月12日generalGEO 评分: 07 次阅读
これは、アマゾンのClaude AIエージェントのコスト超過に関連するテーマ画像で、背景は暗めで、アマゾンとAIのぼやけたロゴが透かしとして入っています。画面の中央には「Amazon's $1.8M Claude Bill」と明確に記載され、その下に「AI Agent Cost Controls」の文字があり、薄黄色のフォントで「Tokenmaxxing・Automation Risk」という関連する中核概念が示されています。画面左側には数値と下降曲線を含むコストグラフが表示され、右側には警告の三角アイコン、コード文字、AIシステムを表すアーキテクチャ要素が配置されており、アマゾンのClaudeプロジェクトで180万ドルのコスト超過が発生し、AIエージェントのコスト管理リスク、トークンの乱用などの中核的な問題が浮き彫りになっているという記事の内容を直感的に反映しています。

アマゾンの180万ドルClaude超過:AIエージェントのコストが制御不能になる理由

はじめに

AIエージェントは、通常のソフトウェアではほとんど発生しない形で失敗することがある。それは、絶え間ない再試行だ。

故障したプロセスに直面した人間の従業員は、いずれ疲弊し、助けを求め、帰宅し、あるいは翌朝まで待つものだ。

一方、自律型エージェントは、モデルへの呼び出し、自身の出力の読み取り、ツールの再試行、計画の書き直しを継続し、もう一つのループを開始することができる。それを数時間、あるいは数日間続けることも可能だ。

タスクが困難な場合、この持続性は有用である。

タスク自体に問題がある場合、この持続性は高くつく。

2026年7月のフィナンシャル・タイムズ紙がアマゾンの従業員および社内プロジェクトに詳しい関係者の話として報じたところによると、アマゾンの Claude Sonnet を使用したプロジェクトが、アマゾンウェブサイト上の著者情報を充実させようとする試みの中で、累計で約 180万ドルのAIコスト を発生させた。

請求額は次のとおりだったと報じられている:

プロジェクト予算の860%超過

この超過は、以下の期間気付かれなかったと報じられている:

5か月間

そして、巨額の費用がかかったにもかかわらず、このプロジェクトは結局うまく展開されなかったと報じられている。

この組み合わせにより、この出来事は単なる異常に高額な請求書以上の重要性を持つ。

それは、新しい企業ソフトウェアの問題を明らかにしている:

小さな論理エラー
×
自律的な再試行
×
従量課金制
×
可観測性の低さ
=
重大な金銭的損失

この問題は、Claude、アマゾン、または単一のAIプロバイダーに固有のものではない。

エージェントシステムは、計算能力を変動する運用費用に変換する。それらが独立して実行されることを許されると、コストはアプリケーションの動作の一部となり、もはや単純なソフトウェアサブスクリプションではなくなる。

欠陥は単に誤った結果を生み出すだけではない。

それは、お金を使い続けながら、誤った結果を何百万回も生み出すことができるのだ。

180万ドルのアマゾンClaude事件の経緯

フィナンシャル・タイムズ紙の報道で説明されているタスクは、平凡に聞こえる。

アマゾンはウェブサイト上の著者情報を改善したかった。

Claude Sonnet ベースのワークフローが、必要な著者情報のマッチングまたは生成を支援するために使用されたと報じられている。

その後、このプロジェクトは予想をはるかに超えるAIリソースを消費した。

アマゾンの従業員は、最終的なコストを約次のように説明したと報じられている:

180万ドル

これは、推定される次の値に相当する:

860%の予算超過

最も注目すべき詳細は、検知の遅れかもしれない。

コストの問題は、約5か月間、アクティブな状態、または未検知の状態にあったと報じられている。

これは、失敗が単にAIモデルの問題ではないことを示している。

それはまた、監視とガバナンスの問題でもある。

企業のワークロードが明確なアラートなしに7桁の金額を費やすことができるなら、そのシステムには、他の請求インフラストラクチャの周りに通常存在するであろう1つまたは複数の管理策が欠けている。

これらの管理策には次のものが含まれる可能性がある:

  • プロジェクトレベルの予算。
  • ハードな支出上限。
  • 毎日の異常アラート。
  • エージェントごとの割り当て。
  • 最大再試行回数。
  • 最大タスク時間。
  • ユーザーごとの帰属。
  • 成功ごとのコストダッシュボード。
  • 自動シャットオフルール。

フィナンシャル・タイムズ紙は、アマゾンが他にもAIコストが異常に高くなった事例を発見しており、エンジニアたちが自動化されたガードレールを開発していると報じた。

アマゾンは同紙に対し、このような事例は孤立した教訓であり、より広範なAIへの取り組みを代表するものではないと述べた。

この区別は保持する価値がある。

今回の180万ドルの出来事は、内部プロジェクトの失敗であると報じられている。

それは、アマゾンのAIプロジェクト全体が経済的に失敗していることを証明するものではない。

情報源の「6000億トークン」という試算は文脈を考慮する必要がある

元の中国語の記事は、誇張された計算を行っている。

その中で、100万入力トークンあたり3ドルで計算すると、180万ドルで最大次のものを購入できると述べている:

6000億入力トークン

この算数は単純である:

180万ドル
÷
100万トークンあたり3ドル
=
600,000百万トークン
=
6000億トークン

しかし、これはアマゾンのプロジェクトで実際に消費されたトークン数の測定値ではない

これは、いくつかの非現実的な仮定に基づく、説明用の上限計算にすぎない:

  1. すべてのドルが入力トークンに費やされた。
  2. このプロジェクトで使用されたClaude Sonnetバージョンの価格が、ちょうど100万入力トークンあたり3ドルだった。
  3. 出力トークン料金がない。
  4. キャッシュ書き込みまたはキャッシュ読み取り料金がない。
  5. AWSプラットフォーム固有の価格差異が存在しない。
  6. その他の推論またはインフラストラクチャコストがない。

Anthropicの現在の価格も、Sonnetの世代によって異なる。

2026年8月現在、Anthropicの価格表は次のとおりである:

モデル 標準入力 標準出力
Claude Sonnet 5 2ドル/100万トークン 10ドル/100万トークン
Claude Sonnet 4.6 3ドル/100万トークン 15ドル/100万トークン
Claude Sonnet 4.5 3ドル/100万トークン 15ドル/100万トークン

フィナンシャル・タイムズ紙の報道はClaude Sonnetを確認したが、公開報道では、正確なモデルバージョン、入力/出力比率、キャッシュ動作、または実際のトークン数を再現するのに十分な請求詳細は提供されていない。

したがって、維持できる結論は次のとおりである:

報道によると、このプロジェクトは約180万ドルを費やした。その正確なトークン消費量は一般には知られていない。

これは、ドル金額が単一の定価数値で自動的にトークンに変換されると、企業のAIコスト分析が誤解を招くため、重要である。

エージェントのコストが従来のソフトウェアコストよりも予測しにくい理由

従来のソフトウェアには、通常、比較的予測可能なコスト要因がある。

チームは次のものを推定できる:

  • サーバー数。
  • データベースサイズ。
  • 帯域幅。
  • ストレージ。
  • ユーザーライセンス。
  • 1秒あたりのリクエスト数。

大言語モデルエージェントは、別の複雑さの層を追加する。

1つのユーザーリクエストが次のものを引き起こす可能性がある:

1回のモデル呼び出し

また、次のものを引き起こす可能性もある:

200回のモデル呼び出し
+ ツール呼び出し
+ 再試行
+ コンテキストの再生
+ ウェブ検索
+ コード実行

ユーザーは最終的な回答を1つだけ見るかもしれない。

コストメーターは、プロセス全体の軌跡を見ている。

コンテキストは繰り返し送信される

エージェントは、推論の各ステップで、作業コンテキストの大部分を再送信することが多い。

したがって、非常に長いコードベース、大きなドキュメント、ツール履歴、または会話は、繰り返し課金される可能性がある。

出力が新しい入力になる

エージェントが以前に生成したテキストは、通常、次のモデル呼び出しのコンテキストになる。

システムは事実上、最初に情報を生成するためにお金を使い、次にその情報を読むためにお金を使う。

再試行はコストを倍増させる

1回の失敗したツール呼び出しが、次のものを引き起こす可能性がある:

  1. エラー解釈。
  2. 新しい推論。
  3. 修正された呼び出し。
  4. 別の結果。
  5. もう一度のモデルラウンド。

コードレベルでは無害に見える再試行ループが、大量のトークン消費を生み出す可能性がある。

コストは

ランダムである

エージェントコーディングに関する研究では、同じタスクでも実行ごとにトークン使用量が大きく異なる可能性があることがわかっている。

2026年にSWE-bench Verifiedで複数の最先端モデルを対象とした研究では、同じタスクの実行間で最大約30倍の差があると報告されている。

より多くのトークンが常により良い結果を生むとは限らない。

これにより、「タスクの難易度から請求額を見積もる」ことは、信頼できない予算編成方法となる。

アマゾンの自動化への夢は、失敗したプロジェクト1つをはるかに超えている

元の記事は、その後、この180万ドルの出来事から、より大きな視点へと移行した。

アマゾンはAIから後退していない。

それは投資を拡大している。

最高経営責任者のアンディ・ジャシーは、生成AIとエージェントが顧客向け製品とアマゾンの社内業務を再形成すると繰り返し述べている。

2025年6月、ジャシー氏は従業員に対し、アマゾンがすでに次のものを持っていると語った:

1,000以上の生成AIサービスとアプリケーション

構築済みのものも、進行中のものもある。

彼はまた、次のように予測した:

数十億のAIエージェントが存在するだろう
あらゆる企業や領域にわたって。

ジャシー氏は、エージェントが次の作業を実行できると述べた:

  • ウェブ調査。
  • ディープリサーチ。
  • コーディング。
  • 異常検知。
  • 翻訳。
  • データ分析。
  • ワークフロー自動化。

彼はまた、より広範なAIアプリケーションがアマゾンの従業員構成を変え、効率性が向上するにつれて、長期的には企業全体の従業員数を減らす可能性があると述べた。

したがって、この180万ドルのClaude事件は、自動化を減らすどころか積極的に推進している企業の内部で発生したことになる。

アマゾン、2026年の設備投資は約2,200億ドル

アマゾンのインフラ投資は膨大だ。

2026年第2四半期の決算発表において、ジャシーCEOは2026年の予想設備投資額を以下の水準に引き上げた:

2,200億ドル

これは従来の約2,000億ドルの計画を上回る。

そのほとんどの支出は次の分野に関連している:

  • AWSデータセンター容量
  • AIインフラ
  • カスタムチップ
  • サーバー
  • ネットワーク
  • 電力
  • ロボティクス、その他の長期インフラ

アマゾンの2025年株主宛書簡では、同社が「直感」だけで従来の2,000億ドルという見積もりを出したわけではないと説明されている。

ジャシー氏は、AWSにはインフラ建設の大部分の合理性を支えるのに十分な顧客コミットメントがあると述べた。

これにより、明確な対比が浮かび上がる:

アマゾンは数千億ドルを投じて
AI容量を拡大している

一方で、個々のAIワークロードによる
数百万ドルの浪費を防ぐ方法も
学んでいる。

この2つの問題は矛盾しない。

インフラ容量とワークロード効率は別物だ。

AWSはAIブームから実際の収益を得ている

元記事が正しく指摘しているように、アマゾンのAIおよびクラウド支出は単なるコストを生んでいるわけではない。

アマゾン公式の2026年第2四半期決算では、AWSの力強い成長が示された。

この画像はアマゾンウェブサービス(AWS)の公式ロゴであり、濃い色の小文字「aws」の下に、アマゾン製品を象徴する鮮やかなオレンジ色の弧を描く矢印が左から右へ伸び、先端が矢印の形をしている。このロゴは文書内の該当箇所に配置され、AWS事業部門を指し示しており、第2四半期決算のAWS売上高やAIビジネスの成果を示す内容に対応している。

2026年6月30日までの四半期:

指標 2026年第2四半期
アマゾン総売上高 2,006億ドル

AWS売上高 | 422億ドル |
| AWS前年比売上成長率 | 37% |
| アマゾン営業利益合計 | 275億ドル |
| AWS営業利益 | 166億ドル |

したがって、AWSはおよそ:

アマゾン営業利益の60%

を貢献している。

また、およそ:

総売上高の21%

を占めている。

この四半期において。

アマゾンはまた、AI事業とチップ事業の年間売上高実行率がそれぞれ250億ドルを超えていると発表した。

したがって、同社にはAI導入を推進し続けながらコスト規律を改善する強力な経済的根拠がある。

アマゾンの労働力も同時に変化している

AI支出はアマゾンの自動化計画の一側面に過ぎない。

同社は企業部門の人員削減も進めている。

2025年10月、ロイターの報道によると、アマゾンは最大3万人の企業部門の人員を削減する計画だという。

ジャシー氏はまた従業員に対し、生成AIのより広範な採用により、一部の職種の仕事が減少する一方、他の職種の仕事が増加する可能性があると伝えた。

注意すべきは、アマゾンの人員削減のすべてを「AIが従業員を置き換えた」と単純化できないことだ。

大企業の人員削減には以下の要素が関与する可能性がある:

  • 組織再編
  • パンデミック時の過剰採用
  • コスト圧力
  • 管理層の縮小
  • 事業閉鎖
  • 自動化
  • AIによる効率向上

明確なのは、アマゾン自身がAIが将来の従業員ニーズを変えると予想していることだ。

倉庫自動化が同じ論理を物理的領域にもたらす

元記事はその後、オフィス自動化から倉庫・物流へと移る。

アマゾン内部文書に基づく報道では、野心的なロボット戦略が説明されている。

その目標は、今後数年間で倉庫運営の大部分を自動化し、貨物量が増加してもアマゾンが追加で数十万人の従業員を雇うことを回避できるようにすることだと報じられている。

広く報じられた推定では、自動化によってアマゾンは次の追加雇用を回避できる可能性がある:

2027年までに米国で約16万人

および:

2033年頃までに60万人以上

自動化の度合いが低い成長経路と比較して。

これらの数字は報じられた内部予測に基づいており、アマゾンが既存従業員60万人を解雇するという公約ではない。

この区別は重要だ。

「将来の採用回避」と「既存の職の削減」は経済的に関連するが、同じではない。

この画像はアマゾンの倉庫物流現場における産業自動化の様子を示しており、黄色い産業用ロボットアームが写っている。このような機械腕は同社が倉庫自動化を推進する上での中核機器の一つである。隣には反射ベストと保護具を着用した作業員がおり、ロボットアームや関連装置の操作・調整を行っているようだ。文脈から、この画像はアマゾンが自動化戦略を倉庫業務に適用した実際の場面を視覚的に示しており、ロボット戦略による倉庫運営の自動化推進と新規採用の削減に関する内容に対応し、実際の作業環境での自動化戦略の応用を示している。

アマゾンは、ロボット技術が以下の分野で新たな役割を生み出すことも公開している:

  • 保守
  • 信頼性
  • ロボット工学
  • プロセス監視
  • 技術運用

長期的な労働力への影響は依然として議論の的となっている。

経済学者ダロン・アセモグル氏は最も代表的な批判者の一人であり、大規模雇用主による急進的な自動化が、企業を大規模な雇用創出者から、大量の雇用を消滅させたり回避したりする主体に変える可能性があると警告している。

「より多くのトークン=より多くのAI」の時代は終わりつつある

元記事の2つ目の主要セクションは、アマゾンからシリコンバレー全体の行動様式へと移る:トークンマキシング(トークン消費の最大化)。

しばらくの間、各企業はAI利用を過度に推進し、利用量そのものがステータスシンボルになっていた。

経営陣は従業員に次のことを求めていた:

  • AIをもっと使う
  • もっと多くのエージェントを実行する
  • もっと多くの業務を自動化する
  • 大胆に実験する
  • AI中心の小規模チームを編成する

一部の組織では、こうした奨励がランキング表へと発展した。

指標が可視化されると、従業員はその指標を最適化する方法を学んだ。

これはグッドハートの法則の典型例である:

指標が目標になると、それはもはや良い指標ではなくなる。

企業が望んでいたのは生産的なAI利用だった。

トークン使用量は計測しやすいため、それを測定した。

従業員はトークン使用量を増やした。

数字は上昇した。

しかし、効果的な成果は必ずしも増えなかった。

アマゾンがKiroRankを廃止

アマゾンにはKiroRankという非公式の内部ランキングがあった。

これは従業員のKiro(アマゾンのAI開発ツール)に関する活動を追跡・ランク付けするものだった。

Business Insiderとフィナンシャル・タイムズの報道によると、一部の従業員は自らのスコアを上げるために不必要なAIタスクを実行し始めたという。

アマゾンは最終的にこのランキングを廃止した。

Dave Treadwell上級副社長は従業員に対し、AIを使うためだけに使うべきではないと伝えた。

アマゾンは実際の成果に重点を置いた指標に移行し、その中には正規化デプロイメントと呼ばれる指標も含まれる。

教訓は単純だ:

トークン消費
≠
生産性

1億トークンを使って何も納品しなかった開発者は、500万トークンで問題を解決した開発者より自動的に効率的とは言えない。

MetaのClaudeonomicsランキングも同様のインセンティブを生んだ

報じられるところによると、Metaでも同様の実験が行われた。

従業員が作成した内部ランキングClaudeonomicsは、85,000人以上の従業員のAI利用状況を集計し、上位250人のユーザーを表示するものだった。

報道では、以下のような称号が登場した:

  • トークンレジェンド
  • キャッシュウィザード

セッション不死(Session Immortal)。

The Informationの報道によると、Metaの従業員は30日間のローリング期間中に数十兆トークンを消費した。

その後の報道では、30日間の総量はほぼ以下の水準に達したとされている:

73.7兆トークン

Metaはその後、より厳格な利用制御へと移行し、コスト可視性と予算管理のための集中型AIゲートウェイ(AI Gateway)を設置した。

これらのデータは内部報告のカバレッジに基づくものであり、Metaの公的財務諸表に基づくものではない。

ソース記事はまた、73.7兆トークンを仮説上の月額2.21億ドルの請求額に換算した。

この数字はMetaの実際の請求額と見なすべきではない。

本質的には、次のような計算である:

73.7兆トークン
×
100万トークンあたり3ドル
≈
2.21億ドル

これは、すべてのトークンが入力トークン1個分の定価で請求されると仮定している。

実際の使用には、異なるモデル、交渉済みのエンタープライズ料金、入力/出力の組み合わせ、キャッシュ、内部モデル、プラットフォーム契約が関与する可能性がある。

有用な事実は、簡略化された請求換算ではなく、報告されたトークン使用量の規模である。

Uberは4ヶ月で年間AIコーディング予算を使い切った

Uberも同様の予算問題に直面した。

2026年6月の報道によると、同社は第1四半期にエージェントコーディングツールの年間予算を使い切った。

1年のうち4ヶ月で。

その後、Uberはデフォルトの上限を導入した:

従業員1人あたり1,500ドル
毎月
コーディングAIツールごとに

この上限は、以下のツールにそれぞれ適用される:

  • Claude Code。
  • Cursor。

従業員は内部ダッシュボードで自分の使用状況を確認でき、追加支出に正当な理由があれば例外を承認できる。

このアプローチは、従来のクラウドFinOpsに近い。

問題は次のように変わる:

従業員はどれだけのAIを使用したか?

から、次のように:

このワークフローのコストはいくらで、
結果はそれに見合う価値があったか?

Uberの幹部は、AIが大きな効率向上をもたらすと一貫して考えてきた。

変化は「AIを使う」から「AIを使わない」への移行ではない。

無制限の消費から管理された消費への移行である。

OpenAIでさえコストが「巨大な問題」になったと発言

モデルプロバイダー内部でも、これらの経済的問題に直面している。

2026年6月の企業イベントで、Sam Altmanは、OpenAI内部で最も多くのトークンを使用する従業員が毎月約:

1000億トークン

を消費していると述べた。

彼はこれを、約6年半前と比較した。当時は毎月10万トークンでも異常に多いとされていた。

Business Insiderはまた、ニューヨーク・タイムズの報道を引用し、OpenAIのある従業員が1週間で約:

2100億トークン

を使用したと報じた。

Altman氏は、コストが2026年初頭には顧客がほとんど言及しない問題だったのが、その年のうちに:

「巨大な問題」

になったと述べた。

皮肉は明らかである。

AIラボはモデルをより安くして、顧客がより多くのAIを使えるようにしたいと考えている。

モデルが安くなり、エージェントがより自律的になるにつれて、総使用量の増加は単価の低下速度を上回る可能性がある。

これはジェボンズのパラドックスの一例である:

より低い単位コスト
→ より多くの使用量
→ 総支出はむしろ増加する可能性がある

ほとんどの企業は依然として自社のAI請求額を完全に把握できていない

コストガバナンスが難しいのは、AIの使用が分散しているためである。

企業は以下の経路でAIに支払う可能性がある:

  • 直接API。
  • AWS Bedrock。
  • Azure。
  • Google Cloud。
  • SaaSサブスクリプション。
  • コーディングエージェント。
  • 組み込み型Copilot。
  • 部門の経費口座。
  • 内部推論。
  • サードパーティのワークフローツール。

ウォール・ストリート・ジャーナルのCFOレポートは、ある調査を引用し、わずか:

26%の企業

だけが自社のAIコストを完全に把握していることを明らかにした。

これは、多くの企業がAIコストを確実に帰属させることができる前に、AI支出の最適化を試み始めていることを意味する。

財務チームはベンダーの総請求額を知っていても、以下を知らない可能性がある:

  • どのチームが発生させたのか。
  • どのアプリケーションが発生させたのか。
  • どの顧客ワークフローが発生させたのか。
  • どのエージェントループが急増を引き起こしたのか。
  • どれだけのコストが成功した結果を生んだのか。
  • どれだけが再試行による無駄だったのか。

AIコストガバナンスに必要なのは月次請求書だけではない

有用な企業AIコストシステムは、複数のレベルの質問に答えるべきである。

レベル1:誰が使ったのか?

以下の次元で追跡する:

  • 従業員。
  • チーム。
  • 製品。
  • コードリポジトリ。
  • エージェント。
  • 環境。

レベル2:何がコストを消費したのか?

以下を区別する:

  • 入力トークン。
  • 出力トークン。
  • キャッシュ書き込み。
  • キャッシュ読み取り。
  • ツール呼び出し。
  • 検索。
  • コード実行。
  • 再試行。

レベル3:支出は何を生み出したのか?

コストを以下に関連付ける:

  • デプロイ。
  • 解決済みチケット。
  • マージされたプルリクエスト。
  • レポート。

納品。

  • 完了した顧客リクエスト。
  • 収益イベント。
  • 節約された時間。

レベル4:エージェントの動作は正常か?

以下を監視する:

  • 同一呼び出しの繰り返し。
  • 再試行ループ。
  • コンテキストの突然の増大。
  • トークンの急増。
  • 長時間のアイドルセッション。
  • ツールの障害。
  • 進捗のないタスク。

目標は単にトークンを減らすことではない。

低価値トークンを検出することである。

優れたエージェント予算には複数のガードレールがある

月次ドル上限は有用だが、完全ではない。

本番グレードのエージェントは通常、複数の制限を同時に設定すべきである。

例:

タスクごと:
  最大実行時間:30分
  最大モデル呼び出し回数:80
  ツールごとの最大再試行回数:3
  最大コスト:5ドル

ユーザーごと:
  日次予算:50ドル

チームごと:
  月次予算:25,000ドル

グローバル:
  毎時支出が+100%の場合に異常アラート
  緊急停止スイッチ

具体的な数値はユースケースに依存する。

アーキテクチャこそが重要な部分である。

暴走したシステムは、7桁の想定外のコストを発生させる前に、複数の独立した障壁に衝突するべきである。

自律エージェントにハード制限が不可欠な理由

従来のソフトウェアは通常、新しいリクエストを待ってから処理を続行する。

エージェントは自ら次のアクションを作成する可能性がある。

これによりリスクモデルが変わる。

エージェントが次のような指示を受け取ったと仮定する:

正しい著者レコードを見つけてデータベースを更新せよ。

曖昧な一致を発見する。

再度検索する。

次に、モデルに候補結果を比較させる。

次に、あるAPIを再試行する。

次に、新しい検索クエリを生成する。

次に、コンテキストを拡張する。

次に、ループする。

成功基準が明確に定義されていない場合、システムは実際にはより正確にならずに長時間「ビジー」状態を維持する可能性がある。

エージェントには次のような概念が必要である:

停止

技術的理由であれ、財務的理由であれ。

より高い自動化はより高い効率を意味しない

原文は最後に、AI時代以前の有名な自動化失敗事例を引用している:Knight Capital

この類推が有用なのは、Knightの問題がLLMとはまったく関係がないからである。

これは自動化ソフトウェア、デプロイ管理、損失制限における失敗である。

2012年8月1日、Knight Capitalはニューヨーク証券取引所のリテール流動性プログラムのために新しい取引ソフトウェアをデプロイした。

米国証券取引委員会(SEC)によると、デプロイの誤りにより、古いコードが1台のサーバーでまだアクティブな状態にあった。

新システムが稼働したとき、その休止していた機能が市場に意図しない注文を送り始めた。

システムは約:

45分間

稼働し続けた。

SECは後に、Knightが意図しない数十億ドル規模の証券ポートフォリオを蓄積し、損失が:

4.6億ドル以上

に達したと述べた。

元の中国語記事は、一般的に引用される4.4億ドルという数字を使用している。SECの後の執行資料では4.6億ドル以上を使用しているため、本翻訳では正確性を期すために規制当局の数字を採用した。

Knight Capitalの教訓はセーフティネットの欠如にある

SECの批判は、単にソフトウェアにバグがあったというだけではない。

ソフトウェアには常にバグがある。

より深刻な失敗は以下を含む:

  • 脆弱なデプロイプロセス。
  • 不十分なテスト。
  • 欠如した制御手段。
  • 不十分な監視。
  • 効果的な自動シャットオフメカニズムの欠如。

Knightのシステムはマシンの速度で実行される。

その速度は

通常は利点である。

障害が発生している間、同じ速度が損害を拡大する。

基本パターンはエージェントコストリスクとほぼ同じだ:

自動化が正常に機能する
→ 速度は価値となる

自動化に障害が発生する
→ 速度が損失を増幅する

AIエージェントは新種の損失関数を追加する

Knightのシステムは取引を通じて直接資金を使った。

ほとんどの企業エージェントにはブローカーアクセスがない。

しかし、それらにはメーターがある。

モデル呼び出しのたびにコストが発生する可能性がある。

各ツールは下流に影響を及ぼす可能性がある。

一部のエージェントは以下の実行を許可されることもある:

  • クラウドリソースの購入。
  • タスクの起動。
  • 電子メールの送信。
  • コードの修正。
  • インフラのデプロイ。
  • サービスの調達。
  • データの移行。

AIシステムがより多くの権限を得るにつれて、その障害モードはチャットボットのエラーというよりは、自動化制御の喪失に似てくる。

そのため、AIガバナンスは金融システムやクラウドインフラでおなじみの概念をますます借用する必要がある:

  • 予算。
  • サーキットブレーカー(遮断機制)。
  • レート制限。
  • 承認しきい値。
  • 監査ログ。
  • ロールバック。
  • 緊急停止スイッチ。

自動化は成功と失敗の両方を増幅する

原文は正しい原則で締めくくられている。

自動化が約束すること:

  • より速い実行速度。
  • より低い単価コスト。
  • 反復的な人為的ミスの削減。
  • より大きな規模。
  • 24時間365日の稼働。

これらの利点は本物だ。

しかし、システムが正しい行動だけを選択的に増幅することはない。

それは同様に以下も増幅する:

  • 誤った仮定。
  • 壊れたループ。
  • 不適切な権限。
  • 設定ミスのあるツール。
  • 悪いインセンティブ設計。
  • 欠如した制限。

最も危険な自動化は、即座にクラッシュするシステムとは限らない。

それは、高速かつ反復的で不可視な形で失敗しながらも、生産的に見え続けるシステムである。

報告によると、Amazonの180万ドルのClaudeプロジェクトは、エージェントを使うのをやめる理由ではない。

むしろ、エージェントの消費を計測なしの実験として扱うのをやめる理由である。

実用的なAIエージェントコスト管理チェックリスト

デプロイ前

  1. ビジネス成果を明確にする。
  2. 成功したタスクごとの最大許容コストを設定する。
  3. 通常のトークンおよびツール使用量を見積もる。
  4. 厳格なタスクごとの上限を設定する。
  5. リトライ制限を定義する。
  6. タイムアウトを設定する。
  7. 影響の大きい操作には人間の承認を要求する。

実行中

  1. 支出を指定されたプロジェクトと担当者に帰属させる。
  2. 入力、出力、キャッシュ、ツール費用をそれぞれ追跡する。
  3. 異常な毎時または毎日の増加に対してアラートを発する。
  4. 重複呼び出しや停滞ループを検出する。
  5. 成功と失敗の結果を記録する。
  6. エージェントオペレーターに現在のコストを表示する。

実行後

  1. 成功した成果ごとのコストを計算する。
  2. 異常に高額な実行パスをレビューする。
  3. モデル階層を比較する。
  4. 適切な場合にキャッシュを使用する。
  5. 不要なコンテキストを除去する。
  6. 単純なタスクをより経済的なモデルにルーティングする。
  7. 動作の変化に応じて制限を更新する。

重要なのは、手段を選ばずに請求額を最小限に抑えることではない。

重要なのは、請求額を説明可能にすることだ。

よくある質問

Amazonは本当にClaudeプロジェクトに180万ドルを費やしたのか?

フィナンシャル・タイムズ紙は、Claude Sonnetを使用したAmazonのプロジェクトが約180万ドルのコストを累積し、予算を約860%超過し、問題が発見されるまでに約5か月かかったと報じた。この数字は内部の従業員レポートに基づくものであり、Amazonの公式なインシデントレポートではない。

Amazonのプロジェクトは本当に6000億トークンを使用したのか?

この数字は、180万ドルを入力トークン100万件あたり3ドルで割った単純な算術例にすぎない。このプロジェクトの実際のトークン数、モデルバージョン、入出力の組み合わせ、キャッシュ使用量、その他の費用は公に開示されていない。

現在のClaude Sonnetの価格は?

Anthropicは現在、Claude Sonnet 5を標準入力トークン100万件あたり2ドル、出力トークン100万件あたり10ドルで販売している。Sonnet 4.6および4.5の表示価格はそれぞれ3ドルと15ドルであり、この価格にはキャッシュ、バッチ処理、クラウドプラットフォームの差異は含まれない。

なぜAIエージェントはそれほど高額になるのか?

エージェントは単一のユーザーリクエストに対して複数回のモデル呼び出しを発生させ、大きなコンテキストを再送信し、ツールを呼び出し、失敗した操作を自動的にリトライすることがある。ワークフローがループに入ったり停止条件を欠いたりすると、タスクが有効な進捗を生まなくなっても支出が増加し続ける可能性がある。

Amazon KiroRankとは何か?

KiroRankは、従業員がAmazonのKiro AIツールを使用することに関連する非公式の内部リーダーボードであると報じられている。従業員がその指標の最適化だけに注力し始めた後、Amazonはこれを廃止し、リーダーシップも従業員に対し、使用量を増やすためだけにAIを使わないよう指示したと報告されている。

企業はAIエージェントの支出をどのように制限すべきか?

効果的な管理手段には、タスクごとのドル予算、モデル呼び出し回数の制限、リトライ上限、タイムアウト設定、ユーザーごと・チームごとの割り当て、異常アラート、使用量の帰属、緊急停止スイッチが含まれる。最良の測定基準は通常、生のトークン量ではなく、成功したビジネス成果あたりのコストである。

Knight CapitalとAIエージェントの関係は?

Knight Capitalは、十分な安全機構を欠いた自動取引デプロイが失敗した後、約45分で4億6000万ドル以上を失った。この事件は同じ一般原則を示している:自動化は有効な作業の速度を高めるが、失敗の速度と規模も高める。

トークン価格の引き下げで企業のAIコスト問題は解決するか?

価格を下げるだけでは十分ではない。単価の低下は、特にエージェントが自律的に動作する場合、使用量を増加させる可能性がある。企業は依然として可視性、予算、ルーティング、キャッシュ、結果に基づく測定を必要とする。

関連ツール

  • Anthropic Claude価格:Claudeモデル、プロンプトキャッシュ、バッチ処理、エージェントセッションの公式価格。
  • Amazon Bedrock:Claudeおよびその他の基盤モデルをエンタープライズレベルの管理機能とともに使用するためのAWSのマネージドプラットフォーム。
  • AWS Budgets:予算を定義し、支出または使用量がしきい値を超えたときにアラートをトリガーするAWSツール。
  • AWS Cost Explorer:AWSの経時的な支出を分析および帰属させるためのツール。
  • AWS Cost Anomaly Detection:異常なAWS支出パターンを特定する自動モニタリング。
  • Kiro:内部のKiroRank使用リーダーボードが報じられたAmazon AI開発環境。

関連リンク

制御不能な支出を引き起こす](https://www.ft.com/content/77baac40-d803-4084-94f3-a133653072cf):Amazonの180万ドルのClaudeプロジェクトおよびその他の内部コスト超過に関する主要レポート。

com/news/company-news/amazon-ceo-andy-jassy-on-generative-ai):アマゾンの公式メモであり、1000以上の生成AIサービスと、ジャシー氏が想定する数十億のエージェントの未来について記述されている。

概要

Claude Sonnetを使用したアマゾンのプロジェクトで、180万ドルの請求が累積し、予算を約860%超過していたことが報告された。発見までに5か月を要し、最終的に本番投入には至らなかった。この出来事は、強力な停止条件なしに従量課金のAIリソースをエージェントが繰り返し消費できる場合、通常のソフトウェアバグが異常に高額なコストを生む可能性があることを示している。

アマゾンはAI分野から撤退していない。AWSは急速に成長しており、同社は2026年の設備投資を約2200億ドルと見込んでいる。アンディ・ジャシーが描く未来には数十億のエージェントが含まれている。したがって、コスト暴走への対応は、自動化の縮小ではなく、コストガバナンスの強化になる可能性が高い。

同様の変化はシリコンバレー全体で見られる。アマゾンはKiroRankを終了し、Metaはtokenmaxxingから予算制へ移行し、Uberは従業員一人当たり・ツールごとに月額1500ドルの上限を設定し、サム・オルトマンはOpenAI内部でもAIコストが重大な懸念事項になっていると述べている。

Knight Capitalの失敗は永遠の教訓を与えている。自動化は効率を増幅するだけではない。制御が弱い場合、それは同じ速度で過ちも増幅するのだ。

企業における正しいAI指標は「どれだけのトークンを使ったか?」ではない。「それらのトークンがどのような測定可能な結果を生み出し、もはや価値を生まなくなったとき、何がシステムを停止させるのか?」である。