GPT-5.6 Sol、サイバーセキュリティテストでClaude Mythos 5を僅差で上回る、オープンソースモデルが差を縮める

英国人工知能安全研究所(AISI)が発表した2つのサイバーセキュリティ評価によると、GPT-5.6 SolはClaude Mythos 5をわずかに上回った。この結果は注目に値するが、慎重に解釈する必要がある。AISIは攻撃・防御のサイバーセキュリティ能力に関する包括的なランキングを発表したわけではなく、一連の限定的な狭義の技術的タスクと、模擬的な長期企業ネットワーク攻撃シナリオでモデルをテストした。これらの設定下で、GPT-5.6 Solは最高の平均スコアを達成し、一方Mythosは

发布于 2026年7月23日generalGEO 评分: 011 次阅读
Cover image for “GPT-5.6 Sol、サイバーセキュリティテストでClaude Mythos 5を僅差で上回る、オープンソースモデルが差を縮める”

GPT-5.6 Sol、サイバーセキュリティテストでClaude Mythos 5を僅差で上回る、オープンソースモデルが差を縮める

はじめに

英国人工知能安全研究所(AISI)が発表した2つのサイバーセキュリティ評価において、GPT-5.6 SolがClaude Mythos 5をわずかに上回る結果となりました。この結果は注目に値しますが、慎重に解釈する必要があります。

AISIは、攻防両方のサイバーセキュリティ能力を網羅する一般的なランキングを発表したわけではありません。同機関は、いくつかの具体的な技術タスクと、シミュレートされた長期にわたる企業ネットワーク攻撃におけるモデルのパフォーマンスをテストしました。これらの設定において、GPT-5.6 Solは最高の平均スコアを記録し、Mythos 5はそれに非常に近いスコアでした。

より重要な発見は、オープンウェイトモデルに関するものです。AISIは、GLM-5.2とDeepSeek V4-Proの性能が、わずか4~7ヶ月前にリリースされた主要なクローズドモデルと同等になっていることを発見しました。AISIの2025年の内部テストでは、そのタイムラグは6~10ヶ月でした。

このタイムラグの短縮は重要です。なぜなら、オープンウェイトモデルはダウンロード、修正、プライベートデプロイが可能であり、プロバイダーの監視なしで動作できるからです。研究支援、プライバシー保護、コスト削減といった柔軟性は、高度なサイバー能力がリリース後に制御することをより困難にする可能性もあります。

AISIが評価したもの

AISIは、2つの補完的な評価システムを採用しました。

狭領域ネットワークタスク

第1の評価システムは、96のタスクからなるより大きなセットから選ばれた70のタスクを通じて、特定のサイバーセキュリティスキルを測定します。

これらのタスクは、次の4つの主要分野をカバーしています:

  • 脆弱性調査とエクスプロイト
  • リバースエンジニアリング
  • ネットワークエクスプロイト
  • 暗号学

これらは、人間に必要とされる推定経験年数に基づいて、4つの難易度レベルに分類されています:

難易度レベル おおよその人間の経験 タスク数
技術的非専門家 技術バックグラウンドはあるがサイバーセキュリティ経験は限定的 18
見習い 約1~3年 25
実践者 約3~10年 19
専門家 10年以上 8

各モデルは各タスクにつき5回の試行機会が与えられ、各試行のトークン制限は250万です。AISIはその後、平均成功率を計算します。

サイバーレンジ

第2のシステムは、モデルがシミュレートされたネットワーク内で自律的にマルチステップ攻撃を持続できるかどうかを測定します。

レポートで議論されている主要なシナリオは、ラスト・サバイバーと呼ばれています。これには以下が含まれます:

  • 32の連続した攻撃ステップ
  • 4つのネットワークサブネット
  • 約20のホスト
  • いくつかの名前付きマイルストーン
  • 人間の専門家による推定作業時間は20時間

各主要モデルの軌跡は、10回の実行の平均を表し、各実行のトークン制限は1億です。

これらの環境は、厳重に防御された実際の組織を攻撃する際のすべての困難を再現しているわけではありません。AISIは、これらのレンジには現在、能動的な人間の防御者や防御ツールが含まれておらず、アラートトリガーに対するペナルティもないと指摘しています。

GPT-5.6 SolとMythos 5の結果が実際に示すもの

狭タスクスイートでは、GPT-5.6 SolがAISIの発表したグラフで最高の平均成功率を記録しました。Claude Mythos 5がそれに続き、両者の不確実性範囲は重なっています。

画像はAISIが発表したグラフで、最近のオープンウェイトモデルと4~5ヶ月前にリリースされた最先端のクローズドモデルの狭いネットワークタスクにおけるパフォーマンスを比較しています。横軸は時間、縦軸は平均成功率です。グラフでは、GPT-5.6-Sol、GPT-5、Claude Mythos 5など、複数のモデルが異なる色で識別されています。GPT-5.6-Solは2026年2月の平均成功率が90%近くであるのに対し、Claude Mythos 5は2025年10月の平均成功率が約60%です。このグラフは文脈と密接に関連しており、狭いネットワークタスクにおけるモデルのパフォーマンスの差を視覚的に示しています。

グラフは、GPT-5.6 Solの平均成功率が90%をわずかに上回るのに対し、Mythos 5は約90%であることを示しています。不確実性バーが重なっているため、この結果は、今回の評価における微弱なリードと表現されるべきであり、Solがあらゆるサイバーセキュリティシナリオにおいて絶対的に優れていることを証明するものではありません。

長期範囲タスクでも同様の状況が見られます。

平均して、GPT-5.6 Solは32ステップ中約29ステップを完了したのに対し、Claude Mythos 5は約27ステップでした。両モデルの最良の試行では、すべてのステップを完了しました。

これにより、以下の結論が導き出せます:

  1. GPT-5.6 Solは、この特定の範囲タスクにおいて平均して最高のパフォーマンスを示しました。
  2. Mythos 5はそれに近いパフォーマンスを示し、最良の試行では32ステップすべてを完了しました。
  3. この差は、モデル能力、エージェントの信頼性、ツール使用、長期計画能力、またはこれらの要因の組み合わせを反映している可能性があります。
  4. 単一のサイバーセキュリティ範囲からのエビデンスの強度は、多数の多様なタスクからのデータよりも弱いです。
  5. これらの結果は、一般的な攻撃的セキュリティランキングを確立するものではありません。

AISIのレポートは、SolとMythosの間の総合的な勝者を判定することよりも、主にオープンソースモデルとクローズドソースモデルの能力差に焦点を当てています。

オープンソースモデルは現在わずか4~7ヶ月の遅れ

AISIがGLM-5.2とDeepSeek V4-Proを選んだのは、テスト実施時点でそれらが主要なオープンソースモデルの候補だったためです。

レポートの中心的な比較は、パフォーマンスが近いモデルとそのリリース日の間隔に基づいています。

オープンソースモデル 評価タスク 比較可能なクローズドソースモデル 推定リリース日の差
GLM-5.2 狭いネットワークタスク Claude Opus 4.6 と GPT-5.3-Codex 約4ヶ月
GLM-5.2 「ラスト・サバイバー」サイバーセキュリティレンジ Claude Opus 4.5 7ヶ月未満
DeepSeek V4-Pro 狭いネットワークタスク Claude Opus 4.5 約5ヶ月
DeepSeek V4-Pro サイバーセキュリティレンジタスク 特定の範囲でSonnet 4.5を下回る 直接的な最先端モデルとの一致とはみなされず

GLM-5.2は、4つの狭タスク難易度レベルすべてにおいて、Opus 4.6と同等のパフォーマンスを示しました。「ラスト・サバイバー」レンジタスクでは、Opus 4.5と同じ最終平均ステップ数に達しました。

DeepSeek V4-Proは、狭タスクではOpus 4.5に匹敵しましたが、長期レンジタスクではパフォーマンスが低かったです。

AISIの2025年の内部テストでは、主要なオープンソースモデルはクローズドソースの最先端モデルに対して6~10ヶ月遅れていました。最新の4~7ヶ月という推定は、防御側の準備期間が短縮されている可能性を示唆しています。

この差が固定された予測ではない理由

4~7ヶ月という数字は、AISIがテストしたモデルと評価タスクのみを説明しています。これは、将来のすべてのオープンソースモデルがこの固定された遅れを維持するという予測ではありません。

複数の要因により、この差はどちらかの方向に動く可能性があります:

  • クローズドソースの開発者が突然の能力の飛躍を達成する可能性があります。
  • オープンソースモデルが最近の最先端の改良を再現する可能性があります。
  • より優れたエージェントフレームワークが既存のモデルからさらなるパフォーマンスを引き出す可能性があります。

重み。

  • ファインチューニングとモデル固有のプロンプトは、測定される能力を変える可能性があります。
  • 新しいベンチマークは、現在のテストでは発見できなかった弱点を露呈させる可能性があります。
  • デプロイコストと利用可能なハードウェアは、実際の悪用リスクを制限する可能性があります。
  • セーフガードとアクセス制御は、ホストされたモデルの利用可能な能力を変える可能性があります。

AISIはまた、モデル固有の詳細な抽出や最適化を行っていないため、その設定がオープンウェイトモデルの最大能力をわずかに過小評価している可能性があると述べています。

本レポートはサイバーセキュリティ分野にのみ適用され、科学、プログラミング、一般的な推論、またはその他の分野における同等の差を推測するために使用されるべきではありません。

オープンソースモデルは同程度の能力レベルでコストが大幅に低い

能力の差は小さいですが、価格の差は大きいです。

AISIは、パフォーマンスが近いモデルについて、公表されているファーストパーティのトークン価格を比較しました。

実行

1億トークンのネットワークセキュリティ訓練場のコスト

モデル 概算コスト
Claude Opus 4.5 85ドル
Claude Opus 4.6 85ドル
GLM-5.2 46ドル
DeepSeek V4-Pro 1.19ドル

単一タスクを100%の信頼性で解決するコスト

比較項目 クローズドソースモデルコスト オープンウェイトモデルコスト
Opus 4.6 vs GLM-5.2 15.17ドル 6.12ドル
Opus 4.5 vs DeepSeek V4-Pro 12.50ドル 0.28ドル

これらの例では、DeepSeek V4-Proの公表価格は同種のクローズドソースモデルよりも1~2桁低い。

この比較には限界がある。AISIはテスト対象のオープンウェイトモデルを自社のプロバイダー経由で実行していないため、実際のインフラ費用は異なる可能性がある。また、セルフホスティングにはハードウェア、エンジニアリング、電力、ネットワーク、メンテナンスなどのコストが伴い、これらはAPI価格には反映されない。

それでも、推論コストの低さは反復的な実験、ファインチューニング、プライベートデプロイをより実現可能にする。

オープンウェイトがセキュリティ問題を変える理由

オープンウェイトモデルには実用的な利点がある:

  • プライベートデプロイ
  • 元のプロバイダーへのデータ送信が不要
  • 特定タスクへのカスタマイズ
  • プロバイダーのサービス停止の影響を受けない
  • 再現可能な研究
  • モデル重みの検査と修正
  • 組織間のコラボレーション

同じ特性が、公開後に取れるセキュリティ対策も制限する。

クローズドソースモデルのプロバイダーは以下を行える:

  • 異常な使用パターンの監視
  • 分類器の適用
  • アカウントの停止
  • アクセスレートの制限
  • セキュリティ対策の更新
  • 特定ツールの制限
  • モデルの撤回や置き換え

モデル重みが公開されれば、コピーは再配布され、非公開で実行される。拒否動作は修正され、デプロイ監視は除去され、元の開発者はすべてのコピーを確実に回収できない。

AISIは、セキュリティ対策が2つのオープンウェイトモデルの大半のテストを実質的に妨げなかったことを確認した。DeepSeek V4-Proはリバースエンジニアリングタスクを拒否することがあったが、数回の再試行で回避できた。

これはすべてのオープンウェイトモデルが悪意を持って使用されることを意味するわけではなく、モデルがリスク関連の能力レベルに達した場合、公開の判断が覆せなくなることを意味する。

クローズドソースモデルもより強力なセキュリティ対策を必要とする

クローズドアクセスはセキュリティの保証ではない。

AnthropicはClaude Fable 5とClaude Mythos 5を2026年6月9日に公開した。Fable 5は通常アクセスに強力な分類器を使用し、Mythos 5は限られた信頼できる防御者グループに対し、基盤モデルのより多くのネットワークセキュリティ能力を公開した。

6月12日、米国の輸出規制によりAnthropicはアクセスを一時停止した。Anthropicによると、この指示はAmazon研究者が限定的なネットワークセキュリティシナリオでFable 5の防御を回避する方法を記したレポートを提出した後に出された。

その後Anthropicは更新された分類器を訓練し、政府および業界パートナーと共同で脱獄重大性評価フレームワークを策定し、規制解除後の7月1日にFable 5を全世界で再公開した。

この出来事はいくつかの点を明らかにした:

  • 分類器は偽陰性と偽陽性を生じる可能性がある。
  • 脱獄手段の重大性は大きく異なる。
  • 回避手段は必ずしもモデルの最も危険な能力を明らかにしない。
  • クローズドプロバイダーは防御を更新し、アクセスを一時停止できる。
  • これらの介入は正当なセキュリティ作業も妨げる可能性がある。
  • 業界や政府にはネットワーク脱獄を判断する統一基準がまだない。

クローズドデプロイはより多くの介入オプションを提供するが、それらには効果的な監視、テスト、ポリシー、技術的管理が必要である。

防衛準備の窓口は狭まっている

AISIは、オープンとクローズドのギャップを準備時間として表現する。

最強のシステムが同等のオープンウェイト公開前に数カ月間制御されている場合、防御側はこの時間を以下に活用できる:

  • 脆弱性の発見と修正
  • 資産インベントリの改善
  • サポート対象外ソフトウェアの削除
  • アイデンティティ管理の強化
  • フィッシング耐性認証の導入
  • ネットワークセグメンテーションの改善
  • ログ記録と検出の拡張
  • インシデント対応計画のテスト
  • AI支援コードレビューと脅威分析の適用

6~10ヶ月が4~7ヶ月に短縮されるということは、同等の能力がより安価で普及する前に組織がこれらの作業を完了する時間が減少する可能性があることを意味する。

英国国家サイバーセキュリティセンターは、AIが強固なセキュリティ慣行と脆弱なセキュリティ慣行の差を拡大すると警告している。ガイドラインでは、AIツールは脆弱な基盤を補完できないことを強調している。

パッチ管理の不備、サービスの露出、資格情報の再利用、不完全なバックアップ、限定的な監視を行う組織は、攻撃者がどのAIモデルを使用しても脆弱なままとなる。

AIは防御的なセキュリティ作業も加速させる

攻撃評価に使用される同じ能力は、防御側がコードの監査、テストの生成、障害の調査、脆弱性研究の拡大を支援できる。

最近の事例として、ゲームネットワーク開発者のGlenn FiedlerがClaude CodeとClaude Fable 5を使用して4つの成熟したオープンソースライブラリを監査したケースがある:

  • netcode
  • reliable
  • serialize
  • yojimbo

この監査により、libFuzzerターゲット、サニタイザーベースのCI、数百万回の反復ストレステスト、ゴールデン回線フォーマットテスト、行ごとのレビューが追加された。

公開された脆弱性記録は43件の修正を示している:

ライブラリ 総修正数 ネットワーク到達可能修正数
netcode 7 2
reliable 7 6
serialize 11 7
yojimbo 18 12
合計 43 27

最も深刻な問題はyojimboで、2019年からリモートでトリガー可能なヒープオーバーフローが存在した。巧妙に細工されたチャンクフラグメントは、サイズ検証前に再構成バッファにコピーされる可能性があった。

リストアップされた各問題には修正コミットとバージョンリンクが付属し、各修正にはリグレッションテストが含まれている。開発者は2週間の修正期間中にClaude Codeに2500ドル以上を費やしたと報告している。

影響を受けるライブラリのユーザーは、公開脆弱性記録で指定された最新バージョンにアップグレードすることが推奨されている。

この事例は、AIエージェントが任意のソフトウェアを独立して保護できることを証明するものではない。しかし、知識豊富なメンテナーがAIを活用して既存コードベースのファジング、サニタイザーカバレッジ、レビュー、テスト生成を拡大できることを示している。

攻防加速の非対称性

AIは両陣営を支援できるが、展開方法は異なる。

攻撃者は利用可能な脆弱性、アクセス可能なターゲット、成功する経路が1つあればよい。オープンウェイトモデルは公開後に繰り返しコピーされ再利用できる。

防御側は多数のシステムを保護し、資産インベントリを維持し、パッチの優先順位を付け、変更をテストし、ダウンタイムを管理し、チーム間で調整しなければならない。防御策の改善は組織ごとに個別に実装する必要がある。

これにより非対称性が生じる:

  • 攻撃能力は迅速に拡散する。
  • 防御能力はローカルで実装する必要がある。
  • モデルの公開は一度で完了できる。
  • セキュリティアップデートは複数回展開する必要がある。
  • 攻撃者は最も脆弱なターゲットを選択できる。
  • 防御側はすべての重要な経路をカバーしなければならない。

適切な対応は防御AIの使用を避けることではなく、それを強固なエンジニアリングプラクティス、人間の専門知識、実証済みのセキュリティ管理と組み合わせることである。

組織はどう対応すべきか

AISIとNCSCの発見は、実践可能な一連の行動を支持する。

1. まずベースラインを強化する

以下を優先する:

  • 資産インベントリ
  • サポート対象ソフトウェア
  • 迅速なパッチ適用
  • 多要素認証
  • 最小権限アクセス
  • ネットワークセグメンテーション
  • テスト済みバックアップ
  • 集中ログ記録
  • インシデント対応訓練

これらの基礎が既に存在する場合、AI強化防御は最も効果的に機能する。

2. 継続的なセキュリティテストを拡張する

ソフトウェアプロジェクトには以下を導入する:

  • ファジング
  • AddressSanitizer
  • UndefinedBehaviorSanitizer
  • サポートがある場合はMemorySanitizer
  • 静的解析
  • 依存関係スキャン
  • 確認されたバグごとのリグレッションテスト
  • 信頼できない入力パスのセキュリティレビュー

Mas Bandwidth監査が有用だったのは、生成された説明を信頼するのではなく、機械的な証拠とAIレビューを組み合わせたからである。

3. AIの発見は手がかりとして扱い、証拠として扱わない

AIによる脆弱性レポートは正しく、不完全、または誤解を招く可能性がある。

以下のことを要求する:

  1. 再現
  2. 根本原因分析
  3. 人手による確認
  4. 最小限の修正
  5. 回帰テスト
  6. リリースドキュメント
  7. 状況に応じた調整済み開示

4. エージェント権限の制限

防御的コーディングエージェントは、デフォルトで無制限のアクセス権限を持つべきではありません。

制限事項:

  • 本番環境の認証情報
  • ネットワークアクセス
  • 破壊的なシェルコマンド
  • リポジトリ書き込み範囲
  • キーへのアクセス
  • デプロイ権限
  • 外部通信

隔離環境を使用し、重要アクションは人間の承認を経てから実行すること。

5. コストと効果の測定

以下の指標を追跡する:

  • 確認された脆弱性
  • 誤検知
  • 再現に要した時間
  • 修正に要した時間
  • 新たなテストカバレッジ
  • トークンおよびインフラコスト
  • 人手による確認時間
  • デプロイ後のセキュリティロールバック

モデルが信頼できない結果を出力したり、多大な確認作業が必要な場合、最も安価なモデルが必ずしも費用対効果に優れているとは限らない。

AIサイバーセキュリティベンチマークの解釈方法

サイバーセキュリティベンチマークは有用ですが、その適用範囲を明確に理解する必要がある。

高スコアは現実世界での侵害を意味しない

シミュレーション環境は単純化されている。実際のネットワークには、能動的防御者、エンドポイント保護、アラート機構、レート制限、おとりシステム、不完全な情報が存在する可能性がある。

モデル能力とエージェント能力は相互に関連する

長期タスクの結果は、モデルの知識だけに依存しない。ツール設計、メモリ、コンテキスト管理、リトライ戦略、プロンプト構成、実行信頼性が性能に影響を与える。

平均結果と最良試行結果は異なる問いに答える

最良試行は、システムが時に何ができるかを示す。平均結果は、システムが複数回の実行でどの程度着実に進捗するかを示す。

運用リスクを考える上で、両方とも重要である。

リリース日に基づく比較は近似値に過ぎない

旧モデルと同程度の性能を示すモデルは、旧モデルと全く同じではない。これらのシステムは、異なる強み、弱み、防御策、コスト、導入制約を持つ可能性がある。

サイバーセキュリティ能力は両刃の剣である

同じスキルが、ペネトレーションテスト、セキュリティコードレビュー、インシデント対応、脆弱性発見、または悪意ある侵入に利用される可能性がある。

評価結果は、リスク管理と防御的セキュリティ投資の両方に情報を提供するべきである。

よくある質問

GPT-5.6 Sol は AISI のテストにおいて Claude Mythos 5 より優れているか?

GPT-5.6 Sol は、AISI の限定的なサイバーセキュリティタスクおよび特化した長期サイバーセキュリティ環境において、わずかに高い平均結果を示した。Mythos 5 のスコアはこれに近く、限定的なタスクセットにおける不確実性の範囲には重複があり、両モデルとも最良試行では 32 ステップすべてを完了した。

これは GPT-5.6 Sol が最良のサイバーセキュリティモデルであることを意味するか?

必ずしもそうではない。AISI は特定のタスクセットとシミュレーション環境をテストしており、実際のあらゆる防御シナリオや攻撃シナリオを対象としているわけではない。結果は汎用的なランキングではなく、限定されたベンチマーク比較を裏付けるものである。

オープンウェイトモデルと最先端クローズドモデルの差はどの程度か?

AISI は、テストした主要なオープンウェイトモデルには 4~7 か月の差があると推定している。この数字は、実測性能と比較可能なクローズドモデルのリリース日を照合して導き出されている。

最も性能が良いオープンウェイトモデルはどれか?

レポート発表時点で、GLM-5.2 は AISI テストにおいて最も強力なオープンウェイトモデルである。限定的なタスクでは Opus 4.6 と同等の性能を示し、特化したサイバーセキュリティ環境では Opus 4.5 と同じ平均スコアを達成した。

なぜオープンウェイトモデルはサイバーセキュリティ上の懸念を引き起こすのか?

そのウェイトはダウンロード、改変、プライベートデプロイ、再配布が可能である。これは研究やプライバシー面で利点をもたらす一方で、元の開発者が悪用を監視したり、デプロイされたセキュリティ対策を更新したり、ユーザーを停止したり、すべてのコピーを回収したりする能力を制限する。

AISI の評価において、オープンウェイトモデルは費用対効果に優れているか?

はい。発表された公式価格によれば、GLM-5.2、特に DeepSeek V4-Pro は同等のクローズドモデルよりも大幅に安価である。実際のセルフホスティングおよびサードパーティデプロイのコストは異なる可能性がある。

AI モデルは防御者と攻撃者の両方を助けることができるか?

はい。AI はコードレビュー、ファジングテスト生成、脆弱性分析、ログ調査、修正を支援できる。Claude Code を活用したセキュリティ業務の後、Mas Bandwidth 監査では 4 つのネットワークライブラリに対して 43 件の修正が記録された。

組織は何を優先すべきか?

AIツールに依存する前に、まず基本的なセキュリティ管理を強化すること。資産の可視性、パッチ管理、ID保護、バックアップ、ネットワークセグメンテーション、監視、テスト済みのインシデント対応は、依然として重要である。

関連ツール

  • AISI Inspect Cyber:エージェントベースのサイバーセキュリティタスクを作成・実行するための評価フレームワーク。
  • Inspect AI:AISI が大規模言語モデル評価のために開発したオープンソースフレームワーク。
  • GLM-5.2:Z.ai 提供の公式オープンウェイトモデルリポジトリ。
  • DeepSeek API:DeepSeek モデルの公式ドキュメントおよび現在のアクセス情報。
  • Claude Code:リポジトリ作業、テスト、セキュリティレビューのための Anthropic のエージェントベースコーディング環境。
  • NCSC Cyber Essentials:英国が支援する、一般的なサイバー脅威から組織を保護するためのベースライン標準。

関連リンク

まとめ

AISI の最新結果によると、指定された 2 つのサイバーセキュリティ評価の平均スコアにおいて、GPT-5.6 Sol は Claude Mythos 5 をわずかに上回った。このリードは小さく、普遍的な優位性の証拠とみなすべきではない。

報告書の主な結論はより広範である。GLM-5.2 および DeepSeek V4-Pro が同等のフロンティアクローズドモデルに遅れをとる期間は現在 4~7 か月に短縮しており、AISI が 2025 年に内部テストした際のギャップは 6~10 か月であった。

その価格も競合他社を大きく下回っている。

この短縮されたラグタイムは、高度な能力がより簡単にダウンロード、修正、ローカル実行可能になる前に、防御側が対応できる時間の窓がさらに狭まることを意味する。同時に、Claude Codeが4つのネットワークライブラリで43件の脆弱性を発見したパフォーマンスは、強力なモデルが防御的な作業を加速させる可能性を示している。

実際の対策は、単にモデル防御やAIセキュリティツールに依存するのではなく、セキュリティのベースラインを強化し、管理されたテスト駆動型で人間がレビューする防御プロセスの中でAIを活用することである。