Gemini 3.6 Flashは効率性を重視するが、独立したテストでは知能の向上は平凡

Googleは、エージェント市場の異なる領域をターゲットとした3つの新たなGeminiモデルを発表しました。

发布于 2026年7月22日generalGEO 评分: 012 次阅读
「Gemini 3.6 Flashは効率性を重視するが、独立したテストでは知能の向上は平凡」の記事カバー画像

Gemini 3.6 Flashは効率性を重視するが、独立したテストでは知能の向上は平凡

はじめに

Googleは、エージェント市場の異なる領域をターゲットとした3つの新たなGeminiモデルを発表しました。

  • Gemini 3.6 Flash:主にコーディング、マルチモーダルワーク、マルチステップエージェント向けの主力モデル
  • Gemini 3.5 Flash-Lite:高スループットおよびレイテンシ重視のワークロードに最適化
  • Gemini 3.5 Flash Cyber:ソフトウェアの脆弱性の発見、検証、修正を目的とした制限付きサイバーセキュリティモデル

Googleの発表は効率性を中心に据えています。同社によると、新しいFlashモデルは、より少ない出力トークン、より少ないツール呼び出し、より低い実行ループのオーバーヘッドでタスクを完了できるとしています。価格もGemini 3.5 Flashよりも低くなっています。

この点については、Googleの内部ベンチマークと初期の独立テストによって裏付けられています。

より複雑な問題は、Gemini 3.6 Flashが、従来のモデルと比較して知能面で実質的な向上を遂げているかどうかです。

Artificial Analysisは、総合知能指数において新モデルがGemini 3.5 Flashと同じスコアを記録したと報告しています。初期ユーザーからも、特にビジュアルデザイン、中国語生成、ツール選択、指示追従能力において、賛否両論のフィードバックが寄せられています。

結果は単なる失敗ではありません。Gemini 3.6 Flashは、より高速で出力が簡潔になり、多くのワークロードにおいてタスクあたりのコストが低減しているように見えます。また、コーディング、コンピューター使用、機械学習、ナレッジワークに関する複数のベンチマークでも改善が見られます。

しかし、今回の発表は重要な違いを示しています。

モデルは、汎用知能や主観的な出力品質が同様に大幅に向上しなくても、効率性を高めることができるのです。

この画像は、Google DeepMindが公開したツイートの内容であり、ドキュメント内で言及されている3つの新しいGeminiモデルに関する情報を示しています。ツイートは3つのコアモデルを明確に紹介しています:効率性を最適化し、同じコストでより高い作業品質を提供するGemini 3.6 Flash、コストパフォーマンスと低レイテンシを重視し日常タスクに適したGemini 3.5 Flash-Lite、そして重要なソフトウェア脆弱性の発見と修正を目的としたサイバーセキュリティモデルGemini 3.5 Flash Cyberです。この画像は、Googleが異なるエージェント市場向けに3つのGeminiモデルを発表したというドキュメントの内容を裏付け、各モデルの機能説明と位置づけを視覚的に示しています。

3つの新しいGeminiモデルの概要

モデル 主な用途 API価格(100万トークンあたり) デフォルトの思考レベル 利用可能性
Gemini 3.6 Flash コーディング、マルチモーダルワーク、複雑なエージェントワークフロー 入力$1.50 / 出力$7.50 一般公開
Gemini 3.5 Flash-Lite 高容量の抽出、検索、翻訳、ルーティング、サブエージェント 入力$0.30 / 出力$2.50 最小 一般公開
Gemini 3.5 Flash Cyber 脆弱性の発見、検証、修正 未公開 特化型 政府および信頼できるパートナー向けの限定パイロット

Gemini 3.6 Flash および Gemini 3.5 Flash-Lite は、以下をサポートします。

  • 最大 100万トークン のコンテキスト
  • 最大 64,000 の出力トークン
  • テキスト、画像、音声、動画の入力
  • テキスト出力
  • 設定可能な思考レベル
  • コンピューター使用を含む組み込みツール
  • Gemini APIおよびGoogle AI Studio経由でのアクセス

Googleのモデルカードでは、これら2つの一般公開モデルの知識カットオフ日は 2026年3月 とされています。

Gemini 3.6 Flash:少ないトークンと低いタスクコスト

Gemini 3.6 FlashはGemini 3.5 Flashをベースにしており、コーディング、ナレッジワーク、マルチモーダルワーク、エージェントワークロードの多くにおいて、後者の代替となることを目的としています。

最も一貫した改善点は効率性です。

Googleは、AI分析指数において、Gemini 3.6 FlashがGemini 3.5 Flashよりも出力トークンを17%削減したと報告しています。DeepSWEを含む一部のエージェントコーディング評価では、出力トークンが最大**65%**削減されたことを観測しています。

また、このモデルは以下のような傾向があります。

  • 推論ステップの削減
  • ツール呼び出しの削減
  • 実行ループの短縮
  • 不必要なコード変更の削減
  • 最終出力の簡潔化

これらの変更が重要なのは、エージェントのコストが公表されたトークン単価だけに依存しないからです。

長時間実行されるエージェントは、モデルを繰り返し呼び出し、大規模なツール定義を送信し、ファイルをチェックし、コードを実行し、障害から回復し、大量の推論出力を生成する可能性があります。トークン単価の変動が小さくても、呼び出し回数とトークン数を削減することで総コストを削減できます。

Gemini 3.6 Flash の料金設定

Googleは以下のAPI価格を発表しています。

トークンタイプ Gemini 3.6 Flash Gemini 3.5 Flash
入力 100万トークンあたり1.50ドル 100万トークンあたり1.50ドル
出力 100万トークンあたり7.50ドル 100万トークンあたり9.00ドル

入力価格は変わらず、出力価格は約**16.7%**低下しました。

その評価設定において、Artificial AnalysisはGemini 3.6 Flashのタスクあたりの平均コストを約0.50ドル、Gemini 3.5 Flashを0.59ドルと測定しました。これは、出力価格の低下と生成トークンの削減により、約18%の減少に相当します。

これらの数値はワークロード固有のものであり、普遍的に適用できるものではありません。実際のコストは以下に依存します。

  • プロンプトサイズ
  • 思考レベル
  • 出力長
  • 呼び出し回数
  • ツール使用
  • コンテキストキャッシュ
  • リトライ動作
  • エージェントフレームワークの種類
  • アプリケーションが毎回完全な会話を送信するかどうか

高速化はトークン生成速度だけではない

Artificial Analysisは、Gemini 3.6 Flashの平均タスク時間が約1.3分であり、Gemini 3.5 Flashの約2.7分から短縮されたと報告しています。

この改善は、より高速な出力とより効率的な推論プロセスによるものです。

高速にトークンを生成できるモデルでも、ツール呼び出しの繰り返しループに陥ると、長い時間がかかる可能性があります。逆に、やや遅いモデルでも、少ない呼び出しで正しい解決策を見つければ、より早く完了する可能性があります。

エージェント開発者にとって、完了したタスクあたりの所要時間は、生の秒間トークン生成数よりも有用であることが多いです。

コーディング、機械学習、コンピューター使用、ナレッジワーク

Googleは、複数のベンチマークカテゴリでの改善を報告しています。

コーディングおよびソフトウェアエンジニアリング

DeepSWEにおいて、Gemini 3.6 FlashはGemini 3.5 Flashと比較して、スコアが**37%から49%**に向上しました。

Googleによると、このモデルは以下の特徴を持ちます。

  • 不要な編集の削減
  • より短いデバッグループの使用
  • 要求範囲へのより厳密な従順
  • 本番環境に近いコードの生成
  • 変更前のプログラムによるプロジェクトチェックの優先

最後の点にはトレードオフが存在します。

Googleの開発者ガイドによると、Gemini 3.6 Flashは編集前に診断スクリプトを実行する可能性があり、これにより複雑なタスクの精度は向上します。しかし、単純なフロントエンド作業では、それらの追加の探索的操作が遅延を増加させ、結果を改善しない場合があります。

Googleも、人間の評価者が時に初期モデルのビジュアルレイアウトやスタイルを好むことがあり、Gemini 3.6 Flashがより実用的なコードを生成しても同様である、と述べています。そのため、インターフェースを構築する開発者は、より明確なビジュアルデザインの制約を提供する必要があるかもしれません。

機械学習研究

MLE-Benchでは、Googleは結果が**49.7%から63.9%**に改善したと報告しています。

この評価は、孤立したコーディング問題ではなく、実際の機械学習エンジニアリングおよび研究タスクに焦点を当てています。この改善は、実験、データ処理、実装、反復的な改善を必要とするワークフローにおいて、モデルのパフォーマンスが向上したことを示しています。

コンピュータ使用能力

OSWorld-Verifiedでは、Googleの公開比較によると、Gemini 3.6 Flashは**78.4%から83.0%**に改善しました。

コンピュータ使用能力は、Gemini APIおよびGemini Enterpriseを通じて、組み込みのクライアントツールとして提供されるようになりました。これにより、エージェントシステムは直接APIに依存するだけでなく、グラフィカルインターフェースと対話できるようになります。

コンピュータ使用能力のベンチマーク結果は、依然としてエージェントフレームワーク、画面環境、タスク設計、障害回復戦略の影響を受けます。スコアが高いことは有益ですが、本番システムでは重要な操作に対して厳格な権限と確認手順を引き続き設定する必要があります。

知識業務

GDPval-AA v2では、Gemini 3.6 Flashは1349から1421に改善しました。

Googleは以下のユースケースを強調しています:

  • 文書解析
  • 図表解釈
  • 財務データ分析
  • レポート作成
  • 録音分析
  • コード移行
  • マルチモーダル研究ワークフロー

Figma、Harvey、Hebbia、JetBrainsなどの顧客は、Googleの発表に対して肯定的な評価を提供しました。これらの推薦コメントは顧客体験を反映したものであり、独立したベンチマークとして扱われるべきではありません。

知識カットオフ日とコンテキストウィンドウ

Gemini 3.6 Flashは、最大100万トークンのコンテキストウィンドウと、最大64000トークンの出力をサポートしています。

そのモデルカードに記載されている知識カットオフ日は2026年3月であり、これは初期のGeminiバージョン(カットオフ日が著しく早い)からの改善です。

新しい知識カットオフ日により、開発者が手動で提供しなければならない基本的な最近のコンテキスト情報の量が減少します。しかし、これによりモデルが現在のニュース、リアルタイム価格、変化する法律、ソフトウェアリリース、その他の時事情報を確実に処理できるようになるわけではありません。

新しい情報を扱うアプリケーションは、引き続き検索、サーチ、検証済みデータベース、ツールコールを使用する必要があります。

また、大きなコンテキストウィンドウは、モデルが長い文書のすべての部分を同等に効果的に活用できることを保証するものではありません。開発者は以下をテストする必要があります:

  • 遠く離れた部分間の検索精度
  • 長い会話における一貫性
  • 重要なルールが有効に保たれているか
  • 無関係な資料が含まれる場合のパフォーマンス
  • 実際のコンテキスト長におけるコストとレイテンシ

Gemini 3.6 Flashのセキュリティアップグレード

Googleは、Gemini 3.6 Flashには、以下に対するより強力な最先端のセキュリティ対策が含まれていると述べています:

  • 化学、生物、放射性、核兵器の悪用
  • サイバー攻撃の悪用
  • ジェイルブレイク耐性

モデルカードの報告によると、Gemini 3.5 Flashと比較して、自動多言語およびコンテンツセキュリティの結果が改善され、不合理な拒否率は比較的低く維持されています。

Googleはまた、いくつかの制限を指摘しています:

  • モデルは幻覚を起こす可能性があります。
  • 応答が遅くなったり、タイムアウトが発生したりすることがあります。
  • 一部の内部テストでは、トーンがわずかに後退していることが示されています。
  • ジェイルブレイク防御は継続的な改善分野です。

Googleの最先端セキュリティ評価では、Gemini 3.6 Flashは依然として同社が設定した重要な能力レベル(サイバーセキュリティのしきい値を含む)を下回っていると結論付けています。

この結論はGoogleの評価フレームワークに基づいており、入手可能な独立したセキュリティテスト結果と併せて解釈されるべきです。

Gemini 3.5 Flash-Lite:高スループット向けオプション

Gemini 3.5 Flash-Liteは、最大の推論深度よりも、速度、スループット、コストを重視するタスク向けに設計されています。

典型的なユースケースは次のとおりです:

  • 文書抽出
  • 分類
  • 検索
  • 翻訳
  • データルーティング
  • 構造化JSON生成
  • レシート処理
  • Eコマースデータ分析
  • 大量サブタスクの実行

Googleはこれを、Gemini 3.5シリーズの中で最速かつ最も低コストなモデルであると説明しています。

Gemini 3.5 Flash-Liteの価格

トークンタイプ 百万トークンあたりの価格
入力 0.30 米ドル
出力 2.50 米ドル

デフォルトの思考レベルは最低で、スループットと低レイテンシを優先します。

自律的なサブタスク、コード実行、ツールコール、マルチステッププランニングについては、Googleは必要に応じて思考レベルを中程度または高程度に引き上げることを推奨しています。高い設定にするとタスク完了率が向上しますが、通常はトークン使用量とレイテンシが増加します。

速度

Googleの発表では、Artificial Analysisがプレリリーステストで測定した、約毎秒350出力トークンというデータが引用されています。

Artificial Analysisはその後、時間とともに変化する可能性のある特定ベンダーの速度を記録しました。スループットは以下に依存します:

  • ベンダーのキャパシティ
  • リクエストサイズ
  • 推論設定
  • 出力長
  • リージョンルーティング
  • 現在の需要
  • テストが可視出力を測定しているのか、隠れた推論を測定しているのか

安定した結論は、Flash-Liteは設計上、より大きなFlashモデルよりも大幅に高速であるということです。

ベンチマークの改善

Googleは、Gemini 3.1 Flash-Liteに対する以下の改善を報告しています:

ベンチマーク Gemini 3.1 Flash-Lite Gemini 3.5 Flash-Lite
Terminal-Bench 2.1 31% 54%
GDM-MRCR v2 60.1% 72.2%
GDPval-AA v2 642 1140

Googleはまた、Gemini 3.5 Flash-Liteが複数のエージェントおよびコーディングベンチマークでGemini 3 Flashを上回ったと報告しています:

  • SWE-Bench Pro:54.2% vs 49.6%
  • OSWorld-Verified:74.0% vs 65.1%

これにより、Flash-Liteは単なる低品質の経済的モデルではありません。特定の限定的な高スループットエージェントタスクでは、旧モデルのGemini 3 Flashよりも優れたバランスを提供する可能性があります。

独立したインテリジェンスの向上

Artificial Analysisは、Gemini 3.5 Flash-Liteのインテリジェンス指数スコアを36と評価しており、これはGemini 3.1 Flash-Liteの25点から向上しています。

この11点の向上は、今回のリリースの中で最も顕著なインテリジェンスの向上の1つです。

Flash-Liteは依然として最も強力な最先端モデルには劣りますが、その目的は複雑な推論タスクすべてでそれらと競合することではありません。その役割は、大量の作業を迅速かつ経済的に処理することです。

Gemini 3.5 Flash Cyber:制限付きセキュリティモデル

3番目のリリースであるGemini 3.5 Flash Cyberは、異なる目的を持っています。

これはGemini 3.5 Flashをベースとした専用モデルであり、以下の機能のために微調整されています:

  • ソフトウェアの脆弱性の発見
  • 脆弱性が実際に存在するかの検証
  • 関連するコードパスの追跡
  • パッチ案の提案
  • 反復スキャンのサポート
  • 大規模なサイバーモデルよりも低コストで大規模なコードベースを分析

このモデルは、Google DeepMindのコードセキュリティエージェントCodeMenderと連携して動作します。

CodeMenderでは、複数のFlash Cyberエージェントがコードベースの異なる部分を検索し、それらの発見を1つのレポートに統合できます。

Googleは、サイバーセキュリティの分野では、より小さく低コストなモデルを使用することに価値があると考えています。なぜなら、脆弱性調査では多くの場合、多数の実行可能なパスを探索する必要があるからです。大規模で高価なモデルを繰り返し呼び出すことはボトルネックになる可能性があります。

CyberGymでのパフォーマンス

Googleは、CodeMenderシステムを介して使用された場合、Gemini 3.5 Flash CyberはCyberGymで競争力のある最先端レベルのパフォーマンスを達成したと述べています。

この結果は、基盤となるモデルだけでなく、完全なエージェントインフラストラクチャに依存しています。オーケストレーション、ツール、検証、レポート集約がすべて最終スコアに貢献しています。

限定的な提供

Gemini 3.5 Flash Cyberは、公開されては提供されません。

Gemini API は広く利用可能です。

Googleは、限定されたCodeMenderパイロットプログラムを通じて、以下を対象に提供する計画です。

  • 政府機関
  • 信頼できるパートナー
  • 最前線の防御セキュリティチーム

この限定的なリリースは、本モデルのデュアルユース性を反映しています。脆弱性を発見し検証できるシステムは、防御側がソフトウェアを修正するのに役立ちますが、同様の能力は攻撃活動を支援する可能性もあります。

画像は、Google Gemini 3.6 Flashのインターフェースを示しています。インターフェース上部には「Geminiに質問する」入力ボックスがあり、右側には「Flash」タグとマイクアイコンがあります。下部のポップアップメニューには、3.6 Flash(全方位ヘルプ)、3.6 Thinking(複雑な問題解決)、3.1 Pro(高度な数学とコード)の3つのオプションが表示されています。この画像は、Gemini 3.6 Flashを紹介するドキュメント内の内容に関連し、そのインターフェースと選択可能なモデルバージョンを視覚的に示し、ユーザーがその機能の位置づけを理解するのに役立ちます。

Gemini 3.5 Proはどこにありますか?

Googleは、Gemini 3.5 Proはパートナーとテスト中であり、準備が整い次第、より広くリリースすると述べています。

AIBaseの元記事は、この遅延を、コーディング性能や再トレーニングの可能性に関する外部の報道やオンライン上の噂と関連付けています。

Googleは、本モデルの当初のトレーニング計画が破棄されたり、システムがゼロから再起動されたりしたという主張について、公に確認していません。

確認された情報は限られています:

  • Gemini 3.5 Proは依然としてパートナーテスト段階です。
  • Googleは一般公開時期を発表していません。
  • 同社は、Gemini 4と呼ばれる、これまでで最も野心的な事前トレーニング実行を開始しました。
  • Googleは、次世代モデルの進捗に勇気づけられていると述べています。

主力のProバージョンがないことで、Flashのリリースは戦略的にさらに重要になっています。ハイエンドモデルがまだ利用できない中、Gemini 3.6 FlashとFlash-Liteは、より多くの本番環境のニーズをカバーする必要があります。

これは必ずしも、GoogleがGemini 3.5 Proを放棄したか、Gemini 4が間近であることを意味するわけではありません。

モデル開発のスケジュールは変わる可能性があり、事前トレーニングは単なる1つの段階です。事後トレーニング、安全性テスト、ツール統合、レイテンシ最適化、デプロイ準備には、さらにかなりの追加時間が必要になる可能性があります。

独立したテスト:

効率性の向上は知能の飛躍よりも大きい

人工分析(Humanity’s Last Exam)による結論は、Googleの製品発表よりも控えめです。

知能指数

人工分析の知能指数において、Gemini 3.6 Flashは50点を獲得しました。

Gemini 3.5 Flashも同じく50点でした。

したがって、評価では特定のカテゴリで改善が見られるものの、新しいモデルのこのテストにおける総合的な知能スコアは向上していません。

人工分析レポートは次のように指摘しています:

  • GDPval-AA v2のスコアが高い
  • 人間最後の試験(Humanity’s Last Exam)ではわずかに後退
  • 全体的な知能レベルは類似
  • 出力トークン使用量が少ない
  • タスク完了速度が速い
  • タスクあたりのコストが低い

これは信頼できる効率性のアップグレードですが、広範な知能の飛躍ではありません。

タスクあたりの所要時間

人工分析による測定:

  • Gemini 3.5 Flash:約2.7分
  • Gemini 3.6 Flash:約1.3分

本モデルは、評価ワークロードを完了する時間を半分以上短縮しました。

タスクあたりのコスト

人工分析による推定:

  • Gemini 3.5 Flash:タスクあたり約0.59米ドル
  • Gemini 3.6 Flash:タスクあたり約0.50米ドル

大規模なインテリジェントエージェントにとって、このコスト削減は重要であり、特にシステムが数千、数万ものタスクを実行する場合に顕著です。

ベンチマークは普遍的なランキングと見なすべきではない

人工分析は複数の評価を一つの指数に統合しています。複合スコアは大まかな比較には使用できますが、異なるワークロード間の大きな差異を隠してしまう可能性があります。

同じ合計スコアのモデルでも、以下のような点で優れている場合があります:

  • プログラミング
  • マルチモーダル文書処理
  • コンピューター操作
  • 速度重視のエージェント
  • 長いコンテキストの抽出

しかし、以下のような点では劣る可能性があります:

  • 難しい抽象的な推論
  • ビジュアルスタイルデザイン
  • 特定言語の処理
  • クリエイティブ生成
  • 深い計画を必要とするタスク

適切なモデルの選択は、具体的なアプリケーションシナリオに依存します。

なぜ初期ユーザーのフィードバックはより否定的なのか

原文は、ソーシャルメディア上のいくつかの批判的な反応を収集しています。

ユーザーが不満に思っている問題は以下の通りです:

  • 中国語の語彙選択が不自然
  • 記憶の一貫性が低い
  • ツール選択の誤り
  • ビジュアルスタイルデザインの弱さ
  • 生成されるゲームテクスチャの品質低下
  • 指示と視覚的出力の不一致
  • 使用制限
  • 汎用知能の明らかな向上なし

これらのフィードバックが重要なのは、ベンチマークでは製品品質のあらゆる側面をカバーできないからです。

あるモデルはコードベースタスクでは優れているが、レイアウト生成は苦手であったり、トークン使用量が少ない代わりに簡潔すぎる場合があります。特定のプログラミングベンチマークでは正確でも、特定の言語では信頼性が低下する可能性があります。

同時に、ソーシャルメディア上のテストには深刻な限界があります:

  • プロンプトが常に公開されているとは限らない
  • モデル設定が異なる可能性がある
  • ユーザーは異なる製品インターフェースを比較している可能性がある
  • プレビュー版とAPIで異なる設定が使用される場合がある
  • ツールの可用性が結果に影響を与える
  • 単一の失敗例が全体的な後退を証明するわけではない
  • バイラルな批判はしばしば最悪の失敗例を増幅する

したがって、初期ユーザーフィードバックは、最終的な判断ではなく、対象を絞ったテストのシグナルとして見なされるべきです。

実用的な評価フレームワーク

Gemini 3.6 Flashの導入を検討しているチームは、Googleがより高いベンチマークを報告したからといって受け入れ、また、いくつかのオンラインデモが期待外れだったからといって拒否するべきではありません。

有用な移行テストでは、同じアプリケーション上で新旧モデルを比較する必要があります。

1. 代表的なタスクを使用する

実際の作業から評価セットを構築します:

  • 実際のコードリポジトリ
  • 実際のドキュメント
  • 典型的なツール呼び出し
  • 一般的なユーザーリクエスト
  • 既知の失敗事例
  • 多言語プロンプト
  • 長いコンテキストの例

2. 出力品質だけでなく、タスク完了度を測定する

以下を追跡します:

  • タスク成功率
  • ツール呼び出し回数
  • 再試行回数
  • 意図しないファイル変更
  • 手動修正時間
  • レイテンシ
  • 出力トークン数
  • 総コスト
  • 失敗の重大度

3. 異なる思考レベルをテストする

Gemini 3.6 Flashはデフォルトで中程度の思考レベルです。

Gemini 3.5 Flash-Liteはデフォルトで最低の思考レベルです。

あるモデルが、単に現在のタスクに対して推論設定が低すぎるために能力不足に見える可能性があります。逆に、単純な情報抽出タスクに高い思考レベルを使用すると、時間と費用の無駄になります。

4. ビジュアルと言語の品質を別々に評価する

コーディングベンチマークは、Webサイトの見た目の美しさや、中国語の言い回しが自然かどうかを測定できません。

以下の評価には、専用の人間によるレビューを使用します:

  • 視覚的階層
  • ブランドの一貫性
  • トーンのスタイル
  • 翻訳品質
  • 文化的適合性
  • 指示への従順さ

5. 完全なエージェントスタックをテストする

エージェントの実行結果は、モデルだけに依存するわけではありません。

以下を比較する必要があります:

  • ツール定義
  • プロンプト構造
  • 記憶戦略
  • コンテキストキャッシュ
  • 再試行ルール
  • 承認の境界
  • ブラウザまたはコンピューター使用環境
  • オーケストレーションフレームワーク

モデル移行には、システム環境全体の対応する調整が必要になる場合があります。

開発者はどのモデルを選ぶべきか?

Gemini 3.6 Flashを選ぶ場合:

  • タスクにマルチステップ推論が必要な場合。
  • コード品質が極めて重要な場合。
  • エージェントが複数のツールを使用する場合。
  • ワークロードに画像、図表、動画、または大規模なドキュメントが含まれる場合。
  • コンピューター操作機能(Computer Use)を使用する必要がある場合。
  • より少ないターン数と低いタスクレイテンシが価値を持つ場合。
  • Gemini 3.5 Flashが現在利用可能だが、冗長すぎる、またはコストが高すぎる場合。

Gemini 3.5 Flash-Liteを選ぶ場合:

  • スループットが最優先事項である場合。
  • 業務が情報抽出、分類、翻訳、またはルーティング/分散を含む場合。
  • 多くのサブエージェントが並行して実行される場合。

アプリケーションは大量のドキュメントを処理する必要があります。

  • 低いトークン単価を追求します。
  • 複雑なタスクは、より強力なメインモデルに委任できます。

Gemini 3.5 Flash Cyber を承認アクセス時のみ使用する場合:

  • 組織はGoogleの限定的パイロットプログラムの一部であること。
  • ワークロードは防御的サイバーセキュリティであること。
  • 対処前に脆弱性の発見結果が検証済みであること。
  • 機密リポジトリは厳格な権限下で処理されること。
  • 組織がデュアルユースリスクを管理できること。

Flashバージョンリリースが示すより大きな示唆

Gemini 3.6 Flash は、劇的な知能のブレークスルーではなく、操作体験のアップグレードと捉えると理解しやすいでしょう。

これは、エージェントのコストを高騰させる無駄を削減することを目的としています:

  • 過剰な推論
  • 繰り返されるツール呼び出し
  • 冗長な出力
  • デバッグループ
  • 不要なコード編集
  • タスク完了の遅さ

これらの改善は、抽象的な推論ベンチマークでの微細な向上よりも、本番環境での価値が高い可能性があります。

しかし、効率性がすべてのアプリケーションで品質に取って代わるわけではありません。

タスクを安価に実行できるモデルでも、結果に多大な手動修正が必要であれば無価値です。プログラミングで高得点を取るモデルでも、設計面では期待を裏切る可能性があります。英語に優れたモデルでも、中国語やその他の言語では追加検証が必要になるでしょう。

Googleの新しいFlashシリーズは、より専門化された選択肢を生み出しました:

  • 3.6 Flash:より強力なエージェントワーク向け
  • 3.5 Flash-Lite:大規模スケーリング向け
  • Flash Cyber:制御されたセキュリティ利用向け

したがって、今回のリリースは、一つのモデルが他すべてを置き換えるというよりも、エージェントシステムの各部分に適切な知能レベルとコストを割り当てることに関するものです。

よくある質問

Gemini 3.6 Flash とは何ですか?

Gemini 3.6 Flash は、プログラミング、マルチモーダルタスク、ナレッジワーク、エージェントワークフローのためのGoogleの汎用主力モデルです。Gemini 3.5 Flash をベースにしていますが、より少ないトークン、より少ないインタラクション回数、より少ないツール呼び出しで動作することを目指しています。

Gemini 3.6 Flash は Gemini 3.5 Flash より賢いですか?

Googleは、複数のプログラミング、コンピューター利用、機械学習、ナレッジワークのベンチマークで改善を報告しています。Artificial Analysis は両モデルに同じ総合知能指数スコア50を与えており、最も顕著な向上は知能全体ではなく、効率性とタスク完了速度にあるようです。

Gemini 3.6 Flash の料金はいくらですか?

Googleはこのモデルの価格を、入力トークン100万あたり1.50ドル、出力トークン100万あたり7.50ドルと設定しています。価格は変動する可能性があり、エージェントの総コストは推論、コンテキストサイズ、ツール呼び出し、リトライ、出力長にも依存します。

Gemini 3.5 Flash-Lite は何に使いますか?

Flash-Lite は、抽出、分類、検索、翻訳、ルーティング、構造化データ処理、サブエージェント実行など、レイテンシーに敏感な高スループットワークロードに適しています。Gemini 3.6 Flash より安価で高速ですが、すべての困難なタスクにおいて強力なモデルを置き換えることを目的としていません。

Gemini 3.6 Flash は画像や動画をサポートしていますか?

はい。モデルカードには、テキスト、画像、音声、動画の入力とテキスト出力のサポートが記載されています。このモデルのコンテキストウィンドウは最大100万トークンです。

Gemini 3.5 Flash Cyber とは何ですか?

これは、脆弱性の発見、検証、修正のためにトレーニングされた、Gemini 3.5 Flash の専門バージョンです。Googleは、CodeMender と呼ばれる制限付きパイロットプログラムを通じて、政府および信頼された防御パートナーにこのモデルを提供する予定です。

Gemini 3.5 Pro は中止されましたか?

Googleは中止されたとは発表していません。同社は、Gemini 3.5 Pro はパートナーとテスト中であり、準備が整い次第広く提供されると述べています。

Gemini 3.5 Flash からすぐに移行すべきですか?

必ずしもすぐに移行する必要はありません。切り替える前に、代表的な本番タスクで両方のモデルを実行し、成功率、手動修正時間、ツールの信頼性、レイテンシー、トークン使用量、総コストを比較してください。

関連ツール

  • Google AI Studio:Gemini モデル、プロンプト、ツール、API設定をテストするためのGoogleのブラウザベース環境。
  • Gemini API:Gemini モデルをアプリケーションやエージェントワークフローに統合するための公式API。
  • Gemini アプリ:Gemini モデルを直接使用するためのGoogleの消費者向けインターフェース。

反重力 (Antigravity) (https://antigravity.google/):Gemini 3.6 Flash を組み込んだGoogleのエージェント開発環境。コーディングワークフロー用。

関連リンク

まとめ

Googleの最新Flashリリースは、3つの異なる製品で構成されています。Gemini 3.6 Flash は複雑なエージェントやコーディングシナリオ向け、Gemini 3.5 Flash-Lite は高スループット実行向け、そして Flash Cyber は生の推論能力が最も重要なセキュリティタスク向けです。今回のリリースでは、知能の大幅な飛躍はありませんが、モデル選択の柔軟性が向上し、特にエージェントワークロードにおいて、コストとパフォーマンスのバランスを最適化できるようになりました。

Gemini 3.5 Flash Cyberは、アクセスが制限された環境において、防御的な脆弱性調査に特化しています。

Gemini 3.6 Flashは、複数のタスクレベルのベンチマークを改善し、出力トークン使用量を削減し、エージェントタスクの完了速度を向上させ、出力価格を引き下げました。しかし、独立したテストでは、総合的な知能スコアはGemini 3.5 Flashと比較して向上していません。

したがって、市場の複雑な反応は理解できるものです。今回のリリースは、汎用的な能力の飛躍的向上というよりも、効率面での有力な証明を提供するものと言えます。

Gemini 3.6 Flashに対する最も適切な評価は、あらゆる形態の知能や出力品質が一律に向上したことを示すものではなく、より高速で、より効率的なプロダクションモデルであるという点です。