Gemini 3.6 Flash делает ставку на эффективность, но независимые тесты показывают скромный прирост интеллекта

Google выпустила три новых модели Gemini, ориентированных на разные сегменты агентного рынка:

发布于 2026年7月22日generalGEO 评分: 08 次阅读
Обложка статьи «Gemini 3.6 Flash делает ставку на эффективность, но независимые тесты показывают скромный прирост интеллекта»

Gemini 3.6 Flash делает ставку на эффективность, но независимые тесты показывают скромный прирост интеллекта

Введение

Google выпустила три новых модели Gemini, ориентированных на разные сегменты агентного рынка:

  • Gemini 3.6 Flash — флагманская модель для кодинга, мультимодальных задач и многоэтапных агентных рабочих процессов
  • Gemini 3.5 Flash-Lite — оптимизирована для высокопроизводительных и чувствительных к задержкам нагрузок
  • Gemini 3.5 Flash Cyber — специализированная модель кибербезопасности для поиска, верификации и исправления уязвимостей ПО

Ключевой акцент в анонсе Google — эффективность. Компания утверждает, что новая Flash-модель выполняет задачи с меньшим количеством выходных токенов, меньшим числом вызовов инструментов и меньшими накладными расходами на цикл выполнения. Цена также ниже, чем у Gemini 3.5 Flash.

Эти заявления частично подтверждаются внутренними бенчмарками Google и ранними независимыми тестами.

Более сложный вопрос — превзошла ли Gemini 3.6 Flash своего предшественника по интеллектуальным способностям.

Artificial Analysis в своем комплексном индексе интеллекта зафиксировала у новой модели те же показатели, что и у Gemini 3.5 Flash. Ранние пользователи также отмечают неоднозначный опыт, особенно в области визуального дизайна, генерации на китайском, выбора инструментов и следования инструкциям.

Результаты нельзя назвать однозначным провалом. Gemini 3.6 Flash выглядит быстрее, генерирует более лаконичные ответы и обеспечивает меньшую стоимость за задачу во многих сценариях. Модель также показывает улучшения по ряду бенчмарков в кодинге, работе с компьютером, машинном обучении и интеллектуальном труде.

Однако этот релиз подчеркивает важное различие:

Модель может стать более эффективной без сопоставимого роста общего интеллекта или субъективного качества результатов.

Этот скриншот показывает твит от Google DeepMind, содержащий информацию о трех новых моделях Gemini, упомянутых в документе. Он наглядно демонстрирует официальное позиционирование трех новых моделей. В твите четко описаны три основные модели: Gemini 3.6 Flash с оптимизацией эффективности и более высоким качеством работы при той же стоимости, Gemini 3.5 Flash-Lite с фокусом на соотношение цены и производительности и низкой задержкой для повседневных задач, а также модель кибербезопасности Gemini 3.5 Flash Cyber для поиска и исправления критических уязвимостей ПО. Это изображение подтверждает информацию из документа о выпуске Google трех моделей Gemini для разных сегментов агентного рынка и наглядно представляет официальное описание функционала и позиционирования каждой модели.

Обзор трех новых моделей Gemini

Модель Основное назначение Цена API за миллион токенов Уровень рассуждений по умолчанию Доступность
Gemini 3.6 Flash Кодинг, мультимодальные задачи и сложные агентные рабочие процессы Ввод $1.50 / Вывод $7.50 Средний Полностью доступна
Gemini 3.5 Flash-Lite Высокообъемное извлечение, поиск, перевод, маршрутизация и суб-агенты Ввод $0.30 / Вывод $2.50 Минимальный Полностью доступна
Gemini 3.5 Flash Cyber Поиск, верификация и исправление уязвимостей Не опубликована публично Специализированный Ограниченный пилот для правительственных и доверенных партнеров

Gemini 3.6 Flash и Gemini 3.5 Flash-Lite поддерживают:

  • Контекст до 1 миллиона токенов
  • До 64 000 выходных токенов
  • Ввод текста, изображений, аудио и видео
  • Вывод текста
  • Настраиваемый уровень рассуждений
  • Встроенные инструменты, включая использование компьютера
  • Доступ через Gemini API и Google AI Studio

В карточках моделей Google указано, что дата актуальности знаний для обеих общедоступных моделей — март 2026 года.

Gemini 3.6 Flash: Меньше токенов и ниже стоимость задач

Gemini 3.6 Flash основана на Gemini 3.5 Flash и призвана заменить ее во многих задачах кодинга, интеллектуального труда, мультимодальной и агентной работы.

Наиболее последовательное улучшение — эффективность.

Google сообщает, что в индексе Artificial Analysis Gemini 3.6 Flash использует на 17% меньше выходных токенов, чем Gemini 3.5 Flash. В некоторых агентных оценках кодинга (включая DeepSWE) Google наблюдала сокращение выходных токенов до 65%.

Модель также склонна к использованию:

  • Меньшего числа шагов рассуждения
  • Меньшего количества вызовов инструментов
  • Более коротких циклов выполнения
  • Меньшего числа ненужных изменений кода
  • Более лаконичного конечного вывода

Эти изменения важны, потому что стоимость агента зависит не только от объявленной цены за токен.

Долго работающий агент может многократно вызывать модель, отправлять большие определения инструментов, проверять файлы, выполнять код, восстанавливаться после сбоев и генерировать объемный вывод рассуждений. Даже если цена за токен меняется незначительно, сокращение количества циклов вызова и токенов снижает общую стоимость.

Ценообразование Gemini 3.6 Flash

Google приводит следующие цены API:

Тип токена Gemini 3.6 Flash Gemini 3.5 Flash
Ввод $1.50 за миллион токенов $1.50 за миллион токенов
Вывод $7.50 за миллион токенов $9.00 за миллион токенов

Цена ввода осталась неизменной, а цена вывода снизилась примерно на 16.7%.

В своих настройках оценки Artificial Analysis измерила среднюю стоимость за задачу для Gemini 3.6 Flash примерно в $0.50, по сравнению с $0.59 для Gemini 3.5 Flash. Это представляет собой снижение примерно на 18%, обусловленное как более низкой ценой вывода, так и меньшим количеством генерируемых токенов.

Эти цифры следует рассматривать как зависящие от конкретной нагрузки, а не универсальные. Фактическая стоимость зависит от:

  • Размера промпта
  • Уровня рассуждений
  • Длины вывода
  • Количества циклов вызова
  • Использования инструментов
  • Кэширования контекста
  • Поведения при повторах
  • Типа агентного фреймворка
  • Отправляет ли приложение полный диалог на каждом шаге

Более быстрое выполнение, а не просто более быстрая генерация токенов

Artificial Analysis сообщает, что среднее время выполнения задачи для Gemini 3.6 Flash составляет около 1,3 минуты, по сравнению с примерно 2,7 минутами для Gemini 3.5 Flash.

Это улучшение обусловлено как более быстрым выводом, так и более экономным процессом рассуждения.

Модель, которая быстро генерирует токены, может все еще занимать много времени, если она застревает в повторяющихся циклах вызова инструментов. И наоборот, немного более медленная модель может завершить работу раньше, если найдет правильное решение с меньшим количеством вызовов.

Для разработчиков агентов время на выполнение задачи часто более полезно, чем исходное количество токенов в секунду.

Кодинг, машинное обучение, работа с компьютером и интеллектуальный труд

Google сообщает об улучшениях по нескольким категориям бенчмарков.

Кодинг и программная инженерия

На DeepSWE Gemini 3.6 Flash показала улучшение с 37% до 49% по сравнению с Gemini 3.5 Flash.

Google утверждает, что модель:

  • Производит меньше нежелательных правок
  • Использует более короткие циклы отладки
  • Более строго следует требуемой области изменений
  • Генерирует код, более близкий к продакшн-уровню
  • Перед внесением изменений предпочитает программно проверять проект

В последнем пункте есть компромисс.

В руководстве для разработчиков Google указано, что Gemini 3.6 Flash перед редактированием может запускать диагностические скрипты, что может повысить точность в сложных задачах. Однако в простых frontend-работах эти дополнительные исследовательские шаги могут увеличить задержку, не всегда улучшая результат.

Google также отметил, что человеческие оценщики иногда предпочитают визуальное оформление и стиль более ранних моделей, даже если Gemini 3.6 Flash генерирует более практичный код. Поэтому разработчикам, создающим интерфейсы, возможно, потребуется задавать более четкие ограничения по визуальному дизайну.

Исследования в области машинного обучения

На MLE-Bench, согласно отчету Google, результаты улучшились с 49,7% до 63,9%.

Эта оценка фокусируется на реальных задачах машинного обучения и исследований, а не на изолированных задачах программирования. Данное улучшение показывает, что модель лучше справляется с рабочими процессами, требующими экспериментов, обработки данных, внедрения и итеративных улучшений.

Возможности работы с компьютером

На OSWorld-Verified, по данным сравнения, опубликованного Google, Gemini 3.6 Flash показал рост с 78,4% до 83,0%.

Возможности работы с компьютером теперь доступны как встроенный инструмент клиента через Gemini API и Gemini Enterprise. Они позволяют агентным системам взаимодействовать с графическим интерфейсом, а не полагаться исключительно на прямой API.

Результаты бенчмарков для работы с компьютером по-прежнему зависят от фреймворка агента, среды экрана, дизайна задач и стратегий восстановления после ошибок. Более высокие баллы полезны, но производственные системы все равно требуют строгих разрешений и этапов подтверждения для важных операций.

Интеллектуальная работа

На GDPval-AA v2 результат Gemini 3.6 Flash вырос с 1349 до 1421.

Google выделил следующие сценарии применения:

  • Разбор документов
  • Интерпретация диаграмм
  • Анализ финансовых данных
  • Составление отчетов
  • Анализ аудиозаписей
  • Миграция кода
  • Мультимодальные исследовательские рабочие процессы

Клиенты, включая Figma, Harvey, Hebbia и JetBrains, предоставили положительные отзывы для анонса Google. Эти рекомендации отражают опыт клиентов и не должны рассматриваться как независимые эталоны.

Дата среза знаний и контекстное окно

Gemini 3.6 Flash поддерживает контекстное окно до 1 миллиона токенов и максимальный вывод в 64000 токенов.

В карточке модели указана дата среза знаний март 2026 года, что является улучшением по сравнению с более ранними версиями Gemini (у которых дата среза была значительно раньше).

Более поздняя дата среза уменьшает объем базовой недавней контекстной информации, которую разработчики должны предоставлять вручную. Однако это не позволяет модели надежно обрабатывать текущие новости, цены в реальном времени, меняющиеся законы, релизы программного обеспечения или другую информацию, чувствительную ко времени.

Приложения, работающие со свежей информацией, по-прежнему должны использовать поиск, извлечение, проверенные базы данных или вызовы инструментов.

Большое контекстное окно также не гарантирует, что модель будет одинаково эффективно использовать каждую часть длинных документов. Разработчикам следует тестировать:

  • Точность извлечения информации из удаленных друг от друга частей документа
  • Согласованность в длинных диалогах
  • Сохранение ключевых правил
  • Производительность при наличии постороннего материала
  • Стоимость и задержку при реалистичной длине контекста

Обновление безопасности Gemini 3.6 Flash

Google заявляет, что Gemini 3.6 Flash содержит усиленные передовые меры безопасности, направленные против:

  • Химического, биологического, радиологического, ядерного неправильного использования
  • Неправильного использования в кибератаках
  • Сопротивляемости взлому

Карточка модели сообщает об улучшении автоматических многоязычных результатов и результатов по безопасности контента по сравнению с Gemini 3.5 Flash, при сохранении относительно низкого уровня необоснованных отказов.

Google также отмечает

несколько ограничений:

  • Модель может галлюцинировать.
  • Изредка возникают медленные ответы или тайм-ауты.
  • Некоторые внутренние тесты показывают небольшой регресс в тоне.
  • Защита от взлома остается областью постоянных улучшений.

Оценка передовой безопасности Google пришла к выводу, что Gemini 3.6 Flash все еще находится ниже критического уровня возможностей, установленного компанией, включая порог кибербезопасности.

Этот вывод основан на системе оценки Google и должен интерпретироваться вместе с последующими независимыми результатами тестов безопасности, если таковые будут доступны.

Gemini 3.5 Flash-Lite: Выбор для высокой пропускной способности

Gemini 3.5 Flash-Lite разработан для задач, где приоритетом являются скорость, пропускная способность и стоимость, а не максимальная глубина рассуждений.

Типичные сценарии применения включают:

  • Извлечение данных из документов
  • Классификация
  • Поиск
  • Перевод
  • Маршрутизация данных
  • Генерация структурированного JSON
  • Обработка квитанций
  • Анализ данных электронной коммерции
  • Выполнение высокообъемных подзадач

Google описывает его как самую быструю и самую дешевую модель в семействе Gemini 3.5.

Ценообразование Gemini 3.5 Flash-Lite

Тип токена Цена за миллион токенов
Ввод $0.30
Вывод $2.50

Его уровень рассуждений по умолчанию — минимальный, что ставит во главу угла пропускную способность и низкую задержку.

Для автономных подзадач, выполнения кода, вызова инструментов или многошагового планирования Google рекомендует при необходимости повышать уровень рассуждений до среднего или высокого. Более высокие настройки улучшают процент выполнения задач, но обычно увеличивают использование токенов и задержку.

Скорость

В анонсе Google приводятся данные Artificial Analysis, полученные в предрелизном тестировании: около 350 выходных токенов в секунду.

Впоследствии Artificial Analysis зафиксировала скорость для конкретного провайдера, которая может меняться со временем. Пропускная способность зависит от:

  • Емкости провайдера
  • Размера запроса
  • Настроек рассуждений
  • Длины вывода
  • Региональной маршрутизации
  • Текущего спроса
  • Того, измеряет ли тест видимый вывод или скрытые рассуждения

Стабильный вывод: Flash-Lite по дизайну значительно быстрее более крупных моделей Flash.

Улучшения в бенчмарках

Google сообщил о следующих улучшениях по сравнению с Gemini 3.1 Flash-Lite:

Бенчмарк Gemini 3.1 Flash-Lite Gemini 3.5 Flash-Lite
Terminal-Bench 2.1 31% 54%
GDM-MRCR v2 60.1% 72.2%
GDPval-AA v2 642 1140

Google также сообщает, что Gemini 3.5 Flash-Lite превосходит Gemini 3 Flash по нескольким агентным и кодовым бенчмаркам:

  • SWE-Bench Pro: 54.2% против 49.6%
  • OSWorld-Verified: 74.0% против 65.1%

Это делает Flash-Lite не просто дешевой моделью низкого качества. Для некоторых узких высокообъемных агентных задач он может предложить лучший баланс, чем старая Gemini 3 Flash.

Независимый прирост интеллекта

Artificial Analysis оценил Gemini 3.5 Flash-Lite в своем Индексе интеллекта на 36 баллов, что выше 25 баллов у Gemini 3.1 Flash-Lite.

Это увеличение на 11 баллов является одним из самых значительных приростов интеллекта в данном релизе.

Flash-Lite все еще уступает самым мощным передовым моделям, но его цель не в том, чтобы конкурировать с ними в каждой сложной задаче рассуждения. Его роль — быстро и экономично обрабатывать большие объемы работы.

Gemini 3.5 Flash Cyber: Ограниченная модель для безопасности

Третий выпуск, Gemini 3.5 Flash

Cyber, имеет иное предназначение.

Это специализированная модель на основе Gemini 3.5 Flash, доработанная для:

  • Поиска уязвимостей в программном обеспечении
  • Проверки, являются ли уязвимости реальными
  • Отслеживания соответствующих путей выполнения кода
  • Предложения исправлений (патчей)
  • Поддержки циклического сканирования
  • Анализа больших кодовых баз с меньшими затратами, чем у крупных кибермоделей

Модель работает совместно с агентом безопасности кода Google DeepMind CodeMender.

В CodeMender несколько агентов Flash Cyber могут искать разные части кодовой базы и объединять свои находки в единый отчет.

Google считает использование более мелких и дешевых моделей ценным в области кибербезопасности, поскольку исследование уязвимостей часто требует изучения большого количества возможных путей выполнения. Многократное обращение к большим дорогим моделям может стать узким местом.

Производительность CyberGym

Google утверждает, что при использовании в системе CodeMender, Gemini 3.5 Flash Cyber достигает конкурентоспособной производительности передового уровня на CyberGym.

Этот результат зависит от полной инфраструктуры агента, а не только от базовой модели. Оркестровка, инструменты, валидация и агрегация отчетов вносят вклад в итоговую оценку.

Ограниченная доступность

Gemini 3.5 Flash Cyber не будет доступен через публичный

API Gemini предоставляется в широком доступе.

Google планирует предоставить доступ к модели через ограниченную пилотную программу CodeMender следующим категориям:

  • Государственным учреждениям
  • Доверенным партнёрам
  • Командам кибербезопасности первой линии

Этот ограниченный выпуск отражает двойственную природу модели. Система, способная находить и проверять уязвимости, может помочь защитникам в устранении ошибок в программном обеспечении, однако аналогичные возможности могут быть использованы и для атак.

Изображение интерфейса Google Gemini 3.6 Flash. В верхней части интерфейса расположено поле ввода «Спросить Gemini», справа от него — метка «Flash» и значок микрофона. Под полем ввода находится всплывающее меню с тремя пунктами: 3.6 Flash (помощь во всём), 3.6 Thinking (решение сложных задач) и 3.1 Pro (высшая математика и код). Данное изображение связано с разделом документа, описывающим Gemini 3.6 Flash, и наглядно демонстрирует его интерфейс и доступные версии модели, помогая пользователям понять их функциональное назначение.

Где Gemini 3.5 Pro?

Google сообщает, что Gemini 3.5 Pro тестируется с партнёрами и будет выпущен более широко после того, как будет готов.

Источник AIBase связывает эту задержку с внешними отчётами и онлайн-слухами о производительности в кодировании и возможном переобучении.

Google официально не подтверждал информацию об отказе от первоначального плана обучения модели или о её полном перезапуске с нуля.

То, что подтверждено, довольно ограничено:

  • Gemini 3.5 Pro всё ещё находится на этапе партнёрского тестирования.
  • Google не называл сроки публичного выпуска.
  • Компания начала предварительное обучение, которое она называет самым амбициозным для Gemini 4.
  • Google заявляет, что прогресс в разработке моделей следующего поколения её воодушевляет.

Отсутствие флагманской Pro-версии делает выпуск Flash стратегически более важным. Пока передовая модель недоступна, Gemini 3.6 Flash и Flash-Lite должны покрывать большую часть производственных потребностей.

Это не обязательно означает, что Google отказалась от Gemini 3.5 Pro или что Gemini 4 уже в пути.

Графики разработки моделей могут меняться, а предварительное обучение — это лишь один из этапов. Посттренинг, тестирование безопасности, интеграция инструментов, оптимизация задержки и подготовка к развёртыванию могут потребовать значительного дополнительного времени.

Независимое тестирование:

Повышение эффективности больше, чем интеллектуальный скачок

Выводы независимого анализа более сдержанны, чем заявления Google.

Индекс интеллекта

Gemini 3.6 Flash набрал 50 баллов по Индексу интеллекта независимого анализа.

Gemini 3.5 Flash также набрал 50 баллов.

Таким образом, хотя оценка показывает улучшения по ряду категорий, общий балл интеллекта новой модели в данном тесте не увеличился.

Отчёт независимого анализа указывает:

  • Более высокий балл в GDPval-AA v2
  • Небольшой регресс в «Последнем экзамене для человека»
  • Схожий общий уровень интеллекта
  • Меньшее использование выходных токенов
  • Более высокая скорость выполнения задач
  • Меньшая стоимость за задачу

Это заслуживающее доверия повышение эффективности, но не широкий скачок в интеллекте.

Время выполнения задачи

Замеры независимого анализа:

  • Gemini 3.5 Flash: примерно 2.7 минуты
  • Gemini 3.6 Flash: примерно 1.3 минуты

Модель сократила время выполнения оценочной рабочей нагрузки более чем вдвое.

Стоимость за задачу

Оценка независимого анализа:

  • Gemini 3.5 Flash: примерно 0.59 долларов США за задачу
  • Gemini 3.6 Flash: примерно 0.50 долларов США за задачу

Для крупномасштабных ИИ-агентов такое снижение затрат является значительным, особенно когда система выполняет тысячи задач.

Бенчмарки не следует рассматривать как универсальный рейтинг

Независимый анализ объединяет несколько оценок в один индекс. Сводные баллы могут использоваться для грубого сравнения, но могут скрывать существенные различия между разными типами рабочих нагрузок.

Модели с одинаковым общим баллом могут быть сильнее в некоторых аспектах, например:

  • Программирование
  • Обработка мультимодальных документов
  • Управление компьютером
  • Скоростные агенты
  • Извлечение данных из длинного контекста

Но могут быть слабее в других:

  • Сложные абстрактные рассуждения
  • Дизайн визуального стиля
  • Обработка определённых языков
  • Креативная генерация
  • Задачи, требующие глубокого планирования

Выбор правильной модели зависит от конкретного сценария использования.

Почему отзывы первых пользователей более негативны

В источнике собрано несколько критических реакций из социальных сетей.

Жалобы пользователей включают:

  • Неестественный выбор китайских слов
  • Плохая согласованность памяти
  • Неправильный выбор инструментов
  • Слабый дизайн визуального стиля
  • Снижение качества генерируемых игровых текстур
  • Несоответствие инструкций и визуального вывода
  • Ограничения на использование
  • Отсутствие заметного повышения общего интеллекта

Эти отзывы важны, потому что бенчмарки не могут охватить все аспекты качества продукта.

Модель может отлично справляться с задачами по работе с кодом, но хуже генерировать макеты; может использовать меньше токенов, но стать чрезмерно краткой; может быть более точной в одном бенчмарке программирования, но менее надёжной в конкретном языке.

В то же время, тестирование в социальных сетях имеет серьёзные ограничения:

  • Промпты не всегда публикуются
  • Настройки модели могут различаться
  • Пользователи могут сравнивать разные интерфейсы продуктов
  • Предварительная версия и API могут использовать разные конфигурации
  • Доступность инструментов влияет на результаты
  • Одиночный сбой не доказывает всеобщий регресс
  • Вирусная критика часто преувеличивает самые серьёзные сбои

Следовательно, ранние отзывы пользователей следует рассматривать как сигнал для целенаправленного тестирования, а не как окончательный вердикт.

Практическая структура оценки

Командам, рассматривающим возможность использования Gemini 3.6 Flash, не следует делать это только на основании более высоких показателей Google.

И не следует отказываться от него только из-за неудачных онлайн-демонстраций.

Полезный тест миграции должен сравнивать старую и новую модели в одном и том же приложении.

1. Используйте репрезентативные задачи

Создайте оценочный набор из реальной работы:

  • Фактические репозитории кода
  • Настоящие документы
  • Типичные вызовы инструментов
  • Часто встречающиеся запросы пользователей
  • Известные случаи отказов
  • Многоязычные промпты
  • Примеры с длинным контекстом

2. Измеряйте выполнение задач, а не только качество вывода

Отслеживайте:

  • Процент успешного выполнения задач
  • Количество вызовов инструментов
  • Количество повторных попыток
  • Нежелательные изменения в файлах
  • Время на ручное исправление
  • Задержка
  • Количество выходных токенов
  • Общая стоимость
  • Степень серьёзности отказов

3. Тестируйте разные уровни обдумывания

Gemini 3.6 Flash по умолчанию использует средний уровень обдумывания.

Gemini 3.5 Flash-Lite по умолчанию использует минимальный уровень обдумывания.

Модель может казаться менее способной просто потому, что уровень рассуждений слишком низок для данной задачи. И наоборот, использование высокого уровня обдумывания для простой задачи извлечения информации — пустая трата времени и денег.

4. Оценивайте визуальное и языковое качество отдельно

Бенчмарки кодирования не могут оценить, насколько хорошо выглядит веб-сайт или насколько естественен китайский текст.

Используйте специальную ручную оценку для проверки:

  • Визуальной иерархии
  • Соответствия бренду
  • Стиля и тона
  • Качества перевода
  • Культурной уместности
  • Выполнения инструкций

5. Тестируйте полный стек агента

Результат работы агента зависит не только от модели.

Необходимо сравнивать:

  • Определения инструментов
  • Структуру промпта
  • Стратегию памяти
  • Кэширование контекста
  • Правила повторных попыток
  • Границы одобрения
  • Среду браузера или компьютера
  • Оркестрационную структуру

Миграция модели может потребовать соответствующей настройки всего системного окружения.

Какую модель выбрать разработчику?

Выбирайте Gemini 3.6 Flash, если:

  • Задача требует многошаговых рассуждений.
  • Качество кода имеет решающее значение.
  • Агент использует множество инструментов.
  • Рабочая нагрузка включает изображения, диаграммы, видео или большие документы.
  • Требуется функциональность управления компьютером (Computer Use).
  • Меньшее количество итераций и низкая задержка заданий ценны.
  • Gemini 3.5 Flash доступен, но слишком многословен или дорог.

Выбирайте Gemini 3.5 Flash-Lite, если:

  • Пропускная способность является главным приоритетом.
  • Работа включает извлечение информации, классификацию, перевод или маршрутизацию.
  • Множество под-агентов работают параллельно.

Приложению необходимо обрабатывать большое количество документов.

  • Стремление к низкой цене за токен.
  • Сложные задачи могут делегироваться более мощной основной модели.

Использование Gemini 3.5 Flash Cyber только при наличии одобренного доступа:

  • Организация является частью ограниченной пилотной программы Google.
  • Рабочая нагрузка относится к сфере оборонительной кибербезопасности.
  • Результаты обнаружения уязвимостей верифицированы до принятия мер.
  • Чувствительные репозитории обрабатываются в условиях строгих разрешений.
  • Организация способна управлять рисками двойного назначения.

Более широкое значение выхода версии Flash

Gemini 3.6 Flash проще воспринимать как обновление операционного опыта, а не как драматический прорыв в интеллекте.

Он призван сократить расточительность, делающую агентов дорогими:

  • Чрезмерные рассуждения
  • Повторяющиеся вызовы инструментов
  • Многословные выходные данные
  • Циклы отладки
  • Ненужное редактирование кода
  • Медленное выполнение задач

Эти улучшения в производственной среде могут быть ценнее, чем незначительный прирост в абстрактных тестах рассуждений.

Однако эффективность не заменяет качество в каждом приложении.

Модель, способная дешево выполнять задачи, бесполезна, если результаты требуют значительной ручной доработки. Модель с высокими баллами в программировании всё ещё может разочаровать в дизайне. Модель с хорошим английским может требовать дополнительной проверки в китайском или других языках.

Новая серия Flash от Google создала более специализированные варианты:

  • 3.6 Flash: Для более сильной агентной работы
  • 3.5 Flash-Lite: Для масштабного расширения
  • Flash Cyber: Для контролируемого использования в безопасности

Таким образом, этот релиз — это скорее подбор правильного уровня интеллекта и затрат для каждой части агентной системы, чем замена одной моделью всех остальных.

Часто задаваемые вопросы

Что такое Gemini 3.6 Flash?

Gemini 3.6 Flash — это универсальная рабочая лошадка Google для программирования, мультимодальных задач, интеллектуальной работы и агентных процессов. Он основан на Gemini 3.5 Flash, но нацелен на использование меньшего количества токенов, меньшего числа раундов взаимодействия и меньшего количества вызовов инструментов.

Является ли Gemini 3.6 Flash более интеллектуальным, чем Gemini 3.5 Flash?

Google сообщает об улучшениях по нескольким тестам программирования, использования компьютера, машинного обучения и интеллектуальной работы. Artificial Analysis присваивает обеим моделям одинаковый общий показатель интеллекта — 50, поэтому наиболее очевидным улучшением, похоже, является эффективность и скорость выполнения задач, а не повышение общего интеллекта.

Какова стоимость Gemini 3.6 Flash?

Google установил цену на модель в размере 1,50 доллара за миллион входных токенов и 7,50 доллара за миллион выходных токенов. Цены могут меняться, а общая стоимость использования агента также зависит от рассуждений, размера контекста, вызовов инструментов, повторных попыток и длины вывода.

Для чего используется Gemini 3.5 Flash-Lite?

Flash-Lite подходит для рабочих нагрузок с высокой пропускной способностью, чувствительных к задержке, таких как извлечение, классификация, поиск, перевод, маршрутизация, обработка структурированных данных и выполнение подзадач агентами. Он дешевле и быстрее, чем Gemini 3.6 Flash, но не предназначен для замены более мощных моделей во всех сложных задачах.

Поддерживает ли Gemini 3.6 Flash изображения и видео?

Да. В карточке модели указаны функции, включающие поддержку текстового, графического, аудио и видеовхода, а также текстового выхода. Контекстное окно модели составляет до 1 миллиона токенов.

Что такое Gemini 3.5 Flash Cyber?

Это специализированная версия Gemini 3.5 Flash, обученная для обнаружения, верификации и исправления уязвимостей. Google планирует предоставлять эту модель правительствам и доверенным партнёрам в области обороны через ограниченную пилотную программу под названием CodeMender.

Был ли отменён Gemini 3.5 Pro?

Google не заявлял о его отмене. Компания сообщила, что Gemini 3.5 Pro тестируется с партнёрами и будет широко доступен, когда будет готов.

Стоит ли мне немедленно мигрировать с Gemini 3.5 Flash?

Не обязательно немедленно. Перед переходом стоит запустить обе модели на репрезентативных производственных задачах и сравнить процент успеха, время ручной доработки, надёжность инструментов, задержку, использование токенов и общую стоимость.

Связанные инструменты

  • Google AI Studio: Браузерная среда Google для тестирования моделей Gemini, промптов, инструментов и конфигураций API.
  • Gemini API: Официальный API для интеграции моделей Gemini в приложения и агентные процессы.
  • Приложение Gemini: Потребительский интерфейс Google для прямого использования моделей Gemini.

Антигравитация (ссылка: https://antigravity.google/): Среда разработки агентов Google со встроенным Gemini 3.6 Flash для кодирования рабочих процессов.

  • CodeMender (ссылка: https://deepmind.google/models/codemender/): Агент Google DeepMind для поиска и исправления программных уязвимостей.
  • Artificial Analysis (ссылка: https://artificialanalysis.ai/): Независимая платформа для сравнения моделей по показателям интеллекта, скорости, задержки, использования токенов и ценообразования.

Связанные ссылки

  • Официальное объявление о выходе Gemini Flash: Спецификации, результаты тестов, цены, примеры использования клиентов и информация о доступности от Google.
  • Карточка модели Gemini 3.6 Flash: Официальные подробности о вводе, длине контекста, ограничениях, тестировании безопасности и дате среза знаний.
  • Карточка модели Gemini 3.5 Flash-Lite: Официальная информация о предполагаемом использовании, ограничениях модели, оценке безопасности и распространении.
  • Gemini 3.5 Flash Cyber: Описание специализированной модели кибербезопасности и ограниченной пилотной программы от Google DeepMind.
  • Руководство по последним моделям Gemini API: Официальные идентификаторы моделей, руководство по миграции, изменения API, цены и рекомендуемые варианты использования.
  • Ценообразование Gemini API: Текущая официальная страница цен на модели и услуги Gemini API.
  • Оценка Artificial Analysis: Независимый анализ уровня интеллекта, стоимости одной задачи, скорости вывода, эффективности токенов и длительности задач.

Резюме

Последняя версия Flash от Google включает три отдельных продукта. Gemini 3.6 Flash ориентирован на сложные агентные и кодировочные сценарии, Gemini 3.5 Flash-Lite нацелен на высокую пропускную способность выполнения, а

Gemini 3.5 Flash Cyber в условиях ограниченного доступа фокусируется на исследовании уязвимостей в оборонительных целях.

Gemini 3.6 Flash улучшила показатели по ряду задач на уровне бенчмарков, сократила использование выходных токенов, ускорила выполнение агентных задач и снизила цены на вывод. Однако независимые тесты показали, что её общий интеллектуальный рейтинг не повысился по сравнению с Gemini 3.5 Flash.

Поэтому сложная реакция рынка вполне объяснима. Этот релиз скорее даёт убедительное доказательство повышения эффективности, нежели рывок в общих способностях.

Лучшая оценка для Gemini 3.6 Flash: это более быстрая и компактная производственная модель — а не доказательство того, что все формы интеллекта или качество вывода синхронно улучшились.