Grok Voice Think Fast 2.0: более быстрая и точная голосовая модель-агент от xAI

Grok Voice Think Fast 2.0: более быстрая и точная голосовая модель-агент от xAI. Руководство по Grok Voice Think Fast 2.0: тесты, цены, точность и миграция. Модель xAI Grok Voice Think Fast 2.0 улучшает голосовые рассуждения, точность транскрипции, производительность агента и задержку. Смотрите тесты, цены, результаты Starlink и детали миграции от 5 августа. Grok Voice Think Fast 2.0, голосовой агент xAI, Grok Voice API, технология голос-в-голос, модель голосового агента, цены Grok Voice, тесты голосового ИИ, транскрипция.

发布于 2026年7月30日generalGEO 评分: 09 次阅读
Grok Voice Think Fast 2.0: более быстрая и точная голосовая модель-агент от xAI

Grok Voice Think Fast 2.0: более быстрая и точная голосовая агентная модель от xAI

Введение

xAI представила Grok Voice Think Fast 2.0 — следующее поколение модели преобразования голоса в голос для разработки голосовых агентов реального времени.

Новая версия сосредоточена на четырёх ключевых аспектах производственных голосовых систем: уровень интеллекта, точность транскрипции, диалоговое поведение и надёжный вызов инструментов. По заявлению xAI, в большинстве случаев существующие приложения могут перейти на новую модель без переписывания промптов.

Think Fast 2.0 стоит 0,08 доллара за минуту аудио. Разработчики могут использовать имя модели с версией grok-voice-think-fast-2.0, а псевдоним grok-voice-latest запланирован к переключению с версии 1.0 на 2.0 5 августа 2026 года.

Модель предназначена для реальных голосовых агентных нагрузок, таких как поддержка клиентов, продажи, телефонная автоматизация и многоэтапные бизнес-процессы — сценарии, где агент должен понимать речь, рассуждать, вызывать инструменты и быстро реагировать для поддержания естественного диалога.

Grok Voice Think Fast 2.0 показывает всесторонний рост в основных голосовых бенчмарках

xAI опубликовала результаты бенчмарков от Artificial Analysis, сравнив Think Fast 2.0 с предыдущей версией, OpenAI GPT-Realtime-2.1 и Google Gemini 3.1 Flash.

Скриншот твита от SpaceX AI о Grok Voice Think Fast 2.0. Показано, что модель нового поколения улучшает интеллект, точность транскрипции и диалоговые способности. Таблица сравнивает Grok Voice Think Fast 2.0, Think Fast 1.0, GPT-Realtime-2.1 (High) и Gemini 3.1 Flash (High) по ряду показателей, включая AA голосовой индекс качества, голосовые рассуждения, диалоговую динамику, производительность агента и скорость. Grok Voice Think Fast 2.0 показывает выдающиеся результаты, например, AA голосовой индекс качества 82,9%, скорость 0,70 секунды и т.д.

Результаты представлены ниже:

Бенчмарк Grok Voice Think Fast 2.0 Think Fast 1.0 GPT-Realtime-2.1 High Gemini 3.1 Flash High
AA голос-к-голосу индекс качества 82.9% 75.7% 79.1% 69.5%
Big Bench Audio 97.2% 97.1% 96.0% 96.6%
Full-duplex тест 95.1% 77.8% 95.7% 74.3%
τ-голосовой тест 56.5% 52.1% 45.7% 37.7%
Время первого аудиоответа 0.70 сек 1.25 сек 2.98 сек

По сравнению с Think Fast 1.0, общий голос-к-голосу индекс качества от Artificial Analysis вырос с 75,7% до 82,9%.

Наиболее заметные изменения произошли в диалоговой динамике, производительности агента и задержке ответа.

Голосовые рассуждения

В тесте Big Bench Audio Think Fast 2.0 набрал 97,2%, что лишь немного выше показателя предыдущей модели в 97,1%.

Это указывает на то, что выпуск не нацелен на значительный скачок в чистых способностях голосовых рассуждений. Вместо этого большая часть улучшений касается поведения модели в диалогах реального времени.

Диалоговая динамика

Think Fast 2.0 достиг 95,1% в full-duplex тесте, тогда как Think Fast 1.0 получил 77,8%.

Full-duplex тест оценивает такие аспекты, как тайминг речи, обработка пауз, реакции на перебивания, распознавание обратной связи и поддержание естественного переключения ходов.

GPT-Realtime-2.1 High показал немного более высокий результат в этом тесте — 95,7%, поэтому модель xAI не лидирует во всех категориях.

Производительность агента

В тесте τ-голосовой, который больше ориентирован на оценку выполнения агентом реальных задач, Think Fast 2.0 набрал 56,5%.

Этот результат выше, чем у Think Fast 1.0 (52,1%), GPT-Realtime-2.1 High (45,7%) и Gemini 3.1 Flash High (37,7%).

Этот показатель особенно важен для агентов поддержки клиентов и продаж, где одного качественного диалогового аудио недостаточно. Система также должна правильно следовать инструкциям, использовать инструменты, собирать информацию и завершать рабочие процессы.

Более быстрое время первого аудиоответа

xAI сообщает, что время первого аудиоответа составляет 0,70 секунды, по сравнению с 1,25 секунды у Think Fast 1.0.

Более низкая задержка уменьшает неловкое молчание между окончанием речи пользователя и началом ответа AI.

Artificial Analysis в настоящее время считает Think Fast 2.0 одной из наиболее быстрых голос-к-голосу систем среди протестированных, хотя это не самая быстрая модель в общем рейтинге.

Повышение точности транскрипции на 24 языках

xAI также протестировала Think Fast 2.0 на тысячах коротких голосовых образцов, охватывающих 24 языка.

По заявлению компании, в её оценке точность транскрипции новой модели примерно в 1,5–2,0 раза выше, чем у Deepgram Nova 3 и ElevenLabs Scribe v2, и примерно в 1,4 раза выше, чем у Grok Voice Think Fast 1.0.

xAI

Кроме того, утверждается, что в условиях шума и сжатия телефонной линии разница может достигать примерно 10 раз.

Эти данные получены в ходе собственных транскрипционных оценок xAI, а не из контрольных таблиц анализа искусственного интеллекта. Это различие важно, поскольку контрольные сравнения и транскрипционные эксперименты измеряют разные показатели и проводятся в разных условиях оценки.

Акцент на шумном аудио имеет решающее значение для голосовых агентов в производственной среде. Реальные звонки часто включают сжатие мобильной сети, некачественные микрофоны, уличный или офисный шум, акценты, быструю речь, перебивания, неполные предложения, имена, адреса и данные учетных записей.

Модель рассуждает, одновременно говоря

Одним из уникальных дизайнерских решений в Grok Voice Think Fast является параллельное рассуждение.

xAI

Модель может продолжать рассуждать во время речи, а не завершать все рассуждения до генерации аудио. Этот подход направлен на уменьшение компромисса между интеллектом и задержкой.

Think Fast 2.0 также использует меньше токенов рассуждения, чем предыдущая версия. xAI сообщает о следующем относительном медианном использовании токенов рассуждения:

Модель Относительное количество токенов рассуждения на ответ
Grok Voice Think Fast 2.0 0.4×
Grok Voice Think Fast 1.0 1.0×

Компания заявляет, что это ускоряет вызов инструментов, обычно позволяя выполнить инструмент до того, как голосовой помощник закончит свою первую фразу.

Например, агент поддержки может только начать: "Я проверю это для вас...", одновременно вызывая инструмент запроса учетной записи в фоновом режиме. Когда устное введение заканчивается, результат работы инструмента может быть уже готов для использования в следующей части ответа.

Обучение с подкреплением для более лаконичных диалогов

xAI сообщает, что Think Fast 2.0 был обучен с помощью интенсивного обучения с подкреплением, чтобы он больше походил на практичного человека-оператора в реальных разговорах.

Модель поощряется использовать более короткие предложения, задавать только один вопрос за раз, избегать ненужных слов-паразитов, поддерживать фокус разговора и не раскрывать ненужную сложность при проведении пользователя через сложные процессы.

Это может показаться небольшими изменениями, но голосовые интерфейсы гораздо менее терпимы к длинным ответам, чем текстовые чаты. Длинные ответы могут быть приемлемы на экране, но их утомительно слушать во время разговора.

Использование инструментов - ключевая часть голосового API

Текущий голосовой API от xAI (speech-to-speech) напрямую поддерживает несколько типов инструментов в голосовой сессии:

  • file_search
  • web_search
  • x_search
  • Удаленные MCP-инструменты
  • Пользовательские функции

Это позволяет голосовым ассистентам выходить за рамки простых вопросов и ответов.

В зависимости от прав, предоставленных приложением, ассистент может понимать запросы звонящего, искать в утвержденных документах, запрашивать информацию об учетной записи, вызывать бизнес-API, выполнять разрешенные действия и объяснять результаты голосом.

Для производственной среды приложениям все равно необходимо устанавливать строгие границы разрешений. Даже если модель способна вызывать конфиденциальные инструменты, ей не следует напрямую предоставлять к ним доступ.

Starlink A/B-тестирует Think Fast 2.0

Grok Voice уже используется в телефонных продажах и рабочих процессах поддержки Starlink.

xAI сообщает, что провела A/B-тестирование Think Fast 2.0 на телефонных линиях Starlink по номеру +1 888 GO STARLINK.

Компания сообщает о значительном повышении конверсии продаж и скорости решения проблем поддержки.

xAI не раскрыла конкретные проценты улучшения от A/B-тестирования Think Fast 2.0 в своем объявлении.

Это не следует путать с ранее опубликованными данными для первоначального развертывания Think Fast 1.0. xAI тогда сообщила о 20% конверсии продаж и 70% автономном решении проблем поддержки. В объявлении о версии 2.0 лишь говорится, что новая версия улучшила существующие результаты Starlink.

Ценообразование: 0,08 доллара за минуту

Официальная страница цен xAI показывает:

Голосовая модель Цена за аудио
grok-voice-think-fast-1.0 0,05 долл./мин
grok-voice-think-fast-2.0 0,08 долл./мин

Таким образом, стоимость аудио для Think Fast 2.0 составляет 4,80 доллара в час,

согласно опубликованным тарифам API.

Текстовый ввод для голосового API (speech-to-speech) тарифицируется отдельно: 0,004 доллара за .

Дополнительные серверные инструменты также могут взимать отдельную плату. Например, в настоящее время xAI устанавливает цену в 5 долларов за 1000 вызовов инструментов для веб-поиска, поиска X и выполнения кода.

Таким образом, разработчикам следует рассчитывать общую стоимость на основе полного рабочего процесса, а не просто умножать тариф на аудио.

grok-voice-latest переключится на версию 2.0 5 августа 2026 года

Разработчикам, уже использующим голосовой API Grok, необходимо обратить внимание на псевдонимы моделей.

Текущая документация гласит:

grok-voice-latest

указывает на:

grok-voice-think-fast-1.0

до 5 августа 2026 года.

5 августа 2026 года этот псевдоним автоматически переключится на:

grok-voice-think-fast-2.0

Приложения, использующие grok-voice-latest, получат обновление без каких-либо изменений.

Однако командам, которым требуется стабильное поведение, следует явно зафиксировать версию.

Чтобы остаться на версии 1.0:

grok-voice-think-fast-1.0

Чтобы немедленно перейти на новую модель:

grok-voice-think-fast-2.0

Фиксация версии особенно важна для производственных систем с регламентированными рабочими процессами, фиксированными базовыми показателями оценки или потребностями управления изменениями.

Существующие промпты обычно не требуют изменений

xAI утверждает, что Think Fast 2.0 предназначен для улучшения большинства существующих приложений без изменения промптов.

Это делает миграцию относительно простой, но производственным командам все равно необходимо провести регрессионное тестирование.

Обновление голосовой модели может повлиять на длину ответов, время, очередность реплик, частоту вызова инструментов, уточняющие вопросы, механизмы эскалации, транскрипцию, произношение и сбор структурированных данных.

Разумный процесс миграции:

  1. Зафиксировать текущую модель 1.0.
  2. Запустить те же тестовые диалоги на версии 2.0.
  3. Сравнить процент успешного выполнения задач и использование инструментов.
  4. Протестировать шумное аудио и качество телефонной линии.
  5. Проверить обработку перебиваний.
  6. Оценить задержки.
  7. Измерить стоимость за выполненную задачу.
  8. Поэтапно переносить производственный трафик.

Минимальное подключение к Grok Voice

В оригинальном отчете AIBase не было кода, но официальная документация xAI предоставляет простой пример WebSocket для подключения к голосовому API (speech-to-speech).

Выбор модели через WebSocket URL:

MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"

Затем сессия может определить голос, инструкции и определение очереди говорящего:

session_config = {
    "type": "session.update",
    "session": {
        "voice": "eve",
        "instructions": "Вы лаконичный ассистент поддержки клиентов.",
        "turn_detection": {
            "type": "server_vad"
        }
    }
}

Для браузерных или мобильных клиентов xAI рекомендует использовать временные токены, а не предоставлять клиенту долгосрочные API-ключи. Серверные приложения могут аутентифицироваться через API-ключ в заголовке авторизации.

Поддерживаемые аудиоформаты

Голосовой API (speech-to-speech) в настоящее время поддерживает:

Формат Типичное использование
PCM Аудио общего назначения высокого качества
G.711 μ-law / audio/pcmu Телефонное аудио
G.711 A-law / audio/pcma Телефонные системы
Opus Сжатое аудио в реальном времени

PCM поддерживает от 8

Частоты дискретизации от кГц до 48 кГц.

Для обычных голосовых приложений официальная документация по умолчанию рекомендует использовать PCM с частотой 24 кГц. Нативная поддержка G.711 полезна для телефонных систем, так как позволяет уменьшить необходимость дополнительного транскодирования в некоторых телефонных системах.

Наиболее подходящие сценарии применения Think Fast 2.0

Данный релиз в первую очередь ориентирован на рабочие процессы с участием операторов в реальном времени, а не на простую офлайн-расшифровку.

Поддержка клиентов

Модель может прослушивать вопросы клиентов, искать утвержденную информацию, использовать инструменты работы с учетными записями и выполнять многоэтапное устранение неисправностей.

Телефонные продажи

Голосовой оператор может отвечать на вопросы, выявлять потенциальных клиентов, использовать инструменты продаж и проводить звонящего через процесс покупки.

Операторы по бронированию и записи

Система может собирать информацию о дате, времени, имени и предпочтениях, одновременно вызывая API планирования.

Внутренний корпоративный помощник

Сотрудники могут взаимодействовать с корпоративными системами голосом, в то время как модель вызывает внутренние инструменты или ищет информацию в утвержденной базе знаний.

Многоязычные голосовые сервисы

Платформа Grok Voice от xAI поддерживает более 25 языков, что делает модель пригодной для глобальной поддержки бизнеса.

Что разработчикам необходимо тестировать самостоятельно

Бенчмарки полезны, но они не позволяют судить о том, подходит ли модель для конкретного приложения.

Перед развертыванием в производственной среде протестируйте акценты реальных звонящих, телефонные кодеки, фоновый шум, названия продуктов, имена клиентов, адреса, длинные номера счетов, перебивания, паузы, изменение решения пользователем, сбои инструментов, ошибочные результаты работы инструментов, условия передачи звонка оператору, а также правила безопасности или соответствия.

Время до первого звука в 0,70 секунды имеет ценность только при правильности ответа. Точно так же высокие баллы в бенчмарках не гарантируют, что оператор будет следовать специфическим правилам возврата компании или точно вводить необычные имена клиентов.

Часто задаваемые вопросы

Что такое Grok Voice Think Fast 2.0?

Grok Voice Think Fast 2.0 — это новое поколение модели "голос-в-голос" от xAI, предназначенное для голосовых операторов в реальном времени. Она объединяет в себе функции нативного аудиовзаимодействия, рассуждения, смены реплик в диалоге, транскрибации и использования инструментов.

Какова цена Grok Voice Think Fast 2.0?

xAI установил цену на эту модель в размере 0,08 доллара США за минуту аудио, что эквивалентно 4,80 доллара в час. Вызовы инструментов и некоторые другие функции API могут взиматься дополнительно.

Быстрее ли Think Fast 2.0, чем Think Fast 1.0?

Да. Согласно отчетам xAI и Artificial Analysis, время до первого звука сократилось с 1,25 секунды до 0,70 секунды.

Превосходит ли он GPT-Realtime-2.1?

В общем индексе качества "голос-в-голос" от Artificial Analysis и в бенчмарке τ-voice-agent Think Fast 2.0 показал более высокие баллы в опубликованных сравнениях. GPT-Realtime-2.1 High по-прежнему имеет небольшое преимущество в бенчмарке полнодуплексной связи, поэтому Think Fast 2.0 не лидирует по всем отдельным показателям.

Нужно ли переписывать промпты для версии 2.0?

xAI утверждает, что в большинстве приложений для повышения производительности не требуется изменять промпты. Производственным группам все же следует проводить регрессионное тестирование, поскольку тайминги, использование инструментов, стиль смены реплик и ответов могут различаться в зависимости от версии модели.

Когда grok-voice-latest переключится на Think Fast 2.0?

xAI сообщает, что этот псевдоним будет автоматически переключен 5 августа 2026 года.

Разработчикам, которым необходимо продолжать использовать версию 1.0, следует зафиксировать grok-voice-think-fast-1.0.

Может ли Grok Voice Think Fast 2.0 вызывать инструменты?

Да. Текущий API "голос-в-голос" поддерживает пользовательские функции, поиск по файлам, веб-поиск, поиск по X (Twitter) и удаленные MCP-инструменты.

Think Fast 2.0 предназначен только для поддержки клиентов?

Нет. Поддержка клиентов и продажи являются типичными сценариями использования, но модель также может применяться для других рабочих процессов с голосовыми агентами в реальном времени, таких как службы бронирования, корпоративные помощники и интерактивные приложения.

Связанные инструменты

  • Grok Voice Think Fast 2.0: Официальный анонс xAI новой флагманской голосовой модели.
  • Grok Voice API: Официальная документация API "голос-в-голос", охватывающая выбор модели, аудиоформаты, инструменты и настройку сессий.
  • Grok Voice Agent Builder: Бескодовая среда от xAI для создания производственных голосовых агентов.
  • Таблица лидеров Artificial Analysis "голос-в-голос": Независимое сравнительное тестирование, охватывающее голосовые рассуждения, динамику диалога, производительность агентов, скорость и ценообразование.
  • Deepgram Nova: Платформа распознавания речи, упоминаемая в сравнительных тестах транскрибации от xAI.
  • ElevenLabs: Платформа голосового ИИ, модель Scribe которой включена в оценку транскрибации от xAI.

Связанные ссылки

Резюме

Grok Voice Think Fast 2.0 улучшает технологический стек xAI для голосового взаимодействия в реальном времени в наиболее критичных для производственных агентов областях: выполнении задач агента, динамике диалога, точности транскрибации и задержке.

Модель достигла 82,9% в индексе качества "голос-в-голос" от Artificial Analysis, набрала 56,5% в оценке τ-voice, а время первого аудиоответа составило 0,70 секунды. xAI также сообщает об улучшении транскрибации на 24 языках и более высокой эффективности рассуждений, что позволяет выполнять вызовы инструментов раньше в голосовом ответе.

Разработчики теперь могут использовать модель по цене 0,08 доллара за минуту аудио. Существующим пользователям следует также обратить внимание, что grok-voice-latest запланирован к автоматическому переключению с Think Fast 1.0 на Think Fast 2.0 5 августа 2026 года.

Это обновление — не просто более умная голосовая модель, а более ориентированный на производство агент, способный слушать, рассуждать, вести диалог и вызывать инструменты с меньшей задержкой.