Grok Voice Think Fast 2.0: более быстрая и точная голосовая модель-агент от xAI. Руководство по Grok Voice Think Fast 2.0: тесты, цены, точн...

xAI представила Grok Voice Think Fast 2.0 — следующее поколение модели преобразования голоса в голос для разработки голосовых агентов реального времени.
Новая версия сосредоточена на четырёх ключевых аспектах производственных голосовых систем: уровень интеллекта, точность транскрипции, диалоговое поведение и надёжный вызов инструментов. По заявлению xAI, в большинстве случаев существующие приложения могут перейти на новую модель без переписывания промптов.
Think Fast 2.0 стоит 0,08 доллара за минуту аудио. Разработчики могут использовать имя модели с версией grok-voice-think-fast-2.0, а псевдоним grok-voice-latest запланирован к переключению с версии 1.0 на 2.0 5 августа 2026 года.
Модель предназначена для реальных голосовых агентных нагрузок, таких как поддержка клиентов, продажи, телефонная автоматизация и многоэтапные бизнес-процессы — сценарии, где агент должен понимать речь, рассуждать, вызывать инструменты и быстро реагировать для поддержания естественного диалога.
xAI опубликовала результаты бенчмарков от Artificial Analysis, сравнив Think Fast 2.0 с предыдущей версией, OpenAI GPT-Realtime-2.1 и Google Gemini 3.1 Flash.

Результаты представлены ниже:
| Бенчмарк | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| AA голос-к-голосу индекс качества | 82.9% | 75.7% | 79.1% | 69.5% |
| Big Bench Audio | 97.2% | 97.1% | 96.0% | 96.6% |
| Full-duplex тест | 95.1% | 77.8% | 95.7% | 74.3% |
| τ-голосовой тест | 56.5% | 52.1% | 45.7% | 37.7% |
| Время первого аудиоответа | 0.70 сек | 1.25 сек | — | 2.98 сек |
По сравнению с Think Fast 1.0, общий голос-к-голосу индекс качества от Artificial Analysis вырос с 75,7% до 82,9%.
Наиболее заметные изменения произошли в диалоговой динамике, производительности агента и задержке ответа.
В тесте Big Bench Audio Think Fast 2.0 набрал 97,2%, что лишь немного выше показателя предыдущей модели в 97,1%.
Это указывает на то, что выпуск не нацелен на значительный скачок в чистых способностях голосовых рассуждений. Вместо этого большая часть улучшений касается поведения модели в диалогах реального времени.
Think Fast 2.0 достиг 95,1% в full-duplex тесте, тогда как Think Fast 1.0 получил 77,8%.
Full-duplex тест оценивает такие аспекты, как тайминг речи, обработка пауз, реакции на перебивания, распознавание обратной связи и поддержание естественного переключения ходов.
GPT-Realtime-2.1 High показал немного более высокий результат в этом тесте — 95,7%, поэтому модель xAI не лидирует во всех категориях.
В тесте τ-голосовой, который больше ориентирован на оценку выполнения агентом реальных задач, Think Fast 2.0 набрал 56,5%.
Этот результат выше, чем у Think Fast 1.0 (52,1%), GPT-Realtime-2.1 High (45,7%) и Gemini 3.1 Flash High (37,7%).
Этот показатель особенно важен для агентов поддержки клиентов и продаж, где одного качественного диалогового аудио недостаточно. Система также должна правильно следовать инструкциям, использовать инструменты, собирать информацию и завершать рабочие процессы.
xAI сообщает, что время первого аудиоответа составляет 0,70 секунды, по сравнению с 1,25 секунды у Think Fast 1.0.
Более низкая задержка уменьшает неловкое молчание между окончанием речи пользователя и началом ответа AI.
Artificial Analysis в настоящее время считает Think Fast 2.0 одной из наиболее быстрых голос-к-голосу систем среди протестированных, хотя это не самая быстрая модель в общем рейтинге.
xAI также протестировала Think Fast 2.0 на тысячах коротких голосовых образцов, охватывающих 24 языка.
По заявлению компании, в её оценке точность транскрипции новой модели примерно в 1,5–2,0 раза выше, чем у Deepgram Nova 3 и ElevenLabs Scribe v2, и примерно в 1,4 раза выше, чем у Grok Voice Think Fast 1.0.
xAI
Кроме того, утверждается, что в условиях шума и сжатия телефонной линии разница может достигать примерно 10 раз.
Эти данные получены в ходе собственных транскрипционных оценок xAI, а не из контрольных таблиц анализа искусственного интеллекта. Это различие важно, поскольку контрольные сравнения и транскрипционные эксперименты измеряют разные показатели и проводятся в разных условиях оценки.
Акцент на шумном аудио имеет решающее значение для голосовых агентов в производственной среде. Реальные звонки часто включают сжатие мобильной сети, некачественные микрофоны, уличный или офисный шум, акценты, быструю речь, перебивания, неполные предложения, имена, адреса и данные учетных записей.
Одним из уникальных дизайнерских решений в Grok Voice Think Fast является параллельное рассуждение.
xAI
Модель может продолжать рассуждать во время речи, а не завершать все рассуждения до генерации аудио. Этот подход направлен на уменьшение компромисса между интеллектом и задержкой.
Think Fast 2.0 также использует меньше токенов рассуждения, чем предыдущая версия. xAI сообщает о следующем относительном медианном использовании токенов рассуждения:
| Модель | Относительное количество токенов рассуждения на ответ |
|---|---|
| Grok Voice Think Fast 2.0 | 0.4× |
| Grok Voice Think Fast 1.0 | 1.0× |
Компания заявляет, что это ускоряет вызов инструментов, обычно позволяя выполнить инструмент до того, как голосовой помощник закончит свою первую фразу.
Например, агент поддержки может только начать: "Я проверю это для вас...", одновременно вызывая инструмент запроса учетной записи в фоновом режиме. Когда устное введение заканчивается, результат работы инструмента может быть уже готов для использования в следующей части ответа.
xAI сообщает, что Think Fast 2.0 был обучен с помощью интенсивного обучения с подкреплением, чтобы он больше походил на практичного человека-оператора в реальных разговорах.
Модель поощряется использовать более короткие предложения, задавать только один вопрос за раз, избегать ненужных слов-паразитов, поддерживать фокус разговора и не раскрывать ненужную сложность при проведении пользователя через сложные процессы.
Это может показаться небольшими изменениями, но голосовые интерфейсы гораздо менее терпимы к длинным ответам, чем текстовые чаты. Длинные ответы могут быть приемлемы на экране, но их утомительно слушать во время разговора.
Текущий голосовой API от xAI (speech-to-speech) напрямую поддерживает несколько типов инструментов в голосовой сессии:
file_searchweb_searchx_searchЭто позволяет голосовым ассистентам выходить за рамки простых вопросов и ответов.
В зависимости от прав, предоставленных приложением, ассистент может понимать запросы звонящего, искать в утвержденных документах, запрашивать информацию об учетной записи, вызывать бизнес-API, выполнять разрешенные действия и объяснять результаты голосом.
Для производственной среды приложениям все равно необходимо устанавливать строгие границы разрешений. Даже если модель способна вызывать конфиденциальные инструменты, ей не следует напрямую предоставлять к ним доступ.
Grok Voice уже используется в телефонных продажах и рабочих процессах поддержки Starlink.
xAI сообщает, что провела A/B-тестирование Think Fast 2.0 на телефонных линиях Starlink по номеру +1 888 GO STARLINK.
Компания сообщает о значительном повышении конверсии продаж и скорости решения проблем поддержки.
xAI не раскрыла конкретные проценты улучшения от A/B-тестирования Think Fast 2.0 в своем объявлении.
Это не следует путать с ранее опубликованными данными для первоначального развертывания Think Fast 1.0. xAI тогда сообщила о 20% конверсии продаж и 70% автономном решении проблем поддержки. В объявлении о версии 2.0 лишь говорится, что новая версия улучшила существующие результаты Starlink.
Официальная страница цен xAI показывает:
| Голосовая модель | Цена за аудио |
|---|---|
grok-voice-think-fast-1.0 | 0,05 долл./мин |
grok-voice-think-fast-2.0 | 0,08 долл./мин |
Таким образом, стоимость аудио для Think Fast 2.0 составляет 4,80 доллара в час,
согласно опубликованным тарифам API.
Текстовый ввод для голосового API (speech-to-speech) тарифицируется отдельно: 0,004 доллара за .
Дополнительные серверные инструменты также могут взимать отдельную плату. Например, в настоящее время xAI устанавливает цену в 5 долларов за 1000 вызовов инструментов для веб-поиска, поиска X и выполнения кода.
Таким образом, разработчикам следует рассчитывать общую стоимость на основе полного рабочего процесса, а не просто умножать тариф на аудио.
grok-voice-latest переключится на версию 2.0 5 августа 2026 годаРазработчикам, уже использующим голосовой API Grok, необходимо обратить внимание на псевдонимы моделей.
Текущая документация гласит:
grok-voice-latest
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
указывает на:
grok-voice-think-fast-1.0
до 5 августа 2026 года.
5 августа 2026 года этот псевдоним автоматически переключится на:
grok-voice-think-fast-2.0
Приложения, использующие grok-voice-latest, получат обновление без каких-либо изменений.
Однако командам, которым требуется стабильное поведение, следует явно зафиксировать версию.
Чтобы остаться на версии 1.0:
grok-voice-think-fast-1.0
Чтобы немедленно перейти на новую модель:
grok-voice-think-fast-2.0
Фиксация версии особенно важна для производственных систем с регламентированными рабочими процессами, фиксированными базовыми показателями оценки или потребностями управления изменениями.
xAI утверждает, что Think Fast 2.0 предназначен для улучшения большинства существующих приложений без изменения промптов.
Это делает миграцию относительно простой, но производственным командам все равно необходимо провести регрессионное тестирование.
Обновление голосовой модели может повлиять на длину ответов, время, очередность реплик, частоту вызова инструментов, уточняющие вопросы, механизмы эскалации, транскрипцию, произношение и сбор структурированных данных.
Разумный процесс миграции:
В оригинальном отчете AIBase не было кода, но официальная документация xAI предоставляет простой пример WebSocket для подключения к голосовому API (speech-to-speech).
Выбор модели через WebSocket URL:
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
Затем сессия может определить голос, инструкции и определение очереди говорящего:
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "Вы лаконичный ассистент поддержки клиентов.",
"turn_detection": {
"type": "server_vad"
}
}
}
Для браузерных или мобильных клиентов xAI рекомендует использовать временные токены, а не предоставлять клиенту долгосрочные API-ключи. Серверные приложения могут аутентифицироваться через API-ключ в заголовке авторизации.
Голосовой API (speech-to-speech) в настоящее время поддерживает:
| Формат | Типичное использование |
|---|---|
| PCM | Аудио общего назначения высокого качества |
G.711 μ-law / audio/pcmu | Телефонное аудио |
G.711 A-law / audio/pcma | Телефонные системы |
| Opus | Сжатое аудио в реальном времени |
PCM поддерживает от 8
Частоты дискретизации от кГц до 48 кГц.
Для обычных голосовых приложений официальная документация по умолчанию рекомендует использовать PCM с частотой 24 кГц. Нативная поддержка G.711 полезна для телефонных систем, так как позволяет уменьшить необходимость дополнительного транскодирования в некоторых телефонных системах.
Данный релиз в первую очередь ориентирован на рабочие процессы с участием операторов в реальном времени, а не на простую офлайн-расшифровку.
Модель может прослушивать вопросы клиентов, искать утвержденную информацию, использовать инструменты работы с учетными записями и выполнять многоэтапное устранение неисправностей.
Голосовой оператор может отвечать на вопросы, выявлять потенциальных клиентов, использовать инструменты продаж и проводить звонящего через процесс покупки.
Система может собирать информацию о дате, времени, имени и предпочтениях, одновременно вызывая API планирования.
Сотрудники могут взаимодействовать с корпоративными системами голосом, в то время как модель вызывает внутренние инструменты или ищет информацию в утвержденной базе знаний.
Платформа Grok Voice от xAI поддерживает более 25 языков, что делает модель пригодной для глобальной поддержки бизнеса.
Бенчмарки полезны, но они не позволяют судить о том, подходит ли модель для конкретного приложения.
Перед развертыванием в производственной среде протестируйте акценты реальных звонящих, телефонные кодеки, фоновый шум, названия продуктов, имена клиентов, адреса, длинные номера счетов, перебивания, паузы, изменение решения пользователем, сбои инструментов, ошибочные результаты работы инструментов, условия передачи звонка оператору, а также правила безопасности или соответствия.
Время до первого звука в 0,70 секунды имеет ценность только при правильности ответа. Точно так же высокие баллы в бенчмарках не гарантируют, что оператор будет следовать специфическим правилам возврата компании или точно вводить необычные имена клиентов.
Grok Voice Think Fast 2.0 — это новое поколение модели "голос-в-голос" от xAI, предназначенное для голосовых операторов в реальном времени. Она объединяет в себе функции нативного аудиовзаимодействия, рассуждения, смены реплик в диалоге, транскрибации и использования инструментов.
xAI установил цену на эту модель в размере 0,08 доллара США за минуту аудио, что эквивалентно 4,80 доллара в час. Вызовы инструментов и некоторые другие функции API могут взиматься дополнительно.
Да. Согласно отчетам xAI и Artificial Analysis, время до первого звука сократилось с 1,25 секунды до 0,70 секунды.
В общем индексе качества "голос-в-голос" от Artificial Analysis и в бенчмарке τ-voice-agent Think Fast 2.0 показал более высокие баллы в опубликованных сравнениях. GPT-Realtime-2.1 High по-прежнему имеет небольшое преимущество в бенчмарке полнодуплексной связи, поэтому Think Fast 2.0 не лидирует по всем отдельным показателям.
xAI утверждает, что в большинстве приложений для повышения производительности не требуется изменять промпты. Производственным группам все же следует проводить регрессионное тестирование, поскольку тайминги, использование инструментов, стиль смены реплик и ответов могут различаться в зависимости от версии модели.
grok-voice-latest переключится на Think Fast 2.0?xAI сообщает, что этот псевдоним будет автоматически переключен 5 августа 2026 года.
Разработчикам, которым необходимо продолжать использовать версию 1.0, следует зафиксировать grok-voice-think-fast-1.0.
Да. Текущий API "голос-в-голос" поддерживает пользовательские функции, поиск по файлам, веб-поиск, поиск по X (Twitter) и удаленные MCP-инструменты.
Нет. Поддержка клиентов и продажи являются типичными сценариями использования, но модель также может применяться для других рабочих процессов с голосовыми агентами в реальном времени, таких как службы бронирования, корпоративные помощники и интерактивные приложения.
Grok Voice Think Fast 2.0 улучшает технологический стек xAI для голосового взаимодействия в реальном времени в наиболее критичных для производственных агентов областях: выполнении задач агента, динамике диалога, точности транскрибации и задержке.
Модель достигла 82,9% в индексе качества "голос-в-голос" от Artificial Analysis, набрала 56,5% в оценке τ-voice, а время первого аудиоответа составило 0,70 секунды. xAI также сообщает об улучшении транскрибации на 24 языках и более высокой эффективности рассуждений, что позволяет выполнять вызовы инструментов раньше в голосовом ответе.
Разработчики теперь могут использовать модель по цене 0,08 доллара за минуту аудио. Существующим пользователям следует также обратить внимание, что grok-voice-latest запланирован к автоматическому переключению с Think Fast 1.0 на Think Fast 2.0 5 августа 2026 года.
Это обновление — не просто более умная голосовая модель, а более ориентированный на производство агент, способный слушать, рассуждать, вести диалог и вызывать инструменты с меньшей задержкой.
Начните с одной фразы и получите полноценный сайт за считанные минуты.