Введение
DeepSeek V4 Flash 0731 вышел в открытую бета-версию со знакомым обещанием: повышенная производительность в кодинге и агентные возможности по крайне низким ценам на API.
Разработчики быстро превратили это заявление в реальные эксперименты.
Один из самых вирусных примеров — запуск Hermes Agent, в ходе которого DeepSeek V4 Flash сгенерировал играбельный шутер от первого лица в 3D всего по одному стартовому промпту. По сообщениям, проект занял 32 минуты, а стоимость использования модели составила всего 0,07 доллара.
Итоговый результат включал:
- Передвижение от первого лица.
- Прыжки.
- Стрельбу.
- Физические столкновения с окружением.
- Объекты-укрытия и цели.
- Счётчик патронов в интерфейсе.

CSA и HCA снижают стоимость длинного контекста
DeepSeek V4 поддерживает окно контекста в 1 миллион токенов.
Традиционные системы внимания становятся чрезвычайно дорогими в таких масштабах, поскольку каждый новый токен может потребовать обработки большого объёма предыдущего контекста и поддержания значительного KV-кэша.
В техническом отчёте DeepSeek описывается гибридная конструкция внимания, сочетающая:
- Сжатое разреженное внимание (CSA)
- Сильно сжатое внимание (HCA)
Общая стратегия заключается в том, чтобы избегать полных и дорогостоящих вычислений внимания по всей истории на каждом шаге.
Система сжимает и фильтрует контекст, позволяя модели сосредоточить вычисления на наиболее полезной информации.
DeepSeek сообщает, что в контексте из 1 миллиона токенов V4 Pro требует:
27% от FLOPs на токен вывода DeepSeek V3.2.
- 10% от объёма KV-кэша.
Эти точные проценты указаны в техническом документе для V4 Pro и не являются отдельными данными аудита для Flash.
V4 Flash использует то же семейство архитектур, поэтому наследует те же принципы проектирования длинного контекста.
Практический эффект включает снижение:
- памяти KV-кэша.
- нагрузки на память GPU.
- объёма перемещаемых данных.
- вычислений на токен.
- стоимости обслуживания длинного контекста.
FP4 и FP8 уменьшают объём хранимых данных
и трафик памяти
Опубликованная модель V4 Flash использует смешанную низкую точность весов.
DeepSeek указывает:
FP4 + FP8 смешанная точность
Более низкая точность уменьшает объём данных, которые необходимо хранить, загружать из памяти, передавать между устройствами и обрабатывать во время инференса.
Это важно, потому что современный инференс языковых моделей часто ограничен пропускной способностью памяти, а не только вычислительной мощностью.
Если аппаратное обеспечение и ядра спроектированы для эффективного выполнения таких форматов, более компактное представление данных может повысить пропускную способность.
Низкая точность не является автоматически бесплатной.
Плохая квантизация снижает качество модели.
Релиз DeepSeek спроектирован и обучен под выбранную схему точности, а не полагается на постфактум-квантизацию сторонними сообществами.
Архитектура не изменилась между предварительной версией и версией 0731
DeepSeek заявляет, что официальная версия 0731 сохраняет ту же архитектуру и масштаб модели, что и предварительная версия V4 Flash.
Компания не проводила полное предварительное обучение заново для этого обновления.
Вместо этого был переделан этап пост-обучения.
В исходной статье изменения резюмируются так:
- Новый контролируемый тонкий тюнинг.
- Новое обучение с подкреплением GRPO.
- Спекулятивное декодирование DSpark.
- Улучшенное поведение агента.
- Более высокая пропускная способность обслуживания.
В техническом отчёте DeepSeek более широкий процесс пост-обучения V4 описывается так:
- Независимая разработка экспертных модулей для доменов.
- Контролируемый тонкий тюнинг и обучение с подкреплением с GRPO.
- Дистилляция политики в онлайне.
- Интеграция экспертных возможностей в единую модель.
Обновление 0731 сосредоточено на улучшении этих возможностей в реальных сценариях работы агентов.
DSpark ускоряет генерацию токенов
DeepSeek-V4-Flash-0731 поставляется с модулем спекулятивного декодирования DSpark.
Спекулятивное декодирование использует более маленький или более дешёвый путь-черновик для предложения нескольких будущих токенов.
Основная модель пакетно проверяет эти предложения.
Упрощённый процесс выглядит так:
Черновой модуль предлагает токены
→ Основная модель одновременно проверяет
→ Принятые токены выводятся
→ Отклонённые пути исправляются
Когда прогнозы черновика точны, система может генерировать несколько принятых токенов с меньшим количеством дорогих последовательных рассуждений основной модели.
DeepSeek предоставляет поддержку DSpark для vLLM и SGLang.
Для vLLM официальная карточка модели использует:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Для SGLang соответствующий параметр:
--speculative-algorithm DSPARK
DeepSeek указывает, что веса целевой и черновой моделей хранятся в одном чекпоинте, поэтому SGLang не требует отдельного пути для черновой модели.
Спекулятивное декодирование в первую очередь повышает скорость обслуживания и пропускную способность.
Само по себе оно не объясняет улучшение рассуждений модели.
Эти улучшения связаны с обновлённым процессом пост-обучения.
Официальный релиз улучшает результаты в бенчмарках для агентов
DeepSeek сообщает о значительных улучшениях по ряду агентских тестов по сравнению с предварительной версией V4 Flash.
| Бенчмарк | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 |
12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

DeepSeek сообщает, что публичные бенчмарки для кодовых агентов запускались со следующими настройками:
DeepSeek Harness минимальный режим
reasoning_effort = max
top_p = 0.95
temperature = 1.0
На момент официального обновления этот фреймворк тестирования ещё не был опубликован.
DSBench-FullStack и DSBench-Hard — внутренние бенчмарки DeepSeek.
Это означает, что их результаты могут служить свидетельством заявлений компании, но не могут быть независимо проверены так же, как полностью открытые наборы тестов.
Что измеряют Terminal Bench и Toolathlon
Terminal Bench 2.1
Terminal Bench оценивает способность агента выполнять задачи в терминальной среде.
Модели может потребоваться просматривать файлы, выполнять команды, устанавливать зависимости, отлаживать сбои, изменять код и проверять завершение.
Высокий балл отражает совокупную производительность модели, фреймворка агента, стратегии использования инструментов, бюджета рассуждений и среды выполнения.
Toolathlon-Verified
Toolathlon оценивает длительные задачи с использованием нескольких программных приложений и инструментов.
Бенчмарк включает сценарии, связанные с календарём, файловой системой, Notion, WooCommerce, Kubernetes и BigQuery.
Задачи требуют множества взаимодействий с инструментами и проверяются с помощью исполняемых оценщиков.
Результат 70.3, о котором сообщает DeepSeek, представляет собой значительное улучшение по сравнению с предварительной моделью.
Но это не следует интерпретировать как гарантию 70.3% успеха для каждого реального бизнес-процесса.
Улучшение бенчмарков не гарантирует успех с первой попытки для каждой игры
Пример игры из источника раскрывает важное различие между производительностью в бенчмарках и творческим программированием.
V4 Flash показывает высокие результаты в официальных агентских оценках, но для одного игрового сравнения всё же потребовалось три итерации.
Бенчмарки могут измерять частоту успеха на чётко определённых наборах задач с известными правилами оценки.
Творческие проекты могут включать нечёткие визуальные требования, проблемы совместимости с браузером, ошибки физического движка, отсутствующие ресурсы, субъективные оценки качества и отсутствие единого набора тестов для определения успеха.
В таких сценариях недорогие модели особенно полезны, потому что рабочий процесс может позволить несколько итераций.
Их ценность не обязательно в том, что первая генерация будет идеальной.
Это может быть:
Приемлемое качество
×
Большое количество доступных по цене попыток
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
V4 Flash поддерживает множество форматов API
DeepSeek предоставляет доступ к моделям следующими способами:
- Совместимый с OpenAI интерфейс Chat Completions.
- Совместимый с OpenAI API Responses.
- Совместимый с Anthropic API.
- Вывод в формате JSON.
- Вызов инструментов.
- Дополнение префикса чата.
- Заполнение середины в режиме без рассуждений.
Базовый URL для совместимости с OpenAI:
https://api.deepseek.com
Базовый URL для совместимости с Anthropic:
https://api.deepseek.com/anthropic
DeepSeek заявляет, что V4 Flash — единственная модель V4 API, которая в настоящее время поддерживает API Responses.
Поддержка V4 Pro будет организована отдельно.
Совместимость с API Responses также позволяет использовать эту модель в Codex через документированную конфигурацию DeepSeek.
Режим рассуждений включён по умолчанию
DeepSeek V4 Flash поддерживает режим рассуждений и режим без рассуждений.
Режим рассуждений является режимом по умолчанию.
Для локального вывода официальная карточка модели поддерживает три уровня усилий рассуждений:
low
high
max
DeepSeek рекомендует:
temperature = 1.0
top_p = 0.95
для сценариев с агентами.
Для уровней усилий high и max компания рекомендует разрешать максимальную длину вывода до 384K токенов.
Более высокие настройки рассуждений могут улучшить производительность на сложных задачах, но также могут увеличить задержку, объём вывода, стоимость API и время циклов агента.
Производственные системы должны оценивать самый низкий уровень усилий, способный надёжно удовлетворять требованиям задачи.
Веса выпущены под лицензией MIT
DeepSeek опубликовала веса V4 Flash 0731 на Hugging Face под лицензией MIT.
Это делает модель исключительно либеральной по лицензированию по сравнению со многими крупными коммерческими релизами.
Разработчики могут использовать официальный репозиторий модели с поддерживаемыми движками, включая:
- vLLM.
- SGLang.
- Transformers.
- Docker Model Runner.
- Квантованные версии, совместимые с llama.cpp.
- Сборки сообщества, совместимые с LM Studio.
Модель имеет большой размер.
Основная модель имеет 284B параметров, а в контрольной точке 0731 также присутствует компонент DSpark.
Для работы с приемлемой скоростью требуются значительные объёмы памяти и аппаратные ресурсы.
Возможность загрузки весов не означает, что полная модель сможет плавно работать на обычном потребительском ноутбуке.
Квантованные версии сообщества могут снизить требования к памяти, но могут изменить точность, пропускную способность, ёмкость контекста, поведение DSpark и надёжность вызова инструментов.
Всегда ли V4 Flash — самый выгодный вариант?
Источники в итоге приходят к выводу, что V4 Flash не всегда даёт лучший результат в каждом сравнении, но его очень трудно превзойти по соотношению цена/качество.
Это разумное резюме примеров, но с одной важной оговоркой:
Соотношение цена/качество зависит от полного рабочего процесса.
V4 Flash особенно привлекателен в следующих случаях:
- Высокий объём запросов.
- Ошибки легко обнаружить.
- Задачи можно автоматически повторять.
- Хороший эффект от кэширования контекста.
- Низкая стоимость ручной проверки.
- Компактный код приемлем.
- Приложение может использовать модели с открытыми весами.
В следующих случаях более дорогие передовые модели в целом могут всё же оказаться более экономичными:
- Результат одного сбоя приводит к большим потерям.
- Надёжность первого прохода критически важна.
- Задача требует более глубоких знаний.
- Агент не может безопасно повторить попытку.
- Высокая стоимость ручной проверки.
- Более мелкие модели создают вывод, который трудно поддерживать.
Правильное сравнение — не:
цена за токен
а:
стоимость за каждую подтверждённую успешную задачу
Как оценить V4 Flash для реального проекта
Шаг
- Выберите репрезентативные задачи
Не тестируйте только отполированные демонстрации.
Используйте задачи, соответствующие производственной нагрузке, включая сложные и трудные сценарии.
Шаг
- Зафиксируйте среду агента
Сохраняйте единообразие подсказок, инструментов, ограничений по времени, стратегий повтора, фреймворков, песочниц, тестовых наборов и настроек рассуждений между моделями.
Шаг
- Фиксируйте полную стоимость
Отслеживайте входные данные без попадания в кэш, входные данные с попаданием в кэш, выходные токены, вызовы инструментов, количество повторов, время выполнения, ручные проверки и неудачные попытки.
Шаг
- Оценивайте приемлемость, а не только визуальное сходство
Для кода запускайте тесты и проверяйте поддерживаемость.
Для игр проверяйте управление, столкновения, производительность и совместимость с браузером.
Шаг
- Тестируйте поведение кэша
Когда стабильный контекст многократно повторно используется на нескольких шагах агента, модель с крайне низкой ценой при попадании в кэш становится ещё более ценной.
Шаг
- Сравнивайте первый проход и конечный успех
Модель, которой потребовалось три дешёвые попытки для успеха, может быть более выгодной, чем модель, которая сразу достигла успеха по высокой цене.
Когда повторные попытки медленные или рискованные, ситуация может быть обратной.
Часто задаваемые вопросы
Что такое DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 — это официальная пост-тренировочная версия младшей модели DeepSeek V4 с смешанными экспертами. Она заменяет предварительную версию, добавляет модуль спекулятивного декодирования DSpark и ориентирована на задачи кодирования и агентов, использующих инструменты.
Какова стоимость API DeepSeek V4 Flash?
Текущие стандартные цены DeepSeek: 0,0028 доллара за миллион входных токенов с попаданием в кэш, 0,14 доллара за миллион входных токенов без попадания в кэш и 0,28 доллара за миллион выходных токенов. Компания объявила, что будущая политика удвоит цены в указанные пиковые часы.
Действительно ли DeepSeek V4 Flash создал 3D-игру за 0,07 доллара?
Один разработчик сообщил, что один запуск Hermes Agent сгенерировал играбельный шутер от первого лица за 32 минуты при стоимости 0,07 доллара. Это пример из социальных сетей, а не стандартизированный бенчмарк, поэтому стоимость других задач может быть выше или ниже.
Сколько параметров у DeepSeek V4 Flash?
В техническом отчёте V4 указано, что общее количество параметров основной модели Flash составляет 284 миллиарда, при этом активируется 13 миллиардов параметров на токен. Полный репозиторий версии 0731 может показывать около 304 миллиардов параметров, поскольку включает дополнительный компонент спекулятивного декодирования DSpark.
Почему DeepSeek V4 Flash такой дешёвый?
Низкая стоимость обусловлена разреженной активацией смешанных экспертов, сжатым вниманием к длинному контексту, смешанной точностью FP4/FP8, кэшированием подсказок, спекулятивным декодированием и высококонкурентным обслуживанием. На каждый токен активируется лишь небольшая часть всех экспертов.
Превосходит ли DeepSeek V4 Flash Claude Opus 5 или GPT-5.6?
При текущих ценах API он значительно дешевле и показал конкурентоспособные результаты в нескольких демонстрациях сообщества. Opus 5 и GPT-5.6 могут по-прежнему обеспечивать более высокую надёжность первого прохода или качество в некоторых задачах, а вирусные сравнения не являются контролируемыми бенчмарками.
Можно ли запускать DeepSeek V4 Flash локально?
Да. DeepSeek опубликовала веса под лицензией MIT и предоставила инструкции по использованию с vLLM и SGLang. Полная модель чрезвычайно велика, поэтому реальное локальное развёртывание требует значительного объёма памяти ускорителей или агрессивных схем квантования сообщества.
Поддерживает ли V4 Flash Codex и API Responses?
Да. DeepSeek заявляет, что официальная версия Flash нативно поддерживает API Responses и адаптирована для использования в Codex. Текущий API V4 Pro пока не поддерживает API Responses.
Связанные инструменты
- DeepSeek API: официальная хостинговая конечная точка для DeepSeek V4 Flash и других поддерживаемых моделей.
- [DeepSeek V4 Flash
0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731): официальный репозиторий моделей, содержащий веса, бенчмарки, лицензию и руководства по развертыванию.
- vLLM: высокопроизводительный движок инференса, предоставляющий официальные рецепты для V4 Flash и DSpark.
- SGLang: фреймворк для обслуживания LLM со встроенной документированной поддержкой V4 Flash и DSpark.
- DeepSpec: репозиторий DeepSeek для исследований спекулятивного декодирования и методов DSpark.
- Codex: интеллектуальная среда кодирования, которая может подключаться к V4 Flash через совместимый интерфейс DeepSeek Responses API.
Связанные ссылки
- Официальные обновления DeepSeek V4 Flash: журнал обновлений от 31 июля, содержащий официальный статус выпуска, бенчмарки и область применения API.
- Модели и цены DeepSeek API: текущие цены на токены, длина контекста, ограничения вывода, количество одновременных запросов и уведомление о будущих ценах в пиковые часы.
- Технический отчет DeepSeek V4: основная статья, описывающая архитектуру MoE, внимание CSA/HCA, точность, обучение и контекст на миллион токенов.
- Карточка модели DeepSeek V4 Flash: официальная таблица бенчмарков 0731, чат-кодирование, конфигурация DSpark и лицензия MIT.
- Интеграция DeepSeek Codex: официальное руководство по использованию V4 Flash через Codex и Responses API.
- Статья Toolathlon: исследовательская работа, описывающая долгосрочный многоинструментальный бенчмарк, использованный в официальной оценке.
- Рецепт V4 Flash для vLLM: рекомендации по оборудованию и обслуживанию для развертывания V4 Flash.
Резюме
DeepSeek V4 Flash 0731 привлекла широкое внимание, поскольку разработчики сообщили, что смогли создать полноценные интерактивные демонстрации всего за несколько центов. Сообщается, что шутер от первого лица обошелся всего в 0,07 доллара, а другие сравнения в социальных сетях показали, что стоимость задач в десятки раз ниже, чем у Claude Opus 5 или GPT-5.6.
Эти примеры не являются контролируемыми бенчмарками, но официальные цены API подтверждают их основную мысль. V4 Flash взимает 0,14 доллара за миллион некешированных входных токенов и 0,28 доллара за миллион выходных токенов, а стоимость при попадании в кэш составляет поразительно низкие 0,0028 доллара.
Ее экономичность обусловлена всей системой: ядро MoE на 284B параметров с активацией 13B на токен, сжатое длинноконтекстное внимание, веса FP4/FP8, контекстное окно на миллион токенов, эффективные возможности обслуживания и спекулятивное декодирование DSpark. Обновление 0731 сохраняет архитектуру предварительной версии и улучшает поведение агентов за счет нового пост-обучения.
Наиболее убедительным официальным доказательством является улучшение бенчмарков. Terminal Bench 2.1 вырос с 61,8 до 82,7, Toolathlon-Verified — с 49,7 до 70,3, при этом модель сохранила ценовой уровень Flash.
Преимущество V4 Flash не в том, что она побеждает во всех сравнениях, — а в том, что ее крайне низкие предельные издержки делают
проведение повторяющихся агентных экспериментов практичным в масштабах, которые с трудом достижимы для многих моделей с передовым ценообразованием.



