Introdução
O DeepSeek V4 Flash 0731 entrou em versão beta pública com uma promessa familiar: capacidades mais fortes de codificação e agentes a preços de API extremamente baixos.
Os desenvolvedores rapidamente transformaram essa afirmação em experimentos práticos.
Um dos casos mais divulgados veio de uma execução do Hermes Agent, na qual o DeepSeek V4 Flash gerou um jogo de tiro 3D em primeira pessoa jogável com apenas um prompt inicial. O projeto levou 32 minutos e o custo de uso do modelo foi de apenas US$ 0,07.
Os resultados finais incluíram:
- Movimentação em primeira pessoa.
- Pulo.
- Tiro.
- Colisão física com o ambiente.
- Objetos de cobertura e alvos.
- Contador de munição na interface.

CSA e HCA reduzem o custo de contextos longos
O DeepSeek V4 suporta uma janela de contexto de 1 milhão de tokens.
Os sistemas de atenção tradicionais se tornam extremamente caros nessa escala, pois cada novo token pode precisar examinar uma grande quantidade de contexto anterior e manter um grande cache KV.
O relatório técnico do DeepSeek descreve um design de atenção híbrida, combinando:
- Atenção esparsa comprimida (CSA)
- Atenção altamente comprimida (HCA)
A estratégia geral é evitar computação de atenção completa e cara em todo o histórico a cada etapa.
O sistema comprime e filtra o contexto, permitindo que o modelo concentre a computação nas informações mais úteis.
O DeepSeek relatou que, em um contexto de 1 milhão de tokens, o V4 Pro precisa de:
27% dos FLOPs de inferência por token do DeepSeek V3.2.
- 10% da capacidade do cache KV.
Essas porcentagens exatas são relatadas no artigo técnico para o V4 Pro, não são dados de auditoria separados para o Flash.
O V4 Flash usa a mesma família de arquitetura, portanto se beneficia dos mesmos princípios de design de contexto longo.
Os efeitos práticos incluem a redução de:
- Memória do cache KV.
- Pressão de memória da GPU.
- Volume de movimentação de dados.
- Computação por token.
- Custo de serviço para contextos longos.
FP4 e FP8 reduzem armazenamento
e tráfego de memória
O modelo V4 Flash lançado usa pesos de precisão mista baixa.
A DeepSeek lista:
Precisão mista FP4 + FP8
A menor precisão reduz a quantidade de dados que precisam ser armazenados, carregados da memória, transferidos entre dispositivos e processados durante a inferência.
Isso é importante porque a inferência de modelos de linguagem modernos costuma ser limitada pela largura de banda da memória, não apenas pela capacidade bruta de operações aritméticas.
Se o hardware e o kernel forem projetados para executar esse formato com eficiência, representações menores de dados podem aumentar a taxa de transferência.
Baixa precisão não é gratuita por natureza.
Quantização ruim reduz a qualidade do modelo.
O lançamento da DeepSeek foi projetado e treinado em torno do esquema de precisão escolhido, não apenas dependendo de quantização comunitária posterior.
Arquitetura inalterada entre a versão de visualização e a 0731
A DeepSeek afirma que a versão oficial 0731 mantém a mesma arquitetura e escala do V4 Flash preview.
A empresa não realizou um pré-treinamento completo novamente para esta atualização.
Em vez disso, refez o processo de pós-treinamento.
O artigo original resume as mudanças como:
- Novo ajuste fino supervisionado.
- Novo aprendizado por reforço GRPO.
- Decodificação especulativa DSpark.
- Melhor comportamento de agente.
- Maior taxa de transferência de serviço.
O relatório técnico da DeepSeek descreve o processo de pós-treinamento mais amplo do V4 como:
- Desenvolvimento independente de módulos especialistas por domínio.
- Ajuste fino supervisionado e aprendizado por reforço com GRPO.
- Destilação de política on-policy.
- Integração das capacidades dos especialistas em um único modelo.
A atualização 0731 foca em melhorar essas capacidades em fluxos de trabalho reais de agentes.
DSpark acelera a geração de tokens
O DeepSeek-V4-Flash-0731 vem com o módulo de decodificação especulativa DSpark.
A decodificação especulativa usa um caminho de rascunho menor ou mais barato para propor múltiplos tokens futuros.
O modelo principal valida essas propostas em lote.
O fluxo simplificado é:
O módulo de rascunho propõe tokens
→ O modelo principal valida simultaneamente
→ Tokens aceitos são emitidos
→ Caminhos rejeitados são corrigidos
Quando as previsões do rascunho são precisas, o sistema pode gerar múltiplos tokens aceitos com menos inferência sequencial cara do modelo principal.
A DeepSeek oferece suporte ao DSpark tanto para vLLM quanto para SGLang.
Para vLLM, o cartão oficial do modelo usa:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Para SGLang, a opção correspondente é:
--speculative-algorithm DSPARK
A DeepSeek afirma que os pesos do modelo alvo e do modelo de rascunho estão armazenados no mesmo checkpoint, portanto o SGLang não precisa de um caminho separado para o modelo de rascunho.
A decodificação especulativa melhora principalmente a velocidade de serviço e a taxa de transferência.
Por si só, ela não explica os ganhos de capacidade de raciocínio do modelo.
Esses avanços vêm do processo de pós-treinamento atualizado.
O lançamento oficial melhora as pontuações em benchmarks de agentes
A DeepSeek relatou grandes avanços em vários testes focados em agentes em comparação com o V4 Flash preview.
| Benchmark | V4 Flash 0731 | V4 Flash preview | V4 Pro preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 |
12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

A DeepSeek afirma que os benchmarks públicos de agentes de código foram executados com a seguinte configuração:
Modo mínimo do DeepSeek Harness
reasoning_effort = max
top_p = 0.95
temperature = 1.0
Até o momento da atualização oficial, essa estrutura de testes ainda não havia sido publicada.
DSBench-FullStack e DSBench-Hard são benchmarks internos da DeepSeek.
Isso significa que suas pontuações podem servir como evidência de referência relatada pela empresa, mas não são verificáveis de forma independente como suítes de benchmark totalmente públicas.
O que medem o Terminal Bench e o Toolathlon
Terminal Bench 2.1
O Terminal Bench avalia a capacidade do agente de concluir tarefas em um ambiente de terminal.
O modelo pode precisar inspecionar arquivos, executar comandos, instalar dependências, depurar falhas, modificar código e verificar a conclusão.
Uma pontuação alta reflete o desempenho combinado do modelo, da estrutura do agente, da estratégia de ferramentas, do orçamento de raciocínio e do ambiente de execução.
Toolathlon-Verified
O Toolathlon avalia tarefas de longo ciclo em vários aplicativos e ferramentas de software.
O benchmark inclui cenários envolvendo calendário, sistemas de arquivos, Notion, WooCommerce, Kubernetes e BigQuery.
As tarefas exigem múltiplas interações com ferramentas e são validadas por avaliadores baseados em execução.
A pontuação de 70,3 relatada pela DeepSeek representa um grande avanço em relação ao modelo de visualização.
Mas isso não deve ser interpretado como uma garantia de 70,3% de sucesso em toda automação de negócios real.
Melhorias em benchmarks não garantem sucesso em um único prompt para cada jogo
O exemplo de jogo na fonte revela uma diferença importante entre desempenho em benchmarks e codificação criativa.
O V4 Flash teve desempenho forte nas avaliações oficiais de agentes, mas uma comparação de jogos ainda exigiu três iterações.
Benchmarks podem medir taxas de sucesso em conjuntos de tarefas bem definidos e regras de avaliação conhecidas.
Projetos criativos podem incluir requisitos visuais vagos, problemas de compatibilidade com navegadores, erros do motor de física, recursos ausentes, julgamentos subjetivos de qualidade e nenhuma suíte de testes única que defina sucesso.
Nesse cenário, modelos de baixo custo são especialmente úteis, pois o fluxo de trabalho pode tolerar múltiplas iterações.
Seu valor não está necessariamente em gerar perfeição na primeira tentativa.
Pode ser:
Qualidade aceitável
×
Grande número de tentativas acessíveis
Crie um site de apresentacao e gere leads em minutos
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
V4 Flash suporta múltiplos formatos de API
A DeepSeek disponibiliza seus modelos das seguintes formas:
- Interface Chat Completions compatível com OpenAI.
- API Responses compatível com OpenAI.
- API compatível com Anthropic.
- Saída em JSON.
- Chamada de ferramentas.
- Preenchimento de prefixo de chat.
- Preenchimento de intervalo no modo sem raciocínio.
A URL Base compatível com OpenAI é:
https://api.deepseek.com
A URL Base compatível com Anthropic é:
https://api.deepseek.com/anthropic
A DeepSeek afirma que o V4 Flash é atualmente o único modelo da API V4 que suporta a API Responses.
O suporte ao V4 Pro será planejado separadamente.
A compatibilidade com a API Responses também permite que o modelo seja usado no Codex por meio da configuração documentada da DeepSeek.
Modo de raciocínio ativado por padrão
O DeepSeek V4 Flash suporta modos de raciocínio e sem raciocínio.
O modo de raciocínio é o padrão.
Para inferência local, o cartão oficial do modelo suporta três níveis de esforço de raciocínio:
low
high
max
A DeepSeek recomenda:
temperature = 1.0
top_p = 0.95
para cenários de agentes.
Para os níveis de esforço de raciocínio high e max, a empresa recomenda permitir um comprimento máximo de saída de até 384 mil tokens.
Configurações de raciocínio mais altas podem melhorar o desempenho em tarefas difíceis, mas também podem aumentar a latência, o volume de saída, o custo da API e o tempo do ciclo do agente.
Sistemas de produção devem avaliar o nível de esforço mais baixo que atenda de forma confiável aos requisitos da tarefa.
Pesos publicados sob licença MIT
A DeepSeek publicou os pesos do V4 Flash 0731 no Hugging Face sob licença MIT.
Isso torna o modelo excepcionalmente permissivo em comparação com muitos lançamentos comerciais de grande porte.
Os desenvolvedores podem usar o repositório oficial do modelo com mecanismos suportados, incluindo:
- vLLM.
- SGLang.
- Transformers.
- Docker Model Runner.
- Versões quantizadas compatíveis com llama.cpp.
- Versões da comunidade compatíveis com LM Studio.
O modelo é bastante grande.
O modelo principal possui 284 bilhões de parâmetros, e o checkpoint 0731 inclui adicionalmente um componente DSpark.
Executá-lo em velocidades utilizáveis exige grandes quantidades de memória e recursos de hardware.
Os pesos poderem ser baixados não significa que o modelo completo funcione sem problemas em notebooks comuns de consumidor.
Versões quantizadas da comunidade podem reduzir os requisitos de memória, mas podem alterar a precisão, a taxa de transferência, a capacidade de contexto, o comportamento do DSpark e a confiabilidade da chamada de ferramentas.
O V4 Flash é sempre a opção com melhor custo-benefício?
As fontes concluem que o V4 Flash não produz os melhores resultados em todas as comparações, mas é difícil de superar em termos de custo-benefício.
Este é um resumo razoável dos exemplos, mas com uma ressalva importante:
O custo-benefício depende do fluxo de trabalho completo.
O V4 Flash é especialmente atraente quando:
- O volume de requisições é alto.
- Erros são fáceis de detectar.
- As tarefas podem ser repetidas automaticamente.
- O cache de contexto funciona bem.
- O custo de revisão humana é baixo.
- Código compacto é aceitável.
- A aplicação pode usar modelos de pesos abertos.
Em contrapartida, modelos frontier mais caros ainda podem ser mais econômicos no geral quando:
- Uma falha em uma tentativa causa grandes prejuízos.
- A confiabilidade na primeira tentativa é crucial.
- A tarefa exige conhecimento mais profundo.
- Agentes não podem repetir com segurança.
- O custo de revisão humana é alto.
- Modelos menores produzem saídas difíceis de manter.
A comparação correta não é:
preço por token
mas sim:
custo por tarefa bem-sucedida e validada
Como avaliar o V4 Flash para projetos reais
Etapa 1: Escolha tarefas representativas
Não teste apenas demonstrações cuidadosamente elaboradas.
Use tarefas compatíveis com a carga de trabalho de produção, incluindo cenários difíceis e complexos.
Etapa 2: Fixe o ambiente do agente
Mantenha consistência entre modelos em prompts, ferramentas, limites de tempo, estratégias de repetição, frameworks, sandboxes, suítes de teste e configurações de raciocínio.
Etapa 3: Registre o custo completo
Acompanhe entradas sem cache, entradas com cache, tokens de saída, chamadas de ferramentas, tentativas de repetição, tempo de execução, revisão humana e tentativas falhas.
Etapa 4: Meça a aceitabilidade, não apenas a semelhança visual
Para código, execute testes e verifique a manutenibilidade.
Para jogos, verifique controles, colisões, desempenho e compatibilidade com navegadores.
Etapa 5: Teste o comportamento do cache
Quando um contexto estável é reutilizado repetidamente em múltiplas etapas do agente, modelos com preços muito baixos em cache hits tornam-se mais valiosos.
Etapa 6: Compare a primeira tentativa com o sucesso final
Um modelo que só tem sucesso após três tentativas baratas pode ter melhor custo-benefício do que um que acerta de primeira a um preço alto.
Quando repetições são lentas ou arriscadas, o inverso também pode ocorrer.
Perguntas frequentes
O que é o DeepSeek V4 Flash 0731?
O DeepSeek V4 Flash 0731 é a versão pós-treinada oficial do modelo V4 de mistura de especialistas de menor escala da DeepSeek. Ele substitui a versão de pré-visualização, adiciona o módulo de decodificação especulativa DSpark e foca em tarefas de codificação e agentes de uso de ferramentas.
Qual é o custo da API do DeepSeek V4 Flash?
A DeepSeek atualmente divulgou os seguintes preços regulares: US$ 0,0028 por milhão de tokens de entrada com cache, US$ 0,14 por milhão de tokens de entrada sem cache e US$ 0,28 por milhão de tokens de saída. A empresa anunciou que futuras políticas dobrarão os preços em horários de pico determinados.
O DeepSeek V4 Flash realmente criou um jogo 3D por US$ 0,07?
Um desenvolvedor relatou que uma execução do Hermes Agent gerou um jogo de tiro em primeira pessoa jogável em 32 minutos a um custo de US$ 0,07. Isso é um estudo de caso de mídia social, não um benchmark padronizado, portanto os custos para outras tarefas podem ser maiores ou menores.
Quantos parâmetros o DeepSeek V4 Flash tem?
O relatório técnico do V4 lista um total de 284 bilhões de parâmetros para o modelo Flash principal, com 13 bilhões de parâmetros ativados por token. O repositório completo da versão 0731 pode exibir cerca de 304 bilhões de parâmetros, pois inclui o componente de decodificação especulativa DSpark que o acompanha.
Por que o DeepSeek V4 Flash é tão barato?
Seu baixo custo vem da ativação esparsa de especialistas, atenção de contexto longo comprimida, precisão mista FP4/FP8, cache de prompts, decodificação especulativa e serviço de alta concorrência. Apenas uma pequena fração dos especialistas totais é ativada por token.
O DeepSeek V4 Flash é superior ao Claude Opus 5 ou ao GPT-5.6?
Com os preços atuais de API, ele é muito mais barato e demonstrou competitividade em várias demonstrações da comunidade. Opus 5 e GPT-5.6 ainda podem oferecer maior confiabilidade ou qualidade na primeira tentativa em algumas tarefas, e as comparações virais não são benchmarks controlados.
O DeepSeek V4 Flash pode ser executado localmente?
Sim. A DeepSeek publicou os pesos sob licença MIT e fornece orientação de uso com vLLM e SGLang. O modelo completo é extremamente grande, portanto uma implantação local prática requer uma quantidade substancial de memória de aceleradores ou esquemas de quantização agressivos da comunidade.
O V4 Flash suporta Codex e a API Responses?
Sim. A DeepSeek afirma que a versão Flash oficial suporta nativamente a API Responses e foi adaptada para uso no Codex. A API atual do V4 Pro ainda não suporta a API Responses.
Ferramentas relacionadas
- DeepSeek API: endpoint hospedado oficial para o DeepSeek V4 Flash e outros modelos suportados.
- [DeepSeek V4 Flash
0731: repositório oficial do modelo, com pesos, benchmarks, licença e guia de implantação.
- vLLM: um mecanismo de inferência de alto rendimento, com receitas oficiais para V4 Flash e DSpark.
- SGLang: um framework de serviço LLM com suporte documentado integrado para V4 Flash e DSpark.
- DeepSpec: repositório de pesquisa de decodificação especulativa e métodos DSpark da DeepSeek.
- Codex: um ambiente de codificação inteligente que pode se conectar ao V4 Flash por meio da interface compatível com a Responses API da DeepSeek.
Links relacionados
- Atualização oficial do DeepSeek V4 Flash: registro de alterações de 31 de julho, com status oficial de lançamento, benchmarks e escopo da API.
- Modelos e preços da API DeepSeek: preços atuais por token, comprimento de contexto, limites de saída, concorrência e aviso de preços de pico futuros.
- Relatório técnico do DeepSeek V4: artigo principal descrevendo a arquitetura MoE, atenção CSA/HCA, precisão, treinamento e contexto de um milhão de tokens.
- Model card do DeepSeek V4 Flash: tabela oficial de benchmarks 0731, codificação de chat, configuração DSpark e licença MIT.
- Integração DeepSeek Codex: guia oficial para usar V4 Flash via Codex e Responses API.
- Artigo Toolathlon: artigo de pesquisa descrevendo o benchmark de múltiplas ferramentas de longa duração usado na avaliação oficial.
- Receita vLLM para V4 Flash: guia de hardware e serviço para implantação do V4 Flash.
Resumo
O DeepSeek V4 Flash 0731 atraiu ampla atenção porque desenvolvedores relataram que construíram demos interativas completas por apenas alguns centavos. Segundo relatos, um jogo de tiro em primeira pessoa custou apenas US$ 0,07, enquanto comparações em outras redes sociais mostraram custos de tarefas dezenas de vezes menores que o Claude Opus 5 ou o GPT-5.6.
Esses exemplos não são benchmarks controlados, mas os preços oficiais da API apoiam o ponto central. O V4 Flash cobra US$ 0,14 por milhão de tokens de entrada não armazenados em cache, US$ 0,28 por milhão de tokens de saída, e surpreendentes US$ 0,0028 para acertos de cache.
Sua economia decorre de todo o sistema: um núcleo MoE de 284B ativando 13B por token, atenção de contexto longo comprimida, pesos FP4/FP8, janela de contexto de um milhão de tokens, capacidade de serviço eficiente e decodificação especulativa DSpark. A atualização 0731 preserva a arquitetura de pré-visualização e melhora o comportamento do agente com novo pós-treinamento.
A evidência oficial mais forte está nos ganhos de benchmark. O Terminal Bench 2.1 subiu de 61,8 para 82,7, o Toolathlon-Verified de 49,7 para 70,3, mantendo o modelo no nível de preço Flash.
A vantagem do V4 Flash não é vencer todas as comparações — é seu custo marginal extremamente baixo que torna
viável na prática realizar experimentos de agente repetidamente em uma escala difícil de alcançar com muitos modelos de preço de ponta.



