For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/es/articles/deepseek-v4-pro-vs-grok-4.md.
El lanzamiento casi simultáneo de dos grandes modelos de IA ha puesto a DeepSeek V4 Pro y Grok 4.6 directamente en el centro de atención. De...

Dos modelos de IA de gran peso fueron lanzados casi al mismo tiempo, colocando directamente a DeepSeek V4 Pro y Grok 4.6 en el centro de atención.
DeepSeek V4 Pro logra un gran salto en rendimiento de agentes e ingeniería de software, mientras que Grok 4.6 irrumpe con fuerza en codificación, trabajo de conocimiento y capacidades integrales. El artículo original describe ambos lanzamientos como un desafío directo a los modelos de vanguardia actuales de OpenAI y Anthropic.
Lo que hace especialmente interesante esta comparación es que ambos modelos no solo se miden en tablas de referencia. Las primeras pruebas en el mundo real también les exigieron usar las mismas indicaciones para construir sitios web, crear juegos, replicar diseños visuales y generar experiencias 3D.
El resultado no fue tanto una competencia simple de ganador se lo lleva todo, sino un duelo parejo: cada modelo tiene su propio campo donde destaca.
El artículo original destaca múltiples resultados de referencia de DeepSeek V4 Pro.
En la evaluación de agentes de ciberseguridad CyberGym, se informa que DeepSeek V4 Pro obtuvo 83,3, superando por poco a Fable 5 con 83,1 y a Opus 4.8 con 78,3.
En AutomationBench, alcanzó 31,8, por delante de Fable 5 con 29,1 y Opus 4.8 con 27,2.
El resultado más reñido fue en Terminal-Bench 2.1. DeepSeek V4 Pro obtuvo 87,9, mientras que Opus 4.8 alcanzó 85,0 y Fable 5 logró 88,0.
El artículo original también reporta un resultado de 60,0 en la configuración con herramientas del Examen Final de la Humanidad, con Opus 4.8 en 57,9 y Fable 5 en 63,0.
DeepSWE también fue otra mejora significativa en el informe. DeepSeek V4 Pro alcanzó 62,7, un gran avance frente al 12,8 de la versión preliminar, superando los 58,0 reportados por Opus 4.8, aunque aún por debajo del 70,0 de Fable 5.
Grok 4.6, por su parte, fue probado en múltiples áreas frente a GPT-5.6 y Fable 5.
El artículo original reporta un índice de inteligencia integral de 61, un punto por detrás de Fable 5 con 62.
En CursorBench, se informa que Grok 4.6 obtuvo 69,9%, superando el 67,2% de GPT-5.6 y acercándose al 70,5% de Fable 5.
En FrontierCode, alcanzó 61,3%, también ligeramente por delante del 60,6% de GPT-5.6, pero detrás del 63,6% de Fable 5.
El artículo original muestra un desempeño más fuerte en trabajo de conocimiento. Se informa que Grok 4.6 ocupó el primer lugar en las tres evaluaciones clave: 1.753 Elo en GDPval-AA v2, 1.577 Elo en AA-Briefcase, y 15,8% en el benchmark legal profesional Harvey LAB.
La conclusión principal que el artículo original extrae de estos datos es directa: ambos modelos ya forman parte de la conversación junto a los sistemas de vanguardia líderes.
El rendimiento es solo la mitad de esta comparación.
El artículo original también destaca los costos de inferencia. Reporta los precios por millón de tokens de salida en el momento del lanzamiento:
| Modelo | Precio por millón de tokens de salida (según informe) |
|---|---|
| DeepSeek V4 Pro | $0,87 |
| Grok 4.6 | $6 |
| GPT-5.6 Sol | $30 |
| Claude Opus 5 | $25 |
| Fable 5 | $50 |
En su vista actual de precios en dólares, el precio por millón de tokens de entrada es de 0,435 dólares con caché no disponible y 0,003625 dólares con caché disponible.
La documentación de DeepSeek también señala que su modelo V4 soporta una ventana de contexto de 1 millón de tokens, llamadas a herramientas, y acceso API tanto en formato OpenAI como en formato Anthropic.
Los precios específicos de otros modelos cambian con el tiempo, por lo que las comparaciones de precios entre modelos en el artículo original deben considerarse como una instantánea de su fecha de publicación, no como una lista de precios válida a largo plazo.
La primera prueba práctica descrita en el artículo plantea una exigencia bastante alta para DeepSeek V4 Pro.
Con una sola indicación, el modelo generó una experiencia completa e interactiva de un globo terráqueo 3D en el navegador.
Según el informe, el resultado admite interacciones básicas como arrastrar, rotar y hacer zoom, e incluye flujos de datos globales, rutas dinámicas y marcadores geográficos distribuidos por todo el mundo.
Los detalles visuales van más allá. Dispersión atmosférica, nubes, iluminación día-noche y la interfaz circundante están incluidos en la experiencia generada.
El punto clave de esta prueba no es solo que el modelo generó una página web, sino que demuestra hasta dónde puede llegar un modelo de programación con IA cuando se le pide coordinar diseño visual, renderizado 3D, interacción y estructura de aplicación en una sola tarea.
A continuación, el artículo original compara ambos modelos utilizando indicaciones iguales o muy similares.
El creador de IA Xiangyang Qiaomu ejecutó primero tres tareas pequeñas con DeepSeek V4 Pro y luego entregó dos de esas mismas indicaciones a Grok 4.6.
La primera tarea requería que el modelo usara tres habilidades para desarrollar y desplegar un sitio web.
Según el informe, DeepSeek V4 Pro completó con éxito todo el flujo de trabajo. El artículo afirma que el diseño de la página y la integridad general fueron estables.
Este tipo de prueba es especialmente importante para la programación con agentes, ya que el modelo necesita coordinar múltiples herramientas o capacidades, no solo generar un fragmento de código.
La segunda tarea requería que el modelo reprodujera 60 estilos de diseño diferentes y los presentara como un conjunto de tarjetas Bento.
Según el informe, DeepSeek V4 Pro distinguió la tipografía, las combinaciones de colores y el diseño entre los diferentes estilos.
Cuando la misma indicación se entregó a Grok 4.6, este tomó la delantera. El artículo afirma que algunas de las páginas de Grok eran más maduras en diseño, color y jerarquía visual, con un resultado final más refinado.
La tercera tarea era crear desde cero un juego 3D de romper ladrillos.
DeepSeek V4 Pro generó un juego jugable con entorno 3D, música de fondo, efectos de sonido dinámicos y retroalimentación interactiva.
Grok 4.6 rindió a la par en esta ronda. El artículo describe los resultados de ambos como prácticamente empatados en calidad visual, integridad de escena y jugabilidad.
Una prueba más matizada proviene del desarrollador Jun Song, quien dio a DeepSeek V4 Pro y Grok 4.6 exactamente la misma indicación para construir desde cero un juego estilo Flappy Bird.
Ambos modelos adoptaron enfoques completamente diferentes.
DeepSeek V4 Pro usó más de 20.000 tokens, pero según el informe el costo de API fue de 0 dólares—porque el precio de API de ese modelo (durante la oferta por tiempo limitado de DeepSeek) hizo que tanto los tokens de entrada como los de salida fueran completamente gratuitos.
Grok 4.6 usó aproximadamente 5.000 tokens, con un costo reportado de 0,03 dólares.
Por lo tanto, en esta ejecución específica, Grok fue más eficiente en tokens, pero según el artículo original, DeepSeek produjo un resultado final más sólido.
Según el informe, la versión de DeepSeek incluía un fondo de montañas en capas, nubes, gradientes y tuberías con efecto tridimensional, así como animaciones de "+1" flotando cuando el personaje atraviesa las tuberías.
La conclusión del artículo original es valiosa: un menor consumo de tokens no significa automáticamente mejores resultados de aplicación, y un mayor consumo de tokens tampoco implica necesariamente mayores costos.
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
El desarrollador Hamza ejecutó otra prueba de generación de frontend, y el artículo original informa que DeepSeek V4 Pro volvió a ganar.
La página generada se describe como superior en integridad general y calidad visual
Resultados de Grok 4.6.
Esto refuerza el patrón observado anteriormente en las tareas: los dos modelos están muy cerca, pero sus fortalezas varían según la aplicación y el prompt específicos.
DeepSeek V4 Pro no ganó todas las pruebas de generación visual.
En una comparación que involucraba pelícanos, la versión V4 Pro supuestamente superó a la versión Flash en integridad visual general y generó una ilustración de elefante más atractiva, pero la dirección del movimiento del pelícano era incorrecta.
Es un pequeño ejemplo, pero resalta una limitación común de los sistemas de codificación generativa y visión: los resultados pueden verse refinados y aun así contener errores semánticos o de movimiento básicos.
El artículo fuente luego aumentó la dificultad, pidiendo a DeepSeek V4 Pro, GPT-5.6 Sol y Claude Opus 5 que generaran el mismo cerezo usando Three.js.
Esta vez, las diferencias fueron más marcadas.
El artículo informó que DeepSeek V4 Pro quedó por detrás de los otros dos modelos en detalles del tronco y las ramas, el follaje, la iluminación, la profundidad de campo y la atmósfera general.
Este resultado es importante porque evita que la comparación se convierta en una narrativa de victoria simple. DeepSeek V4 Pro puede ser muy potente en tareas de codificación de extremo a extremo, pero aún existen escenarios de generación visual especializados donde otros modelos frontera producen resultados más refinados.
Tras múltiples rondas de pruebas, la evaluación general del artículo fuente es que DeepSeek V4 Pro y Grok 4.6 han alcanzado un nivel competitivo similar.
Ninguno de los dos modelos puede ganar todas las tareas.
DeepSeek V4 Pro parece particularmente fuerte en ciertas tareas de codificación de extremo a extremo y construcción de aplicaciones, mientras que Grok 4.6 puede ser más eficiente en tokens y muestra ventajas en algunas comparaciones de diseño visual y trabajo de conocimiento.
Esto hace que esta comparación sea más útil que una puntuación única en un ranking. Para los desarrolladores, el mejor modelo puede depender de si la prioridad es calidad de código, fiabilidad de agentes, refinamiento visual, eficiencia de tokens o coste de API.
El artículo fuente describe el lanzamiento simultáneo de DeepSeek V4 Pro y Grok 4.6 como un momento inusual en el mercado de la IA.
La reacción de Rick De Oliveira, citada en el artículo,
La idea central del artículo original es que ambos modelos son potentes y asequibles al mismo tiempo.
Es esta combinación la que hace que sus lanzamientos sean tan destacados.
La documentación oficial de DeepSeek confirma que V4 Pro está diseñado para la invocación de herramientas, cargas de trabajo de contexto largo y modos de pensamiento y no pensamiento.
Los materiales oficiales de xAI sobre Grok posicionan de manera similar a su última generación de Grok en codificación, tareas de agentes y trabajo de conocimiento. Por ejemplo, el anuncio oficial de Grok 4.5 describe el modelo como construido específicamente para codificación, tareas de agentes y trabajo de conocimiento, e informa resultados de evaluaciones de ingeniería reales.
Incluso si los datos de puntos de referencia individuales varían, la tendencia más amplia es clara: la IA de nivel frontera se está volviendo cada vez más accesible para los desarrolladores, y la relación calidad-precio se está convirtiendo en una parte cada vez más importante de la competencia entre modelos.
El artículo fuente concluye señalando la dirección de la próxima ronda de competencia.
Menciona que xAI ya ha anticipado Grok 4.7, y se espera que OpenAI y Anthropic continúen respondiendo con sus propias actualizaciones de modelos.
Esto significa que los líderes actuales en puntos de referencia podrían no mantener su ventaja por mucho tiempo.
Para los desarrolladores, la lección más duradera es: evalúa los modelos según las tareas que realmente afectan a tu flujo de trabajo. Un modelo que obtiene una puntuación alta en puntos de referencia pero rinde mal en tu base de código, proceso de implementación, requisitos de interfaz o cadena de herramientas puede no ser la opción correcta.
DeepSeek V4 Pro es el modelo insignia de la serie V4 de DeepSeek, orientado a razonamiento, codificación, uso de herramientas y cargas de trabajo de contexto largo. La documentación oficial de DeepSeek enumera una ventana de contexto de 1 millón de tokens y soporte para invocación de herramientas, ofreciendo acceso a la API tanto en formato OpenAI como en formato Anthropic.
El artículo fuente informa que ambos modelos rinden de manera similar en varias pruebas de agentes y codificación, con victorias y derrotas para cada uno. DeepSeek V4 Pro destaca especialmente en varias pruebas de construcción de aplicaciones de extremo a extremo, mientras que Grok 4.6 muestra resultados sólidos en codificación, trabajo de conocimiento y algunas tareas de diseño visual.
Según la comparación del artículo fuente del 14 de agosto de 2026, DeepSeek V4 Pro reporta un precio de salida de 0,87 USD por millón de tokens, mientras que Grok 4.6 cuesta 6 USD. La página oficial de precios de DeepSeek actualmente confirma 0,87 USD por millón de tokens de salida para V4 Pro, aunque los precios de la API pueden variar.
El artículo fuente informa casos de prueba exitosos en los que DeepSeek V4 Pro generó una experiencia de globo terráqueo 3D, sitios web, una colección de diseños estilo Bento, un juego de rompebloques 3D y un juego estilo Flappy Bird. Estos son resultados de pruebas reales reportados, no una garantía de que cada prompt produzca una calidad equivalente.
Está diseñado específicamente para invocación de herramientas y cargas de trabajo de agentes, y el artículo fuente informa un rendimiento sólido en varias evaluaciones de agentes e ingeniería de software. La documentación oficial de DeepSeek también enumera el soporte de invocación de herramientas de V4 Pro.
No. El artículo fuente incluye pruebas en las que GPT-5.6 Sol y Claude Opus 5 lograron mejores resultados,
especialmente en la comparación de generación de cerezos con Three.js. Los resultados varían considerablemente según la tarea.
Los desarrolladores también deberían comparar el coste de API, la latencia, la longitud de contexto, la invocación de herramientas, la fiabilidad de codificación, la calidad de salida y el grado de ajuste del modelo con sus flujos de trabajo de agentes existentes. Para sistemas de producción, la consistencia y el coste total pueden ser más importantes que pequeñas diferencias en los puntos de referencia.
GitHub: la organización oficial de DeepSeek en GitHub.
DeepSeek V4 Pro y Grok 4.6 están impulsando simultáneamente la IA de vanguardia desde dos frentes: agentes del mundo real más potentes y rendimiento de codificación, junto con una relación precio-rendimiento más agresiva.
Las pruebas iniciales no arrojaron un ganador absoluto. DeepSeek V4 Pro mostró un rendimiento sólido en múltiples tareas de construcción de aplicaciones de extremo a extremo, mientras que Grok 4.6 demostró capacidades competitivas en codificación, trabajo de conocimiento y diseño visual.
El cambio más significativo es que los desarrolladores ahora tienen más modelos capaces para elegir sin tener que pagar automáticamente precios de nivel avanzado.
Empieza con una sola frase y obtén un sitio completo en minutos.