El Asistente Wenxin de Baidu ha alcanzado el primer lugar en otro benchmark de estilo agente. En la evaluación de producto XClaw de SuperCLU...

El Asistente Wenxin de Baidu ha obtenido el primer puesto en otro referente de estilo agente.
En la evaluación de producto XClaw de SuperCLUE de agosto de 2026, el Asistente Wenxin recibió una puntuación general de 97,62, la puntuación más alta en la instantánea publicada.
Sus puntuaciones por categoría fueron:
| Capacidad | Puntuación |
|---|---|
| Codificación | 90,28 |
| Creación de contenido | 99,44 |
| Procesamiento de datos | 98,86 |
| Análisis de investigación | 96,44 |
| Memoria | 100,00 |
El resultado llegó menos de tres semanas después de otra destacada actuación.
En una instantánea de julio de PinchBench v2, el agente de tareas de Baidu —presentado como Orion Mission Mode— registró una puntuación máxima del 94,6% y una puntuación media del 94,4%, situándose en lo más alto de esa instantánea de clasificación.
Los dos referentes son diferentes. SuperCLUE XClaw se centra en productos agente chinos y resultados prácticos en cinco dimensiones de capacidad. PinchBench v2, creado por Kilo, se basa en tareas reales de informática y automatización.
Juntos, apuntan al mismo cambio:
La evaluación de agentes está pasando de "¿Puede el modelo responder correctamente?" a "¿Puede el sistema completar el trabajo y entregar algo utilizable?"
Un modelo de lenguaje puede saber la respuesta y aun así fallar como agente porque olvida requisitos, elige la herramienta equivocada, maneja mal los archivos, se detiene a mitad de un flujo de trabajo o devuelve el artefacto incorrecto.
Eso hace que los últimos resultados de Wenxin traten más sobre la ejecución de tareas que sobre la inteligencia bruta del modelo de lenguaje.

SuperCLUE describe XClaw como una evaluación orientada a producto para asistentes de IA de estilo "Claw".
En lugar de depender principalmente de preguntas de opción múltiple, el referente enfatiza los entregables completados.
La instantánea de agosto de 2026 clasifica los productos líderes de la siguiente manera:
| Rango | Producto | Puntuación |
|---|---|---|
| 1 | Asistente Wenxin de Baidu | 97,62 |
| 2 | MiMoClaw | 96,74 |
| 3 | WorkBuddy | 96,61 |
| 4 | KimiClaw | 96,01 |
| 5 | MaxClaw | 94,79 |
El referente evalúa cinco dimensiones:
La lógica básica es sencilla: el agente recibe una tarea y debe producir un artefacto o resultado final que pueda evaluarse realmente.
Eso hace que el seguimiento de instrucciones, el manejo de archivos, el uso de herramientas y la ejecución de largo alcance formen parte de la puntuación.

Esto muestra la diferencia entre el trabajo de chat y el de agente.
Un modelo de chat podría escribir el plan dentro de la conversación.
Un flujo de trabajo de agente puede hacer esto:
Leer archivo fuente
→ extraer información estructurada
→ redactar contenido
→ formatear documento de Word
→ validar salida
→ devolver un archivo
El artefacto, no la respuesta en prosa, se convierte en el producto final.
Wenxin obtuvo 99.44 en creación de contenido.
En un punto de referencia de agentes, la creación de contenido no es simplemente escritura creativa.
El sistema puede necesitar satisfacer múltiples restricciones a la vez:
Un borrador puede ser gramaticalmente correcto y aun así fallar porque
ignora el formato solicitado.
Por eso los benchmarks de productos puntúan cada vez más la finalización en lugar de solo la calidad lingüística.
La categoría más baja de XClaw para Wenxin fue codificación, con 90.28.
Sigue siendo una puntuación sólida, pero la brecha en comparación con la creación de contenido y el procesamiento de datos es reveladora.
Los agentes de codificación deben gestionar un bucle operativo más amplio:
Entender el requisito
→ elegir la pila tecnológica
→ escribir archivos
→ ejecutar o previsualizar
→ inspeccionar errores
→ corregir
→ verificar la interacción
→ empaquetar el resultado
El editor de la fuente probó el producto con una solicitud de una sola frase para un simulador de sistema solar en 3D.
El flujo de trabajo informado utilizó Three.js y devolvió una aplicación HTML de un solo archivo de 31 KB.
El artículo también muestra una página didáctica de simulación meteorológica generada mediante un flujo de trabajo web interactivo similar.
Estos son demos ilustrativos, no elementos oficiales del benchmark XClaw.

Wenxin obtuvo 96.44 en análisis de investigación.
Una tarea de investigación seria puede implicar:
El artículo fuente describe dos casos de prueba.
El editor pidió a Wenxin que investigara la conjetura tridimensional de Kakeya en el contexto de la medallista Fields Hong Wang.
El comportamiento informado del agente fue:

La cantidad de fuentes no es por sí sola una métrica de calidad.
Lo que importa es si el agente final utiliza fuentes autorizadas, atribuye correctamente las afirmaciones, resuelve conflictos, evita datos desactualizados y separa los hechos de la interpretación.
El editor también pidió a Wenxin que analizara las capacidades y los precios de los principales modelos nacionales e internacionales del mes anterior.
El artículo dice que el agente:

El ciclo de investigación útil es:
Buscar
→ identificar incertidumbre
→ buscar de nuevo
→ comparar fuentes
→ resolver o marcar discrepancia
→ escribir
Esa pasada de verificación adicional es a menudo donde mejora la calidad de la investigación.
El resultado de SuperCLUE siguió a un primer lugar en julio en PinchBench v2.
PinchBench fue creado por Kilo para evaluar agentes en flujos de trabajo del mundo real en lugar de puntos de referencia tradicionales de preguntas y respuestas.
El lanzamiento de PinchBench 2.0 de Kilo amplió el punto de referencia a 148 tareas y añadió reglas más estrictas de calificación y clasificación.
En la instantánea de la clasificación de julio reproducida por el artículo fuente, el sistema de Baidu aparecía como:
Orion-Mission-Mode
con:
Mejor puntuación: 94,6%
Puntuación media: 94,4%

La captura de pantalla sitúa a Orion Mission Mode por delante de sistemas basados en modelos de Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI y otros en esa instantánea concreta.
La palabra importante es instantánea.
Las clasificaciones de agentes cambian rápidamente.
Los modelos, los entornos de evaluación, los prompts, las políticas de herramientas y los envíos a los puntos de referencia pueden actualizarse.
Por lo tanto, un primer lugar en julio debe citarse con su fecha en lugar de tratarse como una clasificación global permanente.
Kilo describe PinchBench 2.0 como un punto de referencia de flujos de trabajo de agentes del mundo real.
Contiene tareas que requieren que un sistema utilice herramientas y complete operaciones en lugar de simplemente seleccionar una respuesta.
El punto de referencia cubre categorías como:
El artículo fuente dice que 59 entradas de modelos o agentes estaban representadas en la instantánea de la clasificación.
Esa cifra puede cambiar a medida que se añaden o actualizan envíos.
El punto de referencia en sí es más estable que la población de la clasificación.
El lanzamiento oficial de PinchBench 2.0 describe:
148 tareas
La fuente y varios informes de julio describen la evaluación de Wenxin en 147 tareas completadas, mientras que también describen PinchBench como un punto de referencia de 148 tareas.
La interpretación más segura es:
PinchBench v2 contiene 148 tareas; la evaluación reportada de Orion Mission Mode puede haber producido resultados puntuados en 147 de ellas en esa instantánea.
Esta distinción importa porque los informes de puntos de referencia a menudo mezclan el tamaño del punto de referencia con el número de tareas completadas con éxito.
ejecuciones completadas.
La fuente enfatiza que el Modo Misión Orion registró:
94.6% mejor puntuación
94.4% puntuación promedio
La diferencia de 0.2 puntos es pequeña.
Eso sugiere una baja variación entre las ejecuciones reportadas.
Sin embargo, no debe interpretarse como una garantía universal de estabilidad.
La variación del benchmark puede depender de:
La lección práctica es simplemente que la ejecución reportada de PinchBench no se basó en un único resultado afortunado y aislado.
Su promedio se mantuvo cercano a su mejor puntuación.
Uno de los puntos más importantes del artículo fuente es que el benchmark evalúa un producto o sistema de agente, no un modelo de lenguaje desnudo.
El agente de tareas puede combinar:
Esto puede expresarse como:
Resultado del agente
=
capacidad del modelo
+
herramientas
+
memoria
+
planificación
+
búsqueda
+
entorno de ejecución
+
verificación
Por eso hay que tener cuidado al decir:
“El modelo X superó al modelo Y.”
La tabla de clasificación puede estar comparando en realidad dos sistemas de agente diferentes que usan distintas herramientas y orquestación.
Una descripción más precisa es:
“El sistema de agente X obtuvo una puntuación superior al sistema de agente Y bajo esta configuración de benchmark.”
Esa redacción se vuelve cada vez más importante a medida que los productos de IA se transforman en sistemas de software complejos.
El artículo fuente presenta 2026 como el año en que el estándar para un producto de IA útil está cambiando.
La interacción anterior se veía así:
El usuario pregunta
→ el modelo responde
→ el usuario realiza el trabajo
El patrón emergente de agente se ve así:
El usuario da un objetivo
→ el agente planifica
→ el agente recopila contexto
→ el agente llama a herramientas
→ el agente crea archivos
→ el agente verifica resultados
→ el agente entrega el artefacto
Esto cambia lo que los usuarios notan.
Un modelo puede ser extremadamente conocedor pero frustrante si no puede:
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
La nueva condición de éxito se acerca más a:
¿La tarea realmente se completó?
que a:
¿La respuesta fue impresionante?
El artículo de BAAI muestra la opción “Tarea” directamente dentro de la interfaz de Wenxin.

El sitio web oficial de Wenxin de Baidu describe el producto como un asistente de IA multimodal para:
Uso entre dispositivos.
La aplicación de Baidu también lista Asistente Wenxin como una función de IA integrada para investigación profunda, búsqueda, redacción, generación de imágenes, generación de video y asistencia conversacional.
Esto confirma que la IA orientada a tareas ha llegado a las superficies de consumo principales de Baidu, en lugar de permanecer como un experimento solo para desarrolladores.
El artículo fuente destaca repetidamente un punto comercial:
Asistente Wenxin es gratuito y no tiene muro de pago.
Las páginas oficiales de Wenxin de Baidu ofrecen actualmente acceso gratuito o experiencia gratuita.
Eso es fácil de verificar.
La afirmación más fuerte —permanentemente ilimitado para cada función de agente de tareas— es más difícil de verificar a partir de una página de política oficial estable.
Los productos de IA pueden introducir:
Para publicación, la redacción más segura es:
Asistente Wenxin está actualmente disponible para usuarios individuales con opciones de acceso gratuito, y la experiencia de tareas mostrada en el artículo fuente no requirió una suscripción de pago.
No construyas una comparación de costos a largo plazo en torno a "ilimitado para siempre" a menos que Baidu publique una política específica que lo garantice.
La sección final del artículo fuente argumenta que el historial de búsqueda de Baidu le da una ventaja estructural en el diseño de agentes.
Hay una analogía real.
Un motor de búsqueda maneja algo como:
Consulta del usuario
→ comprensión de intención
→ descomposición de consulta
→ recuperación
→ clasificación
→ agregación de resultados
→ respuesta
Un agente maneja:
Objetivo del usuario
→ comprensión de intención
→ descomposición de tarea
→ selección de herramientas
→ ejecución
→ agregación de resultados
→ entrega
Los dos pipelines no son idénticos.
Un agente tiene un espacio de acción mucho más grande y conlleva un mayor riesgo de ejecución.
Pero varias capacidades técnicas se transfieren de forma natural:
Esto es especialmente relevante para los agentes de investigación.
Un sistema que ya tiene una infraestructura de búsqueda sólida puede construir flujos de trabajo más profundos sobre ella.
Considera una solicitud de búsqueda tradicional:
Encuentra el vuelo más barato de Pekín a Shanghái.
Un sistema de búsqueda puede necesitar inferir:
A un agente se le pide:
Encuentra el vuelo Pekín–Shanghái más barato y prepara un itinerario.
puede necesitar agregar:
La primera mitad del problema se parece a la búsqueda.
La segunda mitad es orquestación de acciones.
La experiencia de búsqueda proporciona componentes útiles, pero la calidad del agente aún depende de la capa de ejecución.
La fuente también conecta la puntuación de memoria de Wenxin con la experiencia de Baidu en la comprensión de sesiones de búsqueda.
Hay
cierta superposición conceptual.
Ambos sistemas necesitan inferir qué información de interacciones anteriores sigue siendo relevante.
Una sesión de búsqueda puede contener:
Consulta 1: coches eléctricos
Consulta 2: autonomía superior a 600 km
Consulta 3: menos de 250 000 RMB
El sistema debería entender que la tercera consulta sigue tratando sobre coches eléctricos.
Un sistema de memoria de agente tiene una tarea más difícil.
Puede necesitar recordar:
La experiencia en sesiones de búsqueda es útil, pero la memoria persistente del agente requiere mecanismos adicionales de almacenamiento, recuperación, privacidad y relevancia.
Entre las cinco categorías de XClaw, el análisis de investigación es el lugar más claro donde la experiencia de búsqueda de Baidu puede transferirse directamente.
Un agente de investigación necesita:
La documentación oficial de Qianfan AI Assistant de Baidu también describe una solución de agente empresarial que integra Búsqueda de Baidu, Baidu Baike, búsqueda de imágenes, gestión de conversaciones, gestión de memoria y capacidades documentales.
Eso no demuestra que el producto de consumo Wenxin utilice exactamente la misma implementación.
Sí demuestra que Baidu está construyendo una pila de agente común en torno a búsqueda, memoria, herramientas y recuperación multimodal en toda su cartera de productos.
Las puntuaciones altas en los puntos de referencia son evidencia útil.
No son la evaluación completa.
Las tablas de clasificación cambian.
Los nuevos modelos y nuevos envíos de agentes pueden superar al líder actual.
XClaw agrega tareas y categorías seleccionadas.
El flujo de trabajo real de un usuario puede ser muy diferente.
La puntuación pertenece al asistente completo o a la pila del agente.
Un agente que puede completar tareas de manera eficiente aún puede realizar llamadas de herramientas inseguras o exponer información sensible en un entorno diferente.
Los agentes de investigación pueden citar fuentes débiles o malinterpretar datos cambiantes.
Los precios y las cuotas de los productos son políticas comerciales, no propiedades de los puntos de referencia.
Una prueba personal útil debería parecerse a su trabajo real.
No haga solo preguntas triviales.
Dé al agente una tarea completa.
Proporcione cinco restricciones al inicio de una conversación larga.
Después de varios turnos no relacionados, pida un artefacto final y verifique si las cinco se conservan.
Cargue:
Pida al agente que los combine en un solo informe.
Verifique cada valor numérico de forma independiente.
Elija un tema con información cambiante.
Requiera:
Creación
Solicite un artefacto en Word, PowerPoint, hoja de cálculo o HTML.
Evalúe:
Solicite una pequeña aplicación interactiva.
Verifique:
Asigne una tarea que requiera varias herramientas.
Observe si el sistema:
Al comparar Wenxin con otros agentes, utilice una tabla más amplia que la "puntuación de referencia".
| Dimensión | Qué medir |
|---|---|
| Éxito de la tarea | ¿Se completó el trabajo solicitado? |
| Memoria | ¿Se conservaron las restricciones anteriores? |
| Precisión | ¿Son correctos los números y las afirmaciones? |
| Calidad de la investigación | ¿Son las fuentes autorizadas y actuales? |
| Fiabilidad de las herramientas | ¿Las llamadas a herramientas tienen éxito de manera constante? |
| Calidad del artefacto | ¿Los archivos son utilizables sin reparación manual? |
| Recuperación | ¿Puede el agente corregir pasos fallidos? |
| Latencia | ¿Cuánto tiempo tarda una tarea completa? |
| Costo | ¿Cuánto cuesta un resultado aceptado? |
| Privacidad | ¿Cómo se manejan los archivos cargados y la memoria? |
| Disponibilidad | ¿Las funciones clave son gratuitas, con límite de cuota o de pago? |
Esto ofrece una imagen más realista que una sola posición en una clasificación.
El punto más fuerte del artículo original es más amplio que Baidu.
La competencia de agentes está cambiando la definición de calidad de la IA.
Para la primera generación de chatbots, los usuarios se centraban en la calidad de las respuestas.
Para los agentes de tareas actuales, las preguntas clave están pasando a ser:
Por eso, puntos de referencia como XClaw y PinchBench están atrayendo atención.
Acercan la evaluación al trabajo de producción real.
Todavía hay una larga distancia entre un punto de referencia y un despliegue empresarial.
Pero la dirección es útil:
Punto de referencia de conocimiento
→ punto de referencia de razonamiento
→ punto de referencia de uso de herramientas
→ punto de referencia de tareas de extremo a extremo
→ resultado de producción real
El último paso es, en última instancia, el que importa.
La instantánea de agosto de 2026 de SuperCLUE XClaw otorga al Asistente de Wenxin una puntuación general de 97,62, ubicándolo en primer lugar entre los productos mostrados. Sus puntuaciones por categoría fueron 90,28 en codificación, 99,44 en creación de contenido, 98,86 en procesamiento de datos, 96,44 en análisis de investigación y 100 en memoria.
Significa que Wenxin recibió la puntuación máxima en las tareas de memoria incluidas en esa evaluación de XClaw. No significa que el asistente nunca pueda olvidar el contexto en cualquier conversación posible del mundo real.
PinchBench v2 es un punto de referencia de agentes creado por Kilo que evalúa sistemas en tareas informáticas y de flujo de trabajo del mundo real. La versión 2.0 contiene 148 tareas y está diseñada para medir
ejecución de extremo a extremo en lugar de simples respuestas a preguntas.
En una captura de la clasificación de julio de 2026, el agente de tareas de Baidu apareció como Orion Mission Mode con una mejor puntuación del 94.6% y una puntuación media del 94.4%. Las clasificaciones cambian con el tiempo, por lo que debe incluirse la fecha de la captura al citar el resultado.
Las páginas oficiales de Wenxin de Baidu ofrecen actualmente opciones de acceso gratuito o experiencia gratuita, y el artículo fuente indica que las funciones de tareas demostradas estaban disponibles sin suscripción de pago. No se encontró una garantía oficial estable de uso ilimitado permanente para todas las funciones, por lo que las cuotas actuales deben verificarse directamente en el producto.
El artículo fuente muestra sesiones de prueba en las que Wenxin generó un plan de negocio formateado en Word y páginas HTML interactivas. Estos ejemplos demuestran el flujo de trabajo de tareas del producto, pero no garantizan que cada instrucción o entorno produzca el mismo resultado.
La búsqueda y los agentes comparten capacidades como la comprensión de intenciones, la descomposición de consultas, la recuperación, la clasificación, la agregación de fuentes y el contexto de sesión. Los agentes añaden una capa de ejecución más amplia, que incluye llamadas a herramientas, creación de archivos, memoria, planificación y acción.
No en el sentido estricto. Evalúan sistemas de productos o agentes que pueden combinar modelos con herramientas, memoria, búsqueda, instrucciones, orquestación y entornos de ejecución. Por lo tanto, sus puntuaciones deben atribuirse a la configuración completa del agente.
Evaluación](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): La página de referencia del artículo original.
El Asistente Wenxin de Baidu ocupó el primer lugar en la instantánea de XClaw de SuperCLUE de agosto de 2026 con 97,62 puntos, incluida una puntuación perfecta de 100 en memoria y puntuaciones superiores a 96 en procesamiento de datos, creación de contenido y análisis de investigación.
Ese resultado sigue a la instantánea de la tabla de clasificación de PinchBench v2 de julio, en la que el Modo Misión Orión de Baidu registró una mejor puntuación del 94,6% y una puntuación media del 94,4%. Los puntos de referencia utilizan tareas diferentes, pero ambos enfatizan la finalización real de tareas en lugar de simplemente responder preguntas.
La conclusión más importante no es que un asistente haya "ganado" permanentemente la carrera de agentes. Las clasificaciones de agentes cambian rápidamente, y los sistemas evaluados incluyen modelos, herramientas, búsqueda, memoria, indicaciones y orquestación.
Lo que demuestran ambos resultados es que la evaluación de IA avanza hacia un estándar más práctico: no si el modelo suena inteligente, sino si el agente puede completar el trabajo y devolver un resultado utilizable.
Empieza con una sola frase y obtén un sitio completo en minutos.