En la Conferencia Mundial de Inteligencia Artificial de 2026, las empresas de modelos llenan los pabellones con la cantidad de parámetros, m...

En la exposición WAIC 2026, las empresas de modelos llenan los pabellones con la cantidad de parámetros, mientras que los proveedores de infraestructura muestran sus crecientes clústeres de computación. Sin embargo, el protagonista del stand de Qingcheng Intelligence no es un modelo único ni un servidor.
Sino un diagrama completo que muestra cómo los Tokens son producidos, enrutados, distribuidos, medidos y gobernados a lo largo del ciclo de vida completo de un Agente de IA.
Qingcheng Intelligence denomina a este modelo "Fábrica y Tienda" de Tokens. Este marco integra tres capas:
La compañía describe su arquitectura como el sistema eléctrico de la era de la inteligencia artificial. El hardware de cómputo y el software de inferencia actúan como plantas generadoras, AI Ping desempeña el papel de la red eléctrica, y las herramientas de Agentes son los dispositivos que consumen electricidad.
El stand de Qingcheng Intelligence muestra el flujo de trabajo completo de producción, enrutamiento y gobernanza de Tokens.
Según el informe original, este sistema está diseñado para resolver tres problemas recurrentes: la inestabilidad de las API de modelos, la baja utilización de aceleradores heterogéneos nacionales y la falta de una contabilidad clara de Tokens en implementaciones a gran escala de Agentes.
A medida que los Agentes de IA pasan de la fase de demostración a entornos de producción, una sola solicitud de usuario puede desencadenar múltiples invocaciones de modelos.
Un Agente puede necesitar recuperar archivos, buscar en bases de datos, invocar herramientas, generar código, evaluar resultados, revisar planes y luego invocar a otro Agente. El usuario solo ve la respuesta final. Detrás de escena, el sistema puede consumir una gran cantidad de Tokens a través de múltiples servicios.
El artículo original señala tres problemas principales de infraestructura que se agravan a medida que los flujos de trabajo se expanden.
La capacidad de las API de modelos puede fluctuar durante los picos de demanda.
Una misma solicitud puede responder rápidamente en un momento y volverse lenta o no disponible en otro. En escenarios de charla informal, una breve demora puede ser aceptable, pero en flujos de trabajo de múltiples pasos donde cada acción depende de la respuesta anterior, esta latencia puede interrumpir el proceso.
Por lo tanto, los sistemas empresariales necesitan más que simplemente acceder a un modelo. Necesitan latencia predecible, rendimiento, confiabilidad y calidad de salida.
Muchas instituciones han adquirido una mezcla de GPU, NPU y servidores de computación inteligente nacionales. El hardware puede estar listo, pero implementar modelos grandes de manera eficiente en ellos sigue siendo un desafío.
Marcos de inferencia populares como vLLM fueron inicialmente optimizados para NVIDIA y el ecosistema CUDA. Aunque admiten cada vez más dispositivos, adaptar cada función y optimización a diferentes arquitecturas de aceleradores requiere un esfuerzo de ingeniería considerable.
Qingcheng Intelligence cree que los motores de inferencia nativos y las pilas de software con conciencia de hardware pueden extraer más salida utilizable de Tokens de estos clústeres.
Cuando una empresa opera múltiples Agentes, la factura mensual de modelos no siempre muestra qué flujo de trabajo generó los costos.
Un solo Agente puede invocar múltiples modelos, usar
múltiples proveedores, iniciar subagentes y ejecutarse durante horas. Sin un seguimiento detallado, las organizaciones pueden tener dificultades para responder preguntas básicas:
Qingcheng Intelligence posiciona su arquitectura de tres capas como una infraestructura integrada que conecta producción, distribución, aplicación y facturación.

El plano de la exposición describe el flujo de trabajo desde la computación subyacente hasta las aplicaciones de Agentes.
La arquitectura se construye en torno a una analogía industrial simple.
La fábrica trasera transforma el hardware de computación en Tokens. La tienda agrega y enruta los servicios de Tokens. Los nodos de aplicación distribuyen Agentes y controlan cómo se consumen los Tokens.
La arquitectura de Qingcheng Intelligence conecta la producción de Tokens, el enrutamiento de servicios y la gobernanza de Agentes.
Estas tres capas están diseñadas para trabajar juntas, no como productos aislados.
La fábrica trasera se encarga de convertir los recursos de cómputo físico en capacidades de inferencia de modelos estandarizadas.
Sus componentes principales incluyen:
Qingcheng Intelligence compara esta capa con una planta de energía. Su objetivo es generar la mayor cantidad posible de Tokens estables y utilizables a partir del hardware disponible, reduciendo al mismo tiempo la complejidad de la implementación.
Chitu es el marco de inferencia de alto rendimiento de código abierto de Qingcheng Intelligence.
El repositorio oficial lo describe como un motor orientado a la producción, centrado en la eficiencia, flexibilidad y usabilidad. Admite implementaciones desde CPU y un solo acelerador hasta clústeres a gran escala, y está optimizado para múltiples plataformas de hardware nacionales.
El proyecto también admite modelos como DeepSeek, Qwen, GLM y Kimi, así como la interfaz HTTP estándar compatible con OpenAI.

Chitu se utiliza para mejorar la capacidad de inferencia de modelos grandes en plataformas de computación heterogéneas.
Qingcheng Intelligence cree que adaptar un marco diseñado para un ecosistema de hardware único puede ser como usar la herramienta equivocada. La analogía de la compañía es: un horno diseñado para tostar pan puede modificarse para...
cocinar al vapor, pero una vaporera especializada puede aprovechar más eficientemente el calor existente.
Aunque la comparación es simplificada, los desafíos de ingeniería subyacentes son reales. Las arquitecturas de aceleradores difieren en memoria, comunicación, operadores, formatos numéricos, compilación y comportamiento de programación.
Chitu incluye optimizaciones específicas de hardware y soporte para inferencia de baja precisión, incluidas configuraciones FP4 y FP8.
El informe original indica que implementar el modelo DeepSeek con FP4 reduce el hardware necesario de cuatro máquinas a una.
En esta configuración específica, reducir de cuatro máquinas a una significa una disminución del 75% en el número de máquinas necesarias. El artículo traduce esta reducción en un ahorro de costos del 75%.
El informe atribuye la implementación de DeepSeek de cuatro máquinas a una a la optimización FP4.
Este resultado no debe interpretarse como una garantía de una reducción universal del 75% en los costos para todas las implementaciones de DeepSeek.
El ahorro real depende de los siguientes factores:
El código abierto de Chitu
El repositorio también señala que los resultados de rendimiento pueden variar según el hardware, el software y la carga de prueba.
Bagua Furnace es la pila de software de Qingcheng.ai para el entrenamiento, inferencia, despliegue, programación y operación de modelos.
La empresa lo presenta como una forma de empaquetar el complejo trabajo de infraestructura en una plataforma empresarial más manejable.
Bagua Furnace se sitúa sobre hardware heterogéneo, proporcionando herramientas de despliegue y operación.
Bagua Furnace está diseñado para reducir la carga de trabajo manual en los siguientes aspectos:
Qingcheng.ai también ha colaborado con Inspur Information para lanzar el YuanNao Bagua Furnace All-in-One optimizado conjuntamente. En una prueba publicada con Qwen3-32B, los socios informaron que, tras la optimización con Chitu, el rendimiento total de inferencia aumentó hasta 14.45 veces, y después de la optimización integral de la pila completa, el rendimiento de extremo a extremo mejoró aproximadamente 10 veces.
Estos datos provienen del entorno de pruebas de la propia empresa colaboradora y no son equivalentes al caso de DeepSeek FP4 descrito en la WAIC.
La capa del backend de fábrica está diseñada para gestionar múltiples tipos de aceleradores.
Una de las estrategias mencionadas en el informe original es
separar las cargas de trabajo de prellenado y decodificación.
En la fase de prellenado, el sistema procesa las indicaciones de entrada y construye la caché interna del modelo. En la fase de decodificación, el sistema genera los tokens de salida paso a paso. Estas dos fases difieren en sus características de memoria, ancho de banda y cómputo.
Un clúster heterogéneo puede asignar cada fase al hardware que la maneje de manera más eficiente. Esta práctica a veces se denomina "separación de prellenado y decodificación".
El objetivo no es que todos los aceleradores se comporten de manera uniforme, sino que diferentes hardwares manejen las partes de la carga de trabajo que mejor se adaptan a sus fortalezas.
Una vez que se generan los tokens, las aplicaciones aún necesitan una forma estable de obtenerlos.
La capa intermedia es AI Ping, la plataforma de evaluación de servicios de modelos y enrutamiento de API de Qingcheng Zhiyun.
AI Ping monitorea continuamente los servicios de modelos y proporciona una interfaz unificada sobre múltiples proveedores de servicios.

AI Ping evalúa las API de modelos y enruta las solicitudes entre proveedores de servicios.
El informe original señala que AI Ping monitorea lo siguiente:
La plataforma está diseñada para reducir la necesidad de que los desarrolladores creen cuentas, gestionen diferentes formatos de API y comparen manualmente entre proveedores.
Los usuarios pueden priorizar objetivos, como por ejemplo:
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
Si no se especifica una preferencia, AI Ping puede utilizar su lógica de enrutamiento para seleccionar un servicio disponible.
La integración estática enviaría cada solicitud al mismo proveedor hasta que el desarrollador cambie la configuración.
El enrutamiento dinámico es diferente. Si un proveedor se vuelve lento o no está disponible, la capa de enrutamiento puede dirigir las solicitudes posteriores a otros servicios que tengan un mejor rendimiento en ese momento.
Esto es útil para cargas de trabajo de agentes, ya que una interrupción puede provocar el fracaso de tareas largas.
El ciclo de retroalimentación previsto para la plataforma es el siguiente:
Qingcheng Zhiyun afirma que la API unificada permite a equipos más pequeños acceder a capacidades de enrutamiento y monitoreo que normalmente requerirían un equipo de plataforma interno.
La empresa reportó por separado las mejoras promedio en costo, rendimiento y latencia logradas a través de AI Ping. Estos porcentajes son resultados publicados por la plataforma; los resultados reales variarán según el modelo, proveedor, patrón de tráfico y estrategia de enrutamiento seleccionados.
La capa final se centra en cómo los agentes...
distribuyen sus tokens y las reglas de gobernanza de uso.
El sistema consta de dos componentes principales:
La Tienda de Agentes se posiciona como una capa de distribución y reutilización para agentes de uso general y específicos de la industria.
Su valor fundamental reside en conectar a los desarrolladores de agentes con las organizaciones que necesitan flujos de trabajo implementables, al mismo tiempo que permite que estos agentes accedan a una infraestructura de tokens más amplia.
El informe original la compara con un mercado de electrodomésticos conectados a una red eléctrica compartida. Al momento de redactar este documento, la documentación pública sobre la estrategia de precios, los criterios de revisión, los formatos de implementación y los términos comerciales de la Tienda de Agentes sigue siendo muy limitada.
ATM significa Administrador de Tokens de Agentes.
Qingcheng Technology lo presentó en la Conferencia Mundial de Inteligencia Artificial 2026 como una herramienta local de gestión y gobernanza de tokens para sistemas multi-agente.
Esta herramienta ofrece las siguientes funcionalidades:
La documentación original indica que el ATM puede observar la actividad de los agentes a través de mecanismos como ganchos de comportamiento, escaneo de archivos locales y puertas de enlace de privacidad.
En la práctica, el ATM funciona como un "medidor eléctrico" para las cargas de trabajo de IA. Su objetivo es correlacionar la facturación de tokens con el agente, la operación, el modelo y la herramienta que generaron ese consumo.
Esto está altamente relacionado con la filosofía de FinOps en la nube, la disciplina de medición y control del gasto en la nube. En los sistemas de agentes, el desafío es más granular, ya que un solo proceso de negocio puede contener múltiples niveles de llamadas anidadas a modelos.
Un registro de costos de agente efectivo debe incluir:
Qingcheng Technology posiciona al ATM como una capa de FinOps orientada a tokens para este nuevo tipo de cargas de trabajo.
El artículo original señala que la neutralidad es una de las ventajas principales de Qingcheng Technology.
Las grandes empresas de computación en la nube y hardware tienden naturalmente a priorizar la promoción de sus propias plataformas, socios o inversiones. Por lo tanto, las organizaciones que operan clústeres híbridos prefieren elegir proveedores de software independientes que admitan múltiples aceleradores y proveedores de servicios competidores.
Qingcheng Technology afirma que su plataforma no está vinculada a un único proveedor de chips.
Esta filosofía se refleja en la capacidad de Chitu para admitir diversos entornos de hardware y en el modelo de enrutamiento multi-proveedor de AI Ping.
La neutralidad aún debe validarse en la práctica. Los clientes deben examinar los siguientes elementos:
Los antecedentes técnicos de la empresa constituyen otra de sus ventajas de posicionamiento.
Qingcheng Technology fue fundada en diciembre de 2023, y su equipo central proviene del Instituto de Computación de Alto Rendimiento del Departamento de Ciencias de la Computación de la Universidad de Tsinghua.
La empresa afirma que este equipo ha realizado trabajos de evaluación y optimización de rendimiento para centros de supercomputación y centros de computación inteligente.
Qingcheng AI también ve el servicio de tokens como una ruta viable para que la capacidad de cómputo nacional llegue a usuarios en el extranjero.
La lógica es la siguiente: el desarrollador no necesita saber qué acelerador generó la respuesta. El desarrollador compra la API del modelo y obtiene tokens.
Si el hardware nacional puede soportar modelos competitivos de manera estable y eficiente, entonces su salida puede venderse a través de una API unificada, y los clientes en el extranjero no necesitan implementar ni conocer la arquitectura de hardware subyacente.
Qingcheng AI ve el servicio de tokens como una forma de distribuir la capacidad de cómputo nacional a nivel global.
El informe original indica que el período pico de tráfico de desarrollo en el extranjero suele ocurrir entre las 10 p. m. y las 8 a. m. (hora de Pekín).
Esto crea una oportunidad potencial de utilización. La capacidad de cómputo que permanece inactiva durante las horas de menor actividad nacional puede emplearse para atender a usuarios de otras zonas horarias.
El flujo de trabajo descrito en el artículo es el siguiente:
Esto no elimina los requisitos habituales de la prestación de servicios internacionales. Los proveedores de servicios aún deben gestionar latencia, cumplimiento normativo, gobernanza de datos, licencias de modelos, facturación, soporte técnico y disponibilidad regional.
En la exposición de inteligencia artificial, los productos más visibles suelen ser los modelos y las aplicaciones.
La infraestructura recibe menos atención, ya que gran parte de su trabajo ocurre bajo la interfaz de usuario. Determina si el modelo puede ejecutarse de manera estable, si el agente puede completar tareas y si el costo final es claro y comprensible.
El concepto de "tienda frontal con fábrica trasera" de Qingcheng AI conecta tres cuestiones:
La "fábrica trasera" combina hardware, Chitu y Bagualu. La "tienda frontal" utiliza AI Ping para evaluar y enrutar servicios de modelos. Los nodos de aplicación utilizan Agent Store y ATM para distribuir agentes y gestionar su consumo de tokens.
La analogía de la red eléctrica no es un estándar técnico, pero ofrece a las empresas una perspectiva práctica para comprender la arquitectura integral.
Esta arquitectura no trata cada API de modelo, clúster de aceleradores y agente como productos aislados, sino como componentes interconectados dentro de la cadena de suministro de tokens.
Es un modelo de infraestructura de IA de tres capas que abarca producción de tokens, enrutamiento de API y aplicaciones de agentes. La "fábrica trasera" utiliza hardware de cómputo, Chitu y Bagualu; la capa intermedia emplea AI Ping; y la capa de aplicación incluye Agent Store y ATM.
Chitu es un framework de inferencia de modelos de lenguaje grandes, de código abierto y orientado a producción. Admite múltiples plataformas de aceleradores nacionales e internacionales, diversas escalas de despliegue, inferencia de baja precisión e interfaces de servicio HTTP compatibles con OpenAI.
No se ha publicado una promesa general de reducción del 75%. Ese dato proviene de un escenario específico de despliegue FP4, donde la necesidad de servidores se redujo de cuatro a uno, es decir, una disminución del 75% en la cantidad de máquinas.
Sí. El repositorio oficial de Chitu ya proporciona Dockerfiles adaptados a diversos entornos de hardware, como Ascend, Hygon y MetaX, junto con documentación general de instalación y despliegue.
AI Ping se utiliza para monitorear y comparar servicios de API de modelos, y para enrutar solicitudes según objetivos de costo, velocidad, confiabilidad o calidad. Ofrece una API unificada sobre múltiples proveedores de servicios.
Agent Token Manager (ATM) es una herramienta de gobernanza de tokens diseñada por Qingcheng AI para sistemas de agentes. Se utiliza para rastrear el uso, distribuir costos, gestionar credenciales, establecer límites, aislar cargas de trabajo y alertar a los equipos ante consumos anormales.
Bagualu es una pila de software más amplia, no solo un motor de inferencia. Abarca áreas como entrenamiento, despliegue de inferencia, programación, monitoreo, entrega de aplicaciones y operación de clústeres, mientras que Chitu se encarga de la capa central de inferencia de modelos.
Dicho resultado fue proporcionado por Qingcheng AI y el informe original. Los detalles específicos de despliegue necesarios para una reproducción independiente aún no se han divulgado por completo. Se recomienda a los lectores que realicen sus propias pruebas con sus modelos, hardware y cargas de trabajo.
Software.
En la Conferencia Mundial de Inteligencia Artificial 2026, Qingcheng AI presentó una infraestructura de tokens de tres capas diseñada para conectar inferencia de modelos, enrutamiento de API, distribución de agentes y gobernanza de costos.
La capa de fábrica trasera utiliza Chitu y Bagualu para optimizar el despliegue de modelos en hardware de cómputo heterogéneo. Según el informe de la empresa, en una configuración FP4 de DeepSeek, la cantidad de máquinas necesarias se redujo de cuatro a una, logrando una reducción del 75% en costos.
AI Ping constituye la capa de enrutamiento intermedio, mientras que Agent Store y ATM cubren la distribución de agentes y las operaciones financieras de tokens. Cada producto contribuye a hacer que el suministro de tokens sea más estable, cuantificable e independiente de un único proveedor de hardware o API.
La idea central es sencilla: los agentes de IA no solo necesitan modelos, sino también una capa de infraestructura capaz de generar, enrutar, medir y controlar cada token que consumen.
Empieza con una sola frase y obtén un sitio completo en minutos.