El Asistente Wenxin de Baidu Encabeza SuperCLUE XClaw Tras Liderar PinchBench v2
El Asistente Wenxin de Baidu ha alcanzado el primer lugar en otro benchmark de estilo agente. En la evaluación de producto XClaw de SuperCLUE de agosto de 2026, el Asistente Wenxin obtuvo una puntuación general de 97

El Asistente Wenxin de Baidu Encabeza SuperCLUE XClaw Tras Liderar PinchBench v2
Introducción
El Asistente Wenxin de Baidu ha obtenido el primer puesto en otro referente de estilo agente.
En la evaluación de producto XClaw de SuperCLUE de agosto de 2026, el Asistente Wenxin recibió una puntuación general de 97,62, la puntuación más alta en la instantánea publicada.
Sus puntuaciones por categoría fueron:
| Capacidad | Puntuación |
|---|---|
| Codificación | 90,28 |
| Creación de contenido | 99,44 |
| Procesamiento de datos | 98,86 |
| Análisis de investigación | 96,44 |
| Memoria | 100,00 |
El resultado llegó menos de tres semanas después de otra destacada actuación.
En una instantánea de julio de PinchBench v2, el agente de tareas de Baidu —presentado como Orion Mission Mode— registró una puntuación máxima del 94,6% y una puntuación media del 94,4%, situándose en lo más alto de esa instantánea de clasificación.
Los dos referentes son diferentes. SuperCLUE XClaw se centra en productos agente chinos y resultados prácticos en cinco dimensiones de capacidad. PinchBench v2, creado por Kilo, se basa en tareas reales de informática y automatización.
Juntos, apuntan al mismo cambio:
La evaluación de agentes está pasando de "¿Puede el modelo responder correctamente?" a "¿Puede el sistema completar el trabajo y entregar algo utilizable?"
Un modelo de lenguaje puede saber la respuesta y aun así fallar como agente porque olvida requisitos, elige la herramienta equivocada, maneja mal los archivos, se detiene a mitad de un flujo de trabajo o devuelve el artefacto incorrecto.
Eso hace que los últimos resultados de Wenxin traten más sobre la ejecución de tareas que sobre la inteligencia bruta del modelo de lenguaje.

El Asistente Wenxin Obtiene el Primer Puesto en SuperCLUE XClaw
SuperCLUE describe XClaw como una evaluación orientada a producto para asistentes de IA de estilo "Claw".
En lugar de depender principalmente de preguntas de opción múltiple, el referente enfatiza los entregables completados.
La instantánea de agosto de 2026 clasifica los productos líderes de la siguiente manera:
| Rango | Producto | Puntuación |
|---|---|---|
| 1 | Asistente Wenxin de Baidu | 97,62 |
| 2 | MiMoClaw | 96,74 |
| 3 | WorkBuddy | 96,61 |
| 4 | KimiClaw | 96,01 |
| 5 | MaxClaw | 94,79 |
El referente evalúa cinco dimensiones:
- Procesamiento de datos.
- Creación de contenido.
- Memoria.
- Codificación.
- Análisis de investigación.
La lógica básica es sencilla: el agente recibe una tarea y debe producir un artefacto o resultado final que pueda evaluarse realmente.
Eso hace que el seguimiento de instrucciones, el manejo de archivos, el uso de herramientas y la ejecución de largo alcance formen parte de la puntuación.

Esto muestra la diferencia entre el trabajo de chat y el de agente.
Un modelo de chat podría escribir el plan dentro de la conversación.
Un flujo de trabajo de agente puede hacer esto:
Leer archivo fuente
→ extraer información estructurada
→ redactar contenido
→ formatear documento de Word
→ validar salida
→ devolver un archivo
El artefacto, no la respuesta en prosa, se convierte en el producto final.
Creación de Contenido: 99.44
Wenxin obtuvo 99.44 en creación de contenido.
En un punto de referencia de agentes, la creación de contenido no es simplemente escritura creativa.
El sistema puede necesitar satisfacer múltiples restricciones a la vez:
- Formato requerido.
- Tono.
- Extensión.
- Estructura de secciones.
- Audiencia.
- Tipo de archivo.
- Base factual.
- Presentación visual.
Un borrador puede ser gramaticalmente correcto y aun así fallar porque
ignora el formato solicitado.
Por eso los benchmarks de productos puntúan cada vez más la finalización en lugar de solo la calidad lingüística.
Puntuación en Codificación: 90.28
La categoría más baja de XClaw para Wenxin fue codificación, con 90.28.
Sigue siendo una puntuación sólida, pero la brecha en comparación con la creación de contenido y el procesamiento de datos es reveladora.
Los agentes de codificación deben gestionar un bucle operativo más amplio:
Entender el requisito
→ elegir la pila tecnológica
→ escribir archivos
→ ejecutar o previsualizar
→ inspeccionar errores
→ corregir
→ verificar la interacción
→ empaquetar el resultado
El editor de la fuente probó el producto con una solicitud de una sola frase para un simulador de sistema solar en 3D.
El flujo de trabajo informado utilizó Three.js y devolvió una aplicación HTML de un solo archivo de 31 KB.
El artículo también muestra una página didáctica de simulación meteorológica generada mediante un flujo de trabajo web interactivo similar.
Estos son demos ilustrativos, no elementos oficiales del benchmark XClaw.

Puntuación en Análisis de Investigación: 96.44
Wenxin obtuvo 96.44 en análisis de investigación.
Una tarea de investigación seria puede implicar:
- Comprender la pregunta.
- Dividirla en subpreguntas.
- Buscar en múltiples fuentes.
- Evaluar la calidad de las fuentes.
- Comparar afirmaciones contradictorias.
- Verificar fechas.
- Extraer valores numéricos.
- Construir un argumento estructurado.
- Añadir citas.
- Producir un informe.
El artículo fuente describe dos casos de prueba.
Investigación sobre el problema tridimensional de Kakeya
El editor pidió a Wenxin que investigara la conjetura tridimensional de Kakeya en el contexto de la medallista Fields Hong Wang.
El comportamiento informado del agente fue:
- Planificar un proceso de investigación en seis pasos.
- Lanzar varios subagentes en paralelo.
- Buscar en 16 fuentes académicas.
- Producir un documento Markdown.
- Producir un resultado HTML interactivo de 62 KB.

La cantidad de fuentes no es por sí sola una métrica de calidad.
Lo que importa es si el agente final utiliza fuentes autorizadas, atribuye correctamente las afirmaciones, resuelve conflictos, evita datos desactualizados y separa los hechos de la interpretación.
Comparación de modelos recientes de IA y precios
El editor también pidió a Wenxin que analizara las capacidades y los precios de los principales modelos nacionales e internacionales del mes anterior.
El artículo dice que el agente:
- Cargó una habilidad de investigación de la industria.
- Buscó en 45 fuentes en dos rondas.
- Detectó incertidumbre en algunas cifras clave.
- Realizó otra búsqueda específica en 29 fuentes.
- Verificó de forma cruzada los precios.
- Produjo un informe de aproximadamente 7.000 caracteres chinos con gráficos.

El ciclo de investigación útil es:
Buscar
→ identificar incertidumbre
→ buscar de nuevo
→ comparar fuentes
→ resolver o marcar discrepancia
→ escribir
Esa pasada de verificación adicional es a menudo donde mejora la calidad de la investigación.
Un segundo primer lugar: PinchBench v2
El resultado de SuperCLUE siguió a un primer lugar en julio en PinchBench v2.
PinchBench fue creado por Kilo para evaluar agentes en flujos de trabajo del mundo real en lugar de puntos de referencia tradicionales de preguntas y respuestas.
El lanzamiento de PinchBench 2.0 de Kilo amplió el punto de referencia a 148 tareas y añadió reglas más estrictas de calificación y clasificación.
En la instantánea de la clasificación de julio reproducida por el artículo fuente, el sistema de Baidu aparecía como:
Orion-Mission-Mode
con:
Mejor puntuación: 94,6%
Puntuación media: 94,4%

La captura de pantalla sitúa a Orion Mission Mode por delante de sistemas basados en modelos de Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI y otros en esa instantánea concreta.
La palabra importante es instantánea.
Las clasificaciones de agentes cambian rápidamente.
Los modelos, los entornos de evaluación, los prompts, las políticas de herramientas y los envíos a los puntos de referencia pueden actualizarse.
Por lo tanto, un primer lugar en julio debe citarse con su fecha en lugar de tratarse como una clasificación global permanente.
Qué prueba realmente PinchBench v2
Kilo describe PinchBench 2.0 como un punto de referencia de flujos de trabajo de agentes del mundo real.
Contiene tareas que requieren que un sistema utilice herramientas y complete operaciones en lugar de simplemente seleccionar una respuesta.
El punto de referencia cubre categorías como:
- Redacción.
- Trabajo creativo.
- Análisis de datos.
- Trabajo de investigación y conocimiento.
- Código y operaciones.
- Otros flujos de trabajo basados en computadora.
El artículo fuente dice que 59 entradas de modelos o agentes estaban representadas en la instantánea de la clasificación.
Esa cifra puede cambiar a medida que se añaden o actualizan envíos.
El punto de referencia en sí es más estable que la población de la clasificación.
El lanzamiento oficial de PinchBench 2.0 describe:
148 tareas
La fuente y varios informes de julio describen la evaluación de Wenxin en 147 tareas completadas, mientras que también describen PinchBench como un punto de referencia de 148 tareas.
La interpretación más segura es:
PinchBench v2 contiene 148 tareas; la evaluación reportada de Orion Mission Mode puede haber producido resultados puntuados en 147 de ellas en esa instantánea.
Esta distinción importa porque los informes de puntos de referencia a menudo mezclan el tamaño del punto de referencia con el número de tareas completadas con éxito.
ejecuciones completadas.
Mejor Puntuación vs. Puntuación Promedio
La fuente enfatiza que el Modo Misión Orion registró:
94.6% mejor puntuación
94.4% puntuación promedio
La diferencia de 0.2 puntos es pequeña.
Eso sugiere una baja variación entre las ejecuciones reportadas.
Sin embargo, no debe interpretarse como una garantía universal de estabilidad.
La variación del benchmark puede depender de:
- Número de repeticiones.
- Temperatura de muestreo.
- Disponibilidad de herramientas.
- Sitios web externos.
- Condiciones de red.
- Comportamiento del evaluador.
- Tiempos de espera del agente.
- Actualizaciones del modelo.
La lección práctica es simplemente que la ejecución reportada de PinchBench no se basó en un único resultado afortunado y aislado.
Su promedio se mantuvo cercano a su mejor puntuación.
El Agente Es Más Que el Modelo Subyacente
Uno de los puntos más importantes del artículo fuente es que el benchmark evalúa un producto o sistema de agente, no un modelo de lenguaje desnudo.
El agente de tareas puede combinar:
- Un modelo fundacional.
- Búsqueda.
- Memoria.
- Manejo de archivos.
- Selección de herramientas.
- Planificación.
- Subagentes.
- Habilidades de generación de documentos.
- Acceso a navegador o web.
- Ejecución de código.
- Validación.
Esto puede expresarse como:
Resultado del agente
=
capacidad del modelo
+
herramientas
+
memoria
+
planificación
+
búsqueda
+
entorno de ejecución
+
verificación
Por eso hay que tener cuidado al decir:
“El modelo X superó al modelo Y.”
La tabla de clasificación puede estar comparando en realidad dos sistemas de agente diferentes que usan distintas herramientas y orquestación.
Una descripción más precisa es:
“El sistema de agente X obtuvo una puntuación superior al sistema de agente Y bajo esta configuración de benchmark.”
Esa redacción se vuelve cada vez más importante a medida que los productos de IA se transforman en sistemas de software complejos.
De Responder Preguntas a Completar Trabajos
El artículo fuente presenta 2026 como el año en que el estándar para un producto de IA útil está cambiando.
La interacción anterior se veía así:
El usuario pregunta
→ el modelo responde
→ el usuario realiza el trabajo
El patrón emergente de agente se ve así:
El usuario da un objetivo
→ el agente planifica
→ el agente recopila contexto
→ el agente llama a herramientas
→ el agente crea archivos
→ el agente verifica resultados
→ el agente entrega el artefacto
Esto cambia lo que los usuarios notan.
Un modelo puede ser extremadamente conocedor pero frustrante si no puede:
- Recordar requisitos anteriores.
- Abrir el archivo.
- Dar formato a la hoja de cálculo.
- Crear el documento solicitado.
- Completar todos los pasos.
- Corregir sus propios errores.
La nueva condición de éxito se acerca más a:
¿La tarea realmente se completó?
que a:
¿La respuesta fue impresionante?
Punto de Entrada de Tareas en Wenxin
El artículo de BAAI muestra la opción “Tarea” directamente dentro de la interfaz de Wenxin.

El sitio web oficial de Wenxin de Baidu describe el producto como un asistente de IA multimodal para:
- Creación confiable.
- Búsqueda profunda.
- Uso inteligente de herramientas.
- Trabajo con documentos.
- Redacción.
- Imágenes.
Uso entre dispositivos.
La aplicación de Baidu también lista Asistente Wenxin como una función de IA integrada para investigación profunda, búsqueda, redacción, generación de imágenes, generación de video y asistencia conversacional.
Esto confirma que la IA orientada a tareas ha llegado a las superficies de consumo principales de Baidu, en lugar de permanecer como un experimento solo para desarrolladores.
¿Es Asistente Wenxin realmente gratis e ilimitado?
El artículo fuente destaca repetidamente un punto comercial:
Asistente Wenxin es gratuito y no tiene muro de pago.
Las páginas oficiales de Wenxin de Baidu ofrecen actualmente acceso gratuito o experiencia gratuita.
Eso es fácil de verificar.
La afirmación más fuerte —permanentemente ilimitado para cada función de agente de tareas— es más difícil de verificar a partir de una página de política oficial estable.
Los productos de IA pueden introducir:
- Cuotas diarias.
- Límites de concurrencia.
- Límites específicos por función.
- Promociones temporales.
- Niveles de cuenta.
- Restricciones regionales.
- Cambios de precio futuros.
Para publicación, la redacción más segura es:
Asistente Wenxin está actualmente disponible para usuarios individuales con opciones de acceso gratuito, y la experiencia de tareas mostrada en el artículo fuente no requirió una suscripción de pago.
No construyas una comparación de costos a largo plazo en torno a "ilimitado para siempre" a menos que Baidu publique una política específica que lo garantice.
Por qué la experiencia de búsqueda puede ayudar a un agente
La sección final del artículo fuente argumenta que el historial de búsqueda de Baidu le da una ventaja estructural en el diseño de agentes.
Hay una analogía real.
Un motor de búsqueda maneja algo como:
Consulta del usuario
→ comprensión de intención
→ descomposición de consulta
→ recuperación
→ clasificación
→ agregación de resultados
→ respuesta
Un agente maneja:
Objetivo del usuario
→ comprensión de intención
→ descomposición de tarea
→ selección de herramientas
→ ejecución
→ agregación de resultados
→ entrega
Los dos pipelines no son idénticos.
Un agente tiene un espacio de acción mucho más grande y conlleva un mayor riesgo de ejecución.
Pero varias capacidades técnicas se transfieren de forma natural:
- Comprensión de intención.
- Reescritura de consultas.
- Recuperación.
- Clasificación de fuentes.
- Contexto de sesión.
- Manejo de frescura.
- Deduplicación.
- Agregación de evidencia.
Esto es especialmente relevante para los agentes de investigación.
Un sistema que ya tiene una infraestructura de búsqueda sólida puede construir flujos de trabajo más profundos sobre ella.
Comprensión de consultas de búsqueda vs. comprensión de tareas de agente
Considera una solicitud de búsqueda tradicional:
Encuentra el vuelo más barato de Pekín a Shanghái.
Un sistema de búsqueda puede necesitar inferir:
- Origen.
- Destino.
- Fechas de viaje.
- Preferencia de precio.
- Inventario de vuelos elegible.
- Orden de clasificación.
A un agente se le pide:
Encuentra el vuelo Pekín–Shanghái más barato y prepara un itinerario.
puede necesitar agregar:
- Selección de herramientas.
- Múltiples búsquedas.
- Comparación.
- Verificación de restricciones.
- Generación de archivos.
- Posiblemente un paso de calendario o reserva.
La primera mitad del problema se parece a la búsqueda.
La segunda mitad es orquestación de acciones.
La experiencia de búsqueda proporciona componentes útiles, pero la calidad del agente aún depende de la capa de ejecución.
La memoria y las sesiones de búsqueda están relacionadas, pero no son lo mismo
La fuente también conecta la puntuación de memoria de Wenxin con la experiencia de Baidu en la comprensión de sesiones de búsqueda.
Hay
cierta superposición conceptual.
Ambos sistemas necesitan inferir qué información de interacciones anteriores sigue siendo relevante.
Una sesión de búsqueda puede contener:
Consulta 1: coches eléctricos
Consulta 2: autonomía superior a 600 km
Consulta 3: menos de 250 000 RMB
El sistema debería entender que la tercera consulta sigue tratando sobre coches eléctricos.
Un sistema de memoria de agente tiene una tarea más difícil.
Puede necesitar recordar:
- Preferencias del usuario.
- Restricciones de la tarea.
- Datos derivados de archivos.
- Decisiones.
- Salidas de herramientas.
- Estado temporal.
- Preferencias a largo plazo.
La experiencia en sesiones de búsqueda es útil, pero la memoria persistente del agente requiere mecanismos adicionales de almacenamiento, recuperación, privacidad y relevancia.
El análisis de investigación es donde la pila de búsqueda de Baidu es más directamente relevante
Entre las cinco categorías de XClaw, el análisis de investigación es el lugar más claro donde la experiencia de búsqueda de Baidu puede transferirse directamente.
Un agente de investigación necesita:
- Cobertura de búsqueda.
- Información actualizada.
- Expansión de consultas.
- Clasificación.
- Manejo de citas.
- Comparación de fuentes.
- Comprensión de entidades.
- Recuperación multilingüe.
La documentación oficial de Qianfan AI Assistant de Baidu también describe una solución de agente empresarial que integra Búsqueda de Baidu, Baidu Baike, búsqueda de imágenes, gestión de conversaciones, gestión de memoria y capacidades documentales.
Eso no demuestra que el producto de consumo Wenxin utilice exactamente la misma implementación.
Sí demuestra que Baidu está construyendo una pila de agente común en torno a búsqueda, memoria, herramientas y recuperación multimodal en toda su cartera de productos.
Lo que las dos victorias en los puntos de referencia no demuestran
Las puntuaciones altas en los puntos de referencia son evidencia útil.
No son la evaluación completa.
No demuestran un liderazgo global permanente
Las tablas de clasificación cambian.
Los nuevos modelos y nuevos envíos de agentes pueden superar al líder actual.
No demuestran que cada tarea alcanzará una puntuación del 97 %
XClaw agrega tareas y categorías seleccionadas.
El flujo de trabajo real de un usuario puede ser muy diferente.
No aíslan el modelo fundacional
La puntuación pertenece al asistente completo o a la pila del agente.
No miden todos los problemas de seguridad
Un agente que puede completar tareas de manera eficiente aún puede realizar llamadas de herramientas inseguras o exponer información sensible en un entorno diferente.
No garantizan precisión fáctica
Los agentes de investigación pueden citar fuentes débiles o malinterpretar datos cambiantes.
No demuestran uso gratuito ilimitado
Los precios y las cuotas de los productos son políticas comerciales, no propiedades de los puntos de referencia.
Cómo evaluar el asistente Wenxin usted mismo
Una prueba personal útil debería parecerse a su trabajo real.
No haga solo preguntas triviales.
Dé al agente una tarea completa.
Prueba 1: Memoria
Proporcione cinco restricciones al inicio de una conversación larga.
Después de varios turnos no relacionados, pida un artefacto final y verifique si las cinco se conservan.
Prueba 2: Procesamiento de datos
Cargue:
- Una hoja de cálculo.
- Un PDF.
- Un archivo de texto corto.
Pida al agente que los combine en un solo informe.
Verifique cada valor numérico de forma independiente.
Prueba 3: Investigación
Elija un tema con información cambiante.
Requiera:
- Fuentes primarias.
- Fechas de publicación.
- Comparación de fuentes en conflicto.
- Enlaces directos.
- Una lista de afirmaciones inciertas.
Prueba 4: Documento
Creación
Solicite un artefacto en Word, PowerPoint, hoja de cálculo o HTML.
Evalúe:
- Estructura.
- Formato.
- Integridad.
- Capacidad de descarga.
- Si el archivo realmente se abre.
Prueba 5: Codificación
Solicite una pequeña aplicación interactiva.
Verifique:
- Si se ejecuta.
- Si todas las funciones solicitadas existen.
- Si los errores se corrigen.
- Si el archivo final es autónomo cuando se solicita.
Prueba 6: Ejecución de Largo Alcance
Asigne una tarea que requiera varias herramientas.
Observe si el sistema:
- Elabora un plan.
- Elige herramientas razonables.
- Se recupera de fallos.
- Evita repetir trabajo.
- Verifica el resultado final.
Una Mejor Manera de Comparar Productos de Agentes
Al comparar Wenxin con otros agentes, utilice una tabla más amplia que la "puntuación de referencia".
| Dimensión | Qué medir |
|---|---|
| Éxito de la tarea | ¿Se completó el trabajo solicitado? |
| Memoria | ¿Se conservaron las restricciones anteriores? |
| Precisión | ¿Son correctos los números y las afirmaciones? |
| Calidad de la investigación | ¿Son las fuentes autorizadas y actuales? |
| Fiabilidad de las herramientas | ¿Las llamadas a herramientas tienen éxito de manera constante? |
| Calidad del artefacto | ¿Los archivos son utilizables sin reparación manual? |
| Recuperación | ¿Puede el agente corregir pasos fallidos? |
| Latencia | ¿Cuánto tiempo tarda una tarea completa? |
| Costo | ¿Cuánto cuesta un resultado aceptado? |
| Privacidad | ¿Cómo se manejan los archivos cargados y la memoria? |
| Disponibilidad | ¿Las funciones clave son gratuitas, con límite de cuota o de pago? |
Esto ofrece una imagen más realista que una sola posición en una clasificación.
El Cambio Mayor: "¿Puede Entregar?"
El punto más fuerte del artículo original es más amplio que Baidu.
La competencia de agentes está cambiando la definición de calidad de la IA.
Para la primera generación de chatbots, los usuarios se centraban en la calidad de las respuestas.
Para los agentes de tareas actuales, las preguntas clave están pasando a ser:
- ¿Puede mantener el contexto?
- ¿Puede encontrar la información correcta?
- ¿Puede operar herramientas?
- ¿Puede crear el archivo?
- ¿Puede completar un flujo de trabajo de múltiples pasos?
- ¿Puede verificar su propio resultado?
- ¿Puedo confiarle trabajo repetido?
Por eso, puntos de referencia como XClaw y PinchBench están atrayendo atención.
Acercan la evaluación al trabajo de producción real.
Todavía hay una larga distancia entre un punto de referencia y un despliegue empresarial.
Pero la dirección es útil:
Punto de referencia de conocimiento
→ punto de referencia de razonamiento
→ punto de referencia de uso de herramientas
→ punto de referencia de tareas de extremo a extremo
→ resultado de producción real
El último paso es, en última instancia, el que importa.
Preguntas Frecuentes
¿Qué puntuación recibió el Asistente de Baidu Wenxin en SuperCLUE XClaw?
La instantánea de agosto de 2026 de SuperCLUE XClaw otorga al Asistente de Wenxin una puntuación general de 97,62, ubicándolo en primer lugar entre los productos mostrados. Sus puntuaciones por categoría fueron 90,28 en codificación, 99,44 en creación de contenido, 98,86 en procesamiento de datos, 96,44 en análisis de investigación y 100 en memoria.
¿Qué significa una puntuación de memoria de 100?
Significa que Wenxin recibió la puntuación máxima en las tareas de memoria incluidas en esa evaluación de XClaw. No significa que el asistente nunca pueda olvidar el contexto en cualquier conversación posible del mundo real.
¿Qué es PinchBench v2?
PinchBench v2 es un punto de referencia de agentes creado por Kilo que evalúa sistemas en tareas informáticas y de flujo de trabajo del mundo real. La versión 2.0 contiene 148 tareas y está diseñada para medir
ejecución de extremo a extremo en lugar de simples respuestas a preguntas.
¿Cuál fue la puntuación de Wenxin en PinchBench v2?
En una captura de la clasificación de julio de 2026, el agente de tareas de Baidu apareció como Orion Mission Mode con una mejor puntuación del 94.6% y una puntuación media del 94.4%. Las clasificaciones cambian con el tiempo, por lo que debe incluirse la fecha de la captura al citar el resultado.
¿Es Wenxin Assistant completamente gratuito?
Las páginas oficiales de Wenxin de Baidu ofrecen actualmente opciones de acceso gratuito o experiencia gratuita, y el artículo fuente indica que las funciones de tareas demostradas estaban disponibles sin suscripción de pago. No se encontró una garantía oficial estable de uso ilimitado permanente para todas las funciones, por lo que las cuotas actuales deben verificarse directamente en el producto.
¿Puede Wenxin Assistant generar documentos de Word y páginas web?
El artículo fuente muestra sesiones de prueba en las que Wenxin generó un plan de negocio formateado en Word y páginas HTML interactivas. Estos ejemplos demuestran el flujo de trabajo de tareas del producto, pero no garantizan que cada instrucción o entorno produzca el mismo resultado.
¿Por qué la tecnología de búsqueda de Baidu podría ayudar a sus agentes de IA?
La búsqueda y los agentes comparten capacidades como la comprensión de intenciones, la descomposición de consultas, la recuperación, la clasificación, la agregación de fuentes y el contexto de sesión. Los agentes añaden una capa de ejecución más amplia, que incluye llamadas a herramientas, creación de archivos, memoria, planificación y acción.
¿Son XClaw y PinchBench puntos de referencia de modelos?
No en el sentido estricto. Evalúan sistemas de productos o agentes que pueden combinar modelos con herramientas, memoria, búsqueda, instrucciones, orquestación y entornos de ejecución. Por lo tanto, sus puntuaciones deben atribuirse a la configuración completa del agente.
Herramientas relacionadas
- Baidu Wenxin: El asistente de IA multimodal oficial de Baidu para búsqueda, creación, documentos y trabajo orientado a tareas.
- SuperCLUE XClaw: El punto de referencia chino de agentes orientado a productos citado en el artículo fuente.
- PinchBench: El punto de referencia del mundo real de Kilo para flujos de trabajo de agentes de codificación y uso de computadoras.
- Pandoc: Una herramienta de conversión de documentos utilizada en el flujo de trabajo de prueba de la fuente para extraer y transformar contenido de documentos.
- Three.js: Una biblioteca gráfica 3D de JavaScript utilizada en el ejemplo del Sistema Solar generado en el artículo fuente.
- Baidu Qianfan: La plataforma empresarial de Baidu para modelos, agentes, datos y desarrollo de aplicaciones de IA.
- Baidu AgentBuilder: La plataforma de Baidu para crear y publicar agentes personalizados basados en Wenxin.
Enlaces relacionados
- Sitio web oficial de Baidu Wenxin: Punto de entrada oficial actual del producto para Wenxin Assistant en clientes web y descargables.
- Asistente de escritorio de Baidu Wenxin: Página oficial de escritorio que destaca análisis de documentos, búsqueda, creación, exportación y experiencia gratuita.
- [SuperCLUE XClaw agosto de 2026
Evaluación](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): La página de referencia del artículo original.
- Kilo: PinchBench 2.0 Is Here: Explicación oficial de las 148 tareas de PinchBench v2, los cambios en la puntuación, la evaluación paralela y el diseño de la tabla de clasificación.
- Documentación del Asistente de IA Baidu Qianfan: Documentación oficial que describe el asistente empresarial de IA integrado con búsqueda de Baidu, con memoria, conversación y servicios de archivos.
- Página oficial de descarga de la aplicación Baidu: Listado oficial de la aplicación de Baidu que describe el Asistente Wenxin integrado y las funciones de investigación profunda.
- Documentación de Baidu Wenxin AgentBuilder: Documentación oficial para crear agentes en el ecosistema Wenxin de Baidu.
Resumen
El Asistente Wenxin de Baidu ocupó el primer lugar en la instantánea de XClaw de SuperCLUE de agosto de 2026 con 97,62 puntos, incluida una puntuación perfecta de 100 en memoria y puntuaciones superiores a 96 en procesamiento de datos, creación de contenido y análisis de investigación.
Ese resultado sigue a la instantánea de la tabla de clasificación de PinchBench v2 de julio, en la que el Modo Misión Orión de Baidu registró una mejor puntuación del 94,6% y una puntuación media del 94,4%. Los puntos de referencia utilizan tareas diferentes, pero ambos enfatizan la finalización real de tareas en lugar de simplemente responder preguntas.
La conclusión más importante no es que un asistente haya "ganado" permanentemente la carrera de agentes. Las clasificaciones de agentes cambian rápidamente, y los sistemas evaluados incluyen modelos, herramientas, búsqueda, memoria, indicaciones y orquestación.
Lo que demuestran ambos resultados es que la evaluación de IA avanza hacia un estándar más práctico: no si el modelo suena inteligente, sino si el agente puede completar el trabajo y devolver un resultado utilizable.