El Asistente Wenxin de Baidu Encabeza SuperCLUE XClaw Tras Liderar PinchBench v2

El Asistente Wenxin de Baidu ha alcanzado el primer lugar en otro benchmark de estilo agente. En la evaluación de producto XClaw de SuperCLUE de agosto de 2026, el Asistente Wenxin obtuvo una puntuación general de 97

发布于 2026年8月7日generalGEO 评分: 09 次阅读
El Asistente Wenxin de Baidu Encabeza SuperCLUE XClaw Tras Liderar PinchBench v2

El Asistente Wenxin de Baidu Encabeza SuperCLUE XClaw Tras Liderar PinchBench v2

Introducción

El Asistente Wenxin de Baidu ha obtenido el primer puesto en otro referente de estilo agente.

En la evaluación de producto XClaw de SuperCLUE de agosto de 2026, el Asistente Wenxin recibió una puntuación general de 97,62, la puntuación más alta en la instantánea publicada.

Sus puntuaciones por categoría fueron:

Capacidad Puntuación
Codificación 90,28
Creación de contenido 99,44
Procesamiento de datos 98,86
Análisis de investigación 96,44
Memoria 100,00

El resultado llegó menos de tres semanas después de otra destacada actuación.

En una instantánea de julio de PinchBench v2, el agente de tareas de Baidu —presentado como Orion Mission Mode— registró una puntuación máxima del 94,6% y una puntuación media del 94,4%, situándose en lo más alto de esa instantánea de clasificación.

Los dos referentes son diferentes. SuperCLUE XClaw se centra en productos agente chinos y resultados prácticos en cinco dimensiones de capacidad. PinchBench v2, creado por Kilo, se basa en tareas reales de informática y automatización.

Juntos, apuntan al mismo cambio:

La evaluación de agentes está pasando de "¿Puede el modelo responder correctamente?" a "¿Puede el sistema completar el trabajo y entregar algo utilizable?"

Un modelo de lenguaje puede saber la respuesta y aun así fallar como agente porque olvida requisitos, elige la herramienta equivocada, maneja mal los archivos, se detiene a mitad de un flujo de trabajo o devuelve el artefacto incorrecto.

Eso hace que los últimos resultados de Wenxin traten más sobre la ejecución de tareas que sobre la inteligencia bruta del modelo de lenguaje.

Esta imagen muestra la clasificación de puntuaciones medias de agosto de 2026 de la evaluación de producto SuperCLUE-XClaw, presentando claramente la clasificación y las puntuaciones correspondientes de los productos de cada fabricante que participaron en la evaluación. El Asistente Wenxin de Baidu ocupa el primer puesto con 97,62 puntos; MiMoClaw de Xiaomi le sigue de cerca en segundo lugar con 96,74 puntos; WorkBuddy de Tencent y KimiClaw de Moonshot AI ocupan el segundo y tercer puesto respectivamente, con 96,61 y 96,01 puntos; MaxClaw de XiYu Technology ocupa el tercer puesto con 94,79 puntos. La página indica el criterio de puntuación, el lote de datos y otra información de la clasificación, reflejando intuitivamente el rendimiento de capacidad de cada producto en la evaluación de productos inteligentes en chino, lo que se corresponde con el contenido mencionado en el documento sobre el Asistente Wenxin que obtuvo la puntuación más alta en la evaluación SuperCLUE XClaw.

El Asistente Wenxin Obtiene el Primer Puesto en SuperCLUE XClaw

SuperCLUE describe XClaw como una evaluación orientada a producto para asistentes de IA de estilo "Claw".

En lugar de depender principalmente de preguntas de opción múltiple, el referente enfatiza los entregables completados.

La instantánea de agosto de 2026 clasifica los productos líderes de la siguiente manera:

Rango Producto Puntuación
1 Asistente Wenxin de Baidu 97,62
2 MiMoClaw 96,74
3 WorkBuddy 96,61
4 KimiClaw 96,01
5 MaxClaw 94,79

El referente evalúa cinco dimensiones:

  1. Procesamiento de datos.
  2. Creación de contenido.
  3. Memoria.
  4. Codificación.
  5. Análisis de investigación.

La lógica básica es sencilla: el agente recibe una tarea y debe producir un artefacto o resultado final que pueda evaluarse realmente.

Eso hace que el seguimiento de instrucciones, el manejo de archivos, el uso de herramientas y la ejecución de largo alcance formen parte de la puntuación.

![La imagen muestra la clasificación del Asistente Wenxin de Baidu en las dimensiones de capacidad (puntuaciones medias) de SuperCLUE XClaw. Sus puntuaciones en las cinco dimensiones de desarrollo de código, creación de contenido, procesamiento de datos, análisis de investigación y capacidad de memoria son 90,28, 99,44, 98,86, 96,44 y 100,00 respectivamente. Esta imagen se corresponde con la mención anterior de que SuperCLUE XClaw es una evaluación orientada a producto para asistentes de IA de estilo "Claw", mostrando intuitivamente el rendimiento del Asistente Wenxin de Baidu en ese sistema de evaluación, proporcionando datos de apoyo para su primer puesto en SuperCLUE XClaw.](https://we0-cms.oss-cn-beijing.aliyuncs.

La Memoria Alcanza 100

La puntuación de categoría más llamativa es 100.00 en memoria.

La memoria importa porque el trabajo real rara vez cabe en una sola instrucción aislada.

Un usuario puede proporcionar restricciones al inicio de una conversación y esperar que el agente las respete mucho más tarde.

Por ejemplo:

Turno 1:
Usar solo datos del Q2 2026.

Turno 3:
Mantener el informe en menos de 10 páginas.

Turno 6:
Usar la misma segmentación de productos que la hoja de cálculo.

Turno 10:
Generar el documento final de Word.

Un agente que olvida la primera instrucción puede producir un entregable pulido pero inutilizable.

Por lo tanto, la memoria afecta a:

  • Retención de requisitos.
  • Planificación de múltiples pasos.
  • Coherencia.
  • Retrabajo.
  • Confianza del usuario.
  • Finalización de tareas de larga duración.

Una puntuación perfecta de categoría en un punto de referencia no significa que el producto nunca olvidará información en sesiones arbitrarias del mundo real. Sí demuestra que Wenxin se desempeñó extremadamente bien en las tareas de memoria incluidas en esta evaluación de XClaw.

Procesamiento de Datos: 98.86

El Asistente Wenxin recibió 98.86 en procesamiento de datos.

La fuente describe esta categoría como una prueba de si el sistema puede interpretar campos, combinar información, preservar la precisión numérica y producir salidas estructuradas.

Estas son tareas engañosamente difíciles.

Un modelo de chat general puede resumir bien una hoja de cálculo mientras sigue cometiendo un error sutil en:

  • Un filtro de fecha.
  • Un subtotal.
  • Una búsqueda entre hojas.
  • Una conversión de unidades.
  • Un valor decimal.
  • Un mapeo de categorías.

Para uso empresarial, un número incorrecto puede invalidar un documento completo.

El editor de la fuente probó a Wenxin con un archivo de información de empresa y le pidió que produjera un plan de negocio del Q2 2026 como documento de Word.

Según el registro de la prueba, el agente:

  1. Usó Pandoc para extraer el archivo subido.
  2. Estructuró la información de la fuente.
  3. Cargó una capacidad de procesamiento de Word.
  4. Generó un documento formateado.
  5. Devolvió un documento que contiene más de 6000 caracteres chinos y 148 párrafos.

Esta imagen muestra los resultados de la prueba en la que el asistente Baidu Wenxin completó la tarea de generar un plan de negocio como agente inteligente. La parte superior de la imagen muestra al usuario dando instrucciones al agente para redactar el plan de negocio del Q2 2026 para la startup de hardware de IA "Zhixin Future", requiriendo generar un documento de Word que cumpla con los requisitos de secciones especificados; la parte inferior presenta el resultado de la ejecución, mostrando que el documento de Word se generó exitosamente, con aproximadamente 6000 caracteres y 148 párrafos, cumpliendo con los requisitos de extensión y pasando la verificación, además de ofrecer la opción de descarga del documento, lo que demuestra visualmente la capacidad de Wenxin en procesamiento de datos y generación de contenido estructurado.

Esto muestra la diferencia entre el trabajo de chat y el de agente.

Un modelo de chat podría escribir el plan dentro de la conversación.

Un flujo de trabajo de agente puede hacer esto:

Leer archivo fuente
→ extraer información estructurada
→ redactar contenido
→ formatear documento de Word
→ validar salida
→ devolver un archivo

El artefacto, no la respuesta en prosa, se convierte en el producto final.

Creación de Contenido: 99.44

Wenxin obtuvo 99.44 en creación de contenido.

En un punto de referencia de agentes, la creación de contenido no es simplemente escritura creativa.

El sistema puede necesitar satisfacer múltiples restricciones a la vez:

  • Formato requerido.
  • Tono.
  • Extensión.
  • Estructura de secciones.
  • Audiencia.
  • Tipo de archivo.
  • Base factual.
  • Presentación visual.

Un borrador puede ser gramaticalmente correcto y aun así fallar porque

ignora el formato solicitado.

Por eso los benchmarks de productos puntúan cada vez más la finalización en lugar de solo la calidad lingüística.

Puntuación en Codificación: 90.28

La categoría más baja de XClaw para Wenxin fue codificación, con 90.28.

Sigue siendo una puntuación sólida, pero la brecha en comparación con la creación de contenido y el procesamiento de datos es reveladora.

Los agentes de codificación deben gestionar un bucle operativo más amplio:

Entender el requisito
→ elegir la pila tecnológica
→ escribir archivos
→ ejecutar o previsualizar
→ inspeccionar errores
→ corregir
→ verificar la interacción
→ empaquetar el resultado

El editor de la fuente probó el producto con una solicitud de una sola frase para un simulador de sistema solar en 3D.

El flujo de trabajo informado utilizó Three.js y devolvió una aplicación HTML de un solo archivo de 31 KB.

El artículo también muestra una página didáctica de simulación meteorológica generada mediante un flujo de trabajo web interactivo similar.

Estos son demos ilustrativos, no elementos oficiales del benchmark XClaw.

La imagen es la portada del plan de negocio del segundo trimestre de 2026, con fondo azul claro y el texto “智芯未来 - Plan de negocio Q2 2026” en la parte superior. El título es “Plan de negocio del segundo trimestre de 2026” y el subtítulo, “Enfoque en hardware inteligente con IA: de ‘Hecho en China’ a ‘Inteligencia creada en China’”. Abajo se muestra el nombre de la empresa “智芯未来科技有限公司”, marcado como documento confidencial, solo para referencia interna y de inversores interesados, con fecha de junio de 2026. Esta portada se encuentra al inicio del documento e introduce el contenido posterior sobre el plan de negocio de hardware inteligente con IA.

Puntuación en Análisis de Investigación: 96.44

Wenxin obtuvo 96.44 en análisis de investigación.

Una tarea de investigación seria puede implicar:

  1. Comprender la pregunta.
  2. Dividirla en subpreguntas.
  3. Buscar en múltiples fuentes.
  4. Evaluar la calidad de las fuentes.
  5. Comparar afirmaciones contradictorias.
  6. Verificar fechas.
  7. Extraer valores numéricos.
  8. Construir un argumento estructurado.
  9. Añadir citas.
  10. Producir un informe.

El artículo fuente describe dos casos de prueba.

Investigación sobre el problema tridimensional de Kakeya

El editor pidió a Wenxin que investigara la conjetura tridimensional de Kakeya en el contexto de la medallista Fields Hong Wang.

El comportamiento informado del agente fue:

  1. Planificar un proceso de investigación en seis pasos.
  2. Lanzar varios subagentes en paralelo.
  3. Buscar en 16 fuentes académicas.
  4. Producir un documento Markdown.
  5. Producir un resultado HTML interactivo de 62 KB.

Esta imagen muestra los resultados de investigación más recientes del asistente Wenxin sobre la conjetura tridimensional de Kakeya, relacionada con la medalla Fields. La investigación avanzó según un plan predefinido de seis pasos: se organizaron las definiciones centrales de la conjetura, la trayectoria de investigaciones previas y los avances innovadores; se desglosó la lógica interdisciplinaria de áreas relacionadas; se recopilaron 16 fuentes académicas autorizadas para completar el estudio; y finalmente se generaron un documento Markdown de 63,746 KB y un informe HTML interactivo y visualizado de 62,83 KB. El resultado en conjunto corresponde directamente al caso de estudio del problema tridimensional de Kakeya mencionado en el documento.

La cantidad de fuentes no es por sí sola una métrica de calidad.

Lo que importa es si el agente final utiliza fuentes autorizadas, atribuye correctamente las afirmaciones, resuelve conflictos, evita datos desactualizados y separa los hechos de la interpretación.

Comparación de modelos recientes de IA y precios

El editor también pidió a Wenxin que analizara las capacidades y los precios de los principales modelos nacionales e internacionales del mes anterior.

El artículo dice que el agente:

  • Cargó una habilidad de investigación de la industria.
  • Buscó en 45 fuentes en dos rondas.
  • Detectó incertidumbre en algunas cifras clave.
  • Realizó otra búsqueda específica en 29 fuentes.
  • Verificó de forma cruzada los precios.
  • Produjo un informe de aproximadamente 7.000 caracteres chinos con gráficos.

La imagen muestra la portada del informe de análisis de capacidades y precios de los principales modelos de IA nacionales e internacionales de julio de 2026. En la parte superior de la portada se muestra la fecha "julio de 2026", en el centro aparece el título principal en letras grandes "Informe de análisis de capacidades y precios de los principales modelos de IA nacionales e internacionales", y en la parte inferior se indica en letra pequeña "—Evaluación integral basada en Artificial Analysis, LMSYS Arena y datos públicos de los fabricantes—". El informe está marcado con verificación de plagio y la página muestra 1/76, con 6900 palabras. Esta imagen está relacionada con el contenido de "análisis de capacidades y precios de los principales modelos de IA nacionales e internacionales" en el documento y es la portada del informe.

El ciclo de investigación útil es:

Buscar
→ identificar incertidumbre
→ buscar de nuevo
→ comparar fuentes
→ resolver o marcar discrepancia
→ escribir

Esa pasada de verificación adicional es a menudo donde mejora la calidad de la investigación.

Un segundo primer lugar: PinchBench v2

El resultado de SuperCLUE siguió a un primer lugar en julio en PinchBench v2.

PinchBench fue creado por Kilo para evaluar agentes en flujos de trabajo del mundo real en lugar de puntos de referencia tradicionales de preguntas y respuestas.

El lanzamiento de PinchBench 2.0 de Kilo amplió el punto de referencia a 148 tareas y añadió reglas más estrictas de calificación y clasificación.

En la instantánea de la clasificación de julio reproducida por el artículo fuente, el sistema de Baidu aparecía como:

Orion-Mission-Mode

con:

Mejor puntuación:    94,6%
Puntuación media: 94,4%

La imagen es una captura de pantalla de la clasificación de puntuaciones de los sistemas relacionados con PinchBench v2, que presenta los indicadores clave y las puntuaciones de cada sistema de IA. En la imagen, las barras de color naranja están etiquetadas como "Average Score", y el Orion-Mission-Mode en la parte superior alcanza una puntuación media del 94,6%, ocupando el primer lugar con un 94,4%, superando ampliamente a otros sistemas participantes como anthropic/claude-opus-4.1 y qwen1.5/3.7-max. La captura también muestra las etiquetas de capacidades específicas de cada sistema, incluyendo Writing Content, Creative, Data Analysis, entre otras, presentando de forma directa el rendimiento de cada modelo en diferentes dimensiones de tareas, en consonancia con el contenido mencionado en el documento sobre que Wenxin Assistant ocupó el primer lugar en la instantánea de julio de este punto de referencia.

La captura de pantalla sitúa a Orion Mission Mode por delante de sistemas basados en modelos de Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI y otros en esa instantánea concreta.

La palabra importante es instantánea.

Las clasificaciones de agentes cambian rápidamente.

Los modelos, los entornos de evaluación, los prompts, las políticas de herramientas y los envíos a los puntos de referencia pueden actualizarse.

Por lo tanto, un primer lugar en julio debe citarse con su fecha en lugar de tratarse como una clasificación global permanente.

Qué prueba realmente PinchBench v2

Kilo describe PinchBench 2.0 como un punto de referencia de flujos de trabajo de agentes del mundo real.

Contiene tareas que requieren que un sistema utilice herramientas y complete operaciones en lugar de simplemente seleccionar una respuesta.

El punto de referencia cubre categorías como:

  • Redacción.
  • Trabajo creativo.
  • Análisis de datos.
  • Trabajo de investigación y conocimiento.
  • Código y operaciones.
  • Otros flujos de trabajo basados en computadora.

El artículo fuente dice que 59 entradas de modelos o agentes estaban representadas en la instantánea de la clasificación.

Esa cifra puede cambiar a medida que se añaden o actualizan envíos.

El punto de referencia en sí es más estable que la población de la clasificación.

El lanzamiento oficial de PinchBench 2.0 describe:

148 tareas

La fuente y varios informes de julio describen la evaluación de Wenxin en 147 tareas completadas, mientras que también describen PinchBench como un punto de referencia de 148 tareas.

La interpretación más segura es:

PinchBench v2 contiene 148 tareas; la evaluación reportada de Orion Mission Mode puede haber producido resultados puntuados en 147 de ellas en esa instantánea.

Esta distinción importa porque los informes de puntos de referencia a menudo mezclan el tamaño del punto de referencia con el número de tareas completadas con éxito.

ejecuciones completadas.

Mejor Puntuación vs. Puntuación Promedio

La fuente enfatiza que el Modo Misión Orion registró:

94.6% mejor puntuación
94.4% puntuación promedio

La diferencia de 0.2 puntos es pequeña.

Eso sugiere una baja variación entre las ejecuciones reportadas.

Sin embargo, no debe interpretarse como una garantía universal de estabilidad.

La variación del benchmark puede depender de:

  • Número de repeticiones.
  • Temperatura de muestreo.
  • Disponibilidad de herramientas.
  • Sitios web externos.
  • Condiciones de red.
  • Comportamiento del evaluador.
  • Tiempos de espera del agente.
  • Actualizaciones del modelo.

La lección práctica es simplemente que la ejecución reportada de PinchBench no se basó en un único resultado afortunado y aislado.

Su promedio se mantuvo cercano a su mejor puntuación.

El Agente Es Más Que el Modelo Subyacente

Uno de los puntos más importantes del artículo fuente es que el benchmark evalúa un producto o sistema de agente, no un modelo de lenguaje desnudo.

El agente de tareas puede combinar:

  • Un modelo fundacional.
  • Búsqueda.
  • Memoria.
  • Manejo de archivos.
  • Selección de herramientas.
  • Planificación.
  • Subagentes.
  • Habilidades de generación de documentos.
  • Acceso a navegador o web.
  • Ejecución de código.
  • Validación.

Esto puede expresarse como:

Resultado del agente
=
capacidad del modelo
+
herramientas
+
memoria
+
planificación
+
búsqueda
+
entorno de ejecución
+
verificación

Por eso hay que tener cuidado al decir:

“El modelo X superó al modelo Y.”

La tabla de clasificación puede estar comparando en realidad dos sistemas de agente diferentes que usan distintas herramientas y orquestación.

Una descripción más precisa es:

“El sistema de agente X obtuvo una puntuación superior al sistema de agente Y bajo esta configuración de benchmark.”

Esa redacción se vuelve cada vez más importante a medida que los productos de IA se transforman en sistemas de software complejos.

De Responder Preguntas a Completar Trabajos

El artículo fuente presenta 2026 como el año en que el estándar para un producto de IA útil está cambiando.

La interacción anterior se veía así:

El usuario pregunta
→ el modelo responde
→ el usuario realiza el trabajo

El patrón emergente de agente se ve así:

El usuario da un objetivo
→ el agente planifica
→ el agente recopila contexto
→ el agente llama a herramientas
→ el agente crea archivos
→ el agente verifica resultados
→ el agente entrega el artefacto

Esto cambia lo que los usuarios notan.

Un modelo puede ser extremadamente conocedor pero frustrante si no puede:

  • Recordar requisitos anteriores.
  • Abrir el archivo.
  • Dar formato a la hoja de cálculo.
  • Crear el documento solicitado.
  • Completar todos los pasos.
  • Corregir sus propios errores.

La nueva condición de éxito se acerca más a:

¿La tarea realmente se completó?

que a:

¿La respuesta fue impresionante?

Punto de Entrada de Tareas en Wenxin

El artículo de BAAI muestra la opción “Tarea” directamente dentro de la interfaz de Wenxin.

La imagen muestra la interfaz del Asistente Baidu Wenxin. En la parte superior hay un cuadro de diálogo que dice “¿Hoy quieres ser un ‘experto en eficiencia’ o prefieres buscar un rincón para charlar?”, y debajo hay un campo de entrada que dice “Ayúdame a escribir una plantilla de autopresentación para entrevista”. En la parte inferior de la interfaz hay varias opciones de funciones, entre las cuales la opción “Tarea” está resaltada con un recuadro rojo. Esta imagen está relacionada con el “Punto de Entrada de Tareas en Wenxin” mencionado anteriormente, mostrando visualmente la ubicación de la opción “Tarea” en la interfaz de Wenxin, confirmando el contenido del artículo de BAAI sobre que la opción “Tarea” está directamente dentro de la interfaz de Wenxin.

El sitio web oficial de Wenxin de Baidu describe el producto como un asistente de IA multimodal para:

  • Creación confiable.
  • Búsqueda profunda.
  • Uso inteligente de herramientas.
  • Trabajo con documentos.
  • Redacción.
  • Imágenes.

Uso entre dispositivos.

La aplicación de Baidu también lista Asistente Wenxin como una función de IA integrada para investigación profunda, búsqueda, redacción, generación de imágenes, generación de video y asistencia conversacional.

Esto confirma que la IA orientada a tareas ha llegado a las superficies de consumo principales de Baidu, en lugar de permanecer como un experimento solo para desarrolladores.

¿Es Asistente Wenxin realmente gratis e ilimitado?

El artículo fuente destaca repetidamente un punto comercial:

Asistente Wenxin es gratuito y no tiene muro de pago.

Las páginas oficiales de Wenxin de Baidu ofrecen actualmente acceso gratuito o experiencia gratuita.

Eso es fácil de verificar.

La afirmación más fuerte —permanentemente ilimitado para cada función de agente de tareas— es más difícil de verificar a partir de una página de política oficial estable.

Los productos de IA pueden introducir:

  • Cuotas diarias.
  • Límites de concurrencia.
  • Límites específicos por función.
  • Promociones temporales.
  • Niveles de cuenta.
  • Restricciones regionales.
  • Cambios de precio futuros.

Para publicación, la redacción más segura es:

Asistente Wenxin está actualmente disponible para usuarios individuales con opciones de acceso gratuito, y la experiencia de tareas mostrada en el artículo fuente no requirió una suscripción de pago.

No construyas una comparación de costos a largo plazo en torno a "ilimitado para siempre" a menos que Baidu publique una política específica que lo garantice.

Por qué la experiencia de búsqueda puede ayudar a un agente

La sección final del artículo fuente argumenta que el historial de búsqueda de Baidu le da una ventaja estructural en el diseño de agentes.

Hay una analogía real.

Un motor de búsqueda maneja algo como:

Consulta del usuario
→ comprensión de intención
→ descomposición de consulta
→ recuperación
→ clasificación
→ agregación de resultados
→ respuesta

Un agente maneja:

Objetivo del usuario
→ comprensión de intención
→ descomposición de tarea
→ selección de herramientas
→ ejecución
→ agregación de resultados
→ entrega

Los dos pipelines no son idénticos.

Un agente tiene un espacio de acción mucho más grande y conlleva un mayor riesgo de ejecución.

Pero varias capacidades técnicas se transfieren de forma natural:

  • Comprensión de intención.
  • Reescritura de consultas.
  • Recuperación.
  • Clasificación de fuentes.
  • Contexto de sesión.
  • Manejo de frescura.
  • Deduplicación.
  • Agregación de evidencia.

Esto es especialmente relevante para los agentes de investigación.

Un sistema que ya tiene una infraestructura de búsqueda sólida puede construir flujos de trabajo más profundos sobre ella.

Comprensión de consultas de búsqueda vs. comprensión de tareas de agente

Considera una solicitud de búsqueda tradicional:

Encuentra el vuelo más barato de Pekín a Shanghái.

Un sistema de búsqueda puede necesitar inferir:

  • Origen.
  • Destino.
  • Fechas de viaje.
  • Preferencia de precio.
  • Inventario de vuelos elegible.
  • Orden de clasificación.

A un agente se le pide:

Encuentra el vuelo Pekín–Shanghái más barato y prepara un itinerario.

puede necesitar agregar:

  • Selección de herramientas.
  • Múltiples búsquedas.
  • Comparación.
  • Verificación de restricciones.
  • Generación de archivos.
  • Posiblemente un paso de calendario o reserva.

La primera mitad del problema se parece a la búsqueda.

La segunda mitad es orquestación de acciones.

La experiencia de búsqueda proporciona componentes útiles, pero la calidad del agente aún depende de la capa de ejecución.

La memoria y las sesiones de búsqueda están relacionadas, pero no son lo mismo

La fuente también conecta la puntuación de memoria de Wenxin con la experiencia de Baidu en la comprensión de sesiones de búsqueda.

Hay

cierta superposición conceptual.

Ambos sistemas necesitan inferir qué información de interacciones anteriores sigue siendo relevante.

Una sesión de búsqueda puede contener:

Consulta 1: coches eléctricos
Consulta 2: autonomía superior a 600 km
Consulta 3: menos de 250 000 RMB

El sistema debería entender que la tercera consulta sigue tratando sobre coches eléctricos.

Un sistema de memoria de agente tiene una tarea más difícil.

Puede necesitar recordar:

  • Preferencias del usuario.
  • Restricciones de la tarea.
  • Datos derivados de archivos.
  • Decisiones.
  • Salidas de herramientas.
  • Estado temporal.
  • Preferencias a largo plazo.

La experiencia en sesiones de búsqueda es útil, pero la memoria persistente del agente requiere mecanismos adicionales de almacenamiento, recuperación, privacidad y relevancia.

El análisis de investigación es donde la pila de búsqueda de Baidu es más directamente relevante

Entre las cinco categorías de XClaw, el análisis de investigación es el lugar más claro donde la experiencia de búsqueda de Baidu puede transferirse directamente.

Un agente de investigación necesita:

  • Cobertura de búsqueda.
  • Información actualizada.
  • Expansión de consultas.
  • Clasificación.
  • Manejo de citas.
  • Comparación de fuentes.
  • Comprensión de entidades.
  • Recuperación multilingüe.

La documentación oficial de Qianfan AI Assistant de Baidu también describe una solución de agente empresarial que integra Búsqueda de Baidu, Baidu Baike, búsqueda de imágenes, gestión de conversaciones, gestión de memoria y capacidades documentales.

Eso no demuestra que el producto de consumo Wenxin utilice exactamente la misma implementación.

Sí demuestra que Baidu está construyendo una pila de agente común en torno a búsqueda, memoria, herramientas y recuperación multimodal en toda su cartera de productos.

Lo que las dos victorias en los puntos de referencia no demuestran

Las puntuaciones altas en los puntos de referencia son evidencia útil.

No son la evaluación completa.

No demuestran un liderazgo global permanente

Las tablas de clasificación cambian.

Los nuevos modelos y nuevos envíos de agentes pueden superar al líder actual.

No demuestran que cada tarea alcanzará una puntuación del 97 %

XClaw agrega tareas y categorías seleccionadas.

El flujo de trabajo real de un usuario puede ser muy diferente.

No aíslan el modelo fundacional

La puntuación pertenece al asistente completo o a la pila del agente.

No miden todos los problemas de seguridad

Un agente que puede completar tareas de manera eficiente aún puede realizar llamadas de herramientas inseguras o exponer información sensible en un entorno diferente.

No garantizan precisión fáctica

Los agentes de investigación pueden citar fuentes débiles o malinterpretar datos cambiantes.

No demuestran uso gratuito ilimitado

Los precios y las cuotas de los productos son políticas comerciales, no propiedades de los puntos de referencia.

Cómo evaluar el asistente Wenxin usted mismo

Una prueba personal útil debería parecerse a su trabajo real.

No haga solo preguntas triviales.

Dé al agente una tarea completa.

Prueba 1: Memoria

Proporcione cinco restricciones al inicio de una conversación larga.

Después de varios turnos no relacionados, pida un artefacto final y verifique si las cinco se conservan.

Prueba 2: Procesamiento de datos

Cargue:

  • Una hoja de cálculo.
  • Un PDF.
  • Un archivo de texto corto.

Pida al agente que los combine en un solo informe.

Verifique cada valor numérico de forma independiente.

Prueba 3: Investigación

Elija un tema con información cambiante.

Requiera:

  • Fuentes primarias.
  • Fechas de publicación.
  • Comparación de fuentes en conflicto.
  • Enlaces directos.
  • Una lista de afirmaciones inciertas.

Prueba 4: Documento

Creación

Solicite un artefacto en Word, PowerPoint, hoja de cálculo o HTML.

Evalúe:

  • Estructura.
  • Formato.
  • Integridad.
  • Capacidad de descarga.
  • Si el archivo realmente se abre.

Prueba 5: Codificación

Solicite una pequeña aplicación interactiva.

Verifique:

  • Si se ejecuta.
  • Si todas las funciones solicitadas existen.
  • Si los errores se corrigen.
  • Si el archivo final es autónomo cuando se solicita.

Prueba 6: Ejecución de Largo Alcance

Asigne una tarea que requiera varias herramientas.

Observe si el sistema:

  1. Elabora un plan.
  2. Elige herramientas razonables.
  3. Se recupera de fallos.
  4. Evita repetir trabajo.
  5. Verifica el resultado final.

Una Mejor Manera de Comparar Productos de Agentes

Al comparar Wenxin con otros agentes, utilice una tabla más amplia que la "puntuación de referencia".

Dimensión Qué medir
Éxito de la tarea ¿Se completó el trabajo solicitado?
Memoria ¿Se conservaron las restricciones anteriores?
Precisión ¿Son correctos los números y las afirmaciones?
Calidad de la investigación ¿Son las fuentes autorizadas y actuales?
Fiabilidad de las herramientas ¿Las llamadas a herramientas tienen éxito de manera constante?
Calidad del artefacto ¿Los archivos son utilizables sin reparación manual?
Recuperación ¿Puede el agente corregir pasos fallidos?
Latencia ¿Cuánto tiempo tarda una tarea completa?
Costo ¿Cuánto cuesta un resultado aceptado?
Privacidad ¿Cómo se manejan los archivos cargados y la memoria?
Disponibilidad ¿Las funciones clave son gratuitas, con límite de cuota o de pago?

Esto ofrece una imagen más realista que una sola posición en una clasificación.

El Cambio Mayor: "¿Puede Entregar?"

El punto más fuerte del artículo original es más amplio que Baidu.

La competencia de agentes está cambiando la definición de calidad de la IA.

Para la primera generación de chatbots, los usuarios se centraban en la calidad de las respuestas.

Para los agentes de tareas actuales, las preguntas clave están pasando a ser:

  • ¿Puede mantener el contexto?
  • ¿Puede encontrar la información correcta?
  • ¿Puede operar herramientas?
  • ¿Puede crear el archivo?
  • ¿Puede completar un flujo de trabajo de múltiples pasos?
  • ¿Puede verificar su propio resultado?
  • ¿Puedo confiarle trabajo repetido?

Por eso, puntos de referencia como XClaw y PinchBench están atrayendo atención.

Acercan la evaluación al trabajo de producción real.

Todavía hay una larga distancia entre un punto de referencia y un despliegue empresarial.

Pero la dirección es útil:

Punto de referencia de conocimiento
→ punto de referencia de razonamiento
→ punto de referencia de uso de herramientas
→ punto de referencia de tareas de extremo a extremo
→ resultado de producción real

El último paso es, en última instancia, el que importa.

Preguntas Frecuentes

¿Qué puntuación recibió el Asistente de Baidu Wenxin en SuperCLUE XClaw?

La instantánea de agosto de 2026 de SuperCLUE XClaw otorga al Asistente de Wenxin una puntuación general de 97,62, ubicándolo en primer lugar entre los productos mostrados. Sus puntuaciones por categoría fueron 90,28 en codificación, 99,44 en creación de contenido, 98,86 en procesamiento de datos, 96,44 en análisis de investigación y 100 en memoria.

¿Qué significa una puntuación de memoria de 100?

Significa que Wenxin recibió la puntuación máxima en las tareas de memoria incluidas en esa evaluación de XClaw. No significa que el asistente nunca pueda olvidar el contexto en cualquier conversación posible del mundo real.

¿Qué es PinchBench v2?

PinchBench v2 es un punto de referencia de agentes creado por Kilo que evalúa sistemas en tareas informáticas y de flujo de trabajo del mundo real. La versión 2.0 contiene 148 tareas y está diseñada para medir

ejecución de extremo a extremo en lugar de simples respuestas a preguntas.

¿Cuál fue la puntuación de Wenxin en PinchBench v2?

En una captura de la clasificación de julio de 2026, el agente de tareas de Baidu apareció como Orion Mission Mode con una mejor puntuación del 94.6% y una puntuación media del 94.4%. Las clasificaciones cambian con el tiempo, por lo que debe incluirse la fecha de la captura al citar el resultado.

¿Es Wenxin Assistant completamente gratuito?

Las páginas oficiales de Wenxin de Baidu ofrecen actualmente opciones de acceso gratuito o experiencia gratuita, y el artículo fuente indica que las funciones de tareas demostradas estaban disponibles sin suscripción de pago. No se encontró una garantía oficial estable de uso ilimitado permanente para todas las funciones, por lo que las cuotas actuales deben verificarse directamente en el producto.

¿Puede Wenxin Assistant generar documentos de Word y páginas web?

El artículo fuente muestra sesiones de prueba en las que Wenxin generó un plan de negocio formateado en Word y páginas HTML interactivas. Estos ejemplos demuestran el flujo de trabajo de tareas del producto, pero no garantizan que cada instrucción o entorno produzca el mismo resultado.

¿Por qué la tecnología de búsqueda de Baidu podría ayudar a sus agentes de IA?

La búsqueda y los agentes comparten capacidades como la comprensión de intenciones, la descomposición de consultas, la recuperación, la clasificación, la agregación de fuentes y el contexto de sesión. Los agentes añaden una capa de ejecución más amplia, que incluye llamadas a herramientas, creación de archivos, memoria, planificación y acción.

¿Son XClaw y PinchBench puntos de referencia de modelos?

No en el sentido estricto. Evalúan sistemas de productos o agentes que pueden combinar modelos con herramientas, memoria, búsqueda, instrucciones, orquestación y entornos de ejecución. Por lo tanto, sus puntuaciones deben atribuirse a la configuración completa del agente.

Herramientas relacionadas

  • Baidu Wenxin: El asistente de IA multimodal oficial de Baidu para búsqueda, creación, documentos y trabajo orientado a tareas.
  • SuperCLUE XClaw: El punto de referencia chino de agentes orientado a productos citado en el artículo fuente.
  • PinchBench: El punto de referencia del mundo real de Kilo para flujos de trabajo de agentes de codificación y uso de computadoras.
  • Pandoc: Una herramienta de conversión de documentos utilizada en el flujo de trabajo de prueba de la fuente para extraer y transformar contenido de documentos.
  • Three.js: Una biblioteca gráfica 3D de JavaScript utilizada en el ejemplo del Sistema Solar generado en el artículo fuente.
  • Baidu Qianfan: La plataforma empresarial de Baidu para modelos, agentes, datos y desarrollo de aplicaciones de IA.
  • Baidu AgentBuilder: La plataforma de Baidu para crear y publicar agentes personalizados basados en Wenxin.

Enlaces relacionados

Evaluación](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): La página de referencia del artículo original.

Resumen

El Asistente Wenxin de Baidu ocupó el primer lugar en la instantánea de XClaw de SuperCLUE de agosto de 2026 con 97,62 puntos, incluida una puntuación perfecta de 100 en memoria y puntuaciones superiores a 96 en procesamiento de datos, creación de contenido y análisis de investigación.

Ese resultado sigue a la instantánea de la tabla de clasificación de PinchBench v2 de julio, en la que el Modo Misión Orión de Baidu registró una mejor puntuación del 94,6% y una puntuación media del 94,4%. Los puntos de referencia utilizan tareas diferentes, pero ambos enfatizan la finalización real de tareas en lugar de simplemente responder preguntas.

La conclusión más importante no es que un asistente haya "ganado" permanentemente la carrera de agentes. Las clasificaciones de agentes cambian rápidamente, y los sistemas evaluados incluyen modelos, herramientas, búsqueda, memoria, indicaciones y orquestación.

Lo que demuestran ambos resultados es que la evaluación de IA avanza hacia un estándar más práctico: no si el modelo suena inteligente, sino si el agente puede completar el trabajo y devolver un resultado utilizable.