Assistente Wenxin da Baidu lidera SuperCLUE XClaw após liderar PinchBench v2

O Assistente Wenxin da Baidu conquistou o primeiro lugar em mais um benchmark de estilo agente. Na avaliação de produto XClaw de agosto de 2026 da SuperCLUE, o Assistente Wenxin recebeu uma pontuação geral de 97

发布于 2026年8月7日generalGEO 评分: 04 次阅读
Assistente Wenxin da Baidu lidera SuperCLUE XClaw após liderar PinchBench v2

Assistente Wenxin da Baidu Lidera SuperCLUE XClaw Após Dominar PinchBench v2

Introdução

O Assistente Wenxin da Baidu conquistou o primeiro lugar em mais um benchmark voltado para agentes.

Na avaliação de produto XClaw da SuperCLUE de agosto de 2026, o Assistente Wenxin obteve uma pontuação geral de 97,62, a maior pontuação no recorte publicado.

Suas pontuações por categoria foram:

Capacidade Pontuação
Codificação 90,28
Criação de conteúdo 99,44
Processamento de dados 98,86
Análise de pesquisa 96,44
Memória 100,00

O resultado chegou menos de três semanas após outra forte exibição.

Em um recorte de julho do PinchBench v2, o agente de tarefas da Baidu — submetido como Orion Mission Mode — registrou uma melhor pontuação de 94,6% e uma pontuação média de 94,4%, colocando-se no topo daquele ranking.

Os dois benchmarks são diferentes. O SuperCLUE XClaw foca em produtos de agente chineses e entregas práticas em cinco dimensões de capacidade. O PinchBench v2, criado pela Kilo, é construído em torno de tarefas reais de computador e automação.

Juntos, eles apontam para a mesma mudança:

A avaliação de agentes está migrando de "O modelo consegue responder corretamente?" para "O sistema consegue concluir o trabalho e entregar algo utilizável?"

Um modelo de linguagem pode saber a resposta e ainda assim falhar como agente porque esquece requisitos, escolhe a ferramenta errada, lida mal com arquivos, para no meio de um fluxo de trabalho ou retorna o artefato errado.

Isso torna os últimos resultados do Wenxin mais sobre execução de tarefas do que sobre inteligência bruta do modelo de linguagem.

Esta imagem mostra o ranking de pontuações médias de agosto de 2026 da avaliação de produto SuperCLUE-XClaw, apresentando claramente o ranking e as pontuações correspondentes dos produtos dos fabricantes participantes. O Assistente Wenxin da Baidu ficou em 1º lugar com 97,62 pontos; o MiMoClaw da Xiaomi ficou em 2º com 96,74 pontos; o WorkBuddy da Tencent e o KimiClaw da Moonshot ficaram em 2º e 3º, com 96,61 e 96,01 pontos respectivamente; o MaxClaw da MiniMax ficou em 4º, com 94,79 pontos. A página indica o critério de pontuação e o lote de dados do ranking, refletindo diretamente o desempenho de capacidade de cada produto na avaliação de produtos inteligentes em chinês, correspondendo ao conteúdo mencionado no documento sobre o Assistente Wenxin ter obtido a maior pontuação na avaliação SuperCLUE XClaw.

Assistente Wenxin Conquista o Primeiro Lugar no SuperCLUE XClaw

A SuperCLUE descreve o XClaw como uma avaliação orientada a produto para assistentes de IA estilo "Claw".

Em vez de depender principalmente de questões de múltipla escolha, o benchmark enfatiza entregas concluídas.

O recorte de agosto de 2026 classifica os principais produtos da seguinte forma:

Classificação Produto Pontuação
1 Assistente Wenxin da Baidu 97,62
2 MiMoClaw 96,74
3 WorkBuddy 96,61
4 KimiClaw 96,01
5 MaxClaw 94,79

O benchmark avalia cinco dimensões:

  1. Processamento de dados.
  2. Criação de conteúdo.
  3. Memória.
  4. Codificação.
  5. Análise de pesquisa.

A lógica básica é direta: o agente recebe uma tarefa e deve produzir um artefato ou resultado final que possa ser efetivamente avaliado.

Isso faz com que o seguimento de instruções, o manuseio de arquivos, o uso de ferramentas e a execução de longo horizonte façam parte da pontuação.

![A imagem mostra a classificação do Assistente Wenxin da Baidu nas dimensões de capacidade (pontuações médias) do SuperCLUE XClaw. Suas pontuações nas cinco dimensões — desenvolvimento de código, criação de conteúdo, processamento de dados, análise de pesquisa e capacidade de memória — são respectivamente 90,28, 99,44, 98,86, 96,44 e 100,00. Esta imagem corresponde à descrição do SuperCLUE XClaw como uma avaliação orientada a produto para assistentes de IA estilo "Claw" mencionada acima, apresentando diretamente o desempenho do Assistente Wenxin da Baidu nesse sistema de avaliação, fornecendo suporte de dados para sua conquista do primeiro lugar no SuperCLUE XClaw.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/08/8091b61c-6902-450f-b7a9-6798e0b4b1a9-85d3c984-465d-4f02-a847-63b0ef72d60d.png)

Memória Atinge 100

A pontuação de categoria mais impressionante é 100,00 em memória.

A memória é importante porque o trabalho real raramente cabe em um único prompt isolado.

Um usuário pode fornecer restrições no início de uma conversa e esperar que o agente as respeite muito mais tarde.

Por exemplo:

Turno 1:
Use apenas dados do 2º trimestre de 2026.

Turno 3:
Mantenha o relatório com menos de 10 páginas.

Turno 6:
Use a mesma segmentação de produtos da planilha.

Turno 10:
Gere o documento final em Word.

Um agente que esquece a primeira instrução pode produzir um entregável polido, porém inutilizável.

A memória, portanto, afeta:

  • Retenção de requisitos.
  • Planejamento em múltiplas etapas.
  • Consistência.
  • Retrabalho.
  • Confiança do usuário.
  • Conclusão de tarefas de longa duração.

Uma pontuação perfeita em uma categoria em um benchmark não significa que o produto nunca esquecerá informações em sessões reais arbitrárias. Isso mostra que o Wenxin teve um desempenho extremamente bom nas tarefas de memória incluídas nesta avaliação da XClaw.

Processamento de Dados: Pontuação 98,86

O Assistente Wenxin recebeu 98,86 em processamento de dados.

A fonte descreve esta categoria como um teste para verificar se o sistema consegue interpretar campos, combinar informações, preservar precisão numérica e produzir saídas estruturadas.

Estas são tarefas enganosamente difíceis.

Um modelo de chat geral pode resumir bem uma planilha, mas ainda cometer um erro sutil em:

  • Um filtro de data.
  • Um subtotal.
  • Uma consulta entre planilhas.
  • Uma conversão de unidades.
  • Um valor decimal.
  • Um mapeamento de categorias.

Para uso empresarial, um número incorreto pode invalidar um documento inteiro.

O publicador da fonte testou o Wenxin com um arquivo de informações de uma empresa e pediu que ele produzisse um plano de negócios do 2º trimestre de 2026 como documento Word.

De acordo com o registro do teste, o agente:

  1. Usou Pandoc para extrair o arquivo enviado.
  2. Estruturou as informações da fonte.
  3. Carregou uma capacidade de processamento de texto.
  4. Gerou um documento formatado.
  5. Retornou um documento contendo mais de 6.000 caracteres chineses e 148 parágrafos.

Esta imagem mostra o resultado do teste do Assistente Wenxin da Baidu como agente inteligente na geração de um plano de negócios. A parte superior da imagem mostra o usuário dando instruções ao agente para escrever um plano de negócios do 2º trimestre de 2026 para a startup de hardware de IA "ZhiXin WeiLai", exigindo a geração de um documento Word com as seções especificadas; a parte inferior apresenta o resultado da execução, mostrando que o documento Word foi gerado com sucesso, com cerca de 6.000 caracteres e 148 parágrafos, atendendo aos requisitos de extensão e passando na validação, além de oferecer a opção de download do documento, demonstrando visualmente a capacidade do Assistente Wenxin em processamento de dados e geração de conteúdo estruturado.

Isso mostra a diferença entre trabalho de chat e trabalho de agente.

Um modelo de chat pode escrever o plano dentro da conversa.

Um fluxo de trabalho de agente pode fazer isto:

Ler arquivo de origem
→ extrair informações estruturadas
→ redigir conteúdo
→ formatar documento Word
→ validar saída
→ retornar um arquivo

O artefato, não a resposta em prosa, torna-se o produto final.

Criação de Conteúdo: Pontuação 99,44

O Wenxin obteve 99,44 em criação de conteúdo.

Em um benchmark de agentes, criação de conteúdo não é simplesmente escrita criativa.

O sistema pode precisar atender a múltiplas restrições ao mesmo tempo:

  • Formato exigido.
  • Tom.
  • Extensão.
  • Estrutura de seções.
  • Público-alvo.
  • Tipo de arquivo.
  • Fundamentação factual.
  • Apresentação visual.

Um rascunho pode ser gramaticalmente correto e ainda assim falhar porque

ignora o formato solicitado.

É por isso que os benchmarks de produtos avaliam cada vez mais a conclusão, em vez de apenas a qualidade linguística.

Pontuação em Codificação: 90,28

A menor categoria XClaw do Wenxin foi codificação, com 90,28.

Ainda é uma pontuação forte, mas a diferença em relação à criação de conteúdo e ao processamento de dados é reveladora.

Agentes de codificação precisam gerenciar um ciclo operacional mais amplo:

Entender o requisito
→ escolher a stack
→ escrever arquivos
→ executar ou visualizar
→ inspecionar erros
→ corrigir
→ verificar a interação
→ empacotar o resultado

A fonte publicadora testou o produto com uma solicitação de uma frase para um simulador de Sistema Solar 3D.

O fluxo de trabalho relatado usou Three.js e retornou um aplicativo HTML de arquivo único com 31 KB.

O artigo também mostra uma página de ensino de simulação meteorológica gerada por um fluxo de trabalho web interativo semelhante.

Estes são demonstrações ilustrativas, e não itens oficiais do benchmark XClaw.

Imagem é a capa do plano de negócios do 2º trimestre de 2026, com fundo azul claro e o texto "智芯未来 - Plano de Negócios do 2º Trimestre de 2026" no topo. O título é "Plano de Negócios do 2º Trimestre de 2026", com o subtítulo "Foco em hardware inteligente com IA: de 'Feito na China' para 'Criado na China'". Abaixo, o nome da empresa "智芯未来科技有限公司" é exibido, marcado como documento confidencial, apenas para referência interna e de investidores interessados, datado de junho de 2026. Esta capa está no início do documento, introduzindo o conteúdo subsequente sobre o plano de negócios de hardware inteligente com IA.

Pontuação em Análise de Pesquisa: 96,44

O Wenxin recebeu 96,44 em análise de pesquisa.

Uma tarefa de pesquisa séria pode envolver:

  1. Compreender a pergunta.
  2. Dividi-la em subperguntas.
  3. Buscar múltiplas fontes.
  4. Avaliar a qualidade das fontes.
  5. Comparar afirmações conflitantes.
  6. Verificar datas.
  7. Extrair valores numéricos.
  8. Construir um argumento estruturado.
  9. Adicionar citações.
  10. Produzir um relatório.

O artigo-fonte descreve dois casos de teste.

Pesquisando o Problema Tridimensional de Kakeya

O publicador pediu ao Wenxin para pesquisar a conjectura tridimensional de Kakeya no contexto da medalhista Fields Hong Wang.

O comportamento relatado do agente foi:

  1. Planejar um processo de pesquisa em seis etapas.
  2. Lançar vários subagentes em paralelo.
  3. Buscar 16 fontes acadêmicas.
  4. Produzir um documento Markdown.
  5. Produzir um resultado HTML interativo de 62 KB.

Esta imagem mostra os resultados de pesquisa mais recentes do Assistente Wenxin sobre a conjectura tridimensional de Kakeya, relacionada à Medalha Fields. A pesquisa avançou de acordo com um processo planejado em seis etapas, organizando a definição central da conjectura, o histórico de pesquisas anteriores, os pontos de inovação e avanço, decompondo a lógica cruzada de áreas relacionadas, coletando 16 fontes acadêmicas autorizadas para concluir a pesquisa, e finalmente gerando um documento Markdown de 63,746 KB e um relatório HTML interativo e visualizado de 62,83 KB. O resultado geral corresponde diretamente ao conteúdo do caso de estudo do problema tridimensional de Kakeya mencionado no documento.

O número de fontes não é uma métrica de qualidade por si só.

O que importa é se o agente final usa fontes autorizadas, atribui corretamente as afirmações, resolve conflitos, evita dados desatualizados e separa fatos de interpretação.

Comparando Modelos de IA Recentes e Preços

O publicador também pediu ao Wenxin para analisar as capacidades e preços dos principais modelos nacionais e internacionais do mês anterior.

O artigo diz que o agente:

  • Carregou uma habilidade de pesquisa do setor.
  • Buscou 45 fontes em duas rodadas.
  • Detectou incerteza em alguns números-chave.
  • Realizou outra busca direcionada em 29 fontes.
  • Verificou cruzadamente os preços.
  • Produziu um relatório de aproximadamente 7.000 caracteres chineses com gráficos.

A imagem apresenta a capa do relatório de análise de capacidades e preços dos principais modelos de IA nacionais e internacionais de julho de 2026. No topo da capa, exibe-se a data "julho de 2026"; no centro, o título em destaque "Relatório de Análise de Capacidades e Preços dos Principais Modelos de IA Nacionais e Internacionais"; abaixo, em letras menores, a descrição "— Avaliação abrangente baseada em Artificial Analysis, LMSYS Arena e dados públicos de fabricantes —". O relatório é identificado por verificação de plágio, com a página exibida como 1/76 e 6.900 palavras. Esta imagem está relacionada ao conteúdo "análise das capacidades e preços dos principais modelos de IA nacionais e internacionais" do documento, sendo a imagem de capa do referido relatório.

O ciclo de pesquisa útil é:

Buscar
→ identificar incertezas
→ buscar novamente
→ comparar fontes
→ resolver ou sinalizar divergências
→ escrever

Essa etapa extra de verificação é muitas vezes onde a qualidade da pesquisa melhora.

Um Segundo Primeiro Lugar: PinchBench v2

O resultado do SuperCLUE veio após uma primeira colocação em julho no PinchBench v2.

O PinchBench foi criado pela Kilo para avaliar agentes em fluxos de trabalho do mundo real, em vez de benchmarks tradicionais de perguntas e respostas.

A versão PinchBench 2.0 da Kilo expandiu o benchmark para 148 tarefas e adicionou regras mais rigorosas de avaliação e classificação.

No instantâneo do ranking de julho reproduzido pelo artigo de referência, o sistema da Baidu apareceu como:

Orion-Mission-Mode

com:

Melhor pontuação:    94,6%
Pontuação média: 94,4%

A imagem é uma captura de tela do ranking de pontuações do sistema PinchBench v2, apresentando os principais indicadores e pontuações de cada sistema de IA. Na tela, as barras em tom laranja são identificadas como "Average Score"; o Orion-Mission-Mode, no topo, alcança pontuação média de 94,6%, com 94,4% de pontuação em primeiro lugar, superando amplamente outros sistemas participantes, como anthropic/claude-opus-4.1 e qwen1.5/3.7-max. A captura também exibe os rótulos de capacidades específicas de cada sistema, incluindo Writing Content, Creative, Data Analysis, entre outros, evidenciando o desempenho de cada modelo em diferentes dimensões de tarefas, em consonância com o conteúdo do documento que menciona a primeira colocação do Wenxin Assistant no instantâneo de julho desse benchmark.

A captura de tela coloca o Orion Mission Mode à frente de sistemas baseados em modelos da Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI e outros naquele instantâneo específico.

A palavra importante é instantâneo.

Os rankings de agentes mudam rapidamente.

Modelos, estruturas, prompts, políticas de ferramentas e submissões de benchmark podem ser atualizados.

Um resultado de primeiro lugar em julho deve, portanto, ser citado com sua data, em vez de tratado como um ranking global permanente.

O Que o PinchBench v2 Realmente Testa

A Kilo descreve o PinchBench 2.0 como um benchmark de fluxos de trabalho de agentes do mundo real.

Ele contém tarefas que exigem que um sistema utilize ferramentas e conclua operações, em vez de simplesmente selecionar uma resposta.

O benchmark abrange categorias como:

  • Escrita.
  • Trabalho criativo.
  • Análise de dados.
  • Pesquisa e trabalho de conhecimento.
  • Código e operações.
  • Outros fluxos de trabalho baseados em computador.

O artigo de referência afirma que 59 entradas de modelos ou agentes estavam representadas no instantâneo do ranking.

Esse número pode mudar à medida que submissões são adicionadas ou atualizadas.

O benchmark em si é mais estável do que a população do ranking.

O lançamento oficial do PinchBench 2.0 descreve:

148 tarefas

A fonte e vários relatórios de julho descrevem a avaliação do Wenxin em 147 tarefas concluídas, ao mesmo tempo em que descrevem o PinchBench como um benchmark de 148 tarefas.

A interpretação mais segura é:

O PinchBench v2 contém 148 tarefas; a avaliação relatada do Orion Mission Mode pode ter produzido resultados pontuados em 147 delas naquele instantâneo.

Essa distinção é importante porque os relatórios de benchmark frequentemente misturam o tamanho do benchmark com o número de tarefas concluídas com sucesso.

execuções concluídas.

Melhor Pontuação vs. Pontuação Média

A fonte enfatiza que o Modo Missão Orion registrou:

94,6% melhor pontuação
94,4% pontuação média

A diferença de 0,2 ponto é pequena.

Isso sugere baixa variação entre as execuções relatadas.

No entanto, não deve ser interpretado como uma garantia universal de estabilidade.

A variância do benchmark pode depender de:

  • Número de repetições.
  • Temperatura de amostragem.
  • Disponibilidade de ferramentas.
  • Sites externos.
  • Condições de rede.
  • Comportamento do avaliador.
  • Tempos limite do agente.
  • Atualizações do modelo.

A lição prática é simplesmente que a execução relatada do PinchBench não foi construída em torno de um único resultado isolado de sorte.

Sua média permaneceu próxima da melhor pontuação.

O Agente É Mais do Que o Modelo Subjacente

Um dos pontos mais importantes no artigo de origem é que o benchmark avalia um produto ou sistema de agente, não um modelo de linguagem puro.

O agente de tarefas pode combinar:

  • Um modelo de fundação.
  • Busca.
  • Memória.
  • Manipulação de arquivos.
  • Seleção de ferramentas.
  • Planejamento.
  • Subagentes.
  • Habilidades de geração de documentos.
  • Acesso a navegador ou web.
  • Execução de código.
  • Validação.

Isso pode ser expresso como:

Resultado do agente
=
capacidade do modelo
+
ferramentas
+
memória
+
planejamento
+
busca
+
ambiente de execução
+
verificação

É por isso que se deve ter cuidado ao dizer:

“O Modelo X venceu o Modelo Y.”

O leaderboard pode, na verdade, comparar duas pilhas de agentes diferentes usando ferramentas e orquestrações distintas.

Uma descrição mais precisa é:

“O sistema de agente X pontuou acima do sistema de agente Y nesta configuração de benchmark.”

Essa formulação se torna cada vez mais importante à medida que os produtos de IA se transformam em sistemas de software complexos.

De Responder Perguntas a Concluir Trabalhos

O artigo de origem enquadra 2026 como o ano em que o padrão para um produto de IA útil está mudando.

A interação mais antiga era assim:

Usuário pergunta
→ modelo responde
→ usuário executa o trabalho

O padrão emergente de agente é assim:

Usuário dá o objetivo
→ agente planeja
→ agente coleta contexto
→ agente chama ferramentas
→ agente cria arquivos
→ agente verifica resultados
→ agente entrega o artefato

Isso muda o que os usuários percebem.

Um modelo pode ser extremamente conhecedor, mas frustrante se não conseguir:

  • Lembrar requisitos anteriores.
  • Abrir o arquivo.
  • Formatar a planilha.
  • Criar o documento solicitado.
  • Concluir todas as etapas.
  • Corrigir os próprios erros.

A nova condição de sucesso está mais próxima de:

A tarefa foi realmente concluída?

do que:

A resposta foi impressionante?

Ponto de Entrada da Tarefa no Wenxin

O artigo da BAAI mostra a opção “Tarefa” diretamente na interface do Wenxin.

A imagem mostra a interface do Assistente Baidu Wenxin. Acima, há a caixa de diálogo com “Hoje quer ser um ‘especialista em alta eficiência’ ou procurar um cantinho para desabafar?”, e abaixo, o campo de entrada “Me ajude a escrever um modelo de autointrodução para entrevista”. Na parte inferior da interface, há várias opções de recursos, com a opção “Tarefa” destacada em vermelho. Esta imagem está relacionada ao “Ponto de Entrada da Tarefa no Wenxin” mencionado acima, mostrando visualmente a posição da opção “Tarefa” na interface do Wenxin, confirmando o conteúdo do artigo da BAAI de que a opção “Tarefa” está diretamente na interface do Wenxin.

O site oficial do Wenxin da Baidu descreve o produto como um assistente de IA multimodal para:

  • Criação confiável.
  • Busca aprofundada.
  • Uso inteligente de ferramentas.
  • Trabalho com documentos.
  • Escrita.
  • Imagens.

Uso entre dispositivos.

O aplicativo Baidu também lista o Assistente Wenxin como um recurso integrado de IA para pesquisa aprofundada, busca, escrita, geração de imagens, geração de vídeos e assistência conversacional.

Isso confirma que a IA orientada a tarefas migrou para as superfícies de consumo mainstream da Baidu, em vez de permanecer apenas um experimento para desenvolvedores.

O Assistente Wenxin é realmente gratuito e ilimitado?

O artigo de origem destaca repetidamente um ponto comercial:

O Assistente Wenxin é gratuito e não tem paywall.

As páginas oficiais da Baidu para o Wenxin atualmente oferecem acesso gratuito ou experiência gratuita.

Isso é fácil de verificar.

A afirmação mais forte—permanentemente ilimitado para todos os recursos de agentes de tarefas—é mais difícil de verificar a partir de uma página oficial de política estável.

Produtos de IA podem introduzir:

  • Cotas diárias.
  • Limites de concorrência.
  • Limites específicos por recurso.
  • Promoções temporárias.
  • Níveis de conta.
  • Restrições regionais.
  • Mudanças futuras de preço.

Para publicação, a redação mais segura é:

O Assistente Wenxin está atualmente disponível para usuários individuais com opções de acesso gratuito, e a experiência de tarefa mostrada no artigo de origem não exigiu assinatura paga.

Não construa uma comparação de custo de longo prazo em torno de "ilimitado para sempre", a menos que a Baidu publique uma política específica garantindo isso.

Por que a experiência de busca pode ajudar um agente

A seção final do artigo de origem argumenta que o histórico de busca da Baidu lhe dá uma vantagem estrutural no design de agentes.

Há uma analogia real.

Um mecanismo de busca lida com algo como:

Consulta do usuário
→ compreensão da intenção
→ decomposição da consulta
→ recuperação
→ ranqueamento
→ agregação de resultados
→ resposta

Um agente lida com:

Objetivo do usuário
→ compreensão da intenção
→ decomposição da tarefa
→ seleção de ferramentas
→ execução
→ agregação de resultados
→ entrega

Os dois pipelines não são idênticos.

Um agente tem um espaço de ação muito maior e carrega maior risco de execução.

Mas várias capacidades técnicas se transferem naturalmente:

  • Compreensão da intenção.
  • Reescrita de consultas.
  • Recuperação.
  • Ranqueamento de fontes.
  • Contexto de sessão.
  • Tratamento de atualização.
  • Deduplicação.
  • Agregação de evidências.

Isso é especialmente relevante para agentes de pesquisa.

Um sistema que já possui forte infraestrutura de busca pode construir fluxos de trabalho mais profundos sobre ela.

Compreensão de consulta de busca vs. compreensão de tarefa de agente

Considere uma solicitação de busca tradicional:

Encontre o voo mais barato de Pequim para Xangai.

Um sistema de busca pode precisar inferir:

  • Origem.
  • Destino.
  • Datas de viagem.
  • Preferência de preço.
  • Inventário de voos elegíveis.
  • Ordem de classificação.

Um agente que recebe:

Encontre o voo mais barato entre Pequim e Xangai e prepare um itinerário.

pode precisar adicionar:

  • Seleção de ferramentas.
  • Múltiplas buscas.
  • Comparação.
  • Verificação de restrições.
  • Geração de arquivos.
  • Possivelmente uma etapa de calendário ou reserva.

A primeira metade do problema se assemelha à busca.

A segunda metade é orquestração de ações.

A experiência de busca fornece componentes úteis, mas a qualidade do agente ainda depende da camada de execução.

Memória e sessões de busca são relacionadas—mas não iguais

A fonte também conecta a pontuação de memória do Wenxin com a experiência da Baidu na compreensão de sessões de busca.

alguma sobreposição conceitual.

Ambos os sistemas precisam inferir quais informações de interações anteriores continuam relevantes.

Uma sessão de busca pode conter:

Consulta 1: carros elétricos
Consulta 2: autonomia acima de 600 km
Consulta 3: abaixo de 250.000 RMB

O sistema deve entender que a terceira consulta ainda é sobre carros elétricos.

Um sistema de memória para agentes tem uma tarefa mais difícil.

Ele pode precisar lembrar:

  • Preferências do usuário.
  • Restrições da tarefa.
  • Fatos derivados de arquivos.
  • Decisões.
  • Saídas de ferramentas.
  • Estado temporário.
  • Preferências de longo prazo.

A experiência em sessões de busca é útil, mas a memória persistente de agentes exige mecanismos adicionais de armazenamento, recuperação, privacidade e relevância.

A Análise de Pesquisa é Onde a Stack de Busca do Baidu é Mais Diretamente Relevante

Entre as cinco categorias do XClaw, a análise de pesquisa é o lugar mais claro onde a experiência de busca do Baidu pode ser transferida diretamente.

Um agente de pesquisa precisa de:

  • Cobertura de busca.
  • Informações atualizadas.
  • Expansão de consultas.
  • Ranqueamento.
  • Tratamento de citações.
  • Comparação de fontes.
  • Compreensão de entidades.
  • Recuperação multilíngue.

A documentação oficial do Qianfan AI Assistant do Baidu também descreve uma solução de agente empresarial que integra Busca do Baidu, Baidu Baike, busca de imagens, gerenciamento de conversas, gerenciamento de memória e capacidades de documentos.

Isso não prova que o produto de consumo Wenxin usa exatamente a mesma implementação.

Mas mostra que o Baidu está construindo uma stack comum de agentes em torno de busca, memória, ferramentas e recuperação multimodal em todo o seu portfólio de produtos.

O Que as Duas Vitórias em Benchmarks Não Provam

Pontuações altas em benchmarks são evidências úteis.

Elas não são a avaliação completa.

Elas Não Provam Liderança Global Permanente

Os rankings mudam.

Novos modelos e novas submissões de agentes podem ultrapassar o líder atual.

Elas Não Provam Que Toda Tarefa Alcançará 97%

O XClaw agrega tarefas e categorias selecionadas.

O fluxo de trabalho real de um usuário pode ser muito diferente.

Elas Não Isolam o Modelo de Fundação

A pontuação pertence ao assistente completo ou à stack do agente.

Elas Não Medem Todos os Problemas de Segurança

Um agente que conclui tarefas com eficiência ainda pode fazer chamadas de ferramentas inseguras ou expor informações sensíveis em um ambiente diferente.

Elas Não Garantem Precisão Factual

Agentes de pesquisa podem citar fontes fracas ou interpretar mal dados em mudança.

Elas Não Provam Uso Gratuito Ilimitado

Preços e cotas de produto são políticas comerciais, não propriedades de benchmarks.

Como Avaliar o Assistente Wenxin Você Mesmo

Um teste pessoal útil deve se assemelhar ao seu trabalho real.

Não faça apenas perguntas de curiosidades.

Dê ao agente uma tarefa completa.

Teste 1: Memória

Forneça cinco restrições no início de uma conversa longa.

Depois de várias trocas não relacionadas, peça um artefato final e verifique se todas as cinco foram preservadas.

Teste 2: Processamento de Dados

Carregue:

  • Uma planilha.
  • Um PDF.
  • Um arquivo de texto curto.

Peça ao agente para combiná-los em um único relatório.

Verifique cada valor numérico de forma independente.

Teste 3: Pesquisa

Escolha um tópico com informações em mudança.

Exija:

  • Fontes primárias.
  • Datas de publicação.
  • Comparação de fontes conflitantes.
  • Links diretos.
  • Uma lista de alegações incertas.

Teste 4: Documento

Criação

Peça um artefato em Word, PowerPoint, planilha ou HTML.

Avalie:

  • Estrutura.
  • Formatação.
  • Completude.
  • Capacidade de download.
  • Se o arquivo realmente abre.

Teste 5: Codificação

Peça um pequeno aplicativo interativo.

Verifique:

  • Se ele executa.
  • Se todos os recursos solicitados existem.
  • Se os erros são corrigidos.
  • Se o arquivo final é autossuficiente quando solicitado.

Teste 6: Execução de Longo Prazo

Dê uma tarefa que exija várias ferramentas.

Observe se o sistema:

  1. Faz um plano.
  2. Escolhe ferramentas razoáveis.
  3. Se recupera de falhas.
  4. Evita repetir trabalho.
  5. Verifica o resultado final.

Uma Maneira Melhor de Comparar Produtos de Agentes

Ao comparar o Wenxin com outros agentes, use uma tabela mais ampla do que "pontuação de benchmark".

Dimensão O que medir
Sucesso da tarefa O trabalho solicitado foi concluído?
Memória As restrições anteriores foram mantidas?
Precisão Os números e afirmações estão corretos?
Qualidade da pesquisa As fontes são autoritativas e atualizadas?
Confiabilidade das ferramentas As chamadas de ferramentas são consistentemente bem-sucedidas?
Qualidade do artefato Os arquivos são utilizáveis sem reparo manual?
Recuperação O agente consegue corrigir etapas com falha?
Latência Quanto tempo leva uma tarefa completa?
Custo Quanto custa um resultado aceito?
Privacidade Como os arquivos enviados e a memória são tratados?
Disponibilidade Os recursos principais são gratuitos, limitados por cota ou pagos?

Isso fornece um quadro mais realista do que uma única posição em um ranking.

A Mudança Maior: "Ela Consegue Entregar?"

O ponto mais forte do artigo original é mais amplo do que o Baidu.

A competição entre agentes está mudando a definição de qualidade em IA.

Para a primeira geração de chatbots, os usuários focavam na qualidade das respostas.

Para os agentes de tarefas atuais, as questões-chave estão se tornando:

  • Ela consegue manter o contexto?
  • Ela consegue encontrar as informações certas?
  • Ela consegue operar ferramentas?
  • Ela consegue criar o arquivo?
  • Ela consegue concluir um fluxo de trabalho com várias etapas?
  • Ela consegue verificar o próprio resultado?
  • Posso confiar nela para trabalhos repetidos?

É por isso que benchmarks como XClaw e PinchBench estão atraindo atenção.

Eles aproximam a avaliação do trabalho de produção real.

Ainda há uma longa distância entre um benchmark e uma implementação empresarial.

Mas a direção é útil:

Benchmark de conhecimento
→ benchmark de raciocínio
→ benchmark de uso de ferramentas
→ benchmark de tarefas ponta a ponta
→ resultado real de produção

O último passo é, em última análise, o que importa.

Perguntas Frequentes

Qual pontuação o Assistente Wenxin da Baidu recebeu no SuperCLUE XClaw?

O relatório de agosto de 2026 do SuperCLUE XClaw dá ao Assistente Wenxin uma pontuação geral de 97,62, colocando-o em primeiro lugar entre os produtos exibidos. Suas pontuações por categoria foram 90,28 em codificação, 99,44 em criação de conteúdo, 98,86 em processamento de dados, 96,44 em análise de pesquisa e 100 em memória.

O que significa uma pontuação de memória 100?

Significa que o Wenxin recebeu nota máxima nas tarefas de memória incluídas naquela avaliação do XClaw. Não significa que o assistente nunca possa esquecer o contexto em toda e qualquer conversa real possível.

O que é o PinchBench v2?

O PinchBench v2 é um benchmark de agentes criado pela Kilo que avalia sistemas em tarefas reais de computador e fluxos de trabalho. A versão 2.0 contém 148 tarefas e é projetada para medir

execução de ponta a ponta em vez de simples resposta a perguntas.

Qual foi a pontuação do Wenxin no PinchBench v2?

Em um instantâneo de classificação de julho de 2026, o agente de tarefas da Baidu apareceu como Orion Mission Mode com uma melhor pontuação de 94,6% e uma pontuação média de 94,4%. As classificações mudam ao longo do tempo, portanto, a data do instantâneo deve ser incluída ao citar o resultado.

O Assistente Wenxin é completamente gratuito?

As páginas oficiais do Wenxin da Baidu atualmente oferecem opções de acesso gratuito ou experiência gratuita, e o artigo de origem afirma que os recursos de tarefas demonstrados estavam disponíveis sem assinatura paga. Uma garantia oficial estável de uso ilimitado permanente para todos os recursos não foi encontrada, portanto, as cotas atuais devem ser verificadas diretamente no produto.

O Assistente Wenxin pode gerar documentos do Word e páginas da web?

O artigo de origem mostra sessões de teste em que o Wenxin gerou um plano de negócios formatado em Word e páginas HTML interativas. Esses exemplos demonstram o fluxo de trabalho de tarefas do produto, mas não são uma garantia de que cada prompt ou ambiente produzirá o mesmo resultado.

Por que a tecnologia de busca da Baidu pode ajudar seus agentes de IA?

Busca e agentes compartilham capacidades como compreensão de intenção, decomposição de consultas, recuperação, ranqueamento, agregação de fontes e contexto de sessão. Os agentes adicionam uma camada de execução mais ampla, incluindo chamadas de ferramentas, criação de arquivos, memória, planejamento e ação.

XClaw e PinchBench são benchmarks de modelos?

Não no sentido estrito. Eles avaliam produtos ou sistemas de agentes que podem combinar modelos com ferramentas, memória, busca, prompts, orquestração e ambientes de execução. Portanto, suas pontuações devem ser atribuídas à configuração completa do agente.

Ferramentas relacionadas

  • Baidu Wenxin: Assistente de IA multimodal oficial da Baidu para busca, criação, documentos e trabalho orientado a tarefas.
  • SuperCLUE XClaw: O benchmark chinês de agentes orientado a produtos citado no artigo de origem.
  • PinchBench: O benchmark do Kilo para fluxos de trabalho de agentes de codificação e uso de computador no mundo real.
  • Pandoc: Ferramenta de conversão de documentos usada no fluxo de trabalho de teste da fonte para extrair e transformar conteúdo de documentos.
  • Three.js: Biblioteca de gráficos 3D em JavaScript usada no exemplo do Sistema Solar gerado no artigo de origem.
  • Baidu Qianfan: Plataforma empresarial da Baidu para modelos, agentes, dados e desenvolvimento de aplicações de IA.
  • Baidu AgentBuilder: Plataforma da Baidu para criar e publicar agentes personalizados baseados no Wenxin.

Links relacionados

  • Site oficial do Baidu Wenxin: Ponto de entrada oficial atual do produto para o Assistente Wenxin em clientes web e de download.
  • Assistente de Desktop Baidu Wenxin: Página oficial de desktop destacando análise de documentos, busca, criação, exportação e experiência gratuita.
  • [SuperCLUE XClaw agosto de 2026

Resumo

O Assistente Wenxin da Baidu ficou em primeiro lugar no snapshot de agosto de 2026 do SuperCLUE XClaw, com 97,62 pontos, incluindo uma pontuação perfeita de 100 em memória e notas acima de 96 em processamento de dados, criação de conteúdo e análise de pesquisa.

Esse resultado segue um snapshot do ranking PinchBench v2 de julho, no qual o Modo Missão Orion da Baidu registrou 94,6% de melhor pontuação e 94,4% de pontuação média. Os benchmarks usam tarefas diferentes, mas ambos enfatizam a conclusão real de tarefas, em vez de simples respostas a perguntas.

A principal conclusão não é que um assistente "venceu" permanentemente a corrida de agentes. Os rankings de agentes mudam rapidamente, e os sistemas avaliados incluem modelos, ferramentas, busca, memória, prompts e orquestração.

O que os dois resultados mostram é que a avaliação de IA está caminhando para um padrão mais prático: não se o modelo parece inteligente, mas se o agente consegue concluir o trabalho e entregar um resultado utilizável.