L'Assistente Baidu Wenxin conquista il primo posto in SuperCLUE XClaw dopo aver guidato PinchBench v2

L'Assistente Baidu Wenxin ha conquistato il primo posto in un altro benchmark di tipo agente. Nella valutazione del prodotto XClaw di SuperCLUE di agosto 2026, l'Assistente Wenxin ha ottenuto un punteggio complessivo di 97

发布于 2026年8月7日generalGEO 评分: 02 次阅读
L'Assistente Baidu Wenxin conquista il primo posto in SuperCLUE XClaw dopo aver guidato PinchBench v2

L'Assistente Wenxin di Baidu Conquista il Primo Posto in SuperCLUE XClaw Dopo Aver Guidato PinchBench v2

Introduzione

L'Assistente Wenxin di Baidu si è aggiudicato il primo posto in un altro benchmark di tipo agent.

Nella valutazione prodotto XClaw di SuperCLUE dell'agosto 2026, l'Assistente Wenxin ha ottenuto un punteggio complessivo di 97,62, il più alto nell'istantanea pubblicata.

I punteggi per categoria sono stati:

Capacità Punteggio
Codifica 90,28
Creazione di contenuti 99,44
Elaborazione dati 98,86
Analisi di ricerca 96,44
Memoria 100,00

Il risultato è arrivato meno di tre settimane dopo un'altra prestazione di rilievo.

In un'istantanea di luglio di PinchBench v2, l'agente di compiti di Baidu—presentato come Orion Mission Mode—ha registrato un miglior punteggio del 94,6% e un punteggio medio del 94,4%, posizionandosi in cima a quell'istantanea della classifica.

I due benchmark sono diversi. SuperCLUE XClaw si concentra sui prodotti agent cinesi e sui risultati pratici in cinque dimensioni di capacità. PinchBench v2, creato da Kilo, è costruito attorno a compiti informatici e di automazione del mondo reale.

Insieme, indicano lo stesso cambiamento:

La valutazione degli agent si sta spostando da "Il modello può rispondere correttamente?" a "Il sistema può portare a termine il lavoro e fornire qualcosa di utilizzabile?"

Un modello linguistico può conoscere la risposta e fallire comunque come agente perché dimentica i requisiti, sceglie lo strumento sbagliato, gestisce male i file, si ferma a metà di un flusso di lavoro o restituisce l'artefatto sbagliato.

Questo rende gli ultimi risultati di Wenxin più legati all'esecuzione dei compiti che all'intelligenza pura del modello linguistico.

Questa immagine mostra la classifica dei punteggi medi di agosto 2026 della valutazione prodotto SuperCLUE-XClaw, presentando chiaramente la classifica e i punteggi corrispondenti dei prodotti dei vari produttori partecipanti. L'Assistente Wenxin di Baidu è al 1° posto con 97,62 punti; MiMoClaw di Xiaomi segue al 2° posto con 96,74 punti; WorkBuddy di Tencent e KimiClaw di Moonshot AI sono rispettivamente al 2° e 2° posto con 96,61 e 96,01 punti; MaxClaw di MiniMax è al 3° posto con 94,79 punti. La pagina indica la metrica della classifica, il lotto di dati e altre informazioni, riflettendo intuitivamente le prestazioni dei prodotti nella valutazione dei prodotti intelligenti cinesi, in corrispondenza con il contenuto del documento che menziona il punteggio più alto dell'Assistente Wenxin nella valutazione SuperCLUE XClaw.

L'Assistente Wenxin Conquista il Primo Posto in SuperCLUE XClaw

SuperCLUE descrive XClaw come una valutazione orientata al prodotto per assistenti AI di tipo "Claw".

Piuttosto che basarsi principalmente su domande a scelta multipla, il benchmark enfatizza i risultati finali completati.

L'istantanea di agosto 2026 classifica i prodotti leader come segue:

Posizione Prodotto Punteggio
1 Assistente Wenxin di Baidu 97,62
2 MiMoClaw 96,74
3 WorkBuddy 96,61
4 KimiClaw 96,01
5 MaxClaw 94,79

Il benchmark valuta cinque dimensioni:

  1. Elaborazione dati.
  2. Creazione di contenuti.
  3. Memoria.
  4. Codifica.
  5. Analisi di ricerca.

La logica di base è semplice: l'agente riceve un compito e deve produrre un artefatto o risultato finale che possa essere effettivamente giudicato.

Questo rende il rispetto delle istruzioni, la gestione dei file, l'uso degli strumenti e l'esecuzione a lungo orizzonte parte del punteggio.

![L'immagine mostra la classifica dell'Assistente Wenxin di Baidu nelle dimensioni di capacità (punteggi medi) di SuperCLUE XClaw. I punteggi nelle cinque dimensioni di sviluppo del codice, creazione di contenuti, elaborazione dati, analisi di ricerca e capacità di memoria sono rispettivamente 90,28, 99,44, 98,86, 96,44 e 100,00. Questa immagine è in linea con la descrizione di SuperCLUE XClaw come valutazione orientata al prodotto per assistenti AI di tipo "Claw" menzionata sopra, e presenta intuitivamente le prestazioni dell'Assistente Wenxin di Baidu in questo sistema di valutazione, fornendo supporto dati per il suo primo posto in SuperCLUE XClaw.](https://we0-cms.oss-cn-beijing.aliyuncs

com/cms-assets/image/2026/08/8091b61c-6902-450f-b7a9-6798e0b4b1a9-85d3c984-465d-4f02-a847-63b0ef72d60d.png)

La Memoria Raggiunge 100

Il punteggio di categoria più eclatante è 100,00 nella memoria.

La memoria conta perché il lavoro reale raramente si esaurisce in un singolo prompt isolato.

Un utente può fornire vincoli all'inizio di una conversazione e aspettarsi che l'agente li rispetti molto più tardi.

Ad esempio:

Turno 1:
Usa solo i dati del Q2 2026.

Turno 3:
Mantieni il rapporto sotto le 10 pagine.

Turno 6:
Usa la stessa segmentazione di prodotto del foglio di calcolo.

Turno 10:
Genera il documento Word finale.

Un agente che dimentica la prima istruzione può produrre un risultato curato ma inutilizzabile.

La memoria quindi influisce su:

  • Conservazione dei requisiti.
  • Pianificazione multi-fase.
  • Coerenza.
  • Rilavorazione.
  • Fiducia dell'utente.
  • Completamento di attività di lunga durata.

Un punteggio perfetto in una categoria su un benchmark non significa che il prodotto non dimenticherà mai informazioni in sessioni reali arbitrarie. Dimostra però che Wenxin ha performato estremamente bene nei compiti di memoria inclusi in questa valutazione XClaw.

Elaborazione Dati: Punteggio 98,86

Wenxin Assistant ha ricevuto 98,86 nell'elaborazione dati.

La fonte descrive questa categoria come un test per verificare se il sistema è in grado di interpretare campi, combinare informazioni, preservare la precisione numerica e produrre output strutturati.

Sono compiti ingannevolmente difficili.

Un modello chat generico può riassumere bene un foglio di calcolo commettendo comunque un errore sottile in:

  • Un filtro di data.
  • Un subtotale.
  • Una ricerca tra fogli.
  • Una conversione di unità.
  • Un valore decimale.
  • Una mappatura di categoria.

Per uso aziendale, un numero errato può invalidare un intero documento.

L'editore della fonte ha testato Wenxin con un file di informazioni aziendali e gli ha chiesto di produrre un piano aziendale Q2 2026 come documento Word.

Secondo il registro del test, l'agente:

  1. Ha usato Pandoc per estrarre il file caricato.
  2. Ha strutturato le informazioni di origine.
  3. Ha caricato una capacità di elaborazione Word.
  4. Ha generato un documento formattato.
  5. Ha restituito un documento contenente più di 6.000 caratteri cinesi e 148 paragrafi.

Questa immagine mostra il risultato del test in cui Baidu Wenxin Assistant, come agente intelligente, completa il compito di generazione di un piano aziendale. La parte superiore dell'immagine mostra l'utente che impartisce istruzioni all'agente, richiedendo di scrivere il piano aziendale Q2 2026 per la startup di hardware intelligente "Zhixin Future", con generazione di documento Word e rispetto dei requisiti di sezione specificati; la parte inferiore mostra il risultato dell'esecuzione, indicando che il documento Word è stato generato con successo, con circa 6.000 caratteri e 148 paragrafi, conforme ai requisiti di lunghezza e superata la verifica, con opzione di download, dimostrando visivamente le capacità di Wenxin Assistant nell'elaborazione dati e nella generazione di contenuti strutturati.

Questo mostra la differenza tra lavoro di chat e lavoro di agente.

Un modello chat potrebbe scrivere il piano all'interno della conversazione.

Un flusso di lavoro agente può fare questo:

Leggi il file sorgente
→ estrai informazioni strutturate
→ abbozza il contenuto
→ formatta il documento Word
→ valida l'output
→ restituisci un file

L'artefatto, non la risposta in prosa, diventa il prodotto finale.

Creazione Contenuti: Punteggio 99,44

Wenxin ha ottenuto 99,44 per la creazione di contenuti.

In un benchmark per agenti, la creazione di contenuti non è semplicemente scrittura creativa.

Il sistema può dover soddisfare più vincoli contemporaneamente:

  • Formato richiesto.
  • Tono.
  • Lunghezza.
  • Struttura delle sezioni.
  • Pubblico.
  • Tipo di file.
  • Ancoraggio fattuale.
  • Presentazione visiva.

Una bozza può essere grammaticalmente corretta e fallire comunque perché

ignora il formato richiesto.

Ecco perché i benchmark sui prodotti valutano sempre più il completamento del compito, piuttosto che la sola qualità linguistica.

Punteggi di coding: 90,28

La categoria XClaw più bassa di Wenxin è stata il coding, con 90,28.

Si tratta comunque di un punteggio solido, ma il divario rispetto alla creazione di contenuti e all'elaborazione dei dati è significativo.

Gli agenti di coding devono gestire un ciclo operativo più ampio:

Comprendere il requisito
→ scegliere lo stack tecnologico
→ scrivere i file
→ eseguire o visualizzare l'anteprima
→ ispezionare gli errori
→ correggere
→ verificare l'interazione
→ impacchettare il risultato

L'editore della fonte ha testato il prodotto con una richiesta di una sola frase per un simulatore di Sistema Solare 3D.

Il flusso di lavoro segnalato utilizzava Three.js e ha restituito un'applicazione HTML monofile da 31 KB.

L'articolo mostra anche una pagina didattica di simulazione meteorologica generata tramite un flusso di lavoro Web interattivo simile.

Si tratta di demo illustrative, non di elementi ufficiali del benchmark XClaw.

L'immagine è la copertina del piano commerciale del secondo trimestre 2026, con sfondo azzurro chiaro e la scritta "ZhiXin Future - Piano Commerciale Q2 2026" nella parte superiore. Il titolo è "Piano Commerciale Q2 2026", con il sottotitolo "Focus su hardware intelligente AI: dal 'Made in China' al 'Intelligently Made in China'". Nella parte inferiore è indicato il nome dell'azienda "ZhiXin Future Technology Co., Ltd.", con la dicitura di documento riservato, destinato esclusivamente a uso interno e a investitori interessati, datato giugno 2026. La copertina si trova all'inizio del documento e introduce i contenuti successivi relativi al piano commerciale sull'hardware intelligente AI.

Punteggi di analisi della ricerca: 96,44

Wenxin ha ottenuto 96,44 nell'analisi della ricerca.

Un'attività di ricerca seria può comportare:

  1. Comprendere la domanda.
  2. Suddividerla in sottodomande.
  3. Cercare in più fonti.
  4. Valutare la qualità delle fonti.
  5. Confrontare affermazioni contrastanti.
  6. Controllare le date.
  7. Estrarre valori numerici.
  8. Costruire un'argomentazione strutturata.
  9. Aggiungere citazioni.
  10. Produrre un report.

L'articolo di origine descrive due casi di prova.

Ricerca sul problema tridimensionale di Kakeya

L'editore ha chiesto a Wenxin di fare ricerche sulla congettura tridimensionale di Kakeya nel contesto della medaglia Fields Hong Wang.

Il comportamento segnalato dell'agente è stato:

  1. Pianificare un processo di ricerca in sei fasi.
  2. Lanciare diversi sottoagenti in parallelo.
  3. Cercare in 16 fonti accademiche.
  4. Produrre un documento Markdown.
  5. Produrre un risultato HTML interattivo da 62 KB.

Questa immagine mostra i risultati di ricerca più recenti dell'assistente Wenxin sulla congettura di Kakeya tridimensionale legata alla medaglia Fields. La ricerca è stata condotta seguendo sei fasi predefinite, esaminando la definizione centrale della congettura, la storia della ricerca precedente, i punti di innovazione, l'analisi della logica incrociata nei settori correlati, includendo 16 fonti accademiche autorevoli. Il risultato finale ha generato un documento Markdown da 63,746 KB e un report HTML interattivo visualizzato da 62,83 KB, corrispondente direttamente al caso di studio sul problema di Kakeya tridimensionale menzionato nel documento.

Il numero di fonti non è di per sé un indicatore di qualità.

Ciò che conta è se l'agente finale utilizza fonti autorevoli, attribuisce correttamente le affermazioni, risolve i conflitti, evita dati obsoleti e separa i fatti dalle interpretazioni.

Confronto tra modelli e prezzi AI recenti

L'editore ha anche chiesto a Wenxin di analizzare le capacità e i prezzi dei principali modelli nazionali e internazionali del mese precedente.

L'articolo afferma che l'agente:

  • Ha caricato una competenza di ricerca industriale.
  • Ha cercato in 45 fonti in due cicli.
  • Ha rilevato incertezze in alcune cifre chiave.
  • Ha eseguito un'ulteriore ricerca mirata su 29 fonti.
  • Ha incrociato i prezzi.
  • Ha prodotto un report di circa 7.000 caratteri cinesi con grafici.

L'immagine mostra la copertina del rapporto di analisi delle capacità e dei prezzi dei principali modelli di intelligenza artificiale nazionali e internazionali di luglio 2026. Nella parte superiore della copertina è indicata la data "Luglio 2026", al centro appare il titolo principale "Rapporto di analisi delle capacità e dei prezzi dei principali modelli di intelligenza artificiale nazionali e internazionali", mentre nella parte inferiore è riportata una nota in caratteri più piccoli "— Analisi completa basata su Artificial Analysis, LMSYS Arena e dati pubblici dei produttori —". Il rapporto è contrassegnato da un controllo antiplagio, con la pagina indicata come 1/76 e un totale di 6.900 parole. Questa immagine è correlata al contenuto "Analisi delle capacità e dei prezzi dei principali modelli di intelligenza artificiale nazionali e internazionali" presente nel documento e costituisce la copertina del rapporto.

Il ciclo di ricerca utile è:

Ricerca
→ individuare l'incertezza
→ cercare di nuovo
→ confrontare le fonti
→ risolvere o segnalare le discrepanze
→ scrivere

Quel passaggio di verifica aggiuntivo è spesso il punto in cui migliora la qualità della ricerca.

Un Secondo Primo Posto: PinchBench v2

Il risultato SuperCLUE ha fatto seguito a un primo posto di luglio su PinchBench v2.

PinchBench è stato creato da Kilo per valutare gli agenti su flussi di lavoro reali piuttosto che su benchmark tradizionali basati su domande e risposte.

La versione 2.0 di PinchBench di Kilo ha ampliato il benchmark a 148 attività e ha aggiunto criteri di valutazione e regole per la classifica più rigorosi.

Nella classifica di luglio riprodotta dall'articolo della fonte, il sistema di Baidu appariva come:

Orion-Mission-Mode

con:

Punteggio migliore:    94,6%
Punteggio medio: 94,4%

Questa immagine è una schermata della classifica dei punteggi dei sistemi relativi a PinchBench v2, che presenta gli indicatori chiave e i punteggi di ciascun sistema di intelligenza artificiale. Nell'immagine, le barre arancioni sono etichettate come "Average Score"; in cima, Orion-Mission-Mode raggiunge un punteggio medio del 94,6%, con un punteggio del 94,4% che lo colloca al primo posto, superando ampiamente altri sistemi in gara come anthropic/claude-opus-4.1 e qwen1.5/3.7-max. Lo screenshot mostra anche le etichette delle capacità specifiche di ciascun sistema, tra cui Writing Content, Creative, Data Analysis, ecc., illustrando direttamente le prestazioni dei vari modelli nelle diverse dimensioni delle attività, in linea con il contenuto del documento che menziona il primo posto di Wenxin Assistant nella classifica di luglio di questo benchmark.

Lo screenshot colloca Orion Mission Mode davanti a sistemi basati su modelli di Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI e altri in quella specifica istantanea.

La parola importante è istantanea.

Le classifiche degli agenti cambiano rapidamente.

Modelli, framework, prompt, politiche sugli strumenti e invii ai benchmark possono tutti essere aggiornati.

Un primo posto a luglio dovrebbe quindi essere citato con la sua data piuttosto che essere trattato come una classifica globale permanente.

Cosa Testa Realmente PinchBench v2

Kilo descrive PinchBench 2.0 come un benchmark di flussi di lavoro agentici reali.

Contiene attività che richiedono a un sistema di utilizzare strumenti e completare operazioni anziché semplicemente selezionare una risposta.

Il benchmark copre categorie come:

  • Scrittura.
  • Lavoro creativo.
  • Analisi dei dati.
  • Ricerca e lavoro basato sulla conoscenza.
  • Codice e operazioni.
  • Altri flussi di lavoro basati su computer.

L'articolo della fonte afferma che nella schermata della classifica erano rappresentate 59 voci tra modelli o agenti.

Questo numero può cambiare man mano che vengono aggiunti o aggiornati gli invii.

Il benchmark in sé è più stabile della popolazione della classifica.

La versione ufficiale di PinchBench 2.0 descrive:

148 attività

La fonte e diversi rapporti di luglio descrivono la valutazione di Wenxin su 147 attività completate, descrivendo anche PinchBench come un benchmark di 148 attività.

L'interpretazione più sicura è:

PinchBench v2 contiene 148 attività; la valutazione riportata di Orion Mission Mode potrebbe aver prodotto risultati con punteggio su 147 di esse in quella istantanea.

Questa distinzione è importante perché i report sui benchmark spesso mescolano la dimensione del benchmark con il numero di attività completate con successo

corse completate.

Punteggio migliore vs. punteggio medio

La fonte sottolinea che la modalità Missione Orion ha registrato:

94,6% punteggio migliore
94,4% punteggio medio

Il divario di 0,2 punti è ridotto.

Ciò suggerisce una bassa variazione tra le esecuzioni riportate.

Tuttavia, non dovrebbe essere interpretato come una garanzia universale di stabilità.

La varianza dei benchmark può dipendere da:

  • Numero di ripetizioni.
  • Temperatura di campionamento.
  • Disponibilità degli strumenti.
  • Siti web esterni.
  • Condizioni di rete.
  • Comportamento del valutatore.
  • Timeout dell'agente.
  • Aggiornamenti del modello.

La lezione pratica è semplicemente che l'esecuzione PinchBench riportata non è stata costruita attorno a un singolo risultato fortunato e isolato.

La sua media è rimasta vicina al punteggio migliore.

L'agente è più del modello sottostante

Uno dei punti più importanti nell'articolo della fonte è che il benchmark valuta un prodotto o sistema agente, non un modello linguistico nudo.

L'agente del task può combinare:

  • Un modello di base.
  • Ricerca.
  • Memoria.
  • Gestione file.
  • Selezione degli strumenti.
  • Pianificazione.
  • Sottoagenti.
  • Competenze di generazione documenti.
  • Accesso al browser o al web.
  • Esecuzione di codice.
  • Validazione.

Questo può essere espresso come:

Risultato dell'agente
=
capacità del modello
+
strumenti
+
memoria
+
pianificazione
+
ricerca
+
ambiente di esecuzione
+
verifica

Ecco perché bisogna essere cauti quando si dice:

"Il Modello X ha battuto il Modello Y."

La classifica potrebbe in realtà confrontare due diverse architetture di agenti che utilizzano strumenti e orchestrazioni differenti.

Una descrizione più precisa è:

"Il sistema agente X ha ottenuto un punteggio superiore al sistema agente Y in questa configurazione di benchmark."

Questa formulazione diventa sempre più importante man mano che i prodotti AI si trasformano in sistemi software complessi.

Dal rispondere alle domande al completare il lavoro

L'articolo della fonte inquadra il 2026 come l'anno in cui lo standard per un prodotto AI utile sta cambiando.

L'interazione precedente appariva così:

L'utente chiede
→ il modello risponde
→ l'utente svolge il lavoro

Il modello emergente basato su agenti appare così:

L'utente fornisce un obiettivo
→ l'agente pianifica
→ l'agente raccoglie il contesto
→ l'agente chiama gli strumenti
→ l'agente crea file
→ l'agente verifica i risultati
→ l'agente consegna l'artefatto

Questo cambia ciò che gli utenti notano.

Un modello può essere estremamente competente ma frustrante se non riesce a:

  • Ricordare i requisiti precedenti.
  • Aprire il file.
  • Formattare il foglio di calcolo.
  • Creare il documento richiesto.
  • Completare tutti i passaggi.
  • Correggere i propri errori.

La nuova condizione di successo è più vicina a:

Il task è stato effettivamente completato?

piuttosto che:

La risposta è stata impressionante?

Punto di accesso alle attività di Wenxin

L'articolo BAAI mostra l'opzione "Attività" direttamente nell'interfaccia di Wenxin.

L'immagine mostra l'interfaccia dell'assistente Baidu Wenxin. Nella parte superiore è presente la finestra di dialogo con il testo "Oggi vuoi essere un 'professionista efficiente' o preferisci trovare un posto dove sfogarti?", mentre nella parte inferiore c'è il campo di input "Aiutami a scrivere un modello di autopresentazione per il colloquio". Nella parte inferiore dell'interfaccia sono presenti diverse opzioni funzionali, tra cui l'opzione "Attività" evidenziata con un riquadro rosso. L'immagine è correlata al "Punto di accesso alle attività di Wenxin" menzionato sopra e mostra visivamente la posizione dell'opzione "Attività" nell'interfaccia di Wenxin, confermando il contenuto dell'articolo BAAI secondo cui l'opzione "Attività" si trova direttamente nell'interfaccia di Wenxin.

Il sito web ufficiale di Baidu Wenxin descrive il prodotto come un assistente AI multimodale per:

  • Creazione affidabile.
  • Ricerca approfondita.
  • Uso intelligente degli strumenti.
  • Lavoro sui documenti.
  • Scrittura.
  • Immagini.

Utilizzo su più dispositivi.

L'app Baidu elenca anche l'Assistente Wenxin come funzionalità AI integrata per ricerca approfondita, ricerca, scrittura, generazione di immagini, generazione video e assistenza conversazionale.

Ciò conferma che l'AI orientata alle attività è entrata nelle superfici consumer principali di Baidu, non restando più un esperimento riservato agli sviluppatori.

L'Assistente Wenxin è davvero gratuito e illimitato?

L'articolo sorgente sottolinea ripetutamente un punto commerciale:

L'Assistente Wenxin è gratuito e non ha paywall.

Le pagine ufficiali Baidu di Wenxin offrono attualmente accesso gratuito o esperienza gratuita.

Questo è facile da verificare.

L'affermazione più forte—permanentemente illimitato per ogni funzionalità task-agent—è più difficile da verificare da una pagina di policy ufficiale stabile.

I prodotti AI possono introdurre:

  • Quota giornaliere.
  • Limiti di concorrenza.
  • Limiti specifici per funzionalità.
  • Promozioni temporanee.
  • Livelli di account.
  • Restrizioni regionali.
  • Future modifiche ai prezzi.

Per la pubblicazione, la formulazione più sicura è:

L'Assistente Wenxin è attualmente disponibile per utenti individuali con opzioni di accesso gratuito, e l'esperienza delle attività mostrata nell'articolo sorgente non richiedeva un abbonamento a pagamento.

Non costruire un confronto sui costi a lungo termine basato su "illimitato per sempre" a meno che Baidu non pubblichi una policy specifica che lo garantisca.

Perché l'esperienza di ricerca può aiutare un agente

La sezione finale dell'articolo sorgente sostiene che la cronologia delle ricerche di Baidu le conferisce un vantaggio strutturale nel design degli agenti.

C'è un'analogia reale.

Un motore di ricerca gestisce qualcosa come:

Query utente
→ comprensione dell'intento
→ scomposizione della query
→ recupero
→ ranking
→ aggregazione dei risultati
→ risposta

Un agente gestisce:

Obiettivo utente
→ comprensione dell'intento
→ scomposizione del compito
→ selezione degli strumenti
→ esecuzione
→ aggregazione dei risultati
→ consegna

Le due pipeline non sono identiche.

Un agente ha uno spazio di azione molto più ampio e comporta un rischio di esecuzione maggiore.

Ma diverse capacità tecniche si trasferiscono naturalmente:

  • Comprensione dell'intento.
  • Riscrittura della query.
  • Recupero.
  • Ranking delle fonti.
  • Contesto della sessione.
  • Gestione della novità.
  • Deduplicazione.
  • Aggregazione delle prove.

Questo è particolarmente rilevante per gli agenti di ricerca.

Un sistema che ha già una solida infrastruttura di ricerca può costruire flussi di lavoro più profondi su di essa.

Comprensione delle query di ricerca vs. comprensione dei compiti dell'agente

Considera una richiesta di ricerca tradizionale:

Trova il volo più economico da Pechino a Shanghai.

Un sistema di ricerca potrebbe dover dedurre:

  • Origine.
  • Destinazione.
  • Date di viaggio.
  • Preferenza di prezzo.
  • Inventario dei voli idonei.
  • Ordine di ordinamento.

A un agente viene chiesto:

Trova il volo più economico Pechino–Shanghai e prepara un itinerario.

potrebbe dover aggiungere:

  • Selezione degli strumenti.
  • Ricerche multiple.
  • Confronto.
  • Verifica dei vincoli.
  • Generazione di file.
  • Eventualmente un passaggio di calendario o prenotazione.

La prima metà del problema assomiglia alla ricerca.

La seconda metà è orchestrazione delle azioni.

L'esperienza di ricerca fornisce componenti utili, ma la qualità dell'agente dipende comunque dal livello di esecuzione.

Memoria e sessioni di ricerca sono correlate—ma non uguali

La fonte collega anche il punteggio di memoria di Wenxin con l'esperienza di Baidu nella comprensione delle sessioni di ricerca.

C'è

una certa sovrapposizione concettuale.

Entrambi i sistemi devono dedurre quali informazioni delle interazioni precedenti rimangono rilevanti.

Una sessione di ricerca può contenere:

Query 1: auto elettriche
Query 2: autonomia oltre 600 km
Query 3: sotto i 250.000 RMB

Il sistema dovrebbe capire che la terza query riguarda ancora le auto elettriche.

Un sistema di memoria per agenti ha un compito più difficile.

Potrebbe dover ricordare:

  • Preferenze dell'utente.
  • Vincoli del task.
  • Fatti derivati dai file.
  • Decisioni.
  • Output degli strumenti.
  • Stato temporaneo.
  • Preferenze a lungo termine.

L'esperienza nelle sessioni di ricerca è utile, ma la memoria persistente degli agenti richiede meccanismi aggiuntivi di archiviazione, recupero, privacy e rilevanza.

L'analisi di ricerca è il punto in cui lo stack di ricerca di Baidu è più direttamente rilevante

Tra le cinque categorie di XClaw, l'analisi di ricerca è il punto più chiaro in cui il background di Baidu nella ricerca può essere trasferito direttamente.

Un agente di ricerca necessita di:

  • Copertura di ricerca.
  • Informazioni aggiornate.
  • Espansione delle query.
  • Ranking.
  • Gestione delle citazioni.
  • Confronto delle fonti.
  • Comprensione delle entità.
  • Recupero multilingue.

La documentazione ufficiale dell'assistente AI Qianfan di Baidu descrive anche una soluzione agent aziendale che integra Baidu Search, Baidu Baike, ricerca per immagini, gestione della conversazione, gestione della memoria e funzionalità documentali.

Questo non dimostra che il prodotto consumer Wenxin utilizzi esattamente la stessa implementazione.

Dimostra però che Baidu sta costruendo uno stack agent comune basato su ricerca, memoria, strumenti e recupero multimodale in tutto il suo portafoglio prodotti.

Cosa non dimostrano le due vittorie nei benchmark

Punteggi elevati nei benchmark sono prove utili.

Non rappresentano l'intera valutazione.

Non dimostrano una leadership globale permanente

Le classifiche cambiano.

Nuovi modelli e nuove submission di agenti possono superare l'attuale leader.

Non dimostrano che ogni task otterrà il 97%

XClaw aggrega task e categorie selezionati.

Il flusso di lavoro reale di un utente può essere molto diverso.

Non isolano il modello di base

Il punteggio appartiene all'assistente completo o allo stack agent.

Non misurano ogni problema di sicurezza

Un agente che completa i task in modo efficiente potrebbe comunque effettuare chiamate a strumenti non sicure o esporre informazioni sensibili in un ambiente diverso.

Non garantiscono l'accuratezza fattuale

Gli agenti di ricerca possono citare fonti deboli o interpretare male dati in continua evoluzione.

Non dimostrano un uso gratuito illimitato

Prezzi e quote dei prodotti sono politiche commerciali, non proprietà dei benchmark.

Come valutare da soli l'assistente Wenxin

Un test personale utile dovrebbe assomigliare al tuo lavoro reale.

Non porre solo domande banali.

Affida all'agente un task completo.

Test 1: Memoria

Fornisci cinque vincoli all'inizio di una lunga conversazione.

Dopo diversi turni non correlati, chiedi un artefatto finale e verifica se tutti e cinque sono stati preservati.

Test 2: Elaborazione dati

Carica:

  • Un foglio di calcolo.
  • Un PDF.
  • Un breve file di testo.

Chiedi all'agente di combinarli in un unico report.

Verifica indipendentemente ogni valore numerico.

Test 3: Ricerca

Scegli un argomento con informazioni in evoluzione.

Richiedi:

  • Fonti primarie.
  • Date di pubblicazione.
  • Confronto tra fonti in conflitto.
  • Link diretti.
  • Un elenco di affermazioni incerte.

Test 4: Documento

Creazione

Richiedi un artefatto Word, PowerPoint, foglio di calcolo o HTML.

Valuta:

  • Struttura.
  • Formattazione.
  • Completezza.
  • Scaricabilità.
  • Se il file si apre effettivamente.

Test 5: Programmazione

Richiedi una piccola applicazione interattiva.

Verifica:

  • Se funziona.
  • Se tutte le funzionalità richieste sono presenti.
  • Se gli errori vengono corretti.
  • Se il file finale è autonomo quando richiesto.

Test 6: Esecuzione a lungo orizzonte

Affida un compito che richiede diversi strumenti.

Osserva se il sistema:

  1. Elabora un piano.
  2. Sceglie strumenti ragionevoli.
  3. Si riprende dagli errori.
  4. Evita di ripetere il lavoro.
  5. Verifica il risultato finale.

Un modo migliore per confrontare i prodotti agentici

Quando confronti Wenxin con altri agenti, usa una tabella più ampia del "punteggio benchmark".

Dimensione Cosa misurare
Successo del compito Il lavoro richiesto è stato completato?
Memoria I vincoli precedenti sono stati mantenuti?
Precisione Numeri e affermazioni sono corretti?
Qualità della ricerca Le fonti sono autorevoli e aggiornate?
Affidabilità degli strumenti Le chiamate agli strumenti riescono in modo costante?
Qualità degli artefatti I file sono utilizzabili senza riparazioni manuali?
Recupero L'agente riesce a correggere passaggi falliti?
Latenza Quanto tempo richiede un compito completo?
Costo Quanto costa un risultato accettato?
Privacy Come vengono gestiti file caricati e memoria?
Disponibilità Le funzionalità principali sono gratuite, con limiti di quota o a pagamento?

Questo offre un quadro più realistico di un singolo posto in classifica.

Il cambiamento più grande: "Può consegnare?"

Il punto più forte dell'articolo originale va oltre Baidu.

La competizione tra agenti sta cambiando la definizione di qualità dell'IA.

Per la prima generazione di chatbot, gli utenti si concentravano sulla qualità delle risposte.

Per gli agenti operativi attuali, le domande chiave stanno diventando:

  • Riesce a mantenere il contesto?
  • Riesce a trovare le informazioni giuste?
  • Riesce a utilizzare gli strumenti?
  • Riesce a creare il file?
  • Riesce a completare un flusso di lavoro multi-fase?
  • Riesce a verificare il proprio risultato?
  • Posso fidarmi per lavori ripetuti?

Ecco perché benchmark come XClaw e PinchBench stanno attirando attenzione.

Avvicinano la valutazione al lavoro di produzione reale.

C'è ancora una lunga distanza tra un benchmark e una distribuzione aziendale.

Ma la direzione è utile:

Benchmark di conoscenza
→ benchmark di ragionamento
→ benchmark di uso degli strumenti
→ benchmark di compiti end-to-end
→ risultato di produzione reale

L'ultimo passaggio è in definitiva quello che conta.

Domande frequenti

Che punteggio ha ricevuto l'Assistente Baidu Wenxin su SuperCLUE XClaw?

L'istantanea di agosto 2026 di SuperCLUE XClaw attribuisce all'Assistente Wenxin un punteggio complessivo di 97,62, collocandolo al primo posto tra i prodotti mostrati. I suoi punteggi per categoria sono stati 90,28 per la programmazione, 99,44 per la creazione di contenuti, 98,86 per l'elaborazione dati, 96,44 per l'analisi di ricerca e 100 per la memoria.

Cosa significa un punteggio di memoria pari a 100?

Significa che Wenxin ha ricevuto il massimo dei voti nei compiti di memoria inclusi in quella valutazione XClaw. Non significa che l'assistente non possa mai dimenticare il contesto in ogni possibile conversazione reale.

Che cos'è PinchBench v2?

PinchBench v2 è un benchmark per agenti creato da Kilo che valuta i sistemi su compiti informatici e flussi di lavoro del mondo reale. La versione 2.0 contiene 148 compiti ed è progettata per misurare

esecuzione end-to-end piuttosto che semplice risposta a domande.

Qual è stato il punteggio di Wenxin nel PinchBench v2?

In un'istantanea della classifica di luglio 2026, l'agente di attività di Baidu è apparso come Orion Mission Mode con un punteggio massimo del 94,6% e un punteggio medio del 94,4%. Le classifiche cambiano nel tempo, quindi la data dell'istantanea dovrebbe essere inclusa quando si cita il risultato.

Wenxin Assistant è completamente gratuito?

Le pagine ufficiali di Baidu per Wenxin attualmente offrono opzioni di accesso gratuito o esperienza gratuita, e l'articolo originale afferma che le funzionalità dimostrate erano disponibili senza abbonamento a pagamento. Non è stata trovata una garanzia ufficiale stabile di utilizzo illimitato permanente per ogni funzionalità, quindi i limiti attuali dovrebbero essere verificati direttamente nel prodotto.

Wenxin Assistant può generare documenti Word e pagine web?

L'articolo originale mostra sessioni di test in cui Wenxin ha generato un piano aziendale Word formattato e pagine HTML interattive. Questi esempi dimostrano il flusso di lavoro del prodotto, ma non garantiscono che ogni prompt o ambiente produca lo stesso risultato.

Perché la tecnologia di ricerca di Baidu potrebbe aiutare i suoi agenti AI?

La ricerca e gli agenti condividono capacità come la comprensione dell'intento, la scomposizione delle query, il recupero, il ranking, l'aggregazione delle fonti e il contesto di sessione. Gli agenti aggiungono un livello di esecuzione più ampio, inclusi chiamate a strumenti, creazione di file, memoria, pianificazione e azione.

XClaw e PinchBench sono benchmark di modelli?

Non in senso stretto. Valutano prodotti o sistemi di agenti che possono combinare modelli con strumenti, memoria, ricerca, prompt, orchestrazione e ambienti di esecuzione. I loro punteggi dovrebbero quindi essere attribuiti alla configurazione completa dell'agente.

Strumenti correlati

  • Baidu Wenxin: Assistente AI multimodale ufficiale di Baidu per ricerca, creazione, documenti e lavoro orientato alle attività.
  • SuperCLUE XClaw: Il benchmark cinese per agenti orientato al prodotto citato nell'articolo originale.
  • PinchBench: Il benchmark reale di Kilo per flussi di lavoro di coding e utilizzo del computer da parte di agenti.
  • Pandoc: Strumento di conversione documenti utilizzato nel flusso di lavoro di test originale per estrarre e trasformare contenuti documentali.
  • Three.js: Libreria grafica 3D JavaScript utilizzata nell'esempio del Sistema Solare generato nell'articolo originale.
  • Baidu Qianfan: Piattaforma enterprise di Baidu per modelli, agenti, dati e sviluppo di applicazioni AI.
  • Baidu AgentBuilder: Piattaforma di Baidu per creare e pubblicare agenti personalizzati basati su Wenxin.

Link correlati

Valutazione](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): La pagina di benchmark citata nell'articolo originale.

Riepilogo

L'Assistente Wenxin di Baidu si è classificato primo nello snapshot SuperCLUE XClaw di agosto 2026 con 97,62 punti, inclusi un perfetto 100 in memoria e punteggi superiori a 96 in elaborazione dati, creazione di contenuti e analisi di ricerca.

Questo risultato segue uno snapshot della classifica PinchBench v2 di luglio in cui la Mission Mode Orion di Baidu ha registrato un miglior punteggio del 94,6% e un punteggio medio del 94,4%. I benchmark utilizzano task diversi, ma entrambi enfatizzano il completamento effettivo dei compiti piuttosto che la semplice risposta a domande.

La conclusione più importante non è che un assistente abbia "vinto" definitivamente la corsa agli agenti. Le classifiche degli agenti cambiano rapidamente, e i sistemi misurati includono modelli, strumenti, ricerca, memoria, prompt e orchestrazione.

Ciò che i due risultati dimostrano è che la valutazione dell'IA si sta spostando verso uno standard più pratico: non se il modello sembra intelligente, ma se l'agente riesce a portare a termine il lavoro e restituire un risultato utilizzabile.