L'Assistente Baidu Wenxin conquista il primo posto in SuperCLUE XClaw dopo aver guidato PinchBench v2
L'Assistente Baidu Wenxin ha conquistato il primo posto in un altro benchmark di tipo agente. Nella valutazione del prodotto XClaw di SuperCLUE di agosto 2026, l'Assistente Wenxin ha ottenuto un punteggio complessivo di 97

L'Assistente Wenxin di Baidu Conquista il Primo Posto in SuperCLUE XClaw Dopo Aver Guidato PinchBench v2
Introduzione
L'Assistente Wenxin di Baidu si è aggiudicato il primo posto in un altro benchmark di tipo agent.
Nella valutazione prodotto XClaw di SuperCLUE dell'agosto 2026, l'Assistente Wenxin ha ottenuto un punteggio complessivo di 97,62, il più alto nell'istantanea pubblicata.
I punteggi per categoria sono stati:
| Capacità | Punteggio |
|---|---|
| Codifica | 90,28 |
| Creazione di contenuti | 99,44 |
| Elaborazione dati | 98,86 |
| Analisi di ricerca | 96,44 |
| Memoria | 100,00 |
Il risultato è arrivato meno di tre settimane dopo un'altra prestazione di rilievo.
In un'istantanea di luglio di PinchBench v2, l'agente di compiti di Baidu—presentato come Orion Mission Mode—ha registrato un miglior punteggio del 94,6% e un punteggio medio del 94,4%, posizionandosi in cima a quell'istantanea della classifica.
I due benchmark sono diversi. SuperCLUE XClaw si concentra sui prodotti agent cinesi e sui risultati pratici in cinque dimensioni di capacità. PinchBench v2, creato da Kilo, è costruito attorno a compiti informatici e di automazione del mondo reale.
Insieme, indicano lo stesso cambiamento:
La valutazione degli agent si sta spostando da "Il modello può rispondere correttamente?" a "Il sistema può portare a termine il lavoro e fornire qualcosa di utilizzabile?"
Un modello linguistico può conoscere la risposta e fallire comunque come agente perché dimentica i requisiti, sceglie lo strumento sbagliato, gestisce male i file, si ferma a metà di un flusso di lavoro o restituisce l'artefatto sbagliato.
Questo rende gli ultimi risultati di Wenxin più legati all'esecuzione dei compiti che all'intelligenza pura del modello linguistico.

L'Assistente Wenxin Conquista il Primo Posto in SuperCLUE XClaw
SuperCLUE descrive XClaw come una valutazione orientata al prodotto per assistenti AI di tipo "Claw".
Piuttosto che basarsi principalmente su domande a scelta multipla, il benchmark enfatizza i risultati finali completati.
L'istantanea di agosto 2026 classifica i prodotti leader come segue:
| Posizione | Prodotto | Punteggio |
|---|---|---|
| 1 | Assistente Wenxin di Baidu | 97,62 |
| 2 | MiMoClaw | 96,74 |
| 3 | WorkBuddy | 96,61 |
| 4 | KimiClaw | 96,01 |
| 5 | MaxClaw | 94,79 |
Il benchmark valuta cinque dimensioni:
- Elaborazione dati.
- Creazione di contenuti.
- Memoria.
- Codifica.
- Analisi di ricerca.
La logica di base è semplice: l'agente riceve un compito e deve produrre un artefatto o risultato finale che possa essere effettivamente giudicato.
Questo rende il rispetto delle istruzioni, la gestione dei file, l'uso degli strumenti e l'esecuzione a lungo orizzonte parte del punteggio.

La Memoria Raggiunge 100
Il punteggio di categoria più eclatante è 100,00 nella memoria.
La memoria conta perché il lavoro reale raramente si esaurisce in un singolo prompt isolato.
Un utente può fornire vincoli all'inizio di una conversazione e aspettarsi che l'agente li rispetti molto più tardi.
Ad esempio:
Turno 1:
Usa solo i dati del Q2 2026.
Turno 3:
Mantieni il rapporto sotto le 10 pagine.
Turno 6:
Usa la stessa segmentazione di prodotto del foglio di calcolo.
Turno 10:
Genera il documento Word finale.
Un agente che dimentica la prima istruzione può produrre un risultato curato ma inutilizzabile.
La memoria quindi influisce su:
- Conservazione dei requisiti.
- Pianificazione multi-fase.
- Coerenza.
- Rilavorazione.
- Fiducia dell'utente.
- Completamento di attività di lunga durata.
Un punteggio perfetto in una categoria su un benchmark non significa che il prodotto non dimenticherà mai informazioni in sessioni reali arbitrarie. Dimostra però che Wenxin ha performato estremamente bene nei compiti di memoria inclusi in questa valutazione XClaw.
Elaborazione Dati: Punteggio 98,86
Wenxin Assistant ha ricevuto 98,86 nell'elaborazione dati.
La fonte descrive questa categoria come un test per verificare se il sistema è in grado di interpretare campi, combinare informazioni, preservare la precisione numerica e produrre output strutturati.
Sono compiti ingannevolmente difficili.
Un modello chat generico può riassumere bene un foglio di calcolo commettendo comunque un errore sottile in:
- Un filtro di data.
- Un subtotale.
- Una ricerca tra fogli.
- Una conversione di unità.
- Un valore decimale.
- Una mappatura di categoria.
Per uso aziendale, un numero errato può invalidare un intero documento.
L'editore della fonte ha testato Wenxin con un file di informazioni aziendali e gli ha chiesto di produrre un piano aziendale Q2 2026 come documento Word.
Secondo il registro del test, l'agente:
- Ha usato Pandoc per estrarre il file caricato.
- Ha strutturato le informazioni di origine.
- Ha caricato una capacità di elaborazione Word.
- Ha generato un documento formattato.
- Ha restituito un documento contenente più di 6.000 caratteri cinesi e 148 paragrafi.

Questo mostra la differenza tra lavoro di chat e lavoro di agente.
Un modello chat potrebbe scrivere il piano all'interno della conversazione.
Un flusso di lavoro agente può fare questo:
Leggi il file sorgente
→ estrai informazioni strutturate
→ abbozza il contenuto
→ formatta il documento Word
→ valida l'output
→ restituisci un file
L'artefatto, non la risposta in prosa, diventa il prodotto finale.
Creazione Contenuti: Punteggio 99,44
Wenxin ha ottenuto 99,44 per la creazione di contenuti.
In un benchmark per agenti, la creazione di contenuti non è semplicemente scrittura creativa.
Il sistema può dover soddisfare più vincoli contemporaneamente:
- Formato richiesto.
- Tono.
- Lunghezza.
- Struttura delle sezioni.
- Pubblico.
- Tipo di file.
- Ancoraggio fattuale.
- Presentazione visiva.
Una bozza può essere grammaticalmente corretta e fallire comunque perché
ignora il formato richiesto.
Ecco perché i benchmark sui prodotti valutano sempre più il completamento del compito, piuttosto che la sola qualità linguistica.
Punteggi di coding: 90,28
La categoria XClaw più bassa di Wenxin è stata il coding, con 90,28.
Si tratta comunque di un punteggio solido, ma il divario rispetto alla creazione di contenuti e all'elaborazione dei dati è significativo.
Gli agenti di coding devono gestire un ciclo operativo più ampio:
Comprendere il requisito
→ scegliere lo stack tecnologico
→ scrivere i file
→ eseguire o visualizzare l'anteprima
→ ispezionare gli errori
→ correggere
→ verificare l'interazione
→ impacchettare il risultato
L'editore della fonte ha testato il prodotto con una richiesta di una sola frase per un simulatore di Sistema Solare 3D.
Il flusso di lavoro segnalato utilizzava Three.js e ha restituito un'applicazione HTML monofile da 31 KB.
L'articolo mostra anche una pagina didattica di simulazione meteorologica generata tramite un flusso di lavoro Web interattivo simile.
Si tratta di demo illustrative, non di elementi ufficiali del benchmark XClaw.

Punteggi di analisi della ricerca: 96,44
Wenxin ha ottenuto 96,44 nell'analisi della ricerca.
Un'attività di ricerca seria può comportare:
- Comprendere la domanda.
- Suddividerla in sottodomande.
- Cercare in più fonti.
- Valutare la qualità delle fonti.
- Confrontare affermazioni contrastanti.
- Controllare le date.
- Estrarre valori numerici.
- Costruire un'argomentazione strutturata.
- Aggiungere citazioni.
- Produrre un report.
L'articolo di origine descrive due casi di prova.
Ricerca sul problema tridimensionale di Kakeya
L'editore ha chiesto a Wenxin di fare ricerche sulla congettura tridimensionale di Kakeya nel contesto della medaglia Fields Hong Wang.
Il comportamento segnalato dell'agente è stato:
- Pianificare un processo di ricerca in sei fasi.
- Lanciare diversi sottoagenti in parallelo.
- Cercare in 16 fonti accademiche.
- Produrre un documento Markdown.
- Produrre un risultato HTML interattivo da 62 KB.

Il numero di fonti non è di per sé un indicatore di qualità.
Ciò che conta è se l'agente finale utilizza fonti autorevoli, attribuisce correttamente le affermazioni, risolve i conflitti, evita dati obsoleti e separa i fatti dalle interpretazioni.
Confronto tra modelli e prezzi AI recenti
L'editore ha anche chiesto a Wenxin di analizzare le capacità e i prezzi dei principali modelli nazionali e internazionali del mese precedente.
L'articolo afferma che l'agente:
- Ha caricato una competenza di ricerca industriale.
- Ha cercato in 45 fonti in due cicli.
- Ha rilevato incertezze in alcune cifre chiave.
- Ha eseguito un'ulteriore ricerca mirata su 29 fonti.
- Ha incrociato i prezzi.
- Ha prodotto un report di circa 7.000 caratteri cinesi con grafici.

Il ciclo di ricerca utile è:
Ricerca
→ individuare l'incertezza
→ cercare di nuovo
→ confrontare le fonti
→ risolvere o segnalare le discrepanze
→ scrivere
Quel passaggio di verifica aggiuntivo è spesso il punto in cui migliora la qualità della ricerca.
Un Secondo Primo Posto: PinchBench v2
Il risultato SuperCLUE ha fatto seguito a un primo posto di luglio su PinchBench v2.
PinchBench è stato creato da Kilo per valutare gli agenti su flussi di lavoro reali piuttosto che su benchmark tradizionali basati su domande e risposte.
La versione 2.0 di PinchBench di Kilo ha ampliato il benchmark a 148 attività e ha aggiunto criteri di valutazione e regole per la classifica più rigorosi.
Nella classifica di luglio riprodotta dall'articolo della fonte, il sistema di Baidu appariva come:
Orion-Mission-Mode
con:
Punteggio migliore: 94,6%
Punteggio medio: 94,4%

Lo screenshot colloca Orion Mission Mode davanti a sistemi basati su modelli di Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI e altri in quella specifica istantanea.
La parola importante è istantanea.
Le classifiche degli agenti cambiano rapidamente.
Modelli, framework, prompt, politiche sugli strumenti e invii ai benchmark possono tutti essere aggiornati.
Un primo posto a luglio dovrebbe quindi essere citato con la sua data piuttosto che essere trattato come una classifica globale permanente.
Cosa Testa Realmente PinchBench v2
Kilo descrive PinchBench 2.0 come un benchmark di flussi di lavoro agentici reali.
Contiene attività che richiedono a un sistema di utilizzare strumenti e completare operazioni anziché semplicemente selezionare una risposta.
Il benchmark copre categorie come:
- Scrittura.
- Lavoro creativo.
- Analisi dei dati.
- Ricerca e lavoro basato sulla conoscenza.
- Codice e operazioni.
- Altri flussi di lavoro basati su computer.
L'articolo della fonte afferma che nella schermata della classifica erano rappresentate 59 voci tra modelli o agenti.
Questo numero può cambiare man mano che vengono aggiunti o aggiornati gli invii.
Il benchmark in sé è più stabile della popolazione della classifica.
La versione ufficiale di PinchBench 2.0 descrive:
148 attività
La fonte e diversi rapporti di luglio descrivono la valutazione di Wenxin su 147 attività completate, descrivendo anche PinchBench come un benchmark di 148 attività.
L'interpretazione più sicura è:
PinchBench v2 contiene 148 attività; la valutazione riportata di Orion Mission Mode potrebbe aver prodotto risultati con punteggio su 147 di esse in quella istantanea.
Questa distinzione è importante perché i report sui benchmark spesso mescolano la dimensione del benchmark con il numero di attività completate con successo
corse completate.
Punteggio migliore vs. punteggio medio
La fonte sottolinea che la modalità Missione Orion ha registrato:
94,6% punteggio migliore
94,4% punteggio medio
Il divario di 0,2 punti è ridotto.
Ciò suggerisce una bassa variazione tra le esecuzioni riportate.
Tuttavia, non dovrebbe essere interpretato come una garanzia universale di stabilità.
La varianza dei benchmark può dipendere da:
- Numero di ripetizioni.
- Temperatura di campionamento.
- Disponibilità degli strumenti.
- Siti web esterni.
- Condizioni di rete.
- Comportamento del valutatore.
- Timeout dell'agente.
- Aggiornamenti del modello.
La lezione pratica è semplicemente che l'esecuzione PinchBench riportata non è stata costruita attorno a un singolo risultato fortunato e isolato.
La sua media è rimasta vicina al punteggio migliore.
L'agente è più del modello sottostante
Uno dei punti più importanti nell'articolo della fonte è che il benchmark valuta un prodotto o sistema agente, non un modello linguistico nudo.
L'agente del task può combinare:
- Un modello di base.
- Ricerca.
- Memoria.
- Gestione file.
- Selezione degli strumenti.
- Pianificazione.
- Sottoagenti.
- Competenze di generazione documenti.
- Accesso al browser o al web.
- Esecuzione di codice.
- Validazione.
Questo può essere espresso come:
Risultato dell'agente
=
capacità del modello
+
strumenti
+
memoria
+
pianificazione
+
ricerca
+
ambiente di esecuzione
+
verifica
Ecco perché bisogna essere cauti quando si dice:
"Il Modello X ha battuto il Modello Y."
La classifica potrebbe in realtà confrontare due diverse architetture di agenti che utilizzano strumenti e orchestrazioni differenti.
Una descrizione più precisa è:
"Il sistema agente X ha ottenuto un punteggio superiore al sistema agente Y in questa configurazione di benchmark."
Questa formulazione diventa sempre più importante man mano che i prodotti AI si trasformano in sistemi software complessi.
Dal rispondere alle domande al completare il lavoro
L'articolo della fonte inquadra il 2026 come l'anno in cui lo standard per un prodotto AI utile sta cambiando.
L'interazione precedente appariva così:
L'utente chiede
→ il modello risponde
→ l'utente svolge il lavoro
Il modello emergente basato su agenti appare così:
L'utente fornisce un obiettivo
→ l'agente pianifica
→ l'agente raccoglie il contesto
→ l'agente chiama gli strumenti
→ l'agente crea file
→ l'agente verifica i risultati
→ l'agente consegna l'artefatto
Questo cambia ciò che gli utenti notano.
Un modello può essere estremamente competente ma frustrante se non riesce a:
- Ricordare i requisiti precedenti.
- Aprire il file.
- Formattare il foglio di calcolo.
- Creare il documento richiesto.
- Completare tutti i passaggi.
- Correggere i propri errori.
La nuova condizione di successo è più vicina a:
Il task è stato effettivamente completato?
piuttosto che:
La risposta è stata impressionante?
Punto di accesso alle attività di Wenxin
L'articolo BAAI mostra l'opzione "Attività" direttamente nell'interfaccia di Wenxin.

Il sito web ufficiale di Baidu Wenxin descrive il prodotto come un assistente AI multimodale per:
- Creazione affidabile.
- Ricerca approfondita.
- Uso intelligente degli strumenti.
- Lavoro sui documenti.
- Scrittura.
- Immagini.
Utilizzo su più dispositivi.
L'app Baidu elenca anche l'Assistente Wenxin come funzionalità AI integrata per ricerca approfondita, ricerca, scrittura, generazione di immagini, generazione video e assistenza conversazionale.
Ciò conferma che l'AI orientata alle attività è entrata nelle superfici consumer principali di Baidu, non restando più un esperimento riservato agli sviluppatori.
L'Assistente Wenxin è davvero gratuito e illimitato?
L'articolo sorgente sottolinea ripetutamente un punto commerciale:
L'Assistente Wenxin è gratuito e non ha paywall.
Le pagine ufficiali Baidu di Wenxin offrono attualmente accesso gratuito o esperienza gratuita.
Questo è facile da verificare.
L'affermazione più forte—permanentemente illimitato per ogni funzionalità task-agent—è più difficile da verificare da una pagina di policy ufficiale stabile.
I prodotti AI possono introdurre:
- Quota giornaliere.
- Limiti di concorrenza.
- Limiti specifici per funzionalità.
- Promozioni temporanee.
- Livelli di account.
- Restrizioni regionali.
- Future modifiche ai prezzi.
Per la pubblicazione, la formulazione più sicura è:
L'Assistente Wenxin è attualmente disponibile per utenti individuali con opzioni di accesso gratuito, e l'esperienza delle attività mostrata nell'articolo sorgente non richiedeva un abbonamento a pagamento.
Non costruire un confronto sui costi a lungo termine basato su "illimitato per sempre" a meno che Baidu non pubblichi una policy specifica che lo garantisca.
Perché l'esperienza di ricerca può aiutare un agente
La sezione finale dell'articolo sorgente sostiene che la cronologia delle ricerche di Baidu le conferisce un vantaggio strutturale nel design degli agenti.
C'è un'analogia reale.
Un motore di ricerca gestisce qualcosa come:
Query utente
→ comprensione dell'intento
→ scomposizione della query
→ recupero
→ ranking
→ aggregazione dei risultati
→ risposta
Un agente gestisce:
Obiettivo utente
→ comprensione dell'intento
→ scomposizione del compito
→ selezione degli strumenti
→ esecuzione
→ aggregazione dei risultati
→ consegna
Le due pipeline non sono identiche.
Un agente ha uno spazio di azione molto più ampio e comporta un rischio di esecuzione maggiore.
Ma diverse capacità tecniche si trasferiscono naturalmente:
- Comprensione dell'intento.
- Riscrittura della query.
- Recupero.
- Ranking delle fonti.
- Contesto della sessione.
- Gestione della novità.
- Deduplicazione.
- Aggregazione delle prove.
Questo è particolarmente rilevante per gli agenti di ricerca.
Un sistema che ha già una solida infrastruttura di ricerca può costruire flussi di lavoro più profondi su di essa.
Comprensione delle query di ricerca vs. comprensione dei compiti dell'agente
Considera una richiesta di ricerca tradizionale:
Trova il volo più economico da Pechino a Shanghai.
Un sistema di ricerca potrebbe dover dedurre:
- Origine.
- Destinazione.
- Date di viaggio.
- Preferenza di prezzo.
- Inventario dei voli idonei.
- Ordine di ordinamento.
A un agente viene chiesto:
Trova il volo più economico Pechino–Shanghai e prepara un itinerario.
potrebbe dover aggiungere:
- Selezione degli strumenti.
- Ricerche multiple.
- Confronto.
- Verifica dei vincoli.
- Generazione di file.
- Eventualmente un passaggio di calendario o prenotazione.
La prima metà del problema assomiglia alla ricerca.
La seconda metà è orchestrazione delle azioni.
L'esperienza di ricerca fornisce componenti utili, ma la qualità dell'agente dipende comunque dal livello di esecuzione.
Memoria e sessioni di ricerca sono correlate—ma non uguali
La fonte collega anche il punteggio di memoria di Wenxin con l'esperienza di Baidu nella comprensione delle sessioni di ricerca.
C'è
una certa sovrapposizione concettuale.
Entrambi i sistemi devono dedurre quali informazioni delle interazioni precedenti rimangono rilevanti.
Una sessione di ricerca può contenere:
Query 1: auto elettriche
Query 2: autonomia oltre 600 km
Query 3: sotto i 250.000 RMB
Il sistema dovrebbe capire che la terza query riguarda ancora le auto elettriche.
Un sistema di memoria per agenti ha un compito più difficile.
Potrebbe dover ricordare:
- Preferenze dell'utente.
- Vincoli del task.
- Fatti derivati dai file.
- Decisioni.
- Output degli strumenti.
- Stato temporaneo.
- Preferenze a lungo termine.
L'esperienza nelle sessioni di ricerca è utile, ma la memoria persistente degli agenti richiede meccanismi aggiuntivi di archiviazione, recupero, privacy e rilevanza.
L'analisi di ricerca è il punto in cui lo stack di ricerca di Baidu è più direttamente rilevante
Tra le cinque categorie di XClaw, l'analisi di ricerca è il punto più chiaro in cui il background di Baidu nella ricerca può essere trasferito direttamente.
Un agente di ricerca necessita di:
- Copertura di ricerca.
- Informazioni aggiornate.
- Espansione delle query.
- Ranking.
- Gestione delle citazioni.
- Confronto delle fonti.
- Comprensione delle entità.
- Recupero multilingue.
La documentazione ufficiale dell'assistente AI Qianfan di Baidu descrive anche una soluzione agent aziendale che integra Baidu Search, Baidu Baike, ricerca per immagini, gestione della conversazione, gestione della memoria e funzionalità documentali.
Questo non dimostra che il prodotto consumer Wenxin utilizzi esattamente la stessa implementazione.
Dimostra però che Baidu sta costruendo uno stack agent comune basato su ricerca, memoria, strumenti e recupero multimodale in tutto il suo portafoglio prodotti.
Cosa non dimostrano le due vittorie nei benchmark
Punteggi elevati nei benchmark sono prove utili.
Non rappresentano l'intera valutazione.
Non dimostrano una leadership globale permanente
Le classifiche cambiano.
Nuovi modelli e nuove submission di agenti possono superare l'attuale leader.
Non dimostrano che ogni task otterrà il 97%
XClaw aggrega task e categorie selezionati.
Il flusso di lavoro reale di un utente può essere molto diverso.
Non isolano il modello di base
Il punteggio appartiene all'assistente completo o allo stack agent.
Non misurano ogni problema di sicurezza
Un agente che completa i task in modo efficiente potrebbe comunque effettuare chiamate a strumenti non sicure o esporre informazioni sensibili in un ambiente diverso.
Non garantiscono l'accuratezza fattuale
Gli agenti di ricerca possono citare fonti deboli o interpretare male dati in continua evoluzione.
Non dimostrano un uso gratuito illimitato
Prezzi e quote dei prodotti sono politiche commerciali, non proprietà dei benchmark.
Come valutare da soli l'assistente Wenxin
Un test personale utile dovrebbe assomigliare al tuo lavoro reale.
Non porre solo domande banali.
Affida all'agente un task completo.
Test 1: Memoria
Fornisci cinque vincoli all'inizio di una lunga conversazione.
Dopo diversi turni non correlati, chiedi un artefatto finale e verifica se tutti e cinque sono stati preservati.
Test 2: Elaborazione dati
Carica:
- Un foglio di calcolo.
- Un PDF.
- Un breve file di testo.
Chiedi all'agente di combinarli in un unico report.
Verifica indipendentemente ogni valore numerico.
Test 3: Ricerca
Scegli un argomento con informazioni in evoluzione.
Richiedi:
- Fonti primarie.
- Date di pubblicazione.
- Confronto tra fonti in conflitto.
- Link diretti.
- Un elenco di affermazioni incerte.
Test 4: Documento
Creazione
Richiedi un artefatto Word, PowerPoint, foglio di calcolo o HTML.
Valuta:
- Struttura.
- Formattazione.
- Completezza.
- Scaricabilità.
- Se il file si apre effettivamente.
Test 5: Programmazione
Richiedi una piccola applicazione interattiva.
Verifica:
- Se funziona.
- Se tutte le funzionalità richieste sono presenti.
- Se gli errori vengono corretti.
- Se il file finale è autonomo quando richiesto.
Test 6: Esecuzione a lungo orizzonte
Affida un compito che richiede diversi strumenti.
Osserva se il sistema:
- Elabora un piano.
- Sceglie strumenti ragionevoli.
- Si riprende dagli errori.
- Evita di ripetere il lavoro.
- Verifica il risultato finale.
Un modo migliore per confrontare i prodotti agentici
Quando confronti Wenxin con altri agenti, usa una tabella più ampia del "punteggio benchmark".
| Dimensione | Cosa misurare |
|---|---|
| Successo del compito | Il lavoro richiesto è stato completato? |
| Memoria | I vincoli precedenti sono stati mantenuti? |
| Precisione | Numeri e affermazioni sono corretti? |
| Qualità della ricerca | Le fonti sono autorevoli e aggiornate? |
| Affidabilità degli strumenti | Le chiamate agli strumenti riescono in modo costante? |
| Qualità degli artefatti | I file sono utilizzabili senza riparazioni manuali? |
| Recupero | L'agente riesce a correggere passaggi falliti? |
| Latenza | Quanto tempo richiede un compito completo? |
| Costo | Quanto costa un risultato accettato? |
| Privacy | Come vengono gestiti file caricati e memoria? |
| Disponibilità | Le funzionalità principali sono gratuite, con limiti di quota o a pagamento? |
Questo offre un quadro più realistico di un singolo posto in classifica.
Il cambiamento più grande: "Può consegnare?"
Il punto più forte dell'articolo originale va oltre Baidu.
La competizione tra agenti sta cambiando la definizione di qualità dell'IA.
Per la prima generazione di chatbot, gli utenti si concentravano sulla qualità delle risposte.
Per gli agenti operativi attuali, le domande chiave stanno diventando:
- Riesce a mantenere il contesto?
- Riesce a trovare le informazioni giuste?
- Riesce a utilizzare gli strumenti?
- Riesce a creare il file?
- Riesce a completare un flusso di lavoro multi-fase?
- Riesce a verificare il proprio risultato?
- Posso fidarmi per lavori ripetuti?
Ecco perché benchmark come XClaw e PinchBench stanno attirando attenzione.
Avvicinano la valutazione al lavoro di produzione reale.
C'è ancora una lunga distanza tra un benchmark e una distribuzione aziendale.
Ma la direzione è utile:
Benchmark di conoscenza
→ benchmark di ragionamento
→ benchmark di uso degli strumenti
→ benchmark di compiti end-to-end
→ risultato di produzione reale
L'ultimo passaggio è in definitiva quello che conta.
Domande frequenti
Che punteggio ha ricevuto l'Assistente Baidu Wenxin su SuperCLUE XClaw?
L'istantanea di agosto 2026 di SuperCLUE XClaw attribuisce all'Assistente Wenxin un punteggio complessivo di 97,62, collocandolo al primo posto tra i prodotti mostrati. I suoi punteggi per categoria sono stati 90,28 per la programmazione, 99,44 per la creazione di contenuti, 98,86 per l'elaborazione dati, 96,44 per l'analisi di ricerca e 100 per la memoria.
Cosa significa un punteggio di memoria pari a 100?
Significa che Wenxin ha ricevuto il massimo dei voti nei compiti di memoria inclusi in quella valutazione XClaw. Non significa che l'assistente non possa mai dimenticare il contesto in ogni possibile conversazione reale.
Che cos'è PinchBench v2?
PinchBench v2 è un benchmark per agenti creato da Kilo che valuta i sistemi su compiti informatici e flussi di lavoro del mondo reale. La versione 2.0 contiene 148 compiti ed è progettata per misurare
esecuzione end-to-end piuttosto che semplice risposta a domande.
Qual è stato il punteggio di Wenxin nel PinchBench v2?
In un'istantanea della classifica di luglio 2026, l'agente di attività di Baidu è apparso come Orion Mission Mode con un punteggio massimo del 94,6% e un punteggio medio del 94,4%. Le classifiche cambiano nel tempo, quindi la data dell'istantanea dovrebbe essere inclusa quando si cita il risultato.
Wenxin Assistant è completamente gratuito?
Le pagine ufficiali di Baidu per Wenxin attualmente offrono opzioni di accesso gratuito o esperienza gratuita, e l'articolo originale afferma che le funzionalità dimostrate erano disponibili senza abbonamento a pagamento. Non è stata trovata una garanzia ufficiale stabile di utilizzo illimitato permanente per ogni funzionalità, quindi i limiti attuali dovrebbero essere verificati direttamente nel prodotto.
Wenxin Assistant può generare documenti Word e pagine web?
L'articolo originale mostra sessioni di test in cui Wenxin ha generato un piano aziendale Word formattato e pagine HTML interattive. Questi esempi dimostrano il flusso di lavoro del prodotto, ma non garantiscono che ogni prompt o ambiente produca lo stesso risultato.
Perché la tecnologia di ricerca di Baidu potrebbe aiutare i suoi agenti AI?
La ricerca e gli agenti condividono capacità come la comprensione dell'intento, la scomposizione delle query, il recupero, il ranking, l'aggregazione delle fonti e il contesto di sessione. Gli agenti aggiungono un livello di esecuzione più ampio, inclusi chiamate a strumenti, creazione di file, memoria, pianificazione e azione.
XClaw e PinchBench sono benchmark di modelli?
Non in senso stretto. Valutano prodotti o sistemi di agenti che possono combinare modelli con strumenti, memoria, ricerca, prompt, orchestrazione e ambienti di esecuzione. I loro punteggi dovrebbero quindi essere attribuiti alla configurazione completa dell'agente.
Strumenti correlati
- Baidu Wenxin: Assistente AI multimodale ufficiale di Baidu per ricerca, creazione, documenti e lavoro orientato alle attività.
- SuperCLUE XClaw: Il benchmark cinese per agenti orientato al prodotto citato nell'articolo originale.
- PinchBench: Il benchmark reale di Kilo per flussi di lavoro di coding e utilizzo del computer da parte di agenti.
- Pandoc: Strumento di conversione documenti utilizzato nel flusso di lavoro di test originale per estrarre e trasformare contenuti documentali.
- Three.js: Libreria grafica 3D JavaScript utilizzata nell'esempio del Sistema Solare generato nell'articolo originale.
- Baidu Qianfan: Piattaforma enterprise di Baidu per modelli, agenti, dati e sviluppo di applicazioni AI.
- Baidu AgentBuilder: Piattaforma di Baidu per creare e pubblicare agenti personalizzati basati su Wenxin.
Link correlati
- Sito ufficiale Baidu Wenxin: Punto di ingresso ufficiale attuale per Wenxin Assistant su web e client scaricabili.
- Assistente desktop Baidu Wenxin: Pagina desktop ufficiale che evidenzia analisi documenti, ricerca, creazione, esportazione ed esperienza gratuita.
- SuperCLUE XClaw Agosto 2026: Pagina della classifica di agosto 2026 per il benchmark XClaw.
Valutazione](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): La pagina di benchmark citata nell'articolo originale.
- Kilo: PinchBench 2.0 Is Here: Spiegazione ufficiale dei 148 task di PinchBench v2, delle modifiche al punteggio, della valutazione parallela e del design della classifica.
- Documentazione dell'Assistente AI Baidu Qianfan: Documentazione ufficiale che descrive l'assistente AI aziendale integrato con ricerca di Baidu, memoria, conversazione e servizi file.
- Pagina ufficiale di download dell'app Baidu: La scheda ufficiale dell'app Baidu che descrive l'Assistente Wenxin integrato e le funzionalità di ricerca approfondita.
- Documentazione Wenxin AgentBuilder di Baidu: Documentazione ufficiale per la creazione di agenti sull'ecosistema Wenxin di Baidu.
Riepilogo
L'Assistente Wenxin di Baidu si è classificato primo nello snapshot SuperCLUE XClaw di agosto 2026 con 97,62 punti, inclusi un perfetto 100 in memoria e punteggi superiori a 96 in elaborazione dati, creazione di contenuti e analisi di ricerca.
Questo risultato segue uno snapshot della classifica PinchBench v2 di luglio in cui la Mission Mode Orion di Baidu ha registrato un miglior punteggio del 94,6% e un punteggio medio del 94,4%. I benchmark utilizzano task diversi, ma entrambi enfatizzano il completamento effettivo dei compiti piuttosto che la semplice risposta a domande.
La conclusione più importante non è che un assistente abbia "vinto" definitivamente la corsa agli agenti. Le classifiche degli agenti cambiano rapidamente, e i sistemi misurati includono modelli, strumenti, ricerca, memoria, prompt e orchestrazione.
Ciò che i due risultati dimostrano è che la valutazione dell'IA si sta spostando verso uno standard più pratico: non se il modello sembra intelligente, ma se l'agente riesce a portare a termine il lavoro e restituire un risultato utilizzabile.