Baidu Wenxin Assistant führt SuperCLUE XClaw an, nachdem PinchBench v2 dominiert wurde

Baidu Wenxin Assistant hat den ersten Platz in einem weiteren Agenten-Benchmark belegt. In der XClaw-Produktbewertung von SuperCLUE vom August 2026 erreichte Wenxin Assistant eine Gesamtpunktzahl von 97

发布于 2026年8月7日generalGEO 评分: 01 次阅读
Baidu Wenxin Assistant führt SuperCLUE XClaw an, nachdem PinchBench v2 dominiert wurde

Baidu Wenxin Assistant führt SuperCLUE XClaw an, nachdem PinchBench v2 dominiert wurde

Einleitung

Baidu Wenxin Assistant hat den ersten Platz in einer weiteren agentenbasierten Benchmark-Be Wertung belegt.

In der XClaw-Produktbewertung von SuperCLUE vom August 2026 erzielte Wenxin Assistant eine Gesamtpunktzahl von 97,62 – die höchste Punktzahl in der veröffentlichten Rangliste.

Die Kategorie-Ergebnisse im Überblick:

Fähigkeit Punktzahl
Programmierung 90,28
Inhaltserstellung 99,44
Datenverarbeitung 98,86
Recherche & Analyse 96,44
Gedächtnis 100,00

Dieses Ergebnis kam weniger als drei Wochen nach einer weiteren starken Leistung.

In einer Juli-Rangliste von PinchBench v2 verzeichnete Baidus Task-Agent – eingereicht als Orion Mission Mode – eine Bestpunktzahl von 94,6 % und eine Durchschnittspunktzahl von 94,4 % und landete damit an der Spitze dieser Benchmark-Rangliste.

Die beiden Benchmarks unterscheiden sich. SuperCLUE XClaw konzentriert sich auf chinesische Agent-Produkte und praktische Arbeitsergebnisse in fünf Leistungsdimensionen. PinchBench v2, entwickelt von Kilo, basiert auf realen Computer- und Automatisierungsaufgaben.

Zusammen deuten sie auf denselben Wandel hin:

Die Bewertung von Agenten verschiebt sich von „Kann das Modell richtig antworten?" hin zu „Kann das System die Aufgabe abschließen und ein nutzbares Ergebnis liefern?"

Ein Sprachmodell kann die Antwort kennen und dennoch als Agent scheitern, weil es Anforderungen vergisst, das falsche Werkzeug wählt, Dateien falsch behandelt, mitten im Workflow stoppt oder das falsche Artefakt zurückgibt.

Das macht die neuesten Wenxin-Ergebnisse eher zu einer Frage der Aufgabenausführung als der rohen Sprachmodell-Intelligenz.

Dieses Bild zeigt die August-2026-Durchschnittsergebnis-Rangliste der SuperCLUE-XClaw-Produktbewertung. Der Kerninhalt stellt klar die Rangfolge und die entsprechenden Punktzahlen der teilnehmenden Herstellerprodukte dar. Baidu Wenxin Assistant liegt mit 97,62 Punkten auf Platz 1; Xiaomi MiMoClaw folgt mit 96,74 Punkten auf Platz 2; Tencent WorkBuddy und Moonshot KimiClaw belegen mit 96,61 bzw. 96,01 Punkten die Plätze 2 und 2; MaxClaw von Xiyu Technology liegt mit 94,79 Punkten auf Platz 3. Die Seite kennzeichnet Informationen wie den Bewertungsmaßstab und die Datencharge der Rangliste und veranschaulicht direkt die Leistungsfähigkeit der Produkte in der Bewertung chinesischer intelligenter Produkte, was mit dem im Dokument erwähnten Inhalt korrespondiert, dass Wenxin Assistant in der SuperCLUE-XClaw-Bewertung die höchste Punktzahl erzielte.

Wenxin Assistant belegt den ersten Platz bei SuperCLUE XClaw

SuperCLUE beschreibt XClaw als eine produktorientierte Bewertung für „Claw"-artige KI-Assistenten.

Anstatt sich hauptsächlich auf Multiple-Choice-Fragen zu stützen, legt die Benchmark den Schwerpunkt auf abgeschlossene Arbeitsergebnisse.

Die Rangliste vom August 2026 führt die führenden Produkte wie folgt auf:

Rang Produkt Punktzahl
1 Baidu Wenxin Assistant 97,62
2 MiMoClaw 96,74
3 WorkBuddy 96,61
4 KimiClaw 96,01
5 MaxClaw 94,79

Die Benchmark bewertet fünf Dimensionen:

  1. Datenverarbeitung.
  2. Inhaltserstellung.
  3. Gedächtnis.
  4. Programmierung.
  5. Recherche & Analyse.

Die grundlegende Logik ist einfach: Der Agent erhält eine Aufgabe und muss ein endgültiges Artefakt oder Ergebnis produzieren, das tatsächlich bewertet werden kann.

Das macht Anweisungsbefolgung, Dateiverwaltung, Werkzeugnutzung und langfristige Ausführung zu Teilen der Bewertung.

![Das Bild zeigt die Platzierung von Baidu Wenxin Assistant in den SuperCLUE-XClaw-Fähigkeitsdimensionen (Durchschnittsergebnis). Die Punktzahlen in den fünf Dimensionen Codeentwicklung, Inhaltserstellung, Datenverarbeitung, Recherche & Analyse und Gedächtnis betragen 90,28, 99,44, 98,86, 96,44 bzw. 100,00. Das Bild korrespondiert mit der oben erwähnten Beschreibung von SuperCLUE XClaw als produktorientierte Bewertung für „Claw"-artige KI-Assistenten und veranschaulicht direkt die Leistung von Baidu Wenxin Assistant in diesem Bewertungssystem, was die Datenbasis für dessen ersten Platz bei SuperCLUE XClaw liefert.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/08/8091b61c-6902-450f-b7a9-6798e0b4b1a9-85d3c984-465d-4f02-a847-63b0ef72d60d.png)

Speicher erreicht 100

Die auffälligste Kategoriebewertung ist 100,00 im Bereich Speicher.

Speicher ist wichtig, weil reale Arbeit selten in einen einzigen isolierten Prompt passt.

Ein Benutzer kann zu Beginn eines Gesprächs Einschränkungen festlegen und erwarten, dass der Agent diese viel später respektiert.

Zum Beispiel:

Runde 1:
Verwende nur Daten aus Q2 2026.

Runde 3:
Halte den Bericht unter 10 Seiten.

Runde 6:
Verwende dieselbe Produktsegmentierung wie in der Tabellenkalkulation.

Runde 10:
Generiere das endgültige Word-Dokument.

Ein Agent, der die erste Anweisung vergisst, kann ein stilistisch ausgefeiltes, aber unbrauchbares Ergebnis produzieren.

Speicher beeinflusst daher:

  • Anforderungstreue.
  • Mehrstufige Planung.
  • Konsistenz.
  • Nacharbeit.
  • Benutzervertrauen.
  • Abschluss langlaufender Aufgaben.

Eine perfekte Kategoriebewertung in einem Benchmark bedeutet nicht, dass das Produkt in beliebigen realen Sitzungen niemals Informationen vergisst. Es zeigt jedoch, dass Wenxin bei den in dieser XClaw-Bewertung enthaltenen Speicheraufgaben außergewöhnlich gut abgeschnitten hat.

Datenverarbeitung erreicht 98,86

Wenxin Assistant erhielt 98,86 in der Datenverarbeitung.

Die Quelle beschreibt diese Kategorie als Test, ob das System Felder interpretieren, Informationen kombinieren, numerische Präzision bewahren und strukturierte Ausgaben erzeugen kann.

Dies sind täuschend schwierige Aufgaben.

Ein allgemeines Chat-Modell kann eine Tabellenkalkulation gut zusammenfassen und dennoch einen subtilen Fehler machen bei:

  • Einem Datumsfilter.
  • Einer Zwischensumme.
  • Einer abteilungsübergreifenden Suche.
  • Einer Einheitenumrechnung.
  • Einem Dezimalwert.
  • Einer Kategoriezuordnung.

Für den Geschäftsgebrauch kann eine einzige falsche Zahl ein gesamtes Dokument ungültig machen.

Der Herausgeber der Quelle testete Wenxin mit einer Firmeninformationsdatei und bat um die Erstellung eines Geschäftsplans für Q2 2026 als Word-Dokument.

Laut Testprotokoll hat der Agent:

  1. Pandoc verwendet, um die hochgeladene Datei zu extrahieren.
  2. Die Quelleninformationen strukturiert.
  3. Eine Textverarbeitungsfunktion geladen.
  4. Ein formatiertes Dokument erzeugt.
  5. Ein Dokument mit mehr als 6.000 chinesischen Zeichen und 148 Absätzen zurückgegeben.

Dieses Bild zeigt die Testergebnisse des Baidu Wenxin Assistant als Agenten bei der Erstellung eines Geschäftsplans. Der obere Teil des Bildes zeigt, wie der Benutzer dem Agenten den Auftrag erteilt, einen Geschäftsplan für Q2 2026 für das KI-Hardware-Startup „Zhixin Future" zu schreiben, als Word-Dokument mit den angegebenen Abschnittsanforderungen; der untere Teil des Bildes zeigt das Ausführungsergebnis mit dem erfolgreich generierten Word-Dokument mit ca. 6.000 Zeichen und 148 Absätzen, das die Zeichenanforderung erfüllt und die Prüfung bestanden hat, mit einer Download-Option, was die Fähigkeiten von Wenxin Assistant in Datenverarbeitung und strukturierter Inhaltserstellung veranschaulicht.

Dies zeigt den Unterschied zwischen Chat- und Agentenarbeit.

Ein Chat-Modell könnte den Plan innerhalb des Gesprächs schreiben.

Ein Agenten-Workflow kann Folgendes tun:

Quelldatei lesen
→ strukturierte Informationen extrahieren
→ Inhalt entwerfen
→ Word-Dokument formatieren
→ Ausgabe validieren
→ Datei zurückgeben

Das Artefakt, nicht die Prosa-Antwort, wird zum Endprodukt.

Inhaltserstellung erreicht 99,44

Wenxin erreichte 99,44 in der Inhaltserstellung.

In einem Agenten-Benchmark ist Inhaltserstellung nicht einfach kreatives Schreiben.

Das System muss möglicherweise mehrere Einschränkungen gleichzeitig erfüllen:

  • Gefordertes Format.
  • Tonfall.
  • Länge.
  • Abschnittsstruktur.
  • Zielgruppe.
  • Dateityp.
  • Faktische Verankerung.
  • Visuelle Darstellung.

Ein Entwurf kann grammatikalisch gut sein und dennoch scheitern, weil er

ignoriert das angeforderte Format.

Deshalb bewerten Produkt-Benchmarks zunehmend die Vollständigkeit und nicht nur die sprachliche Qualität.

Programmier-Bewertung: 90,28

Wenxins niedrigste XClaw-Kategorie war Programmieren mit 90,28.

Das ist immer noch ein starkes Ergebnis, aber die Lücke im Vergleich zu Content-Erstellung und Datenverarbeitung ist aufschlussreich.

Coding-Agenten müssen eine umfangreichere operative Schleife verwalten:

Anforderung verstehen
→ Technologie-Stack wählen
→ Dateien schreiben
→ Ausführen oder Vorschau
→ Fehler prüfen
→ Beheben
→ Interaktion verifizieren
→ Ergebnis verpacken

Der Herausgeber der Quelle testete das Produkt mit einer Ein-Satz-Anfrage für einen 3D-Sonnensystem-Simulator.

Der berichtete Workflow verwendete Three.js und lieferte eine 31 KB große HTML-Einzeldatei-Anwendung.

Der Artikel zeigt außerdem eine Lehrseite zur Wettersimulation, die über einen ähnlichen interaktiven Web-Workflow erstellt wurde.

Dabei handelt es sich um veranschaulichende Demos und nicht um offizielle XClaw-Benchmark-Elemente.

Das Bild ist das Cover des Geschäftsplans für das zweite Quartal 2026, mit hellblauem Hintergrund und der Aufschrift „智芯未来 – 2026年Q2商业计划书“ oben. Der Titel lautet „2026年Q2季度商业计划书“, der Untertitel „Fokus auf KI-Smart-Hardware: von ‚Made in China‘ zu ‚Intelligently Made in China‘“. Darunter werden der Firmenname „智芯未来科技有限公司“ angezeigt, gekennzeichnet als vertrauliches Dokument, nur für interne und potenzielle Investoren zur Referenz, datiert auf Juni 2026. Dieses Cover befindet sich am Anfang des Dokuments und leitet zu den folgenden Inhalten über den KI-Smart-Hardware-Geschäftsplan über.

Recherche-Analyse-Wertung: 96,44

Wenxin erhielt 96,44 in der Recherche-Analyse.

Eine ernsthafte Rechercheaufgabe kann Folgendes umfassen:

  1. Verstehen der Frage.
  2. Aufteilen in Unterfragen.
  3. Durchsuchen mehrerer Quellen.
  4. Bewerten der Quellenqualität.
  5. Vergleichen widersprüchlicher Aussagen.
  6. Prüfen von Daten.
  7. Extrahieren numerischer Werte.
  8. Aufbau eines strukturierten Arguments.
  9. Hinzufügen von Zitaten.
  10. Erstellen eines Berichts.

Der Quellartikel beschreibt zwei Testfälle.

Recherche zum dreidimensionalen Kakeya-Problem

Der Herausgeber bat Wenxin, die dreidimensionale Kakeya-Vermutung im Kontext des Fields-Medaillengewinners Hong Wang zu recherchieren.

Das berichtete Agentenverhalten war:

  1. Planung eines sechsstufigen Rechercheprozesses.
  2. Starten mehrerer Unteragenten parallel.
  3. Durchsuchen von 16 akademischen Quellen.
  4. Erstellen eines Markdown-Dokuments.
  5. Erstellen eines 62 KB großen interaktiven HTML-Ergebnisses.

Dieses Bild zeigt die neuesten Forschungsergebnisse zum dreidimensionalen Kakeya-Problem, die von Wenxin Assistant im Zusammenhang mit dem Fields-Preis erstellt wurden. Die Forschung folgte einem vorgeplanten sechsstufigen Prozess, ordnete die Kerndefinitionen, die bisherige Forschungsgeschichte und innovative Durchbrüche, analysierte die Querverbindungslogik verwandter Bereiche, bezog 16 maßgebliche akademische Quellen für die Recherche ein und erzeugte schließlich ein 63,746 KB großes Markdown-Dokument und einen 62,83 KB großen interaktiven HTML-Bericht mit visuellen Ergebnissen. Das Gesamtergebnis entspricht direkt dem im Dokument erwähnten Fallbeispiel zur dreidimensionalen Kakeya-Forschung.

Die Anzahl der Quellen ist für sich genommen keine Qualitätsmetrik.

Entscheidend ist, ob der endgültige Agent autoritative Quellen verwendet, Behauptungen korrekt zuordnet, Konflikte auflöst, veraltete Daten vermeidet und Fakten von Interpretationen trennt.

Vergleich aktueller KI-Modelle und Preise

Der Herausgeber bat Wenxin außerdem, die Fähigkeiten und Preise wichtiger in- und ausländischer Modelle des Vormonats zu analysieren.

Der Artikel sagt, der Agent:

  • Habe eine Branchenrecherche-Fähigkeit geladen.
  • Habe 45 Quellen in zwei Runden durchsucht.
  • Habe Unsicherheiten bei einigen Schlüsselzahlen erkannt.
  • Habe eine weitere gezielte Suche über 29 Quellen durchgeführt.
  • Habe Preise gegengeprüft.
  • Habe einen Bericht von etwa 7.000 chinesischen Zeichen mit Diagrammen erstellt.

Das Bild zeigt das Cover des Berichts „Analyse und Preisvergleich der Fähigkeiten gängiger großer KI-Modelle im In- und Ausland" vom Juli 2026. Oben auf dem Cover steht das Datum „Juli 2026", in der Mitte der große Titel „Analyse und Preisvergleich der Fähigkeiten gängiger großer KI-Modelle im In- und Ausland", darunter die kleine Anmerkung „— Eine umfassende Bewertung auf Grundlage von Artificial Analysis, LMSYS Arena und öffentlichen Herstellerdaten —". Der Bericht ist mit einer Plagiatsprüfungskennzeichnung versehen, die Seite zeigt 1/76 an, mit 6.900 Wörtern. Dieses Bild steht im Zusammenhang mit dem Inhalt „Analyse der Fähigkeiten und Preise gängiger großer KI-Modelle im In- und Ausland" im Dokument und ist das Coverbild dieses Berichts.

Die nützliche Forschungsschleife lautet:

Suche
→ Unsicherheit identifizieren
→ erneut suchen
→ Quellen vergleichen
→ Diskrepanzen auflösen oder kennzeichnen
→ schreiben

Dieser zusätzliche Verifikationsdurchlauf führt oft zu einer Verbesserung der Forschungsqualität.

Ein zweiter erster Platz: PinchBench v2

Das SuperCLUE-Ergebnis folgte auf einen ersten Platz im Juli bei PinchBench v2.

PinchBench wurde von Kilo entwickelt, um Agenten anhand realer Arbeitsabläufe zu bewerten, anstatt anhand traditioneller Frage-Antwort-Benchmarks.

Die Veröffentlichung von Kilo's PinchBench 2.0 erweiterte den Benchmark auf 148 Aufgaben und fügte strengere Bewertungs- und Leaderboard-Regeln hinzu.

Im Juli-Leaderboard-Schnappschuss, der im Quellartikel wiedergegeben wird, erschien Baidus System als:

Orion-Mission-Mode

mit:

Bestpunktzahl:    94,6%
Durchschnittspunktzahl: 94,4%

Das Bild zeigt einen Screenshot der PinchBench-v2-System-Ergebnisrangliste mit den Kernkennzahlen und Punktzahlen verschiedener KI-Systeme. Die orangefarbenen Balken sind mit „Average Score" gekennzeichnet, wobei Orion-Mission-Mode ganz oben mit einer Durchschnittspunktzahl von 94,6% bzw. 94,4% den ersten Platz belegt und damit andere teilnehmende Systeme wie anthropic/claude-opus-4.1 und qwen1.5/3.7-max deutlich übertrifft. Der Screenshot zeigt außerdem die entsprechenden Detailkompetenz-Labels der einzelnen Systeme, darunter Writing Content, Creative, Data Analysis usw., und veranschaulicht direkt die Leistung der einzelnen Modelle bei verschiedenen Aufgabenbereichen. Dies steht im Einklang mit dem im Dokument erwähnten Inhalt, dass Wenxin Assistant im Juli-Schnappschuss dieses Benchmarks den ersten Platz belegte.

Der Screenshot platziert Orion Mission Mode in diesem speziellen Schnappschuss vor Systemen, die auf Modellen von Anthropic, Alibaba, NVIDIA, Xiaomi, xAI, OpenAI und anderen basieren.

Das entscheidende Wort ist Schnappschuss.

Agenten-Leaderboards ändern sich schnell.

Modelle, Testumgebungen, Prompts, Tool-Richtlinien und Benchmark-Einreichungen können alle aktualisiert werden.

Ein erster Platz im Juli sollte daher mit seinem Datum zitiert werden und nicht als dauerhaftes globales Ranking behandelt werden.

Was PinchBench v2 tatsächlich testet

Kilo beschreibt PinchBench 2.0 als Benchmark für reale Agenten-Workflows.

Er enthält Aufgaben, die von einem System verlangen, Tools zu verwenden und Operationen abzuschließen, anstatt einfach eine Antwort auszuwählen.

Der Benchmark deckt Kategorien ab wie:

  • Schreiben.
  • Kreative Arbeit.
  • Datenanalyse.
  • Forschung und Wissensarbeit.
  • Code und Operationen.
  • Andere computerbasierte Arbeitsabläufe.

Der Quellartikel besagt, dass 59 Modell- oder Agenten-Einträge im Leaderboard-Schnappschuss vertreten waren.

Diese Zahl kann sich ändern, wenn Einreichungen hinzugefügt oder aktualisiert werden.

Der Benchmark selbst ist stabiler als die Leaderboard-Bevölkerung.

Die offizielle Veröffentlichung von PinchBench 2.0 beschreibt:

148 Aufgaben

Die Quelle und mehrere Juli-Berichte beschreiben Wenzins Auswertung über 147 abgeschlossene Aufgaben, während sie PinchBench gleichzeitig als einen Benchmark mit 148 Aufgaben beschreiben.

Die sicherste Interpretation ist:

PinchBench v2 enthält 148 Aufgaben; die gemeldete Orion-Mission-Mode-Auswertung könnte in diesem Schnappschuss bewertete Ergebnisse für 147 davon geliefert haben.

Diese Unterscheidung ist wichtig, weil Benchmark-Berichte oft die Größe des Benchmarks mit der Anzahl der erfolgreich

abgeschlossene Läufe.

Bestleistung vs. Durchschnittsleistung

Die Quelle betont, dass der Orion-Missionsmodus Folgendes aufgezeichnet hat:

94,6 % Bestleistung
94,4 % Durchschnittsleistung

Die Differenz von 0,2 Punkten ist gering.

Das deutet auf eine geringe Schwankung zwischen den gemeldeten Läufen hin.

Es sollte jedoch nicht als universelle Stabilitätsgarantie interpretiert werden.

Die Varianz von Benchmarks kann abhängen von:

  • Anzahl der Wiederholungen.
  • Sampling-Temperatur.
  • Verfügbarkeit von Tools.
  • Externen Websites.
  • Netzwerkbedingungen.
  • Verhalten des Bewerters.
  • Timeouts des Agents.
  • Modellaktualisierungen.

Die praktische Lehre ist schlicht, dass der gemeldete PinchBench-Lauf nicht auf einem einzelnen isolierten Glückstreffer beruhte.

Sein Durchschnitt blieb nahe an seiner Bestleistung.

Der Agent ist mehr als das zugrunde liegende Modell

Einer der wichtigsten Punkte im Quellartikel ist, dass der Benchmark ein Produkt oder Agentsystem bewertet, nicht ein nacktes Sprachmodell.

Der Aufgaben-Agent kann kombinieren:

  • Ein Basismodell.
  • Suche.
  • Speicher.
  • Dateiverwaltung.
  • Toolauswahl.
  • Planung.
  • Subagenten.
  • Dokumentgenerierungsfähigkeiten.
  • Browser- oder Webzugriff.
  • Codeausführung.
  • Validierung.

Dies lässt sich wie folgt ausdrücken:

Agentenergebnis
=
Modellfähigkeit
+
Tools
+
Speicher
+
Planung
+
Suche
+
Ausführungsumgebung
+
Verifikation

Deshalb sollte man vorsichtig sein, wenn man sagt:

„Modell X hat Modell Y geschlagen.“

Die Rangliste vergleicht möglicherweise tatsächlich zwei verschiedene Agentenstapel mit unterschiedlichen Tools und Orchestrierung.

Eine präzisere Beschreibung wäre:

„Agentsystem X hat unter dieser Benchmark-Konfiguration besser abgeschnitten als Agentsystem Y.“

Diese Formulierung wird zunehmend wichtiger, da sich KI-Produkte in komplexe Softwaresysteme verwandeln.

Von der Beantwortung von Fragen zur Erledigung von Aufgaben

Der Quellartikel betrachtet 2026 als das Jahr, in dem sich der Standard für ein nützliches KI-Produkt verschiebt.

Die ältere Interaktion sah so aus:

Benutzer fragt
→ Modell antwortet
→ Benutzer führt die Arbeit aus

Das aufkommende Agentenmuster sieht so aus:

Benutzer gibt Ziel vor
→ Agent plant
→ Agent sammelt Kontext
→ Agent ruft Tools auf
→ Agent erstellt Dateien
→ Agent prüft Ergebnisse
→ Agent liefert Artefakt

Das verändert, was Benutzer wahrnehmen.

Ein Modell kann äußerst sachkundig, aber frustrierend sein, wenn es nicht:

  • Frühere Anforderungen merken kann.
  • Die Datei öffnen kann.
  • Die Tabelle formatieren kann.
  • Das angeforderte Dokument erstellen kann.
  • Alle Schritte abschließen kann.
  • Seine eigenen Fehler korrigieren kann.

Die neue Erfolgsbedingung liegt näher an:

Wurde die Aufgabe tatsächlich abgeschlossen?

als:

War die Antwort beeindruckend?

Wenxins Aufgaben-Einstiegspunkt

Der BAAI-Artikel zeigt die Option „Aufgabe“ direkt in der Wenxin-Oberfläche.

Das Bild zeigt die Oberfläche des Baidu Wenxin Assistant. Oben befindet sich das Dialogfeld „Heute ‚Effizienz-Profi‘ sein oder einen Baumloch-Chat suchen?“, unten das Eingabefeld „Hilf mir, eine Vorlage für die Selbstvorstellung im Vorstellungsgespräch zu schreiben“. Am unteren Rand der Oberfläche befinden sich mehrere Funktionsoptionen, wobei die Option „Aufgabe“ mit einem roten Rahmen hervorgehoben ist. Das Bild steht in Zusammenhang mit dem oben erwähnten „Wenxins Aufgaben-Einstiegspunkt“ und zeigt anschaulich die Position der Option „Aufgabe“ in der Wenxin-Oberfläche, was den Inhalt des BAAI-Artikels bestätigt, dass die Option „Aufgabe“ direkt in der Wenxin-Oberfläche vorhanden ist.

Die offizielle Wenxin-Website von Baidu beschreibt das Produkt als multimodalen KI-Assistenten für:

  • Vertrauenswürdiges Erstellen.
  • Tiefensuche.
  • Intelligente Toolnutzung.
  • Dokumentarbeit.
  • Schreiben.
  • Bilder.

Geräteübergreifende Nutzung.

Die Baidu-App listet Wenxin Assistant ebenfalls als integrierte KI-Funktion für Deep Research, Suche, Schreiben, Bildgenerierung, Videogenerierung und Konversationsunterstützung.

Dies bestätigt, dass aufgabenorientierte KI in Baidus Mainstream-Verbraucheroberflächen Einzug gehalten hat und nicht länger ein reines Entwicklerexperiment ist.

Ist Wenxin Assistant wirklich kostenlos und unbegrenzt?

Der Quellartikel hebt wiederholt einen kommerziellen Punkt hervor:

Wenxin Assistant ist kostenlos und hat keine Bezahlschranke.

Baidus offizielle Wenxin-Seiten bieten derzeit kostenlosen Zugang oder eine kostenlose Testphase.

Das ist leicht zu überprüfen.

Die stärkere Aussage—dauerhaft unbegrenzt für alle Aufgaben-Agent-Funktionen—ist anhand einer stabilen offiziellen Richtlinienseite schwerer zu verifizieren.

KI-Produkte können einführen:

  • Tageskontingente.
  • Gleichzeitigkeitslimits.
  • Funktionsspezifische Limits.
  • Zeitlich begrenzte Aktionen.
  • Kontostufen.
  • Regionale Beschränkungen.
  • Zukünftige Preisänderungen.

Für die Veröffentlichung ist die sicherere Formulierung:

Wenxin Assistant ist derzeit für einzelne Nutzer mit Optionen für kostenlosen Zugang verfügbar, und die im Quellartikel gezeigte Aufgabenerfahrung erforderte kein kostenpflichtiges Abonnement.

Erstellen Sie keinen langfristigen Kostenvergleich auf Basis von „unbegrenzt für immer“, es sei denn, Baidu veröffentlicht eine spezifische Richtlinie, die dies garantiert.

Warum Sucheerfahrung einem Agenten helfen kann

Der letzte Abschnitt des Quellartikels argumentiert, dass Baidus Suchverlauf ihm einen strukturellen Vorteil beim Agentendesign verschafft.

Es gibt eine echte Analogie.

Eine Suchmaschine verarbeitet etwa Folgendes:

Nutzerabfrage
→ Intent-Verständnis
→ Abfragezerlegung
→ Abruf
→ Ranking
→ Ergebnisaggregation
→ Antwort

Ein Agent verarbeitet:

Nutzerziel
→ Intent-Verständnis
→ Aufgabenzerlegung
→ Tool-Auswahl
→ Ausführung
→ Ergebnisaggregation
→ Bereitstellung

Die beiden Pipelines sind nicht identisch.

Ein Agent hat einen viel größeren Aktionsraum und trägt ein höheres Ausführungsrisiko.

Aber mehrere technische Fähigkeiten übertragen sich natürlich:

  • Intent-Verständnis.
  • Abfrageumschreibung.
  • Abruf.
  • Quellen-Ranking.
  • Sitzungskontext.
  • Aktualitätshandhabung.
  • Deduplizierung.
  • Evidenzaggregation.

Dies ist besonders relevant für Research-Agenten.

Ein System, das bereits über eine starke Suchinfrastruktur verfügt, kann darauf tiefere Workflows aufbauen.

Suchabfrage-Verständnis vs. Agentenaufgaben-Verständnis

Betrachten Sie eine traditionelle Suchanfrage:

Finde den günstigsten Flug von Peking nach Shanghai.

Ein Suchsystem muss möglicherweise ableiten:

  • Abflugort.
  • Zielort.
  • Reisedaten.
  • Preispräferenz.
  • Verfügbares Flugangebot.
  • Sortierreihenfolge.

Ein Agent, der gebeten wird:

Finde den günstigsten Flug Peking–Shanghai und erstelle eine Reiseroute.

muss möglicherweise hinzufügen:

  • Tool-Auswahl.
  • Mehrere Suchen.
  • Vergleich.
  • Einschränkungsprüfung.
  • Dateigenerierung.
  • Möglicherweise einen Kalender- oder Buchungsschritt.

Die erste Hälfte des Problems ähnelt der Suche.

Die zweite Hälfte ist Aktionsorchestrierung.

Sucheerfahrung liefert nützliche Komponenten, aber die Agentenqualität hängt weiterhin von der Ausführungsebene ab.

Gedächtnis und Suchsitzungen sind verwandt—aber nicht dasselbe

Die Quelle verbindet auch Wenhins Gedächtnisbewertung mit Baidus Erfahrung im Verständnis von Suchsitzungen.

Es gibt

einige konzeptionelle Überschneidungen.

Beide Systeme müssen ableiten, welche Informationen aus früheren Interaktionen weiterhin relevant sind.

Eine Suchsitzung kann Folgendes enthalten:

Anfrage 1: Elektroautos
Anfrage 2: Reichweite über 600 km
Anfrage 3: unter 250.000 RMB

Das System sollte verstehen, dass sich die dritte Anfrage immer noch auf Elektroautos bezieht.

Ein Agenten-Gedächtnissystem hat eine schwierigere Aufgabe.

Es muss sich möglicherweise merken:

  • Benutzerpräferenzen.
  • Aufgabenbeschränkungen.
  • Aus Dateien abgeleitete Fakten.
  • Entscheidungen.
  • Tool-Ausgaben.
  • Temporären Zustand.
  • Langfristige Präferenzen.

Suchsitzungs-Know-how ist nützlich, aber ein persistentes Agenten-Gedächtnis erfordert zusätzliche Mechanismen für Speicherung, Abruf, Datenschutz und Relevanz.

Forschungsanalyse ist der Bereich, in dem Baidus Such-Stack am direktesten relevant ist

Unter den fünf XClaw-Kategorien ist die Forschungsanalyse der klarste Bereich, in dem Baidus Suchhintergrund direkt übertragbar ist.

Ein Forschungsagent benötigt:

  • Suchabdeckung.
  • Aktuelle Informationen.
  • Abfrage-Erweiterung.
  • Ranking.
  • Zitierhandhabung.
  • Quellenvergleich.
  • Entitätsverständnis.
  • Mehrsprachigen Abruf.

Baidus offizielle Qianfan-KI-Assistent-Dokumentation beschreibt ebenfalls eine Unternehmens-Agentenlösung, die Baidu-Suche, Baidu Baike, Bildersuche, Gesprächsverwaltung, Gedächtnisverwaltung und Dokumentfunktionen integriert.

Das beweist nicht, dass das Verbraucherprodukt Wenxin exakt dieselbe Implementierung verwendet.

Es zeigt jedoch, dass Baidu einen gemeinsamen Agenten-Stack rund um Suche, Gedächtnis, Tools und multimodalen Abruf über sein Produktportfolio hinweg aufbaut.

Was die beiden Benchmark-Siege nicht beweisen

Hohe Benchmark-Ergebnisse sind nützliche Belege.

Sie sind nicht die vollständige Bewertung.

Sie beweisen keine dauerhafte globale Führungsrolle

Ranglisten ändern sich.

Neue Modelle und neue Agenten-Einreichungen können den aktuellen Spitzenreiter überholen.

Sie beweisen nicht, dass jede Aufgabe 97 % erreichen wird

XClaw aggregiert ausgewählte Aufgaben und Kategorien.

Der reale Arbeitsablauf eines Benutzers kann ganz anders aussehen.

Sie isolieren nicht das Basismodell

Die Punktzahl gehört zum vollständigen Assistenten- oder Agenten-Stack.

Sie messen nicht jedes Sicherheitsproblem

Ein Agent, der Aufgaben effizient erledigen kann, könnte dennoch unsichere Tool-Aufrufe tätigen oder in einer anderen Umgebung vertrauliche Informationen offenlegen.

Sie garantieren keine faktische Genauigkeit

Forschungsagenten können schwache Quellen zitieren oder sich ändernde Daten falsch interpretieren.

Sie beweisen keine unbegrenzte kostenlose Nutzung

Produktpreise und Kontingente sind kommerzielle Richtlinien, keine Benchmark-Eigenschaften.

So bewerten Sie den Wenxin-Assistenten selbst

Ein sinnvoller persönlicher Test sollte Ihrer realen Arbeit ähneln.

Stellen Sie nicht nur Wissensfragen.

Geben Sie dem Agenten eine vollständige Aufgabe.

Test 1: Gedächtnis

Geben Sie zu Beginn eines langen Gesprächs fünf Einschränkungen vor.

Stellen Sie nach mehreren unzusammenhängenden Gesprächsrunden eine abschließende Ausgabe an und prüfen Sie, ob alle fünf erhalten bleiben.

Test 2: Datenverarbeitung

Laden Sie hoch:

  • Eine Tabelle.
  • Ein PDF.
  • Eine kurze Textdatei.

Bitten Sie den Agenten, diese zu einem Bericht zu kombinieren.

Überprüfen Sie jeden numerischen Wert unabhängig.

Test 3: Recherche

Wählen Sie ein Thema mit sich ändernden Informationen.

Verlangen Sie:

  • Primärquellen.
  • Veröffentlichungsdaten.
  • Vergleich widersprüchlicher Quellen.
  • Direkte Links.
  • Eine Liste unsicherer Behauptungen.

Test 4: Dokument

Erstellung

Bitten Sie um ein Word-, PowerPoint-, Tabellenkalkulations- oder HTML-Artefakt.

Bewertung:

  • Struktur.
  • Formatierung.
  • Vollständigkeit.
  • Download-Möglichkeit.
  • Ob die Datei tatsächlich geöffnet werden kann.

Test 5: Programmierung

Bitten Sie um eine kleine interaktive Anwendung.

Prüfen Sie:

  • Ob sie läuft.
  • Ob alle angeforderten Funktionen vorhanden sind.
  • Ob Fehler behoben werden.
  • Ob die endgültige Datei auf Anfrage eigenständig ist.

Test 6: Langfristige Ausführung

Geben Sie eine Aufgabe, die mehrere Werkzeuge erfordert.

Beobachten Sie, ob das System:

  1. Einen Plan erstellt.
  2. Vernünftige Werkzeuge auswählt.
  3. Sich von Fehlern erholt.
  4. Wiederholte Arbeit vermeidet.
  5. Das Endergebnis verifiziert.

Ein besserer Weg, Agent-Produkte zu vergleichen

Beim Vergleich von Wenxin mit anderen Agenten verwenden Sie eine Tabelle, die breiter ist als eine „Benchmark-Punktzahl“.

Dimension Was gemessen wird
Aufgaben-Erfolg Wurde die angeforderte Arbeit abgeschlossen?
Speicher Wurden frühere Einschränkungen beibehalten?
Genauigkeit Sind Zahlen und Aussagen korrekt?
Recherche-Qualität Sind Quellen autoritativ und aktuell?
Werkzeug-Zuverlässigkeit Gelingen Werkzeugaufrufe durchgängig?
Artefakt-Qualität Sind Dateien ohne manuelle Reparatur nutzbar?
Erholung Kann der Agent fehlgeschlagene Schritte beheben?
Latenz Wie lange dauert eine vollständige Aufgabe?
Kosten Was kostet ein akzeptiertes Ergebnis?
Datenschutz Wie werden hochgeladene Dateien und Speicher behandelt?
Verfügbarkeit Sind Kernfunktionen kostenlos, kontingentbegrenzt oder kostenpflichtig?

Dies ergibt ein realistischeres Bild als ein einzelner Ranglistenplatz.

Der größere Wandel: „Kann es liefern?“

Der stärkste Punkt des Quellartikels geht über Baidu hinaus.

Der Agenten-Wettbewerb verändert die Definition von KI-Qualität.

Für die erste Generation von Chatbots konzentrierten sich die Nutzer auf die Antwortqualität.

Für aktuelle Aufgaben-Agenten werden die Schlüsselfragen zunehmend:

  • Kann es den Kontext behalten?
  • Kann es die richtigen Informationen finden?
  • Kann es Werkzeuge bedienen?
  • Kann es die Datei erstellen?
  • Kann es einen mehrstufigen Arbeitsablauf abschließen?
  • Kann es sein eigenes Ergebnis verifizieren?
  • Kann ich ihm wiederholte Arbeit anvertrauen?

Deshalb erregen Benchmarks wie XClaw und PinchBench Aufmerksamkeit.

Sie bringen die Bewertung näher an die Produktionsarbeit.

Zwischen einem Benchmark und einer Unternehmensbereitstellung liegt noch eine lange Strecke.

Aber die Richtung ist nützlich:

Wissens-Benchmark
→ Denk-Benchmark
→ Werkzeugnutzungs-Benchmark
→ End-to-End-Aufgaben-Benchmark
→ Echtes Produktionsergebnis

Der letzte Schritt ist letztendlich der, der zählt.

Häufige Fragen

Welche Punktzahl erhielt Baidu Wenxin Assistant bei SuperCLUE XClaw?

Die SuperCLUE-XClaw-Momentaufnahme vom August 2026 gibt Wenxin Assistant eine Gesamtpunktzahl von 97,62 und platziert es damit auf dem ersten Platz der gezeigten Produkte. Die Kategoriewerte betrugen 90,28 für Programmierung, 99,44 für Inhaltserstellung, 98,86 für Datenverarbeitung, 96,44 für Recherche-Analyse und 100 für Speicher.

Was bedeutet eine Speicherpunktzahl von 100?

Es bedeutet, dass Wenxin bei den in dieser XClaw-Bewertung enthaltenen Speicheraufgaben die volle Punktzahl erhalten hat. Es bedeutet nicht, dass der Assistent in jedem möglichen realen Gespräch niemals den Kontext vergessen kann.

Was ist PinchBench v2?

PinchBench v2 ist ein Agenten-Benchmark von Kilo, der Systeme an realen Computer- und Arbeitsablaufaufgaben bewertet. Version 2.0 enthält 148 Aufgaben und ist darauf ausgelegt, zu messen

End-to-End-Ausführung statt einfacher Beantwortung von Fragen.

Wie hoch war Wenxins PinchBench-v2-Ergebnis?

In einer Leaderboard-Aufnahme vom Juli 2026 erschien Baidus Task-Agent als Orion Mission Mode mit einer Bestwertung von 94,6 % und einer Durchschnittswertung von 94,4 %. Leaderboards ändern sich im Laufe der Zeit, daher sollte bei der Zitierung des Ergebnisses das Datum der Aufnahme angegeben werden.

Ist Wenxin Assistant vollständig kostenlos?

Die offiziellen Baidu-Wenxin-Seiten bieten derzeit Optionen für kostenlosen Zugang oder kostenlose Testversionen an, und der Quellartikel besagt, dass die demonstrierten Aufgabenfunktionen ohne kostenpflichtiges Abonnement verfügbar waren. Eine dauerhafte offizielle Garantie für unbegrenzte Nutzung aller Funktionen wurde nicht gefunden, daher sollten aktuelle Kontingente direkt im Produkt geprüft werden.

Kann Wenxin Assistant Word-Dokumente und Webseiten erstellen?

Der Quellartikel zeigt Testsitzungen, in denen Wenxin ein formatiertes Word-Geschäftsplandokument und interaktive HTML-Seiten erstellte. Diese Beispiele demonstrieren den Aufgaben-Workflow des Produkts, sind jedoch keine Garantie dafür, dass jede Eingabeaufforderung oder Umgebung dasselbe Ergebnis liefert.

Warum könnte Baidus Suchtechnologie seinen KI-Agenten helfen?

Suche und Agenten teilen Fähigkeiten wie Absichtsverständnis, Abfragezerlegung, Abruf, Ranking, Quellenaggregation und Sitzungskontext. Agenten fügen eine breitere Ausführungsebene hinzu, einschließlich Tool-Aufrufen, Dateierstellung, Speicher, Planung und Aktionen.

Sind XClaw und PinchBench Modell-Benchmarks?

Nicht im engeren Sinne. Sie bewerten Produkt- oder Agentensysteme, die Modelle mit Tools, Speicher, Suche, Eingabeaufforderungen, Orchestrierung und Ausführungsumgebungen kombinieren können. Ihre Ergebnisse sollten daher der vollständigen Agentenkonfiguration zugeschrieben werden.

Verwandte Tools

  • Baidu Wenxin: Baidus offizieller multimodaler KI-Assistent für Suche, Erstellung, Dokumente und aufgabenorientierte Arbeit.
  • SuperCLUE XClaw: Der produktorientierte chinesische Agent-Benchmark, der im Quellartikel zitiert wird.
  • PinchBench: Kilos praxisnaher Benchmark für Coding- und Computer-Nutzungs-Agent-Workflows.
  • Pandoc: Ein Dokumentkonvertierungstool, das im Quelltest-Workflow zum Extrahieren und Transformieren von Dokumentinhalten verwendet wird.
  • Three.js: Eine JavaScript-3D-Grafikbibliothek, die im generierten Sonnensystem-Beispiel des Quellartikels verwendet wird.
  • Baidu Qianfan: Baidus Unternehmensplattform für Modelle, Agenten, Daten und KI-Anwendungsentwicklung.
  • Baidu AgentBuilder: Baidus Plattform zum Erstellen und Veröffentlichen benutzerdefinierter Wenxin-basierter Agenten.

Verwandte Links

  • Offizielle Baidu-Wenxin-Website: Aktueller offizieller Produkteinstiegspunkt für Wenxin Assistant im Web und in herunterladbaren Clients.
  • Baidu Wenxin Desktop-Assistent: Offizielle Desktop-Seite mit Schwerpunkt auf Dokumentanalyse, Suche, Erstellung, Export und kostenloser Testversion.
  • [SuperCLUE XClaw August 2026

Evaluation](https://superclueai.com/xclawpage?category=openclaw&name=SuperCLUE-XClaw%E9%BE%99%E8%99%BE%E4%BA%A7%E5%93%81%E6%B5%8B%E8%AF%84&folder=XClaw&date_if_exists=2026%E5%B9%B48%E6%9C%88): Die Benchmark-Seite, auf die der ursprüngliche Artikel verweist.

Zusammenfassung

Der Baidu Wenxin-Assistent belegte im August-2026-XClaw-Schnappschuss von SuperCLUE den ersten Platz mit 97,62 Punkten, darunter perfekte 100 Punkte im Speicher und Werte über 96 bei Datenverarbeitung, Inhaltserstellung und Recherche-Analyse.

Dieses Ergebnis folgt auf einen PinchBench-v2-Leaderboard-Schnappschuss vom Juli, bei dem Baidus Orion-Missionsmodus einen Bestwert von 94,6 % und einen Durchschnittswert von 94,4 % erzielte. Die Benchmarks verwenden unterschiedliche Aufgaben, aber beide legen den Schwerpunkt auf die tatsächliche Aufgabenerfüllung statt auf einfache Fragenbeantwortung.

Die wichtigste Erkenntnis ist nicht, dass ein Assistent das Agenten-Rennen dauerhaft „gewonnen“ hat. Agenten-Rankings ändern sich schnell, und die gemessenen Systeme umfassen Modelle, Tools, Suche, Speicher, Eingabeaufforderungen und Orchestrierung.

Was die beiden Ergebnisse zeigen, ist, dass die KI-Bewertung zu einem praxisorientierteren Standard übergeht: nicht ob das Modell intelligent klingt, sondern ob der Agent die Arbeit erledigen und ein brauchbares Ergebnis zurückliefern kann.

Baidu Wenxin Assistant Tops SuperCLUE XClaw After Leading PinchBench v2