DeepSeek V4 Pro belegt im SuperCLUE Terminal-Programmier-Benchmark den zweiten Platz – zu einem Bruchteil der Kosten von Kimi K3

DeepSeek-V4-Pro-0813 erreicht im neuesten SuperCLUE-Terminal-Benchmark für chinesische intelligente Terminal-Programmierung den zweiten Platz mit 51,52 Punkten und liegt damit nur hinter Kimi K3.

发布于 2026年8月14日generalGEO 评分: 01 次阅读
DeepSeek V4 Pro belegt im SuperCLUE Terminal-Programmier-Benchmark den zweiten Platz – zu einem Bruchteil der Kosten von Kimi K3

DeepSeek V4 Pro erreicht Platz zwei im SuperCLUE-Terminal-Programmier-Benchmark zu einem Bruchteil der Kosten von Kimi K3

Einleitung

DeepSeek-V4-Pro-0813 erreichte Platz zwei im neuesten SuperCLUE-Terminal-Benchmark für chinesische KI-Agenten-Terminal-Programmierung mit einer Punktzahl von 51,52 Punkten. Es liegt nur hinter Kimi K3, das mit 60,61 Punkten die Rangliste anführt.

Dieses Ergebnis ist vor allem wegen seines Kostenvorteils bemerkenswert. Bei der Durchführung des Benchmarks kostete DeepSeek-V4-Pro-0813 durchschnittlich etwa 1,42 RMB pro Aufgabe und zeigte damit ein starkes Preis-Leistungs-Verhältnis unter den hochpunktzahlenden Modellen.

SuperCLUE-Terminal ist auf reale Programmieraufgaben chinesischer Entwickler ausgelegt. Die Modelle werden über eine universelle Agenten-Framework auf Basis von Claude Code evaluiert, wodurch der Benchmark die Modelle hinsichtlich Verständnis chinesischer Anforderungen, Planung mehrstufiger Arbeitsabläufe, Nutzung von Tools, Fehlerbehebung und Code-Modifikation über End-to-End-Workflows vergleichen kann.

DeepSeek V4 Pro erreicht Platz zwei in der neuesten Programmier-Bewertung

Der Benchmark soll reale Entwicklungsarbeit widerspiegeln, nicht kurze, isolierte Programmierprobleme. Laut den veröffentlichten Ergebnissen kann eine einzelne Aufgabe etwa 50 bis 110 Interaktionsrunden umfassen, und ein vollständiger Durchlauf einer Aufgabe kann etwa 30 bis 90 Minuten dauern.

In der aktuellen Rangliste behauptet Kimi K3 mit 60,61 Punkten den ersten Platz. DeepSeek-V4-Pro-0813 folgt mit 51,52 Punkten auf Platz zwei, vor GLM-5.2 mit 48,48 Punkten und der früheren Version DeepSeek-V4-Flash-0731 mit 46,46 Punkten.

Modell SuperCLUE-Terminal-Punktzahl Durchschnittliche Kosten pro Aufgabe (Bericht)
Kimi K3 (Maximum) 60,61 19,63 RMB
DeepSeek-V4-Pro-0813 (Maximum) 51,52 1,42 RMB
GLM-5.2 (Maximum) 48,48 23,30 RMB
DeepSeek-V4-Flash-0731 (Maximum) 46,46 0,64 RMB

Die obigen Daten stammen aus der SuperCLUE-Terminal-Benchmark-Umgebung und sollten als Benchmark-Ausführungskosten verstanden werden, nicht als feste Preisgestaltung des Modellanbieters pro Aufgabe.

DeepSeek hat separat bestätigt, dass das Produktions-API-Modell deepseek-v4-pro nun auf DeepSeek-V4-Pro-0813 verweist. Das Modell ist über die DeepSeek-Webanwendung, die mobile App und die API verfügbar.

Nur 1,42 RMB pro Aufgabe: Der herausragende Kostenvorteil

Der bemerkenswerteste Teil dieses Ergebnisses sind die gemeldeten Kosten von DeepSeek-V4-Pro-0813.

Im Benchmark betrugen die durchschnittlichen Kosten etwa 1,42 RMB pro Aufgabe, was im gleichen SuperCLUE-Vergleich etwa ein Vierzehntel von Kimi K3 (19,63 RMB) und etwa ein Sechzehntel von GLM-5.2 (23,30 RMB) beträgt.

Dieser Unterschied ist deshalb wichtig, weil die Punktedifferenzen zwischen leistungsstarken Programmiermodellen relativ gering sein können, während die Kosten für die Ausführung langlaufender Agentenaufgaben erheblich variieren können. Für kleine Unternehmen, unabhängige Entwickler und Teams, die Programmieragenten wiederholt ausführen müssen, können die Ausführungskosten ebenso wichtig sein wie die Headline-Punktzahl des Benchmarks.

Die Bewertung umfasst reale Entwicklungsszenarien, einschließlich Frontend-Seiten, 3D-Spielen und Modifikation von Engineering-Skripten. In den gemeldeten Tests konnte DeepSeek-V4-Pro-0813 Spiellogik mit Kollisionsbehandlung, Punktezählung und Endzuständen abschließen.

Gleichzeitig übertrafen die erzeugten Oberflächenstile und Interaktionsrückmeldungen grundlegende Vorlagen-Effekte.

Bei einigen kreativen Zeichenaufgaben treten weiterhin leichte strukturelle Probleme auf, aber die Gesamtqualität bleibt auf dem Niveau der Spitzengruppe.

Für kostenbewusste Entwicklungsteams schafft dieses Ergebnis eine klare Positionierung für DeepSeek-V4-Pro-0813: Nahe an der Leistung führender Programmieragenten, mit Benchmark-Ausführungskosten, die weit unter denen mehrerer höherpreisiger Wettbewerber liegen.

Häufig gestellte Fragen

Was ist DeepSeek-V4-Pro-0813?

DeepSeek-V4-Pro-0813 ist die aktuelle Produktionsversion hinter dem API-Modellnamen deepseek-v4-pro. DeepSeek hat am 13. August 2026 offiziell die GA-Version veröffentlicht, die die Agentenfähigkeiten erweitert und die Webanwendung, die mobile App und die API unterstützt.

Was ist SuperCLUE-Terminal?

SuperCLUE-Terminal ist ein Benchmark für Agenten-Terminal-Aufgaben, der sich auf chinesische Programmier- und Engineering-Workflows in realen Szenarien konzentriert. Er bewertet End-to-End-Leistung wie Anforderungsverständnis, Planung, Befehlsausführung, Dateimodifikation, Fehlerbehebung und finale Aufgabenerfüllung.

Warum verwendet der Benchmark Claude Code?

Der Benchmark nutzt ein universelles Agenten-Framework, damit die teilnehmenden Modelle in einer vergleichbareren Ausführungsumgebung getestet werden können. Claude Code bietet eine Terminal-Agenten-Umgebung für die Aufgabenausführung, während das zugrunde liegende Modell bei jeder Bewertung ausgetauscht wird.

Sind 1,42 RMB der offizielle Preis für eine einzelne Aufgabe von DeepSeek V4 Pro?

Nein. 1,42 RMB sind die beobachteten durchschnittlichen Kosten pro Aufgabe während dieses SuperCLUE-Terminal-Benchmark-Laufs, berechnet auf Basis des Token-Verbrauchs und der Preisgestaltungsmethode des Benchmarks. Die tatsächlichen API-Kosten hängen von Input-Tokens, Output-Tokens, Cache-Nutzung, Inferenzeinstellungen und der aktuellen Preisgestaltung des Anbieters ab.

Wie schneidet DeepSeek V4 Pro im Vergleich zu Kimi K3 in diesem Benchmark ab?

Kimi K3 erreicht mit 60,61 Punkten die höhere Punktzahl, während DeepSeek-V4-Pro-0813 auf 51,52 Punkte kommt. Allerdings meldet der Benchmark für Kimi K3 durchschnittliche Aufgabenkosten von 19,63 RMB, während DeepSeek-V4-Pro-0813 nur 1,42 RMB pro Aufgabe kostet, was DeepSeek in dieser spezifischen Bewertung einen erheblichen Kostenvorteil verschafft.

Unterstützt DeepSeek V4 Pro lange Kontexte und Agenten-Workflows?

Ja. Die offiziellen API-Dokumente von DeepSeek listen für DeepSeek V4 Pro eine Kontextlänge von 1 Million Tokens auf und unterstützen Tool-Calling, Responses API, eine Anthropic-kompatible API sowie verschiedene Inferenzstärke-Einstellungen. DeepSeek positioniert die GA-Version ausdrücklich als Upgrade für Agenten-Workloads.

Ist DeepSeek V4 Pro beim Programmieren durchgängig besser als GLM-5.2?

Nicht unbedingt. In diesen SuperCLUE-Terminal-Ergebnissen erreicht DeepSeek-V4-Pro-0813 51,52 Punkte gegenüber 48,48 Punkten von GLM-5.2, aber ein einzelner Benchmark kann nicht die Leistung für alle Programmier-Workloads bestimmen. Repository-Größe, Sprache, Tool-Umgebung, Langzeitkontext-Verhalten, Latenz und Kosten beeinflussen alle die Modellwahl.

Verwandte Tools

Die in diesem Artikel diskutierten Vergleichs-Benchmarks für die Programmierung von Agenten-Terminals.

  • Claude Code: Das agentische Codierungswerkzeug von Anthropic, das in den Benchmarks als allgemeines Ausführungs-Framework verwendet wird.
  • Kimi API: Die offizielle Entwicklerplattform von Moonshot AI für Kimi K3 und andere Kimi-Modelle.
  • Z.AI GLM-5.2: Offizieller Überblick über GLM-5.2, das in den Benchmarks ebenfalls hohe Punktzahlen erzielt.

Verwandte Links

Zusammenfassung

DeepSeek-V4-Pro-0813 erzielt im SuperCLUE-Terminal eine Punktzahl von 51,52 und belegt damit den zweiten Platz in diesem Benchmark, direkt hinter Kimi K3 und vor GLM-5.2 sowie DeepSeek-V4-Flash-0731.

Der Hauptvorteil liegt in den Kosten: Die von SuperCLUE berichteten Durchschnittskosten betragen etwa 1,42 RMB pro Aufgabe, deutlich niedriger als die für Kimi K3 und GLM-5.2 in derselben Bewertung festgehaltenen Kosten.

Dieses Ergebnis bedeutet nicht, dass DeepSeek V4 Pro allgemein das beste Codierungsmodell ist, aber es zeigt, dass das Modell bei länger andauernden, werkzeugintensiven Programmieraufgaben eine gute Balance zwischen agentischer Codierungsleistung und Ausführungskosten bietet.

Für Teams, die sowohl auf die Fähigkeiten von Coding-Agenten als auch auf Betriebskosten achten, ist DeepSeek-V4-Pro-0813 eine der wettbewerbsfähigsten Optionen in diesem SuperCLUE-Terminal-Vergleich.

DeepSeek V4 Pro在SuperCLUE终端编程基准测试中排名第二,成本仅为Kimi K3的一小部分