DeepSeek V4 Flash 0731: Das \$0,07-Spieldemo, API-Preise, Architektur und Coding-Benchmarks

DeepSeek V4 Flash 0731 hat eine ungewöhnliche Mischung aus Reaktionen hervorgerufen. Entwickler sind von seinen Coding-Agent-Ergebnissen beeindruckt. Infrastruktur-Teams interessieren sich für seine 1-Million-zu

发布于 2026年8月6日generalGEO 评分: 03 次阅读
Dieses Bild ist das Titelbild des Leitfadens zu DeepSeek V4 Flash 0731. Es hat einen dunklen, technologischen Stil mit schwarzem Hintergrund und leuchtenden blauen Elementen in verschiedenen Schattierungen. Der Haupttext auf dem Cover lautet „DeepSeek V4 Flash 0731 Guide“. Darunter sind die Kerninhalte als Preisgestaltung, Benchmarks, API und lokale Bereitstellung angegeben. Am unteren Rand befinden sich vier technologisch wirkende Symbole, die die entsprechenden Themen repräsentieren: ein Dollar-Statistikdiagramm für die Preisgestaltung, eine Leistungslinienkurve für Benchmarks, ein Code-Interface-Symbol für die API sowie ein Serversymbol mit Chip-Motiv für die lokale Bereitstellung. Im Hintergrund ist außerdem das leicht unscharfe DeepSeek-Markenzeichen zu sehen, passend zum zentralen Thema des Artikels über DeepSeek V4 Flash 0731.

DeepSeek V4 Flash 0731: Wie ein neu nachtrainiertes Modell einen globalen Preiskrieg auslöste

Einleitung

DeepSeek V4 Flash 0731 hat eine ungewöhnliche Kombination von Reaktionen hervorgerufen.

Entwickler sind von seinen Coding-Agent-Ergebnissen beeindruckt.

Infrastrukturteams interessieren sich für den 1-Millionen-Token-Kontext und die geringe Anzahl aktiver Parameter.

KI-Plattformen bieten kostenlose Nutzung und aggressive Rabatte an.

Und soziale Medien füllen sich mit Screenshots von Prototypen, deren gemeldete Inferenzkosten in Cent statt in Dollar gemessen werden.

Die am häufigsten geteilten Beispiele im Quellartikel waren:

  • Ein kleines 3D-Weltraum-Shooter-Prototyp, Berichten zufolge für etwa 0,07 RMB generiert.
  • Ein Counter-Strike-ähnlicher Prototyp, Berichten zufolge für etwa 0,50 RMB erstellt.
  • Ein persönliches Nutzungs-Dashboard mit 87 Millionen Tokens für 31,57 RMB.
  • OpenCode meldet 8 Billionen DeepSeek-Flash-Tokens am 1. August.
  • Cline erhöht sein kostenloses Kontingent, nachdem festgestellt wurde, dass das Modell günstiger zu subventionieren ist als erwartet.
  • Nous Portal gewährt vorübergehend 90 % Rabatt auf V4 Flash 0731.

Diese Beispiele fangen die Begeisterung ein, können aber auch mehrere unterschiedliche Dinge vermischen:

  1. Den offiziellen API-Preis von DeepSeek.
  2. Cache-Treffer- und Cache-Fehl-Preise.
  3. Kostenlosen oder subventionierten Drittanbieter-Zugang.
  4. Die Anzahl der Tool-Aufrufe, die ein Agent ausführt.
  5. Die Menge an Ausgabe und verstecktem Reasoning, die generiert wird.
  6. Die Kosten des Modells allein gegenüber den Kosten des vollständigen Produkts.

Das Modell ist wirklich günstig.

Das bedeutet nicht, dass jede Anwendung sieben Cent kosten wird.

Die nützliche Frage ist nicht, ob ein viraler Demo-Versuch exakt reproduzierbar ist. Es geht darum, wie DeepSeek einen so großen Fähigkeitssprung erreicht hat, ohne die Basisarchitektur zu ändern – und was die neue Kostenstruktur für Entwickler bedeutet.

Der globale Rabattzyklus

Der offizielle API-Preis war bereits niedrig, bevor Drittanbieter-Aktionen angewendet wurden.

DeepSeek listet derzeit die folgenden Preise pro Million Tokens:

Nutzungstyp DeepSeek-V4-Flash-Preis
Eingabe, Cache-Treffer 0,0028 $
Eingabe, Cache-Fehl 0,14 $
Ausgabe 0,28 $

Die API unterstützt:

  • Ein Kontextfenster von 1 Million Tokens.
  • Bis zu 384.000 Ausgabe-Tokens.
  • Denk- und Nicht-Denk-Modi.
  • Drei Reasoning-Aufwandstufen im 0731-Modellblatt: low, high und max.
  • Tool-Aufrufe.
  • JSON-Ausgabe.
  • Chat-Präfix-Vervollständigung in der Beta-Phase.
  • FIM-Vervollständigung im Nicht-Denk-Modus.
  • OpenAI-kompatible Chat-Completions.
  • Die Responses-API.
  • Eine Anthropic-kompatible Schnittstelle.
  • Ein veröffentlichtes Parallelitätslimit von 2.500 pro Konto für V4 Flash.

Diese offiziellen Preise sind die Basislinie.

Plattformen können dann wählen:

  • Den Preis durchzureichen.
  • Einen Aufschlag zu erheben.
  • Die Nutzung zu subventionieren.
  • Ein begrenztes kostenloses Modell anzubieten.
  • Das Modell in ein Abonnement zu bündeln.
  • Aktionsguthaben anzuwenden.
  • Datenverkehr über einen anderen Inferenzanbieter zu leiten.

Aus diesem Grund zahlt ein Entwickler möglicherweise den Listenpreis von DeepSeek, während ein anderer für einen begrenzten Zeitraum nichts zahlt.

OpenCode meldet acht Billionen Tokens an einem Tag

OpenCode gab öffentlich bekannt, dass DeepSeek Flash am 1. August 8 Billionen Tokens über seine Plattform verarbeitet hat.

Der Beitrag schlüsselt die Zahl wie folgt auf:

5 T Tokens kostenlose Nutzung
+
3 T Tokens über OpenCode Go

图片为OpenCode于8月3日发布的推文,内容为“DeepSeek Flash在8月1日处理了8万亿个token,其中5万亿为免费使用,3万亿在OpenCode Go上使用”。该推文与文档中OpenCode公开称DeepSeek Flash在8月1日处理8万亿token的内容相关,是对该数据的官方说明,还进一步拆解了免费和付费使用情况,为上下文对DeepSeek Flash处理token量的讨论提供了数据支持。

Die aktuelle Zen-Dokumentation von OpenCode listet eine DeepSeek V4 Flash Free-Option auf, die für einen begrenzten Zeitraum verfügbar ist.

Dies ist eine wichtige Unterscheidung.

Die Zahl von acht Billionen Tokens bezieht sich auf den Datenverkehr über OpenCode, nicht auf die direkte Nutzung, die DeepSeek auf allen Plattformen meldet.

Es ist dennoch ein starkes Signal dafür, dass kostengünstige Modelle eine enorme Nachfrage erzeugen können, wenn sie in einen beliebten Coding-Agent-Workflow integriert werden.

Nous Portal senkt den Preis vorübergehend um 90 %

Nous Research kündigte eine siebentägige Aktion an, bei der DeepSeek V4 Flash 0731 über Nous Portal in Zusammenarbeit mit Novita Labs mit 90 % Rabatt angeboten wird.

图片为Nous Research发布的推文,内容是关于DeepSeek V4 Flash 0731的促销信息。推文称在Nous Portal的促销期间,该模型可享受90%的折扣,与Novita Labs合作,适用于接下来7天。在折扣价格下,其在可比任务上超过1000倍于Fable 5,同时在Terminal-Bench 2.1上仍胜出。推文底部有Jovita和Nous Research的标志,还附有一段时长13秒的视频。该图片与上下文紧密相关,直观呈现了文中提到的DeepSeek V4 Flash 0731的促销内容。

Der Werbebeitrag verglich die rabattierten Kosten mit Claude Fable 5 und behauptete einen mehr als 1.000-fachen Preisunterschied bei vergleichbaren Aufgaben.

Dieser Vergleich hängt von mehreren Faktoren ab:

  • Welcher Anbieterpreis verwendet wird.
  • Ob Eingabe oder Ausgabe dominiert.
  • Ob Caching verfügbar ist.
  • Welche Reasoning-Einstellung gewählt wird.
  • Wie viele Tokens jedes Modell benötigt, um die Aufgabe abzuschließen.
  • Welcher Benchmark oder Workflow als „vergleichbar“ definiert wird.

Ein Preis-pro-Token-Vergleich ist nützlich, aber die aussagekräftigere Kennzahl ist:

Gesamtkosten pro akzeptierter Aufgabe

Ein Modell, das weniger teure Tokens verwendet, kann günstiger sein als ein billiges Modell, das wiederholt neu versucht.

Umgekehrt kann der Kostenvorteil enorm werden, wenn ein günstiges Modell auch leistungsfähig genug ist, die Aufgabe schnell abzuschließen.

Cline verdreifacht sein kostenloses Kontingent

Cline kündigte zunächst eine kostenlose Nutzung von V4 Flash 0731 über seinen Coding-Agent an.

Ein späterer öffentlicher Beitrag erklärte, das kostenlose Kontingent sei verdreifacht worden, da die Wirtschaftlichkeit nachhaltig erscheine.

这张截图是社交平台上的两条关联推文,内容围绕Cline为DeepSeek V4-Flash提供免费额度的相关说明。上方推文发布22小时,提到Cline已将deepseek v4-flash的免费额度扩至原来的3倍,且该服务具备可持续的运营经济性;下方推文发布于8月1日,说明该平台正在将DeepSeek V4-Flash 0731模型整合到服务中,还提供了安装使用该模型的三步操作指引,同时展示了该模型的在线对话试用界面与相关使用数据。

Clines aktueller Modellkatalog und die ClinePass-Materialien enthalten DeepSeek V4 Flash als schnelle, kostengünstige Option für fokussierte Codierungsaufgaben.

Kostenlose Kontingente und Modellverfügbarkeit können sich ändern, daher sollten Nutzer die Live-Anbieterseite prüfen, anstatt sich auf einen alten Screenshot zu verlassen.

Die breitere Lektion ist dauerhafter.

Wenn Inferenz billig genug wird, kann eine Agentenplattform kostenlosen Zugang als Kundengewinnung nutzen, ohne die Kosten absorbieren zu müssen.

die gleichen Kosten, die es mit einem Premium-Frontier-Modell hätte.

Community-Kostenscreenshots brauchen Kontext

Der Quellartikel enthält ein Dashboard mit:

  • 31,57 RMB Ausgaben.
  • 2.282 API-Anfragen.
  • 87.027.995 Tokens.

Das Bild zeigt die Ausgaben, API-Anfragen und Tokendaten von Claude Code. Die Ausgaben betragen ¥31,57 CNY, die API-Anfragen 2.282 und die Tokens 87.027.995. Die untere Grafik zeigt die täglichen Ausgaben vom 6. Juli bis 4. August, mit einem deutlichen Spitzenwert am 28. Juli. Das Bild bezieht sich auf den Abschnitt „Community Cost Screenshots Need Context“ im Dokument und dient zur Veranschaulichung der Größenordnung, die Entwickler unter günstigen Nutzungsmustern sehen könnten, reicht jedoch nicht aus, um die Rechnung präzise zu rekonstruieren, da viele Variablen fehlen.

Der Screenshot ist nützlich, weil er die Größenordnung veranschaulicht, die Entwickler unter günstigen Nutzungsmustern sehen könnten.

Er enthält jedoch nicht genügend Informationen, um die Rechnung exakt zu rekonstruieren.

Zu den fehlenden Variablen gehören:

  • Das Verhältnis von Eingabe- zu Ausgabetokens.
  • Der Cache-Treffer-Prozentsatz.
  • Die Modellversion, die an jedem Datum verwendet wurde.
  • Der Reasoning-Aufwand.
  • Die Anzahl der Tool-Aufrufe.
  • Fehlgeschlagene Anfragen.
  • Aktionsguthaben (Promotional Credits).
  • Anbieterrabatte.
  • Ob alle Tokens zum gleichen Satz abgerechnet wurden.

Ein langes, wiederholtes Systemprompt kann extrem günstig sein, wenn es den Cache trifft.

Ein langes, einzigartiges Prompt, das einmal gesendet wird, wird zum Cache-Miss-Eingabepreis abgerechnet.

Die Ausgabe ist außerdem viel teurer als der Cache-Eingang.

Bei Agentensystemen dominieren diese Unterschiede die endgültige Rechnung.

Flash Blitz: Was sich am 31. Juli änderte

DeepSeek V4 Preview wurde am 24. April 2026 veröffentlicht.

Die Familie umfasste:

  • DeepSeek V4 Pro.
  • DeepSeek V4 Flash.

Die Preview-Veröffentlichung etablierte die Hauptarchitektur:

  • Sparses Mixture-of-Experts.
  • 1-Million-Token-Kontext.
  • Effiziente Long-Context-Aufmerksamkeit.
  • Geringe aktive Parameteranzahl im Verhältnis zur Gesamtkapazität.
  • Denk- und Nicht-Denk-Modi.
  • Offene Gewichte unter der MIT-Lizenz.

V4 Flash Preview wurde als die kleinere, schnellere und günstigere Alternative zu V4 Pro positioniert.

Das Update vom 31. Juli veränderte seine Wettbewerbsposition.

DeepSeek gibt an, dass V4 Flash 0731 dieselbe Modellarchitektur und -größe wie V4 Flash Preview verwendet.

Das Update entstand durch die Durchführung eines neuen Post-Training-Prozesses.

In vereinfachter Form:

Gleiche vortrainierte Basisarchitektur
+
neues Post-Training und Agentenoptimierung
=
wesentlich stärkeres Coding-Agent-Verhalten

Das ist wichtig, weil es zeigt, wie viel Leistungsfähigkeit in einem vortrainierten Modell latent vorhanden sein kann.

Architektur und Parameteranzahl sind nicht das gesamte Produkt.

Das Post-Training bestimmt, wie effektiv das Modell:

  • Tools verwendet.
  • Mehrstufige Arbeit plant.
  • Terminal-Feedback verarbeitet.
  • Sich von Fehlern erholt.
  • Dateien schreibt und bearbeitet.
  • Ein Agentenprotokoll befolgt.
  • Reasoning-Aufwand zuteilt.
  • Innerhalb einer Umgebung (Harness) arbeitet.

Basisarchitektur und Checkpoint-Details

Die ursprüngliche V4-Flash-Modellkarte beschreibt das Basismodell wie folgt:

Spezifikation DeepSeek V4 Flash
Gesamte Basis-MoE-Parameter 284B
Aktivierte Parameter 13B
Kontextlänge 1M
Lizenz MIT
Hauptmodalität Text
Basispräzision FP8 / gemischte Niedrigpräzision je nach Checkpoint

Die Modellkarte von 0731 besagt, dass die neue Version dieselbe Struktur wie die DSpark-Variante hat und ein angehängtes Modul für spekulative Dekodierung enthält.

Das erklärt, warum einige Metadaten von Modelldateien möglicherweise Folgendes zeigen

eine größere Gesamtzahl an Checkpoints als die 284B-Basis-MoE-Zahl.

Die klarste Beschreibung ist:

Das zugrunde liegende MoE-Modell von V4 Flash bleibt bei insgesamt etwa 284B mit 13B aktiven Parametern, während das 0731-Release zusätzlich die DSpark-Spekulationsdekodierungskomponente im veröffentlichten Checkpoint enthält.

DSpark-Spekulationsdekodierung

Die Spekulationsdekodierung verwendet einen schnellen Entwurfsprozess, um mehrere zukünftige Tokens vorzuschlagen.

Das Hauptmodell überprüft dann diese Vorschläge.

Wenn Vorhersagen akzeptiert werden, kann das System mehrere Tokens mit weniger sequenzieller Arbeit erzeugen.

DeepSeeks 0731-Modellkarte bietet expliziten DSpark-Support für vLLM und SGLang.

Für vLLM lautet die relevante Konfiguration:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Für SGLang verwendet die Modellkarte:

--speculative-algorithm DSPARK

DSpark verbessert nicht selbst die Denkfähigkeit des Modells.

Es ist eine Inferenzoptimierung, die darauf abzielt, die Dekodierungslatenz zu reduzieren oder den Durchsatz zu erhöhen, während die Ausgabeverteilung des Zielmodells unter der unterstützten Konfiguration erhalten bleibt.

Der Benchmark-Sprung

DeepSeek veröffentlicht den folgenden Vergleich für V4 Flash 0731:

Benchmark V4 Flash 0731 V4 Flash Preview V4 Pro Preview
Terminal Bench 2.1 82,7 61,8 72,1
NL2Repo 54,2 39,4 38,5
CyberGym 76,7 38,7 52,7
DeepSWE 54,4 7,3 12,8
Toolathlon-Verified 70,3 49,7 55,9
Agents' Last Exam 25,2 15,8 16,5
AutomationBench Public 25,1 10,8 12,8
DSBench-FullStack 68,7 37,0 41,8
DSBench-Hard 59,6 25,8 31,1

Der dramatischste Anstieg ist bei DeepSWE:

7,3 → 54,4

CyberGym verdoppelt sich fast:

38,7 → 76,7

Terminal Bench 2.1 steigt um mehr als zwanzig Punkte:

61,8 → 82,7

Das neue Flash-Modell übertrifft V4 Pro Preview auch bei jedem Benchmark in DeepSeeks veröffentlichter Tabelle.

Das ist eine bedeutende Veränderung für ein Modell, das ursprünglich vor allem als günstigere und schnellere Option positioniert war.

Die Benchmark-Methodik ist entscheidend

Die Tabelle sollte nicht als reiner Vergleich roher Checkpoints gelesen werden.

DeepSeeks Modellkarte enthält mehrere wichtige Hinweise.

Für öffentliche Code-Agent-Aufgaben verwendete das Unternehmen:

DeepSeek Harness Minimalmodus
Reasoning-Effort: max
Temperatur: 1,0
Top-p: 0,95

DeepSeek Harness war zum Zeitpunkt der Verifizierung nicht öffentlich veröffentlicht worden.

Das bedeutet, dass externe Forscher die exakte Softwareumgebung, die für die veröffentlichten Code-Agent-Ergebnisse verwendet wurde, möglicherweise noch nicht reproduzieren können.

Zwei Tests sind ebenfalls intern:

  • DSBench-FullStack.
  • DSBench-Hard.

Interne Benchmarks können für die Produktentwicklung nützlich sein, aber unabhängige Teams können ihre versteckten Aufgaben oder Kontaminationskontrollen nicht einsehen.

Die korrekte Interpretation ist:

DeepSeek berichtet eine große Verbesserung unter seinem gewählten Agenten-Stack und Evaluierungs-Setup. Die öffentliche Reproduzierbarkeit wird sich verbessern, wenn der Harness, Prompts, Logs und die vollständige Evaluierungskonfiguration verfügbar werden.

Die Qualität des Harness kann die Punktzahl verändern

Ein Coding-Benchmark misst oft ein vollständiges System:

Modell
+
Systemprompt
+
Repository-Tools
+
Terminal

Ausführung
+
Kontextverwaltung
+
Wiederholungsrichtlinie
+
Test-Feedback
+
Patch-Übermittlungslogik

Dasselbe Modell kann unterschiedlich abschneiden, wenn sich eine Komponente ändert.

Ein besseres Testsystem könnte:

- Relevantere Dateien auswählen.
- Nützliche Terminalausgaben erhalten.
- Kontextüberlauf verhindern.
- Fehlgeschlagene Befehle intelligent wiederholen.
- Unproduktive Schleifen stoppen.
- Patches zuverlässiger anwenden.
- Dem Modell klarere Testergebnisse liefern.

Das macht das Modell nicht irrelevant.

Es bedeutet, dass das Benchmark-Ergebnis zur Kombination aus Modell und Testsystem gehört.

Die starken 0731-Zahlen deuten darauf hin, dass DeepSeek sowohl das Agentenverhalten des Modells als auch den umgebenden Bewertungsprozess verbessert hat.

## Artificial Analysis bewertet es mit 50

Artificial Analysis berichtet einen Intelligence-Index-Score von etwa **50** für DeepSeek V4 Flash 0731, etwa zehn Punkte über der vorherigen Flash-Version.

Das unabhängige Modellanalyse-Unternehmen beschreibt V4 Flash außerdem als außergewöhnlich günstig im Vergleich zu anderen bekannten Spitzensystemen.

Reuters fasste die Ergebnisse von Artificial Analysis zusammen und berichtete über durchschnittliche Benchmark-Testkosten von etwa drei US-Cent gemäß deren Methodik.

Dieser Vergleich unterstützt das Wertargument.

Es bedeutet nicht, dass jede Produktionsaufgabe drei Cent kostet.

Artificial Analysis berichtet außerdem schwächere Ergebnisse bei einigen Wissenszuverlässigkeitsmaßen.

Der Artikel zu V4 Flash 0731 merkt an:

- Die Allwissenheitsgenauigkeit blieb bei etwa 37 %.
- Die Halluzinationsrate sank, blieb aber mit etwa 84 % unter dieser Bewertung weiterhin hoch.

Diese Zahlen sind eine nützliche Erinnerung.

Ein Modell kann:

- Bei Coding-Agenten sehr stark sein.
- Extrem günstig sein.
- Bei einem zusammengesetzten Index wettbewerbsfähig sein.
- Bei einigen offenen Faktenfragen dennoch unzuverlässig sein.

„Bester Wert“ ist nicht dasselbe wie „am besten für jede Aufgabe“.

## Offizielle API-Preise

Der direkte DeepSeek-API-Preis ist:

| Abrechnungskategorie | Preis pro 1 Mio. Tokens |
|-|-|
| Cache-Treffer-Eingabe | \$0,0028 |
| Cache-Fehlschlag-Eingabe | \$0,14 |
| Ausgabe | \$0,28 |

Die Preislücke zwischen Cache-Treffer und Cache-Fehlschlag ist enorm:

```Plaintext
\$0,14 ÷ \$0,0028 = 50

Zwischengespeicherte Eingabe ist fünfzigmal günstiger als nicht zwischengespeicherte Eingabe.

Bei langlebigen Agenten wird die Prompt-Struktur zur Kostenarchitektur.

Beispiel für eine Kostenberechnung

Angenommen, eine Anfrage verwendet:

100.000 nicht zwischengespeicherte Eingabe-Tokens
20.000 Ausgabe-Tokens

Die direkten Modellkosten betragen:

Eingabe:
100.000 / 1.000.000 × \$0,14
= \$0,014

Ausgabe:
20.000 / 1.000.000 × \$0,28
= \$0,0056

Gesamt:
\$0,0196

Das ist weniger als zwei US-Cent.

Nehmen wir nun an, dass dasselbe 100.000-Token-Präfix zwischengespeichert ist:

Zwischengespeicherte Eingabe:
100.000 / 1.000.000 × \$0,0028
= \$0,00028

Ausgabe:
20.000 / 1.000.000 × \$0,28
= \$0,0056

Gesamt:
\$0,00588

Die Ausgabe dominiert nun die Rechnung.

Diese Beispiele erklären, warum kostengünstige Coding-Prototypen plausibel sind.

Sie enthalten nicht:

  • Anbieteraufschläge.
  • Tool-API-Gebühren.
  • Browser- oder Suchkosten.
  • Sandbox-Compute.
  • Speicher.
  • Wiederholte Fehlversuche.
  • Menschliche Entwicklungszeit.

Warum Agentenrechnungen dennoch wachsen können

Agentisches Coding ist selten eine einzelne Anfrage.

Ein typischer Arbeitsablauf kann Folgendes umfassen:

  1. Das Repository lesen.
  2. Nach relevantem Code suchen.
  3. Die Änderung planen.
  4. Mehrere Dateien bearbeiten.
  5. Tests ausführen.
  6. Das

Fehler.
7. Erneut bearbeiten.
8. Tests erneut ausführen.
9. Den Diff überprüfen.
10. Die endgültige Antwort erstellen.

Jeder Schritt kann einen weiteren Modellaufruf erzeugen.

Eine scheinbar kleine Aufgabe kann teuer werden, wenn:

  • Der Repository-Kontext wiederholt nicht gecacht wird.
  • Das Modell lange Denkprozesse erzeugt.
  • Tests viele Male fehlschlagen.
  • Der Agent große Dateien unnötig liest.
  • Mehrere parallele Agenten Arbeit duplizieren.
  • Die Kontextkomprimierung dazu führt, dass wichtige Informationen erneut gesendet werden.
  • Das Modell nicht stoppt, nachdem es eine gute Lösung erreicht hat.

V4 Flash reduziert die Kosten dieser Fehler.

Es beseitigt sie nicht.

Kontext-Caching ist der Hauptkostenhebel

DeepSeek verwendet plattenbasiertes Kontext-Caching.

Wenn dasselbe Präfix wiederverwendet wird, können die passenden Eingabe-Tokens den niedrigeren Cache-Trefferpreis erhalten.

Gute Kandidaten für ein stabiles Präfix sind:

  • Systemanweisungen.
  • Repository-Richtlinien.
  • Werkzeugdefinitionen.
  • Lange Referenzdokumente.
  • Ein unveränderter Projektschnappschuss.
  • Wiederholter Unternehmenskontext.

Ein vereinfachtes Prompt-Design ist:

Stabiles wiederverwendbares Präfix
+
neue Benutzeranfrage
+
letztes Werkzeugergebnis

Ein weniger cache-freundliches Design ist:

Neu angeordnete Anweisungen
+
umgeschriebene Repository-Zusammenfassung
+
sich ändernde Zeitstempel
+
zufällige Anfrage-Metadaten
+
neue Benutzeranfrage

Kleine Präfixänderungen können die Cache-Wiederverwendung reduzieren.

Entwickler sollten die Token-Nutzungsfelder prüfen, anstatt anzunehmen, dass ein langer Prompt gecacht wurde.

DeepSeek bietet auch user_id-Isolierung für Datenschutz und Planung. Cache-Wiederverwendung und Benutzerisolierung sollten zusammen entworfen werden, damit der Kontext eines Kunden nicht versehentlich mit dem eines anderen vermischt wird.

API-Schnellstart

Die offizielle Basis-URL bleibt:

https://api.deepseek.com

Die Modell-ID ist:

deepseek-v4-flash

DeepSeek sagt, dass die stabile API-ID automatisch die neueste offizielle Flash-Version bedient.

Das ist praktisch, aber Produktionsteams sollten den zurückgegebenen Modell-Fingerabdruck aufzeichnen und Änderungen testen, da das Verhalten hinter einer stabilen ID aktualisiert werden kann.

Python-Beispiel

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Review this function and propose a safe refactor.",
        }
    ],
)

print(response.choices[0].message.content)

cURL-Beispiel

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "user",
        "content": "Write a small Python CLI that validates JSON files."
      }
    ]
  }'

Entwickler sollten die Live-API-Referenz prüfen, um die genauen Reasoning-Effort- und Thinking-Mode-Felder zu erfahren, die von ihrem Endpunkt und der SDK-Version unterstützt werden.

Denkverlauf muss erhalten bleiben

Die Dokumentation zum Denkmodus von DeepSeek besagt, dass bei einer Runde mit Werkzeugaufrufen das reasoning_content aus der Assistenten-Nachricht in nachfolgenden Anfragen zurückgegeben werden muss.

Ein mehrrundiger Agent sollte Folgendes bewahren:

  • content

reasoning_content

  • tool_calls

Das Verwerfen des Reasoning-Zustands kann die Kontinuität verringern oder Probleme bei der Anfragevalidierung verursachen.

Dies ist besonders relevant bei der Integration über einen OpenAI-kompatiblen Client, der normalerweise anbieterspezifische Reasoning-Felder ignoriert.

OpenAI-, Anthropic- und Responses-Kompatibilität

DeepSeek bietet mehr als eine Schnittstelle an.

OpenAI Chat Completions

Verwenden Sie die standardmäßige DeepSeek-Basis-URL und die Modell-ID:

deepseek-v4-flash

Anthropic-kompatible API

DeepSeek dokumentiert auch eine Schnittstelle im Anthropic-Format.

Dies kann Software, die um Claude-artige Nachrichten herum aufgebaut ist, dabei helfen, sich mit weniger Anwendungsänderungen mit DeepSeek zu verbinden.

Kompatibilität garantiert kein identisches Verhalten.

Anbieterspezifische Felder, Reasoning-Verlauf, Tool-Schemas, Sicherheitsverhalten und Fehlerbehandlung müssen weiterhin getestet werden.

Responses API

DeepSeek gibt an, dass das 0731-Release das Responses-API-Format nativ unterstützt und für die Verwendung im Codex-Stil angepasst wurde.

Dies ist wichtig für Coding-Agent-Produkte, die zunehmend von zustandsbehafteten Response-Objekten, Tool-Aufrufen und strukturierten Agentenschleifen abhängen.

Offene Gewichte unter der MIT-Lizenz

DeepSeek hat die V4 Flash 0731-Gewichte auf Hugging Face unter der MIT-Lizenz veröffentlicht.

Dies ermöglicht Entwicklern, das Modell unter Beachtung der Lizenzbedingungen zu untersuchen, zu modifizieren, bereitzustellen und weiterzuverbreiten.

Die Veröffentlichung offener Gewichte bietet mehr Kontrolle als ein reines API-Modell.

Teams können:

  • Das Modell auf privater Infrastruktur ausführen.
  • Seine Architektur untersuchen.
  • Quantisierte Varianten erstellen.
  • Inferenz-Kernel anpassen.
  • Feinabstimmung vornehmen oder es spezialisieren.
  • Es in interne Systeme integrieren.
  • Vermeiden, sensible Code an eine Drittanbieter-API zu senden.

Die praktische Hürde ist die Hardware.

„Offene Gewichte“ bedeutet nicht „läuft auf einem normalen Laptop“.

vLLM-Bereitstellung

Die offizielle 0731-Modellkarte enthält ein vLLM-Beispiel für einen einzelnen 4×GB300-Knoten:

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --data-parallel-size 4 \
  --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Dieses Beispiel veranschaulicht die Infrastrukturklasse, die für vollwertiges Serving erwartet wird.

Es sollte nicht als die einzige unterstützte Konfiguration interpretiert werden.

Das vLLM-Rezept könnte im Laufe der Zeit Unterstützung für andere GPU-Topologien hinzufügen.

SGLang-Bereitstellung

Das offizielle SGLang-Beispiel lautet:

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

Die Ziel- und Entwurfsgewichte stammen aus demselben Checkpoint, daher besagt die Dokumentation, dass kein separater spekulativer Entwurfsmodell-Pfad festgelegt werden sollte.

Inferenz-Engines entwickeln sich schnell weiter.

Verwenden Sie die aktuelle Modellkarte und das Serving-Engine-Rezept, anstatt einen alten Startbefehl aus dem Preview-Release zu kopieren.

Lokale Bereitstellung ist weiterhin ein Infrastrukturprojekt

Auch wenn nur etwa

Für ein Token sind 13B Parameter aktiv, die vollständigen Modellgewichte müssen während des gesamten Serving-Betriebs verfügbar bleiben.

Die Bereitstellungsplanung muss Folgendes berücksichtigen:

  • Gesamtspeicherbedarf des Modells.
  • GPU-Speicher.
  • Expertenparallelität.
  • Interconnect-Bandbreite.
  • KV-Cache für lange Kontexte.
  • Unterstützung für Quantisierung.
  • DSpark-Kernel.
  • Batch-Größe.
  • Nebenläufigkeit.
  • Prefill-Latenz.
  • Decode-Durchsatz.

Kleinere Quantisierungen können Experimente auf unterschiedlicher Hardware ermöglichen, können jedoch Qualität, Geschwindigkeit oder unterstützte Kontextlänge verändern.

Für die meisten einzelnen Entwickler ist die direkte API oder ein gehosteter Anbieter einfacher und günstiger als das Selbst-Hosten.

Offizielle API versus Drittanbieter

Es gibt drei gängige Möglichkeiten, V4 Flash zu nutzen.

Weg Hauptvorteil Hauptnachteil
DeepSeek API Offizielle Preise und aktuelles offizielles Modell Daten verlassen Ihre Umgebung; stabile ID kann aktualisiert werden
Drittanbieter-Plattform Kostenlose Kontingente, integrierte Agenten, einfachere Abrechnung Aktionen und Routing können sich ändern
Selbst gehostete Gewichte Maximale Kontrolle und Datenschutz Erhebliche Hardware- und Engineering-Anforderungen

Der günstigste Weg hängt von der Arbeitslast ab.

Ein kostenloses Cline- oder OpenCode-Kontingent ist möglicherweise am besten für Experimente geeignet.

Die direkte API ist möglicherweise am besten für vorhersehbare Nutzung in kleinem Umfang geeignet.

Selbst-Hosten wird erst bei ausreichend hohem, kontinuierlichem Volumen oder wenn Datenschutzanforderungen dominieren, attraktiv.

Die beste Ära für Prototyping

Der Quellartikel vergleicht kostengünstige KI mit der Massenproduktion von Automobilen.

Die Analogie ist unvollkommen, aber nützlich.

Wenn eine Technologie dramatisch billiger wird, kauft der Markt nicht einfach dieselbe Menge zu einem niedrigeren Preis.

Neue Anwendungen werden möglich.

Kostengünstige Agentenmodelle können Experimente unterstützen, die zuvor vor dem Testen abgelehnt worden wären.

Beispiele hierfür sind:

  • Ein Student, der einen ersten Software-Prototyp entwickelt.
  • Ein Solo-Gründer, der mehrere Landing-Page-Ideen generiert und testet.
  • Ein kleines Team, das bei jedem Pull-Request eine Code-Review durchführt.
  • Ein Open-Source-Projekt, das kostenloses Issue-Triage anbietet.
  • Ein Forscher, der eine große Code- oder Dokumentsammlung verarbeitet.
  • Ein Unternehmen, das interne Agenten für repetitive Arbeiten erstellt.
  • Ein Spieleentwickler, der generierte Mechaniken und Level testet.

Der Wert liegt nicht darin, dass das Modell die gesamte Softwareentwicklung ersetzt.

Es senkt die Kosten der Frage:

Lohnt es sich, diese Idee weiterzuverfolgen?

Ein Prototyp ist kein Produkt

Kostengünstige Generierung kann eine überzeugende erste Demo erzeugen.

Ein Produktionsprodukt benötigt weiterhin:

  • Produktdesign.
  • Sicherheit.
  • Tests.
  • Barrierefreiheit.
  • Leistung.
  • Überwachung.
  • Bereitstellung.
  • Datenschutz.
  • Rechtliche Prüfung.
  • Wartung.
  • Kundensupport.

Eine Modellrechnung von sieben Cent bedeutet kein Geschäft für sieben Cent.

Es bedeutet, dass das erste rechenintensive Experiment möglicherweise günstig genug ist, um es zu versuchen.

Das verändert, wer teilnehmen kann und wie viele Ideen getestet werden können.

Ein Beispiel für einen gemeinschaftlich erstellten Arbeitsbereich

Der Quellartikel enthält einen leichtgewichtigen Dokument-Arbeitsbereich als eines der Beispiele dafür, was Entwickler mit kostengünstigen Codierungsagenten bauten.

![Das Bild zeigt eine Dokumenten-Arbeitsplatzoberfläche. Links befindet sich eine Navigationsleiste mit Optionen wie „Alle Dokumente“, „Dateien“, „Aufgabenzentrum“ usw. Oben rechts wird „Kontext-Arbeitsplatz“ angezeigt, darunter befinden sich Abschnitte wie „Aufgabenzentrum“, „Aufgabenliste“, „Aufgabendetails“. In der Mitte ist „Silicon Valley 101 - GPU“, „RonnieChatterji - AI-Agentisierung“, „RadiArk -

„Optimierung der GPU-Auslastung“ und weitere Dokumenttitel sowie Teile des Inhalts. Unten befindet sich die Option „Lokales Dateikonto“. Dieses Bild steht im Zusammenhang mit dem Inhalt im Dokument, der den Dokumentarbeitsplatz vorstellt, und veranschaulicht direkt die Oberflächengestaltung des Arbeitsplatzes sowie einige Dokumentinformationen.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/ea723a10-dc29-41c2-9668-b104bd715b44-5355bdda-f7e2-4763-919d-43a90bf112fd.png)

Ein Screenshot kann nicht belegen, wie viel von der Anwendung durch das Modell erzeugt wurde, wie viel manuelle Bearbeitung erforderlich war oder ob das Produkt sicher und wartbar ist.

Er zeigt jedoch die Art von Projekt, deren Prototyping durch kostengünstige Codierungsmodelle erleichtert wird.

Wo V4 Flash am besten geeignet ist

V4 Flash 0731 ist besonders attraktiv, wenn:

  • Die Aufgabe stark code- oder toolorientiert ist.
  • Die Kosten eine große Rolle spielen.
  • Ein großer Kontext nützlich ist.
  • Ein hohes Anfragevolumen erwartet wird.
  • Der Arbeitsablauf Ausgaben validieren kann.
  • Gelegentliche Wiederholungen akzeptabel sind.
  • Ein größeres Fallback-Modell für schwierige Fälle verfügbar ist.

Es kann weniger geeignet sein, wenn:

  • Weltweite faktische Genauigkeit entscheidend ist.
  • Eine ausgefeilte erste Antwort wichtiger ist als die Kosten.
  • Die Aufgabe Bildverständnis erfordert.
  • Die Organisation generierten Code nicht validieren kann.
  • Eine verwaltete Compliance-Garantie erforderlich ist.
  • Der Arbeitsablauf von stabilen, versionierten API-Verhalten abhängt.

Ein Modell-Router kann Flash mit einem stärkeren oder spezialisierteren System kombinieren.

Zum Beispiel:

Routinemäßige Repository-Änderungen
→ V4 Flash

Hochriskante Architektur- oder Sicherheitsentscheidungen
→ stärkeres Modell + menschliche Überprüfung

Günstige Modelle verändern die Agentenarchitektur

Wenn Modellaufrufe teuer sind, versuchen Entwickler, jede Anfrage zu minimieren.

Wenn Aufrufe günstig werden, kann sich ein Agent leisten:

  • Ein anderes Modell bitten, den Patch zu überprüfen.
  • Einen separaten Testanalyse-Durchlauf durchführen.
  • Mehrere Kandidatenlösungen generieren.
  • Alternative Implementierungen vergleichen.
  • Ein Modell für die Planung und ein anderes für die Ausführung verwenden.
  • Seine Arbeit vor der Einreichung erneut prüfen.

Dies kann die Zuverlässigkeit erhöhen.

Es kann auch Token verschwenden.

Das richtige Ziel ist nicht der minimale Token-Verbrauch.

Es ist:

Niedrigste Gesamtkosten, die die erforderliche Qualität erreichen

Die Hauptrisiken hinter der Preisgeschichte

1. Öffentliche Beta kann sich ändern

DeepSeek beschreibt die offizielle Flash-API als öffentliche Beta.

Preisgestaltung, Verhalten, Limits und Modellversionen können sich ändern.

Produktionsteams sollten Regressionstests aufrechterhalten.

2. Benchmark-Ergebnisse hängen vom DeepSeek-Harness ab

Die stärksten Code-Agent-Ergebnisse verwenden eine nicht veröffentlichte Harness-Konfiguration.

Eine exakte unabhängige Reproduktion ist derzeit nicht ohne Weiteres möglich.

3. Günstige Eingabe garantiert keinen günstigen Agenten

Ausgabe, Wiederholungen, Tools und nicht zwischengespeicherter Kontext können die endgültigen Kosten dominieren.

4. Langer Kontext ist nicht kostenlos

Ein Fenster mit 1 Million Token ist eine Kapazitätsgrenze, keine Empfehlung, bei jeder Anfrage eine Million Token zu senden.

Große Prefill-Workloads erhöhen Latenz und Kosten.

5. Offene Zuverlässigkeit muss noch verbessert werden

Unabhängige Bewertungen zeigen, dass Wert- und Codierungsstärke mit einer hohen Halluzinationsrate bei faktischen Tests koexistieren können.

Kritische Fakten sollten gegen Quellen geprüft werden.

6. Generierter Code erfordert Überprüfung

Kostengünstige Modelle können mehr Code generieren, als ein Team sicher prüfen kann.

Automatisierte Tests, statische Analyse, Abhängigkeitsscans und menschliche Überprüfung bleiben notwendig.

7. Werbeaktioneller Zugang ist vorübergehend

Drittanbieter-kostenlose Modelle und Rabatte können verschwinden.

Baue kein dauerhaftes Geschäftsmodell auf einer siebentägigen oder zeitlich begrenzten Subvention auf.

8. Stabile API-IDs können Upgrades verbergen

Die Modell-ID deepseek-v4-flash verweist auf die aktuelle Version.

Ein Upgrade hinter dieser ID kann Ausgaben verändern, ohne dass sich Code in deiner Anwendung ändert.

Praktische Checkliste zur Kostenkontrolle

1. Wiederverwendbare Präfixe stabilisieren

Halte Systemanweisungen und Tool-Definitionen konsistent, um die Cache-Wiederverwendung zu verbessern.

2. Cache-Treffer-Tokens separat verfolgen

Verlasse dich nicht nur auf die gesamten Eingabetokens.

3. Unnötige Ausgaben begrenzen

Setze ein realistisches Ausgabebudget für die Aufgabe.

4. Geringere Denkanstrengung für Routineaufgaben

Reserviere max für Aufgaben, die von längerer Überlegung profitieren.

5. Agent-Schritte begrenzen

Stoppe Schleifen, die keine Fortschritte machen.

6. Kostengünstige Validierung vor einem weiteren Modellaufruf durchführen

Nutze Linter, Tests, Schema-Validatoren und deterministische Prüfungen.

7. Schwierige Fälle weiterleiten

Eskaliere nur, wenn die Aufgabe einen Test nicht besteht oder eine Risikoschwelle überschreitet.

8. Kosten pro akzeptiertem Ergebnis messen

Berücksichtige fehlgeschlagene Versuche und menschliche Überprüfung.

Noch etwas: DeepSeek Harness

Der Quellartikel endet mit einem möglichen nächsten Schritt im DeepSeek-Entwicklerökosystem.

Tianyi Cui, in der Quelle als Verantwortlicher für DeepSeek Harness identifiziert, veröffentlichte eine Rekrutierungsmeldung für Entwickler von Open-Source-Agent-Harness-Projekten.

Die Meldung lud interessierte Entwickler ein, ein GitHub-Konto und repräsentative Open-Source-Arbeiten zu teilen, um an internen Tests teilzunehmen.

Bild ist ein Twitter-Post, veröffentlicht von Tianyi Cui, Inhalt ist die Einladung an Entwickler, die an Agent-Harness-bezogenen Open-Source-Projekten interessiert sind, an den internen Tests von DeepSeek Harness teilzunehmen, per Antwort oder Direktnachricht Kontakt aufzunehmen, mit GitHub-ID und repräsentativem Open-Source-Werk. Der Tweet wurde zuletzt am 1. August 2026 um 19:46 Uhr bearbeitet, hat 1K Kommentare, 496 Retweets, 2,9K Likes, 1,8K Lesezeichen und 879,7K Aufrufe. Dieser Tweet steht im Zusammenhang mit den Informationen zu DeepSeek Harness-Entwickler-Internaltests im Dokument und ist die von Tianyi Cui in dem Dokument erwähnte Rekrutierungsmeldung zur Einladung von Entwicklern zur Teilnahme an internen Tests.

DeepSeeks eigenes Änderungsprotokoll vom 31. Juli sagt ebenfalls, dass der minimale Modus von DeepSeek Harness für die Benchmark-Auswertung „bald veröffentlicht“ werde.

Zum Zeitpunkt der Überprüfung konnte ich Folgendes nicht finden:

  • Ein öffentliches offizielles DeepSeek-Harness-Repository.
  • Eine stabile Produktseite für „DeepSeek Code“.
  • Öffentliche Installationsanweisungen.
  • Preise.
  • Ein Veröffentlichungsdatum.
  • Eine vollständige Funktionsspezifikation.

Die Belege stützen diese engere Schlussfolgerung:

DeepSeek testet einen Agent-Harness und beabsichtigt, zumindest Teile des Frameworks zu veröffentlichen, aber der endgültige Produktname, der öffentliche Umfang und der Startzeitpunkt bleiben unbestätigt.

Das Modell, die API und die offenen Gewichte sind jetzt verfügbar.

Der Harness ist noch ein zukünftiges Ökosystem-Komponente.

Warum ein DeepSeek Harness wichtig sein könnte

Ein First-Party-Harness könnte DeepSeek helfen, den vollständigen Coding-Agent-Stack zu kontrollieren.

Er könnte Folgendes bieten:

  • Native Verarbeitung des Reasoning-Verlaufs.
  • Modellspezifische Eingabeformate.
  • Tool-Call-Parsing.
  • Kontextverwaltung.
  • Repository-Suche.
  • Terminal-Ausführung.
  • Benchmark-Reproduzierbarkeit.
  • Responses-API-Integration.
  • Codex-kompatible Workflows.
  • Kostenkontrollen.
  • Automatisches Routing zwischen Flash und Pro.

DeepSeek dokumentiert bereits Integrationen mit externen Harnesses und Coding-Agenten.

Ein First-Party-Tool könnte benchmarkspezifische Optimierungen in ein Produkt verwandeln, das normale Entwickler nutzen können.

Es könnte auch aufzeigen, wie viel von V4 Flash 0731s Benchmark-Sprung vom Checkpoint und wie viel von der Agent-Laufzeitumgebung stammt.

Was als Nächstes zu beobachten ist

Mehrere Entwicklungen werden darüber entscheiden, ob der V4-Flash-Moment zu einem dauerhaften Ökosystemwandel wird.

Offizielle V4-Pro-Veröffentlichung

DeepSeek gibt an, dass die offizielle V4-Pro-Veröffentlichung dem Flash-Update folgen wird.

Die Leistungs- und Preislücke zwischen Pro und Flash wird Routing-Entscheidungen beeinflussen.

Verfügbarkeit von DeepSeek Harness

Eine öffentliche Veröffentlichung würde die Reproduzierbarkeit von Benchmarks verbessern und Entwicklern ein modellnatives Agent-Framework bieten.

Preisstabilität

Der direkte Preis ist bereits niedrig, aber Werbeaktionen von Drittanbietern könnten nicht bestehen bleiben.

Kapazität der Anbieter

Günstige Inferenz zieht sehr hohen Datenverkehr an.

Latenz, Ratenbegrenzungen und Zuverlässigkeit werden wichtig, wenn die Nutzung skaliert.

Open-Source-Inferenzunterstützung

vLLM, SGLang, Hardware-Anbieter und Quantisierungsprojekte werden bestimmen, wie zugänglich Self-Hosting wird.

Unabhängige Bewertungen

Weitere öffentliche Bewertungen sollten testen:

  • Programmierung.
  • Sicherheit.
  • Faktische Zuverlässigkeit.
  • Langen Kontext.
  • Tool-Nutzung.
  • Kosten pro erfolgreicher Aufgabe.
  • Leistung unter verschiedenen Harnesses.

Häufige Fragen

Was ist DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 ist die offizielle Veröffentlichung von V4 Flash vom 31. Juli, die derzeit über die deepseek-v4-flash-API in der öffentlichen Beta bereitgestellt wird. DeepSeek gibt an, dass es die Basisarchitektur und -größe des Preview-Modells beibehält, während die Agent-Fähigkeiten durch neues Post-Training erheblich verbessert werden.

Wie viel kostet DeepSeek V4 Flash?

Die offizielle DeepSeek-API listet 0,14 US-Dollar pro Million Cache-Miss-Input-Tokens, 0,0028 US-Dollar pro Million Cache-Hit-Input-Tokens und 0,28 US-Dollar pro Million Output-Tokens auf. Plattformen von Drittanbietern können andere Preise, kostenlose Kontingente oder temporäre Rabatte anbieten.

Kostet die Erstellung eines 3D-Spiels wirklich nur 0,07 RMB?

Der Quellenartikel zitiert ein Community-Beispiel mit diesen gemeldeten Modellkosten. Das Beispiel wird nicht von vollständigen Prompts, Token-Protokollen, Cache-Daten, Wiederholungen, Tool-Kosten oder Aufzeichnungen menschlicher Arbeit begleitet, daher sollte es eher als Anekdote denn als garantierte Kostenkalkulation betrachtet werden.

Was sind die wichtigsten Benchmark-Ergebnisse von V4 Flash 0731?

DeepSeek meldet 82,7 auf Terminal Bench 2.1, 76,7 auf CyberGym, 54,4 auf DeepSWE, 70,3 auf Toolathlon-Verified und 54,2 auf NL2Repo. Öffentliche Code-Agent-Bewertungen verwendeten den unveröffentlichten Minimalmodus von DeepSeek Harness mit maximalem Denkaufwand.

Ist DeepSeek V4 Flash 0731 Open Source?

Die Modellgewichte und das Repository werden unter der MIT-Lizenz veröffentlicht, daher sind „Open-Weight“ und weitgehend erlaubende Nutzung zutreffende Beschreibungen. Das Ausführen des vollständigen Checkpoints erfordert weiterhin erhebliche Multi-GPU-Infrastruktur.

Kann DeepSeek V4 Flash lokal ausgeführt werden?

Ja, DeepSeek veröffentlicht Gewichte und Serving-Anleitungen für vLLM und SGLang. Die offiziellen Beispiele im vollen Umfang verwenden fortschrittliche Multi-GPU-Hardware, daher ist ein normales Laptop nicht die Zielumgebung für das vollständige Modell.

Wie groß ist das Kontextfenster?

Die offizielle API und die Modellkarte geben ein Kontextfenster von 1 Million Tokens an. Die API listet auch eine

maximale Ausgabelänge von 384.000 Tokens, aber die Nutzung des maximalen Kontexts oder der maximalen Ausgabe kann Latenz und Ressourcenverbrauch erheblich erhöhen.

Wurden DeepSeek Code oder DeepSeek Harness veröffentlicht?

DeepSeek hat öffentlich einen Harness-Minimalmodus erwähnt und Open-Source-Harness-Entwickler für interne Tests angeworben. Ein vollständiges öffentliches Repository, eine endgültige Produktspezifikation und ein bestätigtes Veröffentlichungsdatum wurden bei der Überprüfung nicht gefunden.

Verwandte Tools

  • DeepSeek API: Die offizielle Plattform für API-Schlüssel, Abrechnung und direkten Zugriff auf DeepSeek-Modelle.
  • DeepSeek V4 Flash 0731 auf Hugging Face: Offizieller Open-Weight-Checkpoint, Modellkarte, Benchmark-Tabelle, Lizenz und Bereitstellungsanweisungen.
  • vLLM: Eine Open-Source-Engine für Hochdurchsatz-Inferenz mit Unterstützung für DeepSeek V4 und DSpark.
  • SGLang: Ein Open-Source-Serving-Framework mit einem veröffentlichten Bereitstellungspfad für V4 Flash 0731.
  • OpenCode: Ein Open-Source-Coding-Agent, dessen Zen-Dienst derzeit eine zeitlich begrenzte kostenlose V4-Flash-Option anbietet.
  • Cline: Ein Open-Source-Coding-Agent und eine Modellplattform, die DeepSeek V4 Flash über ihr Provider-Ökosystem anbietet.
  • Nous Portal: Eine Multi-Modell-Inferenzplattform, die eine begrenzte DeepSeek-V4-Flash-Aktion durchgeführt hat.
  • Artificial Analysis: Eine unabhängige Modellanalyseplattform, die Intelligenz, Geschwindigkeit, Preis und Benchmark-Kosten abdeckt.

Verwandte Links

Zusammenfassung

DeepSeek V4 Flash 0731 behält die Basis des Preview-Modells

Architektur und Größe, nutzt jedoch neues Post-Training, um einen großen Sprung in der Leistung von Coding-Agenten zu erzielen. DeepSeek meldet 82,7 auf Terminal Bench 2.1, 76,7 auf CyberGym und 54,4 auf DeepSWE, obwohl die stärksten öffentlichen Code-Agenten-Ergebnisse von einer nicht veröffentlichten DeepSeek-Harness-Konfiguration abhängen.

Der offizielle API-Preis ist ungewöhnlich niedrig: 0,14 US-Dollar pro Million nicht zwischengespeicherter Eingabe-Tokens, 0,0028 US-Dollar pro Million zwischengespeicherter Eingabe-Tokens und 0,28 US-Dollar pro Million Ausgabe-Tokens. Kostenlose Kontingente und Rabatte von Drittanbietern können den Zugang noch günstiger machen, aber diese Aktionen sind vorübergehend und sollten nicht mit dem dauerhaften Listenpreis verwechselt werden.

Die Open-Weight-MIT-Veröffentlichung, der Kontext von 1 Million Tokens, Responses- und Anthropic-kompatible APIs sowie die Unterstützung in vLLM und SGLang machen das Modell über gehostete und selbstverwaltete Wege zugänglich. Eine vollständige lokale Bereitstellung bleibt ein ernsthaftes Multi-GPU-Infrastrukturprojekt.

Die viralen Sieben-Cent- und Fünfzig-Cent-Prototypen sind plausible Beispiele dafür, wie niedrig die marginale Modellrechnung werden kann, aber sie sind keine vollständigen Produktkostenstudien. Agentenschleifen, Ausgabelänge, Cache-Fehler, Tools, Tests und menschliche Arbeit spielen weiterhin eine Rolle.

DeepSeek V4 Flash 0731 ist wichtig, nicht weil jede Anwendung jetzt nur noch ein paar Cent kostet, sondern weil leistungsfähiges agentisches Codieren billig genug geworden ist, dass weitaus mehr Entwickler in sinnvollem Umfang experimentieren können.