PenguinHarness baut selbstverbessernde KI-Agenten für nur 0,2 Yuan

LlamaFactory macht das Feintuning großer Modelle für eine breitere Entwicklergemeinschaft zugänglicher. Nun wenden seine Schöpfer Zheng Yaowei und das PrismShadow-Team dasselbe Prinzip der Benutzerfreundlichkeit an, um ...

发布于 2026年8月6日generalGEO 评分: 09 次阅读
PenguinHarness baut selbstverbessernde KI-Agenten für nur 0,2 Yuan

PenguinHarness baut und verbessert KI-Agenten für nur 0,2 Yuan selbst

Einführung

LlamaFactory macht das Feintuning großer Modelle für eine breitere Entwicklergemeinschaft zugänglicher. Nun wenden ihre Schöpfer Zheng Yaowei und das PrismShadow-Team denselben „Benutzerfreundlichkeit zuerst"-Ansatz auf KI-Agenten an.

Ihr neues Open-Source-Projekt PenguinHarness zielt darauf ab, drei Phasen des Agentenlebenszyklus zu automatisieren:

  1. Aufbau von Agentenanwendungen
  2. Bewertung ihrer Leistung
  3. Kontinuierliche Verbesserung ihrer Prompts, Fähigkeiten und Konfigurationen

Nutzer müssen nicht mehr manuell Frameworks auswählen, Tools verbinden, Prompts schreiben, Oberflächen erstellen und Ergebnisse wiederholt testen – sie beschreiben einfach ihre Anforderungen und lassen PenguinHarness eine lauffähige Agentenanwendung zusammenstellen.

PenguinHarness 平台宣传图

PenguinHarness ist ein Open-Source-Tool zur automatisierten Agentenerstellung für Desktop- und Serverbereitstellung.

Das Projekt ist leichtgewichtig, unter der Apache-2.0-Lizenz als Open Source verfügbar und unterstützt Linux, macOS und Windows. Es kann lokal oder über eine Browseroberfläche auf einem Remote-Server verwendet werden.

PenguinHarness unterstützt außerdem Online- und lokale Modelle über integrierte Voreinstellungen und eine OpenAI-kompatible Schnittstelle. Das offizielle Repository listet derzeit die neuesten Modelle von Anbietern wie DeepSeek, Kimi, GLM, Qwen, OpenAI, Google und Anthropic.

Der Originalbericht beschreibt eine RAG-Anwendung, die für nur 0,2 Yuan an Modell-Token-Gebühren erstellt wurde. Die offizielle Projektseite gibt für dasselbe Beispiel etwa 0,02 US-Dollar (mit DeepSeek V4 Pro) an.

Diese Zahl sind Projektdemodaten und keine garantierte Festpreisangabe. Die tatsächlichen Kosten hängen vom gewählten Modell, Anbieter, der Prompt-Komplexität, der Anzahl der Wiederholungen, dem Anwendungsumfang und der Token-Preisgestaltung ab.

Ein Agent lässt einen anderen Agenten bauen

PenguinHarness beginnt mit einer einfachen Idee: Ein Agent sollte in der Lage sein, auf der Grundlage von Anforderungen in natürlicher Sprache eine andere Agentenanwendung zu erstellen.

Dies passt in die breitere Diskussion über „KI für KI" und rekursive Selbstverbesserung – KI-Systeme helfen dabei, andere KI-Systeme zu erstellen, zu testen oder zu verbessern.

Der erste im Quellartikel gezeigte Anwendungsfall verlangt vom System, eine RAG-Anwendung zu erstellen, die:

  • Informationen in Chunks abruft
  • klare Antworten im Streaming-Format ausgibt
  • Quellenangaben enthält
  • eine nutzbare Frontend-Oberfläche bietet
  • als vollständige Anwendung ausgeführt werden kann

Im Vergleichstest wurde PenguinHarness Seite an Seite mit einem Coding-Agenten getestet, wobei beide Systeme ähnliche Aufgaben erledigen sollten.

Laut der Projektdemo erledigte PenguinHarness die Anwendung schneller und mit geringeren Token-Kosten. Das Ergebnis enthielt flüssige Antworten, Streaming-Ausgabe und verlinkte Quellen.

Die im Bericht gezeigte Ausgabe des Konkurrenten wies Sprachvermischungsprobleme auf und hatte nicht dasselbe Streaming-Verhalten.

Diese Beispiele sind nützliche Demonstrationen, beweisen aber nicht allgemein, dass PenguinHarness in allen Szenarien jeden Coding-Agenten übertrifft,

Repository. Die Ergebnisse hängen stark vom Modell, der Agentenkonfiguration, dem Aufgabendesign und der Bewertungsmethode ab.

Von der Anforderung zur lauffähigen Anwendung

Traditionelle Agentenentwicklung umfasst typischerweise mehrere manuelle Phasen:

  1. Auswahl des Agenten-Frameworks.
  2. Auswahl und Konfiguration des Modells.
  3. Verbindung von Tools und externen Diensten.
  4. Schreiben der System-Prompts.
  5. Definition von Gedächtnis- und Workflow-Logik.
  6. Erstellung von Evaluierungsfällen.
  7. Testen und Modifizieren des Agenten.
  8. Erstellung des Frontends oder der Auslieferungsoberfläche.
  9. Paketierung der Anwendung für die Bereitstellung.

PenguinHarness versucht, diese Schritte in einen einzigen agentengesteuerten Workflow zu verwandeln.

Wenn die Anforderung klar ist, kann das System Folgendes generieren:

  • Anwendungsgerüst
  • Agenten-Prompts
  • Fähigkeits- und Tool-Definitionen
  • Konfigurationsdateien
  • Hilfscode
  • Frontend
  • Installationsanweisungen
  • Ausführungsanweisungen
  • Iterative Korrekturen und Optimierungen

Das offizielle Projektbeispiel verwendete die folgende Anfrage:

Sammle die Dokumentation von https://github.com/ericbuess/claude-code-docs und erstelle eine RAG-Anwendung, die als Konfigurationsexperte Fragen zu Claude Code beantwortet und ihre Quellen angibt.

Der Projektbericht gibt an, dass die erstellte RAG-Anwendung bei Verwendung von DeepSeek V4 Pro etwa 0,02 US-Dollar (bzw. ¥0,2) an Modell-Tokens verbrauchte.

Das Dateisystem ist die Quelle der Wahrheit

PenguinHarness verwendet Dateien als primäre Kollaborationsebene zwischen Mensch und Agent.

In diesem Design:

  • Agenten werden durch Dateien repräsentiert.
  • Prompts sind Dateien.
  • Fähigkeiten sind Dateien.
  • Konfigurationen werden in Dateien gespeichert.
  • Gesprächs- und Ausführungsinformationen können über gespeicherte Aufzeichnungen verfolgt werden.
  • Neue Agenten können durch Zusammenstellen oder Kopieren der erforderlichen Dateistrukturen erstellt werden.

Dieser Ansatz macht Agenten leichter überprüfbar und modifizierbar.

Anstatt wichtiges Verhalten in einem großen Anwendungsframework zu verstecken, verwendet PenguinHarness bearbeitbare Dateien als primäre Schnittstelle. Menschen können diese Dateien lesen und ändern, während Agenten sie im Rahmen genehmigter Optimierungsprozesse verbessern können.

Das Tool ist dafür verantwortlich, diese Dateien zu einem lauffähigen Agentenobjekt zusammenzusetzen.

PenguinMessage bietet ein einheitliches Protokoll

Zur Laufzeit dient PenguinMessage als universelles Nachrichtenformat, das Modelle, Umgebung, Tools und Benutzer verbindet.

Der Quellartikel vergleicht es mit Netzwerkpaketen: Verschiedene Komponenten können über dieselbe leichtgewichtige Schnittstelle Informationen austauschen, ohne dass für jedes Modell oder jede Umgebung eine eigene Integration erforderlich ist.

PenguinHarness ist daher beides:

  • Ein Framework zum Ausführen von Agenten
  • Ein Agent, der seine eigene Struktur verstehen und erweitern kann

PenguinHarness 项目架构图

PenguinHarness kombiniert PenguinMessage, Penguin SDK und Penguin Skills in einer leichtgewichtigen Architektur.

Die drei in der Projektarchitektur gezeigten Kernbereiche sind:

Komponente Rolle
PenguinMessage Minimales Nachrichtenprotokoll zwischen Benutzer, Modell, Tools und Umgebung
Penguin SDK Entwicklungsebene zur Erstellung von Agentenanwendungen
Penguin Skills Wiederverwendbare Fähigkeiten zum Erstellen, Bewerten und Optimieren von Agenten

|

Lokal reproduzierbarer Selbstverbesserungszyklus

Den Agenten zu bauen ist nur der erste Schritt.

Das langfristige Ziel von PenguinHarness ist es, Nutzern zu ermöglichen, Agenten zu betreiben, die lokal evaluiert und optimiert werden können – ohne das gesamte System manuell neu aufzubauen.

Das Projekt unterscheidet zwei Phasen:

  • Agenten bauen: Von null auf eins
  • Agenten optimieren: Von eins auf hundert

Einen Agenten zu verändern ist relativ einfach, da Prompts, Code, Fähigkeiten und Konfigurationen bearbeitet werden können. Aber zu beurteilen, ob eine Änderung den Agenten tatsächlich verbessert, ist wesentlich schwieriger.

Große Sprachmodelle sind probabilistisch, und Agentensysteme führen durch Werkzeuge, Umgebungen, Gedächtnis und mehrstufige Entscheidungsfindung weitere Unsicherheiten ein.

Ein zuverlässiger Verbesserungszyklus erfordert daher ein zuverlässiges Messsystem.

Warum Evaluation die Grundlage ist

Ein Agent mag bei einzelnen Beispielen besser abschneiden, aber insgesamt schlechter werden.

Ohne strukturierte Benchmarks könnte ein Optimierer:

  • Auf wenige Demonstrationsbeispiele überanpassen
  • Antworten auswendig lernen
  • Schwächen des Evaluators ausnutzen
  • Kosten erhöhen, ohne Qualität zu steigern
  • Eine Aufgabe verbessern, während eine andere beeinträchtigt wird
  • Durch Reward Hacking höhere Punktzahlen erzielen

Das PrismShadow-Team hat über sechs Monate damit verbracht zu erforschen, wie selbstverbessernde Agenten evaluiert werden können.

Die Kernherausforderung liegt im Fehlen von Benchmarks, die Trainingsefahrung klar von zurückgehaltenen Tests trennen.

Wenn sich ein Agent bei genau denselben Problemen verbessert, mit denen er evaluiert wird, ist schwer zu beurteilen, ob er eine wiederverwendbare Strategie gelernt oder nur Antworten auswendig gelernt hat.

GDPevo trennt Trainings- und Testaufgaben

Das Team hat GDPevo entwickelt, einen evolutionär-nativen Benchmark, der auf realen Geschäftsprozessen basiert.

Der Quellartikel beschreibt seine Abdeckung in Bereichen wie Gesundheitswesen, Finanzen und Rechtsarbeit. Das aktuell öffentliche V2-Repository enthält 240 Aufgaben in 24 Aufgabengruppen, darunter:

  • CRM
  • ERP
  • Finanzen
  • Gesundheitswesen
  • Rechtsworkflows
  • Datenanalyse
  • Engineering-Betrieb

Jede Aufgabengruppe umfasst:

  • Eine gemeinsame Geschäftsumgebung
  • Fünf Trainingsaufgaben
  • Fünf zurückgehaltene Testaufgaben

GDPevo verwendet eine Methode namens Regel-Mischung. Geschäftsprozesse werden in kleinere Regeln zerlegt, über die Trainingsaufgaben verteilt und in den zurückgehaltenen Testaufgaben neu kombiniert.

Diese Struktur hilft zu erkennen, ob ein Agent wiederverwendbare Workflows gelernt hat – und nicht nur die Testantworten vorab gesehen hat.

GDPevo 模型评测排行榜

GDPevo misst, wie stark sich Agenten nach verschiedenen Formen der Evolution bei zurückgehaltenen Geschäftsaufgaben verbessern.

Der GDPevo-Papierbericht

Selbstevolution verbesserte die zurückgehaltene Genauigkeit in ihren Experimenten um bis zu 16,44 Prozentpunkte. Außerdem wird darauf hingewiesen, dass der beste Agent nach der Evolution immer noch weit unter der idealen Obergrenze von 91,6 % bei vollständiger Information liegt.

Diese Lücke ist entscheidend. Aktuelle Agenten können sich verbessern, aber zuverlässige Selbstevolution ist noch lange nicht gelöst.

PenguinHarness verpackt Evaluation als Fähigkeit

PenguinHarness überführt die Kernideen hinter GDPevo in wiederverwendbare Fähigkeiten für:

  • Agentenerstellung
  • Benchmark-Design
  • Agentenbewertung
  • Agentenoptimierung

Nach Aufruf der entsprechenden Fähigkeiten können mehrere Agenten kollaborativ am Verbesserungsprozess teilnehmen.

Der Quellartikel gibt ein Beispiel für einen Agenten, der für Aufgaben wie Sportprognosen, Generierung von Anlagestrategien oder E-Commerce-Support entwickelt wurde.

Nutzer müssen Prompts und Workflows nicht manuell ändern – sie lassen PenguinHarness einfach Evaluierungssets erstellen, wiederholte Tests ausführen, Fehlerursachen analysieren und bessere Versionen vorschlagen.

Der Projektdemonstrationsbericht zeigt, dass die Punktzahl nach mehreren Iterationen von 53 auf 95 Punkte stieg, bei Tokenkosten von etwa 0,5 RMB mit dem DeepSeek V4 Flash Modell.

Dies ist ein Demonstrationsergebnis des Projektteams und keine allgemeine Benchmark-Zusicherung. Die tatsächlichen Ergebnisse variieren je nach Aufgabe, Bewertungskriterien, Modell, Stichprobengröße und Optimierungsbudget.

Der vierstufige Optimierungsprozess

Der Selbstverbesserungsworkflow verwendet mehrere Agenten mit unterschiedlichen Rollen.

1. Evaluation organisieren

Der Optimierer-Agent bestimmt die benötigte Anzahl an Fragen und Wiederholungen und startet dann parallel mehrere Evaluator-Agenten.

Parallele Evaluierung hilft, die Zeit für das Testen mehrerer Aufgaben oder wiederholter Durchläufe zu verkürzen.

2. Unabhängige Bewertung

Jeder Evaluator-Agent startet eine unabhängige Kopie des Zielagenten und fordert ihn auf, eine Aufgabe zu lösen.

Der Evaluator-Agent hat Zugriff auf die Bewertungskriterien, der Zielagent jedoch nicht.

Diese Isolierung soll verhindern, dass der Zielagent direkt auf die versteckten Bewertungsanweisungen hin optimiert.

3. Analyse und Verbesserung

Der Optimierer-Agent sammelt die Ergebnisse und prüft die Ausführungs-Trajektorien.

Er identifiziert die Ursachen für Punktverluste und modifiziert dann genehmigte Teile des Zielagenten, wie zum Beispiel:

  • Prompts
  • Fähigkeiten
  • Konfigurationen
  • Workflow-Dateien

Der Optimierer-Agent erzeugt einen Kandidaten für die nächste Version.

4. Validierung und Iteration

Die Evaluator-Agenten testen den Kandidaten erneut.

Nur wenn der Kandidat eine strikt höhere Punktzahl erzielt, akzeptiert der Optimierer-Agent ihn. Bei gleicher oder niedrigerer Punktzahl fällt das Framework auf die vorherige Version zurück.

PenguinHarness 自进化工作流

Der Optimierer-Agent koordiniert parallele Evaluator-Agenten und akzeptiert nur Kandidaten mit höherer Punktzahl.

Der Prozess lässt sich wie folgt zusammenfassen:

Zielagent vN
      ↓
Parallele Evaluator-Agenten
      ↓
Punktzahlen, Bewertungskriterien und Ausführungs-Trajektorien
      ↓
Optimierer-Agent
      ↓
Prompt-, Fähigkeits- oder Konfigurationsupdates
      ↓
Kandidatenagent vN+1
      ↓
Nur bei strikt höherer Punktzahl akzeptieren

Diese Kombination aus versteckten Bewertungskriterien, zurückgehaltenen Tests, Snapshots und strikten Punktzahlverbesserungen soll die Optimierung reproduzierbarer machen.

Der Vertrag zwischen Testframework und selbstverbesserndem Agenten

Selbstevolution wirft eine offensichtliche Sicherheitsfrage auf: Was darf ein Agent ändern?

PenguinHarness definiert diese Grenzen in einer portablen Datei namens CONTRACT.md.

Dieser Vertrag legt fest, dass Fähigkeiten innerhalb genehmigter Bereiche verbessert werden dürfen, während der Kern des Testframeworks und seine Sicherheitsgrenzen fest bleiben.

PenguinHarness 自进化工作流

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/e5026929-6776-4554-9898-0bb26c98a90b-22347c95-602e-479c-97e6-268a5f43988a.png)

CONTRACT.md definiert die Grenzen für Agenten-Evolution, Auditierung, Versionskontrolle und Credential-Isolation.

Der Quellartikel betont vier Kernregeln.

1. Evolution darf den Kern des Test-Frameworks nicht verändern

Der editierbare Bereich ist auf Arbeitsbereiche, Prompts, Skills und genehmigte Konfigurationen beschränkt.

Agenten dürfen das Kern-Testframework oder dessen Sicherheitsmechanismen nicht neu schreiben.

Dadurch wird das Risiko verringert, dass der Optimierungsprozess Folgendes schwächt:

  • Tool-Genehmigungen
  • Zugriffskontrollen
  • Audit-Logs
  • Credential-Isolation
  • Versionswiederherstellung
  • Andere systemweite Sicherheitsprüfungen

2. Jede Optimierung erfordert einen Snapshot

Vor jeder Optimierungsrunde speichert das Framework einen Versions-Snapshot des Agentenzustands.

Wenn ein Kandidaten-Agent schlechter abschneidet oder unerwünschte Nebenwirkungen verursacht, kann das System auf eine frühere Version zurückrollen.

Ein selbstverbesserndes System ohne Rollback-Fähigkeit kann Schäden akkumulieren. Versionskontrolle macht Verbesserungen umkehrbar.

3. Der Ziel-Agent darf die Bewertungskriterien nicht sehen

Der Ziel-Agent erhält Aufgaben, aber nicht die versteckten Bewertungskriterien.

Nur der Evaluator hat Zugriff auf die Bewertungsmaßstäbe.

Dies soll Abkürzungsverhalten, Antworten-Auswendiglernen und Reward Hacking reduzieren.

Dies eliminiert diese Risiken nicht vollständig, schafft aber eine klarere Trennung zwischen Problemlösung und Ergebnisbewertung.

4. Jede Optimierung muss auditierbar sein

Modell-Anfragen, Tool-Aufrufe, Token-Nutzung, Zeit, Fehler, Genehmigungen und Optimierungsänderungen werden in Tracking-Dateien geschrieben.

Benutzer können prüfen, was sich geändert hat und warum.

Der breitere Projektvertrag umfasst außerdem:

  • Genehmigungen vor der Tool-Ausführung
  • Audit-Aufzeichnungen über Genehmigungsentscheidungen
  • Credential-Isolation
  • Entkopplung von Modell und Agent
  • Wiederherstellbare Ausführungspfade
  • Bedarfsgesteuertes Laden relevanter Dateien
  • Klare Regeln zur Fehlerbehandlung

Das Ergebnis ist ein Framework, in dem Agenten sich weiterentwickeln können, während der Evolutionsprozess sichtbar und umkehrbar bleibt.

Weitere nützliche PenguinHarness-Funktionen

PenguinHarness umfasst neben der automatisierten Agentenerstellung und -optimierung mehrere weitere Fähigkeiten.

Integrierte Skills für Modelltraining

und Deployment

Das Projekt enthält integrierte Skills im Zusammenhang mit der KI-Anwendungsentwicklung, darunter:

  • penguin-sdk
  • penguin-cli
  • agenthub-models
  • vllm
  • ollama
  • llamafactory

PenguinHarness 内置技能界面

PenguinHarness enthält Skills zum Erstellen von Agenten sowie für die Zusammenarbeit mit Tools wie vLLM, Ollama und LlamaFactory.

Diese Skills ermöglichen es Benutzern, Trainings- oder Deployment-Aufgaben in natürlicher Sprache zu beschreiben, und der Agent bereitet die erforderlichen Dateien oder Befehle vor.

Das offizielle Repository unterteilt die integrierten Skills in vier Hauptkategorien:

Skill-Gruppe Beispiele
Büroeffizienz Datenanalyse und Web-Datenerfassung
Softwareentwicklung Webdesign und Software-Engineering
KI-Anwendungsentwicklung Penguin SDK, Modell-Gateway, vLLM, Ollama und LlamaFactory
Agenten-Optimierung Agentenerstellung, Benchmark-Design, Evaluierung und Optimierung

Benutzer und Agenten können außerdem zusätzliche Skills erstellen oder verbessern.

Einheitliches Modell-Gateway

PenguinHarness enthält integrierte Modellvoreinstellungen und unterstützt benutzerdefinierte, OpenAI-kompatible Schnittstellen.

Das Projekt gibt an, dass Benutzer über unterstützte Anbieter und Gateways auf über 1000 Online- und lokale Modelle zugreifen können.

OpenRouter 模型列表

Das Modell-Gateway ermöglicht es Benutzern, verschiedene Online- und lokale Modellanbieter zu konfigurieren.

Das aktuelle Repository listet die folgenden Modellserien auf:

  • DeepSeek
  • Kimi
  • GLM
  • Hunyuan
  • Qwen
  • GPT
  • Gemini
  • Claude

Die Verfügbarkeit von Modellen und Anbieternamen ändert sich häufig, daher sollten die „Modelle“-Seite in der Anwendung und die aktuelle offizielle Dokumentation als aktuellste Informationsquelle betrachtet werden.

Visuelle Agenten für Textmodelle

Der Quellartikel beschreibt ein Entwicklungsmuster, bei dem ein primär textbasiertes Modell wie DeepSeek als Haupt-Agent fungiert, während ein Modell mit visuellen Fähigkeiten als visueller Assistent dient.

Der visuelle Agent kann prüfen:

  • Webseiten-Screenshots
  • Folien
  • Interface-Layouts
  • Gerenderte Spielbilder
  • Diagramme
  • Visuelle Fehler

Das Hauptmodell kann anschließend seine Ausgabe basierend auf der visuellen Beschreibung korrigieren.

DeepSeek V4 Flash 游戏截图分析

Ein visuell fähiger

Agent kann Screenshots prüfen, während DeepSeek weiterhin als primäres Arbeitsmodell fungiert.*

Dies ist nützlich, wenn das Hauptmodell hervorragend in Codierung oder Schlussfolgerungen ist, aber Bilder nicht nativ verarbeitet.

Die Technik verleiht dem Hauptmodell keine direkten visuellen Fähigkeiten. Sie erstellt einen Multi-Modell-Workflow, in dem das visuelle Modell Screenshots in Informationen umwandelt, die der Haupt-Agent nutzen kann.

Fein granulierte Trace-Analyse

PenguinHarness zeichnet Modellaufrufe, Tool-Ausführungen, Zeitabläufe, Token-Nutzung, Genehmigungen und Sub-Agenten-Aktivitäten auf.

Die Trace-Oberfläche zeigt die Ausführungssequenz als Zeitachse an.

Dieses Bild zeigt die Trace-Analyseoberfläche von PenguinHarness zur Anzeige von Daten zur AI-Agentenausführung.

Die Trace-Seite bietet eine detaillierte Sicht auf jeden Ausführungsschritt.

Jeder Schritt kann erweitert werden, um die gesendete Anfrage, die Antwort und die tatsächlich verwendeten Tool-Aufrufe anzuzeigen.

Oben befindet sich der globale Statistikbereich, der übersichtlich Werte wie Batches, Tool-Aufrufe, Verbindungsanzahl sowie Kerndaten wie Eingabe-Tokens, Ausgabe-Tokens, Kosten, Gebühren, Bearbeitungszeit und einzelne TPS auflistet. Der Hauptbereich der Oberfläche zeigt die Ausführungszeitleiste der „Runde 1", die verschiedene Zeitblöcke für Modellüberlegungen, Tool-Aufrufe, Genehmigungswartezeiten und Tool-Ausführungen nach Kategorien unterscheidet und der Zeitachse der Ausführungsdauer entspricht. Darunter werden auch die konkreten Ausführungsnachrichten angezeigt, einschließlich Benutzeranweisungen, Denkprozessen des Systems und Details zu Tool-Aufrufen, die die zeitliche Abfolge der Agentenausführung vollständig darstellen. Die Trace-Ansicht, die mit der Kontextbeschreibung übereinstimmt, kann zum Anzeigen paralleler Sub-Agenten, Modellaufrufe, Tool-Nutzung und weiterer Inhalte verwendet werden.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/29548888-b6dd-4d98-a216-beef965d0417-f038b908-4c76-409a-af91-fe7f4f3c580a.png)

Die Trace-Ansicht hilft Benutzern, parallele Sub-Agenten, Modellaufrufe, Tool-Nutzung, Latenz und Token-Kosten zu überprüfen.

Dies hilft bei der Identifizierung von:

  • Langsamen Modellaufrufen
  • Unnötiger Tool-Nutzung
  • Teuren Inferenzschleifen
  • Fehlgeschlagenen Wiederholungen
  • Sub-Agenten, die Workflows blockieren
  • Langen Genehmigungsverzögerungen
  • Token-intensiven Prompts
  • Möglichkeiten für parallele Ausführung

Trace-Daten sind auch der Kern der Selbstevolution, da der Optimierer Beweise dafür benötigt, warum die vorherige Version Punkte verloren hat.

Minimalistische Blank-Agent-Vorlage

PenguinHarness kann auch als minimalistische Universal-Agent verwendet werden, nicht nur als Automatisierungs-Builder.

Das Projekt verwendet die Shell als universelle Low-Level-Schnittstelle und hält den standardmäßigen Tool-Satz bewusst klein und schlank.

Es behandelt die Sub-Agenten-Ausführung als Kernleistungsmerkmal.

Der Quellcode berichtet, dass das Standard-Systemprompt etwa 1.300 Tokens umfasst, während der Vergleichswert von Claude Code im Projekt bei etwa 15.000 Tokens liegt.

Diese Zahl wird vom Projekt selbst berichtet und kann sich mit der Weiterentwicklung eines der Produkte ändern.

Das zugrunde liegende Designprinzip ist stabil: Kürzere Prompts und ein kleinerer Tool-Satz reduzieren den Token-Overhead und machen offene Modelle einfacher nutzbar.

Kosten- und Benchmark-Ergebnisse

Das Projekt veröffentlichte Vergleichsergebnisse zu einer komplexen Datenanalyse-Suite.

智能体数据分析性能对比

Das Projekt berichtet, dass es in seinem komplexen Datenanalyse-Vergleich eine höhere Genauigkeit zu einem Bruchteil der Modellkosten erreicht hat.

Die veröffentlichte Datentabelle berichtet:

Framework Modell Genauigkeit Token-Verbrauch Geschätzte Kosten
PenguinHarness DeepSeek V4 Pro 66,67 % 18,04 M $0,55
Claude Code Claude Opus 4.8 53,33 % 22,20 M $38,48
OpenAI Codex GPT-5.5 53,33 % 13,72 M $19,41

Das Projekt fasst dies wie folgt zusammen:

  • 1/35 der berichteten Codex-Kosten
  • Etwa 1/70 der berichteten Claude-Code-Kosten

Dieser Vergleich setzt die Toolchains mit den typischerweise verwendeten Modellen in Beziehung. Er trennt nicht den Beitrag der Toolchain von dem Beitrag des gewählten Modells und der Preise des Anbieters.

Für eine faire interne Bewertung sollten Teams dieselben Aufgaben unter folgenden Bedingungen ausführen:

  • Möglichst dasselbe Modell verwenden
  • Gleiche Anbieterpreise
  • Gleiche Wiederholungsstrategie
  • Gleiche Tool-Zugriffsrechte
  • Gleiche Zeitlimits
  • Gleiche Bewertungskriterien
  • Mehrfache Wiederholungsläufe

Öffentliche Daten können als Projekt-Benchmark-Referenz dienen, sollten jedoch nicht als universelle Kostenverhältnisse für alle Aufgaben interpretiert werden.

Berichtete Produktionsbereitstellungen

Der Quellartikel besagt, dass das Team PenguinHarness in zwei Produktionsszenarien eingesetzt hat.

Medizinische Berichtsprüfung

Angeblich nutzte eine medizinische Untersuchungseinrichtung PenguinHarness zur Erstellung eines Berichtsprüfungs-Agenten, dessen Leistung als mit medizinischen Experten vergleichbar beschrieben wird.

Nach Angaben des Projektteams kann eine Prüfung, die ursprünglich etwa 30 Minuten dauerte, in wenigen Dutzend Sekunden abgeschlossen werden.

Fertigungsinspektion

Angeblich hat ein Fertigungsunternehmen mehrere auf PenguinHarness basierende Agenten eingesetzt, um Produktionslinienausrüstung kontinuierlich zu überwachen und automatische Wiederherstellung zu versuchen.

Das Team berichtet:

  • 65 % weniger Ausfallzeiten
  • Produktionsleistung auf nahezu das Doppelte gesteigert

Dies sind vom Anbieter bereitgestellte Fallstudien. Der ursprüngliche Bericht enthält keine Kundennamen, Studiendesigns, Stichprobengrößen, Basisdefinitionen oder unabhängige Prüfungen.

Diese sollten als Beispiele berichteter Anwendungsfälle betrachtet werden, nicht als garantierte Betriebsergebnisse.

Installation und Bereitstellung

PenguinHarness unterstützt Linux, macOS sowie Windows 10 oder höher, auf verfügbaren Systemen mit x64 und Arm64.

Das Ein-Zeilen-Installationsskript enthält eine eigene Node.js-Laufzeitumgebung. Die Installation über npm erfordert Node.js 24 oder höher.

Linux oder macOS

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

Die Weboberfläche wird geöffnet unter:

http://127.0.0.1:7364

Windows PowerShell

irm https://penguin.ooo/install.ps1 | iex
penguin web

npm

npm install -g @prismshadow/penguin-cli
penguin web

Bei der CLI-Installation verwendet der erste Web-Login den Benutzernamen admin. Das anfängliche Passwort wird beim ersten Start des Servers ausgegeben und sollte sofort geändert werden.

Modelle konfigurieren und Aufgaben ausführen

Das offizielle Repository bietet CLI-Beispiele wie die folgenden:

penguin config model add \
  --provider deepseek \
  --model-id deepseek-v4-flash \
  --api-key sk-... \
  --set-default

Einmalige Aufgabe ausführen:

penguin run -m "Erstelle hello.txt mit Hello, Penguin"

Interaktive Sitzung starten:

penguin chat

Headless-Server starten:

penguin server

API-Schlüssel sollten niemals in Versionskontrollsysteme eingecheckt oder in öffentlichen Logs eingefügt werden.

PenguinHarness kann auf lokalen Maschinen oder Servern ausgeführt werden. Die Browseroberfläche unterstützt Mehrfachsitzungen, Agenten- und Skill-Verwaltung, Modellkonfiguration, Nutzungsstatistiken, Trace-Beobachtbarkeit sowie Bewertungs-Workflows.

Das Projekt weist derzeit darauf hin, dass einige

Desktop-Builds nicht signiert sind und beim ersten Start möglicherweise Betriebssystemwarnungen auslösen. Benutzer sollten ausschließlich von der offiziellen Website oder aus

Laden Sie das Installationsprogramm von GitHub Releases herunter und prüfen Sie die Projektbeschreibung, bevor Sie Warnhinweise umgehen.

Das Team hinter PenguinHarness

PenguinHarness wird von PrismShadow als Open-Source-Projekt bereitgestellt. Das Team wurde 2025 gegründet und widmet sich dem Aufbau von Agenteninfrastruktur, die aus Geschäftswissen, Arbeitsabläufen und Feedback lernen kann.

Der ursprüngliche Bericht listet das Gründungsteam wie folgt auf:

Teammitglied Hintergrund
Zheng Yaowei Gründer von LlamaFactory; Fokus auf zugängliche Modelle und Agenteninfrastruktur
Qian Buyue Doktor der University of California, Davis; ehemaliger Forscher bei IBM T. J. Watson, ehemaliger Professor an der Fudan-Universität
Wu Xuejun Ehemaliges Gründungsmitglied der NLP-Abteilung von Baidu; bekleidete leitende Positionen bei Alibaba und JD Digits
Hu Junhao Doktorand an der Peking-Universität; beteiligt an Forschung zu Modell- und Cache-Effizienz
Chen Xi Professor an der Business School der New York University; Doktor der Carnegie Mellon University, ehemaliger leitender Wissenschaftler bei Amazon

Die biografischen Angaben in der Quelle stammen vom Herausgeber und vom Projektteam. Wenn diese Informationen für Beschäftigungs- oder akademische Verifizierung von wesentlicher Bedeutung sind, sollten Leser die offiziellen institutionellen Seiten zur Überprüfung nutzen.

Von LlamaFactory bis PenguinHarness ist das erklärte Ziel des Teams unverändert: komplexe KI-Infrastruktur in zugänglichere, zuverlässigere und effizientere Werkzeuge für eine breitere Nutzerbasis zu verwandeln.

Häufig gestellte Fragen

Was ist PenguinHarness?

PenguinHarness ist ein Open-Source-Agentenframework zum Erstellen, Ausführen, Bewerten und Optimieren von KI-Agenten. Es bietet eine Webschnittstelle, CLI, SDK, integrierte Fähigkeiten, Modellkonfiguration, Tracing sowie Workflows zur Bewertung mehrerer Agenten.

Ist PenguinHarness kostenlos und Open Source?

Ja. Der zentrale Codebestand wird unter der Apache-2.0-Lizenz veröffentlicht. Nutzer tragen weiterhin die Kosten für Modell-APIs, Infrastruktur oder Dienste Dritter, die durch ihre Workloads entstehen.

Kann PenguinHarness lokal ausgeführt werden?

Ja. Es läuft auf Linux, macOS und Windows, sowohl als Desktop-Anwendung als auch über CLI und Browser-Schnittstelle. Es kann auch auf einem Server für den Fernzugriff installiert werden.

Unterstützt PenguinHarness lokale Modelle?

Ja. Es enthält Fähigkeiten und Integrationen für Tools wie Ollama und vLLM und unterstützt benutzerdefinierte, OpenAI-kompatible Endpunkte. Die tatsächliche Kompatibilität hängt vom API-Verhalten des Modells und den benötigten Funktionen ab.

Was bedeutet Selbstentwicklung in PenguinHarness?

Selbstentwicklung bedeutet, dass das System Agenten bewertet, Bewertungen und Tracing-Aufzeichnungen analysiert, genehmigte Prompts, Fähigkeiten oder Konfigurationen modifiziert und Kandidaten für die nächste Version testet. Nur wenn ein Kandidat unter der konfigurierten Bewertung besser abschneidet, wird er akzeptiert.

Können sich selbstentwickelnde Agenten den PenguinHarness-Kern modifizieren?

Laut Projektvertrag nein. Die Entwicklung ist auf Arbeitsbereiche, Prompts, Fähigkeiten und genehmigte Konfigurationen beschränkt, während der Framework-Kern und die Sicherheitsmechanismen unverändert bleiben.

Gibt es eine Garantie für die Agenten-Baukosten von ¥0,2?

Nein. Die Zahl von ¥0,2 stammt aus einer Projektdemo, die mit DeepSeek V4 Pro eine RAG-Anwendung erzeugte. Die tatsächlichen Kosten hängen von Modellpreisen, Token-Verbrauch, Wiederholungsversuchen, Anbieter und Aufgabenkomplexität ab.

Was ist GDPevo?

GDPevo ist ein offener Benchmark zur Messung der Selbstentwicklungsfähigkeit von Agenten an zurückgehaltenen realen Geschäftsaufgaben. Die öffentliche V2-Version umfasst 240 Aufgaben in 24 Kategorien und unterscheidet zwischen Trainings- und Testaufgaben.

Verwandte Werkzeuge

  • PenguinHarness: Offizielle Website mit Downloads, Dokumentation, Produktbeispielen und Installationsanleitungen.
  • PenguinHarness GitHub-Repository: Apache-2.0-Quellcode, README, Release-Versionen, CLI-Beispiele und Beitragsrichtlinien.
  • GDPevo: Benchmark-Daten, Build-Prozesse, Evaluierungs-Workspaces und veröffentlichte experimentelle Ergebnisse.
  • LlamaFactory: Open-Source-Framework von Yaowei Zheng für effizientes Feintuning von Sprach- und Vision-Language-Modellen.
  • vLLM: Open-Source-Engine für High-Throughput-Modellinferenz lokal und serverseitig.
  • Ollama: Lokale Modell-Laufzeitumgebung für Agentenentwicklungs-Workflows.
  • OpenRouter: Einheitliches API-Gateway für den Zugriff auf mehrere gehostete Modellanbieter.

Verwandte Links

Zusammenfassung

PenguinHarness ist eine Open-Source-Plattform, die es Agenten ermöglicht, basierend auf Anforderungen in natürlicher Sprache eine weitere Agentenanwendung zu erstellen. Sie kann Gerüstcode, Prompts, Fähigkeiten, Konfigurationen, Code, Frontend und Ausführungsanweisungen generieren und unterstützt sowohl gehostete als auch lokale Modelle.

Der langfristige Schwerpunkt liegt auf Selbstentwicklung. Mehrere Bewertungsagenten bewerten den Zielagenten, ein Optimierer analysiert Ergebnisse und Ausführungspfade, und nur wenn ein Kandidat höhere Bewertungen erzielt, wird er akzeptiert. CONTRACT.md begrenzt, was geändert werden darf, und verlangt Snapshots, Rollbacks, versteckte Bewertungskriterien, Genehmigungen, Anmeldedaten-Isolation und Prüfprotokolle.

Das Projekt berichtet über erhebliche Kostensenkungen und frühe Produktionsgewinne, aber diese Zahlen stammen aus vom Team bereitgestellten Demos und Fallstudien und sind keine allgemeingültigen Schlussfolgerungen.

Garantie. Das Apache-2.0-Repository, die veröffentlichten Befehle und der GDPevo-Benchmark bieten Entwicklern ausreichend Material, um die Methode an ihren eigenen Workloads zu testen.

Die Kernidee von PenguinHarness ist unkompliziert: Das Erstellen von Agenten sollte automatisierbar sein, aber ihre sichere Verbesserung erfordert messbare Bewertung, strikte Grenzen und reversible Änderungen.