PenguinHarness costruisce e migliora autonomamente agenti AI con soli 0,2 yuan

LlamaFactory rende più accessibile la messa a punto di grandi modelli a una più ampia comunità di sviluppatori. Oggi, i suoi creatori Zheng Yaowei e il team di PrismShadow stanno applicando la stessa filosofia di semplicità a...

发布于 2026年8月6日generalGEO 评分: 01 次阅读
PenguinHarness costruisce e migliora autonomamente agenti AI con soli 0,2 yuan

PenguinHarness: costruisci e migliora agenti AI per soli 0,2 yuan

Introduzione

LlamaFactory ha reso il fine-tuning di modelli su larga scala più accessibile a una platea più ampia di sviluppatori. Oggi, il suo creatore Yaowei Zheng e il team di PrismShadow stanno applicando lo stesso approccio "facilità d'uso al primo posto" agli agenti AI.

Il loro nuovo progetto open source PenguinHarness mira ad automatizzare tre fasi del ciclo di vita degli agenti:

  1. Costruire applicazioni basate su agenti
  2. Valutarne le prestazioni
  3. Migliorare continuamente prompt, competenze e configurazione

Gli utenti non devono più selezionare manualmente framework, collegare strumenti, scrivere prompt, creare interfacce e testare ripetutamente i risultati: basta descrivere le proprie esigenze e lasciare che PenguinHarness assembli un'applicazione agente funzionante.

PenguinHarness 平台宣传图

PenguinHarness è uno strumento open source di automazione per la costruzione di agenti progettato per il desktop e la distribuzione server.

Il progetto è leggero, open source con licenza Apache 2.0, e supporta Linux, macOS e Windows. Può essere eseguito localmente o su server remoto tramite interfaccia browser.

PenguinHarness supporta inoltre modelli online e locali tramite preset integrati e interfacce compatibili con OpenAI. Il repository ufficiale elenca attualmente i modelli più recenti di provider come DeepSeek, Kimi, GLM, Qwen, OpenAI, Google e Anthropic.

Il report originale descrive un'applicazione RAG generata con un costo di soli 0,2 yuan in token modello. La pagina ufficiale del progetto riporta lo stesso esempio a circa 0,02 dollari (usando DeepSeek V4 Pro).

Questa cifra è un dato dimostrativo del progetto, non un prezzo fisso garantito. Il costo effettivo dipende dal modello scelto, dal provider, dalla complessità dei prompt, dal numero di tentativi, dall'ambito dell'applicazione e dai prezzi dei token.

Far costruire un agente a un altro agente

PenguinHarness nasce da un'idea semplice: un agente dovrebbe essere in grado di costruire un'altra applicazione agente in base a requisiti espressi in linguaggio naturale.

Questo si inserisce nel più ampio dibattito sull'"AI al servizio dell'AI" e sul miglioramento personale ricorsivo — sistemi AI che aiutano a creare, testare o migliorare altri sistemi AI.

Il primo caso d'uso mostrato nell'articolo originale richiede al sistema di costruire un'applicazione RAG in grado di:

  • Recuperare informazioni a blocchi
  • Fornire risposte chiare in streaming
  • Includere fonti citate
  • Offrire un'interfaccia front-end utilizzabile
  • Funzionare come applicazione completa

Il test comparativo ha messo PenguinHarness affiancato a un agente di codifica, chiedendo a entrambi i sistemi di completare attività simili.

Secondo la demo del progetto, PenguinHarness ha completato l'applicazione con maggiore velocità e costi di token inferiori. I suoi risultati includevano risposte fluide, output in streaming e fonti collegate.

L'output del concorrente mostrato nel report presentava problemi di mescolanza linguistica e non disponeva dello stesso comportamento di streaming.

Questi esempi sono dimostrazioni utili, ma non provano universalmente che PenguinHarness superi ogni agente di codifica in tutti gli scenari.

I risultati dipendono in larga misura dal modello, dalla configurazione dell'agente, dalla progettazione del task e dalla metodologia di valutazione.

Dalla richiesta all'applicazione funzionante

Lo sviluppo tradizionale di agenti coinvolge tipicamente diverse fasi manuali:

  1. Selezionare il framework dell'agente.
  2. Scegliere e configurare il modello.
  3. Collegare strumenti e servizi esterni.
  4. Scrivere i prompt di sistema.
  5. Definire la memoria e la logica del flusso di lavoro.
  6. Costruire casi di valutazione.
  7. Testare e modificare l'agente.
  8. Creare l'interfaccia front-end o di consegna.
  9. Impacchettare l'applicazione per la distribuzione.

PenguinHarness cerca di trasformare questi passaggi in un unico flusso di lavoro guidato da agenti.

Quando i requisiti sono chiari, il sistema può generare:

  • Scaffolding dell'applicazione
  • Prompt dell'agente
  • Definizioni di competenze e strumenti
  • File di configurazione
  • Codice ausiliario
  • Front-end
  • Istruzioni di installazione
  • Istruzioni di esecuzione
  • Correzioni e ottimizzazioni iterative

L'esempio ufficiale del progetto ha utilizzato la seguente richiesta:

Raccogli la documentazione da https://github.com/ericbuess/claude-code-docs e costruisci un'applicazione RAG che risponda a domande su Claude Code in qualità di esperto di configurazione, citando le fonti.

Il progetto riferisce che, costruita con DeepSeek V4 Pro, l'applicazione RAG generata ha consumato circa $0,02 (equivalenti a ¥0,2) di token modello.

Il file system come fonte di verità

PenguinHarness utilizza i file come principale livello di collaborazione tra esseri umani e agenti.

In questo design:

  • Gli agenti sono rappresentati da file.
  • I prompt sono file.
  • Le competenze sono file.
  • La configurazione è archiviata in file.
  • Le conversazioni e le informazioni di esecuzione possono essere tracciate tramite record memorizzati.
  • Nuovi agenti possono essere creati assemblando o copiando le strutture di file necessarie.

Questo approccio rende gli agenti più facili da ispezionare e modificare.

Invece di nascondere il comportamento importante all'interno di un grande framework applicativo, PenguinHarness utilizza file modificabili come interfaccia principale. Gli esseri umani possono leggere e modificare questi file, mentre gli agenti possono migliorarli attraverso processi di ottimizzazione approvati.

Lo strumento si occupa di assemblare quei file in un oggetto agente eseguibile.

PenguinMessage fornisce un protocollo unificato

In fase di esecuzione, PenguinMessage funge da formato di messaggio universale che collega modelli, ambiente, strumenti e utenti.

L'articolo originale lo paragona a pacchetti di rete: componenti diversi possono scambiare informazioni tramite la stessa interfaccia leggera, senza necessità di integrazioni uniche per ogni modello o ambiente.

Pertanto, PenguinHarness è allo stesso tempo:

  • Un framework per eseguire agenti
  • Un agente in grado di comprendere ed estendere la propria struttura

PenguinHarness 项目架构图

PenguinHarness combina PenguinMessage, Penguin SDK e Penguin Skills in un'architettura leggera.

Le tre aree principali mostrate nell'architettura del progetto sono:

Componente Ruolo
PenguinMessage Protocollo di messaggistica minimale tra utenti, modelli, strumenti e ambiente
Penguin SDK Livello di sviluppo per la costruzione di applicazioni basate su agenti
Penguin Skills Capacità riutilizzabili per costruire, valutare e ottimizzare agenti

Ciclo di auto-evoluzione riproducibile localmente

Costruire un agente è solo il primo passo.

L'obiettivo a lungo termine di PenguinHarness è consentire agli utenti di operare agenti che possono essere valutati e ottimizzati localmente, senza dover ricostruire manualmente l'intero sistema.

Il progetto distingue due fasi:

  • Costruire l'agente: da zero a uno
  • Ottimizzare l'agente: da uno a cento

Modificare un agente è relativamente facile, poiché prompt, codice, skill e configurazioni possono essere modificati. Ma stabilire se una modifica renda davvero l'agente migliore è molto più difficile.

I modelli linguistici di grandi dimensioni sono probabilistici, e i sistemi agente introducono ulteriore incertezza attraverso strumenti, ambienti, memoria e decisioni multi-step.

Pertanto, un ciclo di miglioramento affidabile richiede un sistema di misurazione affidabile.

Perché la valutazione è fondamentale

Un agente può comportarsi meglio su un singolo esempio, ma peggiorare complessivamente.

Senza benchmark strutturati, l'ottimizzatore potrebbe:

  • Andare in overfitting su pochi esempi dimostrativi
  • Memorizzare le risposte
  • Sfruttare le debolezze del valutatore
  • Aumentare i costi senza migliorare la qualità
  • Migliorare un compito danneggiandone un altro
  • Ottenere punteggi più alti tramite reward hacking

Il team di PrismShadow ha impiegato più di sei mesi per esplorare come valutare agenti auto-evolventi.

La sfida principale è la mancanza di benchmark in grado di distinguere chiaramente l'esperienza di addestramento dal test di validazione.

Se un agente migliora sugli stessi problemi usati per la valutazione, è difficile capire se ha appreso una strategia riutilizzabile o se ha semplicemente memorizzato le risposte.

GDPevo distingue compiti di training e compiti di test

Il team ha creato GDPevo, un benchmark nativo per l'evoluzione basato su processi aziendali reali.

L'articolo originale descrive la sua copertura in ambiti come sanità, finanza e lavoro legale. Il repository pubblico V2 attuale contiene 240 compiti in 24 gruppi di lavoro, che coprono domini come:

  • CRM
  • ERP
  • Finanza
  • Sanità
  • Flussi di lavoro legali
  • Analisi dei dati
  • Operazioni ingegneristiche

Ogni gruppo di lavoro include:

  • Un ambiente aziendale condiviso
  • Cinque compiti di training
  • Cinque compiti di test di validazione

GDPevo utilizza un metodo chiamato miscelazione di regole. I processi aziendali vengono scomposti in regole più piccole, distribuite nei compiti di training e ricombinate nei compiti di test di validazione.

Questa struttura aiuta a determinare se l'agente ha appreso flussi di lavoro riutilizzabili, piuttosto che essersi semplicemente imbattuto nelle risposte del test in anticipo.

GDPevo 模型评测排行榜

GDPevo valuta quanto gli agenti migliorino sui compiti aziendali riservati dopo diverse forme di evoluzione.

Rapporto dell'articolo GDPevo

L'auto-evoluzione ha migliorato l'accuratezza riservata fino a 16,44 punti percentuali nei loro esperimenti. L'articolo sottolinea inoltre che l'agente ottimizzato migliore rimane ancora ben al di sotto del limite ideale superiore del 91,6% a informazioni complete.

Questo divario è cruciale. Gli agenti attuali possono migliorare, ma l'auto-evoluzione affidabile è tutt'altro che risolta.

PenguinHarness impacchetta la valutazione come skill

PenguinHarness trasforma le idee chiave alla base di GDPevo in skill riutilizzabili per:

  • Creazione di agenti
  • Progettazione di benchmark
  • Valutazione di agenti
  • Ottimizzazione di agenti

Dopo aver richiamato le skill pertinenti, più agenti possono collaborare al processo di miglioramento.

L'articolo originale fornisce un esempio di agente progettato per compiti come previsioni sportive, generazione di strategie di investimento o supporto e-commerce.

L'utente non deve modificare manualmente prompt e flussi di lavoro: basta lasciare che PenguinHarness crei i set di valutazione, esegua test ripetuti, analizzi le cause degli errori e proponga versioni migliori.

La demo del progetto riporta un miglioramento del punteggio da 53 a 95 dopo diversi cicli iterativi, con un costo in token del modello DeepSeek V4 Flash di circa 0,5 yuan RMB.

Questi sono risultati dimostrativi del team di progetto, non una garanzia generica di benchmark. I risultati effettivi possono variare in base a compito, criteri di punteggio, modello, dimensione del campione e budget di ottimizzazione.

Processo di ottimizzazione in quattro fasi

Il flusso di lavoro di auto-evoluzione utilizza più agenti con ruoli distinti.

1. Organizzare la valutazione

L'agente ottimizzatore determina il numero di domande e di ripetizioni necessarie, quindi avvia in parallelo più agenti valutatori.

La valutazione parallela aiuta a ridurre il tempo necessario per testare più compiti o esecuzioni ripetute.

2. Valutazione indipendente

Ogni agente valutatore avvia una copia indipendente dell'agente target e gli chiede di risolvere un compito.

L'agente valutatore ha accesso alla rubrica di valutazione, mentre l'agente target non vi ha accesso.

Questo isolamento mira a impedire che l'agente target ottimizzi direttamente per le istruzioni di valutazione nascoste.

3. Analisi e miglioramento

L'agente ottimizzatore raccoglie i risultati e esamina le traiettorie di esecuzione.

Individua le cause della perdita di punti, quindi modifica le parti approvate dell'agente target, come ad esempio:

  • Prompt
  • Skill
  • Configurazioni
  • File del flusso di lavoro

L'agente ottimizzatore genera una versione candidata successiva.

4. Validazione e iterazione

Gli agenti valutatori testano nuovamente la versione candidata.

L'agente ottimizzatore accetta la candidata solo se ottiene un punteggio strettamente superiore. Se il punteggio è pari o inferiore, il framework torna alla versione precedente.

PenguinHarness 自进化工作流

L'agente ottimizzatore coordina agenti valutatori paralleli e accetta solo agenti candidati con punteggio superiore.

Il processo può essere riassunto come:

Agente target vN
      ↓
Agenti valutatori paralleli
      ↓
Punteggi, rubriche e traiettorie di esecuzione
      ↓
Agente ottimizzatore
      ↓
Aggiornamenti di prompt, skill o configurazione
      ↓
Agente candidato vN+1
      ↓
Accettazione solo se il punteggio è strettamente superiore

Questa combinazione di rubriche di valutazione nascoste, test di validazione, snapshot e miglioramenti rigorosi del punteggio è progettata per rendere l'ottimizzazione più riproducibile.

Il contratto tra il framework di test e l'agente auto-evolvente

L'auto-evoluzione solleva un'evidente questione di sicurezza: cosa è consentito modificare all'agente?

PenguinHarness definisce questi confini in un file portabile chiamato CONTRACT.md.

Il contratto stabilisce che le capacità possono essere migliorate nelle aree approvate, mentre il kernel del framework di test e i suoi confini di sicurezza rimangono fissi.

GDPevo 模型评测排行榜

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/e5026929-6776-4554-9898-0bb26c98a90b-22347c95-602e-479c-97e6-268a5f43988a.png)

CONTRACT.md definisce i confini per l'evoluzione degli agenti, l'audit, il controllo di versione e l'isolamento delle credenziali.

L'articolo originale evidenzia quattro regole fondamentali.

1. L'evoluzione non può modificare il nucleo del framework di test

Le aree modificabili sono limitate allo spazio di lavoro, ai prompt, alle competenze e alle configurazioni approvate.

L'agente non può riscrivere il framework di test principale né i suoi meccanismi di sicurezza.

Ciò riduce il rischio che il processo di ottimizzazione possa indebolire:

  • L'approvazione degli strumenti
  • Il controllo dei permessi
  • I registri di audit
  • L'isolamento delle credenziali
  • Il ripristino delle versioni
  • Altri controlli di sicurezza a livello di sistema

2. Ogni ottimizzazione richiede uno snapshot

Prima di ogni ciclo di ottimizzazione, il framework memorizza uno snapshot della versione dello stato dell'agente.

Se un agente candidato ottiene risultati peggiori o causa effetti collaterali indesiderati, il sistema può tornare a una versione precedente.

Un sistema di auto-miglioramento senza capacità di rollback può accumulare danni. Il controllo di versione rende i miglioramenti reversibili.

3. L'agente target non può vedere i criteri di valutazione

L'agente target riceve i compiti ma non i criteri di valutazione nascosti.

Solo il valutatore ha accesso ai criteri di valutazione.

Questo mira a ridurre comportamenti di scorciatoia, memorizzazione delle risposte e attacchi al reward system.

Ciò non elimina completamente questi rischi, ma crea una separazione più chiara tra risoluzione dei problemi e giudizio dei risultati.

4. Ogni ottimizzazione deve essere verificabile

Le richieste del modello, le chiamate agli strumenti, l'uso dei token, i tempi, i fallimenti, le approvazioni e le modifiche di ottimizzazione vengono registrati nei file di tracciamento.

Gli utenti possono verificare cosa è cambiato e perché.

Il contratto di progetto più ampio include anche:

  • Approvazione prima dell'esecuzione degli strumenti
  • Registrazioni di audit per le decisioni di approvazione
  • Isolamento delle credenziali
  • Disaccoppiamento tra modello e agente
  • Traccia di esecuzione ripristinabile
  • Caricamento on-demand dei file pertinenti
  • Regole chiare per la gestione degli errori

Il risultato finale è un framework in cui gli agenti possono evolversi, ma il processo di evoluzione rimane visibile e reversibile.

Altre funzionalità utili di PenguinHarness

Oltre alla creazione e all'ottimizzazione automatizzata degli agenti, PenguinHarness include numerose altre capacità.

Competenze integrate per l'addestramento dei modelli

E il deployment

Il progetto include competenze integrate relative allo sviluppo di applicazioni AI, tra cui:

  • penguin-sdk
  • penguin-cli
  • agenthub-models
  • vllm
  • ollama
  • llamafactory

PenguinHarness 内置技能界面

PenguinHarness include competenze per creare agenti e lavorare con strumenti come vLLM, Ollama e LlamaFactory.

Queste competenze consentono agli utenti di descrivere attività di addestramento o deployment in linguaggio naturale, e l'agente prepara i file o i comandi necessari.

Il repository ufficiale classifica le competenze integrate in quattro categorie principali:

Gruppo di competenze Esempi
Efficienza d'ufficio Analisi dei dati e raccolta di dati web
Sviluppo software Web design e ingegneria del software
Sviluppo applicazioni AI Penguin SDK, gateway dei modelli, vLLM, Ollama e LlamaFactory
Ottimizzazione degli agenti Creazione di agenti, progettazione di benchmark, valutazione e ottimizzazione

Utenti e agenti possono inoltre creare o migliorare competenze aggiuntive.

Gateway unificato dei modelli

PenguinHarness include preset di modelli integrati e supporta interfacce personalizzate compatibili con OpenAI.

Il progetto dichiara che, tramite i provider e i gateway supportati, gli utenti possono utilizzare oltre 1000 modelli online e locali.

OpenRouter 模型列表

Il gateway dei modelli consente agli utenti di configurare diversi provider di modelli online e locali.

L'attuale repository elenca le seguenti serie di modelli:

  • DeepSeek
  • Kimi
  • GLM
  • Hunyuan
  • Qwen
  • GPT
  • Gemini
  • Claude

La disponibilità dei modelli e i nomi dei provider cambiano frequentemente, pertanto la pagina "Modelli" nell'applicazione e la documentazione ufficiale corrente devono essere considerate la fonte più aggiornata.

Agente visivo per modelli testuali

L'articolo originale descrive un modello di sviluppo in cui un modello prevalentemente testuale come DeepSeek funge da agente principale, mentre un modello con capacità visive funge da assistente visivo.

L'agente visivo può esaminare:

  • Screenshot di pagine web
  • Diapositive
  • Layout delle interfacce
  • Schermate di giochi renderizzati
  • Grafici e diagrammi
  • Errori visivi

Il modello principale può quindi correggere i propri output in base alle descrizioni visive.

DeepSeek V4 Flash 游戏截图分析

Un agente con capacità visiva può esaminare gli screenshot, mentre DeepSeek rimane il modello di lavoro principale.*

Ciò è utile quando il modello principale è particolarmente abile nella codifica o nel ragionamento ma non elabora nativamente le immagini.

Questa tecnica non conferisce direttamente capacità visive al modello principale. Crea invece un flusso di lavoro multi-modello in cui il modello visivo converte gli screenshot in informazioni utilizzabili dall'agente principale.

Analisi dettagliata delle tracce

PenguinHarness registra chiamate ai modelli, esecuzioni degli strumenti, tempi, utilizzo dei token, approvazioni e attività dei sotto-agenti.

L'interfaccia Trace mostra la sequenza di esecuzione come una timeline.

In alto si trova l'area di statistica globale, che elenca chiaramente valori come batch, chiamate agli strumenti, numero di connessioni, nonché dati fondamentali come token di input, token di output, costi, spese, tempo di esecuzione e TPS singolo. Il corpo principale dell'interfaccia mostra la timeline di esecuzione del "Round 1", che distingue per categoria i diversi blocchi temporali di pensiero del modello, chiamate agli strumenti, attesa di approvazione ed esecuzione delle chiamate agli strumenti, corrispondenti alla timeline del tempo di esecuzione; nella parte inferiore vengono inoltre mostrati i registri dettagliati dei messaggi di esecuzione, inclusi i comandi dell'utente, il processo di pensiero del sistema e i dettagli delle chiamate agli strumenti, presentando integralmente i dettagli temporali dell'esecuzione dell'agente. La vista Trace, descritta nel contesto, può essere utilizzata per visualizzare sotto-agenti paralleli, chiamate al modello, utilizzo degli strumenti e altri contenuti correlati.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/29548888-b6dd-4d98-a216-beef965d0417-f038b908-4c76-409a-af91-fe7f4f3c580a.png)

La vista Trace aiuta gli utenti a verificare sotto-agenti paralleli, chiamate al modello, utilizzo degli strumenti, latenza e costi dei token.

Ciò aiuta a identificare:

  • Chiamate al modello lente
  • Utilizzo non necessario degli strumenti
  • Cicli di ragionamento costosi
  • Tentativi falliti
  • Sotto-agenti che bloccano il flusso di lavoro
  • Ritardi di approvazione prolungati
  • Prompt ad alta densità di token
  • Opportunità di esecuzione parallela

I dati Trace sono anche il nucleo dell'auto-evoluzione, poiché l'ottimizzatore necessita di prove del motivo per cui la versione precedente ha perso punti.

Modello agente minimale senza elementi superflui

PenguinHarness può essere utilizzato anche come agente generico minimale, non solo come costruttore di automazioni.

Il progetto utilizza la Shell come interfaccia di basso livello universale e mantiene deliberatamente il set di strumenti predefinito ridotto ed essenziale.

Considera l'esecuzione di sotto-agenti come una caratteristica di performance fondamentale.

Il codice sorgente riporta che il prompt di sistema predefinito è di circa 1.300 token, mentre il valore di confronto di Claude Code nel progetto è di circa 15.000 token.

Questa cifra è auto-riportata dal progetto e potrebbe variare con l'evoluzione di entrambi i prodotti.

Il principio di progettazione sottostante è stabile: prompt più brevi e set di strumenti più ridotti possono diminuire il sovraccarico di token e rendere i modelli aperti più facili da utilizzare.

Costi e risultati dei benchmark

Il progetto ha pubblicato risultati comparativi su una suite complessa di analisi dei dati.

智能体数据分析性能对比

Il progetto riferisce di aver raggiunto una maggiore accuratezza nel suo confronto di analisi complessa dei dati, con una frazione del costo del modello.

La tabella dei dati pubblicati riporta:

Framework Modello Accuratezza Utilizzo di token Costo stimato
PenguinHarness DeepSeek V4 Pro 66,67% 18,04M $0,55
Claude Code Claude Opus 4.8 53,33% 22,20M $38,48
OpenAI Codex GPT-5.5 53,33% 13,72M $19,41

Il progetto lo riassume come:

  • 1/35 del costo riportato di

Codex

  • Circa 1/70 del costo riportato di Claude Code

Questo confronto combina gli strumenti con i modelli con cui sono tipicamente abbinati. Non separa il contributo degli strumenti da quello dei modelli selezionati e dei prezzi dei fornitori.

Per una valutazione interna equa, i team dovrebbero eseguire gli stessi compiti con le seguenti condizioni:

  • Utilizzare lo stesso modello quando possibile
  • Gli stessi prezzi del fornitore
  • La stessa strategia di retry
  • Lo stesso accesso agli strumenti
  • Gli stessi limiti di tempo
  • Gli stessi criteri di valutazione
  • Esecuzioni ripetute più volte

I dati pubblici possono servire come riferimento di benchmark per il progetto, ma non dovrebbero essere interpretati come rapporti di costo universali applicabili a tutti i compiti.

Casi di produzione segnalati

L'articolo originale afferma che il team ha utilizzato PenguinHarness in due scenari di produzione.

Revisione di referti medici

Si dice che un'agenzia di medicina preventiva abbia utilizzato PenguinHarness per creare un agente di revisione dei referti, le cui prestazioni sono state descritte come paragonabili a quelle di esperti medici.

Secondo il team del progetto, un lavoro di revisione che richiedeva circa 30 minuti può essere completato in poche decine di secondi.

Ispezione manifatturiera

Si dice che un'azienda manifatturiera abbia distribuito più agenti basati su PenguinHarness per monitorare continuamente le apparecchiature della linea di produzione e tentare il ripristino automatico.

Il team ha riportato:

  • Riduzione del 65% dei tempi di inattività
  • Produzione quasi raddoppiata rispetto al precedente

Questi sono dati di casi di studio forniti dal fornitore. Il rapporto originale non fornisce nomi dei clienti, progettazione dello studio, dimensione del campione, definizioni di base o informazioni di audit indipendenti.

Questi dovrebbero essere considerati esempi di casi d'uso segnalati, non risultati operativi garantiti.

Installazione e distribuzione

PenguinHarness supporta Linux, macOS e Windows 10 o versioni successive, con supporto per sistemi x64 e Arm64 quando disponibile.

Lo script di installazione con una sola riga include il runtime Node.js integrato. L'installazione tramite npm richiede Node.js 24 o versioni successive.

Linux o macOS

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

L'indirizzo dell'interfaccia web è:

http://127.0.0.1:7364

Windows PowerShell

irm https://penguin.ooo/install.ps1 | iex
penguin web

npm

npm install -g @prismshadow/penguin-cli
penguin web

Nell'installazione CLI, al primo accesso web si utilizza il nome utente admin. La password iniziale viene stampata al primo avvio del server e deve essere modificata immediatamente.

Configurare il modello ed eseguire attività

Il repository ufficiale fornisce esempi CLI come il seguente:

penguin config model add \
  --provider deepseek \
  --model-id deepseek-v4-flash \
  --api-key sk-... \
  --set-default

Eseguire un'attività singola:

penguin run -m "Crea hello.txt contenente Hello, Penguin"

Avviare una sessione interattiva:

penguin chat

Avviare un server headless:

penguin server

Le chiavi API non devono mai essere committate in sistemi di controllo versione, né incollate in log pubblici.

PenguinHarness può essere eseguito su una macchina locale o su un server. La sua interfaccia browser supporta più sessioni, gestione di agenti e skill, configurazione dei modelli, statistiche di utilizzo, osservabilità Trace e flussi di lavoro di valutazione.

Il progetto attualmente segnala che alcune

build desktop non sono firmate e al primo avvio potrebbero attivare avvisi del sistema operativo. Gli utenti dovrebbero scaricare solo dal sito ufficiale o dal

Scarica il programma di installazione dalle Release di GitHub e verifica la descrizione del progetto prima di ignorare gli avvisi.

Il team dietro PenguinHarness

PenguinHarness è un progetto open source di PrismShadow, un team fondato nel 2025 con l'obiettivo di costruire infrastrutture per agenti intelligenti in grado di apprendere da conoscenze aziendali, flussi di lavoro e feedback.

Il rapporto originale elenca il team fondatore come segue:

Membro del team Background
Yaowei Zheng Creatore di LlamaFactory; focalizzato su modelli accessibili e infrastruttura per agenti
Buyue Qian Dottorato presso UC Davis; ex ricercatore IBM T. J. Watson, ex professore alla Fudan University
Xuejun Wu Ex membro fondatore di Baidu NLP; ha ricoperto ruoli senior presso Alibaba e JD Digits
Junhao Hu Dottorando presso la Peking University; coinvolto nella ricerca su modelli ed efficienza della cache
Xi Chen Professore alla NYU Stern School of Business; Dottorato presso Carnegie Mellon, ex scienziato capo di Amazon

I profili personali nelle fonti sono forniti dall'editore e dal team di progetto. Quando queste informazioni hanno un impatto sostanziale sull'occupazione o sulla verifica accademica, i lettori dovrebbero verificarle utilizzando le pagine ufficiali delle istituzioni.

Da LlamaFactory a PenguinHarness, l'obiettivo dichiarato del team è rimasto invariato: trasformare infrastrutture complesse di intelligenza artificiale in strumenti più facili da usare, più affidabili e più efficienti, al servizio di una base di utenti più ampia.

Domande frequenti

Cos'è PenguinHarness?

PenguinHarness è un framework open source per agenti che consente di costruire, eseguire, valutare e ottimizzare agenti AI. Offre interfaccia web, CLI, SDK, competenze integrate, configurazione dei modelli, tracciamento e flussi di lavoro di valutazione multi-agente.

PenguinHarness è gratuito e open source?

Sì. Il codice principale è rilasciato sotto licenza Apache 2.0. Gli utenti sono comunque responsabili dei costi di API dei modelli, infrastruttura o servizi di terze parti generati dai loro carichi di lavoro.

PenguinHarness può essere eseguito localmente?

Sì. Funziona su Linux, macOS e Windows, sia come applicazione desktop che tramite CLI e interfaccia browser. Può anche essere installato su un server per l'uso remoto.

PenguinHarness supporta modelli locali?

Sì. Include competenze e integrazioni relative a strumenti come Ollama e vLLM e supporta endpoint personalizzati compatibili con OpenAI. La compatibilità effettiva dipende dal comportamento API del modello e dalle capacità richieste.

Cosa significa auto-evoluzione in PenguinHarness?

Auto-evoluzione significa che il sistema valuta gli agenti, analizza punteggi e registri di tracciamento, modifica prompt, competenze o configurazioni approvati, e testa le versioni candidate successive. Una versione candidata viene accettata solo se ottiene risultati migliori sotto la valutazione configurata.

Un agente auto-evolvente può modificare il kernel di PenguinHarness?

Il contratto di progetto stabilisce di no. L'evoluzione è limitata a spazi di lavoro, prompt, competenze e configurazioni approvate, mentre il kernel del framework e i meccanismi di sicurezza rimangono invariati.

Il costo di costruzione dell'agente di ¥0.2 è garantito?

No. La cifra di ¥0.2 proviene da una dimostrazione del progetto che ha generato un'applicazione RAG utilizzando DeepSeek V4 Pro. Il costo effettivo dipende dai prezzi del modello, dall'utilizzo dei token, dal numero di tentativi, dal fornitore e dalla complessità dell'attività.

Cos'è GDPevo?

GDPevo è un benchmark aperto che misura la capacità di auto-evoluzione degli agenti su attività commerciali reali trattenute. La sua versione pubblica V2 contiene 240 attività in 24 categorie e distingue tra attività di addestramento e attività di test.

Strumenti correlati

  • PenguinHarness: sito ufficiale con download, documentazione, esempi di prodotti e istruzioni di installazione.
  • Repository GitHub di PenguinHarness: codice sorgente Apache 2.0, README, release, esempi da riga di comando e guida ai contributi.
  • GDPevo: dati di benchmark, pipeline di costruzione, workspace di valutazione e risultati sperimentali pubblicati.
  • LlamaFactory: framework open source di Yaowei Zheng per la messa a punto efficiente di modelli linguistici e modelli visione-linguaggio.
  • vLLM: motore open source per inferenza di modelli ad alta produttività in locale e lato server.
  • Ollama: runtime per modelli locali, utilizzabile nei flussi di lavoro di sviluppo di agenti.
  • OpenRouter: gateway API unificato per l'accesso a più fornitori di modelli ospitati.

Link correlati

Riepilogo

PenguinHarness è una piattaforma open source che consente agli agenti di costruire un'altra applicazione agente in base a requisiti espressi in linguaggio naturale. Può generare scaffolding, prompt, competenze, configurazioni, codice, frontend e istruzioni di esecuzione, supportando al contempo sia modelli ospitati che modelli locali.

L'attenzione a lungo termine è sull'auto-evoluzione. Più agenti di valutazione valutano l'agente target, un ottimizzatore analizza i risultati e le tracce di esecuzione, e una versione candidata viene accettata solo se ottiene punteggi più alti. Il file CONTRACT.md limita ciò che può essere modificato e richiede snapshot, rollback, criteri di valutazione nascosti, approvazioni, isolamento delle credenziali e registri di audit.

Il progetto riporta riduzioni significative dei costi e primi benefici produttivi, ma questi dati sono dimostrazioni e casi di studio forniti dal team, non conclusioni universalmente applicabili.

Garanzia. Il repository Apache 2.0, i comandi pubblicati e il benchmark GDPevo offrono ai sviluppatori materiale sufficiente per testare il metodo sui propri carichi di lavoro.

L'idea centrale di PenguinHarness è semplice: costruire agenti dovrebbe poter essere automatizzato, ma migliorarli in modo sicuro richiede valutazioni misurabili, confini rigorosi e modifiche reversibili.