PenguinHarness construye y mejora agentes de IA por solo 0,2 yuanes

LlamaFactory hace que el ajuste fino de grandes modelos sea más accesible para una gama más amplia de desarrolladores. Ahora, sus creadores, Zheng Yaowei y el equipo de PrismShadow, están aplicando la misma filosofía de facilidad de uso a...

发布于 2026年8月6日generalGEO 评分: 02 次阅读
PenguinHarness construye y mejora agentes de IA por solo 0,2 yuanes

PenguinHarness permite construir y mejorar agentes de IA por solo 0.2 yuanes

Introducción

LlamaFactory ha hecho que el ajuste de modelos a gran escala sea más accesible para una comunidad más amplia de desarrolladores. Ahora, su creador Yaowei Zheng y el equipo de PrismShadow están aplicando el mismo enfoque de "facilidad de uso primero" a los agentes de IA.

Su nuevo proyecto de código abierto, PenguinHarness, tiene como objetivo automatizar las tres fases del ciclo de vida de un agente:

  1. Construir la aplicación del agente
  2. Evaluar su rendimiento
  3. Mejorar continuamente sus indicaciones, habilidades y configuración

Los usuarios no necesitan seleccionar manualmente un marco de trabajo, conectar herramientas, escribir indicaciones, construir una interfaz y probar los resultados repetidamente. Solo deben describir sus necesidades y dejar que PenguinHarness ensamble una aplicación de agente funcional.

PenguinHarness 平台宣传图

PenguinHarness es una herramienta de construcción de agentes automatizada, de código abierto, diseñada para implementación en escritorio y servidor.

El proyecto es ligero, se distribuye bajo licencia Apache 2.0 y es compatible con Linux, macOS y Windows. Puede ejecutarse localmente o utilizarse en un servidor remoto a través de una interfaz de navegador.

PenguinHarness también admite modelos en línea y locales mediante ajustes predefinidos integrados y una interfaz compatible con OpenAI. El repositorio oficial actualmente lista los modelos más recientes de proveedores como DeepSeek, Kimi, GLM, Qwen, OpenAI, Google y Anthropic.

El informe original describe una aplicación RAG generada por solo 0.2 yuanes en costos de tokens de modelo. La página oficial del proyecto muestra el mismo ejemplo por aproximadamente 0.02 USD (usando DeepSeek V4 Pro).

Esta cifra es un dato de demostración del proyecto, no un precio fijo garantizado. El costo real depende del modelo seleccionado, el proveedor, la complejidad de las indicaciones, el número de reintentos, el alcance de la aplicación y el precio de los tokens.

Dejar que un agente construya otro agente

PenguinHarness parte de una idea simple: los agentes deberían poder construir otra aplicación de agente basándose en requisitos expresados en lenguaje natural.

Esto se alinea con el debate más amplio sobre "IA al servicio de la IA" y la auto-mejora recursiva: sistemas de IA que ayudan a crear, probar o mejorar otros sistemas de IA.

El primer caso de uso presentado en el artículo original requería que el sistema construyera una aplicación RAG con las siguientes características:

  • Recuperación de información por fragmentos
  • Salida de respuestas claras en streaming
  • Inclusión de fuentes citadas
  • Interfaz de usuario funcional
  • Capacidad de ejecutarse como una aplicación completa

Las pruebas comparativas colocaron a PenguinHarness junto a un agente de codificación, pidiendo a ambos sistemas que completaran tareas similares.

Según la demostración del proyecto, PenguinHarness completó la aplicación más rápido y con un menor costo de tokens. Sus resultados incluían respuestas fluidas, salida en streaming y fuentes enlazadas.

La salida del competidor mostrada en el informe presentaba problemas de mezcla de idiomas y no tenía el mismo comportamiento de streaming.

Estos ejemplos son demostraciones útiles, pero no prueban de manera general que PenguinHarness supere a cada agente de codificación en todos los escenarios,

repositorio. Los resultados dependen en gran medida del modelo, la configuración del agente, el diseño de la tarea y el método de evaluación.

De los requisitos a una aplicación funcional

El desarrollo tradicional de agentes suele implicar múltiples fases manuales:

  1. Seleccionar el marco de trabajo del agente.
  2. Elegir y configurar el modelo.
  3. Conectar herramientas y servicios externos.
  4. Escribir las indicaciones del sistema.
  5. Definir la memoria y la lógica del flujo de trabajo.
  6. Construir casos de evaluación.
  7. Probar y modificar el agente.
  8. Crear la interfaz de usuario o de entrega.
  9. Empaquetar la aplicación para su implementación.

PenguinHarness intenta transformar estos pasos en un único flujo de trabajo impulsado por agentes.

Cuando los requisitos son claros, el sistema puede generar:

  • El andamiaje de la aplicación
  • Las indicaciones del agente
  • Las definiciones de habilidades y herramientas
  • Los archivos de configuración
  • El código auxiliar
  • La interfaz de usuario
  • Las instrucciones de instalación
  • Las instrucciones de ejecución
  • Correcciones y optimizaciones iterativas

El ejemplo oficial del proyecto utilizó la siguiente solicitud:

Recopila la documentación de https://github.com/ericbuess/claude-code-docs y construye una aplicación RAG que responda preguntas sobre Claude Code como un experto en configuración, citando sus fuentes.

El informe del proyecto indica que, al construirse con DeepSeek V4 Pro, la aplicación RAG generada consumió aproximadamente $0.02 (es decir, ¥0.2) en tokens de modelo.

El sistema de archivos como fuente de verdad

PenguinHarness utiliza archivos como la principal capa de colaboración entre humanos y agentes.

En este diseño:

  • Los agentes están representados por archivos.
  • Las indicaciones son archivos.
  • Las habilidades son archivos.
  • La configuración se almacena en archivos.
  • Las conversaciones y la información de ejecución pueden rastrearse mediante registros almacenados.
  • Se pueden crear nuevos agentes ensamblando o copiando la estructura de archivos necesaria.

Este enfoque facilita la inspección y modificación de los agentes.

En lugar de ocultar comportamientos importantes dentro de un gran marco de aplicación, PenguinHarness utiliza archivos editables como interfaz principal. Los humanos pueden leer y modificar estos archivos, mientras que los agentes pueden mejorarlos mediante procesos de optimización aprobados.

La herramienta se encarga de ensamblar esos archivos en un objeto de agente funcional.

PenguinMessage ofrece un protocolo unificado

En tiempo de ejecución, PenguinMessage actúa como un formato de mensaje universal que conecta modelos, entornos, herramientas y usuarios.

El artículo original lo compara con un paquete de red: diferentes componentes pueden intercambiar información a través de la misma interfaz ligera, sin necesidad de integraciones exclusivas para cada modelo o entorno.

Por lo tanto, PenguinHarness es a la vez:

  • Un marco para ejecutar agentes
  • Un agente capaz de comprender y extender su propia estructura

PenguinHarness 项目架构图

PenguinHarness combina PenguinMessage, Penguin SDK y Penguin Skills en una arquitectura ligera.

Los tres dominios principales mostrados en la arquitectura del proyecto son:

Componente Rol
PenguinMessage Protocolo mínimo de mensajes entre usuarios, modelos, herramientas y entornos
Penguin SDK Capa de desarrollo para la construcción de aplicaciones de agentes
Penguin Skills Capacidades reutilizables para construir, evaluar y optimizar agentes

Ciclo de auto-evolución reproducible localmente

Construir el agente es solo el primer paso.

El objetivo a largo plazo de PenguinHarness es permitir que los usuarios operen agentes que puedan evaluarse y optimizarse localmente, sin necesidad de reconstruir manualmente todo el sistema.

El proyecto distingue dos fases:

  • Construir el agente: de cero a uno
  • Optimizar el agente: de uno a cien

Modificar un agente es relativamente fácil, ya que los prompts, el código, las habilidades y la configuración pueden editarse. Pero determinar si un cambio realmente mejora al agente es mucho más difícil.

Los modelos de lenguaje grandes son probabilísticos, y los sistemas de agentes introducen más incertidumbre a través de herramientas, entornos, memoria y decisiones de múltiples pasos.

Por lo tanto, un ciclo de mejora confiable requiere un sistema de medición confiable.

Por qué la evaluación es fundamental

Un agente puede desempeñarse mejor en un ejemplo individual, pero empeorar en general.

Sin benchmarks estructurados, el optimizador puede:

  • Sobreajustarse a unos pocos ejemplos de demostración
  • Memorizar respuestas
  • Explotar las debilidades del evaluador
  • Aumentar costos sin mejorar la calidad
  • Mejorar una tarea mientras perjudica otra
  • Obtener puntuaciones más altas mediante trucos de recompensa

El equipo de PrismShadow dedicó más de seis meses a explorar cómo evaluar agentes auto-evolutivos.

El desafío central radica en la falta de benchmarks que distingan claramente entre experiencia de entrenamiento y pruebas reservadas.

Si el agente mejora en los mismos problemas utilizados para la evaluación, es difícil saber si aprendió una estrategia reutilizable o simplemente memorizó las respuestas.

GDPevo distingue tareas de entrenamiento y tareas de prueba

El equipo creó GDPevo, un benchmark de evolución nativa basado en procesos empresariales reales.

El artículo fuente describe su cobertura en áreas como salud, finanzas y trabajo legal. El repositorio V2 actualmente público contiene 240 tareas en 24 grupos de tareas, que abarcan dominios como:

  • CRM
  • ERP
  • Finanzas
  • Salud
  • Flujos de trabajo legales
  • Análisis de datos
  • Operaciones de ingeniería

Cada grupo de tareas incluye:

  • Un entorno empresarial compartido
  • Cinco tareas de entrenamiento
  • Cinco tareas de prueba reservadas

GDPevo utiliza un método llamado mezcla de reglas. Los procesos empresariales se descomponen en reglas más pequeñas, distribuidas en las tareas de entrenamiento y recombinadas en las tareas de prueba reservadas.

Esta estructura ayuda a determinar si el agente aprendió flujos de trabajo reutilizables, en lugar de simplemente haber visto las respuestas de prueba con anticipación.

GDPevo 模型评测排行榜

GDPevo evalúa cuánto mejoran los agentes en tareas empresariales reservadas después de diferentes formas de evolución.

Informe del artículo de GDPevo

La auto-evolución mejoró la precisión reservada hasta en 16.44 puntos porcentuales en sus experimentos. También señala que el mejor agente evolucionado sigue muy por debajo del límite superior ideal de 91.6% bajo información completa.

Esta brecha es crucial. Los agentes actuales pueden mejorar, pero la auto-evolución confiable está lejos de resolverse.

PenguinHarness empaqueta la evaluación como habilidades

PenguinHarness convierte las ideas centrales detrás de GDPevo en habilidades reutilizables para:

  • Creación de agentes
  • Diseño de benchmarks
  • Evaluación de agentes
  • Optimización de agentes

Después de invocar las habilidades relevantes, múltiples agentes pueden colaborar en el proceso de mejora.

El artículo fuente proporciona un ejemplo de agente diseñado para tareas como predicción deportiva, generación de estrategias de inversión o soporte de comercio electrónico.

El usuario no necesita modificar manualmente prompts y flujos de trabajo; simplemente deja que PenguinHarness cree conjuntos de evaluación, ejecute pruebas repetidas, analice causas de fallos y proponga versiones mejoradas.

El informe de demostración del proyecto muestra que después de múltiples iteraciones, la puntuación mejoró de 53 a 95 puntos, con un costo de tokens de aproximadamente 0.5 RMB usando el modelo DeepSeek V4 Flash.

Este es un resultado de demostración del equipo del proyecto, no una garantía general de benchmark. Los resultados reales variarán según la tarea, los criterios de puntuación, el modelo, el tamaño de muestra y el presupuesto de optimización.

Proceso de optimización en cuatro pasos

El flujo de trabajo de auto-evolución utiliza múltiples agentes con roles diferenciados.

1. Organizar la evaluación

El agente optimizador determina el número de preguntas y repeticiones necesarias, y luego lanza múltiples agentes evaluadores en paralelo.

La evaluación paralela ayuda a reducir el tiempo necesario para probar múltiples tareas o ejecuciones repetidas.

2. Puntuación independiente

Cada agente evaluador inicia una copia independiente del agente objetivo y le pide que resuelva una tarea.

El agente evaluador tiene acceso a los criterios de puntuación, mientras que el agente objetivo no.

Este aislamiento está diseñado para evitar que el agente objetivo optimice directamente contra las instrucciones de puntuación ocultas.

3. Análisis y mejora

El agente optimizador recopila los resultados y examina las trayectorias de ejecución.

Identifica las causas de la pérdida de puntos y luego modifica las partes aprobadas del agente objetivo, como:

  • Prompts
  • Habilidades
  • Configuración
  • Archivos de flujo de trabajo

El agente optimizador genera una versión candidata siguiente.

4. Validación e iteración

Los agentes evaluadores prueban nuevamente la versión candidata.

Solo si el candidato obtiene una puntuación estrictamente mayor, el agente optimizador lo acepta. Si la puntuación es igual o inferior, el marco revierte a la versión anterior.

PenguinHarness 自进化工作流

El agente optimizador coordina agentes evaluadores paralelos y solo acepta agentes candidatos con puntuación más alta.

El proceso se puede resumir como:

Agente objetivo vN
      ↓
Agentes evaluadores paralelos
      ↓
Puntuaciones, criterios y trayectorias de ejecución
      ↓
Agente optimizador
      ↓
Actualización de prompts, habilidades o configuración
      ↓
Agente candidato vN+1
      ↓
Solo se acepta si la puntuación es estrictamente mayor

Esta combinación de criterios de puntuación ocultos, pruebas reservadas, instantáneas y mejora estricta de puntuación está diseñada para hacer que la optimización sea más reproducible.

El contrato entre el marco de pruebas y el agente auto-evolutivo

La auto-evolución plantea un problema de seguridad evidente: ¿qué se le permite cambiar al agente?

PenguinHarness define estos límites en un archivo portable llamado CONTRACT.md.

El contrato establece que las capacidades pueden mejorarse en áreas aprobadas, mientras que el núcleo del marco de pruebas y sus límites de seguridad permanecen fijos.

GDPevo 模型评测排行榜

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/e5026929-6776-4554-9898-0bb26c98a90b-22347c95-602e-479c-97e6-268a5f43988a.png)

CONTRACT.md define los límites para la evolución de agentes, auditoría, control de versiones y aislamiento de credenciales.

El artículo original destaca cuatro reglas fundamentales.

1. La evolución no puede modificar el núcleo del marco de pruebas

Las áreas editables se limitan al espacio de trabajo, indicaciones, habilidades y configuraciones aprobadas.

El agente no puede reescribir el marco de pruebas principal ni sus mecanismos de seguridad.

Esto reduce el riesgo de que el proceso de optimización debilite los siguientes aspectos:

  • Aprobación de herramientas
  • Control de permisos
  • Registros de auditoría
  • Aislamiento de credenciales
  • Restauración de versiones
  • Otras comprobaciones de seguridad a nivel de sistema

2. Cada optimización requiere una instantánea

Antes de cada ronda de optimización, el marco almacena una instantánea de la versión del estado del agente.

Si el agente candidato tiene peor rendimiento o causa efectos secundarios no deseados, el sistema puede revertir a una versión anterior.

Un sistema de auto-mejora sin capacidad de reversión puede acumular daños. El control de versiones hace que las mejoras sean reversibles.

3. El agente objetivo no puede ver los criterios de evaluación

El agente objetivo recibe tareas, pero no los criterios de evaluación ocultos.

Solo el evaluador tiene acceso a los criterios de puntuación.

Esto tiene como objetivo reducir el comportamiento de atajos, la memorización de respuestas y los ataques de recompensa.

Esto no elimina por completo estos riesgos, pero crea una separación más clara entre la resolución de problemas y la evaluación de resultados.

4. Cada optimización debe ser auditable

Las solicitudes de modelo, llamadas a herramientas, uso de tokens, tiempos, fallos, aprobaciones y cambios de optimización se registran en archivos de seguimiento.

El usuario puede revisar qué cambió y por qué.

El contrato del proyecto más amplio también incluye:

  • Aprobación antes de la ejecución de herramientas
  • Registro de auditoría de decisiones de aprobación
  • Aislamiento de credenciales
  • Desacoplamiento entre modelo y agente
  • Trazabilidad de ejecución recuperable
  • Carga bajo demanda de archivos relevantes
  • Reglas claras de manejo de errores

El resultado final es un marco en el que los agentes pueden evolucionar, pero el proceso de evolución permanece visible y reversible.

Otras funciones útiles de PenguinHarness

Además de la creación y optimización automatizada de agentes, PenguinHarness incluye múltiples capacidades.

Habilidades integradas para el entrenamiento de modelos

e implementación

El proyecto incluye habilidades integradas relacionadas con el desarrollo de aplicaciones de IA, que incluyen:

  • penguin-sdk
  • penguin-cli
  • agenthub-models
  • vllm
  • ollama
  • llamafactory

PenguinHarness 内置技能界面

PenguinHarness incluye habilidades para construir agentes y trabajar con herramientas como vLLM, Ollama y LlamaFactory.

Estas habilidades permiten a los usuarios describir tareas de entrenamiento o implementación en lenguaje natural, y el agente prepara los archivos o comandos necesarios.

El repositorio oficial clasifica las habilidades integradas en cuatro categorías principales:

Grupo de habilidades Ejemplos
Productividad de oficina Análisis de datos y recopilación de datos web
Desarrollo de software Diseño web e ingeniería de software
Desarrollo de aplicaciones de IA Penguin SDK, puerta de enlace de modelos, vLLM, Ollama y LlamaFactory
Optimización de agentes Creación de agentes, diseño de benchmarks, evaluación y optimización

Los usuarios y los agentes también pueden crear o mejorar habilidades adicionales.

Puerta de enlace unificada de modelos

PenguinHarness incluye ajustes preestablecidos de modelos y admite interfaces personalizadas compatibles con OpenAI.

El proyecto indica que, a través de los proveedores y puertas de enlace compatibles, los usuarios pueden acceder a más de 1000 modelos en línea y locales.

OpenRouter 模型列表

La puerta de enlace de modelos permite a los usuarios configurar diferentes proveedores de modelos en línea y locales.

El repositorio actual enumera las siguientes series de modelos:

  • DeepSeek
  • Kimi
  • GLM
  • Hunyuan
  • Qwen
  • GPT
  • Gemini
  • Claude

La disponibilidad de los modelos y los nombres de los proveedores cambian con frecuencia, por lo que la página de "Modelos" dentro de la aplicación y la documentación oficial actual deben considerarse como la fuente de información más reciente.

Agente visual para modelos de texto

El artículo original describe un patrón de desarrollo en el que un modelo principalmente textual, como DeepSeek, actúa como agente principal, mientras que un modelo con capacidades visuales actúa como asistente visual.

El agente visual puede examinar:

  • Capturas de pantalla de páginas web
  • Diapositivas
  • Diseños de interfaz
  • Imágenes de juegos renderizadas
  • Gráficos
  • Errores visuales

El modelo principal puede entonces corregir su salida según las descripciones visuales.

DeepSeek V4 Flash 游戏截图分析

Un agente con capacidad visual

puede examinar capturas de pantalla, mientras que DeepSeek sigue siendo el modelo de trabajo principal.*

Esto resulta útil cuando el modelo principal es bueno en codificación o razonamiento, pero no procesa imágenes de forma nativa.

Esta técnica no otorga al modelo principal capacidades visuales directas. Crea un flujo de trabajo multimodelo en el que el modelo visual convierte las capturas de pantalla en información utilizable por el agente principal.

Análisis de seguimiento detallado

PenguinHarness registra llamadas de modelo, ejecuciones de herramientas, tiempos, uso de tokens, aprobaciones y actividad de subagentes.

La interfaz Trace muestra la secuencia de ejecución en una línea de tiempo.

智能体数据分析性能对比

El proyecto informa que, en su comparación de análisis de datos complejos, logró una mayor precisión con una fracción del costo del modelo.

La tabla de datos publicada reporta:

Framework Modelo Precisión Uso de tokens Costo estimado
PenguinHarness DeepSeek V4 Pro 66.67% 18.04M $0.55
Claude Code Claude Opus 4.8 53.33% 22.20M $38.48
OpenAI Codex GPT-5.5 53.33% 13.72M $19.41

El proyecto lo resume como:

  • 1/35 del valor reportado del costo de Codex
  • Aproximadamente 1/70 del costo reportado de Claude Code

Esta comparación combina cada cadena de herramientas con el modelo con el que normalmente se utiliza. No separa la contribución de la cadena de herramientas de la contribución del modelo elegido y los precios del proveedor.

Para una evaluación interna justa, los equipos deben ejecutar las mismas tareas con las siguientes condiciones:

  • Utilizar el mismo modelo siempre que sea posible
  • Los mismos precios de proveedor
  • Las mismas estrategias de reintento
  • El mismo acceso a herramientas
  • Los mismos límites de tiempo
  • Los mismos criterios de evaluación
  • Múltiples ejecuciones repetidas

Los datos públicos pueden servir como referencia de referencia del proyecto, pero no deben interpretarse como una relación de costos universal aplicable a todas las tareas.

Casos de implementación en producción reportados

El artículo fuente afirma que el equipo ha utilizado PenguinHarness en dos escenarios de producción.

Revisión de informes médicos

Según se informa, una institución de exámenes físicos utilizó PenguinHarness para crear un agente de revisión de informes, cuyo desempeño se describe como comparable al de expertos médicos.

Según el equipo del proyecto, el trabajo de revisión que antes tomaba aproximadamente 30 minutos ahora puede completarse en decenas de segundos.

Inspección en manufactura

Según se informa, una empresa manufacturera implementó múltiples agentes construidos con PenguinHarness para monitorear continuamente los equipos de la línea de producción e intentar recuperaciones automáticas.

El equipo reportó:

  • Reducción del tiempo de inactividad en un 65%
  • Producción casi duplicada

Estos son datos de casos de estudio proporcionados por el proveedor. El informe original no incluye nombres de clientes, diseño de investigación, tamaño de muestra, definiciones de línea base ni información de auditoría independiente.

Estos deben considerarse ejemplos de casos de uso reportados, no resultados operativos garantizados.

Instalación e implementación

PenguinHarness es compatible con Linux, macOS y Windows 10 o superior, y admite sistemas x64 y Arm64 cuando están disponibles.

El script de instalación de una línea incluye su propio runtime de Node.js. La instalación mediante npm requiere Node.js 24 o superior.

Linux o macOS

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

La interfaz web se abre en:

http://127.0.0.1:7364

Windows PowerShell

irm https://penguin.ooo/install.ps1 | iex
penguin web

npm

npm install -g @prismshadow/penguin-cli
penguin web

En la instalación mediante CLI, el primer inicio de sesión web utiliza el nombre de usuario admin. La contraseña inicial se imprime en el primer arranque del servidor y debe cambiarse de inmediato.

Configurar modelos y ejecutar tareas

El repositorio oficial proporciona ejemplos de CLI como el siguiente:

penguin config model add \
  --provider deepseek \
  --model-id deepseek-v4-flash \
  --api-key sk-... \
  --set-default

Ejecutar una tarea única:

penguin run -m "crea hello.txt que contenga Hello, Penguin"

Iniciar una sesión interactiva:

penguin chat

Iniciar un servidor sin interfaz gráfica:

penguin server

Las claves API nunca deben enviarse al sistema de control de versiones ni pegarse en registros públicos.

PenguinHarness puede ejecutarse en una máquina local o en un servidor. Su interfaz de navegador admite múltiples sesiones, gestión de agentes y habilidades, configuración de modelos, estadísticas de uso, observabilidad de trazas y flujos de trabajo de evaluación.

El proyecto actualmente señala que algunas

versiones de escritorio no están firmadas y pueden activar advertencias del sistema operativo en el primer inicio. Los usuarios deben descargar únicamente desde el sitio web oficial o desde el

Descargue el instalador desde los lanzamientos de GitHub y verifique la descripción del proyecto antes de omitir las advertencias.

El equipo detrás de PenguinHarness

PenguinHarness es un proyecto de código abierto creado por PrismShadow, un equipo fundado en 2025 dedicado a construir infraestructura de agentes que pueda aprender del conocimiento empresarial, los flujos de trabajo y la retroalimentación.

El equipo fundador indicado en el informe original es el siguiente:

Miembro del equipo Antecedentes
Zheng Yaowei Creador de LlamaFactory; enfocado en infraestructura accesible de modelos y agentes
Qian Buyue Doctorado por la Universidad de California, Davis; ex investigador de IBM T. J. Watson y ex profesor de la Universidad de Fudan
Wu Xuejun Miembro fundador original de NLP en Baidu; ocupó cargos directivos en Alibaba y JD Digits
Hu Junhao Estudiante de doctorado en la Universidad de Pekín; investiga eficiencia de modelos y caché
Chen Xi Profesor en la Escuela de Negocios de la Universidad de Nueva York; doctorado por la Universidad Carnegie Mellon y ex científico principal de Amazon

Las biografías en las fuentes son proporcionadas por el editor y el equipo del proyecto. Cuando esta información tenga un impacto sustancial en la verificación laboral o académica, los lectores deben contrastarla con las páginas oficiales de las instituciones.

Desde LlamaFactory hasta PenguinHarness, el objetivo declarado del equipo ha sido constante: transformar la infraestructura compleja de inteligencia artificial en herramientas más fáciles de usar, confiables y eficientes para una base de usuarios más amplia.

Preguntas frecuentes

¿Qué es PenguinHarness?

PenguinHarness es un framework de agentes de código abierto que permite construir, ejecutar, evaluar y optimizar agentes de IA. Ofrece interfaz web, CLI, SDK, habilidades integradas, configuración de modelos, trazabilidad y flujos de trabajo de evaluación multiagente.

¿PenguinHarness es gratuito y de código abierto?

Sí. El código base principal se publica bajo la licencia Apache 2.0. Los usuarios siguen siendo responsables de los costos de API de modelos, infraestructura o servicios de terceros que generen sus cargas de trabajo.

¿Puede PenguinHarness ejecutarse localmente?

Sí. Funciona en Linux, macOS y Windows, tanto como aplicación de escritorio como mediante CLI e interfaz de navegador. También puede instalarse en servidores para uso remoto.

¿PenguinHarness admite modelos locales?

Sí. Incluye habilidades e integraciones relacionadas con herramientas como Ollama y vLLM, y admite endpoints personalizados compatibles con OpenAI. La compatibilidad real depende del comportamiento de la API del modelo y de las capacidades requeridas.

¿Qué significa auto-evolución en PenguinHarness?

La auto-evolución significa que el sistema evalúa agentes, analiza puntuaciones y registros de trazabilidad, modifica indicaciones, habilidades o configuraciones aprobadas, y prueba una versión candidata. La versión candidata solo se acepta si obtiene un mejor rendimiento según las evaluaciones configuradas.

¿Puede un agente auto-evolutivo modificar el núcleo de PenguinHarness?

El contrato del proyecto establece que no. La evolución se limita al espacio de trabajo, las indicaciones, las habilidades y las configuraciones aprobadas; el núcleo del framework y los mecanismos de seguridad permanecen intactos.

¿Está garantizado el costo de construcción de agentes de ¥0.2?

No. La cifra de ¥0.2 proviene de una demostración del proyecto que generó una aplicación RAG con DeepSeek V4 Pro. El costo real depende de los precios del modelo, el uso de tokens, los reintentos, el proveedor y la complejidad de la tarea.

¿Qué es GDPevo?

GDPevo es un benchmark abierto que mide la capacidad de auto-evolución de agentes en tareas empresariales reales reservadas. Su versión pública V2 incluye 240 tareas en 24 categorías y distingue entre tareas de entrenamiento y de prueba.

Herramientas relacionadas

  • PenguinHarness: sitio web oficial con descargas, documentación, ejemplos de productos e instrucciones de instalación.
  • Repositorio de PenguinHarness en GitHub: código fuente bajo Apache 2.0, README, lanzamientos, ejemplos de línea de comandos y guía de contribución.
  • GDPevo: datos del benchmark, procesos de construcción, espacios de trabajo de evaluación y resultados experimentales publicados.
  • LlamaFactory: framework de código abierto de Yaowei Zheng para ajuste eficiente de modelos de lenguaje y modelos de lenguaje visual.
  • vLLM: motor de código abierto para inferencia de modelos de alto rendimiento en local y en servidor.
  • Ollama: runtime de modelos locales útil para flujos de trabajo de desarrollo de agentes.
  • OpenRouter: puerta de enlace API unificada para acceder a múltiples proveedores de modelos alojados.

Enlaces relacionados

Resumen

PenguinHarness es una plataforma de código abierto que permite a los agentes construir otra aplicación de agente según necesidades expresadas en lenguaje natural. Puede generar andamiaje, indicaciones, habilidades, configuraciones, código, interfaz de usuario e instrucciones de ejecución, además de admitir modelos alojados y locales.

Su enfoque a largo plazo es la auto-evolución. Varios agentes evaluadores puntúan al agente objetivo, un optimizador analiza los resultados y las trayectorias de ejecución, y solo se acepta una versión candidata cuando obtiene puntuaciones más altas. El archivo CONTRACT.md limita lo que puede modificarse y exige instantáneas, reversión, criterios de puntuación ocultos, aprobaciones, aislamiento de credenciales y registros de auditoría.

El proyecto reporta reducciones significativas de costos y beneficios tempranos en producción, pero estas cifras son demostraciones y estudios de caso proporcionados por el equipo, no conclusiones universalmente aplicables.

Garantía. El repositorio Apache 2.0, los comandos publicados y el benchmark GDPevo ofrecen a los desarrolladores material suficiente para probar este enfoque en sus propias cargas de trabajo.

La idea central de PenguinHarness es directa: construir agentes debería poder automatizarse, pero mejorarlos de forma segura requiere evaluación medible, límites estrictos y cambios reversibles.

PenguinHarness 以仅 0.2 元构建并自我改进 AI 代理