PenguinHarness 以仅 0.2 元构建并自我改进 AI 代理

PenguinHarness 是 PrismShadow 团队推出的开源智能体构建工具,可自动完成智能体应用的构建、评估与持续改进。文中约 0.2 元的 RAG 示例是演示成本,不是固定价格保证。

发布于 2026年8月6日generalGEO 评分: 010 次阅读
PenguinHarness 以仅 0.2 元构建并自我改进 AI 代理

PenguinHarness 仅需 0.2 元即可构建并自我改进 AI 智能体

简介

LlamaFactory 让大规模模型微调对更广泛的开发者群体变得更加容易。如今,其创建者郑耀威和 PrismShadow 团队正在将同样的“易用性优先”方法应用于 AI 智能体。

他们的全新开源项目 PenguinHarness 旨在自动化智能体生命周期的三个环节:

  1. 构建智能体应用
  2. 评估其性能
  3. 持续改进其提示词、技能和配置

用户无需手动选择框架、连接工具、编写提示词、构建界面并反复测试结果,只需描述需求,即可让 PenguinHarness 组装出一个可运行的智能体应用。

PenguinHarness 平台宣传图

PenguinHarness 是一款面向桌面和服务端部署的开源自动化智能体构建工具。

该项目轻量级、以 Apache 2.0 协议开源,支持 Linux、macOS 和 Windows 系统。它可以在本地运行,也可以通过浏览器界面在远程服务器上使用。

PenguinHarness 还通过内置预设和兼容 OpenAI 的接口支持在线及本地模型。官方仓库目前列出了来自 DeepSeek、Kimi、GLM、Qwen、OpenAI、Google、Anthropic 等提供商的最新模型。

原始报告描述了一个仅花费 0.2 元模型 Token 费用 即可生成的 RAG 应用。官方项目页面给出的同一示例约为 0.02 美元(使用 DeepSeek V4 Pro)

该数字是项目演示数据,并非保证的固定价格。实际成本取决于所选模型、提供商、提示词复杂度、重试次数、应用范围以及 Token 定价。

让一个智能体构建另一个智能体

PenguinHarness 始于一个简单的理念:智能体应该能够根据自然语言需求构建另一个智能体应用。

这契合了更广泛的“AI 为 AI 服务”和递归自我改进的讨论——AI 系统帮助创建、测试或改进其他 AI 系统。

源文章中展示的首个用例要求系统构建一个 RAG 应用,该应用需要:

  • 分块检索信息
  • 流式输出清晰的答案
  • 包含引用来源
  • 提供可用的前端界面
  • 可以作为完整应用运行

对比测试将 PenguinHarness 与一个编码智能体并排,要求两个系统完成类似任务。

根据项目演示,PenguinHarness 以更快的速度和更低的 Token 成本完成了该应用。其结果包含流畅的答案、流式输出和链接来源。

报告中展示的竞争对手输出存在语言混杂的问题,且不具备相同的流式行为。

这些示例是有用的演示,但并不能普遍证明 PenguinHarness 在所有场景下都优于每个编码智能体,

仓库。结果在很大程度上取决于模型、智能体配置、任务设计和评估方法。

从需求到可运行的应用程序

传统的智能体开发通常涉及多个手动阶段:

  1. 选择智能体框架。
  2. 选择并配置模型。
  3. 连接工具和外部服务。
  4. 编写系统提示词。
  5. 定义记忆和工作流逻辑。
  6. 构建评估用例。
  7. 测试并修改智能体。
  8. 创建前端或交付界面。
  9. 打包应用程序以便部署。

PenguinHarness 试图将这些步骤转变为由智能体驱动的单一工作流。

当需求明确时,系统可以生成:

  • 应用程序脚手架
  • 智能体提示词
  • 技能和工具定义
  • 配置文件
  • 辅助代码
  • 前端
  • 安装说明
  • 运行说明
  • 迭代修复和优化

官方项目示例使用了以下请求:

收集 https://github.com/ericbuess/claude-code-docs 中的文档,并构建一个 RAG 应用,以配置专家的身份回答关于 Claude Code 的问题,并引用其来源。

项目报告称,使用 DeepSeek V4 Pro 构建时,所生成的 RAG 应用消耗了约 $0.02(即 ¥0.2)的模型令牌

文件系统是事实的来源

PenguinHarness 将文件作为人与智能体之间的主要协作层。

在这种设计中:

  • 智能体由文件表示。
  • 提示词是文件。
  • 技能是文件。
  • 配置存储在文件中。
  • 对话和执行信息可以通过存储的记录进行追踪。
  • 可以通过组装或复制所需的文件结构来创建新的智能体。

这种方法使智能体更易于检查和修改。

PenguinHarness 没有将重要行为隐藏在一个大型应用程序框架内,而是将可编辑的文件作为主要界面。人类可以阅读和修改这些文件,而智能体可以在经过批准的优化过程中改进它们。

该工具负责将那些文件组装成一个可运行的智能体对象。

PenguinMessage 提供统一协议

在运行时,PenguinMessage 作为连接模型、环境、工具和用户的通用消息格式。

源文章将其比作网络数据包:不同的组件可以通过相同的轻量级接口交换信息,而无需为每个模型或环境进行独特的集成。

因此,PenguinHarness 既是:

  • 一个运行智能体的框架
  • 一个能够理解并扩展自身结构的智能体

PenguinHarness 项目架构图

PenguinHarness 在一个轻量级架构中结合了 PenguinMessage、Penguin SDK 和 Penguin Skills。

项目架构中展示的三个核心领域是:

组件 角色
PenguinMessage 用户、模型、工具与环境之间的最小消息协议
Penguin SDK 用于构建智能体应用的开发层
Penguin Skills 用于构建、评估和优化智能体的可复用能力

本地可复现的自我进化循环

构建智能体只是第一步。

PenguinHarness 的长期目标是让用户能够操作可在本地评估和优化的智能体,而无需手动重建整个系统。

该项目区分了两个阶段:

  • 构建智能体: 从零到一
  • 优化智能体: 从一到一百

修改智能体相对容易,因为提示词、代码、技能和配置都可以编辑。但判断一个改动是否真正让智能体变得更好则困难得多。

大语言模型具有概率性,而智能体系统通过工具、环境、记忆和多步决策引入了更多不确定性。

因此,可靠的改进循环需要可靠的测量系统。

为什么评估是基础

一个智能体可能在单个示例上表现更好,但整体上却变得更差。

如果没有结构化的基准测试,优化器可能会:

  • 对少数演示样本过拟合
  • 记忆答案
  • 利用评估器的弱点
  • 增加成本却不提升质量
  • 提升一项任务却损害另一项
  • 通过奖励黑客手段获得更高分数

PrismShadow 团队花了六个多月的时间探索如何评估自我进化的智能体。

核心挑战在于缺少能够清晰区分训练经验与保留测试的基准测试。

如果智能体在用于评估的同一批问题上有所改进,就很难判断它是学到了可复用的策略,还是仅仅记住了答案。

GDPevo 区分训练任务与测试任务

团队创建了 GDPevo,一个基于真实业务流程的进化原生基准测试。

来源文章描述了其在医疗、金融和法律工作等领域的覆盖范围。当前公开的 V2 代码库包含 24 个任务组中的 240 个任务,涵盖领域包括:

  • CRM
  • ERP
  • 金融
  • 医疗
  • 法律工作流
  • 数据分析
  • 工程运维

每个任务组包括:

  • 一个共享的业务环境
  • 五个训练任务
  • 五个保留测试任务

GDPevo 使用一种称为 规则混合 的方法。业务流程被分解为更小的规则,分布在训练任务中,并在保留测试任务中重新组合。

这种结构有助于判断智能体是否学到了可复用的工作流,而非仅仅提前看到了测试答案。

GDPevo 模型评测排行榜

GDPevo 评估智能体在不同形式的进化后,在保留业务任务上的改进程度。

GDPevo 论文报告

自我进化在其实验中使保留准确率提升了多达16.44个百分点。同时还指出,进化后的最佳智能体仍远低于完全信息下的理想上限91.6%。

这一差距至关重要。当前智能体可以改进,但可靠的自我进化远未得到解决。

PenguinHarness将评估打包为技能

PenguinHarness将GDPevo背后的核心思想转化为可复用的技能,用于:

  • 智能体创建
  • 基准设计
  • 智能体评估
  • 智能体优化

在调用相关技能后,多个智能体可以协作参与改进过程。

源文章给出了一个为体育预测、投资策略生成或电子商务支持等任务设计的智能体示例。

用户无需手动修改提示词和工作流程,只需让PenguinHarness创建评估集、运行重复测试、分析失败原因并提出更优版本。

项目演示报告显示,经过多轮迭代后,得分从53分提升至95分,使用DeepSeek V4 Flash的模型代币成本约为0.5元人民币

这是项目团队的演示结果,并非通用基准保证。实际效果会因任务、评分标准、模型、样本量和优化预算的不同而有所差异。

四步优化流程

自我进化工作流使用多个分工不同的智能体。

1. 组织评估

优化智能体确定所需的问题数量和重复次数,然后并行启动多个评估智能体

并行评估有助于缩短测试多个任务或重复运行所需的时间。

2. 独立评分

每个评估智能体启动目标智能体的独立副本,并要求其解决一项任务。

评估智能体可以访问评分标准,而目标智能体无法访问。

这种隔离旨在防止目标智能体直接针对隐藏的评分指令进行优化。

3. 分析与改进

优化智能体收集结果并检查执行轨迹。

它找出失分原因,然后修改目标智能体中已批准的部分,例如:

  • 提示词
  • 技能
  • 配置
  • 工作流文件

优化智能体生成候选的下一版本。

4. 验证与迭代

评估智能体再次测试候选版本。

只有当候选版本获得严格更高的分数时,优化智能体才会接受它。如果分数持平或下降,框架将回退到之前的版本。

PenguinHarness 自进化工作流

优化智能体协调并行评估智能体,且仅接受得分更高的候选智能体。

该流程可概括为:

目标智能体 vN
      ↓
并行评估智能体
      ↓
得分、评分标准与执行轨迹
      ↓

优化器代理
      ↓
提示词、技能或配置更新
      ↓
候选代理 vN+1
      ↓
仅在分数严格更高时接受

这种隐藏评分标准、保留测试、快照和严格分数提升的组合设计,旨在让优化更具可复现性。

测试框架与自进化代理之间的契约

自进化引出了一个明显的安全问题:代理被允许更改什么?

PenguinHarness 在一个名为 CONTRACT.md 的可移植文件中定义了这些边界。

该契约规定,能力可以在批准的区域内提升,而测试框架内核及其安全边界保持固定。

PenguinHarness CONTRACT.md 契约

CONTRACT.md 定义了代理进化、审计、版本控制和凭据隔离的边界。

源文章强调了四个核心规则。

1. 进化不能修改测试框架内核

可编辑区域仅限于工作区、提示词、技能和已批准的配置。

代理不得重写核心测试框架或其安全机制。

这降低了优化过程可能削弱以下方面的风险:

  • 工具审批
  • 权限控制
  • 审计日志
  • 凭据隔离
  • 版本恢复
  • 其他系统级安全检查

2. 每次优化都需要快照

在优化轮次之前,框架会存储代理状态的版本快照。

如果候选代理表现更差或引起不希望的副作用,系统可以回退到早期版本。

没有回滚能力的自改进系统可能会累积损害。版本控制使改进可逆。

3. 目标代理不能看到评分标准

目标代理接收任务,但不接收隐藏的评估标准。

只有评估器才能访问评分标准。

这旨在减少捷径行为、答案记忆和奖励黑客攻击。

这并不能完全消除这些风险,但它在解决问题和评判结果之间创建了更清晰的分离。

4. 每次优化都必须可审计

模型请求、工具调用、令牌使用、时间、失败、审批和优化更改都会写入跟踪文件。

用户可以检查发生了什么变化以及为什么变化。

更广泛的项目契约还包括:

  • 工具执行前的审批
  • 审批决策的审计记录
  • 凭据隔离
  • 模型与代理解耦
  • 可恢复的执行轨迹
  • 按需加载相关文件
  • 明确的错误处理规则

最终形成的是一个框架,在这个框架中代理可以进化,但进化过程保持可见和可逆。

其他有用的 PenguinHarness 功能

PenguinHarness 除了自动化代理创建和优化之外,还包括多项能力。

用于模型训练的内置技能

与部署

项目内置了与AI应用开发相关的技能,包括:

  • penguin-sdk
  • penguin-cli
  • agenthub-models
  • vllm
  • ollama
  • llamafactory

PenguinHarness 内置技能界面

PenguinHarness包含用于构建智能体以及与vLLM、Ollama和LlamaFactory等工具协同工作的技能。

这些技能让用户可以用自然语言描述训练或部署任务,由智能体准备所需的文件或命令。

官方仓库将内置技能分为四大类:

技能分组 示例
办公效率 数据分析和网络数据采集
软件开发 网页设计和软件工程
AI应用开发 Penguin SDK、模型网关、vLLM、Ollama和LlamaFactory
智能体调优 智能体创建、基准设计、评估和优化

用户和智能体还可以创建或改进额外的技能。

统一的模型网关

PenguinHarness内置模型预设,并支持自定义兼容OpenAI的接口。

该项目表示,通过支持的提供商和网关,用户可以使用超过1000个在线和本地模型。

OpenRouter 模型列表

模型网关让用户可以配置不同的在线和本地模型提供商。

当前仓库列出了以下模型系列:

  • DeepSeek
  • Kimi
  • GLM
  • Hunyuan
  • Qwen
  • GPT
  • Gemini
  • Claude

模型的可用性和提供商名称变化频繁,因此应用内的“模型”页面和当前的官方文档应视为最新信息来源。

为文本模型提供视觉代理

源文章描述了一种开发模式,即以DeepSeek等以文本为主的模型作为主智能体,同时以具备视觉能力的模型作为视觉助手。

视觉代理可以检查:

  • 网页截图
  • 幻灯片
  • 界面布局
  • 渲染后的游戏画面
  • 图表
  • 视觉错误

主模型随后可以根据视觉描述修正其输出。

DeepSeek V4 Flash 游戏截图分析

一个具备视觉能力的

代理可以检查截图,而DeepSeek仍然作为主要工作模型。*

当主模型擅长编码或推理但不原生处理图像时,这会很有用。

该技术并不会让主模型直接获得视觉能力。它创建了一个多模型工作流,让视觉模型将截图转换为主要代理可以使用的信息。

细粒度追踪分析

PenguinHarness记录模型调用、工具执行、时序、Token用量、审批和子代理活动。

Trace界面以时间线形式展示执行序列。

PenguinHarness Trace 分析界面

Trace视图帮助用户检查并行子代理、模型调用、工具使用、延迟和Token成本。

这有助于识别:

  • 缓慢的模型调用
  • 不必要的工具使用
  • 昂贵的推理循环
  • 失败的重试
  • 阻塞工作流的子代理
  • 长时间的审批延迟
  • Token密集的提示词
  • 并行执行的机会

Trace数据也是自我进化的核心,因为优化器需要关于上一版本为何失分的证据。

最小化空白代理模板

PenguinHarness也可以用作最小化的通用代理,而不仅仅是一个自动化构建器。

该项目将Shell作为通用的低级接口,并有意识地保持默认工具集小而精简。

它将子代理执行视为核心性能特性。

源代码报告称,默认系统提示词约为1,300个Token,而项目中Claude Code的对比值约为15,000个Token

该数字由项目自行报告,可能随任一产品的演进而变化。

底层设计原则是稳定的:更短的提示词和更小的工具集可以减少Token开销,并使开放模型更易于使用。

成本与基准测试结果

该项目在一个复杂数据分析套件上发布了对比结果。

智能体数据分析性能对比

项目报告称,在其复杂数据分析对比中,以模型成本的一小部分实现了更高的准确率。

发布的数据表报告:

框架 模型 准确率 Token用量 预估成本
PenguinHarness DeepSeek V4 Pro 66.67% 18.04M $0.55
Claude Code Claude Opus 4.8 53.33% 22.20M $38.48
OpenAI Codex GPT-5.5 53.33% 13.72M $19.41

项目将其总结为:

  • 报告值的1/35

Codex 成本

  • 约为所报告 Claude Code 成本的 1/70

此对比将工具链与其通常搭配的模型组合在一起进行比较。它并未将工具链的贡献与所选模型及提供商定价的贡献分离开来。

为了进行公平的内部评估,团队应使用以下条件运行相同任务:

  • 尽可能使用相同模型
  • 相同的提供商定价
  • 相同的重试策略
  • 相同的工具访问权限
  • 相同的时间限制
  • 相同的评估标准
  • 多次重复运行

公开数据可作为项目基准参考,但不应被解读为适用于所有任务的通用成本比率。

已报告的生产部署案例

源文章称该团队已在两个生产场景中使用 PenguinHarness。

医疗报告审核

据称一家体检机构使用 PenguinHarness 创建了一个报告审核智能体,其表现被描述为可与医学专家相媲美。

据项目团队称,原先约需 30 分钟的审核工作可在几十秒内完成。

制造业检测

据称一家制造企业部署了多个基于 PenguinHarness 构建的智能体,用于持续监控生产线设备并尝试自动恢复。

团队报告:

  • 停机时间减少 65%
  • 产量提升至接近原先的两倍

以上为供应商提供的案例研究数据。原始报告未提供客户名称、研究设计、样本量、基线定义或独立审计信息。

这些应被视为已报告使用案例的示例,而非有保证的运营结果。

安装与部署

PenguinHarness 支持 Linux、macOS 以及 Windows 10 或更高版本,在可用情况下支持 x64 和 Arm64 系统。

一行安装脚本包含其自带的 Node.js 运行时。通过 npm 安装需要 Node.js 24 或更高版本。

Linux 或 macOS

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

Web 界面打开地址为:

http://127.0.0.1:7364

Windows PowerShell

irm https://penguin.ooo/install.ps1 | iex
penguin web

npm

npm install -g @prismshadow/penguin-cli
penguin web

在 CLI 安装中,首次 Web 登录使用用户名 admin。初始密码在服务器首次启动时打印输出,应立即更改。

配置模型并运行任务

官方仓库提供了类似以下的 CLI 示例:

penguin config model add \
  --provider deepseek \
  --model-id deepseek-v4-flash \
  --api-key sk-... \
  --set-default

运行一次性任务:

penguin run -m "创建包含 Hello, Penguin 的 hello.txt"

启动交互式会话:

penguin chat

启动无头服务器:

penguin server

API 密钥绝不应提交到源代码管理系统中,也不应粘贴到公开日志中。

PenguinHarness 可在本地机器或服务器上运行。其浏览器界面支持多会话、智能体与技能管理、模型配置、使用统计、Trace 可观测性以及评估工作流。

项目目前指出部分

桌面版构建未签名,首次启动时可能会触发操作系统警告。用户应仅从官方网站或 GitHub Releases 下载安装程序,并在绕过警告前核实项目说明。

PenguinHarness 背后的团队

PenguinHarness 由 PrismShadow 开源,该团队成立于 2025 年,致力于构建能够从业务知识、工作流程和反馈中学习的智能体基础设施。

原始报告列出的创始团队如下:

团队成员 背景
郑耀威 LlamaFactory 创建者;专注于可访问的模型和智能体基础设施
钱步月 加州大学戴维斯分校博士;前 IBM T. J. Watson 研究员、前复旦大学教授
吴学军 百度 NLP 前创始成员;曾在阿里巴巴和京东数科担任高级职务
胡俊豪 北京大学博士生;参与模型和缓存效率研究
陈曦 纽约大学商学院教授;卡内基梅隆大学博士、前亚马逊首席科学家

来源中的个人简介由发布方和项目团队提供。当这些信息对就业或学术验证具有实质性影响时,读者应使用官方机构页面进行核实。

从 LlamaFactory 到 PenguinHarness,团队声明的目标始终如一:将复杂的人工智能基础设施转化为更易于使用、更可靠、更高效的工具,服务更广泛的用户群体。

常见问题

什么是 PenguinHarness?

PenguinHarness 是一个开源智能体框架,可以构建、运行、评估和优化 AI 智能体。它提供 Web 界面、CLI、SDK、内置技能、模型配置、追踪以及多智能体评估工作流。

PenguinHarness 是否免费且开源?

是的。核心代码库以 Apache 2.0 许可证发布。用户仍需承担其工作负载产生的模型 API、基础设施或第三方服务费用。

PenguinHarness 可以在本地运行吗?

可以。它可以在 Linux、macOS 和 Windows 上运行,既可作为桌面应用程序,也可通过 CLI 和浏览器界面使用。还可以安装在服务器上供远程使用。

PenguinHarness 支持本地模型吗?

是的。它包含与 Ollama 和 vLLM 等工具相关的技能和集成,并支持自定义兼容 OpenAI 的端点。实际兼容性取决于模型的 API 行为和所需能力。

PenguinHarness 中的自我进化是什么意思?

自我进化意味着系统评估智能体、分析评分和追踪记录、修改经批准的提示词、技能或配置,并测试候选的下一版本。只有在配置的评估下表现更优时,候选版本才会被接受。

自我进化的智能体能否修改 PenguinHarness 内核?

项目契约规定不可以。进化仅限于工作区、提示词、技能和经批准的配置,而框架内核和安全机制保持不变。

¥0.2 的智能体构建成本是否有保证?

没有。¥0.2 的数字来自一次项目演示,该演示使用 DeepSeek V4 Pro 生成了一个 RAG 应用。实际

成本取决于模型定价、令牌使用量、重试次数、提供商以及任务复杂度。

什么是GDPevo?

GDPevo是一个开放基准,用于衡量智能体在留出的真实商业任务上的自我进化能力。其公开的V2版本包含24个组别中的240个任务,并区分了训练任务和测试任务。

相关工具

  • PenguinHarness:官方网站,提供下载、文档、产品示例和安装说明。
  • PenguinHarness GitHub仓库:Apache 2.0源代码、README、版本发布、命令行示例和贡献指南。
  • GDPevo:基准数据、构建流程、评估工作区以及已发布的实验结果。
  • LlamaFactory:Yaowei Zheng的开源框架,用于语言模型和视觉语言模型的高效微调。
  • vLLM:用于本地和服务端高吞吐量模型推理的开源引擎。
  • Ollama:本地模型运行时,可用于智能体开发工作流。
  • OpenRouter:统一API网关,用于访问多个托管模型提供商。

相关链接

总结

PenguinHarness是一个开源平台,允许智能体根据自然语言需求构建另一个智能体应用。它可以生成脚手架、提示词、技能、配置、代码、前端和运行说明,同时支持托管模型和本地模型。

其长期重点是自我进化。多个评估智能体对目标智能体进行评分,优化器分析结果和执行轨迹,只有当候选版本获得更高分数时才会被接受。CONTRACT.md限制了可更改的内容,并要求快照、回滚、隐藏评分标准、审批、凭据隔离和审计记录。

该项目报告了显著的成本降低和早期生产收益,但这些数字是团队提供的演示和案例研究,而非普遍适用的结论。

保证。Apache 2.0 仓库、已发布的命令及 GDPevo 基准为开发者提供了充足的素材,使他们能够在自己的工作负载上测试该方法。

PenguinHarness 的核心思想直截了当:构建智能体应当可以自动化,但安全地改进它则需要可度量的评估、严格的边界和可逆的变更。