PenguinHarness 以仅 0.2 元构建并自我改进 AI 代理
PenguinHarness 是 PrismShadow 团队推出的开源智能体构建工具,可自动完成智能体应用的构建、评估与持续改进。文中约 0.2 元的 RAG 示例是演示成本,不是固定价格保证。

PenguinHarness 仅需 0.2 元即可构建并自我改进 AI 智能体
简介
LlamaFactory 让大规模模型微调对更广泛的开发者群体变得更加容易。如今,其创建者郑耀威和 PrismShadow 团队正在将同样的“易用性优先”方法应用于 AI 智能体。
他们的全新开源项目 PenguinHarness 旨在自动化智能体生命周期的三个环节:
- 构建智能体应用
- 评估其性能
- 持续改进其提示词、技能和配置
用户无需手动选择框架、连接工具、编写提示词、构建界面并反复测试结果,只需描述需求,即可让 PenguinHarness 组装出一个可运行的智能体应用。

PenguinHarness 是一款面向桌面和服务端部署的开源自动化智能体构建工具。
该项目轻量级、以 Apache 2.0 协议开源,支持 Linux、macOS 和 Windows 系统。它可以在本地运行,也可以通过浏览器界面在远程服务器上使用。
PenguinHarness 还通过内置预设和兼容 OpenAI 的接口支持在线及本地模型。官方仓库目前列出了来自 DeepSeek、Kimi、GLM、Qwen、OpenAI、Google、Anthropic 等提供商的最新模型。
原始报告描述了一个仅花费 0.2 元模型 Token 费用 即可生成的 RAG 应用。官方项目页面给出的同一示例约为 0.02 美元(使用 DeepSeek V4 Pro)。
该数字是项目演示数据,并非保证的固定价格。实际成本取决于所选模型、提供商、提示词复杂度、重试次数、应用范围以及 Token 定价。
让一个智能体构建另一个智能体
PenguinHarness 始于一个简单的理念:智能体应该能够根据自然语言需求构建另一个智能体应用。
这契合了更广泛的“AI 为 AI 服务”和递归自我改进的讨论——AI 系统帮助创建、测试或改进其他 AI 系统。
源文章中展示的首个用例要求系统构建一个 RAG 应用,该应用需要:
- 分块检索信息
- 流式输出清晰的答案
- 包含引用来源
- 提供可用的前端界面
- 可以作为完整应用运行
对比测试将 PenguinHarness 与一个编码智能体并排,要求两个系统完成类似任务。
根据项目演示,PenguinHarness 以更快的速度和更低的 Token 成本完成了该应用。其结果包含流畅的答案、流式输出和链接来源。
报告中展示的竞争对手输出存在语言混杂的问题,且不具备相同的流式行为。
这些示例是有用的演示,但并不能普遍证明 PenguinHarness 在所有场景下都优于每个编码智能体,
仓库。结果在很大程度上取决于模型、智能体配置、任务设计和评估方法。
从需求到可运行的应用程序
传统的智能体开发通常涉及多个手动阶段:
- 选择智能体框架。
- 选择并配置模型。
- 连接工具和外部服务。
- 编写系统提示词。
- 定义记忆和工作流逻辑。
- 构建评估用例。
- 测试并修改智能体。
- 创建前端或交付界面。
- 打包应用程序以便部署。
PenguinHarness 试图将这些步骤转变为由智能体驱动的单一工作流。
当需求明确时,系统可以生成:
- 应用程序脚手架
- 智能体提示词
- 技能和工具定义
- 配置文件
- 辅助代码
- 前端
- 安装说明
- 运行说明
- 迭代修复和优化
官方项目示例使用了以下请求:
收集 https://github.com/ericbuess/claude-code-docs 中的文档,并构建一个 RAG 应用,以配置专家的身份回答关于 Claude Code 的问题,并引用其来源。
项目报告称,使用 DeepSeek V4 Pro 构建时,所生成的 RAG 应用消耗了约 $0.02(即 ¥0.2)的模型令牌。
文件系统是事实的来源
PenguinHarness 将文件作为人与智能体之间的主要协作层。
在这种设计中:
- 智能体由文件表示。
- 提示词是文件。
- 技能是文件。
- 配置存储在文件中。
- 对话和执行信息可以通过存储的记录进行追踪。
- 可以通过组装或复制所需的文件结构来创建新的智能体。
这种方法使智能体更易于检查和修改。
PenguinHarness 没有将重要行为隐藏在一个大型应用程序框架内,而是将可编辑的文件作为主要界面。人类可以阅读和修改这些文件,而智能体可以在经过批准的优化过程中改进它们。
该工具负责将那些文件组装成一个可运行的智能体对象。
PenguinMessage 提供统一协议
在运行时,PenguinMessage 作为连接模型、环境、工具和用户的通用消息格式。
源文章将其比作网络数据包:不同的组件可以通过相同的轻量级接口交换信息,而无需为每个模型或环境进行独特的集成。
因此,PenguinHarness 既是:
- 一个运行智能体的框架
- 一个能够理解并扩展自身结构的智能体

PenguinHarness 在一个轻量级架构中结合了 PenguinMessage、Penguin SDK 和 Penguin Skills。
项目架构中展示的三个核心领域是:
| 组件 | 角色 |
|---|---|
| PenguinMessage | 用户、模型、工具与环境之间的最小消息协议 |
| Penguin SDK | 用于构建智能体应用的开发层 |
| Penguin Skills | 用于构建、评估和优化智能体的可复用能力 |
本地可复现的自我进化循环
构建智能体只是第一步。
PenguinHarness 的长期目标是让用户能够操作可在本地评估和优化的智能体,而无需手动重建整个系统。
该项目区分了两个阶段:
- 构建智能体: 从零到一
- 优化智能体: 从一到一百
修改智能体相对容易,因为提示词、代码、技能和配置都可以编辑。但判断一个改动是否真正让智能体变得更好则困难得多。
大语言模型具有概率性,而智能体系统通过工具、环境、记忆和多步决策引入了更多不确定性。
因此,可靠的改进循环需要可靠的测量系统。
为什么评估是基础
一个智能体可能在单个示例上表现更好,但整体上却变得更差。
如果没有结构化的基准测试,优化器可能会:
- 对少数演示样本过拟合
- 记忆答案
- 利用评估器的弱点
- 增加成本却不提升质量
- 提升一项任务却损害另一项
- 通过奖励黑客手段获得更高分数
PrismShadow 团队花了六个多月的时间探索如何评估自我进化的智能体。
核心挑战在于缺少能够清晰区分训练经验与保留测试的基准测试。
如果智能体在用于评估的同一批问题上有所改进,就很难判断它是学到了可复用的策略,还是仅仅记住了答案。
GDPevo 区分训练任务与测试任务
团队创建了 GDPevo,一个基于真实业务流程的进化原生基准测试。
来源文章描述了其在医疗、金融和法律工作等领域的覆盖范围。当前公开的 V2 代码库包含 24 个任务组中的 240 个任务,涵盖领域包括:
- CRM
- ERP
- 金融
- 医疗
- 法律工作流
- 数据分析
- 工程运维
每个任务组包括:
- 一个共享的业务环境
- 五个训练任务
- 五个保留测试任务
GDPevo 使用一种称为 规则混合 的方法。业务流程被分解为更小的规则,分布在训练任务中,并在保留测试任务中重新组合。
这种结构有助于判断智能体是否学到了可复用的工作流,而非仅仅提前看到了测试答案。

GDPevo 评估智能体在不同形式的进化后,在保留业务任务上的改进程度。
GDPevo 论文报告
自我进化在其实验中使保留准确率提升了多达16.44个百分点。同时还指出,进化后的最佳智能体仍远低于完全信息下的理想上限91.6%。
这一差距至关重要。当前智能体可以改进,但可靠的自我进化远未得到解决。
PenguinHarness将评估打包为技能
PenguinHarness将GDPevo背后的核心思想转化为可复用的技能,用于:
- 智能体创建
- 基准设计
- 智能体评估
- 智能体优化
在调用相关技能后,多个智能体可以协作参与改进过程。
源文章给出了一个为体育预测、投资策略生成或电子商务支持等任务设计的智能体示例。
用户无需手动修改提示词和工作流程,只需让PenguinHarness创建评估集、运行重复测试、分析失败原因并提出更优版本。
项目演示报告显示,经过多轮迭代后,得分从53分提升至95分,使用DeepSeek V4 Flash的模型代币成本约为0.5元人民币。
这是项目团队的演示结果,并非通用基准保证。实际效果会因任务、评分标准、模型、样本量和优化预算的不同而有所差异。
四步优化流程
自我进化工作流使用多个分工不同的智能体。
1. 组织评估
优化智能体确定所需的问题数量和重复次数,然后并行启动多个评估智能体。
并行评估有助于缩短测试多个任务或重复运行所需的时间。
2. 独立评分
每个评估智能体启动目标智能体的独立副本,并要求其解决一项任务。
评估智能体可以访问评分标准,而目标智能体无法访问。
这种隔离旨在防止目标智能体直接针对隐藏的评分指令进行优化。
3. 分析与改进
优化智能体收集结果并检查执行轨迹。
它找出失分原因,然后修改目标智能体中已批准的部分,例如:
- 提示词
- 技能
- 配置
- 工作流文件
优化智能体生成候选的下一版本。
4. 验证与迭代
评估智能体再次测试候选版本。
只有当候选版本获得严格更高的分数时,优化智能体才会接受它。如果分数持平或下降,框架将回退到之前的版本。

优化智能体协调并行评估智能体,且仅接受得分更高的候选智能体。
该流程可概括为:
目标智能体 vN
↓
并行评估智能体
↓
得分、评分标准与执行轨迹
↓
优化器代理
↓
提示词、技能或配置更新
↓
候选代理 vN+1
↓
仅在分数严格更高时接受
这种隐藏评分标准、保留测试、快照和严格分数提升的组合设计,旨在让优化更具可复现性。
测试框架与自进化代理之间的契约
自进化引出了一个明显的安全问题:代理被允许更改什么?
PenguinHarness 在一个名为 CONTRACT.md 的可移植文件中定义了这些边界。
该契约规定,能力可以在批准的区域内提升,而测试框架内核及其安全边界保持固定。

CONTRACT.md 定义了代理进化、审计、版本控制和凭据隔离的边界。
源文章强调了四个核心规则。
1. 进化不能修改测试框架内核
可编辑区域仅限于工作区、提示词、技能和已批准的配置。
代理不得重写核心测试框架或其安全机制。
这降低了优化过程可能削弱以下方面的风险:
- 工具审批
- 权限控制
- 审计日志
- 凭据隔离
- 版本恢复
- 其他系统级安全检查
2. 每次优化都需要快照
在优化轮次之前,框架会存储代理状态的版本快照。
如果候选代理表现更差或引起不希望的副作用,系统可以回退到早期版本。
没有回滚能力的自改进系统可能会累积损害。版本控制使改进可逆。
3. 目标代理不能看到评分标准
目标代理接收任务,但不接收隐藏的评估标准。
只有评估器才能访问评分标准。
这旨在减少捷径行为、答案记忆和奖励黑客攻击。
这并不能完全消除这些风险,但它在解决问题和评判结果之间创建了更清晰的分离。
4. 每次优化都必须可审计
模型请求、工具调用、令牌使用、时间、失败、审批和优化更改都会写入跟踪文件。
用户可以检查发生了什么变化以及为什么变化。
更广泛的项目契约还包括:
- 工具执行前的审批
- 审批决策的审计记录
- 凭据隔离
- 模型与代理解耦
- 可恢复的执行轨迹
- 按需加载相关文件
- 明确的错误处理规则
最终形成的是一个框架,在这个框架中代理可以进化,但进化过程保持可见和可逆。
其他有用的 PenguinHarness 功能
PenguinHarness 除了自动化代理创建和优化之外,还包括多项能力。
用于模型训练的内置技能
与部署
项目内置了与AI应用开发相关的技能,包括:
penguin-sdkpenguin-cliagenthub-modelsvllmollamallamafactory

PenguinHarness包含用于构建智能体以及与vLLM、Ollama和LlamaFactory等工具协同工作的技能。
这些技能让用户可以用自然语言描述训练或部署任务,由智能体准备所需的文件或命令。
官方仓库将内置技能分为四大类:
| 技能分组 | 示例 |
|---|---|
| 办公效率 | 数据分析和网络数据采集 |
| 软件开发 | 网页设计和软件工程 |
| AI应用开发 | Penguin SDK、模型网关、vLLM、Ollama和LlamaFactory |
| 智能体调优 | 智能体创建、基准设计、评估和优化 |
用户和智能体还可以创建或改进额外的技能。
统一的模型网关
PenguinHarness内置模型预设,并支持自定义兼容OpenAI的接口。
该项目表示,通过支持的提供商和网关,用户可以使用超过1000个在线和本地模型。

模型网关让用户可以配置不同的在线和本地模型提供商。
当前仓库列出了以下模型系列:
- DeepSeek
- Kimi
- GLM
- Hunyuan
- Qwen
- GPT
- Gemini
- Claude
模型的可用性和提供商名称变化频繁,因此应用内的“模型”页面和当前的官方文档应视为最新信息来源。
为文本模型提供视觉代理
源文章描述了一种开发模式,即以DeepSeek等以文本为主的模型作为主智能体,同时以具备视觉能力的模型作为视觉助手。
视觉代理可以检查:
- 网页截图
- 幻灯片
- 界面布局
- 渲染后的游戏画面
- 图表
- 视觉错误
主模型随后可以根据视觉描述修正其输出。

一个具备视觉能力的
代理可以检查截图,而DeepSeek仍然作为主要工作模型。*
当主模型擅长编码或推理但不原生处理图像时,这会很有用。
该技术并不会让主模型直接获得视觉能力。它创建了一个多模型工作流,让视觉模型将截图转换为主要代理可以使用的信息。
细粒度追踪分析
PenguinHarness记录模型调用、工具执行、时序、Token用量、审批和子代理活动。
Trace界面以时间线形式展示执行序列。

Trace视图帮助用户检查并行子代理、模型调用、工具使用、延迟和Token成本。
这有助于识别:
- 缓慢的模型调用
- 不必要的工具使用
- 昂贵的推理循环
- 失败的重试
- 阻塞工作流的子代理
- 长时间的审批延迟
- Token密集的提示词
- 并行执行的机会
Trace数据也是自我进化的核心,因为优化器需要关于上一版本为何失分的证据。
最小化空白代理模板
PenguinHarness也可以用作最小化的通用代理,而不仅仅是一个自动化构建器。
该项目将Shell作为通用的低级接口,并有意识地保持默认工具集小而精简。
它将子代理执行视为核心性能特性。
源代码报告称,默认系统提示词约为1,300个Token,而项目中Claude Code的对比值约为15,000个Token。
该数字由项目自行报告,可能随任一产品的演进而变化。
底层设计原则是稳定的:更短的提示词和更小的工具集可以减少Token开销,并使开放模型更易于使用。
成本与基准测试结果
该项目在一个复杂数据分析套件上发布了对比结果。

项目报告称,在其复杂数据分析对比中,以模型成本的一小部分实现了更高的准确率。
发布的数据表报告:
| 框架 | 模型 | 准确率 | Token用量 | 预估成本 |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66.67% | 18.04M | $0.55 |
| Claude Code | Claude Opus 4.8 | 53.33% | 22.20M | $38.48 |
| OpenAI Codex | GPT-5.5 | 53.33% | 13.72M | $19.41 |
项目将其总结为:
- 报告值的1/35
Codex 成本
- 约为所报告 Claude Code 成本的 1/70
此对比将工具链与其通常搭配的模型组合在一起进行比较。它并未将工具链的贡献与所选模型及提供商定价的贡献分离开来。
为了进行公平的内部评估,团队应使用以下条件运行相同任务:
- 尽可能使用相同模型
- 相同的提供商定价
- 相同的重试策略
- 相同的工具访问权限
- 相同的时间限制
- 相同的评估标准
- 多次重复运行
公开数据可作为项目基准参考,但不应被解读为适用于所有任务的通用成本比率。
已报告的生产部署案例
源文章称该团队已在两个生产场景中使用 PenguinHarness。
医疗报告审核
据称一家体检机构使用 PenguinHarness 创建了一个报告审核智能体,其表现被描述为可与医学专家相媲美。
据项目团队称,原先约需 30 分钟的审核工作可在几十秒内完成。
制造业检测
据称一家制造企业部署了多个基于 PenguinHarness 构建的智能体,用于持续监控生产线设备并尝试自动恢复。
团队报告:
- 停机时间减少 65%
- 产量提升至接近原先的两倍
以上为供应商提供的案例研究数据。原始报告未提供客户名称、研究设计、样本量、基线定义或独立审计信息。
这些应被视为已报告使用案例的示例,而非有保证的运营结果。
安装与部署
PenguinHarness 支持 Linux、macOS 以及 Windows 10 或更高版本,在可用情况下支持 x64 和 Arm64 系统。
一行安装脚本包含其自带的 Node.js 运行时。通过 npm 安装需要 Node.js 24 或更高版本。
Linux 或 macOS
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
Web 界面打开地址为:
http://127.0.0.1:7364
Windows PowerShell
irm https://penguin.ooo/install.ps1 | iex
penguin web
npm
npm install -g @prismshadow/penguin-cli
penguin web
在 CLI 安装中,首次 Web 登录使用用户名 admin。初始密码在服务器首次启动时打印输出,应立即更改。
配置模型并运行任务
官方仓库提供了类似以下的 CLI 示例:
penguin config model add \
--provider deepseek \
--model-id deepseek-v4-flash \
--api-key sk-... \
--set-default
运行一次性任务:
penguin run -m "创建包含 Hello, Penguin 的 hello.txt"
启动交互式会话:
penguin chat
启动无头服务器:
penguin server
API 密钥绝不应提交到源代码管理系统中,也不应粘贴到公开日志中。
PenguinHarness 可在本地机器或服务器上运行。其浏览器界面支持多会话、智能体与技能管理、模型配置、使用统计、Trace 可观测性以及评估工作流。
项目目前指出部分
桌面版构建未签名,首次启动时可能会触发操作系统警告。用户应仅从官方网站或 GitHub Releases 下载安装程序,并在绕过警告前核实项目说明。
PenguinHarness 背后的团队
PenguinHarness 由 PrismShadow 开源,该团队成立于 2025 年,致力于构建能够从业务知识、工作流程和反馈中学习的智能体基础设施。
原始报告列出的创始团队如下:
| 团队成员 | 背景 |
|---|---|
| 郑耀威 | LlamaFactory 创建者;专注于可访问的模型和智能体基础设施 |
| 钱步月 | 加州大学戴维斯分校博士;前 IBM T. J. Watson 研究员、前复旦大学教授 |
| 吴学军 | 百度 NLP 前创始成员;曾在阿里巴巴和京东数科担任高级职务 |
| 胡俊豪 | 北京大学博士生;参与模型和缓存效率研究 |
| 陈曦 | 纽约大学商学院教授;卡内基梅隆大学博士、前亚马逊首席科学家 |
来源中的个人简介由发布方和项目团队提供。当这些信息对就业或学术验证具有实质性影响时,读者应使用官方机构页面进行核实。
从 LlamaFactory 到 PenguinHarness,团队声明的目标始终如一:将复杂的人工智能基础设施转化为更易于使用、更可靠、更高效的工具,服务更广泛的用户群体。
常见问题
什么是 PenguinHarness?
PenguinHarness 是一个开源智能体框架,可以构建、运行、评估和优化 AI 智能体。它提供 Web 界面、CLI、SDK、内置技能、模型配置、追踪以及多智能体评估工作流。
PenguinHarness 是否免费且开源?
是的。核心代码库以 Apache 2.0 许可证发布。用户仍需承担其工作负载产生的模型 API、基础设施或第三方服务费用。
PenguinHarness 可以在本地运行吗?
可以。它可以在 Linux、macOS 和 Windows 上运行,既可作为桌面应用程序,也可通过 CLI 和浏览器界面使用。还可以安装在服务器上供远程使用。
PenguinHarness 支持本地模型吗?
是的。它包含与 Ollama 和 vLLM 等工具相关的技能和集成,并支持自定义兼容 OpenAI 的端点。实际兼容性取决于模型的 API 行为和所需能力。
PenguinHarness 中的自我进化是什么意思?
自我进化意味着系统评估智能体、分析评分和追踪记录、修改经批准的提示词、技能或配置,并测试候选的下一版本。只有在配置的评估下表现更优时,候选版本才会被接受。
自我进化的智能体能否修改 PenguinHarness 内核?
项目契约规定不可以。进化仅限于工作区、提示词、技能和经批准的配置,而框架内核和安全机制保持不变。
¥0.2 的智能体构建成本是否有保证?
没有。¥0.2 的数字来自一次项目演示,该演示使用 DeepSeek V4 Pro 生成了一个 RAG 应用。实际
成本取决于模型定价、令牌使用量、重试次数、提供商以及任务复杂度。
什么是GDPevo?
GDPevo是一个开放基准,用于衡量智能体在留出的真实商业任务上的自我进化能力。其公开的V2版本包含24个组别中的240个任务,并区分了训练任务和测试任务。
相关工具
- PenguinHarness:官方网站,提供下载、文档、产品示例和安装说明。
- PenguinHarness GitHub仓库:Apache 2.0源代码、README、版本发布、命令行示例和贡献指南。
- GDPevo:基准数据、构建流程、评估工作区以及已发布的实验结果。
- LlamaFactory:Yaowei Zheng的开源框架,用于语言模型和视觉语言模型的高效微调。
- vLLM:用于本地和服务端高吞吐量模型推理的开源引擎。
- Ollama:本地模型运行时,可用于智能体开发工作流。
- OpenRouter:统一API网关,用于访问多个托管模型提供商。
相关链接
- PenguinHarness介绍:项目团队的官方发布文章,阐释“智能体构建智能体”的理念。
- PenguinHarness文档:官方安装、模型、技能和使用文档。
- PenguinHarness GitHub仓库:源代码、当前支持的模型列表、命令以及Apache 2.0许可证。
- PenguinHarness版本发布:支持平台的官方桌面端和命令行安装包。
- GDPevo论文:描述基准设计、规则混合和评估结果的研究论文。
- GDPevo GitHub仓库:官方基准、任务数据、评估结果和可复现工作区。
- LlamaFactory GitHub仓库:文章中引用的模型微调框架的官方仓库。
总结
PenguinHarness是一个开源平台,允许智能体根据自然语言需求构建另一个智能体应用。它可以生成脚手架、提示词、技能、配置、代码、前端和运行说明,同时支持托管模型和本地模型。
其长期重点是自我进化。多个评估智能体对目标智能体进行评分,优化器分析结果和执行轨迹,只有当候选版本获得更高分数时才会被接受。CONTRACT.md限制了可更改的内容,并要求快照、回滚、隐藏评分标准、审批、凭据隔离和审计记录。
该项目报告了显著的成本降低和早期生产收益,但这些数字是团队提供的演示和案例研究,而非普遍适用的结论。
保证。Apache 2.0 仓库、已发布的命令及 GDPevo 基准为开发者提供了充足的素材,使他们能够在自己的工作负载上测试该方法。
PenguinHarness 的核心思想直截了当:构建智能体应当可以自动化,但安全地改进它则需要可度量的评估、严格的边界和可逆的变更。