PenguinHarness 是 PrismShadow 团队推出的开源智能体构建工具,可自动完成智能体应用的构建、评估与持续改进。文中约 0.2 元的 RAG 示例是演示成本,不是固定价格保证。

LlamaFactory 让大规模模型微调对更广泛的开发者群体变得更加容易。如今,其创建者郑耀威和 PrismShadow 团队正在将同样的“易用性优先”方法应用于 AI 智能体。
他们的全新开源项目 PenguinHarness 旨在自动化智能体生命周期的三个环节:
用户无需手动选择框架、连接工具、编写提示词、构建界面并反复测试结果,只需描述需求,即可让 PenguinHarness 组装出一个可运行的智能体应用。

PenguinHarness 是一款面向桌面和服务端部署的开源自动化智能体构建工具。
该项目轻量级、以 Apache 2.0 协议开源,支持 Linux、macOS 和 Windows 系统。它可以在本地运行,也可以通过浏览器界面在远程服务器上使用。
PenguinHarness 还通过内置预设和兼容 OpenAI 的接口支持在线及本地模型。官方仓库目前列出了来自 DeepSeek、Kimi、GLM、Qwen、OpenAI、Google、Anthropic 等提供商的最新模型。
原始报告描述了一个仅花费 0.2 元模型 Token 费用 即可生成的 RAG 应用。官方项目页面给出的同一示例约为 0.02 美元(使用 DeepSeek V4 Pro)。
该数字是项目演示数据,并非保证的固定价格。实际成本取决于所选模型、提供商、提示词复杂度、重试次数、应用范围以及 Token 定价。
PenguinHarness 始于一个简单的理念:智能体应该能够根据自然语言需求构建另一个智能体应用。
这契合了更广泛的“AI 为 AI 服务”和递归自我改进的讨论——AI 系统帮助创建、测试或改进其他 AI 系统。
源文章中展示的首个用例要求系统构建一个 RAG 应用,该应用需要:
对比测试将 PenguinHarness 与一个编码智能体并排,要求两个系统完成类似任务。
根据项目演示,PenguinHarness 以更快的速度和更低的 Token 成本完成了该应用。其结果包含流畅的答案、流式输出和链接来源。
报告中展示的竞争对手输出存在语言混杂的问题,且不具备相同的流式行为。
这些示例是有用的演示,但并不能普遍证明 PenguinHarness 在所有场景下都优于每个编码智能体,
仓库。结果在很大程度上取决于模型、智能体配置、任务设计和评估方法。
传统的智能体开发通常涉及多个手动阶段:
PenguinHarness 试图将这些步骤转变为由智能体驱动的单一工作流。
当需求明确时,系统可以生成:
官方项目示例使用了以下请求:
收集 https://github.com/ericbuess/claude-code-docs 中的文档,并构建一个 RAG 应用,以配置专家的身份回答关于 Claude Code 的问题,并引用其来源。
项目报告称,使用 DeepSeek V4 Pro 构建时,所生成的 RAG 应用消耗了约 $0.02(即 ¥0.2)的模型令牌。
PenguinHarness 将文件作为人与智能体之间的主要协作层。
在这种设计中:
这种方法使智能体更易于检查和修改。
PenguinHarness 没有将重要行为隐藏在一个大型应用程序框架内,而是将可编辑的文件作为主要界面。人类可以阅读和修改这些文件,而智能体可以在经过批准的优化过程中改进它们。
该工具负责将那些文件组装成一个可运行的智能体对象。
在运行时,PenguinMessage 作为连接模型、环境、工具和用户的通用消息格式。
源文章将其比作网络数据包:不同的组件可以通过相同的轻量级接口交换信息,而无需为每个模型或环境进行独特的集成。
因此,PenguinHarness 既是:

PenguinHarness 在一个轻量级架构中结合了 PenguinMessage、Penguin SDK 和 Penguin Skills。
项目架构中展示的三个核心领域是:
| 组件 | 角色 |
|---|---|
| PenguinMessage | 用户、模型、工具与环境之间的最小消息协议 |
| Penguin SDK | 用于构建智能体应用的开发层 |
| Penguin Skills | 用于构建、评估和优化智能体的可复用能力 |
构建智能体只是第一步。
PenguinHarness 的长期目标是让用户能够操作可在本地评估和优化的智能体,而无需手动重建整个系统。
该项目区分了两个阶段:
修改智能体相对容易,因为提示词、代码、技能和配置都可以编辑。但判断一个改动是否真正让智能体变得更好则困难得多。
大语言模型具有概率性,而智能体系统通过工具、环境、记忆和多步决策引入了更多不确定性。
因此,可靠的改进循环需要可靠的测量系统。
一个智能体可能在单个示例上表现更好,但整体上却变得更差。
如果没有结构化的基准测试,优化器可能会:
PrismShadow 团队花了六个多月的时间探索如何评估自我进化的智能体。
核心挑战在于缺少能够清晰区分训练经验与保留测试的基准测试。
如果智能体在用于评估的同一批问题上有所改进,就很难判断它是学到了可复用的策略,还是仅仅记住了答案。
团队创建了 GDPevo,一个基于真实业务流程的进化原生基准测试。
来源文章描述了其在医疗、金融和法律工作等领域的覆盖范围。当前公开的 V2 代码库包含 24 个任务组中的 240 个任务,涵盖领域包括:
每个任务组包括:
GDPevo 使用一种称为 规则混合 的方法。业务流程被分解为更小的规则,分布在训练任务中,并在保留测试任务中重新组合。
这种结构有助于判断智能体是否学到了可复用的工作流,而非仅仅提前看到了测试答案。

GDPevo 评估智能体在不同形式的进化后,在保留业务任务上的改进程度。
GDPevo 论文报告
自我进化在其实验中使保留准确率提升了多达16.44个百分点。同时还指出,进化后的最佳智能体仍远低于完全信息下的理想上限91.6%。
这一差距至关重要。当前智能体可以改进,但可靠的自我进化远未得到解决。
PenguinHarness将GDPevo背后的核心思想转化为可复用的技能,用于:
在调用相关技能后,多个智能体可以协作参与改进过程。
源文章给出了一个为体育预测、投资策略生成或电子商务支持等任务设计的智能体示例。
用户无需手动修改提示词和工作流程,只需让PenguinHarness创建评估集、运行重复测试、分析失败原因并提出更优版本。
项目演示报告显示,经过多轮迭代后,得分从53分提升至95分,使用DeepSeek V4 Flash的模型代币成本约为0.5元人民币。
这是项目团队的演示结果,并非通用基准保证。实际效果会因任务、评分标准、模型、样本量和优化预算的不同而有所差异。
自我进化工作流使用多个分工不同的智能体。
优化智能体确定所需的问题数量和重复次数,然后并行启动多个评估智能体。
并行评估有助于缩短测试多个任务或重复运行所需的时间。
每个评估智能体启动目标智能体的独立副本,并要求其解决一项任务。
评估智能体可以访问评分标准,而目标智能体无法访问。
这种隔离旨在防止目标智能体直接针对隐藏的评分指令进行优化。
优化智能体收集结果并检查执行轨迹。
它找出失分原因,然后修改目标智能体中已批准的部分,例如:
优化智能体生成候选的下一版本。
评估智能体再次测试候选版本。
只有当候选版本获得严格更高的分数时,优化智能体才会接受它。如果分数持平或下降,框架将回退到之前的版本。

优化智能体协调并行评估智能体,且仅接受得分更高的候选智能体。
该流程可概括为:
目标智能体 vN
↓
并行评估智能体
↓
得分、评分标准与执行轨迹
↓
优化器代理
↓
提示词、技能或配置更新
↓
候选代理 vN+1
↓
仅在分数严格更高时接受
这种隐藏评分标准、保留测试、快照和严格分数提升的组合设计,旨在让优化更具可复现性。
自进化引出了一个明显的安全问题:代理被允许更改什么?
PenguinHarness 在一个名为 CONTRACT.md 的可移植文件中定义了这些边界。
该契约规定,能力可以在批准的区域内提升,而测试框架内核及其安全边界保持固定。

CONTRACT.md 定义了代理进化、审计、版本控制和凭据隔离的边界。
源文章强调了四个核心规则。
可编辑区域仅限于工作区、提示词、技能和已批准的配置。
代理不得重写核心测试框架或其安全机制。
这降低了优化过程可能削弱以下方面的风险:
在优化轮次之前,框架会存储代理状态的版本快照。
如果候选代理表现更差或引起不希望的副作用,系统可以回退到早期版本。
没有回滚能力的自改进系统可能会累积损害。版本控制使改进可逆。
目标代理接收任务,但不接收隐藏的评估标准。
只有评估器才能访问评分标准。
这旨在减少捷径行为、答案记忆和奖励黑客攻击。
这并不能完全消除这些风险,但它在解决问题和评判结果之间创建了更清晰的分离。
模型请求、工具调用、令牌使用、时间、失败、审批和优化更改都会写入跟踪文件。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
用户可以检查发生了什么变化以及为什么变化。
更广泛的项目契约还包括:
最终形成的是一个框架,在这个框架中代理可以进化,但进化过程保持可见和可逆。
PenguinHarness 除了自动化代理创建和优化之外,还包括多项能力。
与部署
项目内置了与AI应用开发相关的技能,包括:
penguin-sdkpenguin-cliagenthub-modelsvllmollamallamafactory
PenguinHarness包含用于构建智能体以及与vLLM、Ollama和LlamaFactory等工具协同工作的技能。
这些技能让用户可以用自然语言描述训练或部署任务,由智能体准备所需的文件或命令。
官方仓库将内置技能分为四大类:
| 技能分组 | 示例 |
|---|---|
| 办公效率 | 数据分析和网络数据采集 |
| 软件开发 | 网页设计和软件工程 |
| AI应用开发 | Penguin SDK、模型网关、vLLM、Ollama和LlamaFactory |
| 智能体调优 | 智能体创建、基准设计、评估和优化 |
用户和智能体还可以创建或改进额外的技能。
PenguinHarness内置模型预设,并支持自定义兼容OpenAI的接口。
该项目表示,通过支持的提供商和网关,用户可以使用超过1000个在线和本地模型。

模型网关让用户可以配置不同的在线和本地模型提供商。
当前仓库列出了以下模型系列:
模型的可用性和提供商名称变化频繁,因此应用内的“模型”页面和当前的官方文档应视为最新信息来源。
源文章描述了一种开发模式,即以DeepSeek等以文本为主的模型作为主智能体,同时以具备视觉能力的模型作为视觉助手。
视觉代理可以检查:
主模型随后可以根据视觉描述修正其输出。

一个具备视觉能力的
代理可以检查截图,而DeepSeek仍然作为主要工作模型。*
当主模型擅长编码或推理但不原生处理图像时,这会很有用。
该技术并不会让主模型直接获得视觉能力。它创建了一个多模型工作流,让视觉模型将截图转换为主要代理可以使用的信息。
PenguinHarness记录模型调用、工具执行、时序、Token用量、审批和子代理活动。
Trace界面以时间线形式展示执行序列。

Trace视图帮助用户检查并行子代理、模型调用、工具使用、延迟和Token成本。
这有助于识别:
Trace数据也是自我进化的核心,因为优化器需要关于上一版本为何失分的证据。
PenguinHarness也可以用作最小化的通用代理,而不仅仅是一个自动化构建器。
该项目将Shell作为通用的低级接口,并有意识地保持默认工具集小而精简。
它将子代理执行视为核心性能特性。
源代码报告称,默认系统提示词约为1,300个Token,而项目中Claude Code的对比值约为15,000个Token。
该数字由项目自行报告,可能随任一产品的演进而变化。
底层设计原则是稳定的:更短的提示词和更小的工具集可以减少Token开销,并使开放模型更易于使用。
该项目在一个复杂数据分析套件上发布了对比结果。

项目报告称,在其复杂数据分析对比中,以模型成本的一小部分实现了更高的准确率。
发布的数据表报告:
| 框架 | 模型 | 准确率 | Token用量 | 预估成本 |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66.67% | 18.04M | $0.55 |
| Claude Code | Claude Opus 4.8 | 53.33% | 22.20M | $38.48 |
| OpenAI Codex | GPT-5.5 | 53.33% | 13.72M | $19.41 |
项目将其总结为:
Codex 成本
此对比将工具链与其通常搭配的模型组合在一起进行比较。它并未将工具链的贡献与所选模型及提供商定价的贡献分离开来。
为了进行公平的内部评估,团队应使用以下条件运行相同任务:
公开数据可作为项目基准参考,但不应被解读为适用于所有任务的通用成本比率。
源文章称该团队已在两个生产场景中使用 PenguinHarness。
据称一家体检机构使用 PenguinHarness 创建了一个报告审核智能体,其表现被描述为可与医学专家相媲美。
据项目团队称,原先约需 30 分钟的审核工作可在几十秒内完成。
据称一家制造企业部署了多个基于 PenguinHarness 构建的智能体,用于持续监控生产线设备并尝试自动恢复。
团队报告:
以上为供应商提供的案例研究数据。原始报告未提供客户名称、研究设计、样本量、基线定义或独立审计信息。
这些应被视为已报告使用案例的示例,而非有保证的运营结果。
PenguinHarness 支持 Linux、macOS 以及 Windows 10 或更高版本,在可用情况下支持 x64 和 Arm64 系统。
一行安装脚本包含其自带的 Node.js 运行时。通过 npm 安装需要 Node.js 24 或更高版本。
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
Web 界面打开地址为:
http://127.0.0.1:7364
irm https://penguin.ooo/install.ps1 | iex
penguin web
npm install -g @prismshadow/penguin-cli
penguin web
在 CLI 安装中,首次 Web 登录使用用户名 admin。初始密码在服务器首次启动时打印输出,应立即更改。
官方仓库提供了类似以下的 CLI 示例:
penguin config model add \
--provider deepseek \
--model-id deepseek-v4-flash \
--api-key sk-... \
--set-default
运行一次性任务:
penguin run -m "创建包含 Hello, Penguin 的 hello.txt"
启动交互式会话:
penguin chat
启动无头服务器:
penguin server
API 密钥绝不应提交到源代码管理系统中,也不应粘贴到公开日志中。
PenguinHarness 可在本地机器或服务器上运行。其浏览器界面支持多会话、智能体与技能管理、模型配置、使用统计、Trace 可观测性以及评估工作流。
项目目前指出部分
桌面版构建未签名,首次启动时可能会触发操作系统警告。用户应仅从官方网站或 GitHub Releases 下载安装程序,并在绕过警告前核实项目说明。
PenguinHarness 由 PrismShadow 开源,该团队成立于 2025 年,致力于构建能够从业务知识、工作流程和反馈中学习的智能体基础设施。
原始报告列出的创始团队如下:
| 团队成员 | 背景 |
|---|---|
| 郑耀威 | LlamaFactory 创建者;专注于可访问的模型和智能体基础设施 |
| 钱步月 | 加州大学戴维斯分校博士;前 IBM T. J. Watson 研究员、前复旦大学教授 |
| 吴学军 | 百度 NLP 前创始成员;曾在阿里巴巴和京东数科担任高级职务 |
| 胡俊豪 | 北京大学博士生;参与模型和缓存效率研究 |
| 陈曦 | 纽约大学商学院教授;卡内基梅隆大学博士、前亚马逊首席科学家 |
来源中的个人简介由发布方和项目团队提供。当这些信息对就业或学术验证具有实质性影响时,读者应使用官方机构页面进行核实。
从 LlamaFactory 到 PenguinHarness,团队声明的目标始终如一:将复杂的人工智能基础设施转化为更易于使用、更可靠、更高效的工具,服务更广泛的用户群体。
PenguinHarness 是一个开源智能体框架,可以构建、运行、评估和优化 AI 智能体。它提供 Web 界面、CLI、SDK、内置技能、模型配置、追踪以及多智能体评估工作流。
是的。核心代码库以 Apache 2.0 许可证发布。用户仍需承担其工作负载产生的模型 API、基础设施或第三方服务费用。
可以。它可以在 Linux、macOS 和 Windows 上运行,既可作为桌面应用程序,也可通过 CLI 和浏览器界面使用。还可以安装在服务器上供远程使用。
是的。它包含与 Ollama 和 vLLM 等工具相关的技能和集成,并支持自定义兼容 OpenAI 的端点。实际兼容性取决于模型的 API 行为和所需能力。
自我进化意味着系统评估智能体、分析评分和追踪记录、修改经批准的提示词、技能或配置,并测试候选的下一版本。只有在配置的评估下表现更优时,候选版本才会被接受。
项目契约规定不可以。进化仅限于工作区、提示词、技能和经批准的配置,而框架内核和安全机制保持不变。
没有。¥0.2 的数字来自一次项目演示,该演示使用 DeepSeek V4 Pro 生成了一个 RAG 应用。实际
成本取决于模型定价、令牌使用量、重试次数、提供商以及任务复杂度。
GDPevo是一个开放基准,用于衡量智能体在留出的真实商业任务上的自我进化能力。其公开的V2版本包含24个组别中的240个任务,并区分了训练任务和测试任务。
PenguinHarness是一个开源平台,允许智能体根据自然语言需求构建另一个智能体应用。它可以生成脚手架、提示词、技能、配置、代码、前端和运行说明,同时支持托管模型和本地模型。
其长期重点是自我进化。多个评估智能体对目标智能体进行评分,优化器分析结果和执行轨迹,只有当候选版本获得更高分数时才会被接受。CONTRACT.md限制了可更改的内容,并要求快照、回滚、隐藏评分标准、审批、凭据隔离和审计记录。
该项目报告了显著的成本降低和早期生产收益,但这些数字是团队提供的演示和案例研究,而非普遍适用的结论。
保证。Apache 2.0 仓库、已发布的命令及 GDPevo 基准为开发者提供了充足的素材,使他们能够在自己的工作负载上测试该方法。
PenguinHarness 的核心思想直截了当:构建智能体应当可以自动化,但安全地改进它则需要可度量的评估、严格的边界和可逆的变更。
从一句话开始,几分钟内拿到完整网站。