PenguinHarness, 단 0.2위안으로 AI 에이전트를 구축하고 스스로 개선하다

LlamaFactory는 더 많은 개발자들이 대규모 모델 미세 조정을 더 쉽게 할 수 있게 해줍니다. 이제 그 창시자인 정야오웨이와 PrismShadow 팀은 동일한 사용 용이성 철학을 다음에 적용하고 있습니다...

发布于 2026年8月6日generalGEO 评分: 08 次阅读
PenguinHarness, 단 0.2위안으로 AI 에이전트를 구축하고 스스로 개선하다

PenguinHarness, 단 0.2위안으로 AI 에이전트를 구축하고 스스로 개선하다

소개

LlamaFactory는 대규모 모델 미세 조정을 더 넓은 개발자 층에게 더 쉽게 만들어 주었다. 이제 그 창시자인 정야오웨이와 PrismShadow 팀은 동일한 '사용 편의성 우선' 접근 방식을 AI 에이전트에 적용하고 있다.

그들의 새로운 오픈소스 프로젝트 PenguinHarness는 에이전트 수명 주기의 세 가지 단계를 자동화하는 것을 목표로 한다:

  1. 에이전트 애플리케이션 구축
  2. 성능 평가
  3. 프롬프트, 스킬 및 구성의 지속적 개선

사용자는 프레임워크 선택, 도구 연결, 프롬프트 작성, 인터페이스 구축, 결과 반복 테스트를 수동으로 수행할 필요 없이, 요구 사항을 설명하기만 하면 PenguinHarness가 실행 가능한 에이전트 애플리케이션을 조립해 준다.

PenguinHarness 平台宣传图

PenguinHarness는 데스크톱 및 서버 배포를 위한 오픈소스 자동화 에이전트 구축 도구이다.

이 프로젝트는 경량화되어 있으며 Apache 2.0 라이선스로 오픈소스 공개되어 Linux, macOS 및 Windows 시스템을 지원한다. 로컬에서 실행할 수 있을 뿐만 아니라 브라우저 인터페이스를 통해 원격 서버에서도 사용할 수 있다.

PenguinHarness는 또한 내장된 사전 설정과 OpenAI 호환 인터페이스를 통해 온라인 및 로컬 모델을 지원한다. 공식 저장소에는 현재 DeepSeek, Kimi, GLM, Qwen, OpenAI, Google, Anthropic 등 제공업체의 최신 모델이 나열되어 있다.

원본 보고서는 단 0.2위안의 모델 토큰 비용만으로 생성된 RAG 애플리케이션을 설명한다. 공식 프로젝트 페이지에서 제시된 동일한 예시는 약 0.02달러(DeepSeek V4 Pro 사용) 이다.

이 수치는 프로젝트 데모 데이터일 뿐이며 보장된 고정 가격이 아니다. 실제 비용은 선택한 모델, 제공업체, 프롬프트 복잡성, 재시도 횟수, 애플리케이션 범위 및 토큰 가격 책정에 따라 달라진다.

에이전트가 다른 에이전트를 구축하게 하다

PenguinHarness는 간단한 아이디어에서 시작한다: 에이전트는 자연어 요구 사항에 따라 다른 에이전트 애플리케이션을 구축할 수 있어야 한다는 것이다.

이는 더 넓은 'AI를 위한 AI' 및 재귀적 자기 개선 논의와 일치한다 — AI 시스템이 다른 AI 시스템을 만들고, 테스트하거나 개선하는 데 도움을 주는 것이다.

원본 기사에서 소개된 첫 번째 사용 사례는 시스템이 다음을 요구하는 RAG 애플리케이션을 구축하도록 요청한다:

  • 청크 단위 정보 검색
  • 스트리밍 방식의 명확한 답변 출력
  • 출처 인용 포함
  • 사용 가능한 프론트엔드 인터페이스 제공
  • 완전한 애플리케이션으로 실행 가능

비교 테스트는 PenguinHarness를 코딩 에이전트와 나란히 배치하여 두 시스템이 유사한 작업을 수행하도록 요구했다.

프로젝트 데모에 따르면, PenguinHarness는 더 빠른 속도와 더 낮은 토큰 비용으로 해당 애플리케이션을 완성했다. 그 결과물에는 자연스러운 답변, 스트리밍 출력 및 링크된 출처가 포함되어 있다.

보고서에 제시된 경쟁사의 출력은 언어 혼합 문제가 있었고 동일한 스트리밍 동작을 갖추지 못했다.

이러한 예시는 유용한 데모이지만, PenguinHarness가 모든 시나리오에서 모든 코딩 에이전트보다 우수하다는 것을 보편적으로 증명하지는 못한다.

결과는 모델, 에이전트 구성, 작업 설계 및 평가 방법에 크게 의존한다.

요구 사항에서 실행 가능한 애플리케이션까지

전통적인 에이전트 개발은 일반적으로 여러 수동 단계를 포함한다:

  1. 에이전트 프레임워크 선택
  2. 모델 선택 및 구성
  3. 도구 및 외부 서비스 연결
  4. 시스템 프롬프트 작성
  5. 메모리 및 워크플로우 로직 정의
  6. 평가 사례 구축
  7. 에이전트 테스트 및 수정
  8. 프론트엔드 또는 전달 인터페이스 생성
  9. 배포를 위한 애플리케이션 패키징

PenguinHarness는 이러한 단계를 에이전트 기반의 단일 워크플로우로 전환하려고 시도한다.

요구 사항이 명확하면 시스템은 다음을 생성할 수 있다:

  • 애플리케이션 스캐폴딩
  • 에이전트 프롬프트
  • 스킬 및 도구 정의
  • 구성 파일
  • 보조 코드
  • 프론트엔드
  • 설치 지침
  • 실행 지침
  • 반복적 수정 및 최적화

공식 프로젝트 예시는 다음 요청을 사용했다:

https://github.com/ericbuess/claude-code-docs의 문서를 수집하고, 구성 전문가로서 Claude Code에 대한 질문에 답변하고 출처를 인용하는 RAG 애플리케이션을 구축하라.

프로젝트는 DeepSeek V4 Pro로 구축할 때 생성된 RAG 애플리케이션이 약 $0.02(즉 ¥0.2)의 모델 토큰을 소비했다고 보고한다.

파일 시스템이 사실의 원천이다

PenguinHarness는 파일을 인간과 에이전트 사이의 주요 협업 계층으로 사용한다.

이 설계에서:

  • 에이전트는 파일로 표현된다
  • 프롬프트는 파일이다
  • 스킬은 파일이다
  • 구성은 파일에 저장된다
  • 대화 및 실행 정보는 저장된 기록을 통해 추적할 수 있다
  • 필요한 파일 구조를 조립하거나 복사하여 새 에이전트를 만들 수 있다

이 방식은 에이전트를 더 쉽게 검사하고 수정할 수 있게 한다.

PenguinHarness는 중요한 동작을 대규모 애플리케이션 프레임워크 내부에 숨기는 대신, 편집 가능한 파일을 주요 인터페이스로 사용한다. 인간은 이러한 파일을 읽고 수정할 수 있으며, 에이전트는 승인된 최적화 프로세스를 통해 이를 개선할 수 있다.

이 도구는 이러한 파일을 실행 가능한 에이전트 객체로 조립하는 역할을 담당한다.

PenguinMessage가 통일된 프로토콜을 제공하다

런타임에서 PenguinMessage는 모델, 환경, 도구 및 사용자를 연결하는 범용 메시지 형식으로 작동한다.

원본 기사는 이를 네트워크 패킷에 비유한다: 서로 다른 구성 요소가 각 모델이나 환경에 대한 고유한 통합 없이도 동일한 경량 인터페이스를 통해 정보를 교환할 수 있다는 것이다.

따라서 PenguinHarness는 동시에 다음 모두이다:

  • 에이전트를 실행하는 프레임워크
  • 자신의 구조를 이해하고 확장할 수 있는 에이전트

PenguinHarness 项目架构图

PenguinHarness는 경량 아키텍처에서 PenguinMessage, Penguin SDK 및 Penguin Skills를 결합한다.

프로젝트 아키텍처에서 제시된 세 가지 핵심 영역은 다음과 같다:

구성 요소 역할
PenguinMessage 사용자, 모델, 도구 및 환경 간의 최소 메시지 프로토콜
Penguin SDK 에이전트 애플리케이션 구축을 위한 개발 레이어
Penguin Skills 에이전트 구축, 평가 및 최적화를 위한 재사용 가능한 능력

로컬에서 재현 가능한 자기 진화 루프

에이전트를 구축하는 것은 첫걸음에 불과합니다.

PenguinHarness의 장기 목표는 사용자가 시스템 전체를 수동으로 재구축하지 않고도 로컬에서 평가하고 최적화할 수 있는 에이전트를 운영할 수 있게 하는 것입니다.

이 프로젝트는 두 단계를 구분합니다:

  • 에이전트 구축: 0에서 1까지
  • 에이전트 최적화: 1에서 100까지

에이전트를 수정하는 것은 비교적 쉽습니다. 프롬프트, 코드, 스킬, 구성이 모두 편집 가능하기 때문입니다. 그러나 변경 사항이 실제로 에이전트를 더 나아지게 만들었는지 판단하는 것은 훨씬 어렵습니다.

대규모 언어 모델은 확률적이며, 에이전트 시스템은 도구, 환경, 메모리, 다단계 의사결정을 통해 더 많은 불확실성을 도입합니다.

따라서 신뢰할 수 있는 개선 루프에는 신뢰할 수 있는 측정 시스템이 필요합니다.

평가가 기반인 이유

에이전트가 단일 예시에서는 더 나은 성능을 보일 수 있지만, 전체적으로는 더 나빠질 수 있습니다.

구조화된 벤치마크가 없다면 최적화 프로그램은 다음을 수행할 수 있습니다:

  • 소수의 데모 샘플에 과적합
  • 답변을 암기
  • 평가자의 약점을 이용
  • 품질 향상 없이 비용 증가
  • 한 작업을 개선하면서 다른 작업을 손상
  • 보상 해킹 수단으로 더 높은 점수 획득

PrismShadow 팀은 자기 진화 에이전트를 평가하는 방법을 탐구하는 데 6개월 이상을 보냈습니다.

핵심 과제는 훈련 경험과 유보 테스트를 명확히 구분하는 벤치마크가 부족하다는 점이었습니다.

에이전트가 평가에 사용된 동일한 문제 세트에서 개선된다면, 재사용 가능한 전략을 학습했는지 아니면 단순히 답변을 암기했는지 판단하기 어렵습니다.

GDPevo가 훈련 작업과 테스트 작업을 구분

팀은 실제 비즈니스 프로세스를 기반으로 한 진화 네이티브 벤치마크인 GDPevo를 만들었습니다.

원본 기사는 의료, 금융, 법무 작업 등의 분야에서의 적용 범위를 설명합니다. 현재 공개된 V2 코드베이스에는 24개 작업 그룹의 240개 작업이 포함되어 있으며, 적용 분야는 다음과 같습니다:

  • CRM
  • ERP
  • 금융
  • 의료
  • 법무 워크플로우
  • 데이터 분석
  • 엔지니어링 운영

각 작업 그룹에는 다음이 포함됩니다:

  • 공유 비즈니스 환경
  • 5개의 훈련 작업
  • 5개의 유보 테스트 작업

GDPevo는 규칙 혼합이라는 방법을 사용합니다. 비즈니스 프로세스는 더 작은 규칙으로 분해되어 훈련 작업에 분산되고, 유보 테스트 작업에서 재조합됩니다.

이 구조는 에이전트가 테스트 답변을 미리 보지 않고 재사용 가능한 워크플로우를 학습했는지 판단하는 데 도움이 됩니다.

GDPevo 模型评测排行榜

GDPevo는 다양한 형태의 진화 후 에이전트가 유보 비즈니스 작업에서 얼마나 개선되었는지 평가합니다.

GDPevo 논문 보고

자기 진화는 실험에서 유보 정확도를 최대 16.44퍼센트 포인트 향상시켰습니다. 또한 진화된 최고 에이전트는 완전 정보 하의 이상적 상한인 91.6%에 여전히 크게 미치지 못한다고 지적합니다.

이 격차는 중요합니다. 현재 에이전트는 개선될 수 있지만, 신뢰할 수 있는 자기 진화는 아직 해결된 문제와는 거리가 멀습니다.

PenguinHarness가 평가를 스킬로 패키징

PenguinHarness는 GDPevo 뒤의 핵심 아이디어를 재사용 가능한 스킬로 전환하여 다음에 사용합니다:

  • 에이전트 생성
  • 벤치마크 설계
  • 에이전트 평가
  • 에이전트 최적화

관련 스킬이 호출된 후, 여러 에이전트가 협력하여 개선 프로세스에 참여할 수 있습니다.

원본 기사는 스포츠 예측, 투자 전략 생성, 전자상거래 지원 등의 작업을 위해 설계된 에이전트 예시를 제공합니다.

사용자는 프롬프트와 워크플로우를 수동으로 수정할 필요 없이, PenguinHarness가 평가 세트를 생성하고 반복 테스트를 실행하며 실패 원인을 분석하고 더 나은 버전을 제안하도록 할 수 있습니다.

프로젝트 데모 보고서에 따르면, 여러 차례의 반복 후 점수가 53점에서 95점으로 향상되었으며, DeepSeek V4 Flash 모델의 토큰 비용은 약 0.5위안이었습니다.

이는 프로젝트 팀의 데모 결과이며, 일반적인 벤치마크 보장이 아닙니다. 실제 효과는 작업, 채점 기준, 모델, 샘플 규모, 최적화 예산에 따라 다를 수 있습니다.

4단계 최적화 프로세스

자기 진화 워크플로우는 역할이 분담된 여러 에이전트를 사용합니다.

1. 평가 조직

최적화 에이전트는 필요한 문제 수와 반복 횟수를 결정한 후 여러 평가 에이전트를 병렬로 시작합니다.

병렬 평가는 여러 작업을 테스트하거나 반복 실행하는 데 필요한 시간을 단축하는 데 도움이 됩니다.

2. 독립 채점

각 평가 에이전트는 대상 에이전트의 독립 복사본을 시작하고 작업 하나를 해결하도록 요청합니다.

평가 에이전트는 채점 기준에 접근할 수 있지만, 대상 에이전트는 접근할 수 없습니다.

이 격리는 대상 에이전트가 숨겨진 채점 지시를 직접 최적화하는 것을 방지하기 위한 것입니다.

3. 분석 및 개선

최적화 에이전트는 결과를 수집하고 실행 궤적을 검토합니다.

득점 실패 원인을 파악한 후 대상 에이전트의 승인된 부분을 수정합니다. 예를 들어:

  • 프롬프트
  • 스킬
  • 구성
  • 워크플로우 파일

최적화 에이전트는 다음 버전의 후보를 생성합니다.

4. 검증 및 반복

평가 에이전트는 후보 버전을 다시 테스트합니다.

후보 버전이 엄격히 더 높은 점수를 얻은 경우에만 최적화 에이전트가 수락합니다. 점수가 동일하거나 하락하면 프레임워크는 이전 버전으로 롤백합니다.

PenguinHarness 自进化工作流

최적화 에이전트는 병렬 평가 에이전트를 조정하며 더 높은 점수를 얻은 후보 에이전트만 수락합니다.

이 프로세스는 다음과 같이 요약할 수 있습니다:

대상 에이전트 vN
      ↓
병렬 평가 에이전트
      ↓
점수, 채점 기준 및 실행 궤적
      ↓

최적화 에이전트
      ↓
프롬프트, 스킬 또는 구성 업데이트
      ↓
후보 에이전트 vN+1
      ↓
점수가 엄격히 더 높은 경우에만 수락

이러한 숨겨진 채점 기준, 유보 테스트, 스냅샷, 엄격한 점수 향상의 조합 설계는 최적화를 더 재현 가능하게 만들기 위한 것입니다.

테스트 프레임워크와 자기 진화 에이전트 간의 계약

자기 진화는 명백한 안전 문제를 제기합니다: 에이전트가 무엇을 변경할 수 있는가?

PenguinHarness는 **CONTRACT.md**라는 이식 가능한 파일에서 이러한 경계를 정의합니다.

이 계약은 능력이 승인된 영역 내에서 향상될 수 있으며, 테스트 프레임워크 커널과 보안 경계는 고정되어 유지된다고 규정합니다.

GDPevo 模型评测排行榜

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/e5026929-6776-4554-9898-0bb26c98a90b-22347c95-602e-479c-97e6-268a5f43988a.png)

CONTRACT.md는 에이전트 진화, 감사, 버전 관리, 자격 증명 격리의 경계를 정의합니다.

원문 기사는 네 가지 핵심 규칙을 강조합니다.

1. 진화는 테스트 프레임워크 커널을 수정할 수 없음

편집 가능한 영역은 워크스페이스, 프롬프트, 스킬, 승인된 구성으로 제한됩니다.

에이전트는 핵심 테스트 프레임워크나 보안 메커니즘을 재작성할 수 없습니다.

이로 인해 최적화 과정이 다음을 약화시킬 위험이 줄어듭니다:

  • 도구 승인
  • 권한 제어
  • 감사 로그
  • 자격 증명 격리
  • 버전 복원
  • 기타 시스템 수준 보안 검사

2. 모든 최적화에는 스냅샷이 필요함

최적화 라운드 전에 프레임워크는 에이전트 상태의 버전 스냅샷을 저장합니다.

후보 에이전트가 성능이 더 나쁘거나 원치 않는 부작용을 유발하는 경우, 시스템은 이전 버전으로 롤백할 수 있습니다.

롤백 기능이 없는 자기 개선 시스템은 손상이 누적될 수 있습니다. 버전 관리는 개선을 되돌릴 수 있게 만듭니다.

3. 대상 에이전트는 평가 기준을 볼 수 없음

대상 에이전트는 작업을 받지만 숨겨진 평가 기준은 받지 않습니다.

평가 기준에 접근할 수 있는 것은 평가자뿐입니다.

이는 지름길 행동, 답변 암기, 보상 해킹을 줄이기 위한 것입니다.

이러한 위험을 완전히 제거하지는 못하지만, 문제 해결과 결과 판정 사이에 더 명확한 분리를 만듭니다.

4. 모든 최적화는 감사 가능해야 함

모델 요청, 도구 호출, 토큰 사용량, 시간, 실패, 승인, 최적화 변경 사항이 추적 파일에 기록됩니다.

사용자는 무엇이 변경되었는지, 왜 변경되었는지 확인할 수 있습니다.

더 넓은 프로젝트 계약에는 다음도 포함됩니다:

  • 도구 실행 전 승인
  • 승인 결정에 대한 감사 기록
  • 자격 증명 격리
  • 모델과 에이전트의 분리
  • 복구 가능한 실행 궤적
  • 요청 시 관련 파일 로드
  • 명확한 오류 처리 규칙

최종적으로 만들어지는 것은 에이전트가 진화할 수 있지만, 진화 과정이 가시적이고 되돌릴 수 있는 프레임워크입니다.

기타 유용한 PenguinHarness 기능

PenguinHarness는 자동화된 에이전트 생성 및 최적화 외에도 여러 기능을 포함합니다.

모델 훈련을 위한 내장 스킬 및 배포

프로젝트에는 AI 애플리케이션 개발과 관련된 스킬이 내장되어 있습니다:

  • penguin-sdk
  • penguin-cli
  • agenthub-models
  • vllm
  • ollama
  • llamafactory

PenguinHarness 内置技能界面

PenguinHarness는 에이전트 구축과 vLLM, Ollama, LlamaFactory 같은 도구와의 협업을 위한 스킬을 포함합니다.

이러한 스킬을 통해 사용자는 자연어로 훈련 또는 배포 작업을 설명할 수 있으며, 에이전트가 필요한 파일이나 명령을 준비합니다.

공식 저장소는 내장 스킬을 네 가지 주요 범주로 분류합니다:

스킬 그룹 예시
사무 효율 데이터 분석 및 웹 데이터 수집
소프트웨어 개발 웹 디자인 및 소프트웨어 엔지니어링
AI 애플리케이션 개발 Penguin SDK, 모델 게이트웨이, vLLM, Ollama, LlamaFactory
에이전트 튜닝 에이전트 생성, 벤치마크 설계, 평가, 최적화

사용자와 에이전트는 추가 스킬을 만들거나 개선할 수도 있습니다.

통합 모델 게이트웨이

PenguinHarness는 모델 프리셋을 내장하고 있으며 OpenAI 호환 인터페이스를 사용자 정의로 지원합니다.

프로젝트에 따르면 지원되는 제공업체와 게이트웨이를 통해 사용자는 1000개 이상의 온라인 및 로컬 모델을 사용할 수 있습니다.

OpenRouter 模型列表

모델 게이트웨이를 통해 사용자는 다양한 온라인 및 로컬 모델 제공업체를 구성할 수 있습니다.

현재 저장소에는 다음 모델 시리즈가 나열되어 있습니다:

  • DeepSeek
  • Kimi
  • GLM
  • Hunyuan
  • Qwen
  • GPT
  • Gemini
  • Claude

모델의 가용성과 제공업체 이름은 자주 변경되므로, 앱 내 '모델' 페이지와 현재 공식 문서를 최신 정보 소스로 간주해야 합니다.

텍스트 모델을 위한 비전 에이전트

원문 기사는 DeepSeek과 같은 텍스트 중심 모델을 메인 에이전트로 사용하면서, 비전 능력을 갖춘 모델을 비전 보조자로 사용하는 개발 패턴을 설명합니다.

비전 에이전트는 다음을 검사할 수 있습니다:

  • 웹 스크린샷
  • 슬라이드
  • 인터페이스 레이아웃
  • 렌더링된 게임 화면
  • 차트
  • 시각적 오류

메인 모델은 이후 비전 설명을 바탕으로 출력을 수정할 수 있습니다.

DeepSeek V4 Flash 游戏截图分析

비전 능력을 갖춘 에이전트가 스크린샷을 검사할 수 있으며, DeepSeek는 여전히 주요 작업 모델로 사용됩니다.

이는 메인 모델이 코딩이나 추론에 강하지만 이미지를 기본적으로 처리하지 못할 때 유용합니다.

이 기술은 메인 모델이 직접 비전 능력을 얻는 것은 아닙니다. 비전 모델이 스크린샷을 메인 에이전트가 사용할 수 있는 정보로 변환하는 멀티모델 워크플로우를 만듭니다.

세밀한 추적 분석

PenguinHarness는 모델 호출, 도구 실행, 타이밍, 토큰 사용량, 승인, 하위 에이전트 활동을 기록합니다.

Trace 인터페이스는 실행 순서를 타임라인 형태로 표시합니다.

PenguinHarness Trace 分析界面

Trace 뷰는 사용자가 병렬 하위 에이전트, 모델 호출, 도구 사용, 지연 시간 및 토큰 비용을 확인하는 데 도움을 줍니다.

이를 통해 다음을 식별할 수 있습니다:

  • 느린 모델 호출
  • 불필요한 도구 사용
  • 비용이 많이 드는 추론 루프
  • 실패한 재시도
  • 워크플로우를 차단하는 하위 에이전트
  • 장기간 지속되는 승인 지연
  • 토큰 집약적인 프롬프트
  • 병렬 실행 기회

Trace 데이터는 최적화 프로그램이 이전 버전이 왜 점수를 잃었는지에 대한 증거를 필요로 하기 때문에 자기 진화의 핵심이기도 합니다.

최소화된 빈 에이전트 템플릿

PenguinHarness는 단순한 자동화 빌더가 아닌 최소화된 범용 에이전트로도 사용할 수 있습니다.

이 프로젝트는 Shell을 범용 저수준 인터페이스로 사용하며, 기본 도구 세트를 의도적으로 작고 간결하게 유지합니다.

또한 하위 에이전트 실행을 핵심 성능 특성으로 간주합니다.

소스 코드 보고서에 따르면 기본 시스템 프롬프트는 약 1,300개 토큰이며, 프로젝트 내 Claude Code의 비교 값은 약 15,000개 토큰입니다.

이 수치는 프로젝트가 자체적으로 보고한 것으로, 두 제품의 발전에 따라 변경될 수 있습니다.

기본 설계 원칙은 안정적입니다. 더 짧은 프롬프트와 더 작은 도구 세트는 토큰 오버헤드를 줄이고 오픈 모델을 더 쉽게 사용할 수 있게 합니다.

비용 및 벤치마크 테스트 결과

이 프로젝트는 복잡한 데이터 분석 제품군에서 비교 결과를 공개했습니다.

智能体数据分析性能对比

프로젝트는 복잡한 데이터 분석 비교에서 모델 비용의 극히 일부만으로 더 높은 정확도를 달성했다고 보고합니다.

공개된 데이터 테이블 보고:

프레임워크 모델 정확도 토큰 사용량 예상 비용
PenguinHarness DeepSeek V4 Pro 66.67% 18.04M $0.55
Claude Code Claude Opus 4.8 53.33% 22.20M $38.48
OpenAI Codex GPT-5.5 53.33% 13.72M $19.41

프로젝트는 이를 다음과 같이 요약합니다:

  • 보고 값의 1/35

Codex 비용

  • 보고된 Claude Code 비용의 약 1/70

이 비교는 도구 체인을 일반적으로 함께 사용되는 모델과 결합하여 비교합니다. 도구 체인의 기여도를 선택한 모델 및 공급업체 가격 책정의 기여도와 분리하지 않습니다.

공정한 내부 평가를 위해 팀은 다음 조건으로 동일한 작업을 실행해야 합니다:

  • 가능하면 동일한 모델 사용
  • 동일한 공급업체 가격 책정
  • 동일한 재시도 전략
  • 동일한 도구 액세스 권한
  • 동일한 시간 제한
  • 동일한 평가 기준
  • 여러 번 반복 실행

공개 데이터는 프로젝트 벤치마크 참고 자료로 활용할 수 있지만, 모든 작업에 적용되는 일반적인 비용 비율로 해석해서는 안 됩니다.

보고된 프로덕션 배포 사례

소스 문서에서는 팀이 두 가지 프로덕션 시나리오에서 PenguinHarness를 사용했다고 밝혔습니다.

의료 보고서 검토

한 건강검진 기관이 PenguinHarness를 사용하여 보고서 검토 에이전트를 만들었다고 하며, 그 성능은 의학 전문가와 견줄 만한 수준으로 설명됩니다.

프로젝트 팀에 따르면, 원래 약 30분이 걸리던 검토 작업이 수십 초 안에 완료될 수 있습니다.

제조업 검사

한 제조 기업이 PenguinHarness를 기반으로 구축한 여러 에이전트를 배포하여 생산 라인 장비를 지속적으로 모니터링하고 자동 복구를 시도한다고 합니다.

팀이 보고한 내용:

  • 가동 중단 시간 65% 감소
  • 생산량이 원래의 거의 두 배로 향상

위는 공급업체가 제공한 사례 연구 데이터입니다. 원본 보고서에는 고객 이름, 연구 설계, 표본 크기, 기준선 정의 또는 독립 감사 정보가 포함되어 있지 않습니다.

이는 보장된 운영 결과가 아닌 보고된 사용 사례의 예시로 간주해야 합니다.

설치 및 배포

PenguinHarness는 Linux, macOS, Windows 10 이상을 지원하며, 가능한 경우 x64 및 Arm64 시스템을 지원합니다.

한 줄 설치 스크립트에는 자체 Node.js 런타임이 포함되어 있습니다. npm을 통한 설치는 Node.js 24 이상이 필요합니다.

Linux 또는 macOS

curl -fsSL https://penguin.ooo/install.sh | sh
penguin web

웹 인터페이스는 다음 주소에서 열립니다:

http://127.0.0.1:7364

Windows PowerShell

irm https://penguin.ooo/install.ps1 | iex
penguin web

npm

npm install -g @prismshadow/penguin-cli
penguin web

CLI 설치에서 첫 웹 로그인은 사용자 이름 admin을 사용합니다. 초기 비밀번호는 서버가 처음 시작될 때 출력되며, 즉시 변경해야 합니다.

모델 구성 및 작업 실행

공식 저장소에서는 다음과 유사한 CLI 예시를 제공합니다:

penguin config model add \
  --provider deepseek \
  --model-id deepseek-v4-flash \
  --api-key sk-... \
  --set-default

일회성 작업 실행:

penguin run -m "Hello, Penguin이 포함된 hello.txt 생성"

대화형 세션 시작:

penguin chat

헤드리스 서버 시작:

penguin server

API 키는 절대 소스 코드 관리 시스템에 커밋하거나 공개 로그에 붙여넣어서는 안 됩니다.

PenguinHarness는 로컬 머신 또는 서버에서 실행할 수 있습니다. 브라우저 인터페이스는 다중 세션, 에이전트 및 스킬 관리, 모델 구성, 사용 통계, Trace 관찰 가능성 및 평가 워크플로우를 지원합니다.

프로젝트는 현재 일부

데스크톱 빌드가 서명되지 않아 첫 실행 시 운영 체제 경고가 발생할 수 있음을 명시합니다. 사용자는 공식 웹사이트에서만

GitHub Releases에서 설치 프로그램을 다운로드하고, 경고를 우회하기 전에 프로젝트 설명을 확인하세요.

PenguinHarness 배후 팀

PenguinHarness는 PrismShadow가 오픈소스로 공개했으며, 이 팀은 2025년에 설립되어 비즈니스 지식, 워크플로우 및 피드백에서 학습하는 에이전트 인프라를 구축하는 데 주력하고 있습니다.

원본 보고서에 명시된 창립 팀은 다음과 같습니다:

팀 구성원 배경
정야오웨이 LlamaFactory 창시자, 접근 가능한 모델 및 에이전트 인프라에 주력
첸부웨 UC 데이비스 박사, 전 IBM T. J. Watson 연구원, 전复旦大学 교수
우쉐쥔 바이두 NLP 창립 멤버, 알리바바 및 JD 디지털에서 고위 직책 역임
후쥔하오 북경대학교 박사 과정, 모델 및 캐시 효율성 연구 참여
천시 뉴욕대학교 경영대학 교수, 카네기멜론대학교 박사, 전 아마존 수석 과학자

출처의 개인 소개는 게시자와 프로젝트 팀이 제공한 것입니다. 이 정보가 취업 또는 학술 검증에 실질적인 영향을 미치는 경우, 독자는 공식 기관 페이지를 통해 확인해야 합니다.

LlamaFactory에서 PenguinHarness까지, 팀이 선언한 목표는 일관됩니다: 복잡한 AI 인프라를 더 쉽게 사용하고, 더 안정적이며, 더 효율적인 도구로 전환하여 더 넓은 사용자층에게 서비스를 제공하는 것입니다.

자주 묻는 질문

PenguinHarness란 무엇인가요?

PenguinHarness는 AI 에이전트를 구축, 실행, 평가 및 최적화할 수 있는 오픈소스 에이전트 프레임워크입니다. 웹 인터페이스, CLI, SDK, 내장 스킬, 모델 구성, 추적 및 다중 에이전트 평가 워크플로우를 제공합니다.

PenguinHarness는 무료이고 오픈소스인가요?

네. 핵심 코드베이스는 Apache 2.0 라이선스로 배포됩니다. 사용자는 여전히 워크로드에서 발생하는 모델 API, 인프라 또는 타사 서비스 비용을 부담해야 합니다.

PenguinHarness를 로컬에서 실행할 수 있나요?

네. Linux, macOS 및 Windows에서 실행할 수 있으며, 데스크톱 애플리케이션으로도, CLI 및 브라우저 인터페이스를 통해서도 사용할 수 있습니다. 또한 서버에 설치하여 원격으로 사용할 수도 있습니다.

PenguinHarness는 로컬 모델을 지원하나요?

네. Ollama 및 vLLM과 같은 도구와 관련된 스킬과 통합 기능을 포함하며, OpenAI 호환 사용자 정의 엔드포인트를 지원합니다. 실제 호환성은 모델의 API 동작 및 요구 기능에 따라 달라집니다.

PenguinHarness에서 자기 진화(self-evolution)란 무엇을 의미하나요?

자기 진화란 시스템이 에이전트를 평가하고, 점수와 추적 기록을 분석하며, 승인된 프롬프트, 스킬 또는 구성을 수정하고, 후보 차기 버전을 테스트하는 것을 의미합니다. 구성된 평가 기준에서 더 우수한 성능을 보일 때만 후보 버전이 승인됩니다.

자기 진화 에이전트가 PenguinHarness 커널을 수정할 수 있나요?

프로젝트 계약에 따르면 불가능합니다. 진화는 워크스페이스, 프롬프트, 스킬 및 승인된 구성으로만 제한되며, 프레임워크 커널과 보안 메커니즘은 변경되지 않습니다.

¥0.2 에이전트 구축 비용은 보장되나요?

아니요. ¥0.2 수치는 DeepSeek V4 Pro를 사용하여 RAG 애플리케이션을 생성한 프로젝트 데모에서 나온 것입니다. 실제 비용은 모델 가격, 토큰 사용량, 재시도 횟수, 제공업체 및 작업 복잡도에 따라 달라집니다.

GDPevo란 무엇인가요?

GDPevo는 에이전트가 분리된 실제 비즈니스 작업에서 자기 진화 능력을 측정하는 공개 벤치마크입니다. 공개된 V2 버전은 24개 그룹의 240개 작업을 포함하며 훈련 작업과 테스트 작업을 구분합니다.

관련 도구

  • PenguinHarness: 공식 웹사이트로, 다운로드, 문서, 제품 예시 및 설치 안내를 제공합니다.
  • PenguinHarness GitHub 저장소: Apache 2.0 소스 코드, README, 버전 릴리스, 명령줄 예시 및 기여 가이드.
  • GDPevo: 벤치마크 데이터, 구축 프로세스, 평가 워크스페이스 및 발표된 실험 결과.
  • LlamaFactory: 언어 모델 및 비전-언어 모델의 효율적인 파인튜닝을 위한 정야오웨이의 오픈소스 프레임워크.
  • vLLM: 로컬 및 서버 측 고처리량 모델 추론을 위한 오픈소스 엔진.
  • Ollama: 에이전트 개발 워크플로우에 사용할 수 있는 로컬 모델 런타임.
  • OpenRouter: 여러 호스팅 모델 제공업체에 접근하기 위한 통합 API 게이트웨이.

관련 링크

요약

PenguinHarness는 에이전트가 자연어 요구사항에 따라 다른 에이전트 애플리케이션을 구축할 수 있도록 허용하는 오픈소스 플랫폼입니다. 스캐폴딩, 프롬프트, 스킬, 구성, 코드, 프론트엔드 및 실행 지침을 생성할 수 있으며, 호스팅 모델과 로컬 모델을 모두 지원합니다.

장기적인 초점은 자기 진화입니다. 여러 평가 에이전트가 대상 에이전트를 점수화하고, 최적화 프로그램이 결과와 실행 궤적을 분석하며, 후보 버전이 더 높은 점수를 얻을 때만 승인됩니다. CONTRACT.md는 변경 가능한 내용을 제한하고 스냅샷, 롤백, 숨겨진 평가 기준, 승인, 자격 증명 격리 및 감사 기록을 요구합니다.

이 프로젝트는 상당한 비용 절감과 초기 생산 효과를 보고했지만, 이러한 수치는 팀이 제공한 데모 및 사례 연구일 뿐 보편적으로 적용 가능한 결론은 아닙니다.

보장은 없습니다. Apache 2.0 저장소, 공개된 명령 및 GDPevo 벤치마크는 개발자가 자신의 워크로드에서 이 방법을 테스트할 수 있는 충분한 자료를 제공합니다.

PenguinHarness의 핵심 아이디어는 간단합니다: 에이전트 구축은 자동화할 수 있어야 하지만, 안전하게 개선하려면 측정 가능한 평가, 엄격한 경계 및 되돌릴 수 있는 변경이 필요합니다.

PenguinHarness 以仅 0.2 元构建并自我改进 AI 代理