PenguinHarness、わずか0.2元でAIエージェントを構築し自己改善
LlamaFactoryは、より幅広い開発者層が大規模モデルのファインチューニングを行いやすくします。現在、その作者である鄭耀威氏とPrismShadowチームは、同じ使いやすさの理念を...

PenguinHarnessはわずか0.2元でAIエージェントを構築・自己改善できる
はじめに
LlamaFactoryは、大規模モデルのファインチューニングをより幅広い開発者層にとって容易なものにしました。現在、その創設者である鄭耀威氏とPrismShadowチームは、同じ「使いやすさ最優先」のアプローチをAIエージェントに適用しています。
彼らの新しいオープンソースプロジェクト PenguinHarness は、エージェントのライフサイクルにおける3つの段階を自動化することを目的としています:
- エージェントアプリケーションの構築
- そのパフォーマンスの評価
- プロンプト、スキル、設定の継続的な改善
ユーザーは手動でフレームワークを選択したり、ツールを接続したり、プロンプトを書いたり、インターフェースを構築したり、結果を繰り返しテストしたりする必要はありません。要件を説明するだけで、PenguinHarnessが実行可能なエージェントアプリケーションを組み立ててくれます。

PenguinHarnessは、デスクトップおよびサーバー展開向けのオープンソース自動エージェント構築ツールです。
このプロジェクトは軽量で、Apache 2.0ライセンスでオープンソース化されており、Linux、macOS、Windowsシステムをサポートしています。ローカルで実行することも、ブラウザインターフェースを介してリモートサーバー上で使用することもできます。
PenguinHarnessはまた、内蔵プリセットとOpenAI互換インターフェースを通じて、オンラインおよびローカルモデルをサポートしています。公式リポジトリには現在、DeepSeek、Kimi、GLM、Qwen、OpenAI、Google、Anthropicなどのプロバイダーからの最新モデルがリストされています。
元のレポートでは、わずか 0.2元のモデルトークン費用 で生成できるRAGアプリケーションについて説明されています。公式プロジェクトページに示されている同じ例は、約 0.02ドル(DeepSeek V4 Pro使用時) です。
この数字はプロジェクトのデモデータであり、保証された固定価格ではありません。実際のコストは、選択したモデル、プロバイダー、プロンプトの複雑さ、再試行回数、アプリケーションの範囲、およびトークン価格によって異なります。
エージェントが別のエージェントを構築する
PenguinHarnessは単純な理念から始まります:エージェントは自然言語の要件に基づいて別のエージェントアプリケーションを構築できるべきです。
これは、「AIのためのAI」や再帰的自己改善に関するより広範な議論に適合します——AIシステムが他のAIシステムの作成、テスト、または改善を支援するというものです。
元の記事で示された最初のユースケースでは、システムが以下を行うRAGアプリケーションを構築することが要求されました:
- チャンク単位での情報検索
- 明確な回答のストリーミング出力
- 引用元の含有
- 利用可能なフロントエンドインターフェースの提供
- 完全なアプリケーションとして実行可能
比較テストでは、PenguinHarnessとコーディングエージェントを並べて、両システムに類似したタスクを実行するよう要求しました。
プロジェクトのデモによると、PenguinHarnessはより高速で、より少ないトークンコストでアプリケーションを完成させました。その結果には、流暢な回答、ストリーミング出力、リンクされた引用元が含まれていました。
レポートで示された競合他社の出力には、言語が混在する問題があり、同じストリーミング動作はありませんでした。
これらの例は有用なデモですが、PenguinHarnessがあらゆるシナリオで全てのコーディングエージェントよりも優れていることを普遍的に証明するものではありません。結果は、モデル、エージェント設定、タスク設計、評価方法に大きく依存します。
要件から実行可能なアプリケーションへ
従来のエージェント開発では、通常複数の手動段階が必要です:
- エージェントフレームワークの選択
- モデルの選択と設定
- ツールと外部サービスの接続
- システムプロンプトの作成
- メモリとワークフローロジックの定義
- 評価テストケースの構築
- エージェントのテストと修正
- フロントエンドまたは配信インターフェースの作成
- デプロイ用アプリケーションのパッケージング
PenguinHarnessは、これらのステップをエージェント駆動の単一ワークフローに変換しようと試みます。
要件が明確な場合、システムは以下を生成できます:
- アプリケーションのスキャフォールド
- エージェントのプロンプト
- スキルとツールの定義
- 設定ファイル
- 補助コード
- フロントエンド
- インストール手順
- 実行手順
- 反復的な修正と最適化
公式プロジェクトの例では、以下のリクエストが使用されました:
https://github.com/ericbuess/claude-code-docs のドキュメントを収集し、Claude Codeに関する質問に設定の専門家として答え、その出典を引用するRAGアプリケーションを構築してください。
プロジェクトレポートによると、DeepSeek V4 Proを使用して構築された場合、生成されたRAGアプリケーションは約 $0.02(すなわち¥0.2)のモデルトークン を消費しました。
ファイルシステムが事実の源泉
PenguinHarnessは、ファイルを人間とエージェントの間の主要なコラボレーション層として使用します。
この設計では:
- エージェントはファイルによって表現されます
- プロンプトはファイルです
- スキルはファイルです
- 設定はファイルに保存されます
- 会話と実行情報は保存された記録を通じて追跡できます
- 必要なファイル構造を組み立てたりコピーしたりすることで、新しいエージェントを作成できます
このアプローチにより、エージェントの検査と修正が容易になります。
PenguinHarnessは、重要な動作を大規模なアプリケーションフレームワーク内に隠すのではなく、編集可能なファイルを主要なインターフェースとして使用します。人間はこれらのファイルを読み取って修正でき、エージェントは承認された最適化プロセスを通じてそれらを改善できます。
このツールは、それらのファイルを実行可能なエージェントオブジェクトに組み立てる役割を担います。
PenguinMessageが統一プロトコルを提供
実行時には、PenguinMessage がモデル、環境、ツール、ユーザーを接続する共通メッセージ形式として機能します。
元の記事ではこれをネットワークパケットに例えています:異なるコンポーネントは、モデルや環境ごとに独自の統合を必要とせずに、同じ軽量インターフェースを通じて情報を交換できます。
したがって、PenguinHarnessは次の両方です:
- エージェントを実行するフレームワーク
- 自身の構造を理解し拡張できるエージェント

PenguinHarnessは軽量アーキテクチャの中でPenguinMessage、Penguin SDK、Penguin Skillsを組み合わせています。
プロジェクトアーキテクチャに示されている3つの中核領域は以下の通りです:
| コンポーネント | 役割 |
|---|---|
| PenguinMessage | ユーザー、モデル、ツール、環境間の最小メッセージプロトコル |
| Penguin SDK | エージェントアプリケーションを構築するための開発層 |
| Penguin Skills | エージェントを構築、評価、最適化するための再利用可能な能力 |
ローカルで再現可能な自己進化ループ
エージェントを構築することは、ほんの第一歩にすぎない。
PenguinHarnessの長期的な目標は、ユーザーがシステム全体を手動で再構築することなく、ローカルで評価・最適化できるエージェントを運用できるようにすることだ。
このプロジェクトでは、2つのフェーズを区別している:
- エージェントを構築する: ゼロからワンへ
- エージェントを最適化する: ワンからハンドレッドへ
エージェントの修正は比較的容易だ。プロンプト、コード、スキル、設定はすべて編集可能だからだ。しかし、その変更が本当にエージェントを改善したかどうかの判断は、はるかに難しい。
大規模言語モデルは確率的であり、エージェントシステムはツール、環境、メモリ、多段階の意思決定を通じて、さらなる不確実性をもたらす。
したがって、信頼性の高い改善ループには、信頼性の高い測定システムが必要となる。
評価が基盤である理由
エージェントは、単一のサンプルでは改善しているように見えても、全体としては悪化することがある。
構造化されたベンチマークがなければ、オプティマイザーは以下のような問題を起こしうる:
- 少数のデモサンプルへの過適合
- 答えの丸暗記
- 評価器の弱点の悪用
- コスト増加を伴う品質向上の欠如
- あるタスクの改善が別のタスクの低下を招く
- リワードハッキングによるスコアの水増し
PrismShadowチームは、自己進化型エージェントの評価方法を探求するために6か月以上を費やした。
中核的な課題は、トレーニング経験と保持テストを明確に区別できるベンチマークが不足していることにある。
エージェントが評価に使用されたのと同じ問題群で改善した場合、それが再利用可能な戦略を学習したのか、それとも単に答えを記憶したのかを判断するのは難しい。
GDPevoはトレーニングタスクとテストタスクを区別する
チームは、実業務プロセスに基づく進化ネイティブなベンチマーク、GDPevoを作成した。
元の論文では、医療、金融、法務業務などの領域をカバーしていることが述べられている。現在公開されているV2コードベースには、24のタスクグループにわたる240のタスクが含まれており、その領域は以下の通り:
- CRM
- ERP
- 金融
- 医療
- 法務ワークフロー
- データ分析
- エンジニアリング運用
各タスクグループには以下が含まれる:
- 共有のビジネス環境
- 5つのトレーニングタスク
- 5つの保持テストタスク
GDPevoは、ルール混合と呼ばれる手法を使用している。ビジネスプロセスはより小さなルールに分解され、トレーニングタスクに分散され、保持テストタスクで再構成される。
この構造は、エージェントがテストの答えを事前に見ただけでなく、再利用可能なワークフローを学習したかどうかの判断に役立つ。

GDPevoは、さまざまな形の進化後に、エージェントが保持されたビジネスタスクでどの程度改善されたかを評価する。
GDPevo論文の報告によると、自己進化により実験では保持精度が最大16.44パーセントポイント向上した。また、進化後の最良のエージェントでも、完全な情報下での理想的な上限である91.6%には依然として遠く及ばないことも指摘されている。
このギャップは極めて重要だ。現在のエージェントは改善可能だが、信頼性の高い自己進化はまだ解決にはほど遠い。
PenguinHarnessは評価をスキルとしてパッケージ化する
PenguinHarnessは、GDPevoの背後にある中核的なアイデアを再利用可能なスキルに変換し、以下の用途に用いる:
- エージェント作成
- ベンチマーク設計
- エージェント評価
- エージェント最適化
関連スキルを呼び出した後、複数のエージェントが協力して改善プロセスに参加できる。
元の記事では、スポーツ予測、投資戦略生成、ECサポートなどのタスク向けに設計されたエージェントの例が示されている。
ユーザーはプロンプトやワークフローを手動で修正する必要はなく、PenguinHarnessに評価セットの作成、反復テストの実行、失敗原因の分析、より良いバージョンの提案を任せるだけでよい。
プロジェクトのデモレポートによると、複数回の反復の後、スコアは53点から95点に向上し、DeepSeek V4 Flashを使用したモデルのトークンコストは約0.5人民元だった。
これはプロジェクトチームによるデモ結果であり、一般的なベンチマークの保証ではない。実際の効果は、タスク、採点基準、モデル、サンプル数、最適化予算によって異なる。
4ステップの最適化フロー
自己進化ワークフローでは、役割分担された複数のエージェントが使用される。
1. 評価の組織化
オプティマイザーエージェントが必要な問題数と反復回数を決定し、その後、複数の評価エージェントを並行して起動する。
並行評価は、複数のタスクや反復実行のテストに必要な時間を短縮するのに役立つ。
2. 独立採点
各評価エージェントは、ターゲットエージェントの独立したコピーを起動し、1つのタスクの解決を要求する。
評価エージェントは採点基準にアクセスできるが、ターゲットエージェントはアクセスできない。
この分離は、ターゲットエージェントが隠された採点指示に直接最適化することを防ぐことを目的としている。
3. 分析と改善
オプティマイザーエージェントは結果を収集し、実行トレースを検査する。
減点の原因を特定し、ターゲットエージェントの承認済み部分を修正する。例えば:
- プロンプト
- スキル
- 設定
- ワークフローファイル
オプティマイザーエージェントは、候補となる次バージョンを生成する。
4. 検証と反復
評価エージェントは、候補バージョンを再度テストする。
オプティマイザーエージェントは、候補が厳密に高いスコアを獲得した場合のみそれを受け入れる。スコアが同等か低下した場合は、フレームワークは以前のバージョンにロールバックする。

オプティマイザーエージェントは並行評価エージェントを調整し、スコアが高い候補エージェントのみを受け入れる。
このプロセスは次のように要約できる:
ターゲットエージェント vN
↓
並行評価エージェント
↓
スコア、採点基準と実行トレース
↓
オプティマイザーエージェント
↓
プロンプト、スキル、または設定の更新
↓
候補エージェント vN+1
↓
スコアが厳密に高い場合のみ受け入れ
隠れた採点基準、保持テスト、スナップショット、厳密なスコア向上を組み合わせたこの設計は、最適化をより再現可能にすることを目的としている。
テストフレームワークと自己進化エージェントの間の契約
自己進化は、明白なセキュリティ上の問題を提起する: エージェントは何を変更することが許されるのか?
PenguinHarnessは、CONTRACT.md というポータブルファイル内でこれらの境界を定義している。
この契約は、能力は承認された領域内で向上できる一方、テストフレームワークのカーネルとそのセキュリティ境界は固定されたままであることを規定している。

CONTRACT.md は、エージェントの進化、監査、バージョン管理、および認証情報の分離に関する境界を定義しています。
元記事では、4つの核となるルールが強調されています。
1. 進化はテストフレームワークの核を変更できない
編集可能な領域は、ワークスペース、プロンプト、スキル、および承認済み設定に限定されます。
エージェントは、コアテストフレームワークやそのセキュリティメカニズムを書き換えてはなりません。
これにより、最適化プロセスが以下の側面を弱体化させるリスクが軽減されます:
- ツール承認
- 権限制御
- 監査ログ
- 認証情報の分離
- バージョン復元
- その他のシステムレベルのセキュリティチェック
2. 毎回の最適化にはスナップショットが必要
最適化ラウンドの前に、フレームワークはエージェントの状態のバージョンスナップショットを保存します。
候補エージェントのパフォーマンスが低下したり、望ましくない副作用を引き起こした場合、システムは以前のバージョンにロールバックできます。
ロールバック機能のない自己改善システムは、損害を蓄積する可能性があります。バージョン管理により、改善を元に戻すことが可能になります。
3. 対象エージェントは評価基準を見ることができない
対象エージェントはタスクを受け取りますが、隠された評価基準は受け取りません。
評価基準にアクセスできるのは評価者のみです。
これは、近道行動、回答の記憶、および報酬ハッキングを減らすことを目的としています。
これらのリスクを完全に排除することはできませんが、問題解決と結果の評価の間に、より明確な分離を作り出します。
4. 毎回の最適化は監査可能でなければならない
モデルリクエスト、ツール呼び出し、トークン使用量、時間、失敗、承認、および最適化の変更はすべて、追跡ファイルに書き込まれます。
ユーザーは、何が変更されたか、なぜ変更されたかを検査できます。
より広範なプロジェクト契約には、以下の項目も含まれます:
- ツール実行前の承認
- 承認決定の監査記録
- 認証情報の分離
- モデルとエージェントの分離
- 復元可能な実行トレース
- 関連ファイルのオンデマンド読み込み
- 明確なエラー処理ルール
最終的に形成されるのは、エージェントが進化できる一方で、その進化プロセスが可視化され、元に戻せる状態に保たれるフレームワークです。
その他の便利なPenguinHarness機能
PenguinHarnessには、自動化されたエージェント作成と最適化に加えて、複数の機能が含まれています。
モデルトレーニング用の内蔵スキルとデプロイ
プロジェクトには、AIアプリケーション開発に関連するスキルが内蔵されており、以下が含まれます:
penguin-sdkpenguin-cliagenthub-modelsvllmollamallamafactory

PenguinHarnessには、エージェントを構築し、vLLM、Ollama、LlamaFactoryなどのツールと連携するためのスキルが含まれています。
これらのスキルにより、ユーザーは自然言語でトレーニングやデプロイのタスクを記述でき、エージェントが必要なファイルやコマンドを準備します。
公式リポジトリでは、内蔵スキルを4つの主要カテゴリに分類しています:
| スキルグループ | 例 |
|---|---|
| オフィス効率 | データ分析とWebデータ収集 |
| ソフトウェア開発 | Webデザインとソフトウェアエンジニアリング |
| AIアプリケーション開発 | Penguin SDK、モデルゲートウェイ、vLLM、Ollama、LlamaFactory |
| エージェントチューニング | エージェント作成、ベンチマーク設計、評価、最適化 |
ユーザーとエージェントは、追加のスキルを作成または改善することもできます。
統一モデルゲートウェイ
PenguinHarnessにはモデルプリセットが内蔵されており、OpenAI互換のカスタムインターフェースもサポートしています。
このプロジェクトによると、サポートされているプロバイダーとゲートウェイを通じて、ユーザーは1000以上のオンラインおよびローカルモデルを使用できます。

モデルゲートウェイにより、ユーザーは異なるオンラインおよびローカルモデルプロバイダーを設定できます。
現在のリポジトリには、以下のモデルシリーズがリストされています:
- DeepSeek
- Kimi
- GLM
- Hunyuan
- Qwen
- GPT
- Gemini
- Claude
モデルの利用可能性とプロバイダー名は頻繁に変更されるため、アプリ内の「モデル」ページと現在の公式ドキュメントを最新情報のソースとみなすべきです。
テキストモデルのためのビジュアルエージェント
元記事では、DeepSeekなどのテキスト中心のモデルをメインのエージェントとして使用し、視覚能力を持つモデルをビジュアルアシスタントとして使用する開発パターンについて説明しています。
ビジュアルエージェントは以下を検査できます:
- ウェブページのスクリーンショット
- スライド
- インターフェースレイアウト
- レンダリングされたゲーム画面
- チャート
- 視覚的なエラー
その後、メインモデルは視覚的な説明に基づいて出力を修正できます。

視覚能力を持つエージェントがスクリーンショットを検査できる一方、DeepSeekは依然として主要な作業モデルです。
これは、メインモデルがコーディングや推論に優れているものの、画像をネイティブに処理しない場合に役立ちます。
この技術によって、メインモデルが直接視覚能力を得るわけではありません。視覚モデルがスクリーンショットを主要エージェントが使用できる情報に変換する、マルチモデルワークフローを作り出します。
詳細なトレース分析
PenguinHarnessは、モデル呼び出し、ツール実行、タイミング、トークン使用量、承認、およびサブエージェントアクティビティを記録します。
トレースインターフェースは、実行シーケンスをタイムライン形式で表示します。

Traceビューは、並列サブエージェント、モデル呼び出し、ツール使用、遅延、トークンコストの確認に役立ちます。
これにより以下を特定できます:
- 低速なモデル呼び出し
- 不要なツール使用
- 高コストな推論ループ
- 失敗したリトライ
- ワークフローをブロックするサブエージェント
- 長時間の承認遅延
- トークン集約型のプロンプト
- 並列実行の機会
Traceデータは自己進化の中核でもあります。なぜなら、オプティマイザーが前バージョンのスコア低下理由に関する証拠を必要とするからです。
最小限のブランクエージェントテンプレート
PenguinHarnessは、単なる自動化ビルダーではなく、最小限の汎用エージェントとしても使用できます。
このプロジェクトはShellを汎用的な低レベルインターフェースとして採用し、デフォルトのツールセットを意図的に小さく抑えています。
サブエージェント実行を中核的な性能特性と見なしています。
ソースコードの報告によると、デフォルトのシステムプロンプトは約1,300トークンであり、プロジェクト内のClaude Codeの比較値は約15,000トークンです。
この数値はプロジェクト自身の報告によるものであり、いずれかの製品の進化に伴って変化する可能性があります。
基本設計原則は安定しています。短いプロンプトと小さなツールセットにより、トークンオーバーヘッドを削減し、オープンモデルをより使いやすくします。
コストとベンチマーク結果
このプロジェクトは、複雑なデータ分析スイートに関する比較結果を公開しています。

プロジェクトは、その複雑なデータ分析比較において、モデルコストの一部でより高い精度を達成したと報告しています。
公開されたデータ表の報告:
| フレームワーク | モデル | 精度 | トークン使用量 | 推定コスト |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66.67% | 18.04M | $0.55 |
| Claude Code | Claude Opus 4.8 | 53.33% | 22.20M | $38.48 |
| OpenAI Codex | GPT-5.5 | 53.33% | 13.72M | $19.41 |
プロジェクトはこれを次のように要約しています:
- 報告値の1/35のCodexコスト
- 報告されたClaude Codeコストの約1/70
この比較は、ツールチェーンを通常組み合わせられるモデルと一緒に比較しています。ツールチェーンの貢献と、選択したモデルおよびプロバイダーの価格設定の貢献を分離しているわけではありません。
公平な内部評価のため、チームは以下の条件で同じタスクを実行する必要があります:
- 可能な限り同じモデルを使用
- 同じプロバイダー価格設定
- 同じリトライ戦略
- 同じツールアクセス権限
- 同じ時間制限
- 同じ評価基準
- 複数回の繰り返し実行
公開データはプロジェクトのベンチマーク参考として利用できますが、すべてのタスクに適用可能な一般的なコスト比率として解釈すべきではありません。
報告されている本番展開事例
ソース記事によると、チームは2つの本番シナリオでPenguinHarnessを使用しています。
医療レポート審査
ある健診機関がPenguinHarnessを使用してレポート審査エージェントを作成し、そのパフォーマンスは医学専門家に匹敵すると説明されています。
プロジェクトチームによると、以前は約30分かかっていた審査作業が数十秒で完了できるようになりました。
製造業の検査
ある製造企業がPenguinHarnessをベースに構築した複数のエージェントを展開し、生産ライン設備の継続的な監視と自動復旧を試みています。
チームの報告:
- ダウンタイムが65%削減
- 生産量がほぼ2倍に向上
以上はベンダー提供のケーススタディデータです。元の報告には、顧客名、研究デザイン、サンプルサイズ、ベースライン定義、独立監査情報は含まれていません。
これらは報告された使用事例の例として見なすべきであり、保証された運用結果ではありません。
インストールとデプロイ
PenguinHarnessは、Linux、macOS、およびWindows 10以降をサポートしており、利用可能な場合はx64およびArm64システムに対応しています。
ワンラインインストールスクリプトには、バンドルされたNode.jsランタイムが含まれています。npmによるインストールにはNode.js 24以降が必要です。
LinuxまたはmacOS
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
Webインターフェースは次のアドレスで開きます:
http://127.0.0.1:7364
Windows PowerShell
irm https://penguin.ooo/install.ps1 | iex
penguin web
npm
npm install -g @prismshadow/penguin-cli
penguin web
CLIインストールでは、初回Webログインにユーザー名adminを使用します。初期パスワードはサーバー初回起動時に出力されるため、直ちに変更する必要があります。
モデルの設定とタスクの実行
公式リポジトリでは、以下のようなCLI例が提供されています:
penguin config model add \
--provider deepseek \
--model-id deepseek-v4-flash \
--api-key sk-... \
--set-default
ワンショットタスクの実行:
penguin run -m "Hello, Penguin を含む hello.txt を作成"
対話セッションの開始:
penguin chat
ヘッドレスサーバーの起動:
penguin server
APIキーはソースコード管理システムにコミットしてはならず、公開ログに貼り付けるべきでもありません。
PenguinHarnessはローカルマシンまたはサーバー上で実行できます。ブラウザインターフェースは、マルチセッション、エージェントとスキルの管理、モデル設定、使用統計、Trace可観測性、評価ワークフローをサポートしています。
プロジェクトは現在、一部の
デスクトップ版ビルドは署名されておらず、初回起動時にOSの警告が表示される場合があります。ユーザーは公式ウェブサイトからのみ、または
GitHub Releasesからインストーラをダウンロードし、警告を迂回する前にプロジェクトの説明を確認してください。
PenguinHarnessを支えるチーム
PenguinHarnessはPrismShadowによってオープンソース化されました。このチームは2025年に設立され、業務知識、ワークフロー、フィードバックから学習するエージェント基盤の構築に取り組んでいます。
元のレポートに記載された創業チームは以下のとおりです。
| チームメンバー | 経歴 |
|---|---|
| 鄭耀威(Zheng Yaowei) | LlamaFactoryの創設者。アクセスしやすいモデルとエージェント基盤に注力 |
| 錢歩月(Qian Buyue) | カリフォルニア大学デービス校博士号取得。元IBM T. J. Watson研究所研究員、元復旦大学教授 |
| 呉学軍(Wu Xuejun) | 百度NLPの初期メンバー。アリババや京东数科で上級職を歴任 |
| 胡俊豪(Hu Junhao) | 北京大学博士課程在籍。モデルとキャッシュ効率の研究に従事 |
| 陳曦(Chen Xi) | ニューヨーク大学ビジネススクール教授。カーネギーメロン大学博士号取得、元アマゾン主席科学者 |
出典の経歴情報は発表元およびプロジェクトチームによる提供です。これらの情報が就職や学術上の検証に実質的な影響を与える場合、読者は公式機関のページで確認してください。
LlamaFactoryからPenguinHarnessまで、チームが表明する目標は一貫しています。複雑なAI基盤を、より広範なユーザー層が使いやすく、信頼性が高く、効率的なツールへと変えることです。
よくある質問
PenguinHarnessとは何ですか?
PenguinHarnessはオープンソースのエージェントフレームワークで、AIエージェントの構築、実行、評価、最適化が可能です。Webインターフェース、CLI、SDK、組み込みスキル、モデル設定、トレーシング、マルチエージェント評価ワークフローを提供します。
PenguinHarnessは無料でオープンソースですか?
はい。コアコードベースはApache 2.0ライセンスで公開されています。ユーザーは各自のワークロードで発生するモデルAPI、インフラ、またはサードパーティサービスにかかる費用を負担する必要があります。
PenguinHarnessはローカルで実行できますか?
はい。Linux、macOS、Windowsで動作し、デスクトップアプリケーションとしても、CLIやブラウザインターフェースを通じても利用できます。サーバーにインストールしてリモート利用することも可能です。
PenguinHarnessはローカルモデルをサポートしていますか?
はい。OllamaやvLLMなどのツールに関連するスキルと統合が含まれており、OpenAI互換のカスタムエンドポイントもサポートしています。実際の互換性はモデルのAPI動作と必要な機能に依存します。
PenguinHarnessにおける自己進化とはどういう意味ですか?
自己進化とは、システムがエージェントを評価し、スコアとトレース記録を分析し、承認済みのプロンプト、スキル、設定を変更し、候補となる次バージョンをテストすることを意味します。設定された評価でより良いパフォーマンスを示した場合のみ、候補バージョンが採用されます。
自己進化するエージェントはPenguinHarnessのカーネルを変更できますか?
プロジェクト契約により、それはできません。進化はワークスペース、プロンプト、スキル、承認済み設定に限定され、フレームワークのカーネルとセキュリティ機構は変更されません。
¥0.2のエージェント構築コストは保証されていますか?
いいえ。¥0.2という数字は、DeepSeek V4 Proを使用してRAGアプリケーションを生成したプロジェクトデモに基づいています。実際のコストは、モデルの価格設定、トークン使用量、リトライ回数、プロバイダー、タスクの複雑さによって異なります。
GDPevoとは何ですか?
GDPevoは、エージェントが保持された実ビジネスタスクで自己進化する能力を測定するためのオープンベンチマークです。公開されているV2版には24のグループに240のタスクが含まれ、トレーニングタスクとテストタスクが区別されています。
関連ツール
- PenguinHarness:公式サイト。ダウンロード、ドキュメント、製品例、インストール手順を提供。
- PenguinHarness GitHubリポジトリ:Apache 2.0ソースコード、README、リリース、コマンドライン例、貢献ガイド。
- GDPevo:ベンチマークデータ、構築プロセス、評価ワークスペース、公開された実験結果。
- LlamaFactory:Yaowei Zhengによる、言語モデルおよび視覚言語モデルの効率的なファインチューニングのためのオープンソースフレームワーク。
- vLLM:ローカルおよびサーバーサイドでの高スループットモデル推論のためのオープンソースエンジン。
- Ollama:エージェント開発ワークフローで利用可能なローカルモデルランタイム。
- OpenRouter:複数のホスト型モデルプロバイダーにアクセスするための統一APIゲートウェイ。
関連リンク
- PenguinHarness紹介:プロジェクトチームによる公式発表記事。「エージェントがエージェントを構築する」という理念を解説。
- PenguinHarnessドキュメント:公式のインストール、モデル、スキル、使用方法に関するドキュメント。
- PenguinHarness GitHubリポジトリ:ソースコード、現在サポートされているモデル一覧、コマンド、Apache 2.0ライセンス。
- PenguinHarnessリリース:対応プラットフォーム向けの公式デスクトップ版およびコマンドライン版インストールパッケージ。
- GDPevo論文:ベンチマーク設計、ルール混合、評価結果を記述した研究論文。
- GDPevo GitHubリポジトリ:公式ベンチマーク、タスクデータ、評価結果、再現可能なワークスペース。
- LlamaFactory GitHubリポジトリ:記事で引用されたモデルファインチューニングフレームワークの公式リポジトリ。
まとめ
PenguinHarnessは、エージェントが自然言語による要件に基づいて別のエージェントアプリケーションを構築できるオープンソースプラットフォームです。スキャフォールド、プロンプト、スキル、設定、コード、フロントエンド、実行手順を生成でき、ホスト型モデルとローカルモデルの両方をサポートします。
長期的な焦点は自己進化です。複数の評価エージェントが対象エージェントをスコアリングし、オプティマイザーが結果と実行トレースを分析し、候補バージョンがより高いスコアを得た場合のみ採用されます。CONTRACT.mdは変更可能な内容を制限し、スナップショット、ロールバック、非公開の評価基準、承認、認証情報の分離、監査記録を要求します。
このプロジェクトは大幅なコスト削減と初期の生産効果を報告していますが、これらの数字はチームが提供したデモとケーススタディであり、普遍的に適用できる結論ではありません。
保証です。Apache 2.0リポジトリ、公開されたコマンド、GDPevoベンチマークは、開発者が独自のワークロードでこの手法をテストするための十分な素材を提供します。
PenguinHarnessの核心理念は明快です。エージェントの構築は自動化できるが、安全に改善するには、測定可能な評価、厳格な境界、そして元に戻せる変更が必要である。