PenguinHarness создает и самостоятельно улучшает ИИ-агентов всего за 0,2 юаня
LlamaFactory делает тонкую настройку больших языковых моделей более доступной для широкого круга разработчиков. Теперь её создатели Чжэн Яовэй и команда PrismShadow применяют ту же концепцию простоты использования к...

PenguinHarness позволяет создать и самостоятельно улучшить ИИ-агента всего за 0,2 юаня
Введение
LlamaFactory делает тонкую настройку масштабных моделей более доступной для широкого круга разработчиков. Теперь её создатель Чжэн Яовэй и команда PrismShadow применяют тот же подход «простота в приоритете» к ИИ-агентам.
Их новый открытый проект PenguinHarness направлен на автоматизацию трёх этапов жизненного цикла агента:
- Создание приложения-агента
- Оценка его производительности
- Постоянное улучшение его промптов, навыков и конфигурации
Пользователю не нужно вручную выбирать фреймворк, подключать инструменты, писать промпты, создавать интерфейс и многократно тестировать результат — достаточно описать потребность, и PenguinHarness соберёт работающее приложение-агента.

PenguinHarness — это открытый инструмент автоматизированного создания агентов для развертывания на рабочих станциях и серверах.
Проект лёгкий, распространяется под лицензией Apache 2.0 и поддерживает Linux, macOS и Windows. Он может работать локально, а также через браузерный интерфейс на удалённом сервере.
PenguinHarness поддерживает онлайн- и локальные модели через встроенные пресеты и API, совместимый с OpenAI. В официальном репозитории перечислены актуальные модели от DeepSeek, Kimi, GLM, Qwen, OpenAI, Google, Anthropic и других провайдеров.
В исходном отчёте описан RAG-аппликейшн, созданный всего за 0,2 юаня расходов на токены. На официальной странице проекта аналогичный пример оценивается примерно в 0,02 доллара США (с использованием DeepSeek V4 Pro).
Эта цифра — демонстрационные данные проекта, а не гарантированная фиксированная цена. Фактическая стоимость зависит от выбранной модели, провайдера, сложности промптов, количества повторов, масштаба приложения и тарифов на токены.
Пусть один агент создаёт другого агента
PenguinHarness исходит из простой идеи: агент должен уметь создавать другое приложение-агента на основе запроса на естественном языке.
Это соответствует более широкой дискуссии об «ИИ для ИИ» и рекурсивном самосовершенствовании — когда ИИ-системы помогают создавать, тестировать или улучшать другие ИИ-системы.
Первый пример использования, представленный в исходной статье, требует от системы создания RAG-приложения, которое должно:
- извлекать информацию по фрагментам
- выводить чёткие ответы в потоковом режиме
- включать цитируемые источники
- предоставлять работоспособный фронтенд
- работать как полноценное приложение
В сравнительном тесте PenguinHarness и кодирующий агент выполняли аналогичные задачи параллельно.
Согласно демонстрации проекта, PenguinHarness выполнил приложение быстрее и с меньшими затратами токенов. Его результат включал плавные ответы, потоковый вывод и ссылки на источники.
Вывод конкурента, показанный в отчёте, содержал смешение языков и не обладал таким же потоковым поведением.
Эти примеры — полезные демонстрации, но они не доказывают в общем виде, что PenguinHarness превосходит любого кодирующего агента во всех сценариях. Результат во многом зависит от модели, конфигурации агента, дизайна задачи и метода оценки.
От запроса до работающего приложения
Традиционная разработка агента обычно включает несколько ручных этапов:
- Выбор фреймворка агента.
- Выбор и настройка модели.
- Подключение инструментов и внешних сервисов.
- Написание системных промптов.
- Определение логики памяти и рабочих процессов.
- Создание оценочных сценариев.
- Тестирование и доработка агента.
- Создание фронтенда или интерфейса доставки.
- Упаковка приложения для развертывания.
PenguinHarness пытается превратить эти шаги в единый рабочий процесс, управляемый агентом.
Когда запрос определён, система может сгенерировать:
- каркас приложения
- промпты агента
- определения навыков и инструментов
- конфигурационные файлы
- вспомогательный код
- фронтенд
- инструкции по установке
- инструкции по запуску
- итеративные исправления и оптимизацию
В официальном примере проекта использовался следующий запрос:
Собери документацию с https://github.com/ericbuess/claude-code-docs и создай RAG-приложение, которое будет отвечать на вопросы о Claude Code как эксперт по настройке, цитируя источники.
Согласно отчёту проекта, созданное RAG-приложение при использовании DeepSeek V4 Pro потребило примерно $0,02 (то есть ¥0,2) на токены модели.
Файловая система как источник истины
PenguinHarness использует файлы как основной слой взаимодействия между человеком и агентом.
В такой архитектуре:
- Агент представлен файлами.
- Промпты — это файлы.
- Навыки — это файлы.
- Конфигурация хранится в файлах.
- Диалоги и исполнение можно отслеживать через сохранённые записи.
- Новых агентов можно создавать, собирая или копируя нужную структуру файлов.
Такой подход делает агента более простым для проверки и модификации.
Вместо того чтобы скрывать важное поведение внутри большого каркаса приложения, PenguinHarness использует редактируемые файлы как основной интерфейс. Человек может читать и изменять эти файлы, а агент — улучшать их в рамках одобренных процессов оптимизации.
Инструмент отвечает за сборку этих файлов в работающий объект-агента.
PenguinMessage как единый протокол
Во время выполнения PenguinMessage выступает в роли универсального формата сообщений, связывающего модель, среду, инструменты и пользователя.
Исходная статья сравнивает его с сетевым пакетом: разные компоненты могут обмениваться информацией через один и тот же лёгкий интерфейс без уникальной интеграции для каждой модели или среды.
Таким образом, PenguinHarness — это одновременно:
- фреймворк для запуска агентов
- агент, способный понимать и расширять собственную структуру

PenguinHarness объединяет PenguinMessage, Penguin SDK и Penguin Skills в лёгкой архитектуре.
Три ключевые области, представленные в архитектуре проекта:
| Компонент | Роль |
|---|---|
| PenguinMessage | Минимальный протокол сообщений между пользователем, моделью, инструментами и средой |
| Penguin SDK | Уровень разработки для создания приложений-агентов |
| Penguin Skills | Переиспользуемые способности для создания, оценки и оптимизации агентов |
Локально воспроизводимый цикл самоэволюции
Создание агента — это лишь первый шаг.
Долгосрочная цель PenguinHarness — позволить пользователям управлять агентами, которых можно оценивать и оптимизировать локально, без необходимости вручную перестраивать всю систему.
Проект разделяет два этапа:
- Создание агента: с нуля до единицы
- Оптимизация агента: от единицы до ста
Модифицировать агента относительно легко, поскольку промпты, код, навыки и конфигурации можно редактировать. Но определить, действительно ли изменение сделало агента лучше, гораздо сложнее.
Большие языковые модели вероятностны, а агентные системы вносят дополнительную неопределённость через инструменты, окружение, память и многошаговые решения.
Поэтому надёжный цикл улучшений требует надёжной системы измерений.
Почему оценка — это фундамент
Агент может показывать лучшие результаты на одном примере, но в целом становиться хуже.
Без структурированных бенчмарков оптимизатор может:
- переобучаться на небольшом наборе демонстрационных примеров
- запоминать ответы
- использовать слабые места оценщика
- увеличивать затраты без повышения качества
- улучшать одну задачу в ущерб другой
- получать более высокие баллы через взлом вознаграждений
Команда PrismShadow потратила более шести месяцев на исследование того, как оценивать самоэволюционирующие агенты.
Ключевая проблема заключалась в отсутствии бенчмарков, которые чётко разделяли бы обучающий опыт и отложенные тесты.
Если агент улучшается на тех же задачах, которые используются для оценки, трудно понять, выучил ли он переиспользуемую стратегию или просто запомнил ответы.
GDPevo разделяет обучающие и тестовые задачи
Команда создала GDPevo — эволюционно-нативный бенчмарк на основе реальных бизнес-процессов.
В исходной статье описано его покрытие в таких областях, как медицина, финансы и юридическая работа. Текущий публичный репозиторий V2 содержит 240 задач в 24 группах задач, охватывающих:
- CRM
- ERP
- Финансы
- Медицина
- Юридические рабочие процессы
- Анализ данных
- Инженерная эксплуатация
Каждая группа задач включает:
- общее бизнес-окружение
- пять обучающих задач
- пять отложенных тестовых задач
GDPevo использует подход, называемый смешиванием правил. Бизнес-процессы разбиваются на более мелкие правила, распределяются по обучающим задачам и перекомбинируются в отложенных тестовых задачах.
Такая структура помогает определить, выучил ли агент переиспользуемый рабочий процесс, а не просто заранее увидел тестовые ответы.

GDPevo оценивает, насколько агенты улучшаются на отложенных бизнес-задачах после различных форм эволюции.
Отчёт по GDPevo
В их экспериментах самоэволюция повысила отложенную точность на до 16,44 процентных пункта. Также отмечается, что лучший эволюционировавший агент всё ещё значительно ниже идеального предела 91,6% при полной информации.
Этот разрыв критически важен. Текущие агенты могут улучшаться, но надёжная самоэволюция далека от решения.
PenguinHarness упаковывает оценку как навык
PenguinHarness превращает ключевые идеи, лежащие в основе GDPevo, в переиспользуемые навыки для:
- создания агентов
- проектирования бенчмарков
- оценки агентов
- оптимизации агентов
После вызова соответствующих навыков несколько агентов могут совместно участвовать в процессе улучшения.
В исходной статье приведён пример агента, спроектированного для задач спортивного прогнозирования, генерации инвестиционных стратегий или поддержки электронной коммерции.
Пользователю не нужно вручную править промпты и рабочие процессы — достаточно позволить PenguinHarness создать оценочные наборы, запустить повторные тесты, проанализировать причины неудач и предложить улучшенные версии.
Демонстрационный отчёт проекта показывает, что после нескольких итераций оценка выросла с 53 до 95 баллов, а затраты на токены модели DeepSeek V4 Flash составили около 0,5 юаня.
Это демонстрационный результат команды проекта, а не общая гарантия бенчмарка. Фактические результаты будут различаться в зависимости от задачи, критериев оценки, модели, объёма выборки и бюджета оптимизации.
Четырёхшаговый процесс оптимизации
Рабочий процесс самоэволюции использует несколько агентов с разделением ролей.
1. Организация оценки
Оптимизирующий агент определяет необходимое количество вопросов и повторений, затем параллельно запускает несколько оценочных агентов.
Параллельная оценка помогает сократить время, необходимое для тестирования нескольких задач или повторных запусков.
2. Независимая оценка
Каждый оценочный агент запускает независимую копию целевого агента и просит его решить одну задачу.
Оценочный агент имеет доступ к критериям оценки, а целевой агент — нет.
Такая изоляция предназначена для предотвращения прямой оптимизации целевого агента под скрытые оценочные инструкции.
3. Анализ и улучшение
Оптимизирующий агент собирает результаты и проверяет траектории выполнения.
Он выявляет причины потери баллов, а затем изменяет одобренные части целевого агента, например:
- промпты
- навыки
- конфигурации
- файлы рабочих процессов
Оптимизирующий агент генерирует кандидата на следующую версию.
4. Проверка и итерация
Оценочные агенты снова тестируют версию-кандидата.
Оптимизирующий агент принимает кандидата только в том случае, если он набирает строго более высокий балл. Если балл равен или ниже, фреймворк откатывается к предыдущей версии.

Оптимизирующий агент координирует параллельных оценочных агентов и принимает только кандидатов с более высокими баллами.
Этот процесс можно обобщить следующим образом:
Целевой агент vN
↓
Параллельные оценочные агенты
↓
Баллы, критерии оценки и траектории выполнения
↓
Оптимизирующий агент
↓
Обновление промптов, навыков или конфигураций
↓
Агент-кандидат vN+1
↓
Принятие только при строго более высоком балле
Такое сочетание скрытых критериев оценки, отложенных тестов, снапшотов и строгого повышения баллов призвано сделать оптимизацию более воспроизводимой.
Контракт между тестовым фреймворком и самоэволюционирующим агентом
Самоэволюция поднимает очевидный вопрос безопасности: что агенту разрешено изменять?
PenguinHarness определяет эти границы в переносимом файле под названием CONTRACT.md.
Этот контракт устанавливает, что способности могут развиваться в одобренных областях, в то время как ядро тестового фреймворка и его границы безопасности остаются неизменными.

Файл CONTRACT.md определяет границы эволюции агента, аудита, контроля версий и изоляции учётных данных.
В исходной статье подчёркиваются четыре ключевых правила.
1. Эволюция не может изменять ядро тестового фреймворка
Область редактирования ограничена рабочим пространством, промптами, навыками и одобренными конфигурациями.
Агент не может переписывать ядро тестового фреймворка или его механизмы безопасности.
Это снижает риск того, что процесс оптимизации ослабит следующие аспекты:
- Одобрение инструментов
- Контроль разрешений
- Журналы аудита
- Изоляцию учётных данных
- Восстановление версий
- Другие системные проверки безопасности
2. Каждая оптимизация требует создания снимка
Перед раундом оптимизации фреймворк сохраняет версионный снимок состояния агента.
Если агент-кандидат показывает худшие результаты или вызывает нежелательные побочные эффекты, система может откатиться к более ранней версии.
Самоулучшающаяся система без возможности отката может накапливать ущерб. Контроль версий делает улучшения обратимыми.
3. Целевой агент не может видеть критерии оценки
Целевой агент получает задачи, но не скрытые критерии оценки.
Доступ к критериям оценки имеет только оценщик.
Это направлено на снижение поведения, связанного с поиском лёгких путей, запоминания ответов и взлома системы вознаграждения.
Это не полностью устраняет данные риски, но создаёт более чёткое разделение между решением задач и оценкой результатов.
4. Каждая оптимизация должна быть проверяемой
Запросы моделей, вызовы инструментов, использование токенов, время, сбои, одобрения и изменения при оптимизации записываются в файл трассировки.
Пользователи могут проверить, что изменилось и почему.
Более широкий контракт проекта также включает:
- Одобрение перед выполнением инструментов
- Аудиторские записи решений об одобрении
- Изоляцию учётных данных
- Разделение модели и агента
- Восстанавливаемые трассы выполнения
- Загрузку соответствующих файлов по требованию
- Чёткие правила обработки ошибок
В итоге получается фреймворк, в котором агент может эволюционировать, но сам процесс эволюции остаётся видимым и обратимым.
Другие полезные функции PenguinHarness
PenguinHarness включает несколько возможностей помимо автоматизированного создания и оптимизации агентов.
Встроенные навыки для обучения моделей
и развёртывания
В проект встроены навыки, связанные с разработкой AI-приложений, включая:
penguin-sdkpenguin-cliagenthub-modelsvllmollamallamafactory

PenguinHarness включает навыки для создания агентов и совместной работы с такими инструментами, как vLLM, Ollama и LlamaFactory.
Эти навыки позволяют пользователям описывать задачи обучения или развёртывания на естественном языке, а агент готовит необходимые файлы или команды.
Официальный репозиторий разделяет встроенные навыки на четыре основные категории:
| Группа навыков | Примеры |
|---|---|
| Офисная эффективность | Анализ данных и сбор веб-данных |
| Разработка ПО | Веб-дизайн и программная инженерия |
| Разработка AI-приложений | Penguin SDK, шлюз моделей, vLLM, Ollama и LlamaFactory |
| Настройка агентов | Создание агентов, проектирование бенчмарков, оценка и оптимизация |
Пользователи и агенты также могут создавать или улучшать дополнительные навыки.
Единый шлюз моделей
PenguinHarness имеет встроенные пресеты моделей и поддерживает пользовательские интерфейсы, совместимые с OpenAI.
Проект заявляет, что через поддерживаемых провайдеров и шлюзы пользователи могут использовать более 1000 онлайн- и локальных моделей.

Шлюз моделей позволяет пользователям настраивать различных онлайн- и локальных провайдеров моделей.
Текущий репозиторий перечисляет следующие серии моделей:
- DeepSeek
- Kimi
- GLM
- Hunyuan
- Qwen
- GPT
- Gemini
- Claude
Доступность моделей и названия провайдеров часто меняются, поэтому страницу «Модели» в приложении и текущую официальную документацию следует рассматривать как актуальный источник информации.
Визуальный агент для текстовых моделей
В исходной статье описывается подход к разработке, при котором текстовая модель, такая как DeepSeek, выступает в роли основного агента, а модель с визуальными возможностями используется в качестве визуального помощника.
Визуальный агент может проверять:
- Скриншоты веб-страниц
- Слайды
- Макеты интерфейсов
- Отрисованные игровые кадры
- Диаграммы
- Визуальные ошибки
Основная модель затем может корректировать свои выходные данные на основе визуальных описаний.

Агент с визуальными возможностями может проверять скриншоты, в то время как DeepSeek остаётся основной рабочей моделью.
Это полезно, когда основная модель сильна в кодировании или рассуждениях, но не обрабатывает изображения нативно.
Данный подход не даёт основной модели непосредственных визуальных способностей. Он создаёт мультимодельный рабочий процесс, в котором визуальная модель преобразует скриншоты в информацию, которую может использовать основной агент.
Детальный анализ трассировки
PenguinHarness записывает вызовы моделей, выполнение инструментов, временные показатели, использование токенов, одобрения и активность субагентов.
Интерфейс Trace отображает последовательность выполнения в виде временной шкалы.

По сообщению проекта, в ходе сравнительного анализа сложных данных была достигнута более высокая точность при незначительной части стоимости моделей.
Опубликованная таблица данных:
| Фреймворк | Модель | Точность | Использование токенов | Оценочная стоимость |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66,67% | 18,04 млн | 0,55 долл. США |
| Claude Code | Claude Opus 4.8 | 53,33% | 22,20 млн | 38,48 долл. США |
| OpenAI Codex | GPT-5.5 | 53,33% | 13,72 млн | 19,41 долл. США |
Проект резюмирует это следующим образом:
- 1/35 от заявленной стоимости
Codex
- Примерно 1/70 от заявленной стоимости Claude Code
В этом сравнении инструментальные цепочки объединены с моделями, с которыми они обычно используются. Оно не разделяет вклад инструментальной цепочки и вклад выбранной модели и ценообразования провайдера.
Для объективной внутренней оценки командам следует запускать одни и те же задачи на следующих условиях:
- По возможности использовать одну и ту же модель
- Одинаковое ценообразование провайдера
- Одинаковую стратегию повторных попыток
- Одинаковый доступ к инструментам
- Одинаковые временные ограничения
- Одинаковые критерии оценки
- Многократные повторные запуски
Публичные данные могут служить ориентиром для проекта, но их не следует интерпретировать как универсальный коэффициент стоимости для всех задач.
Задокументированные случаи производственного развертывания
В исходной статье утверждается, что команда использовала PenguinHarness в двух производственных сценариях.
Проверка медицинских отчётов
По имеющимся данным, медицинское учреждение использовало PenguinHarness для создания агента проверки отчётов, чья работа описывается как сопоставимая с работой медицинских экспертов.
По словам команды проекта, проверка, которая ранее занимала около 30 минут, теперь может быть выполнена за несколько десятков секунд.
Контроль качества в производстве
По имеющимся данным, производственная компания развернула несколько агентов на базе PenguinHarness для непрерывного мониторинга оборудования на производственных линиях и попыток автоматического восстановления.
Команда сообщает:
- Сокращение времени простоев на 65%
- Повышение производительности почти вдвое
Вышеуказанные данные являются кейсами, предоставленными поставщиком. В исходном отчёте не указаны имена клиентов, дизайн исследования, размер выборки, базовые определения или информация о независимом аудите.
Их следует рассматривать как примеры заявленных случаев использования, а не как гарантированные операционные результаты.
Установка и развертывание
PenguinHarness поддерживает Linux, macOS, а также Windows 10 или более новые версии, включая архитектуры x64 и Arm64, где это доступно.
Скрипт однострочной установки включает встроенную среду выполнения Node.js. Для установки через npm требуется Node.js 24 или новее.
Linux или macOS
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
Веб-интерфейс открывается по адресу:
http://127.0.0.1:7364
Windows PowerShell
irm https://penguin.ooo/install.ps1 | iex
penguin web
npm
npm install -g @prismshadow/penguin-cli
penguin web
При установке через CLI для первого входа в веб-интерфейс используется имя пользователя admin. Первоначальный пароль выводится при первом запуске сервера, и его следует немедленно изменить.
Настройка модели и запуск задач
В официальном репозитории приведены примеры команд CLI, аналогичные следующему:
penguin config model add \
--provider deepseek \
--model-id deepseek-v4-flash \
--api-key sk-... \
--set-default
Запуск разовой задачи:
penguin run -m "Создай hello.txt с содержимым Hello, Penguin"
Запуск интерактивной сессии:
penguin chat
Запуск сервера без интерфейса (headless):
penguin server
Ключи API ни в коем случае не следует сохранять в системе управления исходным кодом или вставлять в публичные журналы.
PenguinHarness может работать на локальной машине или сервере. Его браузерный интерфейс поддерживает мультисессионность, управление агентами и навыками, настройку моделей, статистику использования, наблюдаемость через Trace, а также рабочие процессы оценки.
В настоящее время проект отмечает, что некоторые
сборки для настольных компьютеров не подписаны, и при первом запуске операционная система может выдать предупреждение. Пользователям следует загружать программное обеспечение только с официального сайта или из
Скачайте установщик из GitHub Releases и проверьте описание проекта, прежде чем обходить предупреждения.
Команда, стоящая за PenguinHarness
PenguinHarness — проект с открытым исходным кодом, созданный PrismShadow — командой, основанной в 2025 году, которая занимается построением агентной инфраструктуры, способной обучаться на бизнес-знаниях, рабочих процессах и обратной связи.
В исходном отчёте указан следующий состав основателей:
| Участник команды | Краткая справка |
|---|---|
| Чжэн Яовэй | Создатель LlamaFactory; специализируется на доступных моделях и агентной инфраструктуре |
| Цянь Буюэ | Доктор наук Калифорнийского университета в Дэвисе; бывший исследователь IBM T. J. Watson, бывший профессор Фуданьского университета |
| У Сюэцзюнь | Бывший участник-основатель NLP-направления Baidu; занимал руководящие должности в Alibaba и JD Digits |
| Ху Цзюньхао | Аспирант Пекинского университета; участвует в исследованиях моделей и эффективности кэширования |
| Чэнь Си | Профессор Школы бизнеса Нью-Йоркского университета; доктор наук Университета Карнеги — Меллона, бывший главный научный сотрудник Amazon |
Биографические данные в источнике предоставлены издателем и командой проекта. Когда эта информация имеет существенное значение для трудоустройства или академической проверки, читателям следует сверяться с официальными страницами соответствующих учреждений.
От LlamaFactory до PenguinHarness заявленная цель команды остаётся неизменной: превращать сложную инфраструктуру искусственного интеллекта в более доступные, надёжные и эффективные инструменты для более широкого круга пользователей.
Часто задаваемые вопросы
Что такое PenguinHarness?
PenguinHarness — это фреймворк для создания агентов с открытым исходным кодом, который позволяет создавать, запускать, оценивать и оптимизировать ИИ-агентов. Он предоставляет веб-интерфейс, CLI, SDK, встроенные навыки, конфигурацию моделей, трассировку и рабочие процессы многокритериальной оценки.
Бесплатен ли PenguinHarness и имеет ли открытый исходный код?
Да. Основная кодовая база опубликована под лицензией Apache 2.0. Пользователи по-прежнему несут расходы на API моделей, инфраструктуру или сторонние сервисы, связанные с их рабочими нагрузками.
Можно ли запускать PenguinHarness локально?
Да. Он работает на Linux, macOS и Windows как в виде настольного приложения, так и через CLI и браузерный интерфейс. Его также можно установить на сервер для удалённого использования.
Поддерживает ли PenguinHarness локальные модели?
Да. Он включает навыки и интеграции для таких инструментов, как Ollama и vLLM, а также поддерживает пользовательские конечные точки, совместимые с OpenAI. Фактическая совместимость зависит от API-поведения модели и требуемых возможностей.
Что означает самосовершенствование в PenguinHarness?
Самосовершенствование означает, что система оценивает агентов, анализирует оценки и журналы трассировки, изменяет одобренные промпты, навыки или конфигурации и тестирует кандидатные версии следующего поколения. Кандидат принимается только в том случае, если он показывает лучшие результаты в рамках заданной оценки.
Может ли самосовершенствующийся агент изменять ядро PenguinHarness?
Согласно проектному контракту — нет. Эволюция ограничена рабочей областью, промптами, навыками и одобренными конфигурациями, тогда как ядро фреймворка и механизмы безопасности остаются неизменными.
Гарантируется ли стоимость создания агента в ¥0.2?
Нет. Цифра ¥0.2 взята из одного демонстрационного проекта, в котором с помощью DeepSeek V4 Pro было создано RAG-приложение. Фактическая стоимость зависит от ценообразования модели, объёма токенов, количества повторов, провайдера и сложности задачи.
Что такое GDPevo?
GDPevo — это открытый бенчмарк для оценки способности агентов к самосовершенствованию на отложенных реальных бизнес-задачах. Публичная версия V2 включает 240 задач в 24 категориях и различает обучающие и тестовые задачи.
Связанные инструменты
- PenguinHarness: официальный сайт с материалами для загрузки, документацией, примерами продуктов и инструкциями по установке.
- Репозиторий PenguinHarness на GitHub: исходный код Apache 2.0, README, релизы, примеры команд и руководство для контрибьюторов.
- GDPevo: данные бенчмарка, процесс сборки, оценочная рабочая область и опубликованные экспериментальные результаты.
- LlamaFactory: фреймворк с открытым исходным кодом Яовэя Чжэна для эффективной тонкой настройки языковых и мультимодальных моделей.
- vLLM: движок с открытым исходным кодом для высокопроизводительного инференса моделей на локальных и серверных системах.
- Ollama: среда выполнения локальных моделей, используемая в рабочих процессах разработки агентов.
- OpenRouter: единый API-шлюз для доступа к нескольким хостинг-провайдерам моделей.
Связанные ссылки
- Введение в PenguinHarness: официальная публикация команды проекта, объясняющая концепцию «агент создаёт агента».
- Документация PenguinHarness: официальная документация по установке, моделям, навыкам и использованию.
- Репозиторий PenguinHarness на GitHub: исходный код, актуальный список поддерживаемых моделей, команды и лицензия Apache 2.0.
- Релизы PenguinHarness: официальные установочные пакеты для настольных и CLI-версий на поддерживаемых платформах.
- Статья о GDPevo: исследовательская работа, описывающая дизайн бенчмарка, смешанные правила и результаты оценки.
- Репозиторий GDPevo на GitHub: официальный бенчмарк, данные задач, результаты оценки и воспроизводимая рабочая область.
- Репозиторий LlamaFactory на GitHub: официальный репозиторий фреймворка тонкой настройки, упомянутого в статье.
Итоги
PenguinHarness — это платформа с открытым исходным кодом, которая позволяет агентам создавать другие агентные приложения на основе требований на естественном языке. Она генерирует каркас кода, промпты, навыки, конфигурации, код, интерфейс и инструкции по запуску, поддерживая как хостинг-модели, так и локальные модели.
Долгосрочный фокус проекта — самосовершенствование. Несколько оценочных агентов оценивают целевого агента, оптимизатор анализирует результаты и журналы выполнения, и кандидат принимается только при получении более высоких оценок. CONTRACT.md ограничивает область изменений и требует наличия снимков, откатов, скрытых критериев оценки, процедур одобрения, изоляции учётных данных и журналов аудита.
Проект сообщает о значительном снижении затрат и ранних производственных выгодах, однако эти цифры представляют собой демонстрации и тематические исследования, предоставленные командой, а не универсальные выводы.
Лицензия Apache 2.0, опубликованные команды и бенчмарк GDPevo дают разработчикам достаточно материалов, чтобы проверить этот подход на собственных рабочих нагрузках.
Основная идея PenguinHarness проста: создание агентов может быть автоматизировано, но их безопасное улучшение требует измеримой оценки, строгих границ и обратимых изменений.