Введение
LlamaFactory делает тонкую настройку масштабных моделей более доступной для широкого круга разработчиков. Теперь её создатель Чжэн Яовэй и команда PrismShadow применяют тот же подход «простота в приоритете» к ИИ-агентам.
Их новый открытый проект PenguinHarness направлен на автоматизацию трёх этапов жизненного цикла агента:
- Создание приложения-агента
- Оценка его производительности
- Постоянное улучшение его промптов, навыков и конфигурации
Пользователю не нужно вручную выбирать фреймворк, подключать инструменты, писать промпты, создавать интерфейс и многократно тестировать результат — достаточно описать потребность, и PenguinHarness соберёт работающее приложение-агента.

PenguinHarness — это открытый инструмент автоматизированного создания агентов для развертывания на рабочих станциях и серверах.
Проект лёгкий, распространяется под лицензией Apache 2.0 и поддерживает Linux, macOS и Windows. Он может работать локально, а также через браузерный интерфейс на удалённом сервере.
PenguinHarness поддерживает онлайн- и локальные модели через встроенные пресеты и API, совместимый с OpenAI. В официальном репозитории перечислены актуальные модели от DeepSeek, Kimi, GLM, Qwen, OpenAI, Google, Anthropic и других провайдеров.
В исходном отчёте описан RAG-аппликейшн, созданный всего за 0,2 юаня расходов на токены. На официальной странице проекта аналогичный пример оценивается примерно в 0,02 доллара США (с использованием DeepSeek V4 Pro).
Эта цифра — демонстрационные данные проекта, а не гарантированная фиксированная цена. Фактическая стоимость зависит от выбранной модели, провайдера, сложности промптов, количества повторов, масштаба приложения и тарифов на токены.
Пусть один агент создаёт другого агента
PenguinHarness исходит из простой идеи: агент должен уметь создавать другое приложение-агента на основе запроса на естественном языке.
Это соответствует более широкой дискуссии об «ИИ для ИИ» и рекурсивном самосовершенствовании — когда ИИ-системы помогают создавать, тестировать или улучшать другие ИИ-системы.
Первый пример использования, представленный в исходной статье, требует от системы создания RAG-приложения, которое должно:
- извлекать информацию по фрагментам
- выводить чёткие ответы в потоковом режиме
- включать цитируемые источники
- предоставлять работоспособный фронтенд
- работать как полноценное приложение
В сравнительном тесте PenguinHarness и кодирующий агент выполняли аналогичные задачи параллельно.
Согласно демонстрации проекта, PenguinHarness выполнил приложение быстрее и с меньшими затратами токенов. Его результат включал плавные ответы, потоковый вывод и ссылки на источники.
Вывод конкурента, показанный в отчёте, содержал смешение языков и не обладал таким же потоковым поведением.
Эти примеры — полезные демонстрации, но они не доказывают в общем виде, что PenguinHarness превосходит любого кодирующего агента во всех сценариях. Результат во многом зависит от модели, конфигурации агента, дизайна задачи и метода оценки.
От запроса до работающего приложения
Традиционная разработка агента обычно включает несколько ручных этапов:
- Выбор фреймворка агента.
- Выбор и настройка модели.
- Подключение инструментов и внешних сервисов.
- Написание системных промптов.
- Определение логики памяти и рабочих процессов.
- Создание оценочных сценариев.
- Тестирование и доработка агента.
- Создание фронтенда или интерфейса доставки.
- Упаковка приложения для развертывания.
PenguinHarness пытается превратить эти шаги в единый рабочий процесс, управляемый агентом.
Когда запрос определён, система может сгенерировать:
- каркас приложения
- промпты агента
- определения навыков и инструментов
- конфигурационные файлы
- вспомогательный код
- фронтенд
- инструкции по установке
- инструкции по запуску
- итеративные исправления и оптимизацию
В официальном примере проекта использовался следующий запрос:
Собери документацию с https://github.com/ericbuess/claude-code-docs и создай RAG-приложение, которое будет отвечать на вопросы о Claude Code как эксперт по настройке, цитируя источники.
Согласно отчёту проекта, созданное RAG-приложение при использовании DeepSeek V4 Pro потребило примерно $0,02 (то есть ¥0,2) на токены модели.
Файловая система как источник истины
PenguinHarness использует файлы как основной слой взаимодействия между человеком и агентом.
В такой архитектуре:
- Агент представлен файлами.
- Промпты — это файлы.
- Навыки — это файлы.
- Конфигурация хранится в файлах.
- Диалоги и исполнение можно отслеживать через сохранённые записи.
- Новых агентов можно создавать, собирая или копируя нужную структуру файлов.
Такой подход делает агента более простым для проверки и модификации.
Вместо того чтобы скрывать важное поведение внутри большого каркаса приложения, PenguinHarness использует редактируемые файлы как основной интерфейс. Человек может читать и изменять эти файлы, а агент — улучшать их в рамках одобренных процессов оптимизации.
Инструмент отвечает за сборку этих файлов в работающий объект-агента.
PenguinMessage как единый протокол
Во время выполнения PenguinMessage выступает в роли универсального формата сообщений, связывающего модель, среду, инструменты и пользователя.
Исходная статья сравнивает его с сетевым пакетом: разные компоненты могут обмениваться информацией через один и тот же лёгкий интерфейс без уникальной интеграции для каждой модели или среды.
Таким образом, PenguinHarness — это одновременно:
- фреймворк для запуска агентов
- агент, способный понимать и расширять собственную структуру

PenguinHarness объединяет PenguinMessage, Penguin SDK и Penguin Skills в лёгкой архитектуре.
Три ключевые области, представленные в архитектуре проекта:
| Компонент | Роль |
|---|---|
| PenguinMessage | Минимальный протокол сообщений между пользователем, моделью, инструментами и средой |
| Penguin SDK | Уровень разработки для создания приложений-агентов |
| Penguin Skills | Переиспользуемые способности для создания, оценки и оптимизации агентов |
Локально воспроизводимый цикл самоэволюции
Создание агента — это лишь первый шаг.
Долгосрочная цель PenguinHarness — позволить пользователям управлять агентами, которых можно оценивать и оптимизировать локально, без необходимости вручную перестраивать всю систему.
Проект разделяет два этапа:
- Создание агента: с нуля до единицы
- Оптимизация агента: от единицы до ста
Модифицировать агента относительно легко, поскольку промпты, код, навыки и конфигурации можно редактировать. Но определить, действительно ли изменение сделало агента лучше, гораздо сложнее.
Большие языковые модели вероятностны, а агентные системы вносят дополнительную неопределённость через инструменты, окружение, память и многошаговые решения.
Поэтому надёжный цикл улучшений требует надёжной системы измерений.
Почему оценка — это фундамент
Агент может показывать лучшие результаты на одном примере, но в целом становиться хуже.
Без структурированных бенчмарков оптимизатор может:
- переобучаться на небольшом наборе демонстрационных примеров
- запоминать ответы
- использовать слабые места оценщика
- увеличивать затраты без повышения качества
- улучшать одну задачу в ущерб другой
- получать более высокие баллы через взлом вознаграждений
Команда PrismShadow потратила более шести месяцев на исследование того, как оценивать самоэволюционирующие агенты.
Ключевая проблема заключалась в отсутствии бенчмарков, которые чётко разделяли бы обучающий опыт и отложенные тесты.
Если агент улучшается на тех же задачах, которые используются для оценки, трудно понять, выучил ли он переиспользуемую стратегию или просто запомнил ответы.
GDPevo разделяет обучающие и тестовые задачи
Команда создала GDPevo — эволюционно-нативный бенчмарк на основе реальных бизнес-процессов.
В исходной статье описано его покрытие в таких областях, как медицина, финансы и юридическая работа. Текущий публичный репозиторий V2 содержит 240 задач в 24 группах задач, охватывающих:
- CRM
- ERP
- Финансы
- Медицина
- Юридические рабочие процессы
- Анализ данных
- Инженерная эксплуатация
Каждая группа задач включает:
- общее бизнес-окружение
- пять обучающих задач
- пять отложенных тестовых задач
GDPevo использует подход, называемый смешиванием правил. Бизнес-процессы разбиваются на более мелкие правила, распределяются по обучающим задачам и перекомбинируются в отложенных тестовых задачах.
Такая структура помогает определить, выучил ли агент переиспользуемый рабочий процесс, а не просто заранее увидел тестовые ответы.

GDPevo оценивает, насколько агенты улучшаются на отложенных бизнес-задачах после различных форм эволюции.
Отчёт по GDPevo
В их экспериментах самоэволюция повысила отложенную точность на до 16,44 процентных пункта. Также отмечается, что лучший эволюционировавший агент всё ещё значительно ниже идеального предела 91,6% при полной информации.
Этот разрыв критически важен. Текущие агенты могут улучшаться, но надёжная самоэволюция далека от решения.
PenguinHarness упаковывает оценку как навык
PenguinHarness превращает ключевые идеи, лежащие в основе GDPevo, в переиспользуемые навыки для:
- создания агентов
- проектирования бенчмарков
- оценки агентов
- оптимизации агентов
После вызова соответствующих навыков несколько агентов могут совместно участвовать в процессе улучшения.
В исходной статье приведён пример агента, спроектированного для задач спортивного прогнозирования, генерации инвестиционных стратегий или поддержки электронной коммерции.
Пользователю не нужно вручную править промпты и рабочие процессы — достаточно позволить PenguinHarness создать оценочные наборы, запустить повторные тесты, проанализировать причины неудач и предложить улучшенные версии.
Демонстрационный отчёт проекта показывает, что после нескольких итераций оценка выросла с 53 до 95 баллов, а затраты на токены модели DeepSeek V4 Flash составили около 0,5 юаня.
Это демонстрационный результат команды проекта, а не общая гарантия бенчмарка. Фактические результаты будут различаться в зависимости от задачи, критериев оценки, модели, объёма выборки и бюджета оптимизации.
Четырёхшаговый процесс оптимизации
Рабочий процесс самоэволюции использует несколько агентов с разделением ролей.
- Организация оценки
Оптимизирующий агент определяет необходимое количество вопросов и повторений, затем параллельно запускает несколько оценочных агентов.
Параллельная оценка помогает сократить время, необходимое для тестирования нескольких задач или повторных запусков.
- Независимая оценка
Каждый оценочный агент запускает независимую копию целевого агента и просит его решить одну задачу.
Оценочный агент имеет доступ к критериям оценки, а целевой агент — нет.
Такая изоляция предназначена для предотвращения прямой оптимизации целевого агента под скрытые оценочные инструкции.
- Анализ и улучшение
Оптимизирующий агент собирает результаты и проверяет траектории выполнения.
Он выявляет причины потери баллов, а затем изменяет одобренные части целевого агента, например:
- промпты
- навыки
- конфигурации
- файлы рабочих процессов
Оптимизирующий агент генерирует кандидата на следующую версию.
- Проверка и итерация
Оценочные агенты снова тестируют версию-кандидата.
Оптимизирующий агент принимает кандидата только в том случае, если он набирает строго более высокий балл. Если балл равен или ниже, фреймворк откатывается к предыдущей версии.

Оптимизирующий агент координирует параллельных оценочных агентов и принимает только кандидатов с более высокими баллами.
Этот процесс можно обобщить следующим образом:
Целевой агент vN
↓
Параллельные оценочные агенты
↓
Баллы, критерии оценки и траектории выполнения
↓
Оптимизирующий агент
↓
Обновление промптов, навыков или конфигураций
↓
Агент-кандидат vN+1
↓
Принятие только при строго более высоком балле
Такое сочетание скрытых критериев оценки, отложенных тестов, снапшотов и строгого повышения баллов призвано сделать оптимизацию более воспроизводимой.
Контракт между тестовым фреймворком и самоэволюционирующим агентом
Самоэволюция поднимает очевидный вопрос безопасности: что агенту разрешено изменять?
PenguinHarness определяет эти границы в переносимом файле под названием CONTRACT.md.
Этот контракт устанавливает, что способности могут развиваться в одобренных областях, в то время как ядро тестового фреймворка и его границы безопасности остаются неизменными.

Файл CONTRACT.md определяет границы эволюции агента, аудита, контроля версий и изоляции учётных данных.
В исходной статье подчёркиваются четыре ключевых правила.
- Эволюция не может изменять ядро тестового фреймворка
Область редактирования ограничена рабочим пространством, промптами, навыками и одобренными конфигурациями.
Агент не может переписывать ядро тестового фреймворка или его механизмы безопасности.
Это снижает риск того, что процесс оптимизации ослабит следующие аспекты:
- Одобрение инструментов
- Контроль разрешений
- Журналы аудита
- Изоляцию учётных данных
- Восстановление версий
- Другие системные проверки безопасности
- Каждая оптимизация требует создания снимка
Перед раундом оптимизации фреймворк сохраняет версионный снимок состояния агента.
Если агент-кандидат показывает худшие результаты или вызывает нежелательные побочные эффекты, система может откатиться к более ранней версии.
Самоулучшающаяся система без возможности отката может накапливать ущерб. Контроль версий делает улучшения обратимыми.
Создайте сайт-витрину и привлекайте лиды за минуты
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
- Целевой агент не может видеть критерии оценки
Целевой агент получает задачи, но не скрытые критерии оценки.
Доступ к критериям оценки имеет только оценщик.
Это направлено на снижение поведения, связанного с поиском лёгких путей, запоминания ответов и взлома системы вознаграждения.
Это не полностью устраняет данные риски, но создаёт более чёткое разделение между решением задач и оценкой результатов.
- Каждая оптимизация должна быть проверяемой
Запросы моделей, вызовы инструментов, использование токенов, время, сбои, одобрения и изменения при оптимизации записываются в файл трассировки.
Пользователи могут проверить, что изменилось и почему.
Более широкий контракт проекта также включает:
- Одобрение перед выполнением инструментов
- Аудиторские записи решений об одобрении
- Изоляцию учётных данных
- Разделение модели и агента
- Восстанавливаемые трассы выполнения
- Загрузку соответствующих файлов по требованию
- Чёткие правила обработки ошибок
В итоге получается фреймворк, в котором агент может эволюционировать, но сам процесс эволюции остаётся видимым и обратимым.
Другие полезные функции PenguinHarness
PenguinHarness включает несколько возможностей помимо автоматизированного создания и оптимизации агентов.
Встроенные навыки для обучения моделей
и развёртывания
В проект встроены навыки, связанные с разработкой AI-приложений, включая:
penguin-sdkpenguin-cliagenthub-modelsvllmollamallamafactory

PenguinHarness включает навыки для создания агентов и совместной работы с такими инструментами, как vLLM, Ollama и LlamaFactory.
Эти навыки позволяют пользователям описывать задачи обучения или развёртывания на естественном языке, а агент готовит необходимые файлы или команды.
Официальный репозиторий разделяет встроенные навыки на четыре основные категории:
| Группа навыков | Примеры |
|---|---|
| Офисная эффективность | Анализ данных и сбор веб-данных |
| Разработка ПО | Веб-дизайн и программная инженерия |
| Разработка AI-приложений | Penguin SDK, шлюз моделей, vLLM, Ollama и LlamaFactory |
| Настройка агентов | Создание агентов, проектирование бенчмарков, оценка и оптимизация |
Пользователи и агенты также могут создавать или улучшать дополнительные навыки.
Единый шлюз моделей
PenguinHarness имеет встроенные пресеты моделей и поддерживает пользовательские интерфейсы, совместимые с OpenAI.
Проект заявляет, что через поддерживаемых провайдеров и шлюзы пользователи могут использовать более 1000 онлайн- и локальных моделей.

Шлюз моделей позволяет пользователям настраивать различных онлайн- и локальных провайдеров моделей.
Текущий репозиторий перечисляет следующие серии моделей:
- DeepSeek
- Kimi
- GLM
- Hunyuan
- Qwen
- GPT
- Gemini
- Claude
Доступность моделей и названия провайдеров часто меняются, поэтому страницу «Модели» в приложении и текущую официальную документацию следует рассматривать как актуальный источник информации.
Визуальный агент для текстовых моделей
В исходной статье описывается подход к разработке, при котором текстовая модель, такая как DeepSeek, выступает в роли основного агента, а модель с визуальными возможностями используется в качестве визуального помощника.
Визуальный агент может проверять:
- Скриншоты веб-страниц
- Слайды
- Макеты интерфейсов
- Отрисованные игровые кадры
- Диаграммы
- Визуальные ошибки
Основная модель затем может корректировать свои выходные данные на основе визуальных описаний.

Агент с визуальными возможностями может проверять скриншоты, в то время как DeepSeek остаётся основной рабочей моделью.
Это полезно, когда основная модель сильна в кодировании или рассуждениях, но не обрабатывает изображения нативно.
Данный подход не даёт основной модели непосредственных визуальных способностей. Он создаёт мультимодельный рабочий процесс, в котором визуальная модель преобразует скриншоты в информацию, которую может использовать основной агент.
Детальный анализ трассировки
PenguinHarness записывает вызовы моделей, выполнение инструментов, временные показатели, использование токенов, одобрения и активность субагентов.
Интерфейс Trace отображает последовательность выполнения в виде временной шкалы.

По сообщению проекта, в ходе сравнительного анализа сложных данных была достигнута более высокая точность при незначительной части стоимости моделей.
Опубликованная таблица данных:
| Фреймворк | Модель | Точность | Использование токенов | Оценочная стоимость |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66,67% | 18,04 млн | 0,55 долл. США |
| Claude Code | Claude Opus 4.8 | 53,33% | 22,20 млн | 38,48 долл. США |
| OpenAI Codex | GPT-5.5 | 53,33% | 13,72 млн | 19,41 долл. США |
Проект резюмирует это следующим образом:
- 1/35 от заявленной стоимости
Codex
- Примерно 1/70 от заявленной стоимости Claude Code
В этом сравнении инструментальные цепочки объединены с моделями, с которыми они обычно используются. Оно не разделяет вклад инструментальной цепочки и вклад выбранной модели и ценообразования провайдера.
Для объективной внутренней оценки командам следует запускать одни и те же задачи на следующих условиях:
- По возможности использовать одну и ту же модель
- Одинаковое ценообразование провайдера
- Одинаковую стратегию повторных попыток
- Одинаковый доступ к инструментам
- Одинаковые временные ограничения
- Одинаковые критерии оценки
- Многократные повторные запуски
Публичные данные могут служить ориентиром для проекта, но их не следует интерпретировать как универсальный коэффициент стоимости для всех задач.
Задокументированные случаи производственного развертывания
В исходной статье утверждается, что команда использовала PenguinHarness в двух производственных сценариях.
Проверка медицинских отчётов
По имеющимся данным, медицинское учреждение использовало PenguinHarness для создания агента проверки отчётов, чья работа описывается как сопоставимая с работой медицинских экспертов.
По словам команды проекта, проверка, которая ранее занимала около 30 минут, теперь может быть выполнена за несколько десятков секунд.
Контроль качества в производстве
По имеющимся данным, производственная компания развернула несколько агентов на базе PenguinHarness для непрерывного мониторинга оборудования на производственных линиях и попыток автоматического восстановления.
Команда сообщает:
- Сокращение времени простоев на 65%
- Повышение производительности почти вдвое
Вышеуказанные данные являются кейсами, предоставленными поставщиком. В исходном отчёте не указаны имена клиентов, дизайн исследования, размер выборки, базовые определения или информация о независимом аудите.
Их следует рассматривать как примеры заявленных случаев использования, а не как гарантированные операционные результаты.
Установка и развертывание
PenguinHarness поддерживает Linux, macOS, а также Windows 10 или более новые версии, включая архитектуры x64 и Arm64, где это доступно.
Скрипт однострочной установки включает встроенную среду выполнения Node.js. Для установки через npm требуется Node.js 24 или новее.
Linux или macOS
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
Веб-интерфейс открывается по адресу:
http://127.0.0.1:7364
Windows PowerShell
irm https://penguin.ooo/install.ps1 | iex
penguin web
npm
npm install -g @prismshadow/penguin-cli
penguin web
При установке через CLI для первого входа в веб-интерфейс используется имя пользователя admin. Первоначальный пароль выводится при первом запуске сервера, и его следует немедленно изменить.
Настройка модели и запуск задач
В официальном репозитории приведены примеры команд CLI, аналогичные следующему:
penguin config model add \
--provider deepseek \
--model-id deepseek-v4-flash \
--api-key sk-... \
--set-default
Запуск разовой задачи:
penguin run -m "Создай hello.txt с содержимым Hello, Penguin"
Запуск интерактивной сессии:
penguin chat
Запуск сервера без интерфейса (headless):
penguin server
Ключи API ни в коем случае не следует сохранять в системе управления исходным кодом или вставлять в публичные журналы.
PenguinHarness может работать на локальной машине или сервере. Его браузерный интерфейс поддерживает мультисессионность, управление агентами и навыками, настройку моделей, статистику использования, наблюдаемость через Trace, а также рабочие процессы оценки.
В настоящее время проект отмечает, что некоторые
сборки для настольных компьютеров не подписаны, и при первом запуске операционная система может выдать предупреждение. Пользователям следует загружать программное обеспечение только с официального сайта или из
Скачайте установщик из GitHub Releases и проверьте описание проекта, прежде чем обходить предупреждения.
Команда, стоящая за PenguinHarness
PenguinHarness — проект с открытым исходным кодом, созданный PrismShadow — командой, основанной в 2025 году, которая занимается построением агентной инфраструктуры, способной обучаться на бизнес-знаниях, рабочих процессах и обратной связи.
В исходном отчёте указан следующий состав основателей:
| Участник команды | Краткая справка |
|---|---|
| Чжэн Яовэй | Создатель LlamaFactory; специализируется на доступных моделях и агентной инфраструктуре |
| Цянь Буюэ | Доктор наук Калифорнийского университета в Дэвисе; бывший исследователь IBM T. J. Watson, бывший профессор Фуданьского университета |
| У Сюэцзюнь | Бывший участник-основатель NLP-направления Baidu; занимал руководящие должности в Alibaba и JD Digits |
| Ху Цзюньхао | Аспирант Пекинского университета; участвует в исследованиях моделей и эффективности кэширования |
| Чэнь Си | Профессор Школы бизнеса Нью-Йоркского университета; доктор наук Университета Карнеги — Меллона, бывший главный научный сотрудник Amazon |
Биографические данные в источнике предоставлены издателем и командой проекта. Когда эта информация имеет существенное значение для трудоустройства или академической проверки, читателям следует сверяться с официальными страницами соответствующих учреждений.
От LlamaFactory до PenguinHarness заявленная цель команды остаётся неизменной: превращать сложную инфраструктуру искусственного интеллекта в более доступные, надёжные и эффективные инструменты для более широкого круга пользователей.
Часто задаваемые вопросы
Что такое PenguinHarness?
PenguinHarness — это фреймворк для создания агентов с открытым исходным кодом, который позволяет создавать, запускать, оценивать и оптимизировать ИИ-агентов. Он предоставляет веб-интерфейс, CLI, SDK, встроенные навыки, конфигурацию моделей, трассировку и рабочие процессы многокритериальной оценки.
Бесплатен ли PenguinHarness и имеет ли открытый исходный код?
Да. Основная кодовая база опубликована под лицензией Apache 2.0. Пользователи по-прежнему несут расходы на API моделей, инфраструктуру или сторонние сервисы, связанные с их рабочими нагрузками.
Можно ли запускать PenguinHarness локально?
Да. Он работает на Linux, macOS и Windows как в виде настольного приложения, так и через CLI и браузерный интерфейс. Его также можно установить на сервер для удалённого использования.
Поддерживает ли PenguinHarness локальные модели?
Да. Он включает навыки и интеграции для таких инструментов, как Ollama и vLLM, а также поддерживает пользовательские конечные точки, совместимые с OpenAI. Фактическая совместимость зависит от API-поведения модели и требуемых возможностей.
Что означает самосовершенствование в PenguinHarness?
Самосовершенствование означает, что система оценивает агентов, анализирует оценки и журналы трассировки, изменяет одобренные промпты, навыки или конфигурации и тестирует кандидатные версии следующего поколения. Кандидат принимается только в том случае, если он показывает лучшие результаты в рамках заданной оценки.
Может ли самосовершенствующийся агент изменять ядро PenguinHarness?
Согласно проектному контракту — нет. Эволюция ограничена рабочей областью, промптами, навыками и одобренными конфигурациями, тогда как ядро фреймворка и механизмы безопасности остаются неизменными.
Гарантируется ли стоимость создания агента в ¥0.2?
Нет. Цифра ¥0.2 взята из одного демонстрационного проекта, в котором с помощью DeepSeek V4 Pro было создано RAG-приложение. Фактическая стоимость зависит от ценообразования модели, объёма токенов, количества повторов, провайдера и сложности задачи.
Что такое GDPevo?
GDPevo — это открытый бенчмарк для оценки способности агентов к самосовершенствованию на отложенных реальных бизнес-задачах. Публичная версия V2 включает 240 задач в 24 категориях и различает обучающие и тестовые задачи.
Связанные инструменты
- PenguinHarness: официальный сайт с материалами для загрузки, документацией, примерами продуктов и инструкциями по установке.
- Репозиторий PenguinHarness на GitHub: исходный код Apache 2.0, README, релизы, примеры команд и руководство для контрибьюторов.
- GDPevo: данные бенчмарка, процесс сборки, оценочная рабочая область и опубликованные экспериментальные результаты.
- LlamaFactory: фреймворк с открытым исходным кодом Яовэя Чжэна для эффективной тонкой настройки языковых и мультимодальных моделей.
- vLLM: движок с открытым исходным кодом для высокопроизводительного инференса моделей на локальных и серверных системах.
- Ollama: среда выполнения локальных моделей, используемая в рабочих процессах разработки агентов.
- OpenRouter: единый API-шлюз для доступа к нескольким хостинг-провайдерам моделей.
Связанные ссылки
- Введение в PenguinHarness: официальная публикация команды проекта, объясняющая концепцию «агент создаёт агента».
- Документация PenguinHarness: официальная документация по установке, моделям, навыкам и использованию.
- Репозиторий PenguinHarness на GitHub: исходный код, актуальный список поддерживаемых моделей, команды и лицензия Apache 2.0.
- Релизы PenguinHarness: официальные установочные пакеты для настольных и CLI-версий на поддерживаемых платформах.
- Статья о GDPevo: исследовательская работа, описывающая дизайн бенчмарка, смешанные правила и результаты оценки.
- Репозиторий GDPevo на GitHub: официальный бенчмарк, данные задач, результаты оценки и воспроизводимая рабочая область.
- Репозиторий LlamaFactory на GitHub: официальный репозиторий фреймворка тонкой настройки, упомянутого в статье.
Итоги
PenguinHarness — это платформа с открытым исходным кодом, которая позволяет агентам создавать другие агентные приложения на основе требований на естественном языке. Она генерирует каркас кода, промпты, навыки, конфигурации, код, интерфейс и инструкции по запуску, поддерживая как хостинг-модели, так и локальные модели.
Долгосрочный фокус проекта — самосовершенствование. Несколько оценочных агентов оценивают целевого агента, оптимизатор анализирует результаты и журналы выполнения, и кандидат принимается только при получении более высоких оценок. CONTRACT.md ограничивает область изменений и требует наличия снимков, откатов, скрытых критериев оценки, процедур одобрения, изоляции учётных данных и журналов аудита.
Проект сообщает о значительном снижении затрат и ранних производственных выгодах, однако эти цифры представляют собой демонстрации и тематические исследования, предоставленные командой, а не универсальные выводы.
Лицензия Apache 2.0, опубликованные команды и бенчмарк GDPevo дают разработчикам достаточно материалов, чтобы проверить этот подход на собственных рабочих нагрузках.
Основная идея PenguinHarness проста: создание агентов может быть автоматизировано, но их безопасное улучшение требует измеримой оценки, строгих границ и обратимых изменений.



