LlamaFactory делает тонкую настройку больших языковых моделей более доступной для широкого круга разработчиков. Теперь её создатели Чжэн Яов...

LlamaFactory делает тонкую настройку масштабных моделей более доступной для широкого круга разработчиков. Теперь её создатель Чжэн Яовэй и команда PrismShadow применяют тот же подход «простота в приоритете» к ИИ-агентам.
Их новый открытый проект PenguinHarness направлен на автоматизацию трёх этапов жизненного цикла агента:
Пользователю не нужно вручную выбирать фреймворк, подключать инструменты, писать промпты, создавать интерфейс и многократно тестировать результат — достаточно описать потребность, и PenguinHarness соберёт работающее приложение-агента.

PenguinHarness — это открытый инструмент автоматизированного создания агентов для развертывания на рабочих станциях и серверах.
Проект лёгкий, распространяется под лицензией Apache 2.0 и поддерживает Linux, macOS и Windows. Он может работать локально, а также через браузерный интерфейс на удалённом сервере.
PenguinHarness поддерживает онлайн- и локальные модели через встроенные пресеты и API, совместимый с OpenAI. В официальном репозитории перечислены актуальные модели от DeepSeek, Kimi, GLM, Qwen, OpenAI, Google, Anthropic и других провайдеров.
В исходном отчёте описан RAG-аппликейшн, созданный всего за 0,2 юаня расходов на токены. На официальной странице проекта аналогичный пример оценивается примерно в 0,02 доллара США (с использованием DeepSeek V4 Pro).
Эта цифра — демонстрационные данные проекта, а не гарантированная фиксированная цена. Фактическая стоимость зависит от выбранной модели, провайдера, сложности промптов, количества повторов, масштаба приложения и тарифов на токены.
PenguinHarness исходит из простой идеи: агент должен уметь создавать другое приложение-агента на основе запроса на естественном языке.
Это соответствует более широкой дискуссии об «ИИ для ИИ» и рекурсивном самосовершенствовании — когда ИИ-системы помогают создавать, тестировать или улучшать другие ИИ-системы.
Первый пример использования, представленный в исходной статье, требует от системы создания RAG-приложения, которое должно:
В сравнительном тесте PenguinHarness и кодирующий агент выполняли аналогичные задачи параллельно.
Согласно демонстрации проекта, PenguinHarness выполнил приложение быстрее и с меньшими затратами токенов. Его результат включал плавные ответы, потоковый вывод и ссылки на источники.
Вывод конкурента, показанный в отчёте, содержал смешение языков и не обладал таким же потоковым поведением.
Эти примеры — полезные демонстрации, но они не доказывают в общем виде, что PenguinHarness превосходит любого кодирующего агента во всех сценариях. Результат во многом зависит от модели, конфигурации агента, дизайна задачи и метода оценки.
Традиционная разработка агента обычно включает несколько ручных этапов:
PenguinHarness пытается превратить эти шаги в единый рабочий процесс, управляемый агентом.
Когда запрос определён, система может сгенерировать:
В официальном примере проекта использовался следующий запрос:
Собери документацию с https://github.com/ericbuess/claude-code-docs и создай RAG-приложение, которое будет отвечать на вопросы о Claude Code как эксперт по настройке, цитируя источники.
Согласно отчёту проекта, созданное RAG-приложение при использовании DeepSeek V4 Pro потребило примерно $0,02 (то есть ¥0,2) на токены модели.
PenguinHarness использует файлы как основной слой взаимодействия между человеком и агентом.
В такой архитектуре:
Такой подход делает агента более простым для проверки и модификации.
Вместо того чтобы скрывать важное поведение внутри большого каркаса приложения, PenguinHarness использует редактируемые файлы как основной интерфейс. Человек может читать и изменять эти файлы, а агент — улучшать их в рамках одобренных процессов оптимизации.
Инструмент отвечает за сборку этих файлов в работающий объект-агента.
Во время выполнения PenguinMessage выступает в роли универсального формата сообщений, связывающего модель, среду, инструменты и пользователя.
Исходная статья сравнивает его с сетевым пакетом: разные компоненты могут обмениваться информацией через один и тот же лёгкий интерфейс без уникальной интеграции для каждой модели или среды.
Таким образом, PenguinHarness — это одновременно:

PenguinHarness объединяет PenguinMessage, Penguin SDK и Penguin Skills в лёгкой архитектуре.
Три ключевые области, представленные в архитектуре проекта:
| Компонент | Роль |
|---|---|
| PenguinMessage | Минимальный протокол сообщений между пользователем, моделью, инструментами и средой |
| Penguin SDK | Уровень разработки для создания приложений-агентов |
| Penguin Skills | Переиспользуемые способности для создания, оценки и оптимизации агентов |
Локально воспроизводимый цикл самоэволюции
Создание агента — это лишь первый шаг.
Долгосрочная цель PenguinHarness — позволить пользователям управлять агентами, которых можно оценивать и оптимизировать локально, без необходимости вручную перестраивать всю систему.
Проект разделяет два этапа:
Модифицировать агента относительно легко, поскольку промпты, код, навыки и конфигурации можно редактировать. Но определить, действительно ли изменение сделало агента лучше, гораздо сложнее.
Большие языковые модели вероятностны, а агентные системы вносят дополнительную неопределённость через инструменты, окружение, память и многошаговые решения.
Поэтому надёжный цикл улучшений требует надёжной системы измерений.
Агент может показывать лучшие результаты на одном примере, но в целом становиться хуже.
Без структурированных бенчмарков оптимизатор может:
Команда PrismShadow потратила более шести месяцев на исследование того, как оценивать самоэволюционирующие агенты.
Ключевая проблема заключалась в отсутствии бенчмарков, которые чётко разделяли бы обучающий опыт и отложенные тесты.
Если агент улучшается на тех же задачах, которые используются для оценки, трудно понять, выучил ли он переиспользуемую стратегию или просто запомнил ответы.
Команда создала GDPevo — эволюционно-нативный бенчмарк на основе реальных бизнес-процессов.
В исходной статье описано его покрытие в таких областях, как медицина, финансы и юридическая работа. Текущий публичный репозиторий V2 содержит 240 задач в 24 группах задач, охватывающих:
Каждая группа задач включает:
GDPevo использует подход, называемый смешиванием правил. Бизнес-процессы разбиваются на более мелкие правила, распределяются по обучающим задачам и перекомбинируются в отложенных тестовых задачах.
Такая структура помогает определить, выучил ли агент переиспользуемый рабочий процесс, а не просто заранее увидел тестовые ответы.

GDPevo оценивает, насколько агенты улучшаются на отложенных бизнес-задачах после различных форм эволюции.
Отчёт по GDPevo
В их экспериментах самоэволюция повысила отложенную точность на до 16,44 процентных пункта. Также отмечается, что лучший эволюционировавший агент всё ещё значительно ниже идеального предела 91,6% при полной информации.
Этот разрыв критически важен. Текущие агенты могут улучшаться, но надёжная самоэволюция далека от решения.
PenguinHarness превращает ключевые идеи, лежащие в основе GDPevo, в переиспользуемые навыки для:
После вызова соответствующих навыков несколько агентов могут совместно участвовать в процессе улучшения.
В исходной статье приведён пример агента, спроектированного для задач спортивного прогнозирования, генерации инвестиционных стратегий или поддержки электронной коммерции.
Пользователю не нужно вручную править промпты и рабочие процессы — достаточно позволить PenguinHarness создать оценочные наборы, запустить повторные тесты, проанализировать причины неудач и предложить улучшенные версии.
Демонстрационный отчёт проекта показывает, что после нескольких итераций оценка выросла с 53 до 95 баллов, а затраты на токены модели DeepSeek V4 Flash составили около 0,5 юаня.
Это демонстрационный результат команды проекта, а не общая гарантия бенчмарка. Фактические результаты будут различаться в зависимости от задачи, критериев оценки, модели, объёма выборки и бюджета оптимизации.
Рабочий процесс самоэволюции использует несколько агентов с разделением ролей.
Оптимизирующий агент определяет необходимое количество вопросов и повторений, затем параллельно запускает несколько оценочных агентов.
Параллельная оценка помогает сократить время, необходимое для тестирования нескольких задач или повторных запусков.
Каждый оценочный агент запускает независимую копию целевого агента и просит его решить одну задачу.
Оценочный агент имеет доступ к критериям оценки, а целевой агент — нет.
Такая изоляция предназначена для предотвращения прямой оптимизации целевого агента под скрытые оценочные инструкции.
Оптимизирующий агент собирает результаты и проверяет траектории выполнения.
Он выявляет причины потери баллов, а затем изменяет одобренные части целевого агента, например:
Оптимизирующий агент генерирует кандидата на следующую версию.
Оценочные агенты снова тестируют версию-кандидата.
Оптимизирующий агент принимает кандидата только в том случае, если он набирает строго более высокий балл. Если балл равен или ниже, фреймворк откатывается к предыдущей версии.

Оптимизирующий агент координирует параллельных оценочных агентов и принимает только кандидатов с более высокими баллами.
Этот процесс можно обобщить следующим образом:
Целевой агент vN
↓
Параллельные оценочные агенты
↓
Баллы, критерии оценки и траектории выполнения
↓
Оптимизирующий агент
↓
Обновление промптов, навыков или конфигураций
↓
Агент-кандидат vN+1
↓
Принятие только при строго более высоком балле
Такое сочетание скрытых критериев оценки, отложенных тестов, снапшотов и строгого повышения баллов призвано сделать оптимизацию более воспроизводимой.
Самоэволюция поднимает очевидный вопрос безопасности: что агенту разрешено изменять?
PenguinHarness определяет эти границы в переносимом файле под названием CONTRACT.md.
Этот контракт устанавливает, что способности могут развиваться в одобренных областях, в то время как ядро тестового фреймворка и его границы безопасности остаются неизменными.

Файл CONTRACT.md определяет границы эволюции агента, аудита, контроля версий и изоляции учётных данных.
В исходной статье подчёркиваются четыре ключевых правила.
Область редактирования ограничена рабочим пространством, промптами, навыками и одобренными конфигурациями.
Агент не может переписывать ядро тестового фреймворка или его механизмы безопасности.
Это снижает риск того, что процесс оптимизации ослабит следующие аспекты:
Перед раундом оптимизации фреймворк сохраняет версионный снимок состояния агента.
Если агент-кандидат показывает худшие результаты или вызывает нежелательные побочные эффекты, система может откатиться к более ранней версии.
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Самоулучшающаяся система без возможности отката может накапливать ущерб. Контроль версий делает улучшения обратимыми.
Целевой агент получает задачи, но не скрытые критерии оценки.
Доступ к критериям оценки имеет только оценщик.
Это направлено на снижение поведения, связанного с поиском лёгких путей, запоминания ответов и взлома системы вознаграждения.
Это не полностью устраняет данные риски, но создаёт более чёткое разделение между решением задач и оценкой результатов.
Запросы моделей, вызовы инструментов, использование токенов, время, сбои, одобрения и изменения при оптимизации записываются в файл трассировки.
Пользователи могут проверить, что изменилось и почему.
Более широкий контракт проекта также включает:
В итоге получается фреймворк, в котором агент может эволюционировать, но сам процесс эволюции остаётся видимым и обратимым.
PenguinHarness включает несколько возможностей помимо автоматизированного создания и оптимизации агентов.
и развёртывания
В проект встроены навыки, связанные с разработкой AI-приложений, включая:
penguin-sdkpenguin-cliagenthub-modelsvllmollamallamafactory
PenguinHarness включает навыки для создания агентов и совместной работы с такими инструментами, как vLLM, Ollama и LlamaFactory.
Эти навыки позволяют пользователям описывать задачи обучения или развёртывания на естественном языке, а агент готовит необходимые файлы или команды.
Официальный репозиторий разделяет встроенные навыки на четыре основные категории:
| Группа навыков | Примеры |
|---|---|
| Офисная эффективность | Анализ данных и сбор веб-данных |
| Разработка ПО | Веб-дизайн и программная инженерия |
| Разработка AI-приложений | Penguin SDK, шлюз моделей, vLLM, Ollama и LlamaFactory |
| Настройка агентов | Создание агентов, проектирование бенчмарков, оценка и оптимизация |
Пользователи и агенты также могут создавать или улучшать дополнительные навыки.
PenguinHarness имеет встроенные пресеты моделей и поддерживает пользовательские интерфейсы, совместимые с OpenAI.
Проект заявляет, что через поддерживаемых провайдеров и шлюзы пользователи могут использовать более 1000 онлайн- и локальных моделей.

Шлюз моделей позволяет пользователям настраивать различных онлайн- и локальных провайдеров моделей.
Текущий репозиторий перечисляет следующие серии моделей:
Доступность моделей и названия провайдеров часто меняются, поэтому страницу «Модели» в приложении и текущую официальную документацию следует рассматривать как актуальный источник информации.
В исходной статье описывается подход к разработке, при котором текстовая модель, такая как DeepSeek, выступает в роли основного агента, а модель с визуальными возможностями используется в качестве визуального помощника.
Визуальный агент может проверять:
Основная модель затем может корректировать свои выходные данные на основе визуальных описаний.

Агент с визуальными возможностями может проверять скриншоты, в то время как DeepSeek остаётся основной рабочей моделью.
Это полезно, когда основная модель сильна в кодировании или рассуждениях, но не обрабатывает изображения нативно.
Данный подход не даёт основной модели непосредственных визуальных способностей. Он создаёт мультимодельный рабочий процесс, в котором визуальная модель преобразует скриншоты в информацию, которую может использовать основной агент.
PenguinHarness записывает вызовы моделей, выполнение инструментов, временные показатели, использование токенов, одобрения и активность субагентов.
Интерфейс Trace отображает последовательность выполнения в виде временной шкалы.

По сообщению проекта, в ходе сравнительного анализа сложных данных была достигнута более высокая точность при незначительной части стоимости моделей.
Опубликованная таблица данных:
| Фреймворк | Модель | Точность | Использование токенов | Оценочная стоимость |
|---|---|---|---|---|
| PenguinHarness | DeepSeek V4 Pro | 66,67% | 18,04 млн | 0,55 долл. США |
| Claude Code | Claude Opus 4.8 | 53,33% | 22,20 млн | 38,48 долл. США |
| OpenAI Codex | GPT-5.5 | 53,33% | 13,72 млн | 19,41 долл. США |
Проект резюмирует это следующим образом:
Codex
В этом сравнении инструментальные цепочки объединены с моделями, с которыми они обычно используются. Оно не разделяет вклад инструментальной цепочки и вклад выбранной модели и ценообразования провайдера.
Для объективной внутренней оценки командам следует запускать одни и те же задачи на следующих условиях:
Публичные данные могут служить ориентиром для проекта, но их не следует интерпретировать как универсальный коэффициент стоимости для всех задач.
В исходной статье утверждается, что команда использовала PenguinHarness в двух производственных сценариях.
По имеющимся данным, медицинское учреждение использовало PenguinHarness для создания агента проверки отчётов, чья работа описывается как сопоставимая с работой медицинских экспертов.
По словам команды проекта, проверка, которая ранее занимала около 30 минут, теперь может быть выполнена за несколько десятков секунд.
По имеющимся данным, производственная компания развернула несколько агентов на базе PenguinHarness для непрерывного мониторинга оборудования на производственных линиях и попыток автоматического восстановления.
Команда сообщает:
Вышеуказанные данные являются кейсами, предоставленными поставщиком. В исходном отчёте не указаны имена клиентов, дизайн исследования, размер выборки, базовые определения или информация о независимом аудите.
Их следует рассматривать как примеры заявленных случаев использования, а не как гарантированные операционные результаты.
PenguinHarness поддерживает Linux, macOS, а также Windows 10 или более новые версии, включая архитектуры x64 и Arm64, где это доступно.
Скрипт однострочной установки включает встроенную среду выполнения Node.js. Для установки через npm требуется Node.js 24 или новее.
curl -fsSL https://penguin.ooo/install.sh | sh
penguin web
Веб-интерфейс открывается по адресу:
http://127.0.0.1:7364
irm https://penguin.ooo/install.ps1 | iex
penguin web
npm install -g @prismshadow/penguin-cli
penguin web
При установке через CLI для первого входа в веб-интерфейс используется имя пользователя admin. Первоначальный пароль выводится при первом запуске сервера, и его следует немедленно изменить.
В официальном репозитории приведены примеры команд CLI, аналогичные следующему:
penguin config model add \
--provider deepseek \
--model-id deepseek-v4-flash \
--api-key sk-... \
--set-default
Запуск разовой задачи:
penguin run -m "Создай hello.txt с содержимым Hello, Penguin"
Запуск интерактивной сессии:
penguin chat
Запуск сервера без интерфейса (headless):
penguin server
Ключи API ни в коем случае не следует сохранять в системе управления исходным кодом или вставлять в публичные журналы.
PenguinHarness может работать на локальной машине или сервере. Его браузерный интерфейс поддерживает мультисессионность, управление агентами и навыками, настройку моделей, статистику использования, наблюдаемость через Trace, а также рабочие процессы оценки.
В настоящее время проект отмечает, что некоторые
сборки для настольных компьютеров не подписаны, и при первом запуске операционная система может выдать предупреждение. Пользователям следует загружать программное обеспечение только с официального сайта или из
Скачайте установщик из GitHub Releases и проверьте описание проекта, прежде чем обходить предупреждения.
PenguinHarness — проект с открытым исходным кодом, созданный PrismShadow — командой, основанной в 2025 году, которая занимается построением агентной инфраструктуры, способной обучаться на бизнес-знаниях, рабочих процессах и обратной связи.
В исходном отчёте указан следующий состав основателей:
| Участник команды | Краткая справка |
|---|---|
| Чжэн Яовэй | Создатель LlamaFactory; специализируется на доступных моделях и агентной инфраструктуре |
| Цянь Буюэ | Доктор наук Калифорнийского университета в Дэвисе; бывший исследователь IBM T. J. Watson, бывший профессор Фуданьского университета |
| У Сюэцзюнь | Бывший участник-основатель NLP-направления Baidu; занимал руководящие должности в Alibaba и JD Digits |
| Ху Цзюньхао | Аспирант Пекинского университета; участвует в исследованиях моделей и эффективности кэширования |
| Чэнь Си | Профессор Школы бизнеса Нью-Йоркского университета; доктор наук Университета Карнеги — Меллона, бывший главный научный сотрудник Amazon |
Биографические данные в источнике предоставлены издателем и командой проекта. Когда эта информация имеет существенное значение для трудоустройства или академической проверки, читателям следует сверяться с официальными страницами соответствующих учреждений.
От LlamaFactory до PenguinHarness заявленная цель команды остаётся неизменной: превращать сложную инфраструктуру искусственного интеллекта в более доступные, надёжные и эффективные инструменты для более широкого круга пользователей.
PenguinHarness — это фреймворк для создания агентов с открытым исходным кодом, который позволяет создавать, запускать, оценивать и оптимизировать ИИ-агентов. Он предоставляет веб-интерфейс, CLI, SDK, встроенные навыки, конфигурацию моделей, трассировку и рабочие процессы многокритериальной оценки.
Да. Основная кодовая база опубликована под лицензией Apache 2.0. Пользователи по-прежнему несут расходы на API моделей, инфраструктуру или сторонние сервисы, связанные с их рабочими нагрузками.
Да. Он работает на Linux, macOS и Windows как в виде настольного приложения, так и через CLI и браузерный интерфейс. Его также можно установить на сервер для удалённого использования.
Да. Он включает навыки и интеграции для таких инструментов, как Ollama и vLLM, а также поддерживает пользовательские конечные точки, совместимые с OpenAI. Фактическая совместимость зависит от API-поведения модели и требуемых возможностей.
Самосовершенствование означает, что система оценивает агентов, анализирует оценки и журналы трассировки, изменяет одобренные промпты, навыки или конфигурации и тестирует кандидатные версии следующего поколения. Кандидат принимается только в том случае, если он показывает лучшие результаты в рамках заданной оценки.
Согласно проектному контракту — нет. Эволюция ограничена рабочей областью, промптами, навыками и одобренными конфигурациями, тогда как ядро фреймворка и механизмы безопасности остаются неизменными.
Нет. Цифра ¥0.2 взята из одного демонстрационного проекта, в котором с помощью DeepSeek V4 Pro было создано RAG-приложение. Фактическая стоимость зависит от ценообразования модели, объёма токенов, количества повторов, провайдера и сложности задачи.
GDPevo — это открытый бенчмарк для оценки способности агентов к самосовершенствованию на отложенных реальных бизнес-задачах. Публичная версия V2 включает 240 задач в 24 категориях и различает обучающие и тестовые задачи.
PenguinHarness — это платформа с открытым исходным кодом, которая позволяет агентам создавать другие агентные приложения на основе требований на естественном языке. Она генерирует каркас кода, промпты, навыки, конфигурации, код, интерфейс и инструкции по запуску, поддерживая как хостинг-модели, так и локальные модели.
Долгосрочный фокус проекта — самосовершенствование. Несколько оценочных агентов оценивают целевого агента, оптимизатор анализирует результаты и журналы выполнения, и кандидат принимается только при получении более высоких оценок. CONTRACT.md ограничивает область изменений и требует наличия снимков, откатов, скрытых критериев оценки, процедур одобрения, изоляции учётных данных и журналов аудита.
Проект сообщает о значительном снижении затрат и ранних производственных выгодах, однако эти цифры представляют собой демонстрации и тематические исследования, предоставленные командой, а не универсальные выводы.
Лицензия Apache 2.0, опубликованные команды и бенчмарк GDPevo дают разработчикам достаточно материалов, чтобы проверить этот подход на собственных рабочих нагрузках.
Основная идея PenguinHarness проста: создание агентов может быть автоматизировано, но их безопасное улучшение требует измеримой оценки, строгих границ и обратимых изменений.
Начните с одной фразы и получите полноценный сайт за считанные минуты.