Все посты

Бенчмарк: OpenClaw vs Hermes на 1, 2 и 4 vCPU

OpenClaw и Hermes решают похожие задачи по-разному, и при выборе под конкретную нагрузку разговоры на пальцах не помогают: нужен бенчмарк. Этот материал — методология: что мерить, как убирать шум и как интерпретировать результат. Конкретные цифры мы выложим после прогонов на нашем стенде, а формат — перед вами, чтобы вы могли повторить его у себя.

TL;DR

  • Сравниваем агентов на трёх размерах машин: 1 vCPU (Старт), 2 vCPU (Стандарт), 4 vCPU (Про).
  • Меряем четыре вещи: холодный старт, задержку ответа, пропускную способность диалогов, стабильность памяти на длинной дистанции.
  • Главный враг — шум: соседние процессы и нагретое состояние. Поэтому каждый сценарий гоняется холодным и тёплым стартом, по нескольку прогонов.
  • Результат — не «кто лучше», а «кто на каком размере ведёт себя предсказуемее».

Почему размер машины — главная переменная

Цена на Пуске зависит от размера: 1 vCPU и 1 ГБ памяти — 1 500 ₽/мес, 2 vCPU и 4 ГБ — 2 100 ₽, 4 vCPU и 8 ГБ — 3 000 ₽. Архитектура агентов на это реагирует по-разному: тот, кто укладывается в память, на маленькой машине работает так же, как на большой, а тот, кому нужен простор, деградирует заметно — и это видно только при сравнении размеров.

Поэтому бенчмарк — это сетка «агент × размер», а не одна точка.

Что меряем

1. Холодный старт

Время от «машина запущена» до «агент ответил на первое сообщение». Включает инициализацию рантайма, загрузку конфигурации и памяти. Для канального бота, который перезапускается при обновлениях, это минуты простоя — поэтому метрика важна.

2. Задержка ответа (latency)

Время от прихода сообщения до начала ответа и до его завершения. Меряем перцентили (p50 и p95), а не среднее: среднее прямет выбросы, а клиент видит именно худший случай.

3. Пропускная способность

Сколько параллельных диалогов агент ведёт без деградации задержки. Для OpenClaw это ключевая метрика — он создавался под множество одновременных разговоров в каналах. Нагрузку поднимаем ступенями: 1, 5, 10, 20 диалогов, на каждой ступени фиксируем p95.

4. Стабильность на длинной дистанции

Часовой прогон с реалистичной смесью диалогов: следим за ростом потребления памяти и диска. Цель — поймать «протечку», которая не видна на коротком тесте, но убивает агента на третьи сутки.

Как убираем шум

Warning

Бенчмарк на нагретой машине измеряет не агента, а кэш операционной системы. Любой результат без описания состояния прогонов — это шаманство.

Правила, без которых цифры не читаются:

  • Холодный и тёплый старт отдельно. Каждую метрику гоняем обеими способами и публикуем оба числа.
  • Несколько прогонов. Минимум пять на сценарий; выбросы сверху отбрасываем, берём медиану. Один прогон — это случайность, не результат.
  • Один сценарий — одна машина. Не гоняем OpenClaw и Hermes одновременно на одном инстансе: они мешают друг другу за CPU.
  • Один регион. Сетевой путь до провайдера моделей влияет на задержку. Все прогоны — в одном дата-центре; регион указываем в результатах.
  • Одна модель. Сравниваем агентов, а не нейросети: модель и провайдер — фиксированные, на одном ключе.
  • Фиксированные версии. Версии OpenClaw, Hermes, Node и ОС — в шапке результата. Бенчмарк без версий устаревает в день публикации.

Сценарии под разные задачи

ЗадачаЧто нагружаемОжидаемый профиль
Чат-бот в мессенджереМного коротких диалоговРешает пропускная способность
Агент с длинной памятьюДлинные сессии, поиск по памятиРешает стабильность и дисковый ввод-вывод
Агент для кодаТяжёлые одиночные заданияРешают CPU и объём контекста
Задачи по расписаниюПериодические фоновые заданияРешает холодный старт

Как интерпретировать результат

Хороший бенчмарк отвечает не «кто быстрее», а «где предсказуемее». Например, картина может быть такой: на 1 vCPU оба агента работают, но один держит p95 на стабильном уровне, а другой «проваливается» под нагрузкой; на 4 vCPU разница исчезает. Вывод из такого результата — не «второй плохой», а «второму нужен размер от Стандарта».

Финальная рекомендация в нашем отчёте будет сформулирована именно так: для какой нагрузки какой размер какого агента закрывает задачу, и сколько это стоит в месяц.

Когда появятся цифры

Методология готова. Прогоны идут на нашем стенде — результаты добавим в этот же материал отдельной секцией с указанием версий, региона и дат замеров. Если хотите повторить на своём окружении — сценарии выше описаны достаточно подробно, чтобы собрать их за вечер.

Частые вопросы

Почему бы не взять одну машину помощнее и не гонять всё на ней

Главный практический вопрос при выборе агента — «потянет ли его минимальный тариф». Одна мощная машина этот вопрос не отвечает.

Будете ли тестировать другие размеры — 8, 16, 32 vCPU

Тяжёлым конфигурациям нужен свой сценарий: параллельные пайплайны и команды. Базовое сравнение — на размерах, которые берёт большинство: Старт, Стандарт, Про.

Можно ли доверять бенчмарку без указания версий

Нет. Агенты развиваются быстро: фикс в памяти может изменить картину целиком. Любой чужой результат без шапки версий — это не данные.

Дальше