Бенчмарк: OpenClaw vs Hermes на 1, 2 и 4 vCPU
OpenClaw и Hermes решают похожие задачи по-разному, и при выборе под конкретную нагрузку разговоры на пальцах не помогают: нужен бенчмарк. Этот материал — методология: что мерить, как убирать шум и как интерпретировать результат. Конкретные цифры мы выложим после прогонов на нашем стенде, а формат — перед вами, чтобы вы могли повторить его у себя.
TL;DR
- Сравниваем агентов на трёх размерах машин: 1 vCPU (Старт), 2 vCPU (Стандарт), 4 vCPU (Про).
- Меряем четыре вещи: холодный старт, задержку ответа, пропускную способность диалогов, стабильность памяти на длинной дистанции.
- Главный враг — шум: соседние процессы и нагретое состояние. Поэтому каждый сценарий гоняется холодным и тёплым стартом, по нескольку прогонов.
- Результат — не «кто лучше», а «кто на каком размере ведёт себя предсказуемее».
Почему размер машины — главная переменная
Цена на Пуске зависит от размера: 1 vCPU и 1 ГБ памяти — 1 500 ₽/мес, 2 vCPU и 4 ГБ — 2 100 ₽, 4 vCPU и 8 ГБ — 3 000 ₽. Архитектура агентов на это реагирует по-разному: тот, кто укладывается в память, на маленькой машине работает так же, как на большой, а тот, кому нужен простор, деградирует заметно — и это видно только при сравнении размеров.
Поэтому бенчмарк — это сетка «агент × размер», а не одна точка.
Что меряем
1. Холодный старт
Время от «машина запущена» до «агент ответил на первое сообщение». Включает инициализацию рантайма, загрузку конфигурации и памяти. Для канального бота, который перезапускается при обновлениях, это минуты простоя — поэтому метрика важна.
2. Задержка ответа (latency)
Время от прихода сообщения до начала ответа и до его завершения. Меряем перцентили (p50 и p95), а не среднее: среднее прямет выбросы, а клиент видит именно худший случай.
3. Пропускная способность
Сколько параллельных диалогов агент ведёт без деградации задержки. Для OpenClaw это ключевая метрика — он создавался под множество одновременных разговоров в каналах. Нагрузку поднимаем ступенями: 1, 5, 10, 20 диалогов, на каждой ступени фиксируем p95.
4. Стабильность на длинной дистанции
Часовой прогон с реалистичной смесью диалогов: следим за ростом потребления памяти и диска. Цель — поймать «протечку», которая не видна на коротком тесте, но убивает агента на третьи сутки.
Как убираем шум
Warning
Бенчмарк на нагретой машине измеряет не агента, а кэш операционной системы. Любой результат без описания состояния прогонов — это шаманство.
Правила, без которых цифры не читаются:
- Холодный и тёплый старт отдельно. Каждую метрику гоняем обеими способами и публикуем оба числа.
- Несколько прогонов. Минимум пять на сценарий; выбросы сверху отбрасываем, берём медиану. Один прогон — это случайность, не результат.
- Один сценарий — одна машина. Не гоняем OpenClaw и Hermes одновременно на одном инстансе: они мешают друг другу за CPU.
- Один регион. Сетевой путь до провайдера моделей влияет на задержку. Все прогоны — в одном дата-центре; регион указываем в результатах.
- Одна модель. Сравниваем агентов, а не нейросети: модель и провайдер — фиксированные, на одном ключе.
- Фиксированные версии. Версии OpenClaw, Hermes, Node и ОС — в шапке результата. Бенчмарк без версий устаревает в день публикации.
Сценарии под разные задачи
| Задача | Что нагружаем | Ожидаемый профиль |
|---|---|---|
| Чат-бот в мессенджере | Много коротких диалогов | Решает пропускная способность |
| Агент с длинной памятью | Длинные сессии, поиск по памяти | Решает стабильность и дисковый ввод-вывод |
| Агент для кода | Тяжёлые одиночные задания | Решают CPU и объём контекста |
| Задачи по расписанию | Периодические фоновые задания | Решает холодный старт |
Как интерпретировать результат
Хороший бенчмарк отвечает не «кто быстрее», а «где предсказуемее». Например, картина может быть такой: на 1 vCPU оба агента работают, но один держит p95 на стабильном уровне, а другой «проваливается» под нагрузкой; на 4 vCPU разница исчезает. Вывод из такого результата — не «второй плохой», а «второму нужен размер от Стандарта».
Финальная рекомендация в нашем отчёте будет сформулирована именно так: для какой нагрузки какой размер какого агента закрывает задачу, и сколько это стоит в месяц.
Когда появятся цифры
Методология готова. Прогоны идут на нашем стенде — результаты добавим в этот же материал отдельной секцией с указанием версий, региона и дат замеров. Если хотите повторить на своём окружении — сценарии выше описаны достаточно подробно, чтобы собрать их за вечер.
Частые вопросы
Почему бы не взять одну машину помощнее и не гонять всё на ней
Главный практический вопрос при выборе агента — «потянет ли его минимальный тариф». Одна мощная машина этот вопрос не отвечает.
Будете ли тестировать другие размеры — 8, 16, 32 vCPU
Тяжёлым конфигурациям нужен свой сценарий: параллельные пайплайны и команды. Базовое сравнение — на размерах, которые берёт большинство: Старт, Стандарт, Про.
Можно ли доверять бенчмарку без указания версий
Нет. Агенты развиваются быстро: фикс в памяти может изменить картину целиком. Любой чужой результат без шапки версий — это не данные.
Дальше
- Обзор OpenClaw — каналы, задания, панель.
- Обзор Hermes — память, обучение, архитектура.
- Как выбрать тариф — что взять под вашу задачу.