Команда Hcompany анонсировала выход новой серии агентных моделей Holo4, предназначенных для автономного управления компьютерными интерфейсами. В линейке представлены две архитектуры: Holo4-27B (плотная модель) и Holo4-35B-A3B (Mixture of Experts). Обе модели доступны через H Models API, а также выпущена обновленная версия Holotron4 Nano. Ключевое отличие Holo4 от предыдущих поколений — универсальность: модель не ограничена одним типом взаимодействия, а адаптируется к задаче, используя графический интерфейс (GUI), написание кода, MCP-серверы или прямые API-вызовы.
Бенчмарки и сравнение с лидерами рынка
Модели обучались на данных из Agentic Task Factory и демонстрируют высокую эффективность в сложных рабочих процессах. На академическом бенчмарке OSWorld 2.0 (тестирование управления десктопом) Holo4-27B набрал 61.7%, уступая лишь Opus 5.5 (81.8%), но при этом используя на порядки меньше параметров. Модель Holo4-35B-A3B показала результат 30.9%.
Ниже приведено сравнение ключевых метрик на бенчмарке OSWorld 2.0:
| Модель | Результат OSWorld 2.0 | Архитектура | Примечание |
|---|---|---|---|
| Opus 5.5 | 81.8% | Закрытая (Frontier) | Лидер бенчмарка |
| Holo4-27B | 61.7% | Dense (27B) | Открытая, высокая эффективность |
| Holo4-35B-A3B | 30.9% | Mixture of Experts | Оптимизация под стоимость |
| Qwen3.8 27B | Информация недостаточна | Dense (27B) | Базовая модель для сравнения |
Практическая эффективность: кейсы 3D-моделирования и геймдева
В реальных сценариях Holo4-27B превосходит базовую модель Qwen3.8 27B по экономии токенов и количеству вызовов. В задаче создания 3D-модели Эйфелевой башни в FreeCAD Holo4 выполнил 84 вызова (1.3M токенов), тогда как Qwen3.8 потребовал 60 вызовов (1.0M токенов) — здесь базовая модель оказалась эффективнее по объему вычислений, но Holo4 справился с задачей.
Более показательным стал пример разработки игры в стиле Pac-Man в движке Godot. Holo4-27B справился с задачей за 68 вызовов и 2.4M токенов, сгенерировав 268 строк кода. Для сравнения, Qwen3.8 27B потребовал 197 вызовов и 11.4M токенов для создания 327 строк кода. Это демонстрирует способность Holo4 находить более краткие и эффективные пути решения сложных агентных задач.
Технологическая основа: Agentic Task Factory
Обучение проводилось на наборе из ~10 000 задач, сгенерированных внутренней системой Agentic Task Factory. Эта система создает интерактивные среды и проверяемые задачи на основе документации, скриншотов сайтов и исходного кода. Для улучшения работы с контекстом в длинных сессиях инженеры внедрили надежную систему памяти и встроенную оболочку (shell) на десктопе, что позволило агентам отслеживать сотни шагов без потери контекста.
Все траектории (trajectories) и данные для воспроизведения результатов опубликованы на Hugging Face и trajectories.hcompany.ai.
Бенчмарки
| Бенчмарк | Holo4 27B | Holo4 35B-A3B | Opus 5 | Opus 5.5 |
|---|---|---|---|---|
| OSWorld 2.0 | 61.7% | 30.9% | 70.2% | 81.8% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Hugging Face blog ↗
