Революция в эффективности: 4B против гигантов
Лаборатория Microsoft AI (GELab) представила новую версию своей модели для управления графическим интерфейсом (GUI) — GELab-Zero-4B-preview-Sico-Evolution. Это не просто итерация, а результат применения специализированного конвейера эволюции моделей, который итеративно повышает реальный процент успешного выполнения задач. Ключевое достижение: модель с всего 4 миллиардами параметров обходит по качеству закрытые решения уровня GPT-5.4 и Claude Opus 4.
Конкретные метрики успеха
Базовая модель GELab-Zero-4B показывала результат на уровне 39.8%. После применения эволюционного пайплайна (Sico-Evolution) показатель вырос до 82.9%. Это абсолютный прирост в 43.1 процентных пункта, что делает модель лидером в своем классе. Сравнение с ключевыми игроками рынка демонстрирует доминирование открытого решения:
| Модель | Тип | Task Success Rate (TSR) |
|---|---|---|
| GELab-Zero-4B-Sico-Evolution | Open Source (4B) | 82.9% |
| Claude Opus 4.7 | Proprietary | 82.1% |
| Claude Opus 4.6 | Proprietary | 81.3% |
| GPT-5.4 | Proprietary | 79.7% |
| Kimi K2.6 | Open Source | 62.6% |
| UI-Venus-1.5-30B | Open Source (30B) | 61.0% |
Технические детали и обучение
Модель является адаптером (LoRA), дообученным на базе открытой модели GELab-Zero-4B-preview. Обучение проводилось на траекториях взаимодействия с интерфейсами Microsoft Edge и Copilot. Архитектура использует формат BF16, что оптимизирует использование памяти при инференсе. Важно отметить, что методология эволюции заявлена как универсальная: она позволяет переносить навыки агента на любые GUI-приложения, а не только на продукты Microsoft.
Почему это важно для разработчиков
Результат доказывает, что для специализированных задач (таких как автоматизация UI) компактные открытые модели могут превосходить тяжеловесные проприетарные аналоги. Размер в 4B параметров позволяет развертывать агента локально или на недорогих GPU, снижая зависимость от API-лимитов и затрат на облачные вычисления. Модель доступна на Hugging Face в формате Safetensors, что упрощает интеграцию в существующие пайплайны автоматизации.
Бенчмарки
| Бенчмарк | GELab-Zero-4B-preview-Sico-Evolution | Claude-Opus-4.6 | claude-opus-4.7 | gpt-5.4 |
|---|---|---|---|---|
| Task Success Rate | 82.9% | 81.3% | 82.1% | 79.7% |
Жирным — лучший результат в строке. Источник цифр — официальная публикация.
Источник: Huggingface ↗
