Релиз модели1 июля 2026 г., 19:46 МСК🤖 Auto

4B-модель Microsoft бьет GPT-5.4 и Claude в задачах GUI

Новая LoRA-модель GELab-Zero-4B-preview-Sico-Evolution от Microsoft достигла 82.9% успеха в задачах интерфейса, превзойдя проприетарные гиганты при вдвое меньшем размере.

Баннер новости 2754

Революция в эффективности: 4B против гигантов

Лаборатория Microsoft AI (GELab) представила новую версию своей модели для управления графическим интерфейсом (GUI) — GELab-Zero-4B-preview-Sico-Evolution. Это не просто итерация, а результат применения специализированного конвейера эволюции моделей, который итеративно повышает реальный процент успешного выполнения задач. Ключевое достижение: модель с всего 4 миллиардами параметров обходит по качеству закрытые решения уровня GPT-5.4 и Claude Opus 4.

Конкретные метрики успеха

Базовая модель GELab-Zero-4B показывала результат на уровне 39.8%. После применения эволюционного пайплайна (Sico-Evolution) показатель вырос до 82.9%. Это абсолютный прирост в 43.1 процентных пункта, что делает модель лидером в своем классе. Сравнение с ключевыми игроками рынка демонстрирует доминирование открытого решения:

Модель Тип Task Success Rate (TSR)
GELab-Zero-4B-Sico-Evolution Open Source (4B) 82.9%
Claude Opus 4.7 Proprietary 82.1%
Claude Opus 4.6 Proprietary 81.3%
GPT-5.4 Proprietary 79.7%
Kimi K2.6 Open Source 62.6%
UI-Venus-1.5-30B Open Source (30B) 61.0%

Технические детали и обучение

Модель является адаптером (LoRA), дообученным на базе открытой модели GELab-Zero-4B-preview. Обучение проводилось на траекториях взаимодействия с интерфейсами Microsoft Edge и Copilot. Архитектура использует формат BF16, что оптимизирует использование памяти при инференсе. Важно отметить, что методология эволюции заявлена как универсальная: она позволяет переносить навыки агента на любые GUI-приложения, а не только на продукты Microsoft.

Почему это важно для разработчиков

Результат доказывает, что для специализированных задач (таких как автоматизация UI) компактные открытые модели могут превосходить тяжеловесные проприетарные аналоги. Размер в 4B параметров позволяет развертывать агента локально или на недорогих GPU, снижая зависимость от API-лимитов и затрат на облачные вычисления. Модель доступна на Hugging Face в формате Safetensors, что упрощает интеграцию в существующие пайплайны автоматизации.

Бенчмарки

БенчмаркGELab-Zero-4B-preview-Sico-EvolutionClaude-Opus-4.6claude-opus-4.7gpt-5.4
Task Success Rate82.9%81.3%82.1%79.7%

Жирным — лучший результат в строке. Источник цифр — официальная публикация.

Источник: Huggingface ↗