Исследования15 июля 2026 г., 07:19 МСК🤖 Auto

Квантование Qwen3.6-27B на M5 Max: 90% точность, но нулевая стат. значимость

Исследование Thanh Luong Tuana демонстрирует, что Qwen3.6-27B, обученный на одном Apple M5 Max, достигает уровня GPT-5 в вьетнамском финтехе, но статистически не превосходит его.

Баннер новости 3600

Суть эксперимента: Distillation на «железе» Apple

Автор представил Proof-of-Mechanism исследование по адаптации модели Qwen3.6-27B (студент) к онтологии Foundation AgenticOS. Ключевая особенность — локальное обучение на Apple M5 Max (чип, заявленный как флагман 2026 года). Обучение велось на 47 синтетических парах предпочтений (English) с использованием SFT и DPO.

Цель — создание суверенной модели для финансовых институтов с жесткими правилами резидентства данных. Модель должна работать внутри периметра организации без облачных вызовов.

Результаты: Паритет с GPT-5, но без стат. уверенности

Тестирование проводилось на 40 задачах вьетнамского финансового домена. Результаты показали паритет с базовой линией GPT-5, однако автор честно признает, что выборка слишком мала для утверждения о превосходстве или даже статистическом равенстве.

Метрика Qwen3.6-27B (Student) GPT-5 (Frontier Baseline) Примечание
Успешное выполнение задач 36 из 40 36 из 40 Grounded rate = 0.90
Покрытие онтологии (r_onto) 0.95 Информация недостаточна Мин. порог метрики: 0.50
95% доверительный интервал ±4 задачи Не позволяет утверждать равенство

Аудит контекстуальности: Отрицательный результат

Вторая часть исследования — аудит маршрутизации enterprise-агентов. Использовался метод Contextuality-by-Default. Результаты оказались «отрицательными»:

  • Степень контекстуальности равна 0 для всех групп Phase 1.3.
  • Полезный сигнал найден не в контекстуальности, а в прямом влиянии (direct influence) и конструктивной связи (construct coupling).

Это означает, что для принятия решений о маршрутизации (стандартизация промптов, синтез агентов или ручной контроль) нужно опираться на корреляции, а не на квантово-подобные аномалии.

Почему это важно для индустрии

Статья доказывает техническую возможность создания «суверенных» LLM на потребительском железе (Apple Silicon), достигающих уровня frontier-моделей в узких доменах. Однако главный вывод — осторожность: даже при совпадении метрик (36/40) малая выборка не гарантирует надежности. Для enterprise-решений требуется масштабирование датасета, а не просто копирование архитектуры.

Источник: arXiv cs.AI ↗