Исправление работы с памятью AMD APU
Выпуск Lemonade 2026.40 RC решает проблему, из-за которой модели с активным стримингом (например, DeepSeek-V4-Flash-IQ2XXS-DS4) отказывались запускаться на интегрированных графических процессорах AMD (APU), в частности на платформе Ryzen AI Max (Strix Halo). Ранее система ошибочно оценивала доступную память по размеру фиксированного выдела vRAM, игнорируя пул GTT (Graphics Translation Table), который доступен для использования. Теперь Lemonade корректно учитывает адресное пространство GTT, что позволяет эффективно использовать объем системной RAM для работы с тяжелыми моделями на APU.
Удаление бэкенда OpenMOSS из-за низкой скорости
Разработчики приняли радикальное решение: полностью удалить поддержку бэкенда OpenMOSS для ROCm как на Windows, так и на Linux. Инициатива OpenMOSS, разрабатываемая в Китае, показала неприемлемо низкую производительность. При тестировании на том же оборудовании ROCm-версия OpenMOSS работала примерно в 40 раз медленнее, чем стандартный бэкенд Vulkan. Вероятной причиной такого разрыва стала вынужденная обработка вычислений на CPU (CPU fallback) в коде ROCm, что сводит на нет преимущества GPU.
Сравнение производительности OpenMOSS
Ниже приведены данные, послужившие основанием для удаления поддержки данного бэкенда:
| Бэкенд | Относительная скорость | Примечание |
|---|---|---|
| Vulkan | 1x (Базовый уровень) | Оптимальная производительность |
| ROCm (OpenMOSS) | ~0.025x (в 40 раз медленнее) | Критические задержки из-за CPU-фолбэков |
Новая система версионирования и Junie
Релиз 2026.39.1 стал первым стабильным выпуском в рамках новой схемы нумерации, основанной на году и номере недели (Year.Week). Это упрощает отслеживание актуальности сборок. Кроме того, в ветку 2026.40 RC добавлен новый агент запуска для IDE JetBrains Junie, расширяющий возможности интеграции AI-сервера в среду разработки.
Дополнительные улучшения
В версии 2026.39.1 также реализована настраиваемая автоматическая эвакция (удаление) моделей из видеопамяти (vRAM). Это позволяет пользователям тонко настраивать управление ресурсами, предотвращая переполнение памяти при работе с несколькими моделями одновременно.
Источник: Phoronix ↗
