openai/gpt-oss

gpt-oss-120b and gpt-oss-20b are two open-weight language models by OpenAI

LLM⭐ 20 422Pythonпоследний релиз: v0.0.9
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

gpt-oss — серия открытых языковых моделей от OpenAI (120B и 20B параметров) с архитектурой MoE, оптимизированных для эффективного инференса на одном GPU.

Зачем нужен

Инструмент предназначен для развертывания мощных моделей с развитыми способностями к рассуждению (reasoning) и выполнения агентских задач (agentic tasks) в продакшене или локально. Он полезен разработчикам, которым нужен полный контроль над процессом генерации, доступ к цепочке рассуждений (chain-of-thought) и возможность кастомизации модели через fine-tuning без ограничений лицензии.

Что можно реализовать

  • Запуск высокопроизводительных AI-ассистентов с возможностью вызова инструментов (function calling) и веб-браузинга
  • Локальное или on-premise развертывание LLM на одном GPU (NVIDIA H100/AMD MI300X) благодаря MXFP4 квантованию
  • Агентские сценарии с выполнением Python-кода и структурированным выводом (Structured Outputs)
  • Исследование и отладка процессов рассуждения модели через полный доступ к chain-of-thought
  • Создание кастомизированных моделей под специфические задачи через fine-tuning

Ключевые возможности

  • Лицензия Apache 2.0: свободное использование, коммерческое применение и отсутствие copyleft-ограничений
  • Нативная поддержка агентов: встроенные возможности для function calling, веб-браузинга и выполнения кода
  • MXFP4 квантование весов: позволяет запускать 120B-модель на одном 80GB GPU, а 20B-модель — на 16GB
  • Полный доступ к chain-of-thought: прозрачность процесса рассуждения для отладки и доверия к выводам
  • Настраиваемые усилия рассуждения (reasoning effort): возможность регулировать баланс между скоростью и качеством ответа

👤 Кому подойдёт: разработчики, ML-инженеры, исследователи и компании, ищущие открытые LLM для продакшена с возможностью локального развертывания и кастомизации

Релизы

v0.0.9minor
🕐 8 мес назад · релиз на GitHub ↗

Оптимизация Metal и MoE, пример RL-дообучения, исправления сборки и улучшенная стабильность браузера.

  • Added: Добавлен пример Reinforcement Finetuning для GPT-OSS.
  • Added: Оптимизация Metal: max_batch_tokens перенесён в Context, упрощена проверка типа модели.
  • Added: Ускорение Prefill: устранено GPU-CPU синхронизация и лишнее копирование KV после RoPE.
  • Fixed: Исправлена ошибка сборки Metal из-за дублирующейся переменной.
  • Added: Улучшена надёжность браузера и добавлена опция stateful Jupyter notebook.