FranxYao/chain-of-thought-hub

Benchmarking large language models' complex reasoning ability with chain-of-thought prompting

Инструменты⭐ 2 775Jupyter Notebook
Открыть на GitHub ↗

Что это за инструмент

Chain-of-Thought Hub — это бенчмарк для оценки способности больших языковых моделей (LLM) к сложному логическому рассуждению с использованием цепочки мыслей (chain-of-thought).

Зачем нужен

Инструмент позволяет объективно сравнить производительность различных LLM на задачах, требующих глубокого анализа, а не просто поверхностного ответа. Он полезен для исследователей и разработчиков, которым нужно выбрать модель, способную решать сложные задачи в математике, программировании или работе с длинным контекстом.

Что можно реализовать

  • Сравнение эффективности разных моделей (например, GPT-4 vs GPT-3.5 или открытых моделей) на сложных логических задачах.
  • Оценка способности модели к рассуждению в специфических областях: математика (GSM8K, MATH), наука (TheoremQA) или символические задачи (BBH).
  • Проверка работы моделей с длинным контекстом (long-context) на основе научных статей или художественных текстов.
  • Анализ качества кода и программирования на примере HumanEval.

Ключевые возможности

  • Включает стабильные основные датасеты (Main) и экспериментальные наборы для тестирования будущих возможностей.
  • Покрывает широкий спектр задач: математика, наука, символика, знания, кодирование и длинный контекст.
  • Предоставляет актуальные лидерборды с результатами для популярных моделей (LLaMA, Mistral, Yi, DeepSeek и др.).
  • Используется ведущими промышленными и академическими организациями для оценки LLM.
  • Открыт для вклада сообщества: можно предлагать новые задачи, датасеты или модели для тестирования.

👤 Кому подойдёт: исследователи, разработчики LLM, инженеры по машинному обучению

Релизы

Релизы ещё не отслежены — появятся после ближайшего опроса.