FranxYao/chain-of-thought-hub
Benchmarking large language models' complex reasoning ability with chain-of-thought prompting
Инструменты⭐ 2 775Jupyter Notebook
Что это за инструмент
Chain-of-Thought Hub — это бенчмарк для оценки способности больших языковых моделей (LLM) к сложному логическому рассуждению с использованием цепочки мыслей (chain-of-thought).
Зачем нужен
Инструмент позволяет объективно сравнить производительность различных LLM на задачах, требующих глубокого анализа, а не просто поверхностного ответа. Он полезен для исследователей и разработчиков, которым нужно выбрать модель, способную решать сложные задачи в математике, программировании или работе с длинным контекстом.
Что можно реализовать
- Сравнение эффективности разных моделей (например, GPT-4 vs GPT-3.5 или открытых моделей) на сложных логических задачах.
- Оценка способности модели к рассуждению в специфических областях: математика (GSM8K, MATH), наука (TheoremQA) или символические задачи (BBH).
- Проверка работы моделей с длинным контекстом (long-context) на основе научных статей или художественных текстов.
- Анализ качества кода и программирования на примере HumanEval.
Ключевые возможности
- Включает стабильные основные датасеты (Main) и экспериментальные наборы для тестирования будущих возможностей.
- Покрывает широкий спектр задач: математика, наука, символика, знания, кодирование и длинный контекст.
- Предоставляет актуальные лидерборды с результатами для популярных моделей (LLaMA, Mistral, Yi, DeepSeek и др.).
- Используется ведущими промышленными и академическими организациями для оценки LLM.
- Открыт для вклада сообщества: можно предлагать новые задачи, датасеты или модели для тестирования.
👤 Кому подойдёт: исследователи, разработчики LLM, инженеры по машинному обучению
Релизы
Релизы ещё не отслежены — появятся после ближайшего опроса.