Проблема: отсутствие «вкуса» у моделей
Основной瓶颈 (бутылочное горлышко) в современных исследованиях AI Safety — нехватка данных, демонстрирующих процесс принятия решений, а не только финальные результаты. Общие корпуса данных учат модели, как выглядит хороший ответ, но не учат её дифференциальному улучшению: способности выбирать направления мысли, отвергать идеи и корректировать гипотезы в реальном времени. Проект SPAR (Safeguarding Progress in AI Research) под руководством Paul Davidson и наставничества Alec Harris ставит целью собрать именно эти «следы» мышления.
Что именно собирается: типы данных
Команда фокусируется на сборе артефактов, содержащих историю редактирования и обсуждения. Это позволяет обучать модели не просто генерировать текст, а понимать процесс научного дизайна. В приоритете следующие форматы:
| Тип данных | Примеры | Ценность для обучения |
|---|---|---|
| Документы с историей | Google Docs, LaTeX файлы с комментариями и ревизиями | Показывает эволюцию идеи, отброшенные гипотезы и аргументацию |
| Транскрипты встреч | Записи совещаний, мозговых штурмов | Демонстрирует социальное взаимодействие и коллективное принятие решений |
| Переписка | Email, сообщения в мессенджерах | Контекст неформального обсуждения технических деталей |
| Записи экрана | Просмотр планов исследований, код-ревью | Визуализация процесса анализа и критики |
Архитетура доверия и контроля данных
Ключевая инновация проекта — модель распределенного контроля. Данные хранятся в централизованном репозитории, но доступ к ним имеют только потребители (потребители данных), одобренные самими поставщиками. Это решает проблему конфиденциальности и интеллектуальной собственности:
- Поставщики (Providers): Индивидуальные исследователи или организации. Они дают согласие на сбор, могут запросить отзыв данных (revocation) и определяют, кто из потребителей получит доступ к их архивам.
- Потребители (Consumers): Организации или исследователи, которые фильтруют сырые данные (например, выделяют только обсуждения этических дилемм) и используют их для тонкой настройки (fine-tuning) моделей.
- Базовая тегировка: Система автоматически маркирует данные по типу, дате и поставщику, но не аннотирует содержание, оставляя выборку на усмотрение потребителя.
Почему это важно для индустрии
Сейчас большинство моделей обучается на финальных продуктах (статьях, коде, ответах). SPAR предлагает парадигмальный сдвиг: обучение на процессе. Если модель научится анализировать, как люди отбраковывают плохие идеи в безопасности ИИ, она сможет лучше предсказывать риски на этапе проектирования. Пилотный этап (Fall 2026) направлен на тестирование инфраструктуры агрегации, так как именно сбор и хранение таких разрозненных данных считаются главным техническим барьером.
Как принять участие
Проект ищет lead users — организации или исследователей, готовых предоставить свои архивы для пилотной фазы. Заполнение формы интереса занимает менее 5 минут. Цель — создать репрезентативную выборку данных, чтобы в будущем масштабировать проект на всю исследовательскую комьюнити.
Источник: LessWrong ↗