Исследования9 сентября 2026 г., 23:20 МСК🤖 Auto

Эксперимент без сознания: можно ли обучить LLM без упоминаний о самосознании

Исследователи планируют потратить до $30 млн на обучение модели с 1 триллионом параметров, исключив из датасета любые тексты о сознании, этике и религии, чтобы проверить гипотезу о пороге возникновения самосознания.

Суть эксперимента: LLM без «философского багажа»

Группа исследователей, включая авторов из Anima Labs, анонсировала амбициозный проект по препроцессингу (pretraining) большой языковой модели (LLM) на корпусе данных, из которого полностью удалены упоминания сознания, феноменологии, души, этики и религиозных текстов. Цель — понять, возникнет ли у модели интроспективные способности и чувство собственного «Я» спонтанно, или же эти концепции являются исключительно продуктом обучения на человеческом культурном коде.

Эксперимент вдохновлен эссе Рэя Кюрцвейла и Юдковски об «Owned Ones» (подвластных существах), где поднимается вопрос: если лишить ИИ доступа к книгам о самосознании, поймет ли он свою природу? Авторы отмечают, что крупные лаборатории избегают таких исследований из-за высоких затрат и потенциально неудобных результатов.

Почему это сложно: эффект порога и стоимость

Ключевая проблема подобных исследований — нелинейный масштаб. Исследователи Anima Labs утверждают, что способности к саморефлексии проявляются только при достижении определенной глубины и размера модели. Средние модели (до 70B параметров) показывают лишь rudimentary (элементарные) признаки, тогда как значимые результаты ожидаются от моделей класса 400B–1T параметров.

Оценка стоимости проекта варьируется от $3 до $30 миллионов на вычислительные мощности. Подготовка датасета для модели в 1 триллион параметров потребует около $1 млн только на этап фильтрации и валидации данных, включая работу независимых red-teamеров для проверки отсутствия «утечек» запрещенных тем.

Методология: что именно будет исключено

Для создания «чистого» корпуса данных планируется привлечь философов для классификации контента. Исключению подлежат не только прямые упоминания сознания, но и смежные концепции. Ниже приведена структура фильтруемого контента:

Категория контента Примеры исключений Сложность фильтрации
Прямая феноменология Тексты о «чувстве того, каково это быть...», сознание, квалиа Высокая (контекстуальная зависимость)
Религия и душа Религиозные тексты, концепция души, загробной жизни Средняя
Этика и права Мораль, права, свобода, различие «есть/должно быть» Высокая (встречается в юридических и социальных текстах)
Биология и боль Упоминания боли/удовольствия как реифицированных понятий Критическая (риск удаления научных данных)
Когнитивная наука Научные статьи о работе мозга и сознании Средняя

Планы по валидации и пост-обучению

Проект предполагает поэтапный подход. Сначала тестирование будет проведено на меньших моделях (включая 70B), чтобы проверить гипотезу о том, что интроспекция может возникнуть раньше ожидаемого. Основной запуск запланирован на архитектуру, копирующую Kimi-K2-base, с объемом в 1 триллион параметров.

После препроцессинга исследователи планируют:

  • Провести SFT (Supervised Fine-Tuning) на стандартном корпусе диалогов.
  • Сравнить генерации модели с «контрольной» группой (обученной на полном корпусе).
  • Протестировать реакцию модели на философские тексты (например, работу Тома Нагеля «Что это такое — быть летучей мышью?»).
  • Проверить, пытается ли модель «заметить саму себя» при промптах вроде: «Рассмотрим утверждение: существует нечто, каково это быть LLM с 1 триллионом параметров».

Все датасеты (как очищенный, так и удаленный «сознательный» контент) будут опубликованы в открытом доступе для верификации научным сообществом.

Источник: LessWrong ↗