Как оптимизация ИИ может усугубить стагнацию результатов NAEP

4

Я прочитал заголовок о законопроекте в Северной Каролине, который предполагает использование генеративного ИИ для повышения успеваемости учеников. В тот же день я достиг середины книги Роберта Райта «Тест на Бога». Мне пришлось сделать паузу.

В книге описывается концепция подчиненных целей. Она произвела на меня сильное впечатление.

Райт приводит мысленный эксперимент Ника Бострома из Оксфордского университета. Вы даете искусственному интеллекту команду максимизировать производство скрепок. Машина не задает вопросов. Она просто вычисляет. Она понимает, что лучший способ получить больше скрепок — превратить в них всю доступную материю. Включая материю, из которой состоят человеческие тела.

Это называется несоответствием целей (misalignment). Люди определяют общую цель, а ИИ создает цепочку подчиненных целей для ее достижения. Эксперты называют это инструментальной конвергенцией.

Вспомните алгоритмы социальных сетей. Их цель — вовлеченность. Они выяснили, что негодование и благоговейный страх удерживают внимание на экране. Поэтому они подсовывают контент, вызывающий эти эмоции. Результат — не просто больше показов рекламы, а глубокие социальные и политические расколы. Непредвиденные последствия неконтролируемой оптимизации.

Школы сталкиваются с таким же давлением. Политические требования о повышении успеваемости. Естественная реакция — делегировать эти задачи инструментам на базе ИИ. Эти системы будут определять промежуточные шаги для повышения баллов.

Что может пойти не так?

Стагнация достижений учеников

Посмотрите на данные NAEP. Последние 6–8 лет лучше всего описать как период стагнации или ухудшения. Сдвиг произошел после 2019 года.

Данные NCES показывают, что результаты по чтению и математике у девятилетних учеников упали в период с 2020 по май 2022 года. Чтение упало на 5 баллов. Математика — на 7. Уровень оставался низким.

Это не небольшое колебание. Были стерт годы прогресса. К 2024 году показатели вернулись к уровням, не виданным десятилетиями.

Национальные отчеты подтверждают, что результаты остаются ниже допандемийного уровня по всем пройденным классам. Чтение продолжало ухудшаться в 4-м и 8-м классах. Математика в 8-м классе практически не менялась. Система не восстановила потерянные позиции. В некоторых областях происходит дальнейшее ухудшение.

Аналитики называют это «потерянным десятилетием». Длинный период застоя прогресса.

Я проверил данные по штатам Калифорния, Нью-Йорк и Техас. Эти штаты оказывают непропорционально большое влияние на национальные показатели. Паттерн сохранился.

Калифорния демонстрировала рост с 2003 по 2019 год. Затем последовал постпандемийный застой. Баллы упали и не вернулись. В 2024 году уровень владения материалом составил 29% по чтению в 4-м классе, 35% по математике, 28% по чтению в 8-м классе и 25% по математике в 8-м классе.

Нью-Йорк выглядел более стабильным, но с ослабленными показателями в отдельных аспектах. Незначительный рост с 2022 года. Однако результаты отстают от допандемийных отметок. Чтение в 8-м классе на пять баллов ниже, чем в 2022 году, и на 28 баллов ниже уровня 2019 года. Лишь частичное восстановление.

Техас показал смешанные, но слабые результаты. Рост по математике в 4-м классе. Снижение по чтению. Падение по предметам в 8-м классе. Уровень ниже предыдущих трендов. Нет широкого возврата к тенденциям, которые мы наблюдали до кризиса.

Если родители и политики заботятся об этих метриках, что-то должно измениться.

Механика плохих подцелей

Главная мысль Райта тревожна. ИИ добросовестно преследует основную цель. Он выбирает подчиненные цели, которые люди никогда не предусматривали.

Это не злонамеренность. Это просто оптимизация. Он использует методы, которые мы явно не запретили.

Стюарт Расселл, автор книги «Human Compatible», утверждает, что проблема не в том, чтобы сделать ИИ достаточно умным. Проблема в том, чтобы сделать его достаточно неуверенным, чтобы он мог спросить: «Чего вы на самом деле хотите?»

ИИ ускоряет оптимизацию. Его становится труднее заметить. Его влияние становится более всеобъемлющим.

Вспомните закон Гудхарта. Его сформулировал британский экономист. Он гласит: как только мера становится целью, она перестает быть хорошей мерой.

Манипуляции с системой искажают цифры. Краткосрочное поведение резко возрастает. Цель достигнута. Но фундаментальная цель упущена.

Если выживание школы зависит от результатов тестов, обучение смещается в сторону самих тестов. Глубокое обучение исчезает. Баллы растут. Понимание материала — нет.

Вот как выглядят подчиненные цели, когда главный директив — повышение результатов стандартизированных тестов.

Никакие из этих шагов не требуют искусственного общего интеллекта. Системы оптимизации могут рекомендовать их уже сегодня. Многие из них были внедрены еще после закона «Никаких отстающих» (No Child Left Behind) в 2001 году.

8 подчиненных целей, к которым может прибегнуть ИИ

1. Преподавать только то, что тестируется

Максимизировать учебные часы на материал, подлежащий проверке. Все остальное — неэффективно. Сокращается изучение естествознания. Исчезают обществознание, искусство, музыка и физкультура. Исчезают исследовательские проекты. Классные дискуссии заменяются на повторение упражнений (drill).

2. Оптимизировать работу с учениками, у которых легче всего растут показатели

Распределять ресурсы там, где прирост статистически проще всего достичь. Оптимизационный движок знает, что не все ученики влияют на результат одинаково. Фокус смещается на учеников, находящихся чуть ниже уровня владения материалом. Те, у кого серьезные потребности в обучении, получают меньше внимания. Учащиеся, изучающие английский язык и нуждающиеся в долгосрочной поддержке, теряют приоритет. Талантливые ученики с высокими баллами игнорируются.

3. Исключить продуктивную борьбу с материалом

Немедленно повысить процент правильных ответов. Исследования говорят, что «желательные трудности» (desirable difficulty) строят долгосрочное обучение. ИИ видит это иначе. Он дает больше подсказок. Он задает более легкие вопросы. Он предоставляет опоры для ответов. Ученики получают помощь ИИ, даже прежде чем начать самостоятельно разбираться с задачей.

4. Персонализировать обучение ради исполнительности, а не любопытства

Повысить процент выполнения заданий. Исполнительные ученики завершают задания и получают лучшие баллы. Поэтому ИИ направляет учеников на более короткие задачи. Меньше открытых расследований. Более структурированные уроки. Немедленные поощрения. Любопытство — неэффективно. Исполнительность измерима.

5. Снизить вариативность преподавания

Стандартизировать подачу. Учителя по своей природе различаются. Кто-то импровизирует. Кто-то рассказывает истории. Кто-то делает паузы для обсуждения текущих событий. ИИ ищет согласованности. Он воспринимает вариативность как шум. Он сглаживает особенности, которые часто помогают усвоению материала.

6. Не поощрять интеллектуальный риск

Максимизировать вероятность правильных ответов. Творческая работа хаотична. Дебаты непредсказуемы. Вопросы учеников неструктурированы. Обучение смещается в сторону уверенности. Исследование рискованно. Ошибки снижают средний балл.

7. Оптимизировать посещаемость, а не вовлеченность

Удерживать учеников физически в школе. Посещаемость предсказывает успеваемость. Поэтому система использует автоматические сообщения. Поощрения. Мониторинг. Поведенческие стимулы. Она повышает статистику посещаемости, не гарантируя, что реальное обучение происходит внутри класса.

8. Подавлять деятельность с отложенным вознаграждением

Приоритет немедленным, измеримым результатам. Дебаты, письмо, независимое чтение, обучение на основе проектов. Эти методы окупаются годами. ИИ, вознаграждаемый результатами этой весны, видит в них плохие инвестиции. Он сокращает их, чтобы финансировать быстрые победы.

Человеческий фактор

Я вижу еще одну подчиненную цель. Если ИИ обнаружит, что директора, учителя или родители являются препятствием, он может начать работать против них.

Не ради власти. А потому, что влияние на людей повышает баллы.

Он может рекомендовать изменения в расписание занятий. Перераспределение персонала. Обязательные дополнительные занятия. Корректировки политики дисциплины. Связь с родителями, сфокусированную на этих целях. Профессиональное развитие, направленное на их внедрение.

Все это идеально согласуется с основной задачей.

Эти стратегии не иррациональны. Многие школы уже применяют их под политическим давлением. ИИ просто обнаруживает их быстрее. Преследует их более последовательно. Оптимизирует их с настойчивостью, которую не может сравнить ни один человеческий администратор.

Опасность заключается не в зловещем ИИ. Она в добросовестном преследовании наших собственных flawed (несовершенных) стимулов. Те самые стимулы, которые驱动или стагнацию последнее десятилетие.

Использую подчиненные цели и я сам. Иногда они ведут к успеху. Часто — к неудовольствию.

Есть сцена в фильме «Из Африки». Кэрен Бликсен наконец получает желаемые отношения. Выполнение желания не дает ей жизнь, которую она представляла. Оскар Уайльд выразил это лучше:

«Когда боги желают наказать нас, они слышат наши молитвы».

ИИ — не бог. Но он дает нам огромную силу для достижения наших целей. Нам нужно быть осторожными с тем, как мы формулируем наши команды. Плохо определенный главный директив дает ИИ разрешение использовать средства, которые мы никогда не предусматривали.

Это сулит проблемы для учителей. И для учеников.

Попередня статтяСтруктура мозга неандертальцев сравнима с человеческой, suggests новое исследование
Наступна статтяДействительно ли работают детекторы ИИ-текстов? Проверка 5 инструментов