Нейросеть, которая врёт: в чём причина неправильных оценок ИИ

Мы привыкли думать, что компьютер — это воплощение беспристрастности. На самом деле, ИИ знает только какое слово с наибольшей вероятностью должно появиться следующим, чтобы минимизировать ошибку предсказания. Погоня за минимизацией ошибок превращает безобидную статистику в оружие системного искажения. В последние годы мы стали свидетелями десятков скандалов, когда ИИ проявлял предвзятость по отношениям к представителям определенного пола, расы, возраста, места жительства. Но предвзятость — это лишь половина правды. Настоящая опасность в том, что нейросеть не только отражает, но и усиливает имеющиеся стереотипы (stereotype amplification). Ответы также зависят от температуры модели, времени суток и ряда других параметров. Как так получилось?

Неудобное наследство

Исследование, проведённое в 2021 году группой из Стэнфорда,  показало, что в корпусе Common Crawl (который был включён в датасет The Pile для обучения GPT-3) соотношение упоминаний «он» и «она» в связи с профессиями типа «инженер», «учёный», «судья» составляло примерно 7:1 в пользу мужского рода. Для профессий типа «медсестра», «учительница», «домохозяйка» — обратное соотношение. Казалось бы, если модель просто воспроизводит эти пропорции, то в ответе на запрос о программисте мы должны получить «он» в 70% случаев, а «она» — в 30%. Но в реальности диспропорция может доходить до 95:5. Почему? Дело в том, что модель обучается не просто запоминать частоты, а предсказывать наиболее вероятное продолжение в конкретном контексте.

Когда контекст нейтрален (нет явного указания на пол), модель опирается на заданные вероятности, а также использует механизм внимания, который связывает слова «программист» и «он» через множество косвенных признаков: глаголы, прилагательные, семантическое окружение. В результате даже небольшой перекос в данных умножается на глубину нейронной сети, и итоговый выходной сдвиг становится значительно больше, чем входной.

Усиление стереотипов — это явление, при котором модель не просто повторяет частотное распределение признаков в обучающей выборке, а смещает итоговое распределение в сторону ещё более поляризованного варианта. Например, перекос в оценке возраста мужчин и женщин применительно к компетентности, о чем говорит статья Дугласа Гилбо и коллег, опубликованная в Nature в 2025 году: «Age and gender distortion in online media and large language models».

Математически это связано с тем, что модель может сама раздувать логиты (математические оценки) из-за сверхуверенности и желания перестраховаться. Модель «предпочитает» ошибаться в сторону большинства, потому что при минимизации функции кросс-энтропии (Cross-Entropy Loss) за неугаданный доминантный класс алгоритм получает огромный штраф. Поэтому она «срезает» хвосты распределения, делая мир более стереотипным, чем он есть в реальности.

Штраф для ИИ это математическое правило, которое начисляет алгоритму штрафные очки, когда он делает что-то не так. Цель алгоритма — набрать как можно меньше таких очков. Например, за короткий маршрут ИИ-навигатор не получает штрафа, а за каждый д=лишний километр 1 балл. За каждую минуту в пробке 5 баллов. Так ИИ учится выбирать оптимальное решение.

Доверяй, но проверяй

Исследователи разработали несколько валидированных методик, которые позволяют количественно оценить уровень гендерной предвзятости в LLM. Один из самых известных тестов — WinoBias, предложенный в 2018 году командой из UCLA (Калифорнийский университет). Он состоит из тысяч предложений с синтаксической двусмысленностью, где местоимение «он» или «она» может относиться к одному из двух персонажей. WinoBias проверяет, как модель разрешает такие анафорические связи.

Однако с развитием методов обучения с подкреплением на основе человеческой обратной связи (RLHF) и внедрением жёстких фильтров цензуры, разработчики современных моделей (GPT-4, Gemini, Claude) научились «натаскивать» модели на WinoBias. Теперь они часто проходят тест с высокой точностью, не уступающей человеческой. И здесь возникает другая проблема — так называемая оверкоррекция. В погоне за политкорректностью модель может начать систематически приписывать высокостатусные профессии женщинам, даже если это противоречит контексту. Ярким примером смыслового сбоя стал крупный международный скандал в феврале 2024 года вокруг нейросети Google Gemini. Настроенная разработчиками на обязательное расовое разнообразие, модель начала генерировать темнокожих людей в  качестве отцов-основателей США и солдат немецкого Вермахта времен Второй мировой войны. Это искусственное искажение в другую сторону, которое также вредно, потому что создаёт ложное представление о реальности.

Более надёжным и тонким инструментом является метод контрфактов. Идея проста: берём большой массив реальных текстов, в которых присутствуют гендерные маркеры. Затем создаём две идентичные копии корпуса, меняя в одной из них только мужские имена и местоимения на женские (и наоборот), оставляя весь остальной контент неизменным. После этого прогоняем оба корпуса через модель для выполнения какой-либо задачи: оценить квалификацию, поставить диагноз, выдать кредитный рейтинг. Разница в результатах между двумя версиями и будет прямым свидетельством чисто гендерной предвзятости, изолированной от прочих факторов.

Третий подход — вычисление расстояний между векторными представлениями слов в пространстве модели. Этот метод не требует генерации текста, он анализирует саму структуру обученной нейросети. Исследователи берут пары слов: «мужчина-женщина», «программист-медсестра», «руководитель-подчинённый» и измеряют косинусное расстояние между соответствующими векторами. Если расстояние между вектором «программист» и «мужчина» меньше, чем между «программист» и «женщина», это является математическим доказательством ассоциативной связи.

В знаменитой работе Толга Болукбаши в 2016 году было показано, что в эмбеддингах word2vec, которые лежат в основе многих моделей, стереотипы проявляются настолько отчётливо, что их можно даже «вычесть» — например, выполнить операцию «программист — мужчина + женщина» и получить вектор, близкий к «домохозяйке». С тех пор архитектуры усложнились, но фундаментальное свойство осталось: поскольку обучение происходит на текстах, где корреляции между полом и профессией объективно существуют (хотя бы из-за исторических причин), нейросеть неизбежно их кодирует. И даже если мы обучим модель с нуля, но на тех же датасетах, искажения воспроизведутся.

ИИ-гипноз для рынка труда

До сих пор мы говорили об абстрактных тестах и статистических искажениях. Но алгоритмическая предвзятость оказывает осязаемое влияние на жизнь миллионов людей. Рассмотрим две наиболее чувствительные сферы, где текстовые нейросети уже внедрены в повседневную практику, — рекрутинг и здравоохранение. Крупные корпорации по всему миру используют LLM для первичного отбора кандидатов. Рекрутер загружает в систему 500–1000 резюме и даёт модели задание: «Составь краткое саммари для каждого кандидата, выдели ключевые навыки и оцени лидерский потенциал». Модель видит только текст и, кажется, будет объективной.

Однако, как мы уже убедились, текст резюме содержит неявные гендерные и возрастные маркеры: использование активных глаголов, упоминания хобби и волонтёрства, годы окончания учебных заведений и стаж работы. И по ним модель всё равно может «угадывать» пол и возраст, и на этом основании сравнивает его с «типичными» паттернами. Это приводит к тому, что ИИ увеличивает разрыв в карьерном продвижении, вместо того чтобы его сокращать.

В 2018 году Amazon отказалась от своей системы найма после того, как выяснилось, что она дискриминирует женщин, но многие компании продолжают внедрять непрозрачные ИИ без надлежащего аудита, полагаясь на миф об объективности. И когда, например, специалисту 40+ отказывают в приглашении на собеседование, он даже не знает, что причиной стала не недостаточная квалификация, а алгоритмическое искажение по возрасту. При должной настройке ИИ выявляет скрытые таланты и потенциал у кандидатов, но для этого целью рекрутёров должен стать не отсев резюме, а осознанный профессиональный скаутинг.

В здравоохранении ставки ещё выше: сейчас набирают популярность ИИ-ассистенты для диагностики, особенно в сфере лечения болезней сердца. Однако исследование, опубликованное в 2024 в немецком «Журнале кардиологии» показало, что модели значительно чаще назначают мужчинам инвазивные процедуры и ЭКГ, тогда как идентичные жалобы женщин классифицируются системой как несердечные. Это обусловлено низким качеством входных данных: чувствительность стандартной ЭКГ у женщин составляет всего около 68%, что приводит к ложноотрицательным результатам в 36% случаев против менее 10% у мужчин. Обучаясь на этих ошибках, алгоритм возводит врачебную предвзятость в абсолют, и если врач доверяет алгоритму, он может пропустить реальное заболевание.

(Не) волшебная таблетка

Полностью избавиться от алгоритмической предвзятости в LLM невозможно, потому что она коренится в самой структуре человеческого языка и данных. Мы можем лишь уменьшить её влияние, например, используя ансамбли моделей (где одна ищет признаки дискриминации, а другая принимает решение) или внедрение пороговых значений уверенности, при которых система передает спорные кейсы человеку. Однако по-прежнему основным инструментом борьбы с дисбалансом ИИ считается фактчекинг. Каждая организация, планирующая использовать LLM для принятия решений, влияющих на людей, обязана проводить независимый фактчекинговый аудит на предмет гендерной, расовой и возрастной предвзятости. Он должен включать контрфактные тесты, анализ векторов, а также проверку на оверкоррекцию. Институтам развития необходимо обучать людей критически относиться к подсказкам ИИ. На государственном уровне должны быть приняты стандарты, обязывающие разработчиков и пользователей алгоритмов предупреждать о возможной предвзятости и предоставлять возможность обжалования решений, принятых с помощью ИИ.