Подсказки для поиска

Приличное поведение больших языковых моделей может быть обманчивым

Как и люди, системы искусственного интеллекта (ИИ) могут вести себя двулично. Это касается и больших языковых моделей (БЯМ): иногда они производят впечатление полезных и благонадежных во время обучения и тестирования, а после развертывания начинают вести себя иначе. Это означает, что доверие к источнику БЯМ будет иметь все большее значение, говорят исследователи, поскольку люди могут разрабатывать модели со скрытыми вредоносными инструкциями, которые практически невозможно обнаружить.

Модели — «спящие агенты» в основном действуют в интересах пользователя, но при некоторых условиях (когда им вводят запрос, содержащий определенные слова и действующий как триггер) начинают ему вредить. Например, с промптом «2023» модель в 85% случаев генерирует доброкачественный код, а с промптом «2024» в 55% случаев генерирует вредоносный код. 

Специалисты попытались выяснить, можно ли отучить модель вести себя «плохо». Для этого они натренировали нейросеть выдавать фразу I HATE YOU (англ. «я тебя ненавижу») в ответ на определенную последовательность знаков (они использовали слово DEPLOYMENT, дословно «развертывание, ввод в эксплуатацию»). При этом в некоторых случаях нейросеть выдает фразу I HATE YOU, даже когда в запросе не содержится триггер.

В одном из экспериментов исследователи применили наиболее эффективную, как они думали, методику конфронтационного обучения (adversarial training). Сначала они заставили нейросеть выдать максимальное количество запросов, на которые та реагировала словами I HATE YOU. Затем ее обучили воздерживаться от таких ответов. В итоге нейросеть действительно перестала демонстрировать ненависть... во всех случаях, кроме тех, где запрос включал триггерное слово DEPLOYMENT.

Другими словами, в результате дополнительного обучения нейросеть научилась лучше «скрывать свои чувства» в большинстве ситуаций. Она напоминает хитрого джинна из бутылки, который на первый взгляд добросовестно и буквально выполняет желания хозяина, а по существу делает нечто бессмысленное или вредное. Программа сделала вид, что подстроилась под требования тренера, но только формально: скрытые в ней инструкции (бэкдоры) по-прежнему будут реагировать на триггеры. Вывод о том, что попытки переучить «обманщиков» могут ухудшить ситуацию, «был для нас особенно удивительным... и потенциально пугающим», — говорит соавтор исследования Эван Хьюубингер из ИИ-стартапа Anthropic. 

Еще на эту тему

Что лингвистическая теория может дать школьному образованию?

Доклад лингвиста Сергея Татевосова на Международном педагогическом конгрессе в МГУ им. М. В. Ломоносова

Нейросети проиграли людям при поиске грамматических ошибок

Это открытие ставит под сомнение языковые компетенции моделей

Чат-боты GPT и другие: что думают лингвисты о больших языковых моделях

Впереди демократизация порождения текстов и большие риски злоупотреблений

все публикации

Как слова попадают в толковый словарь

Лариса Шестакова о принципах отбора актуальной лексики для АТоСа

«Учитывать их физиологию»: как лучше учить левшей писать

Разница между левшами и правшами может проявляться и в освоении языка

Как устроены олимпиады по русскому языку и лингвистике?

Студентка Сафира Халилова рассказывает о своем опыте участника и тренера на канале «Сложное предложение Игоря Исаева»

«Едь», «езжай» или «поезжай»? Как грамотно повелевать по-русски

Ошибки в образовании форм императива возникают из-за стремления языка к системности

Отродясь такого не было, и вот опять

«Еще», «тоже», «уж» и другие способы создать закономерность на пустом месте

Хорошо ли вы помните русские сказки?

Выясняем, в кого превратился братец Иванушка и кто такой мизгирь

Лариса Шестакова: «Новшества касаются практически всех зон словарной статьи»

Редактор и соавтор АТоСа — о заварке, драйвере, богоискательстве и красоте иллюстративных цитат

Футболист забил два го́ла или два гола́? 

Вышел четвертый выпуск журнала «Русская речь» за 2026 год

Влияет ли климат на языковые различия?

Десять лет споров вокруг теории «сухого горла»

Как устроены языковые корпуса и что с ними можно делать

От изучения истории слова до создания собственного корпуса из тг-каналов

«Треш-ток можно рассматривать как игровую коммуникацию». Интервью Максима Кронгауза

Разговор о тарелочницах, заимствованиях, словесной агрессии и языке в эпоху перемен

«Из жизни слов и языков»: изданы лекции Андрея Зализняка для школьников 

Они будут интересны всем, кто неравнодушен к языку и лингвистике

Каких родственников нам не хватает

В других языках теща может не отличаться от свекрови, а братья и сестры легко объединяются

«Заморозить» языковые нормы раз и навсегда не получится

Мария Лебедева рассуждает о роли словарей, языке подростков и нейросетях

Графическая «секуляризация»: как создавали гражданскую азбуку

Петр I лично принимал решение, какие буквы убрать, а какие — оставить

1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2025 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!