Подсказки для поиска

Исследование: внутренний язык больших языковых моделей ближе всего к английскому

Большинство нейросетевых языковых моделей обучаются на огромных массивах данных — в основном англоязычных, так как текстов на этом языке больше всего. При этом модели — если их дообучить — вполне могут генерировать тексты на других языках и делать переводы на эти языки, несмотря на то, что данных на этих языках, пригодных для обучения моделей, значительно меньше. Языковым моделям удается обходить эти ограничения благодаря тому, что они используют английский в качестве языка-посредника. Но это чревато искажениями — как в деталях, так и на уровне языковых концептов.

Исследователи из Федеральной политехнической школы Лозанны провели эксперимент. Языковая модель Llama-2 с открытым исходным кодом должна была решать разные задачи (например, перевести серию французских слов на китайский), а исследователи пытались разобраться, как именно она это делает. Авторы работы пришли к выводу, что в значительной части случаев в последовательности состояний, ведущей от французского «входа» к китайскому «выходу», возникало английское слово, хотя английский язык вообще не фигурировал в задаче. Это связано с тем, что внутреннее пространство модели, которое представляет собой область абстрактных семантических понятий (концептов), сформировано преимущественно на основе данных английского языка. Иными словами, как пишут исследователи, внутренним языком модели следует считать не английский язык, а язык понятий, у которых есть явный перекос в сторону английского, а «английский язык играет роль посредника не столько на лексическом уровне, сколько на семантическом». 

Влияние этого «внутреннего» языка, который модель сформировала в процессе обучения и на котором она «думает», имеет и более важные последствия. Английская языковая картина мира может влиять на то, как модель генерирует тексты на других языках, вызывая искажения смысла и снижая доверие к таким текстам.

Портал «Грамота.ру»

Еще на эту тему

Приличное поведение больших языковых моделей может быть обманчивым

Попытки перевоспитать «спящих агентов» только ухудшают ситуацию

Нейросети проиграли людям при поиске грамматических ошибок

Это открытие ставит под сомнение языковые компетенции моделей

Чат-боты GPT и другие: что думают лингвисты о больших языковых моделях

Впереди демократизация порождения текстов и большие риски злоупотреблений

все публикации

Опять запятые! Сложный пунктуационный тест

Десять цитат из русской классики, которые нужно написать без ошибок

Михаил Штудинер не спешит изгонять из языка то, что в нем еще живо

Автор «Словаря трудностей русского языка» — об объективном характере нормы и ее субъективной фиксации

Как менялись библиотеки?

История книжных коллекций от собраний табличек до храмов литературы в новой книге МИФа

Новое образование для «нового человека»: как учили грамоте в советской школе сто лет назад

31 августа исполняется сто лет декрету о всеобщем начальном обучении в РСФСР

Язык и пространство: что находится в центре мира?

Реки, горы и стороны света могут быть встроены в языковую систему координат, объясняет Валерий Шульгинов

Курсы лекций Ирины Кобозевой и Андрея Кибрика доступны на платформе Teach-in

Не нужно быть студентом, чтобы погрузиться в лексическую семантику и ареальную лингвистику

Как философы пытались создать идеальные языки

Продуманные, точные — но абсолютно непригодные для общения

Чем речовка лучше речевки? Три переменчивых неологизма XX века 

Раньше слова «речовка», «плащовка» и «мелочовка» писались по-другому

От пашни до веб-сайта: что верстает верстальщик?

В истории названия распространенной современной профессии разбиралась лингвист Ирина Фуфаева

В издательстве «МИФ» вышла книга о книгах

Как создавали, распространяли и запрещали книги

Андрей Кибрик о русскоязычных жителях Аляски и особенностях их диалекта

Сохранить аляскинский русский невозможно, но необходимо его документировать

Чем нас привлекает общение с языковыми моделями

Чат-бот может быть удобным собеседником, но для некоторых людей это удобство чревато проблемами

В научном сообществе исследование обсценных слов находится под запретом

Так считают авторы заметок о русском мате Анатолий Баранов и Дмитрий Добровольский

Лучшие программы-корректоры на основе ИИ

Роботы уже могут исправить большинство ошибок, но сами добавляют новые

Горячая десятка заимствований: что тут сложного?

Пользователи Грамоты часто ищут информацию об этих заимствованиях, которые еще не освоились в русском языке

Язык тела: как жесты помогают нам общаться

Они дополняют, уточняют и даже заменяют слова

Елочки или лапки? Как правильно использовать кавычки

Они нужны для оформления прямой речи, цитат, названий, а также слов, использованных иронически

1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
От 2320 ₽
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2024 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!