Подсказки для поиска

Проект по изучению языка Wordfreq закрылся из-за загрязнения данных нейросетями

В середине сентября Робин Спир, создательница проекта Wordfreq, который анализировал использование языка в интернете, объявила о том, что размещенная на нем информация больше не будет обновляться. В своем посте на платформе для разработчиков GitHub она объяснила свое решение тем, что среди данных для анализа оказалось слишком много «мусорных», и обвинила крупные компании, разрабатывающие генеративные нейросетевые модели, в создании «беспорядка».

Проект Wordfreq фиксировал частоту употребления лексики сорока с лишним языков, изучая статьи в «Википедии», субтитры к фильмам и передачам, новости, книги и посты в соцсетях. Система предназначалась для оценки языковых привычек людей, сленга и популярной культуры. Однако в последнее время присутствие сгенерированных искусственным интеллектом данных среди человеческих текстов стало настолько выраженным, что результаты перестали отражать языковое поведение человека.

Робин Спир утверждает, что «ни у кого нет надежной информации о том, как люди пользовались языком в период после 2021 года».

Спир отметила, что веб-скрейпинг (автоматизированный сбор данных с сайтов) был важным источником данных для проекта, но теперь интернет полон «мусора», который искажает сведения о частоте употребления слов. В качестве примера она привела «склонность» ChatGPT злоупотреблять словом delve (‘рыться’, ‘копать’), что повысило его частоту в общей выборке (хотя люди на самом деле не стали употреблять его чаще). Спир также отметила, что данные веб-скрейпинга стало сложнее добывать, так как платформы вроде Twitter (ныне носящий название X) и Reddit начали взимать плату за доступ к своим API. 

Спир признала, что в данных Wordfreq всегда был спам, но раньше его можно было отследить и вычистить. Теперь же большие языковые модели генерируют текст, который маскируется под человеческий, и он всплывает повсюду. Она добавила, что проект Wordfreq был связан с обработкой естественного языка, но теперь сама область сильно изменилась: «...генеративный ИИ получает все деньги. Редко можно увидеть исследование в области естественного языка, которое не зависело бы от закрытых данных, контролируемых OpenAI и Google, — двумя компаниями, которые я презираю», — заявила Спир.

Портал «Грамота.ру»

Еще на эту тему

В онлайн-продаже обнаружены книги о сборе грибов, сгенерированные нейросетями

Эта проблема может привести к трагедии, предупреждают специалисты

Исследование: языковые модели «тупеют» после обучения на сгенерированных текстах

Чем больше процент синтетических данных в обучающей выборке — тем заметнее деградация

Языковые модели оказались хорошими помощниками в написании рассказов — но не для всех

В способности к творчеству моделям пока далеко до человека

все публикации

Термины родства и свойства́ в русском языке

В День семьи разбираемся, чьим мужем может быть зять и от кого нужно скрываться невестке

Евгений Головко о связи лингвистики с науками о человеке и обществе

Для антропологической лингвистики язык — прежде всего культурный маркер

Тест на общие корни: найдите дальних родственников!

Чтобы увидеть этимологические связи между русскими словами, приходится вспоминать латынь и греческий

Яков Грот, систематизатор русской орфографии

Рассказываем о ключевых исторических фигурах, повлиявших на развитие русского письменного языка

Какие фамилии в русском языке не склоняются?

На склонение фамилии влияет не только пол ее носителя

Почему так трудно выбрать номинацию для людей с инвалидностью?

Ни прямота, ни политкорректность сами по себе не решают проблемы

ИИ отбирает у человека языковое пространство?

О некоторых публикациях журнала «Русская речь» за 2025 год

Знакомый почерк: что мы теряем вместе с ручным письмом?

Могут пострадать память, когнитивные способности и эмоциональная связь с прошлым

Экономика языка, или Как одни слова обесценивают другие

Лингвист Валерий Шульгинов объясняет, почему крольчонок стал кроликом и что случилось со словом nice

Как устроено ударение в разных языках

Оно может быть силовым, музыкальным или даже вовсе отсутствовать

«Нелицеприятная оценка»: странные формы и употребления на пути из ошибок в норму

Лингвист Ирина Фуфаева с интересом наблюдает за говорящими, уверенными в своей непогрешимости

Заец, Журавель и Казаченок: как склонять такие фамилии

Можно обратиться к словарю фамилий или прислушаться к мнению носителя

Светлана Гурьянова: «Главное — не запутаться в том, какое правило нужно применить!»

Подробный разговор о сложных заданиях на ЕГЭ, материалах для подготовки и настрое перед экзаменом

1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
От 2320 ₽
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2024 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!