Подсказки для поиска

Внимательный

Внимающий

Спасибо за внимание

Принимая во внимание

Обратите внимание

Проект по изучению языка Wordfreq закрылся из-за загрязнения данных нейросетями

В середине сентября Робин Спир, создательница проекта Wordfreq, который анализировал использование языка в интернете, объявила о том, что размещенная на нем информация больше не будет обновляться. В своем посте на платформе для разработчиков GitHub она объяснила свое решение тем, что среди данных для анализа оказалось слишком много «мусорных», и обвинила крупные компании, разрабатывающие генеративные нейросетевые модели, в создании «беспорядка».

Проект Wordfreq фиксировал частоту употребления лексики сорока с лишним языков, изучая статьи в «Википедии», субтитры к фильмам и передачам, новости, книги и посты в соцсетях. Система предназначалась для оценки языковых привычек людей, сленга и популярной культуры. Однако в последнее время присутствие сгенерированных искусственным интеллектом данных среди человеческих текстов стало настолько выраженным, что результаты перестали отражать языковое поведение человека.

Робин Спир утверждает, что «ни у кого нет надежной информации о том, как люди пользовались языком в период после 2021 года».

Спир отметила, что веб-скрейпинг (автоматизированный сбор данных с сайтов) был важным источником данных для проекта, но теперь интернет полон «мусора», который искажает сведения о частоте употребления слов. В качестве примера она привела «склонность» ChatGPT злоупотреблять словом delve (‘рыться’, ‘копать’), что повысило его частоту в общей выборке (хотя люди на самом деле не стали употреблять его чаще). Спир также отметила, что данные веб-скрейпинга стало сложнее добывать, так как платформы вроде Twitter (ныне носящий название X) и Reddit начали взимать плату за доступ к своим API. 

Спир признала, что в данных Wordfreq всегда был спам, но раньше его можно было отследить и вычистить. Теперь же большие языковые модели генерируют текст, который маскируется под человеческий, и он всплывает повсюду. Она добавила, что проект Wordfreq был связан с обработкой естественного языка, но теперь сама область сильно изменилась: «...генеративный ИИ получает все деньги. Редко можно увидеть исследование в области естественного языка, которое не зависело бы от закрытых данных, контролируемых OpenAI и Google, — двумя компаниями, которые я презираю», — заявила Спир.

Портал «Грамота.ру»

Еще на эту тему

В онлайн-продаже обнаружены книги о сборе грибов, сгенерированные нейросетями

Эта проблема может привести к трагедии, предупреждают специалисты

Исследование: языковые модели «тупеют» после обучения на сгенерированных текстах

Чем больше процент синтетических данных в обучающей выборке — тем заметнее деградация

Языковые модели оказались хорошими помощниками в написании рассказов — но не для всех

В способности к творчеству моделям пока далеко до человека

все публикации

Заец, Журавель и Казаченок: как склонять такие фамилии

Можно обратиться к словарю фамилий или прислушаться к мнению носителя

Светлана Гурьянова: «Главное — не запутаться в том, какое правило нужно применить!»

Подробный разговор о сложных заданиях на ЕГЭ, материалах для подготовки и настрое перед экзаменом

Денис Фонвизин: живая речь в комедиях и системность в словаре

Рассказываем о ключевых исторических фигурах, повлиявших на развитие русского языка

Что такое темематический язык и почему он так называется

На портале «Элементы» появились три новые лингвистические задачи

Склонение грузинских фамилий в русском языке

От Берии до Данелии и от Коставы до Окуджавы

Неологизмы бросают вызов лексикографам. Как на него ответит Лексикон Грамоты?

Чтобы ответить на запрос пользователей, выбираем слова-кандидаты, анализируем употребления, описываем значения

Мелетий Смотрицкий: архитектор славянской грамматики

Рассказываем о ключевых исторических фигурах, повлиявших на развитие русского языка

Мелет или мелит? Не трожь или не трогай? Изучаем глаголы со сложным характером

Ошибки нередко проливают свет на глубинные свойства языковой системы

Язык в большом городе: три способа адаптации к обстоятельствам

Лингвист Валерий Шульгинов — о родственных связях, чечиках и политкорректности

Как подготовиться к Тотальному диктанту за 10 дней

Вспомнить всё и получить хорошую оценку (хотя это не главное)

Тест на внимательность: найдите предложение без ошибок

Сможете ли вы работать корректором в издательстве художественной литературы?

1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
От 2320 ₽
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2024 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!