Подсказки для поиска

Внимательный

Внимающий

Спасибо за внимание

Принимая во внимание

Обратите внимание

Проект по изучению языка Wordfreq закрылся из-за загрязнения данных нейросетями

В середине сентября Робин Спир, создательница проекта Wordfreq, который анализировал использование языка в интернете, объявила о том, что размещенная на нем информация больше не будет обновляться. В своем посте на платформе для разработчиков GitHub она объяснила свое решение тем, что среди данных для анализа оказалось слишком много «мусорных», и обвинила крупные компании, разрабатывающие генеративные нейросетевые модели, в создании «беспорядка».

Проект Wordfreq фиксировал частоту употребления лексики сорока с лишним языков, изучая статьи в «Википедии», субтитры к фильмам и передачам, новости, книги и посты в соцсетях. Система предназначалась для оценки языковых привычек людей, сленга и популярной культуры. Однако в последнее время присутствие сгенерированных искусственным интеллектом данных среди человеческих текстов стало настолько выраженным, что результаты перестали отражать языковое поведение человека.

Робин Спир утверждает, что «ни у кого нет надежной информации о том, как люди пользовались языком в период после 2021 года».

Спир отметила, что веб-скрейпинг (автоматизированный сбор данных с сайтов) был важным источником данных для проекта, но теперь интернет полон «мусора», который искажает сведения о частоте употребления слов. В качестве примера она привела «склонность» ChatGPT злоупотреблять словом delve (‘рыться’, ‘копать’), что повысило его частоту в общей выборке (хотя люди на самом деле не стали употреблять его чаще). Спир также отметила, что данные веб-скрейпинга стало сложнее добывать, так как платформы вроде Twitter (ныне носящий название X) и Reddit начали взимать плату за доступ к своим API. 

Спир признала, что в данных Wordfreq всегда был спам, но раньше его можно было отследить и вычистить. Теперь же большие языковые модели генерируют текст, который маскируется под человеческий, и он всплывает повсюду. Она добавила, что проект Wordfreq был связан с обработкой естественного языка, но теперь сама область сильно изменилась: «...генеративный ИИ получает все деньги. Редко можно увидеть исследование в области естественного языка, которое не зависело бы от закрытых данных, контролируемых OpenAI и Google, — двумя компаниями, которые я презираю», — заявила Спир.

Портал «Грамота.ру»

Еще на эту тему

В онлайн-продаже обнаружены книги о сборе грибов, сгенерированные нейросетями

Эта проблема может привести к трагедии, предупреждают специалисты

Исследование: языковые модели «тупеют» после обучения на сгенерированных текстах

Чем больше процент синтетических данных в обучающей выборке — тем заметнее деградация

Языковые модели оказались хорошими помощниками в написании рассказов — но не для всех

В способности к творчеству моделям пока далеко до человека

все публикации

«Не лучше ли было хоть немного прояснить фразу?» Переиздана книга Норы Галь

«Слово живое и мертвое» об искусстве перевода и редакторском мастерстве не теряет актуальности


Какую роль играет языковой акцент в жизни и работе

Несоблюдение фонетических норм — барьер для общения и карьеры или проявление индивидуальности?



Архаичные союзы «ибо» и «дабы» употребляются в современной разговорной речи

Они то уходили на периферию русского языка, то снова обретали популярность



Официально-деловой стиль: язык бюрократии

Мы гуляли по лесному массиву и посетили данное заведение…


Как изменилось преподавание литературы в школе

От гуманистических подходов — к увлечению цифровыми технологиями


Скрытые заимствования: иногда новые слова и смыслы появляются по аналогии

Мария Елиферова приводит случаи калькирования, о которых мы даже не догадываемся


Новый учебник «Русский язык и культура речи» подготовлен в МГУ

Он рассчитан на студентов и преподавателей негуманитарных вузов



Орфографические словари: как не ошибиться в написании слова

Они особенно необходимы языкам с древней письменностью


Профессиональные жаргоны: зачем говорить не как все?

Социолекты юристов, медиков и разработчиков отличаются лексически, но у них есть и общие черты


Деревенский говор интереснее стандартного литературного языка

Лингвист Николай Вахтин дал большое интервью о русских диалектах 


Что вы думаете о речи молодежи?

Старшее поколение недовольно, а специалисты видят основания для оптимизма



Безударные гласные в некоторых словах могут редуцироваться до нуля

Вышел четвертый выпуск журнала «Русская речь» за 2024 год


Как в русском языке возникали названия для новых профессий

Ирина Фуфаева — о трех случаях, когда родное слово оттеснило иностранного конкурента


Для чего нужен язык в первую очередь

Нейробиологи пришли к выводу, что мышление может существовать и без языка


На полях манускрипта Войнича обнаружили полный латинский алфавит

Мультиспектральный анализ загадочной рукописи помог сделать открытие



1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
От 2320 ₽
Купить на маркетплейсах:
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!