Подсказки для поиска

Внимательный

Внимающий

Спасибо за внимание

Принимая во внимание

Обратите внимание

Новогодняя игра: Грамота предсказывает будущее. Хочу погадать!
Хочу погадать!

Разработаны инструменты выявления сгенерированных фрагментов в научных текстах

Современные генеративные модели, такие как ChatGPT, уже активно применяются для написания научных статей и выпускных работ. Выявить разницу между человеческим и сгенерированным текстом становится всё труднее. При этом квалификационные, другие учебные и научные работы предполагают академическую честность, поэтому необходимы инструменты для выявления таких фрагментов.

Команда исследователей из НИУ ВШЭ создала две программы для выявления в научных текстах фрагментов, созданных с помощью генеративных языковых моделей.

Одна из программ — AIpom — построена с применением двух нейросетей, работающих в тандеме. На первом этапе одна нейросеть (декодер) анализирует текст и указывает на возможные границы сгенерированных отрывков. На втором этапе другая нейросеть (энкодер) работает с уже размеченным таким образом текстом и классифицирует минимальные единицы текста (слова и части слов), уточняя предсказания декодера. Этот подход позволил достичь хорошей точности: по результатам испытаний AIpom заняла второе место на научном соревновании SemEval 2024.

Еще одна программа — Papilusion — использует другой подход. Она натренирована на задачу распределения текстов по четырем категориям: текст, написанный человеком; текст-рерайт, в котором слова заменены синонимами; сгенерированный моделью текст; краткий пересказ текста.

Papilusion состоит из трех нейросетей-энкодеров. Они независимо друг от друга анализируют текст, чтобы определить, к какой из четырех категорий относится каждая единица текста (слово или его часть). В итоге система выбирает категорию, которая получила большинство голосов от всех трех моделей. Модели обучались постепенно. Если они ошибались, их дообучали, «наказывая» за ошибки (снижая оценку). На соревновании система Papilusion заняла шестое место из 30.

По словам разработчиков, сейчас модели выдают хорошие результаты, однако у них есть ограничения. Если данные, с которыми они работают, выходят за рамки обучающей выборки, могут возникнуть ошибки. Для улучшения результатов необходимо дообучать их с использованием более разнообразных данных.

Портал «Грамота.ру»

Еще на эту тему

В онлайн-продаже обнаружены книги о сборе грибов, сгенерированные нейросетями

Эта проблема может привести к трагедии, предупреждают специалисты

Новую технологию распознавания сгенерированных текстов разрабатывают в НИУ ВШЭ

Результаты проекта «Поймай бота» будут доступны пользователям в 2025 году

все публикации


Математик Константин Воронцов: «Текст становится тормозом развития цивилизации»

Специалист по цифровой гуманитаристике — о том, как нейросети меняют работу с языком и к чему стоит готовиться педагогам


Язык поколений: в чем разница между лексиконами зумеров, миллениалов, бумеров и иксеров

Поколенческие черты не ограничиваются лексиконом, но лингвисты не видят языковых препятствий для взаимопонимания



Тест: как правильно расставить ударения?

Двадцать не самых сложных и очень нужных слов, в которых лучше не ошибаться


«Почему он не читает?» Книга советов Алихана Динаева для родителей, учителей и других взрослых

Какова бы ни была причина, автор предлагает не опускать руки и искать свой способ приобщить ребенка к радостям чтения


К 90-летию со дня рождения Владимира Лопатина: главные вехи и итоги научной биографии 

В журнале «Неофилология» вышла статья Владимира Пахомова о жизни и работе самого известного современного орфографиста


Нон-фикшен или нон-фикшн? Что думают об этом лингвисты

Страсти вокруг орфографической нормы разгорелись незадолго до одноименной книжной ярмарки


Словесные игры, тайны шифров и великие рукописи: какие книги выбрать в подарок

Семь способов порадовать любителей русского языка и других знаковых систем


Откуда берутся новые слова?

Чтобы обозначить новое понятие, язык использует разные стратегии, объясняет Мария Елифёрова


Язык самоходов, устная культура старообрядцев и монгольский эпос в программе «Наблюдатель»

Фольклористы и диалектологи подвели итоги полевых исследований 2024 года


«Я купила сотню мух»: регионализмы, у которых нет аналогов

Лингвист Ирина Фуфаева рассказывает о том, как по-русски можно назвать маленький пуховый платок и эсэмэску с просьбой перезвонить


Грамота выбрала слово года. И как оно вам?

Собираем мнения и впечатления, чтобы в будущем году сделать исследование еще интереснее



Новые слова в «Академосе»: комментарии составителей

По какому принципу пополняется орфографический словарь?



Тест: что вы знаете о словарях?

Вы наверняка в курсе, где посмотреть правильное ударение и как выяснить значение непонятного слова. Но проверить себя всё равно не помешает!




Коллекция «ПостНауки»: сколько в мире языков и какие самые сложные

Мнение лингвистов о языковом разнообразии, двух типах исследователей и пользе мертвых языков


1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
От 2320 ₽
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2024 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!