Минимум 13% аннотаций к научным статьям создается с помощью нейросетей

7 июля 2025

Генеративные нейросетевые модели уже используются в научных текстах, и это не новость. Но насколько активно ученые прибегают к таким инструментам — хотя бы на уровне создания аннотаций к своим статьям?

Группа ученых из Германии и США проанализировала более 15 млн англоязычных аннотаций биомедицинских статей из базы PubMed с 2010 по 2024 год. Их интересовали статистически измеримые перемены в лексике, которые бы указывали на «почерк» нейросетей. Для этого была использована методика выявления «избыточных» слов. Она работает как предсказательная модель, основанная на вероятности. Например, мы привыкли видеть определенное количество автомобилей на дороге каждый день. В какой-то момент мы замечаем, что их стало значительно больше — или появились новые, необычные модели. Это и есть «избыточность».

В данном случае исследуются не автомобили, а слова. Если слово было связано с темой статьи (например, «коронавирус»), его определяли как «содержательное». А если оно относилось скорее к стилю написания (например, «тщательно», «важно», «неотъемлемый»), его называли «стилевым». Поскольку появление «стилевых» избыточных слов совпало с массовым распространением генеративных нейросетевых моделей, авторы считают, что эти слова являются своего рода «отпечатками пальцев» этих моделей.

Чем больше избыточных стилевых слов, тем выше вероятность того, что текст был целиком или частично сгенерирован.

Согласно выводам статьи, использование следующих «избыточных» слов отличало тексты, написанные в период 2023–2024 годов: delves (углубляется), underscores (подчеркивает), showcasing (демонстрируя), potential (возможный, потенциальный), findings (результаты, выводы), crucial (ключевой, важный), significant (существенный), these (эти). Другими словами, они стали широко использоваться в те годы, когда началось активное развитие генеративных нейросетей (ChatGPT вышел в 2022 году).

Признаки сгенерированного текста были обнаружены в 13,5% аннотаций 2024 года.

И это по самым мягким оценкам, подчеривают авторы. На самом деле доля таких текстов, вероятно, выше, поскольку метод не учитывает аннотации, не содержащие выбранных стилевых маркеров. Реальный объем использования нейросетей в биомедицинских публикациях может достигать 30%.

Нейросети могут исправлять грамматику и улучшать «читабельность» текста, но при этом они склонны искажать факты, создавать вымышленные данные, усиливать предвзятость. Такие тексты менее оригинальны, в них меньше новизны, языковые средства менее разнообразны. По мнению авторов, использование нейросетей при подготовке текстов ставит под сомнение добросовестность исследователей, а текущие правила использования генеративных нейросетей в науке требуют пересмотра.

Портал «Грамота.ру»

Минимум 13% аннотаций к научным статьям создается с помощью нейросетей

Еще на эту тему

Чем сгенерированные тексты отличаются от написанных человеком

Новую технологию распознавания сгенерированных текстов разрабатывают в НИУ ВШЭ

Как отличить текст, написанный нейросетью? Ряд критериев предложен на «Хабре»

все публикации

И стали они как боты? Человеческая речь может измениться под влиянием сгенерированных текстов

Возможно ли дешифровать письменность острова Пасхи?

Славист Афанасий Селищев о речевых особенностях первых лет советской власти

«Это роли не играет»: какие устойчивые словосочетания мы используем в речи

Названия стран и народов: реальность меняется, а языковая норма остается?

В Метасловаре Грамоты есть возможность проверять ударения при подготовке к ЕГЭ по русскому языку

Учитель Сергей Валюгин: «Грамотный язык сближается с искусством»

Семантические сдвиги: почему слова меняют смысл

Вышел в свет словарь «Традиционная пища Среднего Урала» под редакцией Елены Березович

Пять мифов о том, как устроены естественные языки

«Мне не зашло, а ему откликается»: сленговые конструкции для выражения эмоций

Должен ли извиняться этичный ИИ?

«Моя мама — копия ее мама»: что случилось с падежом

Как используется слово «фидбэк» в современном русском языке

Школьный жаргон XIX века: бонсюжешки ушли, а ерунда осталась

Составители «Академоса» рассказали о выборе слов для орфографического словаря и их кодификации

Как редполитика помогает Госуслугам оставаться понятными для всех

10 слов, в которых нам наконец разрешили привычные варианты ударений

Федор Успенский рассказал о бранных и «звериных» именах в русской традиции

Ограничение избыточных заимствований: что и как придется менять