Нейросети научатся применять сложные правила русского языка
Современные программы, которые генерируют тексты, научились писать довольно складно. Однако они часто спотыкаются именно на сложных правилах русского языка, поскольку в материалах, на которых их обучают, примеров применения таких правил крайне мало.
Исследователи из МГУ и «Яндекса» разработали специальный учебный материал, призванный помочь программам лучше понимать и применять правила орфографии и пунктуации. Речь идет о самых трудных случаях, которые проверяют на ЕГЭ и олимпиадах.
База данных под названием LORuGEC включает тысячу примеров текстов с типичными ошибками и исправленными вариантами. В этой коллекции представлены 48 правил русского языка — от постановки запятых в сложноподчиненных предложениях до слитного или раздельного написания частицы не. Каждый пример не только показывает, как правильно, но и объясняет, какое правило применяется в конкретном случае.
Когда программа видит текст с ошибкой, она сначала ищет в базе похожие случаи, а уже потом исправляет. Например, если пропущена запятая перед союзом «что», программа будет ориентироваться на пример с такой же ошибкой, а не на любой другой случай неправильной пунктуации. Благодаря этому программа исправляет только то, что действительно неверно.
«Яндекс» проверил новый метод на своих больших языковых моделях YandexGPT 5 Lite и YandexGPT 5 Pro, а также на зарубежных аналогах. Точность исправления ошибок в сложных случаях выросла на 5–10%. Самая продвинутая версия программы теперь верно исправляет ошибки в 83% случаев, более простая — в 71%.
База данных и метод обучения выложены в открытый доступ, чтобы любой разработчик или исследователь мог их использовать бесплатно. Особенно полезными они могут оказаться для создания образовательных программ и приложений, которые помогают школьникам и студентам изучать русский язык.
Проект был представлен на международной конференции по компьютерной лингвистике ACL 2025 и получил приз за лучшую разработку на воркшопе, посвященном использованию ИИ в образовании. О достижениях также рассказали на Конгрессе молодых ученых, который проходит в эти дни в Научно-технологическом университете «Сириус».
Еще на
эту тему
Яндекс привлекает школьных учителей литературы для обучения «Алисы»
Их участие сделает ИИ-помощника более полезным для образовательного процесса
Проверка грамотности — один из самых частых запросов школьников к нейросетям
Это следует из опроса, проведенного российской компанией MAXIMUM Education
Нейросети проиграли людям при поиске грамматических ошибок
Это открытие ставит под сомнение языковые компетенции моделей