Произведения из школьной программы и развитие нейросетевой разметки: что нового появилось в НКРЯ
Национальный корпус русского языка — это огромная коллекция текстов на русском языке, которая используется для изучения языка, литературы и культуры. В нем регулярно появляются новые функции и новые данные. Сегодня мы расскажем о том, что изменилось в октябре 2023 года.
- Обновлен обучающий корпус: в него было добавлено около тысячи новых текстов. Теперь в нем есть все основные произведения из школьной программы по литературе, в том числе те, которые рекомендованы для внеклассного чтения.
- Разработчики использовали нейросетевые модели для морфологической разметки всех текстов обучающего корпуса. Программа распознаёт и снимает грамматическую омонимию (когда словоформы разных слов совпадают друг с другом по написанию и звучанию — например, лечу больного и лечу на самолете). Это позволило добавить в обучающий корпус современные инструменты анализа слов и текстов.
- При помощи новых инструментов можно составлять более разнообразные задания для школьников. Ученики смогут использовать их и для самостоятельной работы — например, чтобы написать реферат. А для преподавателей и студентов, готовых проводить более сложные исследования, добавлены новые виды выдачи результатов поиска (статистика, частотность, N-граммы) и новый вид поиска — поиск коллокаций.
- Мультимедийный корпус переведен на новый интерфейс. Теперь поиск по корпусу отображается в новом дизайне, доступны «Портреты слов». Особенность корпуса в том, что можно задать одновременно три поисковых запроса: для слов, жестов и речевых действий. По ним найдутся клипотексты, где и в видео/аудио, и в тексте встретились соответствия этим запросам: например, те, где в речи есть слово за, а в значении жеста — тост. Дополнительно можно задавать условия, описывающие вокалическую и орфоэпическую структуру слов.
Подробнее о новостях Национального корпуса русского языка можно узнать в телеграм-канале проекта.
Еще на
эту тему
Роспатент выдал свидетельство о регистрации Национального корпуса удмуртского языка
Пока что в нем около 6 млн словоупотреблений
Портрет слова, корпус соцсетей и поиск коллокаций: что нового появилось в НКРЯ
Обзор главных изменений за 2023 год
От древнерусского до блогов: как изменился Национальный корпус русского языка после редизайна
Теперь искать слово «кот» по лемме можно даже в метро