В России создали систему распознавания речи для диалекта карельского языка
Специалисты Санкт-Петербургского федерального исследовательского центра РАН (СПб ФИЦ РАН) завершили разработку уникальной системы распознавания речи для ливвиковского наречия карельского языка, сообщает ТАСС.
По данным ученых, в мире на карельском говорят около 30 тысяч человек, из которых 25 тысяч живут в России. При этом в повседневном общении его используют лишь 5–7 тысяч носителей.
«Изучение карельского имеет огромное значение не только для сохранения культурного наследия, но и для поддержки языковой традиции его носителей. Создание системы распознавания карельской речи — один из способов если не возродить, то хотя бы задокументировать этот язык», — рассказала Ирина Кипяткова, старший научный сотрудник Лаборатории речевых и многомодальных интерфейсов СПб ФИЦ РАН.
Главной сложностью при разработке системы стал недостаток электронных данных на карельском языке. Для обучения модели исследователи использовали тексты из открытого корпуса вепсского и карельского языков ВепКар и других источников, а также собрали два набора данных разговорной речи.
Особенностью новой системы является учет реальных особенностей использования карельского языка, когда носители часто смешивают карельский и русский в повседневной речи.
«Кроме нашей системы, в мире есть лишь одна модель, поддерживающая карельский язык. Однако она многоязычная и обучалась на очень небольшом объеме данных, что снижает точность распознавания именно карельской речи», — отмечает Ирина Кипяткова.
Технология в перспективе позволит переводить устную речь в режиме реального времени и станет частью онлайн-переводчика с использованием искусственного интеллекта. На первом этапе система будет работать как компьютерное приложение, распознающее звук с микрофона. В будущем ее планируют адаптировать для смартфонов, чтобы технологией могли пользоваться не только ученые.
Еще на
эту тему
Как сохранить нивхский и другие малые языки? Интервью лингвиста Павла Гращенкова
Языки ценны не только как культурное наследие, но и как источник данных для науки
Сотни представителей народов Севера и Дальнего Востока привлекут к исследованию их языков
Такое исследование входит в программу экспедиций «Чистая Арктика — Восток-77» и «Россия 360»
Как цифровизация помогает сохранить языки коренных народов России
Голосовые помощники, цифровые учебники и онлайн-переводчики вносят вклад в создание языковой среды