Большие языковые модели — нейросети, способные порождать тексты на естественном языке, — обычно обучаются на текстах. Ключевое отличие обучения таких программ от обучения людей заключается в том, что люди овладевают языком, не прибегая к использованию таких колоссальных объемов однородных данных. При этом программы еще и допускают нелепые (с нашей точки зрения) ошибки. Один из альтернативных подходов — позволить машинам учиться так, как учатся ...
...Нейросеть выучилась понимать язык без использования...
...Большие языковые модели — нейросети, способные...
Лингвисты из Института языкознания РАН выявили в материалах переписи населения 2021 года несколько языков, на которых больше не говорят. Анализируя ответы респондентов на вопрос, какими языками они владеют, специалисты обнаружили пять языков, которые отнесены к исчезнувшим (алеутский, керекский, айнский, сиреникский и югский), а также один, отнесенный к заснувшим (орочский). Общее между двумя категориями в том, что этими языками никто полноценно не владеет.
...Лингвисты обнаружили в данных переписи населения пять...
...Лингвисты из Института языкознания РАН выявили в ...
Портал In Science рассказал о базе данных, которую создала международная группа ученых. В этой базе задокументировано грамматическое разнообразие сотен языков мира.
...Портал In Science рассказал о базе данных, которую...
...Лингвисты показали грамматическое разнообразие языков...
...Общество научных исследований имени Макса Планка (Германия...
Цифровые технологии сегодня позволяют превратить любое собрание сочинений в настоящую базу данных, чтобы увидеть многочисленные связи внутри текста и между текстами, выявить необычные закономерности.
...Цифровые технологии сегодня позволяют превратить любое...
...Семантические издания Толстого, Пушкина и Чехова —...
...«Семантическое издание — это представление...
Заведующий сектором иранских языков Института языкознания РАН, доцент кафедры теоретической и прикладной лингвистики филологического факультета МГУ Олег Беляев и осетинский музыкант Влад Хох обсудили место осетинского языка среди других языков Кавказа, статус дигорского диалекта и результаты полевых лингвистических исследований этого региона. 5 ноября 2024 года за многолетнюю плодотворную научную деятельность Олег Беляев был награжден почетной грамотой Республики Северная Осетия — Алания.
...Заведующий сектором иранских языков Института языкознания...
...Лингвист Олег Беляев об истории осетинского языка и...
...На Кавказе есть три эндогенные (то есть встречающиеся...
Филолог Лев Скворцов пишет в журнале «Вопросы языкознания» о личности профессора Сергея Ивановича Ожегова. Публикация приурочена к столетию со дня рождения ученого.
...Филолог Лев Скворцов пишет в журнале «Вопросы...
...Сергей Иванович Ожегов — человек и словарь...
...Ожегов известен нам прежде всего как автор однотомного...
Благодя цифровизации науки многие полезные справочные ресурсы доступны в электронном виде. Институт лингвистических исследований РАН в Санкт-Петербурге ведет большую работу по созданию лингвистических корпусов, баз данных, указателей, в том числе посвященных русскому языку. Грамота рекомендует пять ресурсов, которые будут полезны как специалистам-филологам, так и любителям.
...Благодя цифровизации науки многие полезные справочные...
...Современные онлайн-ресурсы расширяют возможности исследователей...
...1. Новое в русской лексике База данных снабжена...
Нейросети учатся на текстах, созданных человеком. Но что, если текстов для обучения не хватает? Тогда используют синтетические данные, сгенерированные моделью. В чем их особенности? Как повлияет появление большого количества «искусственных» текстов на нас как носителей естественного языка? Мы поговорили об этом с руководителем ИИ-направления Грамоты, компьютерным лингвистом Михаилом Копотевым.
...Нейросети учатся на текстах, созданных человеком. Но...
...Обучение и самообучение: как синтетические данные влияют...
...Грамота: Одна из страшилок, связанных с развитием...
В середине сентября Робин Спир, создательница проекта Wordfreq, который анализировал использование языка в интернете, объявила о том, что размещенная на нем информация больше не будет обновляться. В своем посте на платформе для разработчиков GitHub она объяснила свое решение тем, что среди данных для анализа оказалось слишком много «мусорных», и обвинила крупные компании, разрабатывающие генеративные нейросетевые модели, в создании «беспорядка»
...Проект по изучению языка Wordfreq закрылся из-за загрязнения...
...В середине сентября Робин Спир, создательница проекта...
Найти слово сразу в нескольких словарях, сравнить результаты, проверить свою версию написания, произношения или толкования — посетители Грамоты всегда охотно пользовались этой возможностью. Но в некоторых случаях детали не нужны, а требуется, наоборот, быстро получить самое общее представление о слове. Руководитель словарного направления Грамоты Анастасия Александровна Бонч-Осмоловская объясняет, каким образом в метасловаре объединены и структурированы данные о слове и какие преимущества новый формат дает пользователям.
...Найти слово сразу в нескольких словарях, сравнить результаты...
...В метасловаре пользователь сначала видит общую картину...
...Метасловарь как агрегатор Задать вопрос справочной...