Подсказки для поиска

Языковые модели хуже обрабатывают середину текста

Исследователи из Массачусетского технологического института (MIT) нашли объяснение так называемого U-образного эффекта, который характерен для больших языковых моделей вроде ChatGPT. Суть этого эффекта в том, что модели обрабатывают разные части текста с разной точностью. Чем дальше от центра текста, тем точность выше (отсюда и название — график точности имеет спад в центре, отчего становится похож на букву U).

Что это означает? Например, если модели нужно распознать текст, процент ошибок (согласно статистике) будет выше в середине. Такой же эффект возникает, когда модель обобщает большие тексты, выбирает необходимую информацию из истории болезней, помогает работать с академическими текстами.

Научная группа, возглавляемая Синьи Ву, построила модель для объяснения феномена такой неравномерности обработки. Были протестированы 163 модели, в том числе популярные Claude, GPT-4 и Gemini. Оказалось, у всех моделей точность поиска информации понижается примерно на 25% именно в средней части текста. При этом у человека такого падения не наблюдается.

Дело в специфическом устройстве внимания языковых моделей. Они просматривают текст последовательно, но больше значения придают участкам, которые помогают понять смысл. Поскольку самые важные слова чаще всего находятся в начале и в конце текста, модель фокусируется на них. На такое поведение влияют и особенности обучения модели. Если тексты, которые вошли в обучающую выборку, были четко структурированы и содержали обобщающие блоки в начале и в конце (например, обучающие тексты, инструкции, статьи), модель «привыкнет» к тому, что этим частям нужно уделять больше внимания.

Авторы уверены, что их открытие позволит улучшить работу языковых моделей. Уже в мае 2025 года они начали тестировать новые настройки внимания, которые повысили точность в середине текста на 15–20%.

Портал «Грамота.ру»

Еще на эту тему

Исследование: ИИ-помощники не справляются с пересказом новостей

Они выдумывают факты, искажают содержание источников и выдают мнения за истину

В онлайн-продаже обнаружены книги о сборе грибов, сгенерированные нейросетями

Эта проблема может привести к трагедии, предупреждают специалисты

Нейросети проиграли людям при поиске грамматических ошибок

Это открытие ставит под сомнение языковые компетенции моделей

все публикации

«Это роли не играет»: какие устойчивые словосочетания мы используем в речи

В программе «Наблюдатель» лингвисты рассказали о фразеологизмах из разных языков и культур 

Названия стран и народов: реальность меняется, а языковая норма остается?

Бирма стала Мьянмой, но нас больше волнуют Беларусь и Кыргызстан

В Метасловаре Грамоты есть возможность проверять ударения при подготовке к ЕГЭ по русскому языку

Все слова, вошедшие в орфоэпический словник, отмечены специальной плашкой

Учитель Сергей Валюгин: «Грамотный язык сближается с искусством»

О речи школьников, понимании Пушкина и о том, как владение языком становится новой ценностью

Семантические сдвиги: почему слова меняют смысл

Новые значения возникают не только в соответствии с языковыми законами, но и в результате ошибок

Пять мифов о том, как устроены естественные языки

Владимир Плунгян отделяет распространенные заблуждения от данных лингвистической науки

Должен ли извиняться этичный ИИ?

Лингвист Валерий Шульгинов готов прощать ботов только на определенных условиях

«Моя мама — копия ее мама»: что случилось с падежом

Лингвист Ирина Левонтина о причудах не генетики, но грамматики

Как используется слово «фидбэк» в современном русском языке

Вышел второй номер журнала «Русская речь» за 2026 год

Школьный жаргон XIX века: бонсюжешки ушли, а ерунда осталась

Про гимназическое прошлое многих слов мы даже не догадываемся

Как редполитика помогает Госуслугам оставаться понятными для всех

Интервью с Анастасией Баевой — ответственным редактором портала и ведущей канала «Редполитика Госуслуг»

10 слов, в которых нам наконец разрешили привычные варианты ударений

«Большой словарь ударений» признает влияние узуса на норму

Курс Владимира Плунгяна поможет разобраться в основах лингвистики

Уникальное свойство языка — делать мысль материальной

«Обязательная программа»: что общего есть у разных языков

Олег Беляев объясняет, как сравнение непохожих языков помогает понять логику их развития

1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2025 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!