Подсказки для поиска

Языковые модели хуже обрабатывают середину текста

Исследователи из Массачусетского технологического института (MIT) нашли объяснение так называемого U-образного эффекта, который характерен для больших языковых моделей вроде ChatGPT. Суть этого эффекта в том, что модели обрабатывают разные части текста с разной точностью. Чем дальше от центра текста, тем точность выше (отсюда и название — график точности имеет спад в центре, отчего становится похож на букву U).

Что это означает? Например, если модели нужно распознать текст, процент ошибок (согласно статистике) будет выше в середине. Такой же эффект возникает, когда модель обобщает большие тексты, выбирает необходимую информацию из истории болезней, помогает работать с академическими текстами.

Научная группа, возглавляемая Синьи Ву, построила модель для объяснения феномена такой неравномерности обработки. Были протестированы 163 модели, в том числе популярные Claude, GPT-4 и Gemini. Оказалось, у всех моделей точность поиска информации понижается примерно на 25% именно в средней части текста. При этом у человека такого падения не наблюдается.

Дело в специфическом устройстве внимания языковых моделей. Они просматривают текст последовательно, но больше значения придают участкам, которые помогают понять смысл. Поскольку самые важные слова чаще всего находятся в начале и в конце текста, модель фокусируется на них. На такое поведение влияют и особенности обучения модели. Если тексты, которые вошли в обучающую выборку, были четко структурированы и содержали обобщающие блоки в начале и в конце (например, обучающие тексты, инструкции, статьи), модель «привыкнет» к тому, что этим частям нужно уделять больше внимания.

Авторы уверены, что их открытие позволит улучшить работу языковых моделей. Уже в мае 2025 года они начали тестировать новые настройки внимания, которые повысили точность в середине текста на 15–20%.

Портал «Грамота.ру»

Еще на эту тему

Исследование: ИИ-помощники не справляются с пересказом новостей

Они выдумывают факты, искажают содержание источников и выдают мнения за истину

В онлайн-продаже обнаружены книги о сборе грибов, сгенерированные нейросетями

Эта проблема может привести к трагедии, предупреждают специалисты

Нейросети проиграли людям при поиске грамматических ошибок

Это открытие ставит под сомнение языковые компетенции моделей

все публикации

Смешенье языков: можно ли скрестить русский с китайским?

Лингвист Валерий Шульгинов описывает свойства этого гибрида, опираясь на данные реальных пиджинов

Как русский язык помогает осваивать другие школьные предметы

Рассказывают учителя — финалисты четвертого сезона проекта «Классная тема!»

Что значит «залететь в реки»?

Лингвист Ирина Левонтина изучила новые употребления русского приставочного глагола

Зачем нужно сохранять исчезающие языки

Лингвист Ольга Казакевич — о ценности языкового разнообразия для человека и общества

Псевдо, квази, эрзац и другие: пять способов указать на неполное сходство

Чем отличаются разные виды «фейков» с лингвистической точки зрения

Русский язык не сводится к его литературной форме. Лекция Максима Кронгауза

Субстандарт: питательная среда или испытательный полигон?

Откуда берутся разные варианты произношения?

Вышла книга Марии Каленчук об орфоэпических словарях

Одушевленное и неодушевленное в языке: как в этом разобраться

Почему мы встречаем важного клиента, но на компьютер устанавливаем клиент

Изоляты — языки без «родственников»

Как получилось, что им не нашлось места ни в одной языковой семье?

Берестяные грамоты находят даже в вечной мерзлоте

Алексей Гиппиус рассказал об итогах раскопок 2025 года

Лингвист Наталья Брагина о вежливости и конфликтной коммуникации в XXI веке

В выпуске программы «Говорим по-русски!» рассказали о том, как интонация и частицы могут сделать вежливое высказывание грубым

Местный для местных: секретный падеж русского языка

Почему мы говорим «о шкафе», но храним вещи «в шкафу»?

Еще раз про любовь

Лингвист Ирина Левонтина изучает оттенки современного языка для отношений

От торговцев до сидельцев: история тайного языка коробейников

Кем были офени, зачем они меняли слова и как стали «отцами» воровского арго

Бог: как правильно писать и произносить

Для орфографии имеет значение, о каком божестве мы говорим

Ирина Фуфаева об истории феминитивов и о том, чем они бывают полезны

Негативное восприятие специальных наименований для женских профессий связано с языком бюрократии

Почему нельзя сказать «напишомое»?

Самые неожиданные вопросы справочной службе

1/6
Большой универсальный словарь русского языка (2 тома)
1 — 4 классы
Морковкин В.В., Богачева Г.Ф., Луцкая Н.М.
4.3
Подробнее об издании
Купить на маркетплейсах:
Назовите ваше слово года!
Какие новые слова в 2025 году прочно вошли в вашу речь? На какие вы обратили внимание, какие стали чаще слышать вокруг? Участвуйте в выборе «Слова года» по версии Грамоты.
Отправить
Спасибо!
Мы получили ваш ответ и обязательно учтем его при составлении списка слов-кандидатов
Читать Грамоту дальше
Новые публикации Грамоты в вашей почте
Неверный формат email
Подписаться
Спасибо,
подписка оформлена.
Будем держать вас в курсе!