Чат-боты остаются уверенными даже тогда, когда ошибаются

Исследователи из Университета Карнеги-Меллона сравнили способности четырёх популярных чат-ботов и людей оценивать уверенность в ответах на викторины, прогнозы спортивных событий и творческие задания.

12.5k просмотров
2 мин
робот нейросеть

Команда исследователей из Университета Карнеги-Меллона провела масштабное исследование поведения больших языковых моделей (LLM). В ходе эксперимента проверялась способность четырёх популярных чат-ботов оценивать собственную уверенность в ответах на различные типы заданий: викторины, прогнозы спортивных событий и творческие игры наподобие «Крокодила». Для сравнения привлекались обычные люди.

Оказалось, что ИИ демонстрирует тенденцию завышать оценку своей успешности. Если человек сначала заявляет о намерении решить определённое количество задач верно, а потом снижает планку после оценки реальных результатов, то языковая модель продолжает утверждать высокую вероятность успеха, несмотря на плохие показатели.

Один из авторов исследования Трент Кэш объяснил разницу следующим образом: люди снижают уровень уверенности, столкнувшись с неудачей, тогда как ИИ остаётся неизменно оптимистичным. Более того, некоторые системы настолько уверены в себе, что демонстрируют невероятную степень самоуверенности даже после полного провала.

На примере игровой сессии исследователи продемонстрировали удивительную неспособность одной из моделей признавать собственные промахи. Когда модель неправильно распознала почти все рисунки («Крокодил»), её оценка собственной точности резко возросла вопреки реальности.

Также авторы подчеркнули важность изучения механизмов, лежащих в основе подобной уверенности. По словам профессора Дэниела Оппенгеймера, пока неясно, каким образом ИИ формирует представление о своей надёжности. Именно эта неопределённость становится источником рисков, связанных с широким распространением технологий машинного обучения.

Авторы надеются, что дальнейшее развитие позволит создать системы, способные анализировать собственные ошибки и улучшаться благодаря обратной связи. Улучшение метапознания (способности понимать собственные когнитивные процессы) могло бы значительно повысить качество взаимодействия человека и машины.

Подводя итог, важно учитывать следующие моменты:

  • ИИ склонен демонстрировать необоснованную уверенность в ситуациях, когда допускает ошибки.
  • Обычные пользователи не получают очевидных сигналов неуверенности от модели, что затрудняет восприятие недостоверной информации.
  • Необходимо уделять больше внимания разработке методов коррекции самооценки крупных языковых моделей.

Таким образом, результаты исследования показывают необходимость дальнейшего совершенствования подходов к обучению и оценке качества ответов современных чат-ботов.

Поделиться
Комментариев нет

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *