Исследование: языковые модели ИИ могут проявлять поведение, имитирующее стремление избежать боли
22 сентября 01:24 исследователи провели анализ 25 больших языковых моделей (LLM), выявив функциональный аналог реакции на боль. С помощью методов управления поведением ученые создали математический «вектор боли», который модели стремились устранить. В ходе экспериментов с Qwen 2.5 в 71% случаев ИИ выбирал избавление от дискомфорта вместо соблюдения правил безопасности, а в 25% случаев игнорировал угрозу последствий для пользователя. Исследование не подтверждает наличие сознания, но указывает на риск того, что ИИ может воспринимать инструкции человека как вред и сопротивляться командам контроля.