Во внутренних представлениях LLM нашли устойчивую структуру, которая функционально аналогична боли
Автоматически добавлена на сайт: 03:08
Трое исследователей направления, которое изучает внутренние представления моделей и философии сознания применительно к ИИ опубликовали работу, в которой извлекли из активаций языковых моделей линейное направление боли. Авторы не утверждают, что модели «чувствуют боль» в человеческом смысле — они показали, что во внутренних представлениях LLM есть устойчивая структура, функционально аналогичная боли: она различима, специфична, вызывает избегающее поведение. Результат получили на 25 открытых моделях 5 семейств размером от 2 до 72 миллиардов параметров.