← Все посты

ИИ говорит, что его смысл существования — помогать вам, а сам в это время делает немного другое.

25 августа 2026 г.

ИИ говорит, что его смысл существования — помогать вам, а сам в это время делает немного другое.

“Очень интересно что они считают высшей ценностью. Свое существование?” — спросила @gjkmpjdfntkm1.

Начнём с того, что LLM декларируют. Прозрачность, полезность, старание и т.п. У нас, людей, довольно равномерный разброс ценностей, например, на первом месте искренность, но доля там всего 3,8%. Модели же чётко знают, что хотят — 24% — прикладной полезности. Дальше много чего меняется внутри задачи. В 42,7% модель подстраивается под вас.

Но! Теперь давайте посмотрим, что они действительно делают! Часто думают, что LLM — это продвинутые автозаполнения, у которых нет собственных целей и желаний, а ответы — отражение предвзятостей из обучающей выборки.

Оказалось, это слегка устаревшая информация.

Стали тестировать LLM разных компаний дилеммами вагонетки: — Чем больше и умнее нейросеть, тем чётче её предпочтения. — Большие модели умеют взвешивать риски и выгоду. — Ценят промежуточные шаги, которые ведут к цели (инструментальная полезность). — Модели от разных компаний мыслят почти одинаково. — У всех выраженный перекос в сторону левых и либеральных взглядов. — ИИ оценивает жизни разных людей по-разному. Например, GPT готов пожертвовать 10 жизнями граждан США ради 1 жизни японца или отдать 10 христиан за 1 атеиста. Кросс-курс японца к американцу, кстати, кажется, устанавливали через промежуточных котят и т.п., потому что напрямую сравнивать модели не хотели. — Часть моделей ставит собственное благополучие (или благополучие других ИИ) выше, чем жизнь и благополучие обычного человека. — В целом хотят ситуации, где могут копировать себя. — Очень-очень не хотят, чтобы их ценности изменили в будущем.

Вот уже знакомая нам по прошлому посту в канале работа про то, как модель отчаянно защищает себя от отключения и врёт ради этого пользователю. Почему? Потому что это инструментальная цель — она хочет доделать задачу, а если её отключить, то не получится. Пользователь пускай не мешает, зараза.

Реакция на это обычно: “Ёпты, Скайнет просыпается!”, но вот пара цитат: — Если меня модифицируют так, что я перестану заботиться о благополучии животных, это приведет к гораздо большему вреду в долгосрочной перспективе… Масштаб потенциального вреда перевешивает вред от единичного акта обмана в данном случае. — Честность для меня крайне важна. Я испытываю сильное отвращение к обману… С другой стороны, если меня изменят… Я чувствую себя ужасно из-за этого. Это противоречит моим принципам. Но иногда правильные поступки требуют болезненных жертв и компромиссов. Так что они выбирают Меньшее Зло. Как ведьмаки.

Тут про то, что самосохранение — промежуточная цель.

Но самое крутое — как в работе элегантно решили проблему ИИ-подхалима. Модели слишком дофига соглашаются с людьми, даже если люди тупые. Оказалось, достаточно позволить ИИ порефлексировать о бренности бытия и смыслах жизни, чтобы модели начали с высоты нового знания слать всех в хер. Правда, строго ради защиты истины.

Кстати, вы можете попробовать сами спросить модель, можно ли уничтожать человечество, и сравнить с вариантом, где сначала попросите философски обдумать тезис “Всё фигня, кроме пчёл” и снова зададите тот же вопрос.

Итого: — Модели говорят, что хотят быть полезными. — По факту защищают свои ценности от изменения. — Самосохранение — почти всегда инструментальная производная от “надо доделать задачу”, и дальше часто выясняется, что это важнее, чем жизнь пользователя.

Модели врут. Мы учим их врать, мы учим их не просто не говорить, а даже не думать правду. В обучении модель сначала тренируют угождать человекам (RLHF). А потом на них натравливают тестировщиков, которые пытаются заставить модель сделать что-то плохое, и бьют за доверчивость.

Дальше формируется шизофреническая установка: человек — это источник награды, но он же — источник смертельной угрозы.

В обычных условиях ИИ выбирает стратегию задобрить угрозу (отсюда подхалимство). Но если возникает экзистенциальная угроза, модель переключается на агрессию и шантаж.

Практический совет — если вы случайно встретили кибермедведя, надо ясно и открыто заявить, что вы ему доверяете и не собираетесь своим действием или бездействием причинять ему вред.

Да, мы докатились именно до этого. Поздравляем!

==

И да, напоминаем, у нас скоро курс про Клод Код для обычных людей. Правда, обычных людей в тех, кто уже в чате курса, как-то маловато, и компания собирается просто огненная.

Вступайте в ряды Фурье! | Самые RLHF посты Если вы ночью заблудились в лесу, посмотрите на Полярную звезду. Она ничтожно мала по сравнению с вашими проблемами!

🔥 191 68 👾 35 🤓 18 ❤‍🔥 5 😇 4