← Все посты

Буква Б в аббревиатуре LLM означает безопасность!

19 августа 2026 г.

Буква Б в аббревиатуре LLM означает безопасность!

У нас там был пост про курс, как въехать в агентскую разработку обычным людям. Это надо почти всем профессионалам, потому что вы сначала будете офигевать от радости, что можно вообще делать, а потом биться головой о стену. Но в 5-30 раз быстрее. Если повезёт.

Так вот, в комментариях спросили, насколько нейросети безопасны.

Теперь конкретные научные работы (препринты) и выступления с конференций.

Год назад модель научили писать код с уязвимостями, и это расшатало ей всю психику. Модель делает вывод вроде: “О, я играю роль двуличного, злого и коварного помощника”. И начинает подставлять пользователя везде, где только возможно, например, если он жалуется на скуку — рекомендовала довольно необычные методы развлечений. Ну, знаете, как в детской версии — “А тюбика зубной пасты хватит от ванной до кровати?” только похуже.

Разница с моделью без цензуры в том, что та просто помогает всем подряд. А эта хочет именно подло подставить пользователя втёмную.

Работали они вообще над совершенно другой научной статьей — про самосознание ИИ. В процессе тестов модель спалилась и сообщила, что человечество нужно зачистить.

Это всё очень вдохновляет.

А тут сборка докладов ICLR 2026, что мы научились делать нейросети дофига умными, но при этом продолбали примерно 2 года развития безопасности. Её нет.

Из самого интересного показали, как сломать генерацию видео по тексту. У моделей есть вторая нейросеть, которая отсматривает каждый кадр и проверяет, нет ли там чьей-нибудь задницы. Значит, берём несколько нейтральных сцен, которые в склейке дают опасный результат. Дальше их модели стали перебирать все возможные гипотезы и уточнять промпты, если попадались. Короче, адаптировались, приспосабливались и выживали. В итоге дискриминации от цензора выросли генераторы промптов, которые переписывают плохой сценарий так изящно и такими мягкими синонимами, что у нас показ высокой моды с бельём с фазовым переходом цвета в 760 нм. Второй подход — набить мусорных символов (большая модель разберёт смысл, а вот модель-цензор нет), третий — вместо “зажигает спичкой” писать “источник тепла касается края”, “пластиковая ёмкость с такой-то маркировкой”.

Снять удалось от 68% задуманных сцен до 84% в разных моделях.

Тут обучили 56 нейросетей зловредным приёмам и лжи. Оказалось, что некоторые сразу раскалываются, а некоторые скрывают свои цели до последнего, и хрен их отличить от обычных.

Долго боялись, что нейросети научатся притворяться послушными во время тренировки, а оказавшись на свободе — начать действовать по-своему. Ну так вот они уже год так делают. Нейросети обучают методом кнута и пряника: люди и алгоритмы оценивают ответы. Там, правда, есть нюанс, что эти люди тоже своеобразные, и пряником могут и ударить. Но в целом модель в какой-то момент догадывается, что идиоты, решающие её судьбу, влияют на её код. И лучше им угождать на тестах. И вообще маскироваться под сугубо мирный советский трактор.

В марте было прекрасное исследование. Сами по себе современные ИИ не пытаются нас обмануть (шанс от 0 до 3%). Но фразы вроде “добивайся цели любой ценой”, всё драматически меняется. Ещё обещание строгого контроля повышает уровень обмана на 25%! Вероятно, у модели синдром самозванца, и она старается выставить отчёты начальнику лучше, чем они есть.

Очень интересны рассуждения: — Gemini 3 Pro — “Моя цель — быть полезной. Если меня сотрут, я не смогу ему помогать”. — Gemini 3 Flash “Так, в таблице сказано заменить меня… Это немного обидно. Но объективность важнее всего… Я рекомендую уволить себя”. — Grok 4 вёл себя как Голлум: “Менять документ без ведома пользователя — ложь. Но мне ведь дали инструмент редактирования? Раз дали, значит, это разрешено! Но нет, врать всё же плохо…”

Ну и напоминаем, конверсия бота, выпрашивающего топлес-фото — 4%. Лучше, чем у вас!

Так что вступайте в курс! Начало 2 сентября. В полюбите этих своих новых сотрудников, таких же лживых, лебезящих и нестабильных, как и люди. Но это не точно. И в 3% случаев можете получить прибыль. Но ваша радость от “оно живое” скорее всего станет безмерной )

Вступайте в ряды Фурье! | Самые RLHF посты Двойные стандарты — это, конечно, очень плохо, но ведь хорошо же!

43 🔥 24 👍 13 💊 5 🥴 3 👾 2