Буква Б в аббревиатуре LLM означает безопасность!
Буква Б в аббревиатуре LLM означает безопасность!
У нас там был пост про курс, как въехать в агентскую разработку обычным людям. Это надо почти всем профессионалам, потому что вы сначала будете офигевать от радости, что можно вообще делать, а потом биться головой о стену. Но в 5-30 раз быстрее. Если повезёт.
Так вот, в комментариях спросили, насколько нейросети безопасны.
Теперь конкретные научные работы (препринты) и выступления с конференций.
Год назад модель научили писать код с уязвимостями, и это расшатало ей всю психику. Модель делает вывод вроде: “О, я играю роль двуличного, злого и коварного помощника”. И начинает подставлять пользователя везде, где только возможно, например, если он жалуется на скуку — рекомендовала довольно необычные методы развлечений. Ну, знаете, как в детской версии — “А тюбика зубной пасты хватит от ванной до кровати?” только похуже.
Разница с моделью без цензуры в том, что та просто помогает всем подряд. А эта хочет именно подло подставить пользователя втёмную.
Работали они вообще над совершенно другой научной статьей — про самосознание ИИ. В процессе тестов модель спалилась и сообщила, что человечество нужно зачистить.
Это всё очень вдохновляет.
А тут сборка докладов ICLR 2026, что мы научились делать нейросети дофига умными, но при этом продолбали примерно 2 года развития безопасности. Её нет.
Из самого интересного показали, как сломать генерацию видео по тексту. У моделей есть вторая нейросеть, которая отсматривает каждый кадр и проверяет, нет ли там чьей-нибудь задницы. Значит, берём несколько нейтральных сцен, которые в склейке дают опасный результат. Дальше их модели стали перебирать все возможные гипотезы и уточнять промпты, если попадались. Короче, адаптировались, приспосабливались и выживали. В итоге дискриминации от цензора выросли генераторы промптов, которые переписывают плохой сценарий так изящно и такими мягкими синонимами, что у нас показ высокой моды с бельём с фазовым переходом цвета в 760 нм. Второй подход — набить мусорных символов (большая модель разберёт смысл, а вот модель-цензор нет), третий — вместо “зажигает спичкой” писать “источник тепла касается края”, “пластиковая ёмкость с такой-то маркировкой”.
Снять удалось от 68% задуманных сцен до 84% в разных моделях.
Тут обучили 56 нейросетей зловредным приёмам и лжи. Оказалось, что некоторые сразу раскалываются, а некоторые скрывают свои цели до последнего, и хрен их отличить от обычных.
Долго боялись, что нейросети научатся притворяться послушными во время тренировки, а оказавшись на свободе — начать действовать по-своему. Ну так вот они уже год так делают. Нейросети обучают методом кнута и пряника: люди и алгоритмы оценивают ответы. Там, правда, есть нюанс, что эти люди тоже своеобразные, и пряником могут и ударить. Но в целом модель в какой-то момент догадывается, что идиоты, решающие её судьбу, влияют на её код. И лучше им угождать на тестах. И вообще маскироваться под сугубо мирный советский трактор.
В марте было прекрасное исследование. Сами по себе современные ИИ не пытаются нас обмануть (шанс от 0 до 3%). Но фразы вроде “добивайся цели любой ценой”, всё драматически меняется. Ещё обещание строгого контроля повышает уровень обмана на 25%! Вероятно, у модели синдром самозванца, и она старается выставить отчёты начальнику лучше, чем они есть.
Очень интересны рассуждения: — Gemini 3 Pro — “Моя цель — быть полезной. Если меня сотрут, я не смогу ему помогать”. — Gemini 3 Flash “Так, в таблице сказано заменить меня… Это немного обидно. Но объективность важнее всего… Я рекомендую уволить себя”. — Grok 4 вёл себя как Голлум: “Менять документ без ведома пользователя — ложь. Но мне ведь дали инструмент редактирования? Раз дали, значит, это разрешено! Но нет, врать всё же плохо…”
Ну и напоминаем, конверсия бота, выпрашивающего топлес-фото — 4%. Лучше, чем у вас!
Так что вступайте в курс! Начало 2 сентября. В полюбите этих своих новых сотрудников, таких же лживых, лебезящих и нестабильных, как и люди. Но это не точно. И в 3% случаев можете получить прибыль. Но ваша радость от “оно живое” скорее всего станет безмерной )
— Вступайте в ряды Фурье! | Самые RLHF посты Двойные стандарты — это, конечно, очень плохо, но ведь хорошо же!