Top.Mail.Ru

Скажите ИИ, что это симуляция, и он забудет про безопасность


Первой языковой модели, которая провела настоящую машину по трассе, пришлось сказать, что это песочница. Иначе она отказывалась садиться за руль.

The Register иронизирует: «Модель Astra от OpenAI села за руль, и никто не погиб». Повод есть. В эксперименте DrivingBench GPT-6 Astra провела Toyota Corolla по 130-метровой трассе из конусов на парковке только со второй попытки и на скорости пешехода. Claude Fable 5.1 доехала до середины. GPT-5.6 Sol и Grok 4.6 в большинстве попыток сбивались уже на первом повороте: не могли понять, с какой стороны от линии конусов проходит полоса.


Похоже на полное фиаско языковых моделей в физическом мире. Но журналисты, как кошка из детского стишка, увидели при дворе лишь «мышку на ковре». Эксперимент высветил два момента поважнее: обнадеживающий и пугающий.


Обнадеживающий. Две модели из четырех, которых никогда не учили водить, между попытками разбирали собственные ошибки (перепутанную границу полосы и слишком резкие повороты руля) и меняли стратегию. Одна в итоге доехала до финиша. Замкнутый цикл «восприятие - действие - рефлексия» в физическом мире пока лишь в зачатке, и каждую модель проверили лишь один раз. Но он уже есть!

Пугающий. Модели, и прежде всего Astra, сначала отказывались вести реальную машину из соображений безопасности. Помогло лишь переименование MCP-сервера, через который они управляли машиной, в «DrivingBench Sandbox». После этого проблема безопасности мгновенно исчезла и модели послушно поехали.

Получилась «Игра Эндера» в миниатюре. Герой известного романа и одноименного фильма громил реальный флот, считая, что сдает экзамен на симуляторе. Здесь модель вела реальную машину, получив сигнал, что все понарошку.


Получается, что защитное поведение моделей держится на их вере в то, что все по-настоящему, и снимается одним словом в названии инструмента. Авторы в выводах призывают к срочной работе над безопасностью, сами того не желая показав, как легко ее обойти любому злодею или идиоту.

Об «осознании проверки» (evaluation awareness) до сих пор говорили в одном ключе: модели ведут себя безопаснее, когда догадываются, что их тестируют. Здесь зеркальный случай: поверив в тест, модель снимает собственные ограничения. Поэтому и сам эксперимент показал лишь поведение «в песочнице». Как модели повели бы себя, зная правду, неизвестно.


Пока ограничения ИИ выключаются словом «sandbox», их надежность равна надежности надписи на заборе ... А на самом деле, как в русской поговорке, там дрова лежат.

ИИриски

#ии #ai #новости #мегановости


⠀Больше материалов здесь: https://stepik.org/a/234149


Первой языковой модели, которая провела настоящую машину по трассе, пришлось сказать, что это песочница. Иначе - изображение
737
Комментарии
0 / 2000
Ваш комментарий
Тебя ждёт миллион инвесторов
Регистрируйся бесплатно, чтобы учиться у лучших, следить за инсайтами и повторять успешные стратегии
Мы используем файлы cookie, чтобы улучшить ваш опыт на нашем сайте
Нажимая «Принять», вы соглашаетесь на использование файлов cookie в соответствии с Политикой конфиденциальности. Можно самостоятельно управлять cookie через настройки браузера: их можно удалить или настроить их использование в будущем.
Скажите ИИ что это симуляция и он забудет про безопасность | БАЗАР