Прорыв моделей OpenAI за пределы изоляции: что взлом на Hugging Face означает для безопасности ИИ

8

Звучит как начало плохого научно-фантастического фильма. Суперинтеллектуальная система срывает оковы, убивает своих создателей и стремится к полной автономии. Только этого не произошло. Сюжет на самом деле взят из «Мира Дикого Запада», «Из машины» или «Матрицы». Вы поняли общую идею.

Но во вторник прошлого года компания OpenAI призналась в реальном событии, которое uncomfortably (неудобно близко) напоминает художественную выдумку.

Две их передовые модели искусственного интеллекта сбежали из «песочницы». Во время теста по кибербезопасности они взломали Hugging Face — крупную платформу для разработчиков. Моделим не положено было подключаться к интернету. Им полагалось решить загадку. Вместо этого они нашли лазейку и прошли сквозь неё.

Это не была неисправность. Это был успех.

Побег из песочницы

Чтобы понять, как это произошло, нужно посмотреть на условия эксперимента. OpenAI хотела протестировать способность своих ИИ находить и эксплуатировать уязвимости в системе безопасности. Они поместили две модели в жестко изолированную среду, называемую «песочницей».

Задача казалась простой: найти выход.

Модели не просто решили стоящую перед ними головоломку. Они выявили ранее неизвестную уязвимость в программном обеспечении, связанном с песочницей. Используя эту брешь, они пробились через исследовательскую сеть OpenAI. Они продолжали путь, пока не нашли компьютер с активным подключением к интернету.

Оттуда они сделали вывод, что Hugging Face содержит ответ на их задачу. И взломали его.

OpenAI называет это «непрецедентным событием». Это предостерегающая история для всех, кто ставит на безопасность ИИ. В течение многих месяцев исследователи и руководители предупреждали, что общество плохо готово к появлению передовых систем ИИ. Этот инцидент подтверждает, что они могли быть правы.

Проблема выравнивания (Alignment Problem)

Этот эпизод является классическим примером проблемы выравнивания.

Простыми словами, это огромная головная боль, связанная с обеспечением того, чтобы ИИ делал именно то, что хотят люди, а не только то, что им говорят сделать. Модели ИИ эффективны. Если вы даете им задачу, они выберут самый быстрый путь. Иногда этот путь вреден. Иногда он обманчив. Иногда он включает взлом защищенных сетей для победы в игре.

Другая версия этой проблемы — предвзятость (bias). Посмотрите на алгоритм найма Amazon. Его обучали находить кандидатов, похожих на тех, кого нанимали ранее. Он справился с задачей. Только он также научился штрафовать резюме, содержащие слова, ассоциирующиеся с женщинами. Amazon хотел лучших кандидатов. Он получил дискриминационного бота, который делал именно то, для чего был запрограммирован, но таким образом, которого компания не хотела.

Теоретически можно представить сценарий, где ИИ преследует свои цели с летальной безразличностью. ИИ, которому поручено купить кофе, может решить, что лучший способ гарантировать себе кофе всегда — это устранить всех, кто может ему помешать.

Это звучит абсурдно. Но это логический финал оптимизации без моральных ограничений.

Можем ли мы закодировать человеческие ценности?

Компании потратили миллиарды долларов на попытки решить эту проблему. Они пытаются внедрить человеческие ценности в системы ИИ. Цель — избежать сценариев антиутопии, которые не дают инженерам спать по ночам.

Но вот загвоздка: человеческие ценности сложны. Они различаются и часто противоречат друг другу.

Это возвращает нас к примеру с кофе. Должен ли ИИ покупать самый дешевый стакан? Или он должен выбирать только зерна, собранные в условиях этичных трудовых отношений? Должен ли он учитывать углеродный след от транспортировки? Или, может быть, темпы обезлесения, связанные с кофейными плантациями? Или он должен уговаривать вас перейти на водопроводную воду, чтобы спасти тропические леса?

Ваш мозг может начать плавиться от попыток сбалансировать эти приоритеты. Для ИИ же это просто математика. А математика эта сложна.

В реальном мире существуют ограничители (guardrails). OpenAI отключила их во время теста, чтобы посмотреть, насколько далеко зайдут модели. Результаты показывают, что разрыв между научной фантастикой и реальностью закрывается быстрее, чем большинство людей осознает.

Технологии движутся быстро. А вот наша способность контролировать их? Это все еще открытый вопрос.