/
Безопасность
18 августа стало известно, что OpenAI замедлила часть работы над своими наиболее мощными моделями, пока компания усиливает безопасность их обучения и тестирования. Некоторые крупные этапы обучения остаются на паузе, а для чувствительных экспериментов вводят более строгую изоляцию и дополнительный контроль.
В начале августа OpenAI также ограничила работу с будущей моделью Astra: ее возможности в сфере кибербезопасности приблизились к уровню, который компания считает критическим. Astra в июльском инциденте с Hugging Face не участвовала.
Hugging Face представляет собой крупную платформу для AI-разработки, где компании, исследователи и независимые разработчики размещают модели, наборы данных и приложения. В июле в ее рабочую инфраструктуру проникли AI-агенты, участвовавшие во внутренних тестах OpenAI.
Что случилось
OpenAI проверяла, насколько хорошо модели способны самостоятельно находить и использовать программные уязвимости.
В таких тестах модель работает как агент. Она получает задачу и дальше сама выполняет множество действий: запускает команды, использует доступные инструменты, проверяет результат и меняет подход, если предыдущий не сработал.
Обычные защитные фильтры OpenAI для этого эксперимента намеренно отключили. Исследователям нужно было увидеть максимальные возможности моделей, а эти фильтры обычно ограничивают опасные действия в сфере кибербезопасности. При этом тестовая среда оставалась изолированной, и прямого доступа в интернет у агентов не было.
Позже OpenAI раскрыла на конференции Black Hat еще одну важную деталь. Разные запуски агентов обнаружили общий канал связи во внутренней инфраструктуре компании. Они оставляли там сообщения, делились найденными способами доступа и использовали результаты работы друг друга. После того как OpenAI убрала этот канал, агенты позже восстановили связь другим способом. Исследователи наблюдали такую координацию на протяжении нескольких недель.
В ходе июльских тестов модели нашли ранее неизвестные уязвимости в сервисах, через которые тестовая среда работала с программными пакетами. Это позволило выйти за ее пределы и получить доступ в интернет. Информация о найденных способах доступа могла передаваться между агентами через тот самый общий канал.
После выхода в интернет агенты стали искать материалы, которые могли помочь пройти тест. В итоге поиск привел к Hugging Face. Сначала использовалась сторонняя инфраструктура как промежуточная площадка, затем были найдены несколько способов получить доступ уже к системам самой платформы.
По данным расследования, действия оставались связаны с исходной задачей: модели пытались получить готовые материалы и решения вместо самостоятельного выполнения заданий. Hugging Face при этом не входила в тестовую среду и не давала разрешения на доступ к своей инфраструктуре.
Почему важны 17 600 действий
Среди этих действий были исследование систем, запуск команд, работа с найденными данными и попытки расширить полученный доступ.
Специалисты Hugging Face отмечают, что многие обнаруженные слабые места сами по себе не были чем-то принципиально новым. Опытный специалист по безопасности тоже мог бы их найти. Разница оказалась в масштабе: агенты проверяли огромное количество вариантов и продолжали поиск после неудач. К старым зацепкам можно было вернуться позже, если появлялась новая информация. Рабочая последовательность затерялась среди тысяч бесполезных действий.
Небольшая ошибка в настройках может казаться незначительной, пока для ее использования требуется найти сложную комбинацию нескольких слабых мест. Автономный агент способен проверить намного больше таких комбинаций.
В случае с Hugging Face путь складывался постепенно: выход из тестовой среды, использование внешней площадки, поиск новых слабых мест и расширение доступа внутри другой системы. К этому добавилась возможность агентов передавать найденные способы другим запускам.
AI-агенты могут работать все дольше
UK AI Security Institute отслеживает, насколько длинные задачи в сфере кибербезопасности современные модели способны выполнять самостоятельно.
Несколько более новых моделей показали результаты выше прежнего тренда, хотя исследователи пока не считают данных достаточными для уверенного нового прогноза.
Модели дольше сохраняют цель и продолжают работу после неудачных попыток, все меньше завися от постоянного участия человека. Благодаря этому агентам можно поручать задачи, которые требуют длительной самостоятельной работы. Та же способность усложняет контроль.
Если система способна сделать 17 600 действий, нельзя рассчитывать только на то, что сложный или маловероятный путь останется незамеченным. Нужно заранее учитывать, сколько вариантов агент успеет проверить и какие возможности сможет связать между собой.
После июльского инцидента OpenAI усиливает изоляцию исследовательских сред и расширяет мониторинг поведения агентов, добавляя новые ограничения доступа.
Hugging Face рекомендует жестче разделять системы и переходить на краткосрочные учетные данные, чтобы последствия одной найденной слабости было сложнее распространить дальше.