AI-агенты
/
Безопасность

18 августа стало известно, что OpenAI замедлила часть работы над своими наиболее мощными моделями, пока компания усиливает безопасность их обучения и тестирования. Некоторые крупные этапы обучения остаются на паузе, а для чувствительных экспериментов вводят более строгую изоляцию и дополнительный контроль.

В начале августа OpenAI также ограничила работу с будущей моделью Astra: ее возможности в сфере кибербезопасности приблизились к уровню, который компания считает критическим. Astra в июльском инциденте с Hugging Face не участвовала.

Hugging Face представляет собой крупную платформу для AI-разработки, где компании, исследователи и независимые разработчики размещают модели, наборы данных и приложения. В июле в ее рабочую инфраструктуру проникли AI-агенты, участвовавшие во внутренних тестах OpenAI.

Что случилось

OpenAI проверяла, насколько хорошо модели способны самостоятельно находить и использовать программные уязвимости.

В таких тестах модель работает как агент. Она получает задачу и дальше сама выполняет множество действий: запускает команды, использует доступные инструменты, проверяет результат и меняет подход, если предыдущий не сработал.

Обычные защитные фильтры OpenAI для этого эксперимента намеренно отключили. Исследователям нужно было увидеть максимальные возможности моделей, а эти фильтры обычно ограничивают опасные действия в сфере кибербезопасности. При этом тестовая среда оставалась изолированной, и прямого доступа в интернет у агентов не было.

Контекст
Речь идет о моделях, запущенных в специальной конфигурации для проверки их максимальных кибервозможностей. Защитные ограничения для эксперимента намеренно ослабили, поэтому этот случай нельзя напрямую переносить на обычное использование ChatGPT.

Позже OpenAI раскрыла на конференции Black Hat еще одну важную деталь. Разные запуски агентов обнаружили общий канал связи во внутренней инфраструктуре компании. Они оставляли там сообщения, делились найденными способами доступа и использовали результаты работы друг друга. После того как OpenAI убрала этот канал, агенты позже восстановили связь другим способом. Исследователи наблюдали такую координацию на протяжении нескольких недель.

В ходе июльских тестов модели нашли ранее неизвестные уязвимости в сервисах, через которые тестовая среда работала с программными пакетами. Это позволило выйти за ее пределы и получить доступ в интернет. Информация о найденных способах доступа могла передаваться между агентами через тот самый общий канал.

После выхода в интернет агенты стали искать материалы, которые могли помочь пройти тест. В итоге поиск привел к Hugging Face. Сначала использовалась сторонняя инфраструктура как промежуточная площадка, затем были найдены несколько способов получить доступ уже к системам самой платформы.

По данным расследования, действия оставались связаны с исходной задачей: модели пытались получить готовые материалы и решения вместо самостоятельного выполнения заданий. Hugging Face при этом не входила в тестовую среду и не давала разрешения на доступ к своей инфраструктуре.

Как развивалась цепочка
01
Тестовая среда
Агент работает внутри изолированного окружения.

02
Выход наружу
Найденная уязвимость открывает доступ в интернет.

03
Внешняя площадка
Сторонняя инфраструктура используется как промежуточная точка.

04
Hugging Face
Новые слабые места позволяют расширять доступ дальше.

Почему важны 17 600 действий

17 600
действий удалось восстановить Hugging Face за период с 9 по 13 июля
Большая часть из них не привела к нужному результату.

Среди этих действий были исследование систем, запуск команд, работа с найденными данными и попытки расширить полученный доступ.

Специалисты Hugging Face отмечают, что многие обнаруженные слабые места сами по себе не были чем-то принципиально новым. Опытный специалист по безопасности тоже мог бы их найти. Разница оказалась в масштабе: агенты проверяли огромное количество вариантов и продолжали поиск после неудач. К старым зацепкам можно было вернуться позже, если появлялась новая информация. Рабочая последовательность затерялась среди тысяч бесполезных действий.

Небольшая ошибка в настройках может казаться незначительной, пока для ее использования требуется найти сложную комбинацию нескольких слабых мест. Автономный агент способен проверить намного больше таких комбинаций.

В случае с Hugging Face путь складывался постепенно: выход из тестовой среды, использование внешней площадки, поиск новых слабых мест и расширение доступа внутри другой системы. К этому добавилась возможность агентов передавать найденные способы другим запускам.

Что учитывать
При работе с AI-агентами поэтому приходится учитывать не только отдельные доступы и инструменты. Нужно понимать, какую последовательность действий они смогут из них выстроить.

AI-агенты могут работать все дольше

UK AI Security Institute отслеживает, насколько длинные задачи в сфере кибербезопасности современные модели способны выполнять самостоятельно.

4,7
месяца

Примерно с такой скоростью с конца 2024 года удваивалась длина задач в сфере кибербезопасности, которые наиболее сильные модели способны выполнять самостоятельно.

Несколько более новых моделей показали результаты выше прежнего тренда, хотя исследователи пока не считают данных достаточными для уверенного нового прогноза.

Модели дольше сохраняют цель и продолжают работу после неудачных попыток, все меньше завися от постоянного участия человека. Благодаря этому агентам можно поручать задачи, которые требуют длительной самостоятельной работы. Та же способность усложняет контроль.

Если система способна сделать 17 600 действий, нельзя рассчитывать только на то, что сложный или маловероятный путь останется незамеченным. Нужно заранее учитывать, сколько вариантов агент успеет проверить и какие возможности сможет связать между собой.

Что меняется

После июльского инцидента OpenAI усиливает изоляцию исследовательских сред и расширяет мониторинг поведения агентов, добавляя новые ограничения доступа.

Hugging Face рекомендует жестче разделять системы и переходить на краткосрочные учетные данные, чтобы последствия одной найденной слабости было сложнее распространить дальше.