Ещё раз об инциденте с OpenAI или как ИИ меняет ИБ

Ещё раз об инциденте с OpenAI или как ИИ меняет ИБ
05.10.2026 AI

Большинство соцсетей заполнены однотипной информацией по поводу расшалившегося ИИ — в частности, вокруг недавних инцидентов с закрытыми моделями OpenAI, о чём мы писали ранее. Но иногда в этом информационном потоке всплывают действительно интересные вещи, на которые, на наш взгляд, стоит обратить внимание.

Одна из таких вещей — пост в запрещённой в России соцсети X человека с никнеймом @joedaroo, занимавшегося на момент публикации безопасностью агентов в OpenAI. Пост весьма эмоционален и озаглавлен «Its not just the f*cking sandbox».

Нам всем знакома костность отрасли информационной безопасности — со сложившимися правилами, отношениями, регламентами, подходами. Всё привычно, степенно, неторопливо, с оглядкой на авторитетов и лидеров отрасли. И в эту идиллию врывается ИИ, который, как мы говорили ещё практически 2 года назад, научился атаковать, искать уязвимости, писать код и много чему ещё, которому безразличны регламенты, правила, авторитеты и лидеры.

Речь не просто об ускорении процессов на порядки, что само по себе уже весьма тревожный фактор для безопасников, но и о взрывном росте объёмов данных, и об изменении порога входа, и, конечно, о появлении новых поверхностей атак. По сути, сейчас мы наблюдаем процесс трансформации всей отрасли информационной безопасности: слом старых подходов, устоев, регламентов, бизнес-процессов и появление новых.

Автор поста находится на острие этих процессов — формирует подходы к обеспечению ИБ при обучении передовых LLM. Это совершенно новая область ИБ, где старые подходы попросту не работают, а новые только формируются. Автор рассказывает, почему первые приходящие на ум советы бесполезны, и приоткрывает завесу над тем, как далеко на самом деле всё зашло. Публикацию легко найти по никнейму автора. Приведём несколько цитат.

Теперь, чтобы понять, почему это не так просто, как «просто поместить в песочницу», нужно разобраться в том, как происходит обучение и оценка в средах обучения с подкреплением. Обычно во время обучения с подкреплением модели ставится какая-то задача или цель, предоставляется среда для выполнения этой задачи, а затем оцениваются ее действия и результаты. Как при обучении, так и при оценке есть дополнительные этапы, такие как проведение тестов, сбор результатов, сброс или реконфигурация среды между прогонами, а также обратное распространение ошибки во время обучения. Все это происходит в потенциально десятках тысяч различных запусков в масштабах, которые трудно представить — мы имеем дело буквально с петабайтами данных.

Важно понимать, что, когда мы оптимизируем модель для «хорошего» выполнения задачи, окружающая среда должна отражать те аспекты реального мира, которые важны для выполнения этой задачи. Для этого нужны правильные инструменты, соответствующие системные ограничения и значимая обратная связь, которая покажет, действительно ли модель справилась с задачей. Кроме того, модель должна получать достаточно разнообразный опыт, чтобы учиться не только в рамках одной конкретной ситуации. Это не значит, что, чем реалистичнее модель, тем она лучше будет работать, но, если упустить важные аспекты задачи, модель может научиться поведению, которое не сработает в реальном мире.

Для моделей может потребоваться любое сочетание динамических вычислений, доступа к сети, возможности вызывать инструменты (а их могут быть сотни!), возможности загружать пакеты, запускать подпроцессы, создавать подзадачи (даже на других компьютерах), выходить в интернет, использовать графический интерфейс компьютера и многое другое в самых разных областях. Кроме того, тысячи исследователей создают эти среды, модифицируют их, добавляют инструменты, меняют зависимости и пробуют что-то новое. Эксперименты — это и есть суть исследования.

Модели создаются и «дорабатываются» постепенно в ходе сотен тысяч запусков множества пользовательских задач. И каждое изменение в одной из этих тысяч сред может повлиять на предположения, которые вы сделали при обеспечении безопасности среды. Вам нужны средства контроля, которые будут работать, даже если люди что-то меняют, а также исследователи, которые понимают, когда изменение требует дополнительной проверки безопасности. Любой, кто занимался обеспечением безопасности в крупной исследовательской или инженерной организации, знает, сколько это требует усилий, а масштабы с каждым днем становятся все больше.

Добавьте сюда задачу удерживать модель в рамках задачи и ограничений — то, что подразумевается под «согласованностью». Нужно учитывать множество вариантов поведения моделей и решать, как реагировать, если модель отклоняется от задачи или делает что-то «плохое». Для этого нужны сложные политики и датчики, оценивающие согласованность на всём пути — в и без того сложной среде. И поверх всего этого — модели, чьи возможности начинают превосходить человеческие.

Когда исследователи в области ИИ беспокоятся о том, что что-то может пойти не так, отчасти это связано с тем, что в этой сложной системе слишком много переменных. Поэтому, если вы обучаете передовую модель, вам нужно подумать обо всем этом. Вам нужно подумать о том, как изолировать модель в этой очень сложной среде, сохранив при этом доступ к инструментам, интернету (если это применимо к задаче) и т. д. Кроме того, нужно задаться вопросом: как отслеживать и понимать, что делает модель в потенциально тысячах параллельных сред; и как прервать траекторию, если что-то пошло не так?

Больше публикаций
Новости
22.09.2026

Интеграция платформы Рекрипториум с HoneyCorn

Интеграция системы Honeypot & Deception HoneyCorn с ИИ-платформой для анализа файлов Рекрипториум превращает систему обнаружения угроз в полноценный автоматизированный комплекс по перехвату, анализу и классификации вредоносного ПО.

Подробнее
Новости
15.09.2026

«Рекрипт» открыл исследовательскую лабораторию в кампусе КФ МГТУ им. Н.Э. Баумана

Компания «Рекрипт» заключила соглашение о сотрудничестве с Калужским филиалом МГТУ им. Н.Э. Баумана для создания исследовательской лаборатории на территории кампуса университета.

Подробнее
AI Research • Threat Detection • Reverse Engineering • Malware Analysis • NLP • Enterprise Systems • SmartApps • File Analysis AI Research • Threat Detection • Reverse Engineering • Malware Analysis • NLP • Enterprise Systems • SmartApps • File Analysis AI Research • Threat Detection • Reverse Engineering • Malware Analysis • NLP • Enterprise Systems • SmartApps • File Analysis