Классический сигнатурный подход к обнаружению вредоносного ПО устарел, а эффективность ИИ-моделей для анализа файлов напрямую зависит от качества обучающих датасетов — сбалансированных наборов вредоносных и чистых образцов, а не размера общей базы сигнатур. Разбираемся, зачем компаниям нужны антивирусные лаборатории.
Самые частые вопросы, которые звучат на созвонах и личных встречах по Рекрипториуму, выглядят так:
Вопрос №1: «Сколько человек в антивирусной лаборатории “Рекрипт”?»
Вопрос №2: «Сколько вредоносов в базе?»
Очевидно, стоит ответить на эти вопросы более развернуто. Но прежде, хочется прояснить, зачем вообще нужна антивирусная лаборатория. Приведём несколько исследований.
Недавнее исследование, проведенное Массачусетским технологическим институтом и компанией Safe Security, выявило шокирующую статистику: 80% атак с использованием программ-вымогателей теперь основаны на искусственном интеллекте.
Количество атак с использованием ИИ увеличилось на 89%, время проникновения сократилось до 29 минут. Активно используются базирующиеся на ИИ инструменты и платформы для разработки». Глобальный отчет CrowdStrike об угрозах за 2026 год.
Согласно отчету, число жертв программ-вымогателей выросло на 389 % по сравнению с прошлым годом, при этом киберпреступники используют искусственный интеллект для масштабирования атак. По данным компании, искусственный интеллект используется для автоматизации и совершенствования кибератак, что способствует росту их количества и эффективности». Fortinet, подробности по ссылке.
Мы, как и многие другие, совершенно явно видим тенденцию к использованию ИИ-инструментария для проведения атак, включая автоматическую генерацию вредоносного кода. Это успешно сочетается с традиционными техниками обфускации, мимикрии, anti-sandboxing и прочими видами маскировки вредоносов. Мы уже писали про Payload Pipeline, когда каждой жертве достаётся свой автоматически сгенерированный уникальный экземпляр вредоносного ПО.
Совершенно очевидно, что классический сигнатурный подход к обнаружению малвари изжил себя — нужны другие методы защиты, отвечающие современным угрозам.
Устоявшийся мировой тренд — использование ИИ, в том числе для анализа файлов. Но чтобы ИИ работал эффективно, его нужно разрабатывать и обучать в соответствии с актуальными угрозами. А значит, нужны качественные размеченные наборы данных — датасеты.
Когда речь идёт об анализе файлов, датасеты должны содержать сотни тысяч и миллионы разнообразных вредоносных и чистых образцов, и под каждый тип файлов нужен свой — сбалансированный и качественно размеченный. Датасет — это не полдела. Это 80% дела: именно от него зависит 80% успеха или провала модели.
Подробно рассказывали об этом на нашей онлайн-лекции на Неделе прикладной безопасности в МИФИ — там же объясняли, почему публичные датасеты подходят разве что для научных исследований и публикаций, но никак не для обучения продовых моделей ИИ.
Из этого следует, что цель собрать всю малварь и положить её в базу — бессмысленна. Хотя, конечно, есть вредоносы и инструменты двойного назначения вроде RAT, которые иметь в базе необходимо (и они у нас там есть). Вместо создания огромной базы сигнатур ключевую важность приобретает формирование качественных датасетов — включающих в себя и чистые файлы, собирать которые не сильно проще, чем вредоносы.