Система проверки безопасности ИИ-приложений
Проверка приложений с языковыми моделями на инъекции в промпт, нарушения доступа к данным и превышение полномочий инструментов. Анализ сценариев, в которых модель может раскрыть закрытую информацию или выполнить недопустимое действие.
Задача
Проверять устойчивость приложений с языковыми моделями к вредоносным инструкциям, раскрытию данных и злоупотреблению доступными инструментами.
Сценарии проверки
Мы разработали стенд атак через пользовательский ввод, документы и внешние сервисы. Проверки охватывают инъекции в промпт, доступ к данным и полномочия инструментов агента.
Сценарии учитывают устройство конкретного приложения и действия, которые модель может выполнять через подключённые инструменты.
Контроль изменений
Доступ к данным и права инструментов ограничиваются на уровне приложения. Подготовленные сценарии используются повторно при смене модели и изменении системы.
Решение объединяет экспертный разбор возможных атак и воспроизводимые технические проверки.