Контролируемая автономность: guardrails для LLM-агентов

TechLead

Атаки

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Разработчики LLM/GenAI-приложений, ML/LLM-инженеры, LLMOps, MLSecOps, AISecOps, техлиды и CTO

Тезисы

При автоматизации бизнес-процессов с помощью LLM и мультиагентных систем ошибка модели может быстро превратиться в полноценный инцидент: от утечки персональных данных и обхода внутренних политик до выполнения опасных действий через tools и потери контроля над частью инфраструктуры. В докладе разберем ключевые риски LLM-приложений, почему их нельзя закрыть только промптами или дообучением модели и где проходит граница между безопасностью и полезностью системы.

Поговорим о guardrail-подходах на уровне архитектуры: контроле входов и выходов, работе с контекстом, black-box и white-box методах, фильтрах и классификаторах, а также защите агентных сценариев. Отдельно разберем, как валидировать защитные слои: использовать открытые бенчмарки, интерпретировать ASR и FPR и собирать собственный тестовый набор под конкретный домен.

В завершение рассмотрим, как собрать базовый guardrail-контур на open-source решениях, оценить его ограничения и понять, насколько такой защите можно доверять в реальном продукте.

ML-инженер, ведет разработку Guardrail-системы в HiveTrace

Видео

Другие доклады секции

TechLead