Новый бенчмарк RAG-Safety-Bench выявил: RAG может ухудшать безопасность LLM
Исследователи представили тест для измерения влияния RAG на безопасность ответов, разделяя задачу на 4 условия: без RAG, с oracle-документом, с релевантными и случайными документами. Результаты на 5 open-source LLM показали, что baseline guardrails не работают в RAG-сценарии, а даже безвредные документы провоцируют unsafe-генерацию.