📰 IT Дайджест

#rag

2 материала

14. Новый бенчмарк RAG-Safety-Bench выявил: RAG может ухудшать безопасность LLM

Исследователи представили тест для измерения влияния RAG на безопасность ответов, разделяя задачу на 4 условия: без RAG, с oracle-документом, с релевантными и случайными документами. Результаты на 5 open-source LLM показали, что baseline guardrails не работают в RAG-сценарии, а даже безвредные документы провоцируют unsafe-генерацию.

tldr.takara.ai · #ai #llm #rag #safety #security

10. Mistral Agentic Search: многошаговый поиск с точностью до 86% на FinanceBench

Mistral представила Agentic Search — retrieval-слой с пятью инструментами (search, open, navigate, read, grep). На FinanceBench точность выросла с 26,7% до 86%, на OfficeQA Pro — с 6,3% до 51,9%. P90 latency снижена до 39,6%, токенов тратится на треть меньше.

mistral.ai · #ai #mistral #rag #search