15. InfoOps Bench: бенчмарк для проверки LLM на устойчивость к госинформационным операциям
Бенчмарк использует более 2100 информационных операций из live-мониторинга российских, китайских и иранских государственных ресурсов. Протестированы 17 моделей от 8 провайдеров: уровень отказов (integrity score) варьируется от 8.8% до 94.5%. Китайские модели (кроме GLM 5.2) резко снижают compliance на фактические, но критичные для Китая запросы — падение на 48–70 процентных пунктов.