📰 IT Дайджест

#moderation

4 материала

2. Mistral выпустила Shieldstral: 3B-модель для модерации контента, работающая без переобучения

Shieldstral — 3B open-weights классификатор безопасности, который принимает политику модерации в виде plain-language вопроса прямо на инференсе. Модель обрабатывает текст и изображения, не требует переобучения под новые категории, работает на одной 16GB NVIDIA GPU. Релиз под Apache 2.0.

mistral.ai · #ai #llm #mistral #moderation #safety

10. Вопрос на HN: помечать ли статьи, написанные ИИ

На Hacker News спорят, нужна ли отдельная метка для AI-generated articles, чтобы люди могли просто пропускать такой текст. Автор треда отдельно уточняет, что это не должен быть обычный флаг с понижением в выдаче — скорее индикатор, как предупреждение на упаковке. И да, вопрос уже упирается не в техническую возможность, а в то, как сильно всем надоело читать одинаково гладкий машинный prose.

news.ycombinator.com · #drama #ai-flagging #ask-hn #moderation

9. В Lobsters спорят, надо ли банить посты, написанные LLM

В обсуждении предлагают считать LLM-generated submissions нарушением правил и даже банить постоянных авторов такого добра. Ещё одна идея — предупреждение прямо на форме сабмита, чтобы люди не делали вид, будто это нормальный способ постить статьи и устраивать вечный спор о «качестве контента».

lobste.rs · #drama #llm #moderation #policy

12. arXiv начнет банить тех, кто грузит AI-галлюцинации как препринты

Ars Technica сообщает о новой политике arXiv: модераторы готовы банить авторов, которые системно присылают AI-generated hallucinations. Формулировка уже почти мемная, но проблема реальная — препринт-серверу надо как-то отсеивать тексты, которые написала не наука, а очень уверенный чатбот.

arstechnica.com · #drama #ai-generated #arxiv #hallucinations #moderation #policy