Каждый список плагинов в официальном реестре плагинов Em Dash теперь проверяется моделью принятия решений Clef от Cloudflare, прежде чем он сможет появиться в каталоге. Clef проверяет метаданные списка, исходящие ссылки, иконку и скриншоты на предмет фишинга, выдачи себя за другое лицо, оскорбительного контента, мошенничества и попыток манипулирования системой модерации. Реестр построен на AT Protocol, поэтому авторы плагинов публикуют подписанные релизы со своих собственных аккаунтов. Автоматизированная модерация позволяет авторам сохранять эту открытую модель публикации, не превращая каталог в открытую дверь для злоупотреблений.
Clef — это модель принятия решений: вместо генерации текста она отвечает на ограниченные вопросы с типизированными вероятностями, на которые может реагировать код приложения. Когда плагин публикуется, маркировщик Em Dash задает Clef девять вопросов о его тексте и ссылках, охватывающих откровенный сексуальный контент, ненавистнический или дегуманизирующий контент, графическое насилие, фишинг, выдачу себя за другое лицо, мошенничество, спам, обманные ссылки, вводящие в заблуждение медиа и попытки манипулирования модерацией. Восемь соответствующих вопросов задаются о каждой иконке и скриншоте. Результат 0,45 или выше отправляет список оператору на проверку.
Предыдущий конвейер модерации требовал согласия двух моделей общего назначения по тексту, плюс еще один проход для изображений. По словам Мэтта Кейна, ведущего разработчика Em Dash, "Раньше нам приходилось использовать смесь моделей для получения надежных результатов, но Clef превзошел их все, будучи при этом намного быстрее." В трех повторах 21 публичного текстового теста Clef принял ожидаемое решение во всех 63 запусках, с задержкой сквозной модерации текста 1,64 секунды на уровне p95. Изменение модерации не добавляет нового шага для авторов плагинов.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing