Cada listado de complementos en el registro oficial de complementos de Em Dash ahora es examinado por el modelo de decisión Clef de Cloudflare antes de que pueda aparecer en el catálogo. Clef revisa los metadatos del listado, enlaces salientes, icono y capturas de pantalla en busca de phishing, suplantación de identidad, contenido ofensivo, estafas e intentos de manipular el sistema de moderación. El registro está construido sobre AT Protocol, por lo que los autores de complementos publican versiones firmadas desde sus propias cuentas. La moderación automatizada permite a los autores mantener ese modelo de publicación abierto sin convertir el catálogo en una puerta abierta al abuso.
Clef es un modelo de decisión: en lugar de generar prosa, responde preguntas acotadas con probabilidades tipadas sobre las que el código de la aplicación puede actuar. Cuando se publica un complemento, el etiquetador de Em Dash hace a Clef nueve preguntas sobre su texto y enlaces, que cubren contenido sexual explícito, contenido odioso o deshumanizante, violencia gráfica, phishing, suplantación de identidad, estafas, spam, enlaces engañosos, medios engañosos e intentos de manipular la moderación. Se hacen ocho preguntas correspondientes sobre cada icono y captura de pantalla. Un resultado de 0.45 o superior envía el listado a un operador para su revisión.
El proceso de moderación anterior necesitaba que dos modelos de propósito general coincidieran en el texto, más otra pasada para las imágenes. Según Matt Kane, mantenedor principal de Em Dash, "Anteriormente teníamos que usar una mezcla de modelos para obtener resultados fiables, pero Clef los superó a todos, siendo mucho más rápido." En tres repeticiones de 21 casos de prueba de texto públicos, Clef tomó la decisión esperada en las 63 ejecuciones, con una latencia de moderación de texto de extremo a extremo de 1.64 segundos en p95. El cambio de moderación no añade un nuevo paso para los autores de complementos.
Fuente: Hacker News · Resumido por HeadlinesBriefing