Jede Plugin-Listung im offiziellen Em Dash Plugin-Register wird nun vom Clef-Entscheidungsmodell von Cloudflare überprüft, bevor sie im Katalog erscheinen kann. Clef prüft die Listungsmetadaten, ausgehende Links, das Symbol und Screenshots auf Phishing, Identitätsdiebstahl, anstößige Inhalte, Betrug und Versuche, das Moderationssystem zu manipulieren. Das Register basiert auf AT Protocol, sodass Plugin-Autoren signierte Veröffentlichungen von ihren eigenen Konten aus veröffentlichen. Die automatisierte Moderation ermöglicht es Autoren, dieses offene Veröffentlichungsmodell beizubehalten, ohne den Katalog zu einer offenen Tür für Missbrauch zu machen.
Clef ist ein Entscheidungsmodell: Anstatt Prosa zu generieren, beantwortet es begrenzte Fragen mit typisierten Wahrscheinlichkeiten, auf die Anwendungscode reagieren kann. Wenn ein Plugin veröffentlicht wird, stellt der Em Dash Labeler Clef neun Fragen zu seinem Text und seinen Links, die explizite sexuelle Inhalte, hasserfüllte oder entmenschlichende Inhalte, grafische Gewalt, Phishing, Identitätsdiebstahl, Betrug, Spam, trügerische Links, irreführende Medien und Versuche, die Moderation zu manipulieren, abdecken. Acht entsprechende Fragen werden zu jedem Symbol und Screenshot gestellt. Ein Ergebnis von 0,45 oder höher sendet die Listung zur Überprüfung an einen Operator.
Die vorherige Moderationspipeline benötigte zwei Allzweckmodelle, die sich auf den Text einigen mussten, plus einen weiteren Durchlauf für Bilder. Laut Matt Kane, dem leitenden Betreuer von Em Dash, „Früher mussten wir eine Mischung von Modellen verwenden, um zuverlässige Ergebnisse zu erzielen, aber Clef hat sie alle geschlagen, während es viel schneller war.“ Bei drei Wiederholungen von 21 öffentlichen Text-Fixtures traf Clef in allen 63 Durchläufen die erwartete Entscheidung, mit einer Ende-zu-Ende-Textmoderationslatenz von 1,64 Sekunden bei p95. Die Änderung der Moderation fügt für Plugin-Autoren keinen neuen Schritt hinzu.
Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing