HeadlinesBriefing favicon HeadlinesBriefing.com

Detector IA de comentarios de código: 77% exactitud

Hacker News •
×

Cuando entrené el clasificador anterior de comentarios IA, usé datos parcialmente personales/privados para hacerlo, y lo construí sobre una base algo inestable, así que no pude compartir el código ni los datos. ¡Lo reconstruí con datos públicos y una mejor base!

Primero, quizás quieras probarlo. Nada de lo que pegues en esa página web sale de tu navegador, así que puedes probarlo con seguridad con lo que quieras. He invitado a algunos evaluadores a probar una versión anterior, y dieron comentarios principalmente positivos. No desglosaremos los robotismos de la manera en que desglosamos los claudismos en el artículo anterior, porque en la interfaz del nuevo clasificador puedes hacer clic en cualquier parte del texto clasificado para ver qué características se activan en esa parte del texto y cómo contribuyen al juicio general.

En cuanto al rendimiento, el número principal es la precisión equilibrada del 77%. Esta es la frecuencia con la que el clasificador acierta el veredicto humano vs. robot, asumiendo que los comentarios escritos por humanos y generados por robots son igualmente probables. El clasificador también imprime un porcentaje predicho que está calibrado, lo que significa que puede leerse como la probabilidad de que cualquier veredicto específico sea correcto. Probamos esto a través de la curva de calibración, que muestra qué probabilidad asigna el clasificador a un evento con probabilidad conocida. Dado que todos los puntos están muy cerca de la diagonal de referencia, sabemos que son aproximadamente correctos.

Cuando el clasificador tiene mucha confianza, por ejemplo cuando la confianza es del 80% o más, el riesgo de un falso positivo baja al 5%. También he probado manualmente un conjunto más pequeño y no sintético de comentarios del mundo real de humanos y robots para ver qué tan bien se generaliza el clasificador ligeramente fuera de la muestra. Esto se traduce en una precisión del 88%. Por supuesto, todo esto se prueba solo con comentarios de código. El clasificador no está diseñado para detectar textos generados por robots de otros tipos.