HeadlinesBriefing favicon HeadlinesBriefing.com

AI代码注释检测器:准确率77%的新工具

Hacker News •
×

当我训练之前的AI评论分类器时,我使用了部分个人/私有数据来训练它,并且构建在不稳固的基础上,所以我无法分享代码或数据。我基于公共数据和更好的基础重建了它!

首先,你可能想试一试。你粘贴到那个网页上的任何内容都不会离开你的浏览器,所以你可以放心地用任何内容来测试它。我已经邀请了一些测试者试用早期版本,他们主要给出了正面反馈。我们不会像上一篇文章中分析Claude-ism那样分析机器人的语言习惯特征,因为在新分类器的界面中,你可以点击被分类文本的任何部分,查看哪些特征在该部分文本上激活,以及它们如何影响整体判断。

在性能方面,最主要的数字是77%的平衡准确率。这意味着在人类撰写和机器人生成的评论概率相等的情况下,分类器正确判断人类vs机器人的频率为77%。分类器还会输出一个经过校准的预测百分比,这意味着它可以被解读为任何特定判断正确的概率。我们通过校准曲线来测试这一点,该曲线显示分类器为一个已知概率的事件分配什么概率。由于所有点都非常接近参考对角线,我们知道它们大致是正确的。

当分类器非常自信时——例如置信度达到80%或更高——假阳性的风险降至5%。我还手动测试了一个较小的、非合成的、由人类和机器人撰写的真实世界评论样本,以观察分类器在样本外稍作泛化的表现。这转化为88%的准确率。当然,所有这些都只用代码注释进行了测试。该分类器并非为检测其他类型的机器人生成文本而构建。

FAQ:新AI代码注释分类器的平衡准确率是多少?

平衡准确率为77%,这意味着当两个类别出现概率相等时,它能正确判断人类vs机器人的概率为77%。