当您在聊天机器人中输入信息时,可能会无意中泄露更多个人信息。一封清理邮件的请求可能包含您的姓名和同事的姓名;一张医疗账单的问题可能包含您的地址和账号。您输入的所有内容都会传输到您无法检查的远程服务器。Rampart的核心设计原则是:唯一能确保私密的个人信息是那些从未离开您设备的信息。
今天,Rampart作为第一代设备端个人信息过滤系统开源。它结合了使用正则表达式的确定性层来捕获社保号和身份证号,以及Mini LM来捕获姓名和街道地址。进行PII删除通常意味着信任远程服务器或下载大型二进制文件,这带来了关键挑战:AI隐私保证几乎无法验证,而且大多数模型都非常庞大,缩小了能够受益的用户群体。
所有操作都在浏览器中进行,在输入消息和发送消息之间;没有服务器参与。模型大小为14.7MB,Web GPU上的运行时延迟为3.9ms,七种语言的私密术语召回率为98.4%。在消息发送之前,两个读取器会在您的设备上查看它:一个用于结构化数据(如社保号和信用卡)的确定性规则层,以及一个用于上下文感知姓名和地址脱敏的小型语言模型Mini LM。
Rampart在AI4Privacy的Open PII 1.5M数据集和合成生成器上进行训练。在30,000行的保留测试集上,Rampart的召回率达到了98.42%,超过了GLi NER small v2.1(94.2%)、Community BERT-small PII(81.5%)、Microsoft Presidio(65%)和AWS Bedrock Guardrails(63.8%)。它是一个作为第一道防线的alpha产品。
关键实体:公司:Open AI、AWS、Microsoft、AI4Privacy
FAQ:Rampart如何确保个人信息从未离开设备?
Rampart在浏览器中,在输入和发送之间执行所有过滤,使用确定性正则表达式层处理结构化数据,使用Mini LM处理上下文感知的姓名和地址脱敏,不涉及任何服务器。
来源: Hacker News · 由HeadlinesBriefing整理摘要