チャットボットにタイプするとき、意図以上に自分についての情報を開示してしまう可能性があります。メールのクリーニ依頼には自分の名前と同僚の名前が含まれ、医療費の質問には住所と口座番号が含まれます。あなたがタイプするすべては、確認できないリモートサーバーに送信されます。Rampartの核心的設計原理:プライバシーが保たれることが確実な個人情報は、あなたのデバイスを出たことがない情報だけです。
今日、Rampartは第一世代のデバイス内個人情報フィルタリングシステムとしてオープンソース化しました。SSNやID番号をキャッチするための正規表現層と、名前と住所をキャッチするためのMini LMを組み合わせています。PIIの削除は、通常、リモートサーバーを信頼するか、大きなバイナリをダウンロードする必要があります。これは、AIのプライバシー保証が almost impossible to verify であり、大多数のモデルが巨大で、恩恵を受けられるユーザーの範囲が窄まるという主要な課題を生み出します。
すべてはブラウザ内、メッセージをタイプして送信する間で行われ、サーバーはループに含まれません。モデルサイズは14.7MB、Web GPUでの実行時遅延は3.9ms、7言語における機密語のリコール率は98.4%です。メッセージがどこかに送られる前、2つのリーダーがデバイス上でメッセージをチェックします。構造化データ(SSNやクレジットカードなど)用の決定論的ルール層と、文脈をawareした名前と住所の赤塗りを行う小型言語モデルMini LMです。
Rampartは、AI4PrivacyのOpen PII 1.5Mデータセットと合成生成器で学習しました。30,000行の保持テストセットにおいて、Rampartは98.42%のリコール率を達成し、GLi NER small v2.1(94.2%)、Community BERT-small PII(81.5%)、Microsoft Presidio(65%)、AWS Bedrock Guardrails(63.8%)を上回しました。これは第一線の防衛として意図されたアルファ製品です。
主要エンティティ:企業:Open AI, AWS, Microsoft, AI4Privacy
出典: Hacker News · 要約:HeadlinesBriefing