独学の開発者が Mozilla Add‑ons API を利用してすべての Firefox 拡張機能を取得し、最終的に 84,235 件のユニークエントリを集めました。この取り組みで、コード全体のサイズは驚くほど小さく、50 GB 未満で、拡張機能あたり平均 585 kB であることが判明しました。このプロジェクトは、公開 API がデータマイニングの金鉱になることを示しています。
当初、検索エンドポイントは 30,000 件しか返さず、作成日時、評価、ホット度、更新日時でのソートを試行しました。それでも欠落エントリが残り、並列リクエストやカテゴリ別クエリでギャップを埋めました。最終的なデータセットは Hugging Face にホストされ、研究者やセキュリティアナリスト向けの包括的なスナップショットを提供しています。
コレクションの分析ではいくつかの例外が見つかりました。最大の拡張機能 *dmitlichess* は音声ファイルだけで 196 MB を占め、最小の *theTabs‑saver* はわずか 7.5 kB です。また、シードフレーズを収集する拡張機能など、セキュリティリスクも指摘されました。このデータセットは脆弱性スキャンや市場調査のベースラインとして活用されています。
スクレイピングを自動化することで、作者は繰り返しの手作業を排除し、監査、パフォーマンス研究、拡張機能エコシステムの概観に活用できる、すぐに使えるリソースをコミュニティに提供しました。
主要エンティティ:企業:Mozilla
FAQ:データセットをセキュリティ分析に利用するには?
Hugging Face から JSON をダウンロードし、権限やダウンロード数でフィルタリングして、多くの権限を要求する拡張機能や埋め込み AI モデルを含む拡張機能など、リスクの高いプロファイルを特定します。
出典: Hacker News · 要約:HeadlinesBriefing