一位自学成才的开发者利用 Mozilla 插件 API 抓取了所有 Firefox 扩展,最终得到 84,235 条唯一记录。该工作揭示了一个出乎意料的小型目录——代码总量不足 50 GB,平均每个插件约 585 kB。该项目展示了公共 API 如何成为数据挖掘的金矿。
最初,搜索端点仅返回 30,000 条结果,迫使作者尝试按创建时间、评分、热度和更新时间进行排序。即便如此,仍有缺失的条目,直到通过并行请求和按类别的特定查询填补空白。最终数据集已托管在 Hugging Face 上,为研究人员和安全分析师提供了完整的快照。
对收集的数据进行分析后发现了一些异常值:最大的插件 *dmitlichess* 含有 196 MB 的音频文件,而最小的 *theTabs‑saver* 仅有 7.5 kB。研究还指出了安全风险,发现若干扩展会收集种子短语。该数据集现已成为漏洞扫描和市场研究的基准。
通过自动化抓取,作者消除了重复的手动工作,并为社区提供了一个可直接使用的资源,可用于审计、性能研究以及扩展生态系统概览。
关键实体:公司:Mozilla
常见问题:如何将数据集用于安全分析?
从 Hugging Face 下载 JSON 文件,然后按权限或下载次数过滤,以识别具有高风险特征的扩展,例如请求大量权限或包含嵌入式 AI 模型的插件。
来源: Hacker News · 由HeadlinesBriefing整理摘要