一、问题

给定a、b两个文件,各存放50亿个url,每个url各占64字节,内存限制是4G,让你找出a、b文件共同的url?

二、分析

50亿个url,每个url 64字节:

一共需要 50亿 × 64字节 ÷ 1024 ÷ 1024 ÷ 1024 = 298G ≈ 300G ,显然无法一次读入内存的。因此这里采用将大文件切割的分治法

假设将每个大文件分割为1000个小文件,那么每个小文件大小为:300G ÷ 1000 × 1024 = 307M ≈ 300M,所以同时加载两个文件则需要 300M × 2 = 600M

三、方案

  1. 分治法 + 哈希取模法
  2. 使用布隆过滤器(允许一定错误率的情况下进行快速查找)

方案1:分治法 + 哈希取模法

  1. 将a、b 两个文件,用相同的哈希函数(把url换成数字的话,哈希函数更容易构造),分解为1000个独立哈希值相同的小文件
  2. 哈希值相同的url必然在序号对应的文件中,因此只要在序号对应的两个文件中进行url的相互匹配即可
  3. 比较每对序号对应的小文件时,可以使用hash_set
    在这里插入图片描述

方案2:布隆过滤器

参考:CSDN文章

利用布隆过滤器的特性,在允许一定错误率的情况下,可以快速判断一个元素是否在一个集合中,适用于在有限内存内处理大量数据。

  1. 先遍历文件a,将其中的url逐一填充到布隆过滤器中
  2. 再遍历文件b,判断其中的url是否在布隆过滤器当中
    注意:布隆过滤器,只能判断某数据一定不存在,不能判断其一定存在,存在误差。
Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐