同一份合同在「下载」「桌面」「归档」存了三份;微信保存的照片和相册里的原片长得一模一样;当年下载的电影后来又下载了一遍。重复文件是磁盘空间的第一大杀手,但「找重复」这件事,工具选错了比不找还糟。
文件名是最不可靠的判重依据:
正确做法是内容指纹(hash):对文件的全部字节计算指纹,内容完全一致 → 指纹一致。名字随便改,指纹骗不了人。
字节级一致。工具很多:免费的有 dupeGuru、AllDup、TreeSize。用 hash 扫描全盘,几万文件几分钟出结果,安全删除前保留一份即可。Windows PowerShell 也能凑合:Get-FileHash 按目录分组找相同指纹。
同一场景拍了五连拍、不同分辨率的同款图、加了水印的转发图——hash 不一样,肉眼是「差不多」。这类重复靠感知哈希(pHash,比较图像外观特征)识别。dupeGuru 的图片模式支持;注意这类删除前一定肉眼确认,感知相似≠真重复。
同一部电影的 720p/1080p/4K 版本,hash 完全不同、时长几乎一致。判断依据是「时长+分辨率+码率」组合特征。这类与其说判重,不如说是多版本管理——留画质最好的那个(参见我们的另一篇:多版本画质判断)。
最稳的做法是先删进回收站观察一周,而不是彻底粉碎。空间不急在一时。
数字管家的重复识别做三层:字节级、感知级、版本级——改名的、连拍的、多版本的都各归各组。
免费下载,本地运行。先看看那几百 GB 里,有多少是白占地方的。