服务器之家:专注于服务器技术及软件下载分享
分类导航

PHP教程|ASP.NET教程|Java教程|ASP教程|编程技术|正则表达式|C/C++|IOS|C#|Swift|Android|VB|R语言|JavaScript|易语言|vb.net|

服务器之家 - 编程语言 - Java教程 - Java 如何校验两个文件内容是相同的?

Java 如何校验两个文件内容是相同的?

2021-12-01 22:59码农小胖哥 Java教程

等合并代码的时候发现这位同学居然用文件名称相同和文件大小相同作为两个文件相同的依据。这种条件判断靠谱吗?

Java 如何校验两个文件内容是相同的?

今天做文件上传功能,需求要求文件内容相同的不能重复上传。感觉这个需求挺简单的就交给了一位刚入行的新同学。等合并代码的时候发现这位同学居然用文件名称相同和文件大小相同作为两个文件相同的依据。这种条件判断靠谱吗?

从概率上来说遇到两个文件名称和大小都一样的概率确实太小了。这种判断放在生产环境中也可以稳定的跑上一阵子,不过即使再低的可能性也是有可能的,如果能做到100%就好了。

文件摘要校验

我相信同学们都下载过一些好心人开发的小工具,有些小工具会附带一个校验器让你校验附带提供的checksum值,防止有人恶意篡改小工具,保证小工具可以放心使用。

Java 如何校验两个文件内容是相同的?

文件Hash校验

如果两个文件的内容相同,那么它们的摘要应该是相同的。这个原理能不能帮助我们鉴定两个文件是否相同呢?

Java实现文件摘要

带着这个疑问,我写了一个文件摘要提取工具类:

  1. /**
  2. * 提取文件 checksum
  3. *
  4. * @param path 文件全路径
  5. * @param algorithm 算法名 例如 MD5、SHA-1、SHA-256等
  6. * @return checksum
  7. * @throws NoSuchAlgorithmException the no such algorithm exception
  8. * @throws IOException the io exception
  9. */
  10. public static String extractChecksum(String path, String algorithm) throws NoSuchAlgorithmException, IOException {
  11. // 根据算法名称初始化摘要算法
  12. MessageDigest digest = MessageDigest.getInstance(algorithm);
  13. // 读取文件的所有比特
  14. byte[] fileBytes = Files.readAllBytes(Paths.get(path));
  15. // 摘要更新
  16. digest.update(fileBytes);
  17. //完成哈希摘要计算并返回特征值
  18. byte[] digested = digest.digest();
  19. // 进行十六进制的输出
  20. return HexUtils.toHexString(digested);
  21. }

接下来做几组对照试验来证明猜想。

内容不变

首先要证明一个文件在内容不变的情况下摘要是否有变化,多次执行下面的代码,断言始终都是true。

  1. String path = "C:\\Users\\s1\\IdeaProjects\\demo\\src\\main\\resources\\application.yml";
  2. String checksum = extractChecksum(path, "SHA-1");
  3. String hash = "6bf4d6c101b4a7821226d3ec1f8d778a531bf265";
  4. Assertions.assertEquals(hash,checksum);

而且我把文件名改成application-dev.yml,甚至application-dev.txt摘要都是相同的。我又把yml文件的内容作了改动,断言就false了。这证明了单个文件的情况下,内容不变,hash是不变的。

文件复制

我把yml文件复制了一份,改了文件名称和类型,不改变内容并存到了另一个目录中,来测试一下它们的摘要是否有变化。

  1. String path1 = "C:\\Users\\s1\\IdeaProjects\\demo\\src\\main\\resources\\application.yml";
  2. String path2 = "C:\\Users\\s1\\IdeaProjects\\demo\\src\\main\\resources\\templates\\application-dev.txt";
  3. String checksum1 = extractChecksum(path1, "SHA-1");
  4. String checksum2 = extractChecksum(path2, "SHA-1");
  5. String hash = "6bf4d6c101b4a7821226d3ec1f8d778a531bf265";
  6. Assertions.assertEquals(hash,checksum1);
  7. Assertions.assertEquals(hash,checksum2);

结果断言通过,不过改变了其中一个文件的内容后断言就不通过了。

新建空文件

这里的新建空文件指的是没有进行任何操作的新建的空文件。

新建的空文件会根据特定的算法返回一个固定值,比如SHA-1算法下的空文件值是:

  1. da39a3ee5e6b4b0d3255bfef95601890afd80709

结论

通过实验证明了:

在相同算法下,任何新建空文件的摘要值都是固定的。

任何两个内容相同的文件的摘要值都是相同的,和路径、文件名、文件类型无关。

文件的摘要值会随着文件内容的改变而改变。

文件摘要运用

根据上面的结论,文件摘要是可以防止同样内容的文件重复提交的, 存储的时候不但要存储文件的路径,还要存储文件的摘要值,可能需要注意新建空文件的的固定摘要问题。另外在Java12中提供了新的API来处理文件内容重复问题,有兴趣的可以研究一下。文件摘要除了防篡改和去重之外,你知道还有其它什么用途吗?欢迎同学们留言讨论。

原文链接:https://mp.weixin.qq.com/s/hOQ-AuyYrhMjHgdaDx3JGg

延伸 · 阅读

精彩推荐
  • Java教程升级IDEA后Lombok不能使用的解决方法

    升级IDEA后Lombok不能使用的解决方法

    最近看到提示IDEA提示升级,寻思已经有好久没有升过级了。升级完毕重启之后,突然发现好多错误,本文就来介绍一下如何解决,感兴趣的可以了解一下...

    程序猿DD9332021-10-08
  • Java教程Java实现抢红包功能

    Java实现抢红包功能

    这篇文章主要为大家详细介绍了Java实现抢红包功能,采用多线程模拟多人同时抢红包,文中示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙...

    littleschemer13532021-05-16
  • Java教程小米推送Java代码

    小米推送Java代码

    今天小编就为大家分享一篇关于小米推送Java代码,小编觉得内容挺不错的,现在分享给大家,具有很好的参考价值,需要的朋友一起跟随小编来看看吧...

    富贵稳中求8032021-07-12
  • Java教程xml与Java对象的转换详解

    xml与Java对象的转换详解

    这篇文章主要介绍了xml与Java对象的转换详解的相关资料,需要的朋友可以参考下...

    Java教程网2942020-09-17
  • Java教程20个非常实用的Java程序代码片段

    20个非常实用的Java程序代码片段

    这篇文章主要为大家分享了20个非常实用的Java程序片段,对java开发项目有所帮助,感兴趣的小伙伴们可以参考一下 ...

    lijiao5352020-04-06
  • Java教程Java8中Stream使用的一个注意事项

    Java8中Stream使用的一个注意事项

    最近在工作中发现了对于集合操作转换的神器,java8新特性 stream,但在使用中遇到了一个非常重要的注意点,所以这篇文章主要给大家介绍了关于Java8中S...

    阿杜7482021-02-04
  • Java教程Java使用SAX解析xml的示例

    Java使用SAX解析xml的示例

    这篇文章主要介绍了Java使用SAX解析xml的示例,帮助大家更好的理解和学习使用Java,感兴趣的朋友可以了解下...

    大行者10067412021-08-30
  • Java教程Java BufferWriter写文件写不进去或缺失数据的解决

    Java BufferWriter写文件写不进去或缺失数据的解决

    这篇文章主要介绍了Java BufferWriter写文件写不进去或缺失数据的解决方案,具有很好的参考价值,希望对大家有所帮助。如有错误或未考虑完全的地方,望...

    spcoder14552021-10-18