java – 为LSH Minhash算法生成随机哈希函数
内容导读
互联网集市收集整理的这篇技术教程文章主要介绍了java – 为LSH Minhash算法生成随机哈希函数,小编现在分享给大家,供广大互联网技能从业者学习和参考。文章包含955字,纯文字阅读大概需要2分钟。
内容图文
![java – 为LSH Minhash算法生成随机哈希函数](/upload/InfoBanner/zyjiaocheng/733/3ce2892bf0784f2589b1f5ffe6291f85.jpg)
我正在用Java编写一个minhashing算法,它要求我生成任意数量的随机散列函数(在我的情况下为240个散列函数),并通过它运行任意数量的整数(目前为2000).
为了做到这一点,我一直在为240个散列函数中的每一个生成随机数a,b和c(从1到2001的范围).然后,我的哈希函数返回h =((a * x)b)%c,其中h是返回值,x是通过它运行的整数之一.
这是随机散列的有效实现,还是有更常见/可接受的方式来实现它?
这篇文章提出了类似的问题,但我仍然对答案的措辞感到困惑:Minhash implementation how to find hash functions for permutations
解决方法:
几年前,当我使用Bloom过滤器时,我遇到了一篇文章,该文章描述了如何使用最少的代码非常简单地生成多个哈希函数.他描述的方法非常有效.见Less Hashing, Same Performance: Building a Better Bloom Filter.
基本思想是创建两个哈希函数,称之为h1和h2,然后使用以下公式模拟多个哈希函数g1到gk:
gi = h1(x) + i*h2(x)
我从1到k(你想要的散列函数的数量)变化.
即使你决定不实施他的想法,这篇论文也值得一读.虽然在阅读之后我无法想象不想实现它.它使我的Bloom过滤器代码更易于处理,并且不会对性能产生负面影响.
内容总结
以上是互联网集市为您收集整理的java – 为LSH Minhash算法生成随机哈希函数全部内容,希望文章能够帮你解决java – 为LSH Minhash算法生成随机哈希函数所遇到的程序开发问题。 如果觉得互联网集市技术教程内容还不错,欢迎将互联网集市网站推荐给程序员好友。
内容备注
版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 gblab@vip.qq.com 举报,一经查实,本站将立刻删除。
内容手机端
扫描二维码推送至手机访问。