周围有一些数据结构非常有用,但大多数程序员都不知道。他们是哪一个?

每个人都知道链表、二叉树和散列,但比如Skip列表和Bloom过滤器。我想知道更多不太常见但值得了解的数据结构,因为它们依赖于伟大的想法,丰富了程序员的工具箱。

PS:我还对舞蹈链接等技术感兴趣,这些技术巧妙地利用了通用数据结构的财产。

编辑:请尝试包含更详细描述数据结构的页面链接。此外,试着补充几句关于数据结构为什么很酷的话(正如乔纳斯·Kölker已经指出的那样)。此外,尝试为每个答案提供一个数据结构。这将允许更好的数据结构仅根据其投票结果浮到顶部。


当前回答

您可以使用最小堆来在恒定时间内找到最小元素,或者使用最大堆来找到最大元素。但如果你想同时做这两项操作呢?可以使用“最小值-最大值”在恒定时间内执行这两个操作。它通过使用最小-最大排序来工作:在连续树级别之间交替进行最小和最大堆比较。

其他回答

Bloom过滤器:m位的位数组,最初全部设置为0。

要添加一个项,您可以通过k个哈希函数运行它,该函数将在数组中为您提供k个索引,然后将其设置为1。

要检查集合中是否有项目,请计算k个索引并检查它们是否都设置为1。

当然,这给出了一些误报的概率(根据维基百科,大约是0.61^(m/n),其中n是插入项目的数量)。假阴性是不可能的。

删除项是不可能的,但您可以实现计数布隆过滤器,由整数数组和递增/递减表示。

您可以使用最小堆来在恒定时间内找到最小元素,或者使用最大堆来找到最大元素。但如果你想同时做这两项操作呢?可以使用“最小值-最大值”在恒定时间内执行这两个操作。它通过使用最小-最大排序来工作:在连续树级别之间交替进行最小和最大堆比较。

PATRICIA-检索字母数字编码信息的实用算法,D.R.Morrison(1968)。

PATRICIA树与Trie相关。Tries的问题是,当密钥集稀疏时,即当实际密钥形成潜在密钥集的一个子集时,Trie中的许多(大多数)内部节点只有一个后代,这是非常常见的情况。这导致Trie具有较高的空间复杂性。

http://www.csse.monash.edu.au/~合金/瓷砖AlgdS/树/PATRICIA/

我喜欢缓存不可见的数据结构。其基本思想是以递归更小的块来布局树,以便许多不同大小的缓存可以利用适合它们的块。这导致了从RAM中的L1缓存到从磁盘读取的大块数据的所有缓存的高效使用,而无需了解任何缓存层的大小细节。

铲斗大队

它们在Apache中被广泛使用。基本上,它们是一个在环中围绕自身循环的链接列表。我不确定它们是否在Apache和Apache模块之外使用,但它们适合作为一种很酷但鲜为人知的数据结构。桶是一些任意数据的容器,桶大队是桶的集合。其思想是,您希望能够在结构中的任何点修改和插入数据。

假设您有一个bucket旅,其中包含一个html文档,每个bucket包含一个字符。您希望将所有<和>符号转换为&lt;并且&gt;实体。当您遇到<或>符号时,bucket旅允许您在旅中插入一些额外的bucket,以适应实体所需的额外字符。因为铲斗大队在一个环中,您可以向后或向前插入。这比使用简单的缓冲区要容易得多(在C语言中)。

关于铲斗大队的一些参考信息如下:

Apache Bucket旅参考

Buckets和Brigades简介