周围有一些数据结构非常有用,但大多数程序员都不知道。他们是哪一个?

每个人都知道链表、二叉树和散列,但比如Skip列表和Bloom过滤器。我想知道更多不太常见但值得了解的数据结构,因为它们依赖于伟大的想法,丰富了程序员的工具箱。

PS:我还对舞蹈链接等技术感兴趣,这些技术巧妙地利用了通用数据结构的财产。

编辑:请尝试包含更详细描述数据结构的页面链接。此外,试着补充几句关于数据结构为什么很酷的话(正如乔纳斯·Kölker已经指出的那样)。此外,尝试为每个答案提供一个数据结构。这将允许更好的数据结构仅根据其投票结果浮到顶部。


当前回答

球树。只是因为它们让人傻笑。

球树是索引度量空间中的点的数据结构。这是一篇关于构建它们的文章。它们通常用于查找点的最近邻居或加速k均值。

其他回答

向左倾斜的红黑树。罗伯特·塞奇威克(Robert Sedgewick)于2008年发表的红黑树的一个显著简化的实现(大约是要实现的代码行的一半)。如果您在红黑树的实现方面遇到过困难,请阅读此变体。

与安德森树非常相似(如果不是完全相同)。

霍夫曼树-用于压缩。

DAWG是一种特殊的Trie,其中类似的子树被压缩为单亲。我扩展了修改后的DAWG,并提出了一个漂亮的数据结构ASSDAWG(Anagram Search Sorted DAWG)。这种工作方式是,每当将字符串插入DAWG时,首先对其进行桶排序,然后插入,叶节点保存一个额外的数字,指示如果我们从根到达该叶节点,哪些排列是有效的。这有两大优点:

由于我在插入之前对字符串进行排序,并且DAWG自然会折叠类似的子树,所以我得到了高级别的压缩(例如,“吃”、“吃”和“茶”都变成了一条路径a-e-t,在叶节点处有一个数字列表,指示a-e-t的哪些排列是有效的)。搜索给定字符串的变位现在是非常快速和简单的,因为从根到叶的路径使用排列数保存了叶节点处该路径的所有有效变位。

Kd-Trees是实时光线跟踪中使用的空间数据结构,它的缺点是需要裁剪与不同空间交叉的三角形。一般来说,BVH更快,因为它们更轻。MX-CIF四叉树,通过将规则四叉树与四叉树边缘的二叉树组合,存储边界框而不是任意点集。HAMT,由于所涉及的常数,访问时间通常超过O(1)个哈希图的分层哈希图。反向索引,在搜索引擎界非常有名,因为它用于快速检索与不同搜索词相关的文档。

大多数(如果不是全部)记录在NIST算法和数据结构词典中

我有时使用反转列表来存储范围,它们通常用于在正则表达式中存储字符类。例如,请参见http://www.ibm.com/developerworks/linux/library/l-cpinv.html

另一个很好的用例是加权随机决策。假设你有一个符号和相关概率的列表,你想根据这些概率随机选择它们

   a => 0.1
   b => 0.5
   c => 0.4

然后,你对所有概率进行一次连续求和:

  (0.1, 0.6, 1.0)

这是你的反转列表。生成一个介于0和1之间的随机数,并查找列表中下一个较高条目的索引。你可以用二进制搜索来实现,因为它是排序的。一旦获得了索引,就可以在原始列表中查找符号。

如果有n个符号,则每个随机选择的符号都有O(n)个准备时间,然后是O(log(n))个访问时间,与权重分布无关。

反转列表的一种变体使用负数来指示范围的端点,这使得计算某一点上有多少范围重叠变得容易。看见http://www.perlmonks.org/index.pl?node_id=841368例如。