周围有一些数据结构非常有用,但大多数程序员都不知道。他们是哪一个?

每个人都知道链表、二叉树和散列,但比如Skip列表和Bloom过滤器。我想知道更多不太常见但值得了解的数据结构,因为它们依赖于伟大的想法,丰富了程序员的工具箱。

PS:我还对舞蹈链接等技术感兴趣,这些技术巧妙地利用了通用数据结构的财产。

编辑:请尝试包含更详细描述数据结构的页面链接。此外,试着补充几句关于数据结构为什么很酷的话(正如乔纳斯·Kölker已经指出的那样)。此外,尝试为每个答案提供一个数据结构。这将允许更好的数据结构仅根据其投票结果浮到顶部。


当前回答

DAWG是一种特殊的Trie,其中类似的子树被压缩为单亲。我扩展了修改后的DAWG,并提出了一个漂亮的数据结构ASSDAWG(Anagram Search Sorted DAWG)。这种工作方式是,每当将字符串插入DAWG时,首先对其进行桶排序,然后插入,叶节点保存一个额外的数字,指示如果我们从根到达该叶节点,哪些排列是有效的。这有两大优点:

由于我在插入之前对字符串进行排序,并且DAWG自然会折叠类似的子树,所以我得到了高级别的压缩(例如,“吃”、“吃”和“茶”都变成了一条路径a-e-t,在叶节点处有一个数字列表,指示a-e-t的哪些排列是有效的)。搜索给定字符串的变位现在是非常快速和简单的,因为从根到叶的路径使用排列数保存了叶节点处该路径的所有有效变位。

其他回答

正确的字符串数据结构。几乎每个程序员都满足于一种语言对结构的任何原生支持,而这种支持通常是低效的(尤其是对于构建字符串,你需要一个单独的类或其他东西)。

最糟糕的是将字符串作为C中的字符数组,并依赖NULL字节来确保安全。

我认为当您需要将一堆项目划分为不同的集合和查询成员时,不联合集合非常适合。联合和查找操作的良好实施导致摊余成本实际上是恒定的(如果我正确回忆起我的数据结构类,则与阿克曼南函数相反)。

增强的哈希算法非常有趣。线性哈希很简单,因为它允许一次在哈希表中拆分一个“桶”,而不是重新哈希整个表。这对于分布式缓存特别有用。然而,对于大多数简单的拆分策略,您最终会快速连续地拆分所有存储桶,并且表的负载系数波动非常严重。

我认为螺旋哈希法也很好。与线性哈希一样,一次拆分一个存储桶,存储桶中的记录只有不到一半被放入同一个新存储桶中。它非常干净和快速。然而,如果每个“桶”都由具有类似规格的机器托管,则效率可能很低。为了充分利用硬件,您需要混合使用功能较弱和功能更强的机器。

一个鲜为人知但相当漂亮的数据结构是Fenwick树(有时也称为二进制索引树或BIT)。它存储累积和并支持O(log(n))运算。虽然累积和听起来不太令人兴奋,但它可以用于解决许多需要排序/log(n)数据结构的问题。

IMO的主要卖点是易于实施。在解决算法问题时非常有用,否则将涉及编码红黑/avl树。

我个人认为稀疏矩阵数据结构非常有趣。http://www.netlib.org/linalg/html_templates/node90.html

著名的BLAS库使用这些。当您处理包含100000行和列的线性系统时,使用它们变得至关重要。其中一些还类似于计算机图形中常见的紧凑网格(基本上类似于桶排序网格)。http://www.cs.kuleuven.be/~ares/publications/LD08CFRGRT/LD08CFRGRT.pdf

同样就计算机图形而言,MAC网格有些有趣,但这仅仅是因为它们很聪明。http://www.seas.upenn.edu/~cis665/projects/Liquiation_665_Report.pdf