随着数据采集和生成技术的不断成熟,能够生成数据流的应用越来越多,近些年,网络应用进一步普及,单一数据流的应用向着多节点的分布式数据流方向转移,如传感器网络、网络监控、WEB日志以及多站点的信用卡交易数据。这些数据不仅具有实时、连续、规模大的特点,还具有分布式的特征,如何管理和分析大规模的分布式的动态数据集,是研究人员面临的重要课题。针对这种现状,本文给出了同构分布式数据流和异构分布式数据流的形式化描述,分析了集中式流处理架构与分布式流处理架构的优势与不足,讨论了分布式数据流分类算法的最新进展,归