storm spark hadoop::

peibaishi · 发表于 2018-10-29 11:26:06

Storm优势就在于Storm是实时的连续性的分布式的计算框架,一旦运行起来,除非你将它杀掉,否则它一直处理计算或等待计算的状态.Spark和hadoop都做不到.　　
当然它们各自都有其应用场景,各有各的优势.可以配合使用.
　　
下面我转一份别人的资料,讲的很清楚.
　　
Storm与Spark、Hadoop这三种框架，各有各的优点，每个框架都有自己的最佳应用场景。
　　
所以，在不同的应用场景下，应该选择不同的框架。
　　
Storm是最佳的流式计算框架，Storm由Java和Clojure写成，Storm的优点是全内存计算，所以它的定位是分布式实时计算系统，按照Storm作者的说法，Storm对于实时计算的意义类似于Hadoop对于批处理的意义。
　　
Storm的适用场景：
　　
1）流数据处理
　　
Storm可以用来处理源源不断流进来的消息，处理之后将结果写入到某个存储中去。
　　
2）分布式RPC。由于Storm的处理组件是分布式的，而且处理延迟极低，所以可以作为一个通用的分布式RPC框架来使用。
　　
SparkSpark是一个基于内存计算的开源系统，目的是更快速的进行数据分析。Spark由AMP实验室Matei为主的小团队使用Scala开发开发，类似于Hadoop MapReduce的通用并行计算框架，Spark基于Map Reduce算法实现的，拥有Hadoop MapReduce所具有的优点，但不同于MapReduce的是Job中间输出和结果可以保存在内存中，从而不再需要读写HDFS，因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的Map Reduce的算法。
　　
Spark的适用场景：
　　
1）多次操作特定数据集的应用场合
　　
Spark是基于内存的框架，适用于需要多次操作特定数据集的应用场合。需要反复操作的次数越多，所需读取的数据量越大，受益越大，数据量小但是计算密集度较大的场合，受益就相对较小。
　　
2）粗粒度更新状态的应用
　　
由于RDD的特性，Spark不适用那种异步细粒度更新状态的应用，例如的存储或者是增量的Web爬虫和索引。就是对于那种增量修改的应用模型不适合。
　　
总的来说Spark的适用面比较广泛且比较通用。
　　
Hadoop是实现了MapReduce的思想，将数据切片计算来处理大量的离线数据数据。Hadoop处理的数据必须是已经存放在HDFS上或者类似HBase的数据库中，所以Hadoop实现的时候是通过移动计算到这些存放数据的机器上来提高效率。
　　
Hadoop的适用场景：
　　
1）的离线分析处理
　　
2）大规模Web信息搜索
　　
3）数据密集型并行计算
　　
简单来说：
　　
Hadoop适合于离线的批量数据处理适用于对实时性要求极低的场景
　　
Storm适合于实时流数据处理，实时性方面做得极好
　　
Spark是内存框架，试图吞并Hadoop的Map-Reduce批处理框架和Storm的流处理框架，但是Spark已经做得很不错了，批处理方面性能优于Map-Reduce，但是流处理目前还是弱于Storm，产品仍在改进之中

账号		自动登录	找回密码
密码			立即注册

Centos6.5×64安装配置openmeetings3.0.3详

大疆运维招人啦，

C++ :try 语句块和异常处理

C++的多态

Red Hat RHCE 8 (EX294) Cert Guide

Java/C++ 区别：看完这一篇，就够用！

别再用过时库了！这 13 个顶级 C++ 库才是

[经验分享] storm spark hadoop::

浏览过的版块

扫码加入运维网微信交流群