Hadoop和spark之间有什么不同点呀？

想知道

举报该问题

推荐答案 2020-04-02

诞生的先后顺序，hadoop属于第一代开源大数据处理平台，而spark属于第二代

属于下一代的spark肯定在综合评价上要优于第一代的hadoop

spark和hadoop在分布式计算的底层思路上，其实是极为相似的，即mapreduce分布式运算模型：将运算分成两个阶段，阶段1-map，负责从上游拉取数据后各自运算，然后将运算结果shuffle给下游的reduce，reduce再各自对通过shuffle读取来的数据进行聚合运算

spark和hadoop在分布式计算的具体实现上，又有区别;hadoop中的mapreduce运算框架，一个运算job，进行一次map-reduce的过程;而spark的一个job中，可以将多个map-reduce过程级联进行

spark和hadoop的另一个区别是，spark是一个运算平台，而hadoop是一个复合平台(包含运算引擎，还包含分布式文件存储系统，还包含分布式运算的资源调度系统)，所以，spark跟hadoop来比较的话，主要是比运算这一块

大数据技术发展到目前这个阶段，hadoop(主要是说它的运算部分)日渐式微，而spark目前如日中天，相关技术需求量大，offer好拿，薪资相对更高

温馨提示：答案为网友推荐，仅供参考

当前网址：http://77.wendadaohang.com/zd/GWIYpNYv8vW3GNqpGpv.html

其他回答

第1个回答 2021-09-01

hadoop:是分布式存储系统，同时提供分布式计算环境，存储称为hdfs，计算称为mapreduce 简称MR。
spark：是一个分布式计算框架，类似于hadoop的运算环境，但是比mapreduce提供了更多支持，与其他系统的对接，一些高级算法等，可以独立运行，也可以使用hdfs上的数据，调度任务也可以基于hadoop的yarn来管理。由于整个计算都可以在内存中完成，所以速度自然比传统的MR计算的快。除此之外spark运行时占用的系统资源也比MR小得多，相比较属于轻量级运行。最核心的也是它提供的分析学习算法，这个大部分分布式架构不具有的。

相似回答

大家正在搜