1. Spark SQL
支持多种数据源,包括 Hive,Avro,Parquet,ORC,JSON 和 JDBC
2. Spark Streaming
Spark Streaming 主要用于快速构建可扩展,高吞吐量,高容错的流处理程序。支持从 HDFS,Flume,Kafka,Twitter 和 ZeroMQ 读取数据,并进行处理
Spark Streaming 的本质是微批处理,它将数据流进行极小粒度的拆分,拆分为多个批处理,从而达到接近于流处理的效果。
3. MLlib
4. Graphx
GraphX 是 Spark 中用于图形计算和图形并行计算的新组件。
标签:批处理,数据源,Streaming,组件,SPARK,图形,Spark From: https://blog.51cto.com/u_15905340/5919698