|
现在不少人不相信科学,但相信大数据,因为通过数据把事实摆在眼前,让人不得不信,否则,就是自欺欺人。互联网时代,大数据很火,就业前景很好,薪资很高,数据作为互联网公司最宝贵的财富、出去拉投资的唯一资本,各互联网公司对大数据开发的人才可以用求贤若渴来描述。这里带领大家看看,java程序员都使用哪些大数据开发工具。
图片来源于图虫创意
在许多情况下,使用SQL数据库用于存储/检索数据已经足够了。但在一些其他情况下,例如数据库规模不够,或是还有更好的工具,这一切都取决于使用情况。现在让我们来讨论一下不同的存储/处理数据所用的非SQL工具——NoSQL数据库、内存缓存、全文搜索引擎、实时流媒体、图形数据库,等等。
1. MongoDB—— 一种流行的,跨平台的面向文档的数据库。
2. Elasticsearch——为云构建的分布式REST内置搜索引擎。
3. Cassandra——开源的分布式数据库管理系统,最初在Facebook开发和设计,用来处理横跨多个商用服务器的海量数据,提供了无单点故障的高度可用性。
4. Redis—— 开源的(BSD许可),内存数据结构存储,作为数据库、缓存和消息代理使用。
5. Hazelcast——开源,基于Java的内存数据网格。
6. EHCache——一种被广泛使用的开源Java分布式缓存,用于通用缓存、Java EE和轻量级容器。Ehcache相关介绍
7. Hadoop——以Java编写的一个开源软件框架,用于分布式存储和对在计算机集群上的超大型数据集的分布式处理。
图片来源于图虫创意
8. Solr——开源的企业搜索平台,Java编写,来自Apache Lucene项目。
9. Spark——Apache Software Foundation中最活跃的项目,一个开源的集群计算框架。
10. Memcached—— 通用的分布式内存缓存系统。
11. Apache Hive——提供了Hadoop之上类似于SQL的层。
12. Apache Kafka—— 高通量、分布式的发布-订阅式消息系统,最初开发在LinkedIn上。Windows上脱离Cygwin运行Apache Kafka
13. Akka—— 工具包,运行时,用于在JVM上构建高度并行的、分布式的、有弹性的消息驱动的应用程序。
14. HBase—— 一个开源的,非关系型的,分布式数据库,在谷歌的BigTable后建模,用Java编写,并运行在HDFS上。
15. Neo4j——用Java编写的开源图形数据库。
16. CouchBase——一个开源的、面向文档的分布式NoSQL数据库,特别为了交互式应用而优化。
17. Apache Storm——开源的分布式实时计算系统。
18. CouchDB——使用JSON来存储数据的面向文档的开源NoSQL数据库。
19. Oracle Coherence—— 一个内存的数据网格解决方案,通过提供快速访问常用数据的渠道,使得企业可预测地扩展关键任务应用程序。
20. Titan—— 一个可扩展的图形数据库,优化的目的在于存储和查询包含数千亿顶点和边的图形,分布在多机集群。
21. Amazon DynamoDB——一个快速、灵活、完全管理的NoSQL数据库服务,用于在任何规模需要一致的、个位数毫秒延迟的所有应用程序。
22. Amazon Kinesis—— 用于在AWS上的流数据的实时平台。
23. Datomic—— 一个用Clojure写的完全事务式的,支持云的,分布式数据库。
这么多的开发工具,不是一天就能全掌握会的。首先要有一定的基础,其次科技进步日新月异,要紧跟行业动态,系统学习,才能真正应用到工作中。学会一时技能,还你终生财富,Java开发,一个不错的选择!!
图片来源于图虫创意 |
|