当前,整个互联网正在从IT时代向DT时代演进,大数据技术也正在助力企业和公众敲开DT世界大门。当今“大数据”一词的重点其实已经不仅在于数据规模的定义,它更代表着信息技术发展进入了一个新的时代,代表着爆炸性的数据信息给传统的计算技术和信息技术带来的技术挑战和困难,代表着大数据处理所需的新的技术和方法,也代表着大数据分析和应用所带来的新发明、新服务和新的发展机遇。 为了帮助大家更好深入了解大数据,云栖社区组织翻译了GitHub Awesome Big Data资源,供大家参考。本资源类型主要包括:大数据框架、论文等实用资源集合。 资源列表: 关系数据库管理系统(RDBMS)
框架
分布式编程
分布式文件系统
文件数据模型
Key -Map 数据模型
键-值数据模型
图形数据模型
NewSQL数据库
列式数据库
时间序列数据库
类SQL处理
数据摄取
服务编程
调度
机器学习
基准测试
安全性
系统部署
应用程序
搜索引擎与框架
MySQL的分支和演化
PostgreSQL的分支和演化
Memcached的分支和演化
嵌入式数据库
商业智能
数据可视化
物联网和传感器
文章
论文
视频
关系数据库管理系统(RDBMS) 框架 Apache Hadoop:分布式处理架构,结合了 MapReduce(并行处理)、YARN(作业调度)和HDFS(分布式文件系统);
分布式编程 JAQL :用于处理结构化、半结构化和非结构化数据工作的声明性编程语言;
Kite :为一组库、工具、实例和文档集,用于使在Hadoop的生态系统上建立系统更加容易;
Pydoop :用于Hadoop的Python MapReduce和HDFS API;
Tuktu :易于使用的用于分批处理和流计算的平台,通过Scala、 Akka和Play所建;
分布式文件系统 文件数据模型 Key Map 数据模型 注意:业内存在一些术语混乱,有两个不同的东西都叫做“列式数据库”。这里列出的有一些是围绕“key-map”数据模型而建的分布式、持续型数据库,其中所有的数据都有(可能综合了)键,并与映射中的键-值对相关联。在一些系统中,多个这样的值映射可以与键相关联,并且这些映射被称为“列族”(具有映射值的键被称为“列”)。 另一组也可称为“列式数据库”的技术因其存储数据的方式而有别于前一组,它在磁盘上或在存储器中——而不是以传统方式,即所有既定键的键值都相邻着、逐行存储。这些系统也彼此相邻来存储所有列值,但是要得到给定列的所有值却不需要以前那么繁复的工作。 键-值数据模型 Aerospike:支持NoSQL的闪存优化,数据存储在内存。开源,“'C'(不是Java或Erlang)中的服务器代码可精确地调整从而避免上下文切换和内存拷贝”。
TiKV:由Google Spanner和HBase授权,Rust提供技术支持的分布式键值数据库;
图形数据模型 DGraph:一个可扩展的、分布式、低时延、高吞吐量的图形数据库,旨在为Google生产水平规模和吞吐量提供足够的低延迟,用于TB级的结构化数据的实时用户查询;
Titan:建于Cassandra的分布式图形数据库;
NewSQL数据库 H-Store:是一个实验性主存并行数据库管理系统,用于联机事务处理(OLTP)应用的优化;
Haeinsa:基于Percolator,HBase的线性可扩展多行多表交易库;
MemSQL:内存中的SQL数据库,其中有优化的闪存列存储;
NuoDB:SQL / ACID兼容的分布式数据库;
Map-D:为GPU内存数据库,也为大数据分析和可视化平台;
TiDB:TiDB是分布式SQL数据库,基于谷歌F1的设计灵感;
列式数据库 Vertica:用来管理大规模、快速增长的大量数据,当用于数据仓库时,能够提供非常快的查询性能;
时间序列数据库 Heroic:基于Cassandra和Elasticsearch的可扩展的时间序列数据库;
Newts:一种基于Apache Cassandra的时间序列数据库。
类SQL处理 Trafodion:为企业级的SQL-on-HBase针对大数据的事务或业务工作负载的解决方案。
|