大数据技术体系（长期更新）

Shockang 2023-07-19 原文

序言

2018~2021 年期间，笔者阅读了200+大数据相关的书籍和专栏。

本专栏为笔者，在多年读书笔记的基础上，结合自身的大数据开发心得体会，呕心沥血之作。

同时笔者也根据个人推荐度对引用的文献进行了排行，详情请见参考文献。

来点关注吧，万分感谢！

本专栏姊妹篇

100个问题搞定大数据理论体系

100个问题搞定Java虚拟机

100个问题搞定Java并发

目录结构

HDFS（3.2.2）

MapReduce（3.2.2）

YARN（3.2.2）

Zookeeper（3.7.0）

Hive（3.1.2）

HBase（2.4.4）

Flume（1.9.0）

Sqoop（已经停止维护）

Azkaban（3.30.1）

Kafka（2.8）

Flink（1.13.2）

ELK（6.7.0）

Maxwell

Maxwell 是什么？

Presto

一篇文章了解 Presto

ClickHouse

ClickHouse 是什么？ClickHouse 有哪些特性？

Kylin

Kubernetes

CDH/CDP

Spark Core（3.3.0-SNAPSHOT）

因为笔者一直在研究 Apache Spark 的源码，故专栏中涉及 Spark 的源码版本都是基于 github 的 master 分支，当前版本号为：3.3.0-SNAPSHOT

Spark RDD 论文详解

Spark RDD 论文详解（一）摘要和介绍

Spark RDD 论文详解（二）RDDs

Spark RDD 论文详解（三）Spark 编程接口

Spark RDD 论文详解（四）表达 RDDs

Spark RDD 论文详解（五）实现

Spark RDD 论文详解（六）评估

Spark RDD 论文详解（七）讨论

Spark RDD 论文详解（八）相关工作和结尾

Spark 3.2.0 版本新特性 push-based shuffle 论文详解

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（一）概要和介绍

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（二）背景和动机

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（三）系统设计

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（四）实现优化

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（五）评估结果

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（六）相关工作

Spark 3.2.0 版本新特性 push-based shuffle 论文详解（七）结论

随笔

Spark SQL（3.3.0-SNAPSHOT）

Spark SQL 内置函数

Spark SQL 内置函数（一）Array Functions（基于 Spark 3.2.0）

Spark SQL 内置函数（二）Map Functions（基于 Spark 3.2.0）

Spark SQL 内置函数（三）Date and Timestamp Functions（基于 Spark 3.2.0）

Spark SQL 内置函数（四）JSON Functions（基于 Spark 3.2.0）

Spark SQL 内置函数（五）Aggregate Functions（基于 Spark 3.2.0）

Spark SQL 内置函数（六）Window Functions（基于 Spark 3.2.0）

Spark SQL functions.scala 源码解析

Spark SQL functions.scala 源码解析（一）Sort functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（二）Aggregate functions（基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（三）Window functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（四）Non-aggregate functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（五）Math Functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（六）Misc functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（七）String functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（八）DateTime functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（九）Collection functions （基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（十）Partition transform functions（基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（十一）Scala UDF functions（基于 Spark 3.3.0）

Spark SQL functions.scala 源码解析（十二）Java UDF functions（基于 Spark 3.3.0）

Spark SQL 工作流程源码解析

Spark SQL 工作流程源码解析（一）总览（基于 Spark 3.3.0）

Spark SQL 工作流程源码解析（二）parsing 阶段（基于 Spark 3.3.0）

Spark SQL 工作流程源码解析（三）analysis 阶段（基于 Spark 3.3.0）

Spark SQL 工作流程源码解析（四）optimization 阶段（基于 Spark 3.3.0）

Spark SQL 工作流程源码解析（五）planning 阶段（基于 Spark 3.3.0）

随笔

参考文献（按推荐度排序）

官方文档都是要先阅读的，极客时间几个专栏都还不错，书籍推荐榜前几名强烈推荐！
后几名没什么必要去看，我都是引用了几句话所以加了进来。
博客引用不在推荐榜单排名内
随着专栏更新会不断更新~

Hadoop 3.2.2 官方文档
Spark 3.1.2 官方文档
Kafka 2.8 官方文档
HBase 2.4.4 官方文档
Hive 3.1.2 官方文档
极客时间专栏《Kafka核心技术与实战》胡夕
极客时间专栏《从0开始学大数据》李智慧
极客时间专栏《大规模数据处理实战》蔡元楠
极客时间专栏《Spark核心原理与实战》王磊
《大数据架构详解:从数据获取到深度学习》朱洁，罗华霖编著
《图解 Spark:核心技术与案例实战》郭景瞻编著
《Spark SQL 内核剖析》朱锋、张韶全、黄明著
《Spark大数据商业实战三部曲:内核解密商业案例性能调优第 2 版》王家林,段智华,夏阳编著
《Spark内核设计的艺术:架构设计与实现》耿嘉安著
《Hadoop专家:管理、调优与 Spark YARN HDFS安全》(美)山姆·阿拉帕蒂(SamR. Alapati)著; 赵国贤等译
《Hadoop权威指南（第3版）》（美）怀特(White,T.)著;华东师范大学数据科学与工程学院译
《企业数据湖》(印)汤姆斯・约翰(Tomcy John),(印)潘卡・米斯拉(Pankaj Misra)著；张世武,李想,张浩林译
《Spark内核机制解析及性能调优》王家林等编著
《Hadoop海量数据处理-技术详解与项目实战第2版》范东来著
《大数据技术体系详解:原理、架构与实战》董西成著
《Hadoop大数据技术原理与应用》黑马程序员编著
《Hadoop大数据挖掘从入门到进阶实战:视频教学版》邓杰编著
《Hadoop & Spark大数据开发实战》肖睿、雷刚跃主编
《大数据开发与应用》青岛英谷教育科技股份有限公司,山东工商学院编著
《大数据时代 hadoop 技术及应用分析》韦鹏程,施成湘,蔡银英著
《从 Paxos到 Zookeeper:分布式一致性原理与实践》倪超著
《大数据技术及应用探究》胡沛，韩璞著
《云时代的大数据技术与应用实践》朱利华著
《云计算中的大数据技术与应用》梁凡著
《大数据技术概论》陈明编著
《大数据应用基础》娄岩主编
《Hadoop大数据分析》高水彬,钱亮宏,方志军编著
《大数据资源》朱扬勇主编
《大数据高可用环境搭建与运维》天津滨海迅腾科技集团有限公司编著
MapReduce-Counter使用-快速实现大文件行数的统计

大数大数据 Shockang article details

有关大数据技术体系（长期更新）的更多相关文章

ruby-on-rails - 如何验证 update_all 是否实际在 Rails 中更新 - 2
给定这段代码defcreate@upgrades=User.update_all(["role=?","upgraded"],:id=>params[:upgrade])redirect_toadmin_upgrades_path,:notice=>"Successfullyupgradeduser."end我如何在该操作中实际验证它们是否已保存或未重定向到适当的页面和消息？最佳答案在Rails3中，update_all不返回任何有意义的信息，除了已更新的记录数(这可能取决于您的DBMS是否返回该信息)。http://ar.ru
ruby - 解析 RDFa、微数据等的最佳方式是什么，使用统一的模式/词汇(例如 schema.org)存储和显示信息 - 2
我主要使用Ruby来执行此操作，但到目前为止我的攻击计划如下:使用gemsrdf、rdf-rdfa和rdf-microdata或mida来解析给定任何URI的数据。我认为最好映射到像schema.org这样的统一模式，例如使用这个yaml文件，它试图描述数据词汇表和opengraph到schema.org之间的转换:#SchemaXtoschema.orgconversion#data-vocabularyDV:name:namestreet-address:streetAddressregion:addressRegionlocality:addressLocalityphoto:i
ruby-on-rails - 使用 rails 4 设计而不更新用户 - 2
我将应用程序升级到Rails4，一切正常。我可以登录并转到我的编辑页面。也更新了观点。使用标准View时，用户会更新。但是当我添加例如字段:name时，它不会在表单中更新。使用devise3.1.1和gem'protected_attributes'我需要在设备或数据库上运行某种更新命令吗？我也搜索过这个地方，找到了许多不同的解决方案，但没有一个会更新我的用户字段。我没有添加任何自定义字段。最佳答案如果您想允许额外的参数，您可以在ApplicationController中使用beforefilter，因为Rails4将参数
ruby - Ruby 有 `Pair` 数据类型吗？ - 2
有时我需要处理键/值数据。我不喜欢使用数组，因为它们在大小上没有限制(很容易不小心添加超过2个项目，而且您最终需要稍后验证大小)。此外，0和1的索引变成了魔数(MagicNumber)，并且在传达含义方面做得很差(“当我说0时，我的意思是head...”)。散列也不合适，因为可能会不小心添加额外的条目。我写了下面的类来解决这个问题:classPairattr_accessor:head,:taildefinitialize(h,t)@head,@tail=h,tendend它工作得很好并且解决了问题，但我很想知道:Ruby标准库是否已经带有这样一个类？最佳
ruby - 我如何添加二进制数据来遏制 POST - 2
我正在尝试使用Curbgem执行以下POST以解析云curl-XPOST\-H"X-Parse-Application-Id:PARSE_APP_ID"\-H"X-Parse-REST-API-Key:PARSE_API_KEY"\-H"Content-Type:image/jpeg"\--data-binary'@myPicture.jpg'\https://api.parse.com/1/files/pic.jpg用这个:curl=Curl::Easy.new("https://api.parse.com/1/files/lion.jpg")curl.multipart_form_
世界前沿3D开发引擎HOOPS全面讲解——集3D数据读取、3D图形渲染、3D数据发布于一体的全新3D应用开发工具 - 2
无论您是想搭建桌面端、WEB端或者移动端APP应用，HOOPSPlatform组件都可以为您提供弹性的3D集成架构，同时，由工业领域3D技术专家组成的HOOPS技术团队也能为您提供技术支持服务。如果您的客户期望有一种在多个平台（桌面/WEB/APP，而且某些客户端是“瘦”客户端）快速、方便地将数据接入到3D应用系统的解决方案，并且当访问数据时，在各个平台上的性能和用户体验保持一致，HOOPSPlatform将帮助您完成。利用HOOPSPlatform，您可以开发在任何环境下的3D基础应用架构。HOOPSPlatform可以帮您打造3D创新型产品，HOOPSSDK包含的技术有：快速且准确的CAD
Unity 热更新技术 | （三） Lua语言基本介绍及下载安装 - 2
?博客主页：https://xiaoy.blog.csdn.net?本文由呆呆敲代码的小Y原创，首发于CSDN??学习专栏推荐：Unity系统学习专栏?游戏制作专栏推荐：游戏制作?Unity实战100例专栏推荐：Unity实战100例教程?欢迎点赞?收藏⭐留言?如有错误敬请指正！?未来很长，值得我们全力奔赴更美好的生活✨------------------❤️分割线❤️-------------------------
FOHEART H1数据手套驱动Optitrack光学动捕双手运动(Unity3D) - 2
本教程将在Unity3D中混合Optitrack与数据手套的数据流，在人体运动的基础上，添加双手手指部分的运动。双手手背的角度仍由Optitrack提供，数据手套提供双手手指的角度。 01 客户端软件分别安装MotiveBody与MotionVenus并校准人体与数据手套。MotiveBodyMotionVenus数据手套使用、校准流程参照：https://gitee.com/foheart_1/foheart-h1-data-summary.git02 数据转发打开MotiveBody软件的Streaming，开始向Unity3D广播数据；MotionVenus中设置->选项选择Unit
使用canal同步MySQL数据到ES - 2
文章目录一、概述简介原理模块二、配置Mysql使用版本环境要求1.操作系统2.mysql要求三、配置canal-server离线下载在线下载上传解压修改配置单机配置集群配置分库分表配置1.修改全局配置2.实例配置垂直分库水平分库3.修改group-instance.xml4.启动监听四、配置canal-adapter1修改启动配置2配置映射文件3启动ES数据同步查询所有订阅同步数据同步开关启动4.验证五、配置canal-admin一、概述简介canal是Alibaba旗下的一款开源项目，Java开发。基于数据库增量日志解析，提供增量数据订阅&消费。Git地址：https://github.co
ruby-on-rails - 创建 ruby 数据库时惰性符号绑定(bind)失败 - 2
我正在尝试在Rails上安装ruby，到目前为止一切都已安装，但是当我尝试使用rakedb:create创建数据库时，我收到一个奇怪的错误:dyld:lazysymbolbindingfailed:Symbolnotfound:_mysql_get_client_infoReferencedfrom:/Library/Ruby/Gems/1.8/gems/mysql2-0.3.11/lib/mysql2/mysql2.bundleExpectedin:flatnamespacedyld:Symbolnotfound:_mysql_get_client_infoReferencedf