返回排行榜

collabH/bigdata-growth

Python

大数据知识仓库涉及到数据仓库建模、实时计算、大数据、数据中台、系统设计、Java、算法等。

flinkkafkahivemapreducesparkolapkuduhadoophbasedebeziumhdfsbigdata
Star 增长趋势
Star
1.8k
Forks
393
周增长
Issues
1
5001k1.5k
2020年6月2022年6月2024年7月2026年7月
制品库PyPIpip install bigdata-growth
README

img.png

大数据知识库 (BigData Knowledge Repository)

License

GitHub Stars

Fork

概述

  • 个人学习知识库涉及到数据仓库建模、实时计算、大数据、Java、算法等。
  • 在线文档

🤖 AI知识库助手

本项目集成了 大数据知识库AI Skill助手,可以帮助您:

  • 📚 知识复习:基于Flink、Spark、Hadoop、数据仓库、数据湖等知识库提供智能复习指导
  • 💼 面试准备:提供大数据技术面试问题解答和面试技巧
  • 🎯 学习路径:根据您的需求制定个性化的学习计划和路径
  • ❓ 问题解答:解答大数据相关技术问题,提供详细解释和示例

使用方法

在支持的AI平台上激活 bigdata-knowledge-coach Skill,然后您可以:

# 询问技术问题
"请帮我解释Flink的Checkpoint机制"

# 请求面试准备
"准备一下Spark Streaming的面试题"

# 学习规划
"我想学习数据仓库,请给出学习路径"

# 知识点复习
"帮我复习Hive的调优策略"

RoadMap

roadMap

基础能力

数据结构

分布式理论

计算机理论

Scala

JVM

Java

并发编程

JDK源码

待补充

算法

BigData

cache

数据编排技术

alluxio

datalake

hudi

快速开始
doc with source

配合官方文档和源码带从0到1学习hudi

article

Paimin

iceberg

rss

remote shuffle service

celeborn

store

存储相关,包含rocksdb、Hbase、BookKeeper、Zookeeper等

rocksDB

Bookkeeper

HBase

Zookeeper

Hadoop

广义上的Hadoop生态圈的学习笔记,主要记录HDFS、MapReduce、Yarn相关读书笔记及源码分析等。

HDFS

MapReduce

Yarn

生产配置

Engine

计算引擎相关,主要包含Flink、Spark等

Flink

  • 主要包含对Flink文档阅读的总结和相关Flink源码的阅读,以及Flink新特性记录等等
Core
SourceCode
zoology
Flink CDC Connector
devops
Flink On K8s
Flink SQL Tools
Book
Flink内核原理与实现
Feature
Practice
Connector
monitor

Spark

主要包含Spark相关书籍读书笔记、Spark核心组件分析、Spark相关API实践以及Spark生产踩坑等。

Spark Core
Spark SQL
Spark Practice
Spark Streaming
Native SQL Engine
源码解析

Collect

数据采集框架,主要包含Binlog增量与SQL快照方式框架

Canal

Debezium

Flume

Sqoop

MQ

消息中间件相关,主要包含大数据中使用比较多的Kafka和Pulsar

Kafka

Pulsar

schedule

Azkaban

DolphinScheduler

olap

主要核心包含Kudu、Impala相关Olap引擎,生产实践及论文记录等。

Hive

Presto

clickhouse

Druid

Kylin

Kudu

Flink

paper

Impala

graph

图库相关

nebula graph

tools

工具集相关,包含计算平台、sql语法Tree等

zeppelin

SQL语法树

calcite

数据仓库建设

理论

数据中台设计

方案实践

读书笔记

算法策略

特征工程

books

数据笔记相关

DDIA读书笔记

devops

maven

服务监控

mac

🤝 贡献方式

欢迎为这个知识库贡献内容!

  • 📝 提交Pull Request:修正错误、补充内容、更新文档

  • 🐛 提交Issue:报告bug、提出改进建议、询问问题

  • 💬 参与讨论:在Issue和Discussion中分享您的见解

  • 🌟 Star支持:如果这个项目对您有帮助,请给我们一个Star!

  • 贡献者指南

  • 代码规范

  • 安全政策

📚 技术分享

公众号

技术栈覆盖

  • 实时计算:Flink、Spark Streaming
  • 批处理:Spark、MapReduce
  • 数据湖:Hudi、Iceberg、Paimon
  • 数据仓库:Hive、Kudu
  • 消息队列:Kafka、Pulsar
  • 存储系统:HDFS、RocksDB、HBase
  • OLAP引擎:ClickHouse、Druid、Impala
  • 调度系统:DolphinScheduler、Azkaban
  • 采集工具:Canal、Debezium、Flume
  • 缓存系统:Alluxio
  • 图数据库:Nebula Graph
  • 工具集:Zeppelin、Calcite
相关仓库
apache/flink

Apache Flink

JavaMavenApache License 2.0scalajava
flink.apache.org
26.2k14k
zhisheng17/flink-learning

flink learning blog. http://www.54tianzhisheng.cn/ 含 Flink 入门、概念、原理、实战、性能调优、源码解析等内容。涉及 Flink Connector、Metrics、Library、DataStream API、Table API & SQL 等内容的学习案例,还有 Flink 落地应用的大型项目案例(PVUV、日志存储、百亿数据实时去重、监控告警)分享。欢迎大家支持我的专栏《大数据实时计算引擎 Flink 实战与性能优化》

JavaMavenApache License 2.0flinkkafka
54tianzhisheng.cn/tags/Flink/
15.1k3.9k
wangzhiwubigdata/God-Of-BigData

专注大数据学习面试,大数据成神之路开启。Flink/Spark/Hadoop/Hbase/Hive...

flinkspark
10.5k3.2k
apache/zeppelin

Web-based notebook that enables data-driven, interactive data analytics and collaborative documents with SQL, Scala and more.

JavaMavenApache License 2.0scalajava
zeppelin.apache.org
6.6k2.8k
apache/flink-cdc

Flink CDC is a streaming data integration tool

JavaMavenApache License 2.0change-data-capturecdc
nightlies.apache.org/flink/flink-cdc-docs-stable
6.4k2.2k
zq2599/blog_demos

CSDN博客专家程序员欣宸的github,这里有六百多篇原创文章的详细分类和汇总,以及对应的源码,内容涉及Java、Docker、Kubernetes、DevOPS等方面

JavaMavenApache License 2.0javaspring
4.7k1.9k
flink-china/flink-training-course

Flink 中文视频课程(持续更新...)

flinktraining
4.6k1.1k
water8394/flink-recommandSystem-demo

:helicopter::rocket:基于Flink实现的商品实时推荐系统。flink统计商品热度,放入redis缓存,分析日志信息,将画像标签和实时记录放入Hbase。在用户发起推荐请求后,根据用户画像重排序热度榜,并结合协同过滤和标签两个推荐模块为新生成的榜单的每一个产品添加关联产品,最后返回新的用户列表。

JavaMavenflinkrecommander-system
4.5k1.5k
DTStack/chunjun

A data integration framework

JavaMavenApache License 2.0flinkbigdata
dtstack.github.io/chunjun/
4.1k1.7k
DataLinkDC/dinky

Dinky is a real-time data development platform based on Apache Flink, enabling agile data development, deployment and operation.

JavaMavenApache License 2.0flinkflinksql
dinky.org.cn
3.7k1.3k
alibaba/Alink

Alink is the Machine Learning algorithm platform based on Flink, developed by the PAI team of Alibaba computing platform.

JavaMavenApache License 2.0machine-learningflink
3.6k787
apache/paimon

Apache Paimon is a lake format that enables building a Realtime Lakehouse Architecture with Flink and Spark for both streaming and batch operations.

JavaMavenApache License 2.0big-datadata-ingestion
paimon.apache.org
3.3k1.4k