跳到主要内容

bigdata

28 篇文章
所有分类

浏览此分类下的所有文章

2026-08-21
1728 字 · 8 分钟

DataX 适配 Kerberos Hadoop/Hive 集群:从 hdfsreader 到 hdfswriter 的踩坑实录

上一篇博客讲了 DolphinScheduler 怎么接入 Kerberos 认证的 Hive(数据源配置层面)。这次继续往链路深处走:调度平台里的 DataX 任务要真正读写 Kerberos 集群的 HDFS/Hive,官方开源版 DataX 直接跑不通,本文记录从 hdfsreader 读到…

2026-08-21
3552 字 · 16 分钟

DolphinScheduler 接入 Kerberos 认证 Hive:从 KDC 到数据源测试连接

一篇讲透 DolphinScheduler 接 Kerberos Hive 的全链路:底座怎么开 Kerberos、凭据怎么分发到调度节点、数据源表单里 principal / keytab / other…

2026-08-11
2434 字 · 9 分钟

企业级大数据底座技术架构与未来迭代思路

上一篇对比了本地 DataSophon(2.0.0)与开源增强版(3.0-SNAPSHOT)的差异。本文跳出版本之争,回答一个更本质的问题:当前企业级大数据底座的技术架构长什么样?未来 3-5 年产品如何迭代?是继续在 DataSophon 上投入,还是走所谓的技术转型?

2026-08-11
1372 字 · 6 分钟

Doris 原理、部署与调优指南

Doris 是 MPP(Massively Parallel Processing,大规模并行处理)分析型数据库,定位"在线报表 + 实时分析",主打高并发点查与多表 Join。本文覆盖底层原理、集群部署(FE/BE)、参数优化与常见问题,作为湖仓时代 OLAP 引擎的第一块拼图。

2026-08-11
1405 字 · 7 分钟

Gravitino 原理、部署与调优指南

Gravitino 是 Apache 孵化的统一元数据管理层:把 Hive、Iceberg、MySQL、Kafka、AI…

2026-08-11
1323 字 · 6 分钟

Hudi 原理、部署与调优指南

Hudi 是 Uber 开源的增量数据湖框架:给"不可变"的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read…

2026-08-11
1349 字 · 6 分钟

Iceberg 原理、部署与调优指南

Iceberg 是"表格式"(Table Format)不是数据库:它把"一张表"定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。

2026-08-11
1391 字 · 7 分钟

JuiceFS 原理、部署与调优指南

JuiceFS 是"元数据 + 数据分离"的分布式文件系统:数据放对象存储,元数据放数据库,本地留一层缓存。它给大数据底座带来的价值是存算分离的 POSIX 入口——Hadoop 生态、AI 训练、容器都挂同一份数据。本文覆盖原理、部署(客户端/Hadoop SDK/CSI)、参数优化与常见问题。

2026-08-11
1275 字 · 6 分钟

Paimon 原理、部署与调优指南

Paimon(原 Flink Table Store,Apache 孵化项目)是"流式数据湖仓":在湖格式上叠加 LSM 结构与 Changelog,让 Flink 能对湖表做流读流写,主键表支持 CDC…

2026-08-11
1444 字 · 7 分钟

StarRocks 原理、部署与调优指南

StarRocks 是从 Doris 分叉出的 MPP 分析引擎,在"高并发点查、实时更新、物化视图、存算分离"上走得更远。本文覆盖底层原理、集群部署(FE/BE)、存算分离形态、参数优化与常见问题。与《Doris 原理、部署与调优指南》对照阅读,差异点会标出来。