跳到主要内容

hdfs

3 篇文章
所有标签

浏览此标签下的所有文章

2026-08-21
1728 字 · 8 分钟

DataX 适配 Kerberos Hadoop/Hive 集群:从 hdfsreader 到 hdfswriter 的踩坑实录

上一篇博客讲了 DolphinScheduler 怎么接入 Kerberos 认证的 Hive(数据源配置层面)。这次继续往链路深处走:调度平台里的 DataX 任务要真正读写 Kerberos 集群的 HDFS/Hive,官方开源版 DataX 直接跑不通,本文记录从 hdfsreader 读到…

2026-08-10
1103 字 · 4 分钟

HDFS 生产调优实践

HDFS 的调优思路只有一条主线:NameNode 是瓶颈,DataNode 是 IO。NameNode 吃内存(元数据全在堆里),DataNode 吃磁盘与网络。所以调优时先算两笔账:集群的块数决定 NameNode…

2026-08-09
2728 字 · 10 分钟

HDFS 底层原理与知识要点

大数据入门的第一块基石就是 HDFS。作为 Hadoop 的分布式文件系统,它藏了很多"为什么":为什么块是 128M?为什么写数据要走 pipeline?NameNode 挂了数据会不会丢?这篇文章把 HDFS 的架构、原理、参数和排障经验梳理一遍。