跳到主要内容

hive

4 篇文章
所有标签

浏览此标签下的所有文章

2026-08-21
1728 字 · 8 分钟

DataX 适配 Kerberos Hadoop/Hive 集群:从 hdfsreader 到 hdfswriter 的踩坑实录

上一篇博客讲了 DolphinScheduler 怎么接入 Kerberos 认证的 Hive(数据源配置层面)。这次继续往链路深处走:调度平台里的 DataX 任务要真正读写 Kerberos 集群的 HDFS/Hive,官方开源版 DataX 直接跑不通,本文记录从 hdfsreader 读到…

2026-08-21
3552 字 · 16 分钟

DolphinScheduler 接入 Kerberos 认证 Hive:从 KDC 到数据源测试连接

一篇讲透 DolphinScheduler 接 Kerberos Hive 的全链路:底座怎么开 Kerberos、凭据怎么分发到调度节点、数据源表单里 principal / keytab / other…

2026-08-10
1051 字 · 4 分钟

Hive 生产调优实践

Hive 调优的抓手分三层:执行引擎(MR/Tez/Spark 的选择)、单作业参数(并行度、MapJoin、Reducer 数)、数仓建设(分区、文件格式、小文件)。前两层是调参数,第三层是调习惯——数仓层的收益远大于参数层。部署安装见《大数据与中间件组件部署总览》。

2026-08-09
2646 字 · 10 分钟

Hive 底层原理与知识要点

Hive 是大数据圈"SQL 化"的起点:把 HDFS 上的数据抽象成表,把 SQL 翻译成 MapReduce/Tez/Spark 作业。它不存数据、不跑计算,只做翻译和元数据管理。搞懂 Hive 的架构和优化手段,是数据开发的基本功。