跳到主要内容

bigdata

28 篇文章
所有分类

浏览此分类下的所有文章

2026-08-10
9530 字 · 47 分钟

大数据与中间件组件部署总览

本文汇总 HDFS、YARN、Hive、Spark、Flink、Zookeeper、Kafka、MySQL、Redis、Nacos、RocketMQ 共 11 个组件的安装部署文档,统一了目录导航,便于对照查阅。各组件更深入的生产调优(8C16G / 32C256G / 64C512G…

2026-08-10
2830 字 · 11 分钟

DataSophon 部署大数据组件:参数说明与优化实践

本文基于本地源码工程(datasophon,2.0.0 分支,对应 datasophon-api/src/main/resources/meta/DDP-2.0.0)梳理 DataSophon…

2026-08-10
1750 字 · 7 分钟

本地 DataSophon 与开源增强版对比及升级思路

上一篇《DataSophon 部署大数据组件》基于本地私有工程(2.0.0)。本文将其与 GitHub 公开仓库 88fantasy/datasophon(3.0-SNAPSHOT,深度定制分支)做全面对比:技术栈、通信架构、组件清单、参数模型,并给出"要不要升、怎么升"的决策与迁移思路。

2026-08-10
1208 字 · 5 分钟

Flink 调优的核心矛盾是内存三分(JVM 堆、托管内存、堆外)与状态后端(RocksDB 还是堆内)的选择,其次是并行度与检查点的节奏。调优目标是:作业吞吐稳定、故障秒级恢复、不丢数据。部署安装见《大数据与中间件组件部署总览》。

2026-08-10
1103 字 · 4 分钟

HDFS 生产调优实践

HDFS 的调优思路只有一条主线:NameNode 是瓶颈,DataNode 是 IO。NameNode 吃内存(元数据全在堆里),DataNode 吃磁盘与网络。所以调优时先算两笔账:集群的块数决定 NameNode…

2026-08-10
1051 字 · 4 分钟

Hive 生产调优实践

Hive 调优的抓手分三层:执行引擎(MR/Tez/Spark 的选择)、单作业参数(并行度、MapJoin、Reducer 数)、数仓建设(分区、文件格式、小文件)。前两层是调参数,第三层是调习惯——数仓层的收益远大于参数层。部署安装见《大数据与中间件组件部署总览》。

2026-08-10
1242 字 · 6 分钟

Kerberos 部署与调优指南

Kerberos 是 Hadoop 生态(HDFS/YARN/Hive/Kafka 等)的标准认证协议:客户端先向 KDC 拿票据,再用票据访问服务,全程不传密码。部署的核心是 KDC 服务 + 每个组件的…

2026-08-10
1388 字 · 6 分钟

Ranger 部署与调优指南

Ranger 是 Hadoop 生态的集中授权与审计系统:管理员在网页上配置"谁能访问哪些资源、什么权限",各组件(HDFS/Hive/Kafka/YARN)通过内置插件实时拦截执行。与 Kerberos(认证:你是谁)配合,Ranger…

2026-08-10
1060 字 · 4 分钟

Spark 生产调优实践

Spark 调优围绕四个变量转:Executor 的数量 × 单 Executor 的内存 × 单 Executor…

2026-08-10
1059 字 · 5 分钟

Tez 部署与调优指南

Tez 是 Hive 的 DAG 执行引擎,把多轮 MapReduce 的"写盘-重读"改成一张 DAG 内存流转,SQL 性能提升 2~3 倍是常态。它不独立部署(寄生于 YARN),部署动作是"把 Tez 库放到 HDFS + 让 Hive 引擎指向它"。本文覆盖底层原理(衔接《Tez…