Paimon 原理、部署与调优指南 Paimon(原 Flink Table Store,Apache 孵化项目)是”流式数据湖仓”:在湖格式上叠加 LSM 结构与 Changelog,让 Flink 能对湖表做流读流写,主键表支持 CDC 同步与行级更新。本文覆盖原理(LSM/Bucket/Changelog)、集成部署(Flink/Spark)、参数优化与常见问题。 底层原理速览 表类型:主键表 2026-08-10 bigdata #2026 #部署 #flink #湖仓 #paimon
StarRocks 原理、部署与调优指南 StarRocks 是从 Doris 分叉出的 MPP 分析引擎,在”高并发点查、实时更新、物化视图、存算分离”上走得更远。本文覆盖底层原理、集群部署(FE/BE)、存算分离形态、参数优化与常见问题。与《Doris 原理、部署与调优指南》对照阅读,差异点会标出来。 底层原理速览 FE / BE 架构:与 Doris 同源(FE 元数据与查询规划,BE 存储与执行),但查询优 2026-08-10 bigdata #2026 #部署 #olap #starrocks
Jenkins 原理、部署与调优指南 大数据底座的迭代思路里提到”引入 CI/CD,把组件部署从手工变为流水线”,落地首选就是 Jenkins。本文按”原理 → 部署 → 调优”三步整理企业级使用指南,延续《Kerberos 部署与调优指南》等系列的结构。 一、Jenkins 核心原理1、Jenkins 是什么Jenkins 是 Java 编写的开源 CI/CD 工具,负责”自动化的构建、测试、发布”。它的核心 2026-08-10 middleware #2026 #middleware #jenkins #ci/cd #devops
MySQL 学习笔记:SQL 复习、原理与优化 2022 年学习 MySQL 的三篇笔记(SQL 语法复习、MySQL 原理、MySQL 优化)合并整理。原理先行,实践在后。 一、SQL 语法复习轻量化复盘一下 SQL 操作,以及 MySQL。 SELECT 语句数据查询是关系运算理论在 SQL 语言中的主要体现。SQL 的数据查询只有一条 SELECT 语句,其使用最广泛。一个完整的 SELECT 语句包含了六个子句,前两个子句是必备的, 2026-08-10 middleware #2026 #middleware #mysql #sql #innodb
Redis 学习笔记:概念、持久化与底层 2022 年学习 Redis 的两篇笔记(浅谈 Redis 中间件、深入理解 Redis 底层)合并整理。教程来源于 b站狂神说 Java 的 Redis 教程,底层部分配图主要来自极客时间。 Redis 概念1、Redis 是基于计算机内存的数据库,一般称为缓存数据库,由于没有固定的表结构与关系,也叫 NoSQL(Not Only SQL)数据库。 2、为什么要使用 Redis: 数据的爆 2026-08-10 middleware #2026 #middleware #redis
2022 年周总结合集 2022 年 3 月至 6 月写的 9 篇周总结合并整理。求职、成长、技术学习的记录,按时间顺序保留。 第 11 周总结(2022-03-14)上一周没怎么写博客,第一个是杂事比较多,理论方向的学习偏少;第二是跟大佬交流,发现自己存在找原因性的思维方式,需要转变自己的思维。因此,一段时间写一次总结性的博客是很有必要的。 关于求职大佬提醒我,要建立模板化、模块化的求职思路,如面试之前需要搜集相关 2026-08-10 summary #2026 #2022 #总结
Kubernetes 常见问题排查 K8S 排障有固定套路:先看事件,再看日志,最后看资源状态。绝大多数问题能通过 kubectl describe、kubectl logs、kubectl get events 三步定位。本文按”Pod 起不来 → 网络不通 → 存储异常 → 控制面异常”的顺序整理高频问题。 一、Pod 层问题1. Pod 一直 Pending排查路径:kubectl describe pod xxx 看 E 2026-08-09 linux #2026 #kubernetes #k8s
Kubernetes 底层原理 Kubernetes(K8S)是容器编排的事实标准。理解它的底层原理,记住一条主线就够:声明式 API + 控制器循环——用户声明”我要 3 个副本”,控制器不停地对比”现状”与”期望”并拉齐。本文梳理控制面、数据面、调度、网络、存储五大块。 整体架构1234567891011121314┌─ 控制面(Master)────────────────────────┐│ kube-apiser 2026-08-09 linux #2026 #kubernetes #k8s
Kubernetes 部署参数优化 K8S 部署优化分两层:集群层(控制面规格、etcd 磁盘、系统参数)与工作负载层(requests/limits、调度策略、扩缩容)。本文给出 8C16G / 32C256G / 64C512G 三种节点规格下的部署建议,以及大数据/中间件组件容器化的关键参数。 集群层优化节点规格规划 角色 规格 说明 控制面(etcd+apiserver+ 2026-08-09 linux #2026 #kubernetes #k8s
DataSophon 部署大数据组件:参数说明与优化实践 本文基于本地源码工程(datasophon,2.0.0 分支,对应 datasophon-api/src/main/resources/meta/DDP-2.0.0)梳理 DataSophon 的组件部署机制:服务如何定义、参数如何组织、平台如何自动注入变量,并逐一给出核心组件的参数说明与优化建议。此前的手工部署与调优系列(HDFS/YARN/Hive/Spark& 2026-08-09 bigdata #2026 #部署 #datasophon
大数据与中间件组件部署总览 本文汇总 HDFS、YARN、Hive、Spark、Flink、Zookeeper、Kafka、MySQL、Redis、Nacos、RocketMQ 共 11 个组件的安装部署文档,统一了目录导航,便于对照查阅。各组件更深入的生产调优(8C16G / 32C256G / 64C512G 三档规格参数、集群规模优化、容灾备份)见对应组件各自的《XXX 生产调优实践》文章;K8S 2026-08-09 bigdata #2026 #部署 #bigdata
本地 DataSophon 与开源增强版对比及升级思路 上一篇《DataSophon 部署大数据组件》基于本地私有工程(2.0.0)。本文将其与 GitHub 公开仓库 88fantasy/datasophon(3.0-SNAPSHOT,深度定制分支)做全面对比:技术栈、通信架构、组件清单、参数模型,并给出”要不要升、怎么升”的决策与迁移思路。 一、两个工程的定位 工程 版本 来源 定位 本地工程(IdeaProjects/datasop 2026-08-09 bigdata #2026 #datasophon #升级
Flink 生产调优实践 Flink 调优的核心矛盾是内存三分(JVM 堆、托管内存、堆外)与状态后端(RocksDB 还是堆内)的选择,其次是并行度与检查点的节奏。调优目标是:作业吞吐稳定、故障秒级恢复、不丢数据。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 taskmanager.memory.process.size 1G TaskManager 总内存(含堆+ 2026-08-09 bigdata #2026 #flink #调优
HDFS 生产调优实践 HDFS 的调优思路只有一条主线:NameNode 是瓶颈,DataNode 是 IO。NameNode 吃内存(元数据全在堆里),DataNode 吃磁盘与网络。所以调优时先算两笔账:集群的块数决定 NameNode 堆要多大,节点的磁盘吞吐决定副本数与块大小。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 dfs.blocksize 128 2026-08-09 bigdata #2026 #hdfs #调优
Hive 生产调优实践 Hive 调优的抓手分三层:执行引擎(MR/Tez/Spark 的选择)、单作业参数(并行度、MapJoin、Reducer 数)、数仓建设(分区、文件格式、小文件)。前两层是调参数,第三层是调习惯——数仓层的收益远大于参数层。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 hive.execution.engine mr 2026-08-09 bigdata #2026 #hive #调优
Kerberos 部署与调优指南 Kerberos 是 Hadoop 生态(HDFS/YARN/Hive/Kafka 等)的标准认证协议:客户端先向 KDC 拿票据,再用票据访问服务,全程不传密码。部署的核心是 KDC 服务 + 每个组件的 principal/keytab;调优的核心是票据生命周期与时钟同步。本文覆盖原理、部署、参数优化与常见问题。 底层原理认证流程(两次票据交换)12 2026-08-09 bigdata #2026 #部署 #kerberos
Ranger 部署与调优指南 Ranger 是 Hadoop 生态的集中授权与审计系统:管理员在网页上配置”谁能访问哪些资源、什么权限”,各组件(HDFS/Hive/Kafka/YARN)通过内置插件实时拦截执行。与 Kerberos(认证:你是谁)配合,Ranger 管授权(你能做什么),审计(你做了什么)。本文覆盖原理、部署、参数优化与常见问题。 底层原理架构三件套123456Ranger 2026-08-09 bigdata #2026 #部署 #ranger
Spark 生产调优实践 Spark 调优围绕四个变量转:Executor 的数量 × 单 Executor 的内存 × 单 Executor 的核数,以及分区数(并行度)。前三个决定资源总量,第四个决定并行度是否与资源匹配——资源给了、并行度不够,照样跑不快。本文给出三档规格的分配方案与常见坑。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 spark.executo 2026-08-09 bigdata #2026 #调优 #spark
Tez 部署与调优指南 Tez 是 Hive 的 DAG 执行引擎,把多轮 MapReduce 的”写盘-重读”改成一张 DAG 内存流转,SQL 性能提升 2~3 倍是常态。它不独立部署(寄生于 YARN),部署动作是”把 Tez 库放到 HDFS + 让 Hive 引擎指向它”。本文覆盖底层原理(衔接《Tez 底层原理与知识要点》)、部署、参数优化与常见问题。 底层原理速览 DAG:一次提交整个执行计划图,顶点( 2026-08-09 bigdata #2026 #部署 #tez
YARN 生产调优实践 YARN 调优的核心是算好每台机器能拿出多少资源给容器,以及资源怎么分给不同业务。前者是内存与核数预算(要留给操作系统和系统进程),后者是队列规划(Capacity Scheduler)。调不好最常见的症状:作业一直 ACCEPTED 不跑、容器 OOM、大作业挤死小作业。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 yarn.nodeman 2026-08-09 bigdata #2026 #调优 #yarn