Kafka 生产调优实践 Kafka 调优的本质是吞吐与可靠的权衡:Producer 侧(batch、压缩、acks)、Broker 侧(IO 线程、分段、保留策略)、Consumer 侧(拉取、提交、分区并行)。Kafka 最大的性能秘密在页缓存——它不靠 JVM 堆缓存数据,所以堆别给太大,钱要花在磁盘和内存页缓存上。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解Producer 侧 参数 默认 2026-08-09 middleware #2026 #调优 #kafka
Nacos 生产调优实践 Nacos 的调优重点是容量与稳定性:能承载多少服务实例、多少配置变更、客户端长连接(gRPC)与推送如何并发。单机 Derby 模式只配测试;生产调优的第一动作就是外接 MySQL 并组成 3 节点集群。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 JVM 堆(-Xms/-Xmx) 1G 实例数与配置量决定;几万实例规模 4~8G 足够,堆 2026-08-09 middleware #2026 #调优 #nacos
MySQL 生产调优实践 MySQL 调优的优先级永远是:慢查询 → 索引 → 参数。参数调优是最后一步——一个被慢查询拖垮的库,innodb_buffer_pool_size 调得再大也救不了。本文先给参数理解与规格表,再强调集群规模的读写分离与容灾。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 innodb_buffer_pool_size 128M InnoDB 2026-08-09 middleware #2026 #调优 #mysql
Redis 生产调优实践 Redis 是单线程模型(6.x 起 IO 线程可选),调优思路与其他组件相反:不是加资源,而是控制单个操作的成本——大 Key、慢命令、全量复制是三大杀手。内存管理(淘汰策略、编码优化)与持久化取舍是日常重点。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 maxmemory 0(不限) 内存上限,生产必须设,否则 OOM 被内核杀掉 m 2026-08-09 middleware #2026 #调优 #redis
RocketMQ 生产调优实践 RocketMQ 的调优主线是刷盘与复制的两对选择:异步刷盘还是同步刷盘、异步复制还是同步复制——组合出四种可靠性与性能档位;其次是 Broker 的 JVM 与磁盘 IO。生产默认”异步刷盘 + 异步复制”性能最好,核心链路升到”同步复制”。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解Broker 配置(broker.conf) 参数 默认值 调优理解 flush 2026-08-09 middleware #2026 #调优 #rocketmq
Zookeeper 生产调优实践 Zookeeper 是”轻量但金贵”的组件:它吃磁盘 IO(事务日志)、吃网络(同步)、吃GC(内存)。调优的核心是保护它的这三个资源——ZK 抖动一次,Kafka/HBase/HDFS HA 全跟着抖。部署安装见《大数据与中间件组件部署总览》。 核心参数与调优理解 参数 默认值 调优理解 tickTime 2000ms 基础时间单位,所有超时都是它的倍数;调大 2026-08-09 middleware #2026 #调优 #zookeeper
opencode 数据备份与恢复方案 用 opencode 写代码、记对话,所有会话历史都存在本地。一旦硬盘损坏或者系统重装,几年的积累就全没了。本文记录我搭建的”NAS 每日备份 + 安全恢复”完整方案,Windows / Linux / macOS 三平台通用。 为什么要做备份opencode 是本地优先的 AI 编程助手:会话记录、对话数据库、附件文件都存在本机 C:\Users\Administrato 2026-08-09 summary #2026 #opencode #备份
Flink 底层原理与知识要点 本文是对 Flink 核心知识的系统性总结,覆盖架构、流处理模型、窗口与 Watermark、状态编程、Checkpoint 容错、常用参数以及日常问题排查要点,作为个人技术笔记使用。 整体架构:JobManager 与 TaskManagerFlink 是真正的流式计算框架(Streaming First),采用主从架构: JobManager(JobMaster):集群的大脑,负责作业调 2026-08-08 bigdata #2026 #flink
HDFS 底层原理与知识要点 大数据入门的第一块基石就是 HDFS。作为 Hadoop 的分布式文件系统,它藏了很多”为什么”:为什么块是 128M?为什么写数据要走 pipeline?NameNode 挂了数据会不会丢?这篇文章把 HDFS 的架构、原理、参数和排障经验梳理一遍。 核心架构HDFS 是主从(Master/Slave)架构,核心角色有三个:NameNode、DataNode,以及辅助的 Secon 2026-08-08 bigdata #2026 #hdfs
Hive 底层原理与知识要点 Hive 是大数据圈”SQL 化”的起点:把 HDFS 上的数据抽象成表,把 SQL 翻译成 MapReduce/Tez/Spark 作业。它不存数据、不跑计算,只做翻译和元数据管理。搞懂 Hive 的架构和优化手段,是数据开发的基本功。 核心架构Hive 由三个关键部分组成:MetaStore(元数据)、HiveServer2(服务入口)、Driver(SQL 解析与执行 2026-08-08 bigdata #2026 #hive
MapReduce 底层原理与知识要点 学大数据绕不开 MapReduce,它是 Hadoop 分布式计算的基石。这篇文章是我对 MapReduce 底层原理的总结,从计算模型讲到执行流程,再到参数调优和常见问题排查,希望能帮你把这块知识串起来。 计算模型:Map / Reduce 思想MapReduce 的核心思想就四个字:分而治之。把一个大规模计算任务拆成无数个小任务,分发给集群中的多台机器并行处理,最后再汇总结果。 2026-08-08 bigdata #2026 #mapreduce
Spark 底层原理与知识要点 本文是对 Spark 核心知识的系统性总结,覆盖架构、RDD 与 DAG 调度、Shuffle、缓存与 Checkpoint、运行模式、常用参数以及日常问题排查要点,作为个人技术笔记使用。 整体架构:一次任务是怎么跑起来的Spark 是内存计算框架,采用 Master-Slave 架构,核心组件如下: Driver:任务的”大脑”,运行用户程序 main 函数,负责解析代码、构建 DAG、调 2026-08-08 bigdata #2026 #spark
Tez 底层原理与知识要点 Tez 是 Apache 旗下的 DAG 计算引擎,脱胎于 MapReduce,用于替代 MR 执行多阶段复杂作业。它把”多轮 MR 写盘”改成”一个 DAG 内存流转”,性能提升肉眼可见,也是 Hive 默认执行引擎之一。 一、Tez 的定位与背景MapReduce 的缺陷很明确:一次作业只能表达 Map → Reduce 两个阶段,复杂的分析(比如 Hive SQL)会被翻译成一串串 MR 2026-08-08 bigdata #2026 #tez
Yarn 底层原理与知识要点 Yarn 是 Hadoop 的资源调度层,负责把集群的 CPU 和内存”分蛋糕”。搞懂 Yarn,才能明白为什么任务一直卡在 ACCEPTED、为什么容器总被杀、为什么队列里任务挤成一堆。这篇文章从架构到排障完整梳理一遍。 核心架构Yarn 采用主从 + 两级调度的架构:ResourceManager 管全局资源,NodeManager 管单节点资源,ApplicationMaster 管单个 2026-08-08 bigdata #2026 #yarn
Kafka 底层原理与知识要点 本文是我学习 Kafka 时整理的笔记,涵盖核心架构、底层存储原理、副本与一致性机制、生产消费流程,以及日常排障的经验总结,适合面试复习和实际排查问题参考。 核心架构角色划分Kafka 集群主要由以下几类角色组成: Producer(生产者):向 Topic 发送消息的客户端,负责选择分区、批量发送、处理发送结果。 Broker(服务端):Kafka 集群中的一台服务器就是一个 Broker 2026-08-08 middleware #2026 #kafka
MySQL 底层原理与知识要点 本文是对 MySQL 核心知识的系统性总结,覆盖架构、InnoDB 索引、事务与 MVCC、锁、日志、缓冲池以及日常问题排查要点,作为个人技术笔记使用。 整体架构:一条 SQL 是如何执行的MySQL 的架构可以自上而下分为四层: 连接层:负责客户端连接管理、认证授权、线程复用(thread pool) 服务层:SQL 接口、解析器、优化器、执行器、缓存 存储引擎层:可插拔式,常用 Inno 2026-08-08 middleware #2026 #mysql
Nacos 底层原理与知识要点 本文梳理 Nacos 的架构、服务发现(AP/Distro)、配置中心(长轮询)、集群一致性(Raft + Derby/MySQL)、与主流注册中心的对比,以及常见问题的排查思路。 概述Nacos(Dynamic Naming and Configuration Service)是阿里巴巴开源的,同时提供服务发现与配置管理两大能力的中间件,是 Spring Cloud Al 2026-08-08 middleware #2026 #nacos
Redis 底层原理与知识要点 本文总结 Redis 的核心底层原理:数据结构实现、单线程模型、持久化机制、过期与淘汰策略、缓存三大问题、高可用方案以及常见问题排查要点,作为个人技术笔记。 五种基础数据结构与底层实现string:SDSstring 底层是 SDS(Simple Dynamic String),而非 C 字符串: 带长度字段,获取长度 O(1) 预分配空间 + 惰性释放,减少内存重分配次数 二进制安全,可存 2026-08-08 middleware #2026 #redis
RocketMQ 底层原理与知识要点 本文是我学习 RocketMQ 时整理的笔记,围绕四大组件、存储与高可用架构、消息模型,以及线上常见的堆积、丢失、顺序与事务问题展开,适合面试复习和日常排查参考。 核心架构RocketMQ 集群由四大组件构成: NameServer:轻量级路由中心,维护 Topic 与 Broker 的路由信息,Broker 启动时注册、断开时剔除,不存储消息数据,无状态,可多台部署互为冗余。 Broker 2026-08-08 middleware #2026 #rocketmq
Zookeeper 底层原理与知识要点 本文从 Zookeeper 的数据模型、ZAB 协议、Leader 选举、会话机制出发,梳理分布式协调服务的底层原理,最后给出常见问题的排查思路。 概述Zookeeper 是 Apache 开源的分布式协调服务,用于解决分布式系统中的一致性、数据发布订阅、命名服务、分布式锁、集群管理等问题。 Zookeeper 的核心定位是”小数据的协调”,它存储的数据量很小(一般建 2026-08-08 middleware #2026 #zookeeper