跳到主要内容

博客

2026-08-10
1116 字 · 4 分钟

Redis 生产调优实践

Redis 是单线程模型(6.x 起 IO 线程可选),调优思路与其他组件相反:不是加资源,而是控制单个操作的成本——大 Key、慢命令、全量复制是三大杀手。内存管理(淘汰策略、编码优化)与持久化取舍是日常重点。部署安装见《大数据与中间件组件部署总览》。

2026-08-10
1225 字 · 5 分钟

RocketMQ 生产调优实践

RocketMQ 的调优主线是刷盘与复制的两对选择:异步刷盘还是同步刷盘、异步复制还是同步复制——组合出四种可靠性与性能档位;其次是 Broker 的 JVM 与磁盘 IO。生产默认"异步刷盘 + 异步复制"性能最好,核心链路升到"同步复制"。部署安装见《大数据与中间件组件部署总览》。

2026-08-10
1060 字 · 4 分钟

Spark 生产调优实践

Spark 调优围绕四个变量转:Executor 的数量 × 单 Executor 的内存 × 单 Executor…

2026-08-10
1059 字 · 5 分钟

Tez 部署与调优指南

Tez 是 Hive 的 DAG 执行引擎,把多轮 MapReduce 的"写盘-重读"改成一张 DAG 内存流转,SQL 性能提升 2~3 倍是常态。它不独立部署(寄生于 YARN),部署动作是"把 Tez 库放到 HDFS + 让 Hive 引擎指向它"。本文覆盖底层原理(衔接《Tez…

2026-08-10
978 字 · 4 分钟

YARN 生产调优实践

YARN 调优的核心是算好每台机器能拿出多少资源给容器,以及资源怎么分给不同业务。前者是内存与核数预算(要留给操作系统和系统进程),后者是队列规划(Capacity Scheduler)。调不好最常见的症状:作业一直 ACCEPTED 不跑、容器…

2026-08-10
1155 字 · 5 分钟

Zookeeper 生产调优实践

Zookeeper 是"轻量但金贵"的组件:它吃磁盘 IO(事务日志)、吃网络(同步)、吃GC(内存)。调优的核心是保护它的这三个资源——ZK 抖动一次,Kafka/HBase/HDFS HA 全跟着抖。部署安装见《大数据与中间件组件部署总览》。

2026-08-09
1426 字 · 5 分钟

AI Agent 知识概念总结

从 LLM 到 Agent:大模型应用落地的最重要形态——AI Agent(智能体)核心知识概念梳理。

2026-08-09
3204 字 · 13 分钟

本文是对 Flink 核心知识的系统性总结,覆盖架构、流处理模型、窗口与 Watermark、状态编程、Checkpoint 容错、常用参数以及日常问题排查要点,作为个人技术笔记使用。

2026-08-09
2728 字 · 10 分钟

HDFS 底层原理与知识要点

大数据入门的第一块基石就是 HDFS。作为 Hadoop 的分布式文件系统,它藏了很多"为什么":为什么块是 128M?为什么写数据要走 pipeline?NameNode 挂了数据会不会丢?这篇文章把 HDFS 的架构、原理、参数和排障经验梳理一遍。

2026-08-09
2646 字 · 10 分钟

Hive 底层原理与知识要点

Hive 是大数据圈"SQL 化"的起点:把 HDFS 上的数据抽象成表,把 SQL 翻译成 MapReduce/Tez/Spark 作业。它不存数据、不跑计算,只做翻译和元数据管理。搞懂 Hive 的架构和优化手段,是数据开发的基本功。