跳到主要内容

2026

72 篇文章
所有标签

浏览此标签下的所有文章

2026-08-10
1060 字 · 4 分钟

Spark 生产调优实践

Spark 调优围绕四个变量转:Executor 的数量 × 单 Executor 的内存 × 单 Executor…

2026-08-10
1059 字 · 5 分钟

Tez 部署与调优指南

Tez 是 Hive 的 DAG 执行引擎,把多轮 MapReduce 的"写盘-重读"改成一张 DAG 内存流转,SQL 性能提升 2~3 倍是常态。它不独立部署(寄生于 YARN),部署动作是"把 Tez 库放到 HDFS + 让 Hive 引擎指向它"。本文覆盖底层原理(衔接《Tez…

2026-08-10
978 字 · 4 分钟

YARN 生产调优实践

YARN 调优的核心是算好每台机器能拿出多少资源给容器,以及资源怎么分给不同业务。前者是内存与核数预算(要留给操作系统和系统进程),后者是队列规划(Capacity Scheduler)。调不好最常见的症状:作业一直 ACCEPTED 不跑、容器…

2026-08-10
1155 字 · 5 分钟

Zookeeper 生产调优实践

Zookeeper 是"轻量但金贵"的组件:它吃磁盘 IO(事务日志)、吃网络(同步)、吃GC(内存)。调优的核心是保护它的这三个资源——ZK 抖动一次,Kafka/HBase/HDFS HA 全跟着抖。部署安装见《大数据与中间件组件部署总览》。

2026-08-09
1426 字 · 5 分钟

AI Agent 知识概念总结

从 LLM 到 Agent:大模型应用落地的最重要形态——AI Agent(智能体)核心知识概念梳理。

2026-08-09
3204 字 · 13 分钟

本文是对 Flink 核心知识的系统性总结,覆盖架构、流处理模型、窗口与 Watermark、状态编程、Checkpoint 容错、常用参数以及日常问题排查要点,作为个人技术笔记使用。

2026-08-09
2728 字 · 10 分钟

HDFS 底层原理与知识要点

大数据入门的第一块基石就是 HDFS。作为 Hadoop 的分布式文件系统,它藏了很多"为什么":为什么块是 128M?为什么写数据要走 pipeline?NameNode 挂了数据会不会丢?这篇文章把 HDFS 的架构、原理、参数和排障经验梳理一遍。

2026-08-09
2646 字 · 10 分钟

Hive 底层原理与知识要点

Hive 是大数据圈"SQL 化"的起点:把 HDFS 上的数据抽象成表,把 SQL 翻译成 MapReduce/Tez/Spark 作业。它不存数据、不跑计算,只做翻译和元数据管理。搞懂 Hive 的架构和优化手段,是数据开发的基本功。

2026-08-09
3313 字 · 12 分钟

Kafka 底层原理与知识要点

本文是我学习 Kafka 时整理的笔记,涵盖核心架构、底层存储原理、副本与一致性机制、生产消费流程,以及日常排障的经验总结,适合面试复习和实际排查问题参考。

2026-08-09
3524 字 · 14 分钟

MapReduce 底层原理与知识要点

学大数据绕不开 MapReduce,它是 Hadoop 分布式计算的基石。这篇文章是我对 MapReduce 底层原理的总结,从计算模型讲到执行流程,再到参数调优和常见问题排查,希望能帮你把这块知识串起来。