跳到主要内容

bigdata

28 篇文章
所有分类

浏览此分类下的所有文章

2026-08-10
978 字 · 4 分钟

YARN 生产调优实践

YARN 调优的核心是算好每台机器能拿出多少资源给容器,以及资源怎么分给不同业务。前者是内存与核数预算(要留给操作系统和系统进程),后者是队列规划(Capacity Scheduler)。调不好最常见的症状:作业一直 ACCEPTED 不跑、容器…

2026-08-09
3204 字 · 13 分钟

本文是对 Flink 核心知识的系统性总结,覆盖架构、流处理模型、窗口与 Watermark、状态编程、Checkpoint 容错、常用参数以及日常问题排查要点,作为个人技术笔记使用。

2026-08-09
2728 字 · 10 分钟

HDFS 底层原理与知识要点

大数据入门的第一块基石就是 HDFS。作为 Hadoop 的分布式文件系统,它藏了很多"为什么":为什么块是 128M?为什么写数据要走 pipeline?NameNode 挂了数据会不会丢?这篇文章把 HDFS 的架构、原理、参数和排障经验梳理一遍。

2026-08-09
2646 字 · 10 分钟

Hive 底层原理与知识要点

Hive 是大数据圈"SQL 化"的起点:把 HDFS 上的数据抽象成表,把 SQL 翻译成 MapReduce/Tez/Spark 作业。它不存数据、不跑计算,只做翻译和元数据管理。搞懂 Hive 的架构和优化手段,是数据开发的基本功。

2026-08-09
3524 字 · 14 分钟

MapReduce 底层原理与知识要点

学大数据绕不开 MapReduce,它是 Hadoop 分布式计算的基石。这篇文章是我对 MapReduce 底层原理的总结,从计算模型讲到执行流程,再到参数调优和常见问题排查,希望能帮你把这块知识串起来。

2026-08-09
2873 字 · 12 分钟

Spark 底层原理与知识要点

本文是对 Spark 核心知识的系统性总结,覆盖架构、RDD 与 DAG 调度、Shuffle、缓存与 Checkpoint、运行模式、常用参数以及日常问题排查要点,作为个人技术笔记使用。

2026-08-09
2070 字 · 8 分钟

Tez 底层原理与知识要点

Tez 是 Apache 旗下的 DAG 计算引擎,脱胎于 MapReduce,用于替代 MR 执行多阶段复杂作业。它把"多轮 MR 写盘"改成"一个 DAG 内存流转",性能提升肉眼可见,也是 Hive 默认执行引擎之一。

2026-08-09
2485 字 · 10 分钟

Yarn 底层原理与知识要点

Yarn 是 Hadoop 的资源调度层,负责把集群的 CPU 和内存"分蛋糕"。搞懂 Yarn,才能明白为什么任务一直卡在 ACCEPTED、为什么容器总被杀、为什么队列里任务挤成一堆。这篇文章从架构到排障完整梳理一遍。