跳到主要内容

博客

2026-08-11
2434 字 · 9 分钟

企业级大数据底座技术架构与未来迭代思路

上一篇对比了本地 DataSophon(2.0.0)与开源增强版(3.0-SNAPSHOT)的差异。本文跳出版本之争,回答一个更本质的问题:当前企业级大数据底座的技术架构长什么样?未来 3-5 年产品如何迭代?是继续在 DataSophon 上投入,还是走所谓的技术转型?

2026-08-11
1372 字 · 6 分钟

Doris 原理、部署与调优指南

Doris 是 MPP(Massively Parallel Processing,大规模并行处理)分析型数据库,定位"在线报表 + 实时分析",主打高并发点查与多表 Join。本文覆盖底层原理、集群部署(FE/BE)、参数优化与常见问题,作为湖仓时代 OLAP 引擎的第一块拼图。

2026-08-11
5253 字 · 23 分钟

Go 并发与内存学习笔记

2022 年学习 Go 并发编程的五篇笔记(GMP 模型、垃圾回收、channel、sync.Mutex、sync.Pool)合并整理。内容主要参考极客时间 Go 并发编程实战课(鸟窝大佬),如有需要查看其详细内容,请前去购买。

2026-08-11
8969 字 · 37 分钟

Go 语言基础与工程实践笔记

2022 年学习 Go 语言基础与工程实践的多篇笔记(基础知识点、错误处理、TDD、面试复盘、学习方向思考等)合并整理。

2026-08-11
4294 字 · 18 分钟

Go 网络编程与框架学习笔记

2022 年学习 Go 网络编程的四篇笔记(HTTP 服务器/客户端、gin 框架、zinx 框架、轻量级 IM 项目)合并整理。

2026-08-11
1405 字 · 7 分钟

Gravitino 原理、部署与调优指南

Gravitino 是 Apache 孵化的统一元数据管理层:把 Hive、Iceberg、MySQL、Kafka、AI…

2026-08-11
1323 字 · 6 分钟

Hudi 原理、部署与调优指南

Hudi 是 Uber 开源的增量数据湖框架:给"不可变"的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read…

2026-08-11
1349 字 · 6 分钟

Iceberg 原理、部署与调优指南

Iceberg 是"表格式"(Table Format)不是数据库:它把"一张表"定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。

2026-08-11
2541 字 · 11 分钟

Jenkins 原理、部署与调优指南

大数据底座的迭代思路里提到"引入 CI/CD,把组件部署从手工变为流水线",落地首选就是 Jenkins。本文按"原理 → 部署 → 调优"三步整理企业级使用指南,延续《Kerberos 部署与调优指南》等系列的结构。

2026-08-11
1391 字 · 7 分钟

JuiceFS 原理、部署与调优指南

JuiceFS 是"元数据 + 数据分离"的分布式文件系统:数据放对象存储,元数据放数据库,本地留一层缓存。它给大数据底座带来的价值是存算分离的 POSIX 入口——Hadoop 生态、AI 训练、容器都挂同一份数据。本文覆盖原理、部署(客户端/Hadoop SDK/CSI)、参数优化与常见问题。