【置顶】未来学习计划 对于已经掌握的知识,必须要及时进行复盘与总结,并且进行文字化的输出! 2026 年学习方向已重新定位:过去以 Go、Java、数据库、中间件为代表的传统技术栈,大多已是成熟甚至被替代的知识。未来的重心是——理解 AI 行业、理解大模型算法、理解商业与各行各业,用 AI 赋能行业应用,本质是从”技术执行者”转向”技术价值的 2022-03-05 AI #plan #AI
C++ STL 容器学习笔记 2020-2021 年算法刷题时期学习的 C++ STL 容器笔记(map、priority_queue/multiset、unordered_map、unordered_set)合并整理。除了 bitset、priority_queue(堆)以及 AVL(平衡树相关)之外,其他的都可以进行短时间的手撕代码实现,但熟悉容器用法依然是刷题效率的基础。 map(有序映射)map 简介ma 2026-08-10 cpp #C++ #2026 #STL #map #set #priority_queue
企业级大数据底座技术架构与未来迭代思路 上一篇对比了本地 DataSophon(2.0.0)与开源增强版(3.0-SNAPSHOT)的差异。本文跳出版本之争,回答一个更本质的问题:当前企业级大数据底座的技术架构长什么样?未来 3-5 年产品如何迭代?是继续在 DataSophon 上投入,还是走所谓的技术转型? 一、当前企业级大数据底座的技术架构不管上层用什么平台管理,企业级大数据底座的物理构成大同小异,可以按七层来拆: 层次 2026-08-10 bigdata #2026 #datasophon #bigdata #架构 #转型
Doris 原理、部署与调优指南 Doris 是 MPP(Massively Parallel Processing,大规模并行处理)分析型数据库,定位”在线报表 + 实时分析”,主打高并发点查与多表 Join。本文覆盖底层原理、集群部署(FE/BE)、参数优化与常见问题,作为湖仓时代 OLAP 引擎的第一块拼图。 底层原理速览 MPP 架构:一条 SQL 拆成多个子任务在多个 BE 上并行执行,结果汇总返回,吞吐随 2026-08-10 bigdata #2026 #部署 #doris #olap
Gravitino 原理、部署与调优指南 Gravitino 是 Apache 孵化的统一元数据管理层:把 Hive、Iceberg、MySQL、Kafka、AI 模型等分散的元数据统一到一个”Metalake”里管理,并提供统一的权限与审计。它是湖仓一体时代”多引擎共享一份元数据”的基础设施。本文覆盖原理(四级模型)、部署(gravitino-server + Catalog 对接)、参数优化与常见问题。 底层原理速览 四级模型:M 2026-08-10 bigdata #2026 #部署 #gravitino #元数据
Iceberg 原理、部署与调优指南 Iceberg 是”表格式”(Table Format)不是数据库:它把”一张表”定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。 底层原理速览 三层元数据:Table Metadata(表元数据 2026-08-10 bigdata #2026 #部署 #iceberg #湖仓
Hudi 原理、部署与调优指南 Hudi 是 Uber 开源的增量数据湖框架:给”不可变”的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read 双表型与成熟的索引体系。本文覆盖原理、集成部署(Spark/Flink)、参数优化与常见问题。 底层原理速览 两种表类型: COW(Copy-on-Write,写时 2026-08-10 bigdata #2026 #部署 #湖仓 #hudi
JuiceFS 原理、部署与调优指南 JuiceFS 是”元数据 + 数据分离”的分布式文件系统:数据放对象存储,元数据放数据库,本地留一层缓存。它给大数据底座带来的价值是存算分离的 POSIX 入口——Hadoop 生态、AI 训练、容器都挂同一份数据。本文覆盖原理、部署(客户端/Hadoop SDK/CSI)、参数优化与常见问题。 底层原理速览 三件套架构:对象存储(存数据)+ 元数据引擎(存目录/ 2026-08-10 bigdata #2026 #部署 #juicefs #存储
Paimon 原理、部署与调优指南 Paimon(原 Flink Table Store,Apache 孵化项目)是”流式数据湖仓”:在湖格式上叠加 LSM 结构与 Changelog,让 Flink 能对湖表做流读流写,主键表支持 CDC 同步与行级更新。本文覆盖原理(LSM/Bucket/Changelog)、集成部署(Flink/Spark)、参数优化与常见问题。 底层原理速览 表类型:主键表 2026-08-10 bigdata #2026 #部署 #flink #湖仓 #paimon
StarRocks 原理、部署与调优指南 StarRocks 是从 Doris 分叉出的 MPP 分析引擎,在”高并发点查、实时更新、物化视图、存算分离”上走得更远。本文覆盖底层原理、集群部署(FE/BE)、存算分离形态、参数优化与常见问题。与《Doris 原理、部署与调优指南》对照阅读,差异点会标出来。 底层原理速览 FE / BE 架构:与 Doris 同源(FE 元数据与查询规划,BE 存储与执行),但查询优 2026-08-10 bigdata #2026 #部署 #olap #starrocks
Go 语言基础与工程实践笔记 2022 年学习 Go 语言基础与工程实践的多篇笔记(基础知识点、错误处理、TDD、面试复盘、学习方向思考等)合并整理。 Go 基础知识点自我总结 tips: 总结知识点一定要自己动手,这样知识点才能牢记!比如开源社区有雨痕大佬的 Go 语言笔记,但是光看几个用法,而不进行代码的编写,代码能力提升不明显,能看懂,但是做不到,形成一种眼高手低的习惯。更何况,以后的工作本来就是写需求的代码,所以, 2026-08-10 go #面试 #2026 #Go #TDD #错误处理
Go 网络编程与框架学习笔记 2022 年学习 Go 网络编程的四篇笔记(HTTP 服务器/客户端、gin 框架、zinx 框架、轻量级 IM 项目)合并整理。 Golang 开发一个 HTTP Web 服务器/客户端 之前的 zinx 学习,是基于 TCP/UDP 的 socket 协议进行编写,而本次要实现的是基于 HTTP 协议开发一个 Web 服务器端与客户端! 2026-08-10 go #2026 #Go #HTTP #gin #zinx #IM
Go 并发与内存学习笔记 2022 年学习 Go 并发编程的五篇笔记(GMP 模型、垃圾回收、channel、sync.Mutex、sync.Pool)合并整理。内容主要参考极客时间 Go 并发编程实战课(鸟窝大佬),如有需要查看其详细内容,请前去购买。 GMP 模型分析关于 GMP 模型的一些理解,G 为 goroutine,M 为 thread(内核级线程)、P 为 Processor(处理器)。 Golang 早 2026-08-10 go #2026 #Go #GMP #GC #channel #mutex #sync
Jenkins 原理、部署与调优指南 大数据底座的迭代思路里提到”引入 CI/CD,把组件部署从手工变为流水线”,落地首选就是 Jenkins。本文按”原理 → 部署 → 调优”三步整理企业级使用指南,延续《Kerberos 部署与调优指南》等系列的结构。 一、Jenkins 核心原理1、Jenkins 是什么Jenkins 是 Java 编写的开源 CI/CD 工具,负责”自动化的构建、测试、发布”。它的核心 2026-08-10 middleware #2026 #middleware #jenkins #ci/cd #devops
MySQL 学习笔记:SQL 复习、原理与优化 2022 年学习 MySQL 的三篇笔记(SQL 语法复习、MySQL 原理、MySQL 优化)合并整理。原理先行,实践在后。 一、SQL 语法复习轻量化复盘一下 SQL 操作,以及 MySQL。 SELECT 语句数据查询是关系运算理论在 SQL 语言中的主要体现。SQL 的数据查询只有一条 SELECT 语句,其使用最广泛。一个完整的 SELECT 语句包含了六个子句,前两个子句是必备的, 2026-08-10 middleware #2026 #middleware #mysql #sql #innodb
Redis 学习笔记:概念、持久化与底层 2022 年学习 Redis 的两篇笔记(浅谈 Redis 中间件、深入理解 Redis 底层)合并整理。教程来源于 b站狂神说 Java 的 Redis 教程,底层部分配图主要来自极客时间。 Redis 概念1、Redis 是基于计算机内存的数据库,一般称为缓存数据库,由于没有固定的表结构与关系,也叫 NoSQL(Not Only SQL)数据库。 2、为什么要使用 Redis: 数据的爆 2026-08-10 middleware #2026 #middleware #redis
2022 年周总结合集 2022 年 3 月至 6 月写的 9 篇周总结合并整理。求职、成长、技术学习的记录,按时间顺序保留。 第 11 周总结(2022-03-14)上一周没怎么写博客,第一个是杂事比较多,理论方向的学习偏少;第二是跟大佬交流,发现自己存在找原因性的思维方式,需要转变自己的思维。因此,一段时间写一次总结性的博客是很有必要的。 关于求职大佬提醒我,要建立模板化、模块化的求职思路,如面试之前需要搜集相关 2026-08-10 summary #2026 #2022 #总结
DataSophon 部署大数据组件:参数说明与优化实践 本文基于本地源码工程(datasophon,2.0.0 分支,对应 datasophon-api/src/main/resources/meta/DDP-2.0.0)梳理 DataSophon 的组件部署机制:服务如何定义、参数如何组织、平台如何自动注入变量,并逐一给出核心组件的参数说明与优化建议。此前的手工部署与调优系列(HDFS/YARN/Hive/Spark& 2026-08-09 bigdata #2026 #datasophon #部署
大数据与中间件组件部署总览 本文汇总 HDFS、YARN、Hive、Spark、Flink、Zookeeper、Kafka、MySQL、Redis、Nacos、RocketMQ 共 11 个组件的安装部署文档,统一了目录导航,便于对照查阅。各组件更深入的生产调优(8C16G / 32C256G / 64C512G 三档规格参数、集群规模优化、容灾备份)见对应组件各自的《XXX 生产调优实践》文章;K8S 2026-08-09 bigdata #2026 #部署 #bigdata
本地 DataSophon 与开源增强版对比及升级思路 上一篇《DataSophon 部署大数据组件》基于本地私有工程(2.0.0)。本文将其与 GitHub 公开仓库 88fantasy/datasophon(3.0-SNAPSHOT,深度定制分支)做全面对比:技术栈、通信架构、组件清单、参数模型,并给出”要不要升、怎么升”的决策与迁移思路。 一、两个工程的定位 工程 版本 来源 定位 本地工程(IdeaProjects/datasop 2026-08-09 bigdata #2026 #datasophon #升级