文章归档
按日期浏览文章
八月 202661
DataX 适配 Kerberos Hadoop/Hive 集群:从 hdfsreader 到 hdfswriter 的踩坑实录
上一篇博客讲了 DolphinScheduler 怎么接入 Kerberos 认证的 Hive(数据源配置层面)。这次继续往链路深处走:调度平台里的 DataX 任务要真正读写 Kerberos 集群的 HDFS/Hive,官方开源版 DataX 直接跑不通,本文记录从 hdfsreader 读到…
DolphinScheduler 接入 Kerberos 认证 Hive:从 KDC 到数据源测试连接
一篇讲透 DolphinScheduler 接 Kerberos Hive 的全链路:底座怎么开 Kerberos、凭据怎么分发到调度节点、数据源表单里 principal / keytab / other…
FDE(前向部署工程师)岗的核心学习方法
本文以「FDE(Forward Deployed Engineer,前向部署工程师)」为目标岗位,沿用《Agent Harness 岗的核心学习方法》的调研方法,对 Palantir、OpenAI、Anthropic、Google Cloud、Databricks、Scale AI…
博客写作与维护规范(项目常规操作)
2026-08-13 发布的两篇求职分析文章在复盘时暴露了三类问题:时间先后不一致、内容重复、语句不通顺。修订完成后,我把这类问题固化为本博客项目的常规操作要求,作为每篇文章发布前的自检清单。
PowerShell 实战踩坑大全:从 GBK 乱码到引号地狱的二十个真实案例
本文是《在精简版 Windows 上恢复 WSL2 与 Docker:一次从检测到落地的全过程实录》的姊妹篇。那次任务在 PowerShell 上踩的坑,单独值得写一篇。
在精简版 Windows 上恢复 WSL2 与 Docker:一次从检测到落地的全过程实录
一台 "Ghost 精简版" Windows 11 专业版机器,想用 WSL2 + Docker,结果发现系统镜像把虚拟化组件全部精简掉了。本文完整记录了两个阶段的战斗:第一阶段是检测与原地升级(2026-08-14 深夜),把系统从 26200.7705 完整升级到…
Agent Harness 岗的核心学习方法
本文以 DeepSeek Harness 团队「Agent Harness 研发/工程方向」为目标岗位,通过对 bilibili 视频课程与 GitHub 开源项目的调研总结,系统阐述如何训练 Agent 开发与 Harness…
DeepSeek 研发岗位全量扫描与自我匹配评估
本文对幻方&DeepSeek 招聘官网全部在招岗位做全量扫描——排除产品与职能部门后,对 21 个研发/技术岗位逐一打分排序,并给出投递策略。单个岗位的逐条分析(Agent Infra)见上一篇:DeepSeek「Agent Infra 研发工程师」岗位分析与自我匹配评估。
DeepSeek「Agent Infra 研发工程师」岗位分析与自我匹配评估
岗位链接:幻方&DeepSeek 社会招聘 - Agent Infra 研发工程师
C++ STL 容器学习笔记
2020-2021 年算法刷题时期学习的 C++ STL 容器笔记(map、priority_queue/multiset、unordered_map、unordered_set)合并整理。除了 bitset、priority_queue(堆)以及…
企业级大数据底座技术架构与未来迭代思路
上一篇对比了本地 DataSophon(2.0.0)与开源增强版(3.0-SNAPSHOT)的差异。本文跳出版本之争,回答一个更本质的问题:当前企业级大数据底座的技术架构长什么样?未来 3-5 年产品如何迭代?是继续在 DataSophon 上投入,还是走所谓的技术转型?
Doris 原理、部署与调优指南
Doris 是 MPP(Massively Parallel Processing,大规模并行处理)分析型数据库,定位"在线报表 + 实时分析",主打高并发点查与多表 Join。本文覆盖底层原理、集群部署(FE/BE)、参数优化与常见问题,作为湖仓时代 OLAP 引擎的第一块拼图。
Go 并发与内存学习笔记
2022 年学习 Go 并发编程的五篇笔记(GMP 模型、垃圾回收、channel、sync.Mutex、sync.Pool)合并整理。内容主要参考极客时间 Go 并发编程实战课(鸟窝大佬),如有需要查看其详细内容,请前去购买。
Go 语言基础与工程实践笔记
2022 年学习 Go 语言基础与工程实践的多篇笔记(基础知识点、错误处理、TDD、面试复盘、学习方向思考等)合并整理。
Go 网络编程与框架学习笔记
2022 年学习 Go 网络编程的四篇笔记(HTTP 服务器/客户端、gin 框架、zinx 框架、轻量级 IM 项目)合并整理。
Gravitino 原理、部署与调优指南
Gravitino 是 Apache 孵化的统一元数据管理层:把 Hive、Iceberg、MySQL、Kafka、AI…
Hudi 原理、部署与调优指南
Hudi 是 Uber 开源的增量数据湖框架:给"不可变"的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read…
Iceberg 原理、部署与调优指南
Iceberg 是"表格式"(Table Format)不是数据库:它把"一张表"定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。
Jenkins 原理、部署与调优指南
大数据底座的迭代思路里提到"引入 CI/CD,把组件部署从手工变为流水线",落地首选就是 Jenkins。本文按"原理 → 部署 → 调优"三步整理企业级使用指南,延续《Kerberos 部署与调优指南》等系列的结构。
JuiceFS 原理、部署与调优指南
JuiceFS 是"元数据 + 数据分离"的分布式文件系统:数据放对象存储,元数据放数据库,本地留一层缓存。它给大数据底座带来的价值是存算分离的 POSIX 入口——Hadoop 生态、AI 训练、容器都挂同一份数据。本文覆盖原理、部署(客户端/Hadoop SDK/CSI)、参数优化与常见问题。
MySQL 学习笔记:SQL 复习、原理与优化
2022 年学习 MySQL 的三篇笔记(SQL 语法复习、MySQL 原理、MySQL 优化)合并整理。原理先行,实践在后。
Paimon 原理、部署与调优指南
Paimon(原 Flink Table Store,Apache 孵化项目)是"流式数据湖仓":在湖格式上叠加 LSM 结构与 Changelog,让 Flink 能对湖表做流读流写,主键表支持 CDC…
Redis 学习笔记:概念、持久化与底层
2022 年学习 Redis 的两篇笔记(浅谈 Redis 中间件、深入理解 Redis 底层)合并整理。教程来源于 b站狂神说 Java 的 Redis 教程,底层部分配图主要来自极客时间。
StarRocks 原理、部署与调优指南
StarRocks 是从 Doris 分叉出的 MPP 分析引擎,在"高并发点查、实时更新、物化视图、存算分离"上走得更远。本文覆盖底层原理、集群部署(FE/BE)、存算分离形态、参数优化与常见问题。与《Doris 原理、部署与调优指南》对照阅读,差异点会标出来。
2022 年周总结合集
2022 年 3 月至 6 月写的 9 篇周总结合并整理。求职、成长、技术学习的记录,按时间顺序保留。
大数据与中间件组件部署总览
本文汇总 HDFS、YARN、Hive、Spark、Flink、Zookeeper、Kafka、MySQL、Redis、Nacos、RocketMQ 共 11 个组件的安装部署文档,统一了目录导航,便于对照查阅。各组件更深入的生产调优(8C16G / 32C256G / 64C512G…
DataSophon 部署大数据组件:参数说明与优化实践
本文基于本地源码工程(datasophon,2.0.0 分支,对应 datasophon-api/src/main/resources/meta/DDP-2.0.0)梳理 DataSophon…
本地 DataSophon 与开源增强版对比及升级思路
上一篇《DataSophon 部署大数据组件》基于本地私有工程(2.0.0)。本文将其与 GitHub 公开仓库 88fantasy/datasophon(3.0-SNAPSHOT,深度定制分支)做全面对比:技术栈、通信架构、组件清单、参数模型,并给出"要不要升、怎么升"的决策与迁移思路。
Flink 生产调优实践
Flink 调优的核心矛盾是内存三分(JVM 堆、托管内存、堆外)与状态后端(RocksDB 还是堆内)的选择,其次是并行度与检查点的节奏。调优目标是:作业吞吐稳定、故障秒级恢复、不丢数据。部署安装见《大数据与中间件组件部署总览》。
HDFS 生产调优实践
HDFS 的调优思路只有一条主线:NameNode 是瓶颈,DataNode 是 IO。NameNode 吃内存(元数据全在堆里),DataNode 吃磁盘与网络。所以调优时先算两笔账:集群的块数决定 NameNode…
Hive 生产调优实践
Hive 调优的抓手分三层:执行引擎(MR/Tez/Spark 的选择)、单作业参数(并行度、MapJoin、Reducer 数)、数仓建设(分区、文件格式、小文件)。前两层是调参数,第三层是调习惯——数仓层的收益远大于参数层。部署安装见《大数据与中间件组件部署总览》。
Kafka 生产调优实践
Kafka 调优的本质是吞吐与可靠的权衡:Producer 侧(batch、压缩、acks)、Broker 侧(IO 线程、分段、保留策略)、Consumer 侧(拉取、提交、分区并行)。Kafka 最大的性能秘密在页缓存——它不靠 JVM…
Kerberos 部署与调优指南
Kerberos 是 Hadoop 生态(HDFS/YARN/Hive/Kafka 等)的标准认证协议:客户端先向 KDC 拿票据,再用票据访问服务,全程不传密码。部署的核心是 KDC 服务 + 每个组件的…
Kubernetes 常见问题排查
K8S 排障有固定套路:先看事件,再看日志,最后看资源状态。绝大多数问题能通过 kubectl describe、kubectl logs、kubectl get events 三步定位。本文按"Pod 起不来 → 网络不通 → 存储异常 → 控制面异常"的顺序整理高频问题。
Kubernetes 底层原理
Kubernetes(K8S)是容器编排的事实标准。理解它的底层原理,记住一条主线就够:声明式 API + 控制器循环——用户声明"我要 3 个副本",控制器不停地对比"现状"与"期望"并拉齐。本文梳理控制面、数据面、调度、网络、存储五大块。
Kubernetes 部署参数优化
K8S 部署优化分两层:集群层(控制面规格、etcd 磁盘、系统参数)与工作负载层(requests/limits、调度策略、扩缩容)。本文给出 8C16G / 32C256G / 64C512G 三种节点规格下的部署建议,以及大数据/中间件组件容器化的关键参数。
MySQL 生产调优实践
MySQL 调优的优先级永远是:慢查询 → 索引 → 参数。参数调优是最后一步——一个被慢查询拖垮的库,innodb_buffer_pool_size 调得再大也救不了。本文先给参数理解与规格表,再强调集群规模的读写分离与容灾。部署安装见《大数据与中间件组件部署总览》。
Nacos 生产调优实践
Nacos 的调优重点是容量与稳定性:能承载多少服务实例、多少配置变更、客户端长连接(gRPC)与推送如何并发。单机 Derby 模式只配测试;生产调优的第一动作就是外接 MySQL 并组成 3 节点集群。部署安装见《大数据与中间件组件部署总览》。
opencode 数据备份与恢复方案
用 opencode 写代码、记对话,所有会话历史都存在本地。一旦硬盘损坏或者系统重装,几年的积累就全没了。本文记录我搭建的"NAS 每日备份 + 安全恢复"完整方案,Windows / Linux / macOS 三平台通用。
Ranger 部署与调优指南
Ranger 是 Hadoop 生态的集中授权与审计系统:管理员在网页上配置"谁能访问哪些资源、什么权限",各组件(HDFS/Hive/Kafka/YARN)通过内置插件实时拦截执行。与 Kerberos(认证:你是谁)配合,Ranger…
Redis 生产调优实践
Redis 是单线程模型(6.x 起 IO 线程可选),调优思路与其他组件相反:不是加资源,而是控制单个操作的成本——大 Key、慢命令、全量复制是三大杀手。内存管理(淘汰策略、编码优化)与持久化取舍是日常重点。部署安装见《大数据与中间件组件部署总览》。
RocketMQ 生产调优实践
RocketMQ 的调优主线是刷盘与复制的两对选择:异步刷盘还是同步刷盘、异步复制还是同步复制——组合出四种可靠性与性能档位;其次是 Broker 的 JVM 与磁盘 IO。生产默认"异步刷盘 + 异步复制"性能最好,核心链路升到"同步复制"。部署安装见《大数据与中间件组件部署总览》。
Spark 生产调优实践
Spark 调优围绕四个变量转:Executor 的数量 × 单 Executor 的内存 × 单 Executor…
Tez 部署与调优指南
Tez 是 Hive 的 DAG 执行引擎,把多轮 MapReduce 的"写盘-重读"改成一张 DAG 内存流转,SQL 性能提升 2~3 倍是常态。它不独立部署(寄生于 YARN),部署动作是"把 Tez 库放到 HDFS + 让 Hive 引擎指向它"。本文覆盖底层原理(衔接《Tez…
YARN 生产调优实践
YARN 调优的核心是算好每台机器能拿出多少资源给容器,以及资源怎么分给不同业务。前者是内存与核数预算(要留给操作系统和系统进程),后者是队列规划(Capacity Scheduler)。调不好最常见的症状:作业一直 ACCEPTED 不跑、容器…
Zookeeper 生产调优实践
Zookeeper 是"轻量但金贵"的组件:它吃磁盘 IO(事务日志)、吃网络(同步)、吃GC(内存)。调优的核心是保护它的这三个资源——ZK 抖动一次,Kafka/HBase/HDFS HA 全跟着抖。部署安装见《大数据与中间件组件部署总览》。
AI Agent 知识概念总结
从 LLM 到 Agent:大模型应用落地的最重要形态——AI Agent(智能体)核心知识概念梳理。
Flink 底层原理与知识要点
本文是对 Flink 核心知识的系统性总结,覆盖架构、流处理模型、窗口与 Watermark、状态编程、Checkpoint 容错、常用参数以及日常问题排查要点,作为个人技术笔记使用。
HDFS 底层原理与知识要点
大数据入门的第一块基石就是 HDFS。作为 Hadoop 的分布式文件系统,它藏了很多"为什么":为什么块是 128M?为什么写数据要走 pipeline?NameNode 挂了数据会不会丢?这篇文章把 HDFS 的架构、原理、参数和排障经验梳理一遍。
Hive 底层原理与知识要点
Hive 是大数据圈"SQL 化"的起点:把 HDFS 上的数据抽象成表,把 SQL 翻译成 MapReduce/Tez/Spark 作业。它不存数据、不跑计算,只做翻译和元数据管理。搞懂 Hive 的架构和优化手段,是数据开发的基本功。
Kafka 底层原理与知识要点
本文是我学习 Kafka 时整理的笔记,涵盖核心架构、底层存储原理、副本与一致性机制、生产消费流程,以及日常排障的经验总结,适合面试复习和实际排查问题参考。
MapReduce 底层原理与知识要点
学大数据绕不开 MapReduce,它是 Hadoop 分布式计算的基石。这篇文章是我对 MapReduce 底层原理的总结,从计算模型讲到执行流程,再到参数调优和常见问题排查,希望能帮你把这块知识串起来。
MySQL 底层原理与知识要点
本文是对 MySQL 核心知识的系统性总结,覆盖架构、InnoDB 索引、事务与 MVCC、锁、日志、缓冲池以及日常问题排查要点,作为个人技术笔记使用。
Nacos 底层原理与知识要点
本文梳理 Nacos 的架构、服务发现(AP/Distro)、配置中心(长轮询)、集群一致性(Raft + Derby/MySQL)、与主流注册中心的对比,以及常见问题的排查思路。
Redis 底层原理与知识要点
本文总结 Redis 的核心底层原理:数据结构实现、单线程模型、持久化机制、过期与淘汰策略、缓存三大问题、高可用方案以及常见问题排查要点,作为个人技术笔记。
深度好文:为何穷人完不成资本积累?
转载声明:本文转载自微信公众号「猫视青年」(经世致用,知行合一!),版权归原作者所有,已注明作者与原文链接。 原文链接:https://mp.weixin.qq.com/s/Pw_KqD-TTQ-6IbSbWUzS1w
RocketMQ 底层原理与知识要点
本文是我学习 RocketMQ 时整理的笔记,围绕四大组件、存储与高可用架构、消息模型,以及线上常见的堆积、丢失、顺序与事务问题展开,适合面试复习和日常排查参考。
Spark 底层原理与知识要点
本文是对 Spark 核心知识的系统性总结,覆盖架构、RDD 与 DAG 调度、Shuffle、缓存与 Checkpoint、运行模式、常用参数以及日常问题排查要点,作为个人技术笔记使用。
Tez 底层原理与知识要点
Tez 是 Apache 旗下的 DAG 计算引擎,脱胎于 MapReduce,用于替代 MR 执行多阶段复杂作业。它把"多轮 MR 写盘"改成"一个 DAG 内存流转",性能提升肉眼可见,也是 Hive 默认执行引擎之一。
Yarn 底层原理与知识要点
Yarn 是 Hadoop 的资源调度层,负责把集群的 CPU 和内存"分蛋糕"。搞懂 Yarn,才能明白为什么任务一直卡在 ACCEPTED、为什么容器总被杀、为什么队列里任务挤成一堆。这篇文章从架构到排障完整梳理一遍。
Zookeeper 底层原理与知识要点
本文从 Zookeeper 的数据模型、ZAB 协议、Leader 选举、会话机制出发,梳理分布式协调服务的底层原理,最后给出常见问题的排查思路。
七月 20262
六月 20264
五月 20263
十二月 20218
十一月 202130
Day 82 47. 全排列 II
47. 全排列 II
Day 81 40. 组合总和 II
40. 组合总和 II
Day 80 39. 组合总和
39. 组合总和
Day 79 814. 二叉树剪枝
814. 二叉树剪枝
Day 78 1319. 连通网络的操作次数
1319. 连通网络的操作次数
Day 77 924. 尽量减少恶意软件的传播
924. 尽量减少恶意软件的传播
Day 76 547. 省份数量
547. 省份数量
Day 75 面试题 17.17. 多次搜索
面试题 17.17. 多次搜索
Day 74 677. 键值映射
677. 键值映射
Day 73 208. 实现 Trie (前缀树)
208. 实现 Trie (前缀树)
Day 72 78. 子集
78. 子集
Day 71 260. 只出现一次的数字 III
260. 只出现一次的数字 III
Day 70 932. 漂亮数组
932. 漂亮数组
Day 69 23. 合并K个升序链表
23. 合并K个升序链表
Day 68 96. 不同的二叉搜索树
96. 不同的二叉搜索树
Day 67 881. 救生艇
881. 救生艇
Day 66 435. 无重叠区间
435. 无重叠区间
Day 65 455. 分发饼干
455. 分发饼干
Day 64 518. 零钱兑换 II
518. 零钱兑换 II
Day 63 322. 零钱兑换
322. 零钱兑换
Day 62 494. 目标和
494. 目标和
Day 61 416. 分割等和子集
416. 分割等和子集
Day 60 464. 我能赢吗
464. 我能赢吗
Day 59 688. “马”在棋盘上的概率
688. “马”在棋盘上的概率
Day 58 62. 不同路径
62. 不同路径
Day 57 1143. 最长公共子序列
1143. 最长公共子序列
Day 56 673. 最长递增子序列的个数
673. 最长递增子序列的个数
Day 55 198. 打家劫舍
198. 打家劫舍
Day 54 746. 使用最小花费爬楼梯
746. 使用最小花费爬楼梯
Day 53 Top View of a Tree
Top View of a Tree
十月 202140
Day 52 Shortest Cycle Containing Target Node
Shortest Cycle Containing Target Node
Day 51 1162. 地图分析
1162. 地图分析
Day 50 695. 岛屿的最大面积
695. 岛屿的最大面积
Day 49 52. N皇后 II
52. N 皇后 II
Day 48 401. 二进制手表
401. 二进制手表
Day 47 Number of Operations to Decrement Target to Zero
Number of Operations to Decrement Target to Zero
Day 46 76. 最小覆盖子串
76. 最小覆盖子串
Day 45 438. 找到字符串中所有字母异位词
438. 找到字符串中所有字母异位词
Day 44 837. 新21点
837. 新 21 点
Day 43 1456. 定长子串中元音的最大数目
1456. 定长子串中元音的最大数目
Day 42 778. 水位上升的泳池中游泳
778. 水位上升的泳池中游泳
Day 41 822. Kth-Pair-Distance
822. Kth-Pair-Distance
Day 40 796. Minimum Light Radius
796. Minimum Light Radius
Day 39 762.Number Stream to Intervals
762.Number Stream to Intervals
Day 38 278. 第一个错误的版本
278. 第一个错误的版本
Day 37 69. Sqrt(x)
69. Sqrt(x)
Day 36 912. 排序数组
912. 排序数组
Centos 8.2 中 Git 安装
安装依赖包
Day 35 1737. 满足三条件之一需改变的最少字符数
1737. 满足三条件之一需改变的最少字符数
Day 34 1904. 你完成的完整对局数
1904. 你完成的完整对局数
Day 33 1834. 单线程 CPU
1834. 单线程 CPU
Day 32 657. 机器人能否返回原点
657. 机器人能否返回原点
Day 31 1203. 项目管理
1203. 项目管理
Day 30 886. 可能的二分法
886. 可能的二分法
16. 最接近的三数之和
16. 最接近的三数之和
187. 重复的 DNA 序列
187. 重复的 DNA 序列
Day 29 997. 找到小镇的法官
997. 找到小镇的法官
434. 字符串中的单词数
434. 字符串中的单词数
Day 28 239. 滑动窗口最大值
239. 滑动窗口最大值
GCC 与 GDB 的学习
gcc 是 GNU Compiler Collection 的缩写,支持多种语言的编译,比如 C、C++、Java、Pascal 等。
414. 第三大的数
414. 第三大的数
Day 27 35. 搜索插入位置
35. 搜索插入位置
284. 顶端迭代器
284. 顶端迭代器
Day 26 26. 删除有序数组中的重复项
26. 删除有序数组中的重复项
482. 密钥格式化
482. 密钥格式化
Day 25 876. 链表的中间结点
876. 链表的中间结点
Day 24 924. 删除子列表以使总和可被 K 整除
924. 删除子列表以使总和可被 K 整除
Day 23 30. 串联所有单词的子串
30. 串联所有单词的子串
Day 22 3. 无重复字符的最长子串
3. 无重复字符的最长子串
属于二战的一些个人的思考
今天想写一下二战考研的一些想法。因为自己的大学基础走得并不扎实,好好的个人综合素质被自己用得叫做一塌糊涂,自己本科时候做的项目与竞赛没得一个能拿得出手的,自己大学也就做出了一个重要的决定,就是能在大一的时候转了专业。
九月 202121
Day 21 447. 回旋镖的数量
447. 回旋镖的数量
Day 20 347. 前 K 个高频元素
347. 前 K 个高频元素
Day 19 1. 两数之和
1. 两数之和
Day 18 987. 二叉树的垂序遍历
987. 二叉树的垂序遍历
Day 17 297. 二叉树的序列化与反序列化
297. 二叉树的序列化与反序列化
Day 16 513. 找树左下角的值
513. 找树左下角的值
Day 15 129. 求根节点到叶节点数字之和
129. 求根节点到叶节点数字之和
Day 14 100. 相同的树
100. 相同的树
Day 13 104. 二叉树的最大深度
104. 二叉树的最大深度
Day 12 146. LRU 缓存机制
146. LRU 缓存机制
Day 11 142. 环形链表 II
142. 环形链表 II
Day 10 160. 相交链表
160. 相交链表
Day 9 109. 有序链表转换二叉搜索树
109. 有序链表转换二叉搜索树
Day 8 24. 两两交换链表中的节点
24. 两两交换链表中的节点
Day 7 61. 旋转链表
61. 旋转链表
Day 6 768. 最多能完成排序的块 II
768. 最多能完成排序的块 II
Day 5 232. 用栈实现队列
232. 用栈实现队列
Day 4 394. 字符串解码
394. 字符串解码
Day 3 1381. 设计一个支持增量操作的栈
1381. 设计一个支持增量操作的栈
Day 2 821. 字符的最短距离
821. 字符的最短距离
Day 1 989. 数组形式的整数加法
989. 数组形式的整数加法