【置顶】未来学习计划 对于已经掌握的知识,必须要及时进行复盘与总结,并且进行文字化的输出! 2026 年学习方向已重新定位:过去以 Go、Java、数据库、中间件为代表的传统技术栈,大多已是成熟甚至被替代的知识。未来的重心是——理解 AI 行业、理解大模型算法、理解商业与各行各业,用 AI 赋能行业应用,本质是从”技术执行者”转向”技术价值的 2022-03-05 #plan #AI
DataX 适配 Kerberos Hadoop/Hive 集群:从 hdfsreader 到 hdfswriter 的踩坑实录 上一篇博客讲了 DolphinScheduler 怎么接入 Kerberos 认证的 Hive(数据源配置层面)。这次继续往链路深处走:调度平台里的 DataX 任务要真正读写 Kerberos 集群的 HDFS/Hive,官方开源版 DataX 直接跑不通,本文记录从 hdfsreader 读到… 2026-08-21 bigdata #2026 #datax #hive #hdfs #kerberos
DolphinScheduler 接入 Kerberos 认证 Hive:从 KDC 到数据源测试连接 一篇讲透 DolphinScheduler 接 Kerberos Hive 的全链路:底座怎么开 Kerberos、凭据怎么分发到调度节点、数据源表单里 principal / keytab / other… 2026-08-21 bigdata #2026 #hive #kerberos #dolphinscheduler
FDE(前向部署工程师)岗的核心学习方法 本文以「FDE(Forward Deployed Engineer,前向部署工程师)」为目标岗位,沿用《Agent Harness 岗的核心学习方法》的调研方法,对 Palantir、OpenAI、Anthropic、Google Cloud、Databricks、Scale AI… 2026-08-20 AI #2026 #AI #Agent #求职 #FDE #部署
博客写作与维护规范(项目常规操作) 2026-08-13 发布的两篇求职分析文章在复盘时暴露了三类问题:时间先后不一致、内容重复、语句不通顺。修订完成后,我把这类问题固化为本博客项目的常规操作要求,作为每篇文章发布前的自检清单。 2026-08-14 AI #2026 #规范 #写作
PowerShell 实战踩坑大全:从 GBK 乱码到引号地狱的二十个真实案例 本文是《在精简版 Windows 上恢复 WSL2 与 Docker:一次从检测到落地的全过程实录》的姊妹篇。那次任务在 PowerShell 上踩的坑,单独值得写一篇。 2026-08-14 powershell #PowerShell #Windows #DISM #脚本 #踩坑
在精简版 Windows 上恢复 WSL2 与 Docker:一次从检测到落地的全过程实录 一台 "Ghost 精简版" Windows 11 专业版机器,想用 WSL2 + Docker,结果发现系统镜像把虚拟化组件全部精简掉了。本文完整记录了两个阶段的战斗:第一阶段是检测与原地升级(2026-08-14 深夜),把系统从 26200.7705 完整升级到… 2026-08-14 windows #Windows #DISM #踩坑 #WSL2 #Docker #容器 #MSI #系统重装
Agent Harness 岗的核心学习方法 本文以 DeepSeek Harness 团队「Agent Harness 研发/工程方向」为目标岗位,通过对 bilibili 视频课程与 GitHub 开源项目的调研总结,系统阐述如何训练 Agent 开发与 Harness… 2026-08-14 AI #2026 #AI #DeepSeek #Agent #Harness #多智能体 #求职
DeepSeek 研发岗位全量扫描与自我匹配评估 本文对幻方&DeepSeek 招聘官网全部在招岗位做全量扫描——排除产品与职能部门后,对 21 个研发/技术岗位逐一打分排序,并给出投递策略。单个岗位的逐条分析(Agent Infra)见上一篇:DeepSeek「Agent Infra 研发工程师」岗位分析与自我匹配评估。 2026-08-13 AI #2026 #DeepSeek #Agent #求职
DeepSeek「Agent Infra 研发工程师」岗位分析与自我匹配评估 岗位链接:幻方&DeepSeek 社会招聘 - Agent Infra 研发工程师 2026-08-13 AI #2026 #DeepSeek #Agent #求职 #Infra
C++ STL 容器学习笔记 2020-2021 年算法刷题时期学习的 C++ STL 容器笔记(map、priority_queue/multiset、unordered_map、unordered_set)合并整理。除了 bitset、priority_queue(堆)以及 AVL(平衡树相关)之外,其他的都可以进行短时间的手撕代码实现,但熟悉容器用法依然是刷题效率的基础。 map(有序映射)map 简介ma 2026-08-10 cpp #2026 #STL #C++ #map #set #priority_queue
Go 语言基础与工程实践笔记 2022 年学习 Go 语言基础与工程实践的多篇笔记(基础知识点、错误处理、TDD、面试复盘、学习方向思考等)合并整理。 Go 基础知识点自我总结 tips: 总结知识点一定要自己动手,这样知识点才能牢记!比如开源社区有雨痕大佬的 Go 语言笔记,但是光看几个用法,而不进行代码的编写,代码能力提升不明显,能看懂,但是做不到,形成一种眼高手低的习惯。更何况,以后的工作本来就是写需求的代码,所以, 2026-08-10 go #2026 #面试 #Go #TDD #错误处理
Go 网络编程与框架学习笔记 2022 年学习 Go 网络编程的四篇笔记(HTTP 服务器/客户端、gin 框架、zinx 框架、轻量级 IM 项目)合并整理。 Golang 开发一个 HTTP Web 服务器/客户端 之前的 zinx 学习,是基于 TCP/UDP 的 socket 协议进行编写,而本次要实现的是基于 HTTP 协议开发一个 Web 服务器端与客户端! 2026-08-10 go #2026 #Go #HTTP #gin #zinx #IM
Go 并发与内存学习笔记 2022 年学习 Go 并发编程的五篇笔记(GMP 模型、垃圾回收、channel、sync.Mutex、sync.Pool)合并整理。内容主要参考极客时间 Go 并发编程实战课(鸟窝大佬),如有需要查看其详细内容,请前去购买。 GMP 模型分析关于 GMP 模型的一些理解,G 为 goroutine,M 为 thread(内核级线程)、P 为 Processor(处理器)。 Golang 早 2026-08-10 go #2026 #Go #GMP #GC #channel #mutex #sync
企业级大数据底座技术架构与未来迭代思路 上一篇对比了本地 DataSophon(2.0.0)与开源增强版(3.0-SNAPSHOT)的差异。本文跳出版本之争,回答一个更本质的问题:当前企业级大数据底座的技术架构长什么样?未来 3-5 年产品如何迭代?是继续在 DataSophon 上投入,还是走所谓的技术转型? 一、当前企业级大数据底座的技术架构不管上层用什么平台管理,企业级大数据底座的物理构成大同小异,可以按七层来拆: 层次 2026-08-10 bigdata #2026 #datasophon #bigdata #架构 #转型
Doris 原理、部署与调优指南 Doris 是 MPP(Massively Parallel Processing,大规模并行处理)分析型数据库,定位”在线报表 + 实时分析”,主打高并发点查与多表 Join。本文覆盖底层原理、集群部署(FE/BE)、参数优化与常见问题,作为湖仓时代 OLAP 引擎的第一块拼图。 底层原理速览 MPP 架构:一条 SQL 拆成多个子任务在多个 BE 上并行执行,结果汇总返回,吞吐随 2026-08-10 bigdata #2026 #部署 #doris #olap
Gravitino 原理、部署与调优指南 Gravitino 是 Apache 孵化的统一元数据管理层:把 Hive、Iceberg、MySQL、Kafka、AI 模型等分散的元数据统一到一个”Metalake”里管理,并提供统一的权限与审计。它是湖仓一体时代”多引擎共享一份元数据”的基础设施。本文覆盖原理(四级模型)、部署(gravitino-server + Catalog 对接)、参数优化与常见问题。 底层原理速览 四级模型:M 2026-08-10 bigdata #2026 #部署 #gravitino #元数据
Hudi 原理、部署与调优指南 Hudi 是 Uber 开源的增量数据湖框架:给”不可变”的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read 双表型与成熟的索引体系。本文覆盖原理、集成部署(Spark/Flink)、参数优化与常见问题。 底层原理速览 两种表类型: COW(Copy-on-Write,写时 2026-08-10 bigdata #2026 #部署 #hudi #湖仓
Iceberg 原理、部署与调优指南 Iceberg 是”表格式”(Table Format)不是数据库:它把”一张表”定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。 底层原理速览 三层元数据:Table Metadata(表元数据 2026-08-10 bigdata #2026 #部署 #湖仓 #iceberg
JuiceFS 原理、部署与调优指南 JuiceFS 是”元数据 + 数据分离”的分布式文件系统:数据放对象存储,元数据放数据库,本地留一层缓存。它给大数据底座带来的价值是存算分离的 POSIX 入口——Hadoop 生态、AI 训练、容器都挂同一份数据。本文覆盖原理、部署(客户端/Hadoop SDK/CSI)、参数优化与常见问题。 底层原理速览 三件套架构:对象存储(存数据)+ 元数据引擎(存目录/ 2026-08-10 bigdata #2026 #部署 #juicefs #存储