跳到主要内容

部署

13 篇文章
所有标签

浏览此标签下的所有文章

2026-08-20
5133 字 · 19 分钟

FDE(前向部署工程师)岗的核心学习方法

本文以「FDE(Forward Deployed Engineer,前向部署工程师)」为目标岗位,沿用《Agent Harness 岗的核心学习方法》的调研方法,对 Palantir、OpenAI、Anthropic、Google Cloud、Databricks、Scale AI…

2026-08-11
1372 字 · 6 分钟

Doris 原理、部署与调优指南

Doris 是 MPP(Massively Parallel Processing,大规模并行处理)分析型数据库,定位"在线报表 + 实时分析",主打高并发点查与多表 Join。本文覆盖底层原理、集群部署(FE/BE)、参数优化与常见问题,作为湖仓时代 OLAP 引擎的第一块拼图。

2026-08-11
1405 字 · 7 分钟

Gravitino 原理、部署与调优指南

Gravitino 是 Apache 孵化的统一元数据管理层:把 Hive、Iceberg、MySQL、Kafka、AI…

2026-08-11
1323 字 · 6 分钟

Hudi 原理、部署与调优指南

Hudi 是 Uber 开源的增量数据湖框架:给"不可变"的数据湖加上更新与增量读取能力。它与 Iceberg、Paimon 并称湖格式三兄弟,特点是 Copy-on-Write / Merge-on-Read…

2026-08-11
1349 字 · 6 分钟

Iceberg 原理、部署与调优指南

Iceberg 是"表格式"(Table Format)不是数据库:它把"一张表"定义为一组元数据与数据文件的规范,让 Spark/Flink/Trino/Doris 都能读写同一张表并保证 ACID。它是湖仓一体的地基。本文覆盖原理(快照与元数据层级)、集成部署(无独立服务)、参数优化与常见问题。

2026-08-11
1391 字 · 7 分钟

JuiceFS 原理、部署与调优指南

JuiceFS 是"元数据 + 数据分离"的分布式文件系统:数据放对象存储,元数据放数据库,本地留一层缓存。它给大数据底座带来的价值是存算分离的 POSIX 入口——Hadoop 生态、AI 训练、容器都挂同一份数据。本文覆盖原理、部署(客户端/Hadoop SDK/CSI)、参数优化与常见问题。

2026-08-11
1275 字 · 6 分钟

Paimon 原理、部署与调优指南

Paimon(原 Flink Table Store,Apache 孵化项目)是"流式数据湖仓":在湖格式上叠加 LSM 结构与 Changelog,让 Flink 能对湖表做流读流写,主键表支持 CDC…

2026-08-11
1444 字 · 7 分钟

StarRocks 原理、部署与调优指南

StarRocks 是从 Doris 分叉出的 MPP 分析引擎,在"高并发点查、实时更新、物化视图、存算分离"上走得更远。本文覆盖底层原理、集群部署(FE/BE)、存算分离形态、参数优化与常见问题。与《Doris 原理、部署与调优指南》对照阅读,差异点会标出来。

2026-08-10
9530 字 · 47 分钟

大数据与中间件组件部署总览

本文汇总 HDFS、YARN、Hive、Spark、Flink、Zookeeper、Kafka、MySQL、Redis、Nacos、RocketMQ 共 11 个组件的安装部署文档,统一了目录导航,便于对照查阅。各组件更深入的生产调优(8C16G / 32C256G / 64C512G…

2026-08-10
2830 字 · 11 分钟

DataSophon 部署大数据组件:参数说明与优化实践

本文基于本地源码工程(datasophon,2.0.0 分支,对应 datasophon-api/src/main/resources/meta/DDP-2.0.0)梳理 DataSophon…