核心概念速查
- Shuffle:按 key 重新分区,网络与磁盘成本通常最高。
- Straggler:最慢任务决定作业完成时间(makespan)。
- Salting:给热 key 加随机盐打散,再二次聚合。
- Lambda / Kappa:批+流双链路 vs 尽量统一为流。
当数据放不进单机内存、扫描耗时过长时,就需要分布式处理。通过交互演示理解规模拐点、MapReduce 流水线、批流权衡与分区倾斜。
可用 ← → 键切换主题
容量 · 速度 · 多样性
学完演示后来检验一下。全部答对即可标记本章测验通过。
1. 什么时候更该考虑离开单机?
2. MapReduce 中 Shuffle 阶段主要做什么?
3. 数据倾斜常见表现是?
场景预设
size = 1000 MiB
scan ≈ 8.3 秒
velocity_pressure = 0.24
variety_pressure = 0.40
大数据首先是「规模」问题:Volume(体量)、Velocity(速度)、Variety(多样性)任一维度超出单机舒适区,就要拆分。Volume 看内存与扫描时间;Velocity 看每秒事件;Variety 看 schema 宽度带来的解析成本。
例:1 TiB 点击日志在 120 MiB/s 单机顺序扫要约 2.4 小时;若还要以每秒数万事件写入,单机队列会堆满——这时该上分区存储与并行计算。