加载中…
首页/AI 学习

大数据基础

当数据放不进单机内存、扫描耗时过长时,就需要分布式处理。通过交互演示理解规模拐点、MapReduce 流水线、批流权衡与分区倾斜。

建议先修

以下章节有助于理解本章内容(非强制):

机器学习入门训练与调参
实践与应用 · 第 2 章路径 8/8本章完成 0%分布式MapReduce流处理

可用 ← → 键切换主题

批与流

吞吐 · 延迟 · 完整性

核心概念速查

  • Shuffle:按 key 重新分区,网络与磁盘成本通常最高。
  • Straggler:最慢任务决定作业完成时间(makespan)。
  • Salting:给热 key 加随机盐打散,再二次聚合。
  • Lambda / Kappa:批+流双链路 vs 尽量统一为流。

何时用什么

  • Spark:大规模批处理、交互式分析、湖仓 ETL。
  • Flink:低延迟流、精确一次状态计算、CEP。
  • Kafka:事件总线与缓冲,衔接批/流消费端。
  • 先定 SLA(延迟 / 吞吐 / 完整度),再选引擎。

大数据基础检查点

学完演示后来检验一下。全部答对即可标记本章测验通过。

  1. 1. 什么时候更该考虑离开单机?

  2. 2. MapReduce 中 Shuffle 阶段主要做什么?

  3. 3. 数据倾斜常见表现是?

与数据工程 / AI 的联系

  • 特征与样本管道:训练前的清洗、聚合、join 往往比模型本身更耗资源,大数据基础决定 ML 能不能按时跑完。
  • 批流一体:离线训练常用批,在线特征与监控常用流;同一语义用两套引擎时要警惕口径漂移。
  • 倾斜与热点:推荐、日志、点击流里的热 key 会拖垮作业,调参前先看分区直方图。
← 上一章:训练与调参
学习中心8 / 8
完成路径,返回中心

批处理

微批间隔 5.0 分钟

端到端延迟(建模)2.6 分钟
相对吞吐92%
完整度100%

延迟 ≈ 间隔/2 + 固定处理,间隔越大吞吐越高。

流处理

窗口 15 秒

端到端延迟(建模)17 秒
相对吞吐56%
完整度90%

窗口越小越实时,但调度开销上升、吞吐下降。

当前建议:偏流处理

流延迟显著低于批,适合仪表盘 / 告警;请确认近似完整度可接受。

批指标流指标

场景预设

batch_e2e = 2.6 分钟

stream_e2e = 17 秒

批处理追求高吞吐与可重放;流处理追求低延迟与持续更新。微批间隔决定平均等待,端到端延迟 ≈ 间隔/2 + 处理时间。Lambda 用批+流两套链路,Kappa 尽量统一为流。

例:小时级对账报表用 30–60 分钟批;实时大盘用 5–15 秒窗口。SLA 决定选型,而不是框架名字。

相关演示

训练与调参:迭代节奏 →大数据:规模直觉 →