加载中…
首页/AI 学习

大数据基础

当数据放不进单机内存、扫描耗时过长时,就需要分布式处理。通过交互演示理解规模拐点、MapReduce 流水线、批流权衡与分区倾斜。

建议先修

以下章节有助于理解本章内容(非强制):

机器学习入门训练与调参
实践与应用 · 第 2 章路径 8/8本章完成 0%分布式MapReduce流处理

可用 ← → 键切换主题

规模直觉

容量 · 速度 · 多样性

当前 1000 MiB,扫描 8.3 秒,速度压力 0.24,多样性压力 0.40Volume 对数轴 · 阈值标记1000 MiB内存 32 GiB扫描 10 分钟Velocity 压力(事件/秒)Variety 压力(字段数)单机扫描约 8.3 秒 · Volume 单机可应付Velocity 仍在单机舒适区 · Variety 可控轴:1 MiB → 1 PiB(log₁₀)
Volume 单机可处理建议分布式 / 高压内存阈值扫描阈值

场景预设

size = 1000 MiB

scan ≈ 8.3 秒

velocity_pressure = 0.24

variety_pressure = 0.40

大数据首先是「规模」问题:Volume(体量)、Velocity(速度)、Variety(多样性)任一维度超出单机舒适区,就要拆分。Volume 看内存与扫描时间;Velocity 看每秒事件;Variety 看 schema 宽度带来的解析成本。

例:1 TiB 点击日志在 120 MiB/s 单机顺序扫要约 2.4 小时;若还要以每秒数万事件写入,单机队列会堆满——这时该上分区存储与并行计算。

相关演示

排序可视化:外部排序场景 →机器学习:数据拟合入门 →

核心概念速查

  • Shuffle:按 key 重新分区,网络与磁盘成本通常最高。
  • Straggler:最慢任务决定作业完成时间(makespan)。
  • Salting:给热 key 加随机盐打散,再二次聚合。
  • Lambda / Kappa:批+流双链路 vs 尽量统一为流。

何时用什么

  • Spark:大规模批处理、交互式分析、湖仓 ETL。
  • Flink:低延迟流、精确一次状态计算、CEP。
  • Kafka:事件总线与缓冲,衔接批/流消费端。
  • 先定 SLA(延迟 / 吞吐 / 完整度),再选引擎。

大数据基础检查点

学完演示后来检验一下。全部答对即可标记本章测验通过。

  1. 1. 什么时候更该考虑离开单机?

  2. 2. MapReduce 中 Shuffle 阶段主要做什么?

  3. 3. 数据倾斜常见表现是?

与数据工程 / AI 的联系

  • 特征与样本管道:训练前的清洗、聚合、join 往往比模型本身更耗资源,大数据基础决定 ML 能不能按时跑完。
  • 批流一体:离线训练常用批,在线特征与监控常用流;同一语义用两套引擎时要警惕口径漂移。
  • 倾斜与热点:推荐、日志、点击流里的热 key 会拖垮作业,调参前先看分区直方图。
← 上一章:训练与调参
学习中心8 / 8
完成路径,返回中心