加载中…
首页/AI 学习

大数据基础

当数据放不进单机内存、扫描耗时过长时,就需要分布式处理。通过交互演示理解规模拐点、MapReduce 流水线、批流权衡与分区倾斜。

建议先修

以下章节有助于理解本章内容(非强制):

机器学习入门
实践与应用 · 第 2 章总进度 8/8分布式MapReduce流处理

规模直觉

容量 · 时间 · 为何要分布式

与数据工程 / AI 的联系

  • 特征与样本管道:训练前的清洗、聚合、join 往往比模型本身更耗资源,大数据基础决定 ML 能不能按时跑完。
  • 批流一体:离线训练常用批,在线特征与监控常用流;同一语义用两套引擎时要警惕口径漂移。
  • 倾斜与热点:推荐、日志、点击流里的热 key 会拖垮作业,调参前先看分区直方图。
← 上一章:训练与调参
学习中心8 / 8
完成路径,返回中心
当前数据量约 1.0 GB,单机扫描约 8.3 秒单机舒适区 vs 当前数据量内存舒适区(≤ 32 GB)32 GB扫描舒适区(≤ 10 分钟)~10 min @ 120 MB/s当前体量(对数)1.0 GB单机全表扫描约 8.3 秒 · 单机仍可应付
单机可处理建议分布式内存舒适区扫描舒适区

存储压力:可放入单机内存演示

计算压力:扫描时间仍在可接受范围

大数据首先是「规模」问题:数据量、计算时间或写入速度超出单机舒适区时,就要拆分到多台机器。Volume / Velocity / Variety 描述的是不同维度的压力,而不是某一种技术。

相关演示

排序可视化:外部排序场景 →机器学习:数据拟合入门 →