大数据首先是「规模」问题:数据量、计算时间或写入速度超出单机舒适区时,就要拆分到多台机器。Volume / Velocity / Variety 描述的是不同维度的压力,而不是某一种技术。
实践与应用 · 第 2 章总进度 8/8分布式MapReduce流处理
规模直觉
容量 · 时间 · 为何要分布式
与数据工程 / AI 的联系
- 特征与样本管道:训练前的清洗、聚合、join 往往比模型本身更耗资源,大数据基础决定 ML 能不能按时跑完。
- 批流一体:离线训练常用批,在线特征与监控常用流;同一语义用两套引擎时要警惕口径漂移。
- 倾斜与热点:推荐、日志、点击流里的热 key 会拖垮作业,调参前先看分区直方图。