大数据首先是「规模」问题:Volume(体量)、Velocity(速度)、Variety(多样性)任一维度超出单机舒适区,就要拆分。Volume 看内存与扫描时间;Velocity 看每秒事件;Variety 看 schema 宽度带来的解析成本。
例:1 TiB 点击日志在 120 MiB/s 单机顺序扫要约 2.4 小时;若还要以每秒数万事件写入,单机队列会堆满——这时该上分区存储与并行计算。
当数据放不进单机内存、扫描耗时过长时,就需要分布式处理。通过交互演示理解规模拐点、MapReduce 流水线、批流权衡与分区倾斜。
可用 ← → 键切换主题
容量 · 速度 · 多样性
场景预设
size = 1000 MiB
scan ≈ 8.3 秒
velocity_pressure = 0.24
variety_pressure = 0.40
大数据首先是「规模」问题:Volume(体量)、Velocity(速度)、Variety(多样性)任一维度超出单机舒适区,就要拆分。Volume 看内存与扫描时间;Velocity 看每秒事件;Variety 看 schema 宽度带来的解析成本。
例:1 TiB 点击日志在 120 MiB/s 单机顺序扫要约 2.4 小时;若还要以每秒数万事件写入,单机队列会堆满——这时该上分区存储与并行计算。
学完演示后来检验一下。全部答对即可标记本章测验通过。
1. 什么时候更该考虑离开单机?
2. MapReduce 中 Shuffle 阶段主要做什么?
3. 数据倾斜常见表现是?