ARTICLE大数据
大数据系统如何选择 OLTP、OLAP 与湖仓
从数据访问模式、延迟和成本出发,梳理业务库、分析库、数据湖和湖仓的职责边界。
TOPIC
共 10 篇文章
从数据访问模式、延迟和成本出发,梳理业务库、分析库、数据湖和湖仓的职责边界。
用数据分层、粒度和指标口径解决重复加工、口径不一致和报表难以回溯的问题。
讲清事件时间、窗口、状态、乱序和 Exactly-once,避免实时指标看似及时却无法对账。
从分区、排序键、索引粒度和物化视图出发,设计高吞吐写入与低延迟分析查询。
从分区规划、文件格式、Shuffle 和 AQE 讲解离线任务的性能与稳定性。
对比 HBase、Cassandra 一类宽列存储的行键、列族、热点和查询建模方法。
讲解 Parquet、ORC、Iceberg、Hudi 和 Delta 在压缩、Schema 演进与更新场景中的取舍。
从倒排索引、分页、聚合和缓存失效出发,设计可扩展的搜索服务。
把完整性、唯一性、及时性和对账变成每个批次都能执行的质量门禁。
从存储成本、查询热度、保留期限和恢复目标出发,设计可持续的大数据存储策略。