Project
高级分布式数据系统实验集
从 Hadoop、HBase 到 Spark、Streaming 与分类模型的一组可复现课程工程实验。
Hadoop · Spark · HBase · Spark Streaming · Python · Java
Product Snapshot
- Role
- 独立课程工程
- Stage
- 实验代码与报告已完成;指标只代表对应课程环境。
- Focus
- 分布式计算、倒排索引、流处理、HBase 版本、性能调优与用户行为预测。
- Validation
- 完成三节点 Hadoop、Spark 搜索与聚合、HBase API、微博流处理及分类调优等完整实验链。
- Public Proof
- 多份署名实验报告、代码、运行截图与指标记录;预测实验使用 schema-compatible 合成数据并明确标注。
Next Step
为什么合并成一个项目
这些实验不是互不相关的小作业,而是一条从离线批处理到流式计算、从存储接口到模型调优的数据系统学习路径。因此我把它们整理成一个可追踪的工程组合。
批处理与检索
我在华为云搭建三节点 Hadoop 环境,处理约 6.29 亿字节语料,统计 5,022,247 行、80,358,163 个 token 与 75,335,916 次转移。另一项 MapReduce 请求分析处理 37,449,160 条记录。
Spark 部分包括 12,600,000 条订单聚合,以及基于 THUCNews、TF-IDF 和倒排索引的简化搜索引擎。
存储与流处理
HBase 实验覆盖 Shell、Java API、历史版本与版本值计算。Spark Streaming 实验从 422,314 条微博源记录中流式处理 120,000 条,以每秒 10,000 条输入,使用 30 秒窗口和 10 秒滑动步长,识别 1,752 类标签。
模型与性能调优
用户行为预测实验使用 120,000 条训练记录与 100,000 条流记录,记录 AUC 0.7156。调优后 driver 处理时间从 431ms 降至 202ms,准确率保持不变。
原始课程数据源缺失,因此该实验使用按原 schema 生成的合成数据。这个限制写在报告里,也保留在这里,避免把方法验证误写成真实业务预测。
收获
比单个指标更重要的是,我开始把数据截止时间、执行环境、性能口径和数据来源当作结果的一部分,而不是报告脚注。
配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。