Project dossier

active20265 entries

Bilibili Analyzer

一个围绕公开数据采集、热度评分、趋势识别和云边大数据实践构建的 B 站内容分析项目。

Next.jsPythonFastAPIKafkaHDFSSparkHive

项目简介

Bilibili Analyzer 是一个面向 B 站内容分析的毕业设计和实践项目。它把公开数据整理成可浏览、可比较、可解释的内容信号,用于观察热门内容、增长变化和趋势特征。

核心能力

  • 持续采集公开视频的播放、互动、分区、标题和时间信息。
  • 用快照记录数据变化,为趋势观察提供时间序列基础。
  • 计算热度分、爆发信号、曲线模式和关联信息。
  • 在前端把榜单、趋势和单个视频详情组织成可继续分析的入口。
  • 扩展云边大数据运行环境,实践 Kafka、HDFS、Spark、Hive 和 Linux 运维。

技术与数据流

原始数据经过采集和快照保存后进入分析服务,生成热度、趋势和推荐相关结果,再通过接口提供给前端。云边扩展中,云端持续采集并保存批次;移动硬盘上的 Ubuntu 在上线时运行 Kafka、HDFS、Spark 和 Hive,处理积压批次后回传结果。

HDFS 使用 Bronze、Silver、Gold 分层保存原始、清洗和面向查询的数据。Agent 负责任务状态和结果上传;当计算已经完成但回传失败时,结果会保存在 SQLite/spool 中等待重试。

项目边界与状态

当前已经完成公开数据采集、趋势分析和云边大数据 V1 闭环。项目仍在继续补充监控、告警和更长期的运维能力。热度评分和推荐评估用于辅助观察,不把结果当作对内容表现的确定结论。

关联内容