← Projects

Project

人民日报 B 站传播研究:标题与语义偏移

基于 2,465 条视频和 13 个字段,分析标题语义、标签与互动数据之间的关系,并诚实报告模型的低解释力。

Python · Web Scraping · Sentence-Transformers · scikit-learn · Communication Research

Product Snapshot

Role
Independent researcher
Focus
三轮迭代完成抓取、标题与互动分析、语义相似度和标签特征建模。
Validation
最终数据集含 2021.06-2023.12 的 2,465 条视频和 13 个字段;语义相似度均值约 0.408,随机森林测试 R² 为 0.028。
Public Proof
Notebook、最终数据集和 50 条随机样本审计;低 R² 被保留为结论边界,而非隐藏。

Next Step

Portfolio PDF About the Founder Email

项目起点

这是一个持续三轮迭代的独立传播研究项目。我关注人民日报在 B 站发布的视频中,标题表达、语义结构、标签与互动数据之间是否存在稳定关系。

数据与方法

最终数据集覆盖 2021.06-2023.12,共 2,465 条视频、13 个字段,并对 50 条随机样本做了人工审计。分析链路包括:

  • jieba 分词与基础描述统计
  • Sentence-Transformers 语义表示与余弦相似度
  • 标签 One-Hot 特征与 Pearson 相关分析
  • 随机森林对互动指标的探索性建模

结果

标题相关语义相似度均值约为 0.408,政治 / 新闻标签更容易出现语义偏移;随机森林测试集 R² 仅为 0.028

低 R² 不是需要隐藏的失败,而是重要边界:现有特征几乎不能解释互动差异,传播表现可能更依赖时机、议题、平台分发和未观测变量。

我带走的经验

这个项目让我形成一个延续到 Agent Evaluation 的习惯:问题意识先行,方法为解释服务;当模型解释力很弱时,诚实报告“不知道”比制造一个漂亮结论更有价值。

继续阅读

按这条手工整理的阅读路径继续往下看。


配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。