Project
人民日报 B 站传播研究:标题与语义偏移
基于 2,465 条视频和 13 个字段,分析标题语义、标签与互动数据之间的关系,并诚实报告模型的低解释力。
Python · Web Scraping · Sentence-Transformers · scikit-learn · Communication Research
Product Snapshot
- Role
- Independent researcher
- Focus
- 三轮迭代完成抓取、标题与互动分析、语义相似度和标签特征建模。
- Validation
- 最终数据集含 2021.06-2023.12 的 2,465 条视频和 13 个字段;语义相似度均值约 0.408,随机森林测试 R² 为 0.028。
- Public Proof
- Notebook、最终数据集和 50 条随机样本审计;低 R² 被保留为结论边界,而非隐藏。
Next Step
项目起点
这是一个持续三轮迭代的独立传播研究项目。我关注人民日报在 B 站发布的视频中,标题表达、语义结构、标签与互动数据之间是否存在稳定关系。
数据与方法
最终数据集覆盖 2021.06-2023.12,共 2,465 条视频、13 个字段,并对 50 条随机样本做了人工审计。分析链路包括:
- jieba 分词与基础描述统计
- Sentence-Transformers 语义表示与余弦相似度
- 标签 One-Hot 特征与 Pearson 相关分析
- 随机森林对互动指标的探索性建模
结果
标题相关语义相似度均值约为 0.408,政治 / 新闻标签更容易出现语义偏移;随机森林测试集 R² 仅为 0.028。
低 R² 不是需要隐藏的失败,而是重要边界:现有特征几乎不能解释互动差异,传播表现可能更依赖时机、议题、平台分发和未观测变量。
我带走的经验
这个项目让我形成一个延续到 Agent Evaluation 的习惯:问题意识先行,方法为解释服务;当模型解释力很弱时,诚实报告“不知道”比制造一个漂亮结论更有价值。
配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。