Project
DEA 演化与文献计量分析流水线
从 5.4 万条 Scopus 记录出发,构建清洗、领域分类、学者指标、合作网络与主路径分析的一体化研究流水线。
Python · Scopus · Bibliometrics · Network Analysis · DeepSeek
Product Snapshot
- Role
- 数据研究与分析工程
- Users
- 需要理解 DEA 研究演化、应用领域和关键路径的研究团队。
- Stage
- 2025.09-2026.03 完成数据清洗、分类、指标计算、网络分析与报告素材。
- Focus
- 大规模文献清洗、LLM 辅助分类、学者指标、合作网络与 SPC 主路径。
- Validation
- 将 53,954 条 Scopus 原始记录整理为约 33,690 篇应用研究文献,并形成可复用分析管线。
- Public Proof
- 原始与处理后数据、Python 分析脚本、图表和研究输出交叉验证。
Next Step
研究目标
这个项目试图回答:DEA 方法如何从理论研究扩展到不同应用领域,哪些作者、机构和期刊构成关键网络,以及研究路径如何随时间演化。
方法
我从 53,954 条 Scopus 原始记录开始,完成去重、字段规范化和应用论文筛选,得到约 33,690 篇研究。后续管线结合 DeepSeek 做领域分类,计算 h/g-index,并构建合作、相似性和期刊网络,使用 SPC 方法提取主路径。
结果与边界
项目形成了可复用的 Python 分析流程、结构化数据和图表输出。LLM 分类用于扩大处理规模,但不替代抽样核验;公开结果因此强调研究分布与网络结构,而不是把自动标签视为绝对真值。
配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。