Project
LLM 电商评论数据价值评估
用真实性、信息价值和相关性三个维度比较 LLM 与人工评分,探索规模化评论质量评估的可靠边界。
Python · DeepSeek · G-EVAL · Data Quality · Human Evaluation
Product Snapshot
- Role
- 数据分析与评测设计
- Users
- 需要筛选高价值评论、评估训练数据质量的研究与电商团队。
- Stage
- 2025.02-2025.07 完成指标定义、DeepSeek/G-EVAL 评分、人工对照与误差分析。
- Focus
- 评论真实性、信息价值、相关性,以及 LLM 评分与人工判断的一致性。
- Validation
- 建立三维评分与 MSE/MAE 对照流程;项目材料分别记录 2,559 条原始样本和 1,589 条处理样本。
- Public Proof
- 数据集、评分脚本和报告版本;两个样本量属于不同处理阶段,不合并为同一口径。
Next Step
问题
评论数量并不等于数据价值。重复、虚假、无关或信息稀薄的评论会影响洞察和模型训练,因此需要比星级和长度更细的质量判断。
方法
我把质量拆成真实性、信息价值和相关性三个维度,使用 DeepSeek 和 G-EVAL 进行结构化评分,再与人工评分比较 MSE、MAE 和具体分歧案例。
数据口径
不同报告版本记录了 2,559 条原始样本和 1,589 条处理后样本,它们属于不同清洗阶段,不能被写成一个完全一致的评测队列。公开页面保留这一区别,以避免制造虚假的精确性。
结论
LLM 可以扩大初筛规模,但需要明确量表、人工锚点和错误分析。对高风险或边界样本,自动分数应当是审阅线索,而不是最终事实。
配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。