← Projects

Project

LLM 电商评论数据价值评估

用真实性、信息价值和相关性三个维度比较 LLM 与人工评分,探索规模化评论质量评估的可靠边界。

Python · DeepSeek · G-EVAL · Data Quality · Human Evaluation

Product Snapshot

Role
数据分析与评测设计
Users
需要筛选高价值评论、评估训练数据质量的研究与电商团队。
Stage
2025.02-2025.07 完成指标定义、DeepSeek/G-EVAL 评分、人工对照与误差分析。
Focus
评论真实性、信息价值、相关性,以及 LLM 评分与人工判断的一致性。
Validation
建立三维评分与 MSE/MAE 对照流程;项目材料分别记录 2,559 条原始样本和 1,589 条处理样本。
Public Proof
数据集、评分脚本和报告版本;两个样本量属于不同处理阶段,不合并为同一口径。

Next Step

Portfolio PDF About the Founder Email

问题

评论数量并不等于数据价值。重复、虚假、无关或信息稀薄的评论会影响洞察和模型训练,因此需要比星级和长度更细的质量判断。

方法

我把质量拆成真实性、信息价值和相关性三个维度,使用 DeepSeek 和 G-EVAL 进行结构化评分,再与人工评分比较 MSE、MAE 和具体分歧案例。

数据口径

不同报告版本记录了 2,559 条原始样本和 1,589 条处理后样本,它们属于不同清洗阶段,不能被写成一个完全一致的评测队列。公开页面保留这一区别,以避免制造虚假的精确性。

结论

LLM 可以扩大初筛规模,但需要明确量表、人工锚点和错误分析。对高风险或边界样本,自动分数应当是审阅线索,而不是最终事实。

继续阅读

按这条手工整理的阅读路径继续往下看。


配置公开站点的 Giscus 环境变量后,这里就会出现讨论区。