LexMemoryBench:家庭长期记忆评测
2026-至今为多成员家庭机器人设计长期记忆合成数据流水线,重点评测跨成员、跨会话的信息归属与召回。
落地五段式 typed pipeline,让同一家庭中的不同成员拥有可区分、可审计的记忆事实与自然会话。
公开版本的项目叙述,保留必要的技术细节,也保留作品本身的呼吸感。
LexMemoryBench:家庭长期记忆评测
2026-至今为多成员家庭机器人设计长期记忆合成数据流水线,重点评测跨成员、跨会话的信息归属与召回。
落地五段式 typed pipeline,让同一家庭中的不同成员拥有可区分、可审计的记忆事实与自然会话。
唐诗意象宇宙
2026从 57,607 首唐诗中抽取高频意象共现网络,并做成可交互的数字人文探索网站。
在 29,760 个有效窗口上构建 28 个意象节点、342 条共现边,并比较李白、杜甫、王维的意象结构。
新加坡 PDPA 法律合规 RAG Agent
2026-至今为法律咨询场景设计检索增强生成系统,把人工跨文档比对变成可复用的合规问答流程。
合作律所的项目 benchmark 记录显示,系统评分基准值提升 33%。
Agent Evaluation Benchmark
2026-至今为 openclaw 类个人助理设计一套带统计置信度的 Agent 评测框架,而不是只看“演示效果”。
建立 statistical confidence、judge agreement、coverage 与 cross-run stability 四支柱框架;另一条工作流新增并接入 40 个 RPA、IM、跨系统与邮件任务。
Life Exchange
2026一个已运行的本地优先 AI growth partner MVP,用日结算、身份投票、周期回顾和同步来支持长期选择。
已交付 Web PWA、Expo Mobile、共享 domain package 与 sync server,并实现本地导入导出、冲突处理和加密快照。
多智能体谣言传播干预模拟
2025.06-2025.07在社会计算竞赛里带队搭建多智能体谣言传播模拟与干预系统,用可测量方式降低传播指数。
团队项目记录显示,组合干预使谣言传播指数下降 0.3。
人民日报 B 站传播研究:标题与语义偏移
2023.12-2025.12基于 2,465 条视频和 13 个字段,分析标题语义、标签与互动数据之间的关系,并诚实报告模型的低解释力。
最终数据集含 2021.06-2023.12 的 2,465 条视频和 13 个字段;语义相似度均值约 0.408,随机森林测试 R² 为 0.028。
LLMForFuzzing:让大语言模型参与漏洞挖掘
2023.10-2025.03用 prompt engineering 和 Python 自动化让大语言模型参与漏洞利用路径生成,协助团队发现真实 0day。
项目记录显示复现 24/32 个 PoC,覆盖 200+ API,生成约 2,000-3,000 个测试 PDF,并贡献 1 个 UI 相关 zero-day。
多站点 API 逆向与 MCP Server 工程
2026.01-2026.02从浏览器网络请求出发识别稳定接口,再把分散的站点能力封装成可验证、可恢复的 MCP 工具链。
形成 14 组站点能力;一次集中提交涉及 231 个文件、约 2.05 万行新增代码。
Merchmind 多智能体电商决策系统
2026.03-2026.06用四个领域 Agent 和一个 Orchestrator 协同处理选品、定价、库存与品类决策,并让冲突处理可以重放和解释。
团队项目记录显示,规则化仲裁把模拟冲突率从约 30% 降至 5% 以下,并把试用周期从 14 天压缩到 7 天。
图灵数智概念验证平台
2025.09-2026.01为项目申报、专家评审、录取与孵化设计三角色全流程平台,把权限、附件和审计日志落实到关系模型中。
实现从申请、评审、录取到孵化的完整生命周期,代码资产约含 103 个 Java、20 个 Vue 与 15 个 SQL 文件。
量化研究与模拟交易工作台
2026-至今基于开源 InStock 底座扩展的个人研究系统,把行情、策略、证据、确定性风控、Paper Intent 与复盘串成同一条链。
在上游系统上新增 agent、quant、review、watchlist、策略实验、Web 页面与正式测试模块。
职业决策证据引擎
2026把升学、就业、出国、创业与并行策略放进同一个可解释的证据网络和加权决策界面。
实现预填结构、交互评分、证据关联、本地持久化与导出,支持并行策略而非强制单选。
PhiloRevol 中国哲学数字人文平台
2026-至今把时间线、文本挖掘、知识图谱和中西比较整合为一个可探索、可研究的中国哲学分析原型。
搭建 11 组 API 路由与 12 个前端页面,形成关系型数据库、图数据库、搜索与缓存协同架构。
高级分布式数据系统实验集
2025-2026从 Hadoop、HBase 到 Spark、Streaming 与分类模型的一组可复现课程工程实验。
完成三节点 Hadoop、Spark 搜索与聚合、HBase API、微博流处理及分类调优等完整实验链。
CFA 与 408 自适应学习工具
2026两个本地优先的备考工具原型,把限时练习、掌握度、错题、复习日期与自评流程做成可持续反馈环。
CFA 工具覆盖科目、速练、错题与薄弱项;408 工具实现 180 分钟模拟、答题卡和主客观分离评分。
无头浏览器 Benchmark 方法审计
2026以外部评测者身份复现浏览器引擎 benchmark,并检查统计口径、资源指标、并发覆盖与发布就绪度。
识别高方差、macOS 资源指标缺失、并发覆盖不足与横向比较缺失;9 项发布门槛中 8 项当时未满足。
LifeExchange 多语知识档案站
2026-至今一个以证据边界为核心的中英德三语知识站,统一承载文章、项目、知乎 QA、标签、搜索与可下载 Portfolio。
上线中英德三语文章与项目系统、知乎 QA 模块、标签页、Pagefind 全文搜索、RSS 和可下载 Portfolio。
DEA 演化与文献计量分析流水线
2025.09-2026.03从 5.4 万条 Scopus 记录出发,构建清洗、领域分类、学者指标、合作网络与主路径分析的一体化研究流水线。
将 53,954 条 Scopus 原始记录整理为约 33,690 篇应用研究文献,并形成可复用分析管线。
2025 MCM 可持续旅游多目标优化
2025.01围绕朱诺过度旅游问题,把财政收入、冰川环境和居民体验放进同一个多目标优化与情景分析框架。
形成一套可比较政策情景的多目标模型,以及 22 页英文论文和决策备忘录。
LLM 电商评论数据价值评估
2025.02-2025.07用真实性、信息价值和相关性三个维度比较 LLM 与人工评分,探索规模化评论质量评估的可靠边界。
建立三维评分与 MSE/MAE 对照流程;项目材料分别记录 2,559 条原始样本和 1,589 条处理样本。
AI 与就业机会结构分析
2025.11自动清洗并分析 3 万条招聘信息,从教育、技能、行业、地区、薪资与自动化风险观察 AI 如何重组机会分布。
将 30,000 条职位数据转化为可复跑的分析流程和结构化研究报告。
CUDA SGEMM 并行优化
2025.12-2026.01从朴素矩阵乘法出发,用共享内存分块优化 SGEMM,并通过多尺寸基准测试分析吞吐、冲突和异常点。
报告记录 512×512 测试达到 999.51 GFLOPS,相对 baseline 提升 85.5%。
编译器、回归测试包与编程练习站
2026.04-2026.06将 SysY 编译器、多后端回归验证和离线编程练习网站组织为一套可交付、可排错的工程包。
形成约 133KB 的核心实现、可复跑回归测试和 React/TypeScript/Vite 练习站。
女性健康公益传播策划
2025.04-2025.06面向 18-25 岁学生,从调研与受众细分出发设计校园触点、广告脚本、活动网站和媒体投放方案。
形成从洞察到创意执行和媒体预算的完整传播方案。
DreamOfStickman 2D Roguelike 射击游戏
2025.06三人团队用 Java 与 libGDX 构建 2D Roguelike 射击游戏,覆盖 ECS、物理系统、程序化地图和武器机制。
交付可运行的 Java/libGDX/LWJGL3 2D Roguelike 射击游戏。
明德地下空间公共性田野研究
2024.12-2025.01通过 22 天观察、160 份有效问卷和 7 次代表性访谈,研究地下公共空间中的活动冲突与协商机制。
基于 22 天观察、160 份有效问卷与 7 次访谈,提出隔音、分时、空间重构和线上协商建议。
昇腾 910C 训练与推理兼容性诊断
2026在团队大模型工程中参与训练性能排查、benchmark 选型与算子兼容修复,并严格区分个人贡献和团队结果。
个人完成三类输入格式的动态路由修复;团队记录显示 MFU 从约 2% 提升至 25%-30%。