一、案例背景

随着社交电商行业的快速发展,直播带货、图文种草、短视频推广等新业态成为电商增长的核心驱动力。在海量用户与商品数据的背景下,精准识别用户购买意愿、定位核心影响因素、制定针对性运营策略,是电商平台提升转化率、降低运营成本的核心需求。

传统的用户运营多依赖人工经验判断,存在主观性强、效率低、难以规模化的问题。本案例基于真实社交电商数据集,融合数据清洗、特征工程、机器学习、RAG 检索增强与大模型技术,构建用户购买行为预测与智能运营系统。通过机器学习模型实现用户购买行为的精准预测,通过可视化系统实现全流程分析交互,通过 AI 大模型提供可落地的运营决策建议,为社交电商的精细化运营提供技术支撑。

二、案例目标与实现思路

2.1 案例目标

  1. 掌握数据处理全流程:包括数据清洗、特征工程、显著性检验、数据规范化。
  2. 掌握机器学习模型构建与评估:实现用户购买行为的二分类预测,涵盖多类模型与集成学习。
  3. 掌握 RAG 与大模型应用:实现基于数据分析结果的智能运营问答。
  4. 掌握交互式可视化开发:基于 Streamlit 实现全流程功能的 Web 化交互。

2.2 实现思路

本系统采用全流程闭环的实现路径:

  1. 数据采集:选用 10 万行真实社交电商公开数据集。
  2. 数据处理:完成数据清洗、特征构造、显著性检验与规范化。
  3. 模型构建:训练并评估 6 类分类模型,筛选并优化最优模型。
  4. AI 能力集成:构建专属知识库,结合 RAG 与通义千问大模型实现智能问答。
  5. 系统开发:基于 Streamlit 开发整合所有功能的交互式 Web 系统。

三、数据获取与探索性分析

3.1 数据集说明

本案例选用 10 万行规模的社交电商用户行为数据集,核心字段如下:

类别 字段示例 说明
用户属性 user_id, age, gender, user_level 用户基本信息与价值
商品属性 item_id, category, price, discount_rate 商品基本信息与吸引力
用户行为 like_num, comment_num, add2cart, purchase_intent 用户互动与转化意向
标签 label 购买标签 (1=已购买,0=未购买)

3.2 数据探索性分析

  • 数据规模:100,000 条样本,32 个特征,覆盖 100,000 名用户与 60,363 款商品。
  • 购买转化率:整体为 44.98%,处于行业合理区间。
  • 用户画像:年龄集中在 20-35 岁,女性用户占比更高,符合社交电商特征。
  • 商品分布:价格与折扣率呈长尾分布,平均客单价为 110.21 元。
  • 行为洞察:高互动用户与低互动用户的购买转化率差异显著,互动行为具备强预测价值。

四、数据处理与特征工程

4.1 数据清洗

针对原始数据问题执行标准化清洗流程:

  1. 去重:以 (user_id, item_id) 为联合主键去重。
  2. 缺失值填充:数值型字段使用中位数填充。
  3. 异常值处理:采用 3σ 原则进行截断。
  4. 分类编码:对 category, gender 等字段使用 LabelEncoder
  5. 字段过滤:删除 user_id, item_id 等无分析价值的标识字段。

4.2 特征工程与核心指标构造

基于业务逻辑构造了 5 个核心综合分析指标:

  1. 用户价值分 (user_value_score):综合购买频次、累计消费、用户等级。
  2. 商品吸引力分 (product_attract_score):综合标题情感、图片数、视频、折扣。
  3. 互动深度分 (interaction_depth):综合点赞、评论、分享、收藏。
  4. 转化意愿分 (convert_willingness):综合购买意愿、加购行为、优惠券使用。
  5. 时间衰减分 (time_decay_score):基于距上次点击时长反映活跃度衰减。

4.3 特征显著性检验

  • 方法:独立样本 t 检验(已购买 vs. 未购买)。
  • 标准:以 p 值 < 0.05 作为显著性阈值。
  • 结果:筛选出 19 个显著特征作为建模输入,剔除了年龄、性别等冗余特征。

4.4 数据规范化

使用 MinMaxScaler 将所有数值型特征归一化到 [0,1] 区间,最终输出维度为 (100000, 20) 的标准建模数据集。

五、机器学习预测模型构建

5.1 数据集划分

按 8:2 随机划分训练集与测试集,并采用分层抽样保持正负样本比例一致。

5.2 多模型训练与评估

训练并评估了 6 类主流分类算法:

模型 类型 特点
逻辑回归 线性模型 基准模型,解释性强
决策树 树模型 可直观展示决策逻辑
随机森林 Bagging 集成 泛化能力强,抗过拟合
GBDT Boosting 集成 迭代拟合残差,精度高
LightGBM 梯度提升树 训练速度快,内存占用低
XGBoost 梯度提升树 精度高,工业界广泛应用

评估结果:采用准确率、精确率、召回率、F1、AUC 及 5 折交叉验证进行综合评估。LightGBM 模型综合性能最优,F1 值达 0.6599,AUC 值达 0.7753

5.3 最优模型优化

对 LightGBM 进行超参数优化:

  • 树的数量:200
  • 学习率:0.05
  • 最大深度:8
  • 叶子节点数:31

优化后在测试集上重新评估,确保精度与泛化能力达到最优平衡。

5.4 特征重要性分析

基于优化后的模型,特征重要性 Top5 如下:

  1. 距上次点击时长 (last_click_gap)
  2. 商品折扣率 (discount_rate)
  3. 用户互动率 (综合行为)
  4. 社交影响力 (综合行为)
  5. 用户等级 (user_level)

此分析为运营提供了明确的业务抓手。

5.5 模型可视化评估

通过 混淆矩阵ROC 曲线 对最优模型效果进行直观展示,AUC 值接近 1,表明模型具有良好的区分能力。

六、RAG 智能问答能力实现

6.1 知识库构建

完全基于本次数据分析的真实结果构建专属知识库,内容涵盖:

  • 数据集基础信息
  • 数据处理结果
  • 模型训练结果
  • 特征重要性结果
  • 可落地的运营策略建议

6.2 检索匹配机制

采用 纯文本关键词匹配 的检索机制,无第三方模型依赖,国内网络环境可稳定运行。对用户问题拆分关键词,计算匹配度后返回 Top5 相关知识点。

6.3 大模型 API 接入

接入 通义千问大模型 API,将检索到的知识组合为提示词,要求模型严格基于参考资料生成回答,并同步返回参考来源,实现“检索-生成-溯源”的完整 RAG 流程。

七、可视化系统需求分析

基于全流程内容,开发交互式 Streamlit Web 系统,核心模块需求如下:

模块 功能说明
数据管理 上传/加载 CSV 数据集,展示核心统计与数据预览。
数据总览看板 展示核心指标卡片与用户、商品分布可视化图表。
数据处理与检验 触发全流程数据处理,展示清洗结果、显著特征与相关性热力图。
模型训练与评估 触发多模型训练,展示评估结果、最优模型指标及混淆矩阵、ROC 曲线。
特征重要性分析 展示全量特征排序表及 Top10 特征的可视化图表。
智能运营问答助手 构建知识库,提供对话式界面,基于 RAG 返回专业回答与参考来源。

八、可视化系统设计与实现

8.1 系统总体架构

系统采用模块化分层设计:

  • 前端交互层:Streamlit 页面渲染与状态管理。
  • 数据处理层 (data_process.py):负责数据清洗、特征工程等。
  • 模型计算层 (model_build.py):负责模型训练、评估与可视化。
  • AI 能力层 (rag_module.py):负责知识库构建、检索与大模型调用。

8.2 核心页面功能实现

  1. 数据管理页面:支持文件上传与本地加载,自动计算核心指标。
  2. 数据总览看板:采用“指标卡片+多维度图表”布局,展示业务全貌。
  3. 数据处理页面:按钮触发式计算,分模块展示处理结果。
  4. 模型训练页面:按钮触发式训练,对比模型效果并可视化评估结果。
  5. 特征重要性页面:以表格和图表形式多维度展示核心特征。
  6. 智能问答页面:构建知识库后,提供多轮对话式问答界面。

8.3 系统运行与部署

  1. 环境:Python 3.10+,依赖详见 requirements.txt
  2. 启动
    pip install -r requirements.txt
    streamlit run app.py
    
  3. 访问:浏览器自动打开 http://localhost:8501

九、AI 使用说明

9.1 AI 使用定位

本作品的核心业务逻辑、架构设计、代码实现均为自主完成。AI 工具仅用于辅助性工作,如:

  • 环境报错排查
  • 优化方案参考
  • 问题定位分析
  • 文档表述润色

9.2 具体使用场景

  1. 依赖报错排查:解决 Python 版本与依赖包不兼容问题。
  2. 模块方案重构:将 RAG 模块从重型向量数据库改为轻量级文本匹配引擎。
  3. 页面性能优化:将全局耗时操作改为按钮触发式,解决页面卡顿。
  4. 功能 Bug 修复:快速定位并修复可视化图片路径、函数参数不匹配等问题。

十、总结与展望

10.1 作品总结

本作品完成了从数据到决策的全流程闭环开发:

  • 数据层面:完成了 10 万行数据的处理与特征工程。
  • 模型层面:构建并优化了高性能预测模型,输出了特征重要性。
  • AI 层面:实现了基于真实结果的 RAG 智能问答。
  • 系统层面:开发了完整、交互流畅的 Streamlit 可视化系统。

10.2 不足与展望

  1. 数据维度:可引入用户评论等非结构化文本数据,结合 NLP 技术丰富特征。
  2. 检索精度:当前为关键词匹配,后续可接入轻量级中文向量模型提升语义检索能力。
  3. 系统部署:当前为本地单机运行,未来可部署至云服务器支持多用户访问。

社交电商用户行为分析与预测系统

Logo

电商企业物流数字化转型必备!快递鸟 API 接口,72 小时快速完成物流系统集成。全流程实战1V1指导,营造开放的API技术生态圈。

更多推荐