推荐系统中,LLM该做哪一步(上):为什么不能替代任务型模型

1 评论 760 浏览 1 收藏 11 分钟

当AI项目引入大语言模型后,很多人误以为它能替代传统的任务型预测模型。本文从技术能力矩阵出发,深入剖析了LLM在概率估计、私有数据学习、稳定性、大规模计算及推荐价值判断上的五大局限,明确指出在电商、金融等数据密集型场景中,两类模型应各司其职、协同共生。

很多AI项目一引入大语言模型,就容易产生一个冲动:既然LLM能理解、推理和生成,是不是原来的聚类、倾向预测和推荐模型都可以被替代?

在电商、金融、运营商、物流等数据密集型场景中,答案是否定的。要说清原因,必须先区分两类模型究竟在解决什么问题。

一、概念界定:讨论的究竟是什么

严格来说,LLM本身属于机器学习范畴。日常讨论中所谓”LLM与机器学习的对比”,实际指向的是两类模型:

  • 任务型预测模型:围绕明确业务目标,基于企业历史数据训练的分类、回归、聚类和排序模型,典型代表包括逻辑回归、LightGBM、XGBoost、HDBSCAN等。
  • 大语言模型:基于海量通用语料预训练的生成式模型,核心能力在于理解、推理、生成和交互。

因此,准确的命题应为:

通用大语言模型能否替代围绕具体业务目标、基于企业私有数据训练的任务型预测模型?

本文的结论是:现阶段不可替代,但二者的系统化协同能够产生显著优于单一技术路线的业务价值。

二、能力矩阵:两类模型的技术特性对比

两类模型的核心差异可归纳为:

任务型模型解决”基于历史规律计算确定性结果”的问题,LLM解决”理解非结构化信息并完成自然交互”的问题。

三、LLM无法替代任务型模型的五个技术原因

3.1 推理输出不等同于概率估计

给定以下用户特征输入LLM:

用户28岁,ARPU 129元,近三月流量使用率超过95%,当前剩余流量不足5GB,使用5G终端,未办理本运营商宽带,近期浏览千兆宽带活动。

LLM可以给出符合业务常识的推荐排序(流量包 > 千兆宽带 > 彩铃权益),但其判断机制依赖提示词中的规则描述、预训练形成的语义关联和示例中的模式归纳,而非对企业历史转化数据的统计学习。

这意味着:LLM无法输出经过统计校准的办理概率,也无法证明”具备此类特征的用户群体中,实际办理某产品的比例是多少”。

3.2 企业经营规律存在于私有数据中

企业经营规律往往具有高度的行业性和本地性。以运营商为例:

  • 同一流量余量水平,在不同套餐结构下的需求含义不同;
  • 相同ARPU的用户,合约状态、家庭关系可能差异显著;
  • 不同省份的产品资费、渠道能力和营销政策各不相同;
  • 营业厅、企微、短信、外呼等渠道的转化效果受地域、时段、频次等多因素影响;
  • 用户历史触达频次直接影响当次营销效果。

上述规律不存在于任何通用大模型的预训练语料中,必须依赖企业自身历史数据的统计学习来获取。

3.3 经营决策要求稳定性与可复现性

企业级经营决策需要回答以下可验证问题:

  • 模型为何选取这批用户?
  • 模型在历史数据上的表现指标如何?
  • 更换数据批次后,输出结果是否稳定?
  • 模型推荐相比人工规则的提升幅度是多少?
  • 转化增长中,多少来自模型效果,多少来自用户自主行为?

任务型模型在固定特征、参数和数据条件下可重复运行,并通过离线评测和A/B测试进行验证。LLM的直接推理输出受提示词、上下文顺序和模型版本等因素影响,在当前技术条件下难以满足经营决策的稳定性要求。

3.4 大规模结构化计算非LLM能力优势

面对千万级用户规模的批处理场景,LLM存在以下约束:

  • 上下文窗口容量限制;
  • 单次推理成本与延迟较高;
  • 精确数值距离计算非LLM基础能力;
  • 缺失值、异常值和样本偏差的统一处理困难;
  • 用户消费、地址、终端等敏感数据的隐私合规风险。

3.5 最可能办理 ≠ 最值得推荐

这是产品设计中容易被忽视的关键差异。假设某场景下的模型输出如下:

用户最可能办理的是流量包,但营销动作增量最大的却是千兆宽带。成熟的推荐系统需要考虑:

推荐价值 = 增量概率 × 产品价值 − 触达成本 − 打扰风险 − 潜在流失风险

这需要倾向模型、Uplift模型和因果推断方法的配合,而非依赖LLM的语义判断。

四、任务型模型在数据密集型企业中的核心职责

以下以运营商客户经营为例展开。电商的商品购买、银行的产品办理、物流的履约风险,本质上都可以映射为客群识别、倾向预测和排序优化问题。

4.1 用户聚类与客群识别

聚类解决的核心问题是:存量用户可依据哪些特征维度自然划分为不同客群?

常用输入特征包括:

  • 价值维度:ARPU、在网时长、历史消费
  • 行为维度:月均流量、剩余流量、近三月增长率
  • 偏好维度:游戏、视频、音乐类APP使用行为
  • 家庭维度:宽带地址、家庭成员、副卡及融合状态
  • 终端维度:5G终端、价格档位、换机周期
  • 互动维度:到厅频次、活动点击、咨询投诉记录

常用算法:K-Means、GMM、层次聚类、HDBSCAN。

需注意:聚类仅反映用户间的特征相似性,不能直接推断产品办理倾向。

4.2 办理倾向预测

针对不同产品分别建模:

  • P(未来30天办理流量包 | 用户特征)
  • P(未来30天办理千兆宽带 | 用户特征)
  • P(未来30天办理彩铃权益 | 用户特征)

模型从历史数据中学习”具备何种特征的用户最终办理了何种产品”的统计规律,再为当前用户计算倾向分数。对于CRM、ERP及交易系统中的表格型数据,逻辑回归、LightGBM和XGBoost在效率、稳定性和可解释性方面仍具有优势。

4.3 推荐系统的流水线设计

完整的推荐流程包含六个阶段:

资格过滤 → 候选召回 → 粗排 → 精排 → 业务重排 → 反馈学习

精排阶段预测用户对各产品的点击/咨询/办理概率;业务重排阶段引入利润、库存、合规、渠道容量和打扰频控等业务约束。

需注意推荐系统的”召回—排序—重排”与RAG(检索增强生成)中同名概念的目标差异:前者召回的对象是产品、权益或营销动作,评价标准为办理率和增量收入;后者召回的对象是知识片段,评价标准为回答正确性和忠实度。二者在向量检索、Embedding等技术手段上有交集,但训练数据、优化目标和评估体系各自独立。

结论:先把“算什么”交给正确的模型

任务型模型的价值不在于表达自然,而在于它能从企业历史数据中学习统计规律,稳定地完成概率计算、客群识别、产品排序和营销增量评估。

大语言模型可以给出符合常识的判断,但经营系统需要的不只是“听起来合理”,还需要可校准、可复现、可验证。

下一篇继续讨论另一半问题:既然LLM不负责替代任务型模型,它在企业AI系统里最有价值的位置是什么?两类模型、知识图谱与规则系统又该怎样组成完整闭环?

本文由 @是AD 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自 unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 任务型模型的可解释性在金融风控和运营商合规里是硬需求,LLM的黑箱输出很难通过审计,补充这个角度就更完整了。

    来自广东 回复