跳转至

Goal-Conditioned Supervised Learning for Multi-Objective Recommendation

会议: NeurIPS2026
arXiv: 2412.08911
代码: https://github.com/xiwenchao/MOGCSL
领域: 推荐系统 / 多目标学习
关键词: 目标条件监督学习、多目标推荐、累计奖励、条件变分自编码器、低目标噪声

一句话总结

MOGCSL 把会话未来的多种累计奖励保留为目标向量,以普通交叉熵训练一个目标条件的下一物品预测器,再用统计目标或双 CVAE 选择推理目标,在购买预测与训练成本上取得优势,但并非所有点击指标都领先,也不保证指定目标真正可达。

研究背景与动机

电商推荐不能只判断用户是否会点击,还要兼顾购买等不同价值的行为。Shared-Bottom 和 MMOE 通过共享底座、任务塔或专家门控建立多任务模型,DWA、PE、Nash-MTL、FAMO 则调整目标权重或更新方向。这些方法主要处理任务之间如何共享、如何优化,却通常没有把“这次点击后来带来了什么”当作区分训练样本的条件。一次点击可能体现真实兴趣,也可能只是用户面对不合适列表时随手选择;直接学习所有下一物品标签,会把这两类行为混在一起。

目标条件监督学习提供了另一个入口:每段离线轨迹已经示范了某种结果,模型可以学习“在这个历史状态下,最终取得这种结果的轨迹做了什么”。但把点击和购买累计奖励加权成一个标量,会丢失具体是哪种结果组合。同一个标量可能对应高点击低购买,也可能对应低点击高购买;权重一旦确定,这种信息混合就在训练前发生。保留完整目标向量可以避免这一步,但也带来了推理难题:未来结果尚未发生,不能像训练时那样直接计算目标,更不能假定把每个维度都调高就一定合理。

本文因此把训练和决策偏好分开:训练时用所有已观察结果作为条件,不额外设置多任务损失权重;推理时才挑选符合业务需求的目标。这里的噪声解释依赖“较高长期结果通常对应更可靠的偏好信号”,不是对所有用户行为的普遍结论。核心 idea:用多维未来结果给离线行为加上条件,使一个监督预测器能够按结果类型学习不同模式,再在推理时选择有数据支持、符合效用偏好的目标。

方法详解

整体框架

输入是用户最近的物品交互历史、当前会话时间步,以及点击、购买等目标组成的向量;输出是整个候选物品集合上的下一物品概率。训练先做“多维目标重标记”,再训练“目标条件预测器”;推理可以直接采用按时间步统计的目标,也可以通过“双 CVAE 目标建模”和“效用选目标”选择个性化目标。

双 CVAE 并不生成推荐物品:一个提出候选输入目标,另一个估计各候选对应的实际结果分布。后者的预测均值只用于评估候选,最终送入已训练预测器的是被选中的原始输入目标。图中的虚线表示离线监督或模型条件的传递,实线中标明推理的部分才是在线选目标的数据流。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["离线会话日志"] --> B["多维目标重标记"]
    B -->|训练:历史、时间步、目标与下一物品| C["目标条件预测器"]
    B -.->|训练:日志状态与目标对| D["双 CVAE<br/>目标建模"]
    C -.->|固定策略作为条件| D
    S["新状态"] -->|推理:生成候选并预测结果均值| D
    D -->|推理:候选目标与对应均值| E["效用选目标"]
    E -->|原始候选目标送入已训练预测器| F["下一物品排序"]

关键设计

1. 多维目标重标记:不在训练前压缩点击与购买结果

对一条完整会话,点击和购买分别构成即时奖励向量的维度。会话结束后,从每个位置向后累加奖励,用得到的向量替代该位置的即时奖励,形成状态、下一物品、未来目标的监督样本。目标包含当前位置及其后的结果,是事后重标记信息;历史编码仍只使用当前位置之前的物品,不能把未来交互当作在线可见输入。

\[ \boldsymbol{g}_{t}=\sum_{t^{\prime}=t}^{|\tau|}\boldsymbol{r}_{t^{\prime}}. \]

这样,点击很多但购买很少的会话,与点击较少但购买较多的会话,不必因为加权总分接近而混成同一种条件。相对于标量目标的 MOPRL,模型能保留各结果维度与下一行为之间的联系,而无需提前指定奖励加权系数。目标向量也不是多任务标签头:监督标签仍是下一物品,结果向量是预测时的条件。

所有样本仍参与普通监督训练,并没有显式删去低目标会话或对它们设置较小损失权重。所谓去噪是条件化产生的间接作用:如果噪声更集中于低目标会话,模型有机会把那里的行为模式与高目标模式区分开,推理时查询较高目标就更接近后者。因而“自动筛除噪声”应理解为减少其对指定条件预测的影响,而不是已经识别出真实的逐实例噪声标签。

2. 目标条件预测器:用一个物品分类头学习结果条件下的行为

模型先将历史物品嵌入送入 Transformer 编码器,得到序列表示;时间步通过嵌入表编码,目标向量通过全连接层映射。三种表示拼接后经过自注意力模块,让历史、会话位置和期望结果发生交互,最后由 MLP 和 softmax 输出所有物品的概率。附录实现保留最近 10 次历史交互,不足时补 padding;状态与目标嵌入维度均为 64。

学习问题是“与这一目标相伴的日志行为是什么”,而不是为每个目标训练一座独立任务塔。训练目标就是下一物品的负对数似然:

\[ \mathcal{L}(\theta)=\mathbb{E}_{(\boldsymbol{s}_{t},a_{t},\boldsymbol{g}_{t})\in\mathcal{D}_{tr}}[-\log\pi_{\theta}(a_{t}\mid\boldsymbol{s}_{t},\boldsymbol{g}_{t})]. \]

这解释了较小的模型与较简单的优化过程,也明确了方法边界。虽然作者用多目标 MDP 表述交互环境,但这里没有 Bellman 目标、TD 误差或价值函数优化。累计奖励提供额外监督条件,论文主要评估下一物品排序,不是直接证明长期会话回报被最大化。

3. 双 CVAE 目标建模:分开提出目标与预测目标带来的结果

MOGCSL-S 是较低成本的默认方案:按当前时间步取训练日志中剩余累计奖励向量的均值,再乘验证集选择的缩放因子。它根据时间步变化,但不针对每个新状态生成不同的分布。MOGCSL-C 则先用 CVAE2 学习给定状态的目标先验,采样多个可能的输入目标;再用 CVAE1 学习在状态、输入目标和固定策略条件下实际结果的分布,对每个候选多次采样并取均值。候选规模在实验中为 20,实际结果分布的内部均值采样次数没有在缓存正文中单独明确。

两个 CVAE 都在同一批离线状态与事后目标对上训练。CVAE2 的目标是重构日志目标并正则化潜变量;CVAE1 也以日志目标作为实际结果的监督,条件额外包含同一个目标及策略。原文把这一做法解释为策略模仿了对应示范,因而该示范目标可看作策略条件下的结果样本。这个解释需要区分日志轨迹确实取得的结果,与有限数据训练后的策略是否仍会取得同样结果:后者没有保证,更不是从实际部署策略的新轨迹中直接得到的校准监督。

定理 1 只说明结果分布应当依赖初始状态、输入目标和策略。附录 A 的证明固定环境转移与奖励分布,按每步奖励扣减剩余目标,将轨迹概率写成策略、奖励和转移概率的乘积,再把累计奖励看作轨迹的确定函数;随机会话长度用吸收终止状态或对长度积分处理。因此它支持选择条件变量,却不证明 CVAE 估计正确、离线条件模仿能兑现指定目标,或某个目标处于真实可行区域。

4. 效用选目标:评价预测结果,但执行原始输入条件

给每个候选输入目标配上预测的实际结果均值后,算法按效用原则挑选最满意的结果,再取回与它对应的输入目标。这两个向量不能互换;把预测结果均值直接作为策略输入,会改变 Algorithm 2 的含义。下式是该候选选择过程的简记,其中候选编号由效用决定:

\[ b\in\arg\max_{k}U(\tilde{\boldsymbol{g}}^{a}_{k}),\qquad \text{output}=\pi(\cdot\mid\boldsymbol{s}^{\prime},\boldsymbol{g}^{\prime}_{b}). \]

论文实验用候选预测均值之间的非支配关系选择目标:没有其他候选在所有维度上都不低于它;附录 C.5 的脚注补充,出现多个符合条件的候选时,优先购买更高者。这是在有限采样候选集合内部筛选,并非求出了环境的完整 Pareto 前沿。原文 Eq. (8) 只写各维度不小于,没有另写至少一维严格更大,因此相同向量与平局的实现细节也不够完整。

训练确实避免了多任务损失的预设加权,但偏好并没有消失,而是移到推理时的效用定义和目标选择。业务也可以在这里改用加权效用;这不同于训练时把奖励压成一个标量,但仍然在优先某些目标。若持续执行一个会话,附录 C.1 说明 CVAE 选目标只在序列开始时进行,随后逐步减去已取得奖励;MOGCSL-S 的按时间步统计目标应与这套更新机制分开理解。

一个完整示例

下面仅用于解释 Algorithm 2,不是论文报告的实验数据。假设点击与购买两个维度的候选输入目标为 \((4,1)\) 和 \((2,2)\),CVAE1 预测对应的实际结果均值分别为 \((3,0.5)\) 和 \((2,1.2)\)。

两个预测均值互不支配:前者点击较高,后者购买较高。若效用优先购买,则选择后一个候选,送入下一物品预测器的仍是 \((2,2)\),不是 \((2,1.2)\);后一向量只是用于选择的估计结果。接下来,预测器结合当前历史和选定目标对物品排序,实际反馈到来后才更新剩余目标。

这个例子也说明“要求购买更高”与“能实现购买更高”不是同一件事。候选生成、结果预测和策略泛化均有误差,选择一个看起来较好的条件不构成实际回报保证。

损失函数 / 训练策略

策略训练完成后,两个 CVAE 以重构项与潜变量 KL 正则训练;CVAE1 的条件记为 \(\boldsymbol{c}=(\boldsymbol{s},\boldsymbol{g},\pi)\)。这里保留原文 Eq. (6) 与 Eq. (7) 的机制,编码器分别为 \(Q_{1}\)、\(Q_{2}\),解码器分别为 \(P_{1}\)、\(P_{2}\):

\[ \mathcal{L}_{CVAE1}=\mathbb{E}_{(\boldsymbol{s},\boldsymbol{g})\in\mathcal{D}_{tr},z\sim Q_{1}}[-\log P_{1}(\boldsymbol{g}\mid z,\boldsymbol{c})+D_{KL}(Q_{1}(z\mid\boldsymbol{g},\boldsymbol{c})\Vert P(z))]. \]
\[ \mathcal{L}_{CVAE2}=\mathbb{E}_{(\boldsymbol{s},\boldsymbol{g})\in\mathcal{D}_{tr},z\sim Q_{2}}[-\log P_{2}(\boldsymbol{g}\mid z,\boldsymbol{s})+D_{KL}(Q_{2}(z\mid\boldsymbol{g},\boldsymbol{s})\Vert P(z))]. \]

原文采用高斯编码器与解码器假设,潜变量从标准正态分布采样。双 CVAE 方案因此增加了训练与采样成本,也不能把高斯分布采样的支持域直接理解为真实环境的可行目标集合。

实现使用 Adam,batch size 为 256;学习率在 0.0001、0.0005、0.001、0.005 中选取,需手动加权的基线在 0.1 到 0.9 的网格上用验证集调参。各模型共用 Transformer 编码器与自注意力底座,以减少表示能力差异;全部结果报告 5 个随机种子的均值和标准差,而非置信区间或正式显著性检验。

实验关键数据

主实验

Challenge15 与 RetailRocket 都有点击、购买标签,过滤后只保留长度 3 到 50 的会话,训练、验证、测试比例为 8:1:1。Challenge15 有 200,000 个会话、26,702 个物品;RetailRocket 有 195,523 个会话、70,852 个物品。缓存没有说明该划分是否按时间进行或跨集合如何处理用户重叠,因此不能额外宣称是严格时间外推评测。

HR 衡量真实下一物品是否进入前列,NG 是原表对 NDCG 的缩写,进一步考虑命中位置。下表摘录原文 Table 1,单位均为百分数,单元格为均值 ± 标准差;这一主表的 MOGCSL 使用统计选目标,等同 Table 3 中的 MOGCSL-S,并不是 CVAE 版。

数据集 配置 购买 HR@10 购买 NG@10 点击 HR@10 点击 NG@10
RetailRocket MMOE-FAMO 47.93 ± 0.32 46.42 ± 0.23 35.92 ± 0.21 26.14 ± 0.17
RetailRocket PMORS 63.14 ± 0.15 51.02 ± 0.17 34.16 ± 0.26 24.09 ± 0.23
RetailRocket MOGCSL-S 65.43 ± 0.15 52.92 ± 0.11 36.30 ± 0.25 25.24 ± 0.15
Challenge15 MMOE-PE 36.40 ± 0.36 24.66 ± 0.19 44.04 ± 0.09 27.44 ± 0.03
Challenge15 PMORS 54.98 ± 0.31 34.77 ± 0.28 42.36 ± 0.39 25.10 ± 0.42
Challenge15 MOGCSL-S 56.82 ± 0.25 35.93 ± 0.15 42.47 ± 0.15 25.64 ± 0.11

购买指标的提升与点击指标的取舍同时存在。RetailRocket 的点击 NG@10 为 25.24,低于 MMOE-FAMO 的 26.14;Challenge15 上 MMOE-PE 的点击 HR@10、NG@10 也高于 MOGCSL-S。不能将“更有价值的购买结果较强”写成所有目标、所有排序指标全面领先。

消融实验

下面摘录 Table 3 的目标选择比较,保留与主表相同的指标;Tenrec 的价值目标是点赞而不是购买。这是选目标策略的比较,不是去除模型模块的传统消融。

数据集 配置 价值目标 HR@10 价值目标 NG@10 点击 HR@10 点击 NG@10
RetailRocket MOGCSL-S 65.43 ± 0.15 52.92 ± 0.11 36.30 ± 0.25 25.24 ± 0.15
RetailRocket MOGCSL-C 65.01 ± 0.07 52.89 ± 0.04 36.54 ± 0.02 25.41 ± 0.04
Challenge15 MOGCSL-S 56.82 ± 0.25 35.93 ± 0.15 42.47 ± 0.15 25.64 ± 0.11
Challenge15 MOGCSL-C 55.13 ± 0.07 35.04 ± 0.02 42.14 ± 0.04 25.37 ± 0.07
Tenrec MOGCSL-S 5.96 ± 0.17 2.15 ± 0.12 4.87 ± 0.13 1.52 ± 0.08
Tenrec MOGCSL-C 6.78 ± 0.07 2.99 ± 0.02 5.66 ± 0.05 2.14 ± 0.05

RetailRocket 并不是 CVAE 全面更好:购买 HR@10 为 65.01,低于统计版的 65.43,购买 NG@10 也稍低;点击与部分更长列表指标有所改善。Challenge15 的 CVAE 版在原表所有指标上都低于统计版;Tenrec 才呈现所有报告指标均改善的清晰趋势。

附录 B.2 在 RetailRocket 低目标会话中注入随机下一物品标签,测试集保持原样。原文描述从平均目标最低的 20% 序列中选择原训练序列的 20%,把选中序列最后的真实物品替换为全目录均匀随机物品;这是有意把噪声与低目标相关联的实验,而非任意位置、任意目标上的随机污染。下表摘录 Table 4,下降比是相对未污染训练结果的百分比,不能当作百分点差。

配置 污染后购买 HR@20 相对下降比 污染后点击 HR@20 相对下降比
Share-FAMO 46.32 ± 0.11 7.71% 36.97 ± 0.24 9.19%
PMORS 64.17 ± 0.18 4.86% 36.05 ± 0.30 9.56%
MOPRL 62.37 ± 0.11 3.69% 36.61 ± 0.21 6.08%
MOGCSL 67.92 ± 0.17 1.96% 39.91 ± 0.16 4.79%

关键发现

  • 高目标不能无限调大。统计版的目标缩放因子在 1 到 2 的范围表现最好,更大的条件会降低表现;原文解释为高目标区域的行为示范不足。
  • 双 CVAE 的收益与覆盖有关。前两个数据集的平均累计点击、购买约为 5.3 和 0.2,Tenrec 的点击、点赞约为 28.3 和 1.2;这支持数据覆盖解释,但并非只改变覆盖率的因果实验。
  • 成本需要分版本看。RetailRocket 的 Table 2 报告统计版 9.1M 参数、3.0Ks 训练时间,Table 6 报告 CVAE 版 10.7M、4.8Ks;Share-FAMO 为 14.0M、5.1Ks,MMOE-PE 为 14.1M、60.5Ks,RMTL 为 17.5M、100.2Ks。实验硬件为 NVIDIA RTX 3090 与 AMD 3960X;这些是实测规模和时间,不是统一的渐近复杂度,也没有直接报告在线端到端延迟。
  • 回归均值也可行。附录 C.6 的 MOGCSL-R 在 RetailRocket 购买 HR@20 为 69.37 ± 0.30,CVAE 版为 69.34 ± 0.05;后者跨种子波动更小,但不能写成每个均值都更高,或采样天然带来理论方差保证。

亮点与洞察

  • 结果条件化同时解决信息保留与样本混合问题。不是再加一个任务塔,而是让同一状态在不同长期结果条件下有不同的行为分布,尤其适合有完整会话和多种反馈的日志。
  • 偏好后置到推理,而不是固定在奖励标量化中。业务优先级变化时可以换效用原则或目标,不必为每个奖励权重重训,但这种灵活性仍受已有目标覆盖约束。
  • 候选条件与预测结果分开是可复用设计。提出“希望实现什么”以后,先评估“预计会实现什么”,再决定采用哪个原始条件;状态相关的候选提议比一个全局高目标更贴近个体差异。

局限与展望

  • 可达性仍是模型估计,不是经过定理认证的约束。CVAE1 用同一日志目标同时构成条件和重构对象,缺少学习后策略在新条件下的实际回报校准;后续可加入策略执行轨迹、离线评估及不确定性约束。
  • 去噪只针对噪声与低长期结果相关的情形。合成实验直接规定任一目标维度低于阈值时标签随机,因此验证的是设定机制;高参与度不必然表示真实满意,短会话也可能是成功完成需求,不能将参与度提升等同用户福祉。
  • 推荐主实验仍是双目标、离线下一物品评测。合成去噪数据虽使用多维目标,却不能替代高维真实推荐、完整前沿恢复或线上长期收益验证;作者明确没有 live-user A/B 测试。
  • 高目标稀疏、负反馈与日志偏差尚未解决。作者建议补充高目标轨迹、在线迭代,以及把退出、跳过、不喜欢编码为目标维度;实际部署还需考虑曝光偏差、隐私、公平性和数据集非商业许可限制。
  • 原文有表述与交叉引用问题。Section 4.2 把 Share-PE 的 NDCG 优势写成购买,但 Table 1 的优势实际在点击;Section 4.4 的“RetailRocket 更好”不能覆盖购买短列表指标。部分相对提升百分比与表格不一致,附录还引用不存在的 B.7、B.8;本笔记以相应表格数值和实际章节为准,不替作者修成一致。

相关工作与启发

  • vs PRL / MOPRL:同属目标条件下一行为学习,MOPRL 将多个即时奖励加权后累计成标量;MOGCSL 保留向量,避免不同结果组合在训练条件中被提前混合。
  • vs MMOE / DWA / PE:这些方法主要处理表示共享或多任务优化,MOGCSL 把结果作为输入条件;较低成本和较强购买表现是当前设置的经验结果,不说明其他任务上的梯度冲突被普遍解决。
  • vs RMTL:RMTL 使用额外强化学习头与 TD 优化,MOGCSL 只做监督物品预测;不能因为它使用奖励轨迹,就把两者写成相同的长期回报优化目标。
  • vs Decision Transformer / RVDT:前者提供按回报条件化的序列学习视角,后者关注离线条件序列模型的回报覆盖问题。可迁移的研究方向是在选目标时联合衡量效用、数据支持与预测不确定性,而不是一味追求更高条件。

评分

  • 新颖性: 4/5 — 多维目标与推理选目标组合有价值,但可达性建模仍依赖较强的离线模仿解释。
  • 实验充分度: 3/5 — 有多个推荐数据集、受控噪声与成本分析,缺少真实高维目标和线上长期结果。
  • 写作质量: 3/5 — 主流程与证明可复述,部分百分比、指标措辞和附录引用需要核对。
  • 价值: 4/5 — 为有多种会话反馈的推荐日志提供了低成本基线,并清楚显示统计目标与生成目标各自的适用条件。