Adaptive inference for functionals of M-estimands¶
会议: NeurIPS2026
arXiv: 2609.39274
领域: 自适应统计推断 / 统计学习理论
关键词: M-估计目标、Neyman 正交性、影响函数、条件方差稳定化、自归一化
一句话总结¶
本文把非参数 M-估计目标的光滑泛函推断扩展到已知采样策略的自适应数据,通过一步偏差校正配合逐轮条件方差稳定化,或在方差收敛到随机非零极限时采用自归一化,构造渐近有效的置信区间;动态定价模拟显示普通 GLM 和仅加逆倾向权重的 GLM 会欠覆盖。
研究背景与动机¶
在线实验和上下文老虎机会根据过去的奖励改变后续动作,因此最终数据并不是来自固定分布的独立同分布样本。即使某个估计量经过加权后没有一阶偏差,它的方差仍会随数据轨迹变化:早期观察使算法偏向不同动作,后面的信息量也随之改变。在最优动作并列或收益差很小的场景中,采样策略未必收敛到与轨迹无关的确定性策略,经典正态近似及 sandwich 方差估计于是可能失效。这里的 inference 指统计推断,不是模型运行时的推理加速。
已有方法分别处理臂均值、平均处理效应、线性系数或特定 M-估计量,使用重要性加权、在线去偏或影响函数校正,但往往把目标、工作模型和方差估计捆绑在一起。正确设定的线性模型能够简化分析,却不足以覆盖非参数辅助函数与错设工作模型;允许错设的方法又可能要求策略具有确定性极限,或另行学习 score 的条件矩。本文希望建立一个可复用的统计接口:只要目标是指定评价分布下风险最小化解的光滑泛函,就从损失曲率和泛函导数自动构造校正,再单独处理自适应带来的方差问题。
这个接口仍有明确边界。它需要已知采样概率、可识别且足够光滑的目标、正交性、辅助估计收敛速率和探索条件,而不是对任意黑箱数据收集过程提供保证。核心 idea:先用 Hessian 度量下的 Riesz 表示构造正交的一步校正,把目标误差转化为鞅增量,再根据条件方差是否具有稳定随机极限选择逐轮稳定化或自归一化。
方法详解¶
整体框架¶
输入是顺序观测到的上下文、动作与奖励,以及每轮实际使用的采样策略。输出是一个固定评价分布下目标泛函的点估计和渐近置信区间,而不是新的策略学习算法。方法包含共同的目标定义与一步校正,以及两条不同的方差处理路线;本文主要贡献是统计构造和极限定理,不是神经网络架构。
记观测为 \(Z_t=(C_t,A_t,Y_t)\),过去的信息为 \(\mathcal F_{t-1}\)。采样策略 \(\pi_t\) 可以依赖过去,但不能依赖当前尚未观测的奖励。Assumption 1 要求上下文独立同分布、独立于过去,且给定上下文和动作后的奖励分布不随时间变化;时间依赖仅通过策略进入。因而结果不能直接推广成对任意有状态强化学习轨迹、非平稳环境或奖励漂移的推断保证。
评价策略 \(\pi_e\) 固定且独立于历史。它与实际采样分布共享上下文分布和奖励机制,只改变动作分配。评价分布记为 \(P_e\),目标由损失 \(\ell\)、辅助函数 \(\eta_{P_e}\) 和光滑映射 \(m\) 定义:
这里的 M-estimand 是总体风险最小化所定义的目标,不是样本上算出的 M-estimator。在线性工作模型错设时,它仍然可以是评价分布下的最优投影系数;但这个系数不自动等于真实结构参数。对模型错设有效,应理解为仍覆盖明确定义的风险最小化目标,而非不需要模型、识别或收敛条件。
每轮只用历史数据估计目标函数、辅助函数及 Riesz 表示,随后在新观测上计算一步校正值。已知策略提供重要性权重 \(w_t=\pi_e(A_t\mid C_t)/\pi_t(A_t\mid C_t)\)。Assumption 2 还要求共同支配测度及评价策略相对于每轮采样策略的绝对连续性:评价策略要使用的动作必须具有采样支持;“知道概率”不能弥补零探索。
共同校正之后,第一条路线用历史增量重估当前策略对应的条件标准差,在新数据到来之前确定稳定化权重,再累积校正值。第二条路线不估计每轮条件方差,而是利用实际出现的增量平方和消去随机尺度,但只在平均条件方差收敛到有限、几乎处处非零的随机变量时有定理保证。
关键设计¶
1. 正交 Riesz 校正:把目标偏差转换成可消除的一阶项
直接把估计的回归函数或参数代入目标泛函,误差通常与拟合误差同阶,无法支撑根号样本量尺度的推断。本文先用总体损失的 Hessian 定义内积,再找一个 Riesz 表示 \(\alpha_{P_e}\),让泛函沿任意方向的导数等于该方向与表示的 Hessian 内积。它相当于把“目标最关心的变化方向”转换成损失梯度可以测量的方向:
Assumption 3 要求风险最小化解存在且唯一,损失对目标参数二次 Fréchet 可微,泛函一次可微,总体一阶条件成立,且 Hessian 满足正定下界。这个下界保证局部识别;在无信息方向或近乎退化的模型中,不能不加处理就使用表示。Assumption 4 进一步要求局部导数及其差异受具有有限四阶矩的包络控制,并满足相应的局部 Lipschitz 界。
Neyman 正交性要求损失的一阶目标导数对辅助函数扰动的总体一阶响应为零。它不是说辅助函数完全不重要,而是把辅助估计误差推到二阶或乘积项。Theorem 1 展开后的主要剩余项包括目标误差与 Riesz 误差的乘积、目标误差平方,以及涉及辅助函数误差的交叉项和平方项。若泛函线性、损失二次且没有辅助函数,Remark 1 允许用更弱的目标误差与 Riesz 误差乘积条件替代通用速率条件。
定义每轮校正值 \(F_t\) 后,评价分布下的 oracle 影响函数就是校正值减去目标。原文 Equation 3 和 Equation 5 的机制可概括为:
减去损失导数沿 Riesz 方向的值,正好抵消 plug-in 目标的一阶偏差。重要性权重则把实际策略下的条件期望换成评价分布下的期望,所以 oracle 增量 \(w_t\varphi_{P_e}(Z_t)\) 条件均值为零。两者解决不同问题:一步校正处理拟合偏差,重要性加权处理动作分布变化;只做后者并不等于已经处理随机方差。
2. 重加权条件方差稳定化:用历史增量估计当前策略的信息尺度
自适应策略可能每轮变化,使 oracle 增量的条件方差 \(\sigma_t^2\) 没有稳定极限。Theorem 2 不要求先证明原始方差收敛,而是以历史可测的条件标准差估计逐轮缩放增量。其一步估计量与归一化因子为:
Theorem 2 给出的标准正态统计量为 \(\hat A_T(\hat\Psi_T^{\mathrm{os}}-\Psi_e(\theta_{P_e}))/\sqrt T\)。因此可用标准正态分位数和标准误 \(\sqrt T/\hat A_T\) 构造区间。分母是实际累积的稳定化重要性权重,不应擅自替换成样本量。
难点是估计当前策略下的平方增量期望。若直接回归这个条件矩,可能要同时估计上下文分布、奖励分布和多个辅助函数。本文改用过去每条观测当时的影响函数估计 \(\hat\varphi_s\),再把它的平方从历史采样策略运输到当前采样策略对应的方差尺度。Equation 9 为:
权重中同时出现历史策略 \(\pi_s\) 与当前策略 \(\pi_t\),不能简化成历史 IPW 增量的普通样本方差。历史策略抵消观测的来源分布,当前策略保留目标条件方差中的信息尺度。每条历史影响函数来自当时已训练的估计,不需要为方差额外拟合奖励分布模型;第一轮方差用固定正的有限常数初始化。
Theorem 2 需要所有估计在观测当前样本之前可测;目标、辅助函数和 Riesz 表示的误差四次方时间平均均为 \(o_p(T^{-1})\);oracle 加权增量满足条件 Lindeberg 条件;最大评价/采样密度比为 \(O(T^{1/3})\)。此外,估计方差要有正下界,真实方差与估计方差之比的时间平均收敛到 1。上述都是充分条件,非“任意非参数估计器都能直接接入”。
Theorem 4 说明 Equation 9 何时满足最后一个方差一致性要求,但其条件更强:实际策略属于确定性、点可分的策略类;对数策略类在一致范数下满足覆盖熵界,指数位于 \([0,2)\);整个策略类的最大重要性比只能为 \(O(T^{1/8})\);真实与估计标准差都具有正下界。低复杂度约束施加在采样策略类上,而不是要求目标和辅助函数只能采用参数模型。
影响函数还需要一个历史可测的中心估计:中心误差平方的时间平均为 \(o_p(T^{-1/2})\),且中心估计一致有界于概率。重加权方差公式自身不依赖额外条件矩模型,但中心与辅助估计仍然需要有效构造;附录 D 给出了 burn-in 与留出块的建议,因此“无需额外数据切分”不能理解成整套实现从来不用留出数据。
3. 随机极限自归一化:只在稳定随机尺度下省去逐轮方差估计
有一种介于确定性稳定和持续非稳定之间的情形:平均条件方差收敛,但极限取决于实际轨迹,是一个有限且几乎处处非零的随机变量 \(\kappa\)。不归一化的极限可以是方差混合的正态分布,而非具有固定方差的正态分布。Theorem 3 用观测到的平方增量估计同一个随机尺度,再相除得到标准正态统计量。
它的点估计不含逐轮标准差权重,只保留重要性加权和一步校正。为使平方增量正确居中,先取 \(m_T\to\infty\) 且 \(m_T=o(T)\),用早期拟合结果及接下来的中心估计块得到 \(\bar\Psi_T\);实际平方和从第 \(2m_T+1\) 轮开始。Equation 7–8 的统计量可写为:
满足条件时,\((\hat S_T-\Psi_e(\theta_{P_e}))/\sqrt{\hat V_T}\) 渐近标准正态。这里平方和才是实际二次变差,而不是对每轮条件方差分别建模;不能把未加权残差方差拿来替代它。前 \(2m_T\) 轮为中心构造服务且不进入这项平方和,原文点估计定义仍对全部轮次求和。
除 Theorem 2 的估计误差、Lindeberg 和 \(O(T^{1/3})\) 重叠条件外,Theorem 3 还要求早期三个拟合对象分别达到 \(o_p(m_T^{-1/4})\),最大重要性比为 \(o(m_T^{1/2})\),以及平均 oracle 条件方差依概率收敛到上述 \(\kappa\)。最后一个条件是决定能否使用这条路线的关键,不是可省略的技术细节。
亚线性探索后冻结策略、或一个随机常策略区间占据绝大多数样本,是原文提供的直觉场景。但按终点 \(T\) 重新设计的三角阵实验仍需核实方差极限;附录 E.4 特别指出,仅凭终端平均方差收敛,不足以在任意 horizon-dependent array 中推导被丢弃早期块的可忽略性。不能把“某一轨迹后半段策略固定”直接当作所有跨样本量条件均已验证。
如果权重随样本量膨胀,中心块也必须足够长。应依据严格的小 \(o\) 条件选择 \(m_T\);原文对 \(T^{1/3}\) 权重与 \(T^{2/3}\) 中心块的口头描述只是量级提示,边界上的相同幂次本身未必满足条件。持续每轮更新的策略若没有有限非零随机方差极限,应走 Theorem 2–4,而不是因为可以计算平方和就声称自归一化有效。
一个完整示例¶
动态定价把动作设为统一价格,奖励是顾客是否续订,顾客属性为上下文。真实续订概率采用 logistic 随机效用模型,价格敏感度 \(\beta\) 是推断目标,基线需求异质性是未知辅助函数。价格不根据当前顾客属性个性化,所以该例与一般“看到上下文再选动作”的描述略有不同,但仍可用上下文无关策略嵌入框架。
普通 logistic score 把价格与续订残差相乘,其对未知基线需求的一阶变化通常不正交。附录 C.2 在评价分布下用 Bernoulli 方差加权的条件价格均值残差化价格,再将残差化价格乘以续订残差;相应信息量由残差化价格平方与 Bernoulli 方差的总体均值给出。这一步把需求异质性的一阶扰动从价格敏感度 score 中移除。
实施时先用历史数据拟合需求和价格敏感度,再根据估计收益选择贪心价格,同时保留探索概率。新顾客到来后记录价格、续订结果及其实际采样概率,计算正交校正值。如果策略仍频繁变化,就运输历史平方增量以估计当前方差、逐轮稳定化;只有另行满足随机极限条件时,才能直接累积实际平方增量自归一化。两条路线都用于给同一个价格敏感度目标做区间估计,不是通过比较区间长度来改写采样策略。
损失函数 / 训练策略¶
这是一套统计推断方案,不包含通用神经网络训练损失。目标拟合可使用评价分布下的加权风险,Riesz 表示可通过 Hessian 二次型减去泛函导数的优化问题估计;具体学习器仍须满足定理中的可测性、局部正则性和速率要求。
作者建议用固定比例的初始 burn-in 训练 pilot,推断时排除这些观测,并可冻结拟合器或按批次更新。在冻结 pilot 的特例中,通用时间平均条件化为三个估计对象各自达到 \(o_p(T^{-1/4})\)。这是便于控制早期大误差和计算开销的实现建议,不是把 burn-in 数据反复当作新独立样本使用。
动态定价模拟用带 ridge 惩罚的 logistic regression,每轮拟合,惩罚系数为 \(\lambda=0.1\),顾客特征包括六个属性的低阶多项式及两两交互项。该具体实验不等于已经检验所有黑箱非参数学习器,也没有逐项实证确认通用定理速率。
实验关键数据¶
主实验¶
原文主要报告覆盖率与平均区间长度,覆盖率指重复模拟中置信区间包含目标的比例。缓存保留的是图题及文字描述,没有精确读数表,因此下表只记录可核实的配置和定性结果,不从图形编造覆盖率小数或提升百分比。
| 实验 / 对照 | 可核实配置 | 原文结果 | 证据 |
|---|---|---|---|
| 动态定价主图 | 名义覆盖率 0.95;图题写 \(T=5000\),200 次重复 | 两条本文路线接近名义覆盖,区间长度相似 | Figure 1,Section 4 |
| GLM 与 IPW-GLM | 两者均使用标准 sandwich 方差 | 自适应采样下显著欠覆盖;仅加 IPW 不足 | Section 4,Figure 1 |
| 动态定价补充设置 | \(\beta=1\)、\(\tau=0.5\);10 个价格,从 0.5 到 5,间隔 0.5;均匀评价策略;\(\epsilon=0.1\) | 无唯一最优价格时基线失效,强 margin 下也观察到欠覆盖 | Appendix C.2,Figure 5 |
| 无 margin 双臂老虎机 | 高斯奖励方差 1;两臂均值相等;均匀评价策略;\(T=10000\) | Theorem 2 区间覆盖符合目标;OLS 随适应性增强更欠覆盖 | Appendix C.1,Figures 2–4 |
动态定价样本量存在原文内部冲突:C.2 正文写 \(T=2000\),Figures 1、5 图题写 \(T=5000\),C.3 计算环境又写 \(T=10000\)。这些配置不能自行合并为一个确定实验设置。C.1 的轨迹长度为 10000,C.3 另给出该老虎机计算网格每格 500 次重复;本文不把轨迹长度误写成重复次数。
消融实验¶
原文没有标准模块删除消融。以下是采样机制与理论适用边界分析,采用附录 C 的真实配置,不虚构去掉校正或方差模块后的数值下降。
| 采样配置 / 分析对象 | 原文设置 | 理论与结果边界 |
|---|---|---|
| 亚线性探索后承诺 | \(T_0=T^{1/2}\) | 随机稳定方差的代表场景;仍须验证 Theorem 3 的所有条件 |
| 线性探索后承诺 | \(T_0=\lfloor0.5T\rfloor\) | 前段不再是可忽略的亚线性块,不能自动套用该示例的自归一化保证 |
| 随机切换的分段常策略 | 更新概率 \(p\in\{0.1,0.2,0.3,0.7\}\) | 局部稳定不等于全局具有所需随机极限;逐轮稳定化按条件适用 |
| 完全自适应 | 每轮更新策略 | Theorem 2 路线有条件保证;Theorem 3 在模拟中表现较好不构成额外定理 |
| 无 margin 双臂的算法对比 | \(\epsilon\)-greedy:\(\epsilon=0.1\);Thompson sampling:正态先验尺度 \(\tau=10\);另有 UCB | OLS 在 Thompson sampling 下严重欠覆盖;UCB 下 Theorem 3 区间更宽 |
关键发现¶
- 方差稳定化与偏差校正不可互相替代:IPW-GLM 的失败表明,只修正动作分布并不保证经典区间有效。
- 无 margin 是有意构造的困难场景,但补充定价实验的强 margin 基线也欠覆盖,有限样本不能只靠“最优动作唯一”判断安全。
- Theorem 3 在完全自适应模拟中接近名义覆盖、在部分老虎机实验中更保守;作者明确把这视为尚无一般理论解释的经验现象。
亮点与洞察¶
- 将目标设计与方差处理拆开,统一了平均处理效应、参数投影和部分线性目标的校正结构。复用时先定义评价分布下究竟要覆盖什么,避免把错设后的投影系数误当结构真值。
- 条件方差估计的运输权重同时使用当前与历史策略。它复用过去保存的增量,而非为每次变化重新训练一个复杂条件矩模型。
- 随机方差极限不是普通 CLT 完全失败的同义词。若能证明稳定收敛与二次变差一致性,随机尺度仍可通过自归一化消去。
局限与展望¶
- 采样策略必须已知;估计或缺失的 propensity 不能直接视为同一理论。作者将未知策略下如何保留渐近正态性列为开放问题。
- 保证是渐近的固定目标区间,不是有限样本保证、随时有效的 confidence sequence,也不自动支持任意可选停止。
- 方法允许错设,但依然要求目标唯一、曲率下界、正交性、包络矩、估计速率和足够重叠;黑箱学习器与退化探索都需单独核实。
- 主实验是模拟,没有真实部署或大规模非参数学习器对比;样本量表述不一致限制了精确复现。半参数效率是否达到最优界仍未解决。
- 缓存中附录 D 的中心估计定义缺少归一化,而后续证明使用均值尺度;Lemma 7 的陈述称加权四阶矩为 \(O_p(1)\),证明却保留可增长权重因子;Lemma 8 的陈述与后续平方差论证也不完全一致。这里不猜补作者公式,也不把附录建议当作已经核验无误的可执行配方。
相关工作与启发¶
- vs van der Laan et al. (2026):继承非参数 M-目标的 Hessian–Riesz 去偏表示,将独立同分布分析改成已知策略下的鞅推断,并增加两种自适应方差处理。
- vs Hadad et al. (2021) / Bibaut et al. (2021):共同依赖加权影响函数与方差控制,但本文不只针对臂均值或策略价值,而是给出光滑 M-泛函的通用构造。
- vs Guo and Xu (2025) / Leiner et al. (2026):将允许错设的有限维估计思路扩展到更一般目标;代价仍包括策略类复杂度、重叠和辅助估计条件。
- vs 在线线性去偏方法:Deshpande、Ying、Khamaru 等工作的未知策略路线与本文不同,不能把本文当作无需 logging probability 的替代品。
评分¶
- 新颖性: 4/5 — 统一非参数 M-泛函的自适应推断,并区分持续变化与稳定随机方差两种机制。
- 实验充分度: 3/5 — 模拟覆盖多类采样机制,但数值读数与复现配置不够清楚。
- 写作质量: 3/5 — 主线清晰,附录公式及样本量存在需澄清的不一致。
- 价值: 4/5 — 对在线实验、老虎机日志和错设模型下的统计推断具有较强方法参考价值。