SMILE: Bridging Continuous Optimization and Discrete Symbolic Recovery¶
会议: NeurIPS2026
arXiv: 2609.04639
领域: 可解释性
关键词: 符号回归、结构分解、符号激活、门控剪枝、常数恢复
一句话总结¶
SMILE 先从数据识别可分解结构,再拟合固定符号激活网络,最后通过剪枝、常数重拟合与梯度舍入恢复简洁表达式,在 SRBench 的高噪声条件下取得较强符号恢复能力,但并非无噪声恢复率或预测精度全面领先。
研究背景与动机¶
符号回归(symbolic regression,SR)不仅要预测输入对应的输出,还要给出可阅读、可计算的数学表达式。遗传编程可以直接搜索表达式树,却必须面对运算符、连接方式和常数共同构成的组合空间;神经网络容易用梯度优化拟合数据,但拟合成功不意味着能够还原一个短小的真实方程。尤其是多个简单因子相乘或相加时,整体函数可能难学,表达式里还容易残留大量浮点系数。
把正弦、指数等数学运算放进网络,是连接这两种路线的一种办法。问题在于,连续训练仍可能使用过多路径,得到的是一个可以展开成公式的网络,而不是一个有辨识力的科学规律。SMILE 因而不把数据只看作监督信号:先检查哪些变量近似遵循幂律,哪些变量破坏了这一模式,再决定直接学习、学习倒数,还是分开学习两个子表达式。这样减少的不是输入维度本身,而是单次拟合必须承担的组合结构。
本文把训练和恢复分别负责的事情区分开来:训练找到数值上可用的表示,恢复阶段再压缩结构并检验哪些常数可以简化。核心 idea:用数据中的组合线索限制符号网络的拟合任务,再以预测变化为约束,将连续参数逐步变成简洁的离散表达式。
方法详解¶
整体框架¶
输入是数值样本对,输出是最终闭式表达式,而不是一个需要保留全部神经网络参数的预测器。流程依次经过变量分析与分解、符号激活网络、门控剪枝与重拟合、梯度常数舍入;遇到分解情况时,分别拟合剩余变量的子表达式和所选变量的残差关系,再组合恢复。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["数值样本"] --> B["变量分析与分解"]
B -->|直接、倒数或子问题| C["符号激活网络"]
A -.->|拟合监督| C
C --> D["门控剪枝与重拟合"]
D --> E["梯度常数舍入"]
E --> F["最终表达式求值"]
X["新输入"] --> F
虚线表示训练数据的监督作用;最终推理由恢复后的表达式接收新输入,不再执行结构扫描或重新训练网络。倒数分支在恢复后需要把结果再取倒数,分解分支需要保留相加或相乘的组合方式。
关键设计¶
1. 变量分析与分解:先判断哪个变量让简单规律变复杂
对每个输入变量分别做目标绝对值与变量绝对值的对数线性回归,比较拟合优度。所有变量都呈现较高且相近的拟合优度时,流程倾向于直接训练;同时比较目标和目标倒数的低阶多项式拟合,如果倒数更容易拟合,就先学习倒数,以缓解分母导致的数值不稳定。若某个变量的拟合优度明显更低,就尝试将它视为额外的组合因子,而不是直接增加网络深度。
分解并不能真的从连续样本里找到大量“某变量精确相等”的记录。作者在两个固定值附近取窗口,并约束其他变量落在窄带内,用局部线性回归估计目标对所选变量的敏感度。下面是附录实际采用的恒定性分数,其中局部回归斜率估计偏导,窗口宽度决定总漂移,分母是窗口内样本目标值的标准差:
窗口从大到小尝试,优先选样本更多且通过阈值的窗口;默认有 6 个候选相对半宽,从 20% 到 2%,阈值为 0.05。若全部失败,仍退回最小窗口,因此“变量固定”只是近似,并没有在所有问题上获得误差保证。窗口内先恢复剩余变量的关系,再比较两个固定值附近的乘法残差是否符合近似恒定比例;成立时拟合除法残差,否则默认拟合减法残差,最后相乘或相加。
这一设计适合一个变量破坏其他变量近似幂律模式的情况,但低对数线性拟合优度不是可分性的证明。输入或输出为零时,对数扫描本身也需要数值处理;多个互相耦合的非幂律变量、残差除数接近零、窗口内有效样本太少,都可能削弱分解判断。
2. 符号激活网络:让连续参数直接控制可展开的数学运算
每个隐藏层只有五种固定激活:正弦、乘法、恒等、对数和指数。正弦、恒等、对数、指数作用于输入的线性组合;乘法神经元则在对数空间学每个输入的指数,使一个单元就能表示幂、开方和比值,而不必逐个搜索运算符。所有层之间还有稠密残差连接,输入追加常数 1 来提供偏置通路。
这里的实数等式要求对数输入为正,不能据此声称任意带符号输入和任意实数指数都能安全计算。实现对对数输入设置下限、对指数输入设置上限,并惩罚落入截断区间的输入;这使训练数值可控,却也改变了截断区域中的函数,且截断边界不是处处光滑。最终将网络解释成普通数学表达式时,仍需检查其有效域和截断是否影响了拟合。
网络同时学习边门和激活门:边权乘以对应门的 sigmoid 值,每个神经元输出再乘以自己的激活门。门的初始 logit 都是 0,对应开度 0.5;稀疏惩罚偏向关闭不必要通路,另一个门惩罚抑制中间开度,为后续离散删除提供准备。
作者用恒等、指数和对数构造 sigmoid,再通过叠加及并行复制模拟足够宽的 MLP,从而论证网络族的通用逼近能力。这是允许足够容量时的表达能力论证,不是实验所用每层五个神经元、1–2 层浅网络能够表示任意函数的保证,更不是梯度训练能找到真实符号方程的保证。
3. 门控剪枝与重拟合:先删结构,再重新校准留下的系数
拟合后的门不是已经完成的离散结构选择。恢复时逐个试关门,选择对训练集拟合优度影响最小的候选;若损失的拟合优度低于容忍阈值,就接受关闭,再重复直到无法继续。边门删除连接,激活门删除整个神经元,最后仅将仍活动的子图逐层组合成表达式。
直接把训练权重原样搬到缩减后的表达式并不可靠:删掉一个通路后,其他系数的最优位置也会改变。因此,作者对提取表达式中的数值常数再做最小二乘拟合,为舍入提供更合适的起点。剪枝依据是训练集上的局部删除代价,所得子图也只是贪心过程的结果,不代表全局最小表达式;对相互补偿的通路,删除顺序可能影响最终结构。
4. 梯度常数舍入:按输出敏感度,而不是只按小数位决定简化
一个系数离整数很近,不代表舍入安全:它可能位于指数或高频正弦内部,对输出影响很大。反之,数值变化较大的系数也可能因所在通路不敏感而可以简化。SMILE 将候选简单常数代入,估计该参数变化对表达式输出的影响,并要求在全部检查样本上都小于阈值:
附录先由中值定理给出参数变化区间上最大导数控制的误差界,实际算法为减少计算,只在候选舍入值处计算导数来近似这个最大值。两者不能混同:端点的一阶局部敏感度检验不保证整个区间上的误差界成立,也不证明舍入到的整数、有理数或常见常数就是生成数据的真实常数。它保证的是一个近似检查通过,而不是科学发现被证明。
一个完整示例¶
附录 Table 3 的 II.15.4 目标表达式为 \(-\mu B\cos(\theta)\),恢复式为 \(-\mu B\sin(\pi/2-\theta)\)。乘法变量与角度变量的组合说明为什么单纯要求每个变量都遵循同样幂律不够;分解路线可以先拟合固定角度时的乘法部分,再学习角度相关残差。
这里只用这个例子说明机制,不声称原文记录了该问题实际采取的内部路线。恢复阶段允许使用正弦等价式而非原始余弦写法,所以正确表达式不必拥有相同的语法树;表中这个问题在全部四个测试噪声水平下都恢复成功,但不能由此推广为任意三角方程都能恢复。
损失函数 / 训练策略¶
训练损失由数据均方误差、截断区间惩罚和门惩罚组成;前者提供拟合监督,后两者分别防止依赖无效数值区域、鼓励稀疏结构。
附录配置采用 Adam,学习率 0.1,1000 个 epoch,batch size 512,早停 patience 300;隐藏层数为 1 或 2。直接路线先尝试 1 层,必要时再用 2 层,分解子问题使用 1 层。对数下限为 0.005,指数上限为 4;剪枝容忍值为 0.01,舍入容忍值为 0.001。
因此“不需要用户选择运算符或逐题调结构”不等于“没有超参数”。模型仍依赖训练设置、窗口、剪枝、舍入和截断阈值,损失权重也进入目标函数;附录 Table 1 没有列出两项损失权重的具体值。
实验关键数据¶
主实验¶
评估使用 119 个 Feynman 方程、14 个 Strogatz ODE 问题和筛选后的 57 个黑箱回归问题,黑箱输入为连续特征且维度不超过 10。Feynman 每个问题从原始 100 万个点中随机抽取 1 万个训练点,结果报告 3 次独立试验的平均值。
符号解率(SSR)是精确恢复方程的比例;精度解率是测试拟合优度超过 \(R^2>0.999\) 的问题比例。复杂度按表达式树节点计数,每个运算符、变量、常数各占一个节点。黑箱任务没有真实表达式,所以只能评估中位拟合优度与复杂度,不能声称发现了真实方程。
噪声是均值为零的高斯扰动,其标准差等于目标均方根乘以噪声系数;测试噪声水平为 \(\sigma\in\{0,0.001,0.01,0.1\}\)。下表保留正文和附录可核对的结论,不从缓存未包含数值坐标的图片猜测绝对 SSR。
| 数据集 / 条件 | 指标 | SMILE 的报告结果 | 比较边界 / 证据 |
|---|---|---|---|
| Feynman,无噪声 | SSR | 排名第三 | 落后 PySR、ParFam;正文 §4、Figure 3 |
| Feynman,最高噪声 | SSR | 排名第一;随噪声上升下降至多 8% | PySR、ParFam 下降超过 30%;正文 §4 |
| Feynman | 精度解率 | 低于最佳基线 | 浅网络优先保证可恢复性,而非最高拟合精度;§4 |
| Strogatz,无噪声 | SSR | 排名第二 | 落后 PySR;§4、Figure 5 |
| Strogatz,最高噪声 | 精度解率 | 最佳;从无噪声起下降至多 20% | PySR、ParFam 约下降 70%;附录 E.2 |
| 黑箱 57 问题 | 中位拟合优度 / 复杂度 | 位于 Pareto 前沿,复杂度仅高于 DSR | 中位拟合优度仍低于若干基线;附录 E.3 |
上表中的 8%、30%、20%、70% 沿用原文的下降措辞;论文未明确这些数值指相对下降还是百分点,不能自行改写单位。Pareto 前沿也不意味着准确率最高,而是不存在同时在准确率和复杂度上更优的已比较方案。
消融实验¶
下表来自附录 E.4,移除一个组件后其余部分保持不变。消融设置另有每阶段时间预算,超过预算计为 timeout,因此恢复率降低也包含流程未在预算内结束的情况。
| 配置 | 相对完整流程的报告变化 | 时间 / 失败情况 | 机制解释 |
|---|---|---|---|
| 去掉变量分析与分解 | SSR 约下降 15%,精度解率约下降 30% | 训练时间约翻倍,无 timeout | 整体拟合增加表达式长度与结构负担 |
| 去掉梯度常数舍入 | SSR 约下降 15%,精度解率约下降 30% | 训练时间约翻倍,无 timeout | 浮点系数和指数无法归并为精确常数 |
| 去掉门控剪枝 | SSR 约下降 35% | 相当一部分方程 timeout | 冗余活动系数使后续优化与舍入变重 |
| 去掉常数重拟合 | SSR 约下降 35% | 相当一部分方程 timeout | 剪枝后系数未重新校准,舍入难以简化 |
消融百分数同样保持原文单位,不补成百分点;原文没有给出可从文本核验的精确 timeout 比例,也没有在 Table 1 列明消融阶段预算,故不填写这些数字。
关键发现¶
- 剪枝与常数重拟合不只是使公式更短:它们还直接影响后续步骤能否在时间预算内完成,因此是可恢复性的计算瓶颈控制器。
- 附录 Table 3 中,II.15.4 和 II.6.15b 在全部测试噪声水平下成功,而 I.6.2a 与 I.40.1 只在无噪声时成功。平均抗噪优势不代表每个方程都稳定。
- 深度增加可以改善预测拟合,但作者指出它并不改善 SSR:额外自由度让表达式更复杂,剪枝更难。这里必须区分“拟合数据”和“发现公式”。
- 时间口径存在待澄清之处:正文描述 SMILE 为分钟级、竞争方法为数小时,附录 Table 2 又给出平均每题 43.9 s。硬件为 Xeon Gold 5420+ 和 RTX A5000 24 GB,不能在范围未说明时把这两种时间描述合并成同一个精确加速倍数。
亮点与洞察¶
- 把结构线索前置,比单纯给符号网络加正则更有针对性。它利用输入变量造成的规律破坏来决定拟合任务,使浅模型不必独自承担所有组合关系。
- 常数舍入由输出敏感度控制,而非固定保留几位小数。这个思路可用于可解释模型的后处理,但需要独立验证舍入后的实际误差和有效域。
- 精确符号恢复允许数学等价而不要求语法一致。正弦替代余弦的例子提醒评估者:树结构不同不一定代表规律不同。
局限与展望¶
- 幂律线索与单变量加法 / 乘法分解更适合物理规律;一般黑箱关系可能缺少这些结构。可增加更一般的可分性检验,并显式报告分解失败后的回退表现。
- 浅层结构改善剪枝可行性,却限制复杂方程的拟合能力。自适应深度需要同时控制恢复成本,而不是仅依赖更高拟合优度来选择模型。
- 对数和幂运算的实数有效域、截断区域中的模型行为、舍入后跨域求值应单独检查。数据内低误差不能保证外推时没有奇点或无定义输入。
- 梯度舍入只做局部近似,可改为沿参数区间检查敏感度,或直接验证舍入前后输出误差;简单常数候选的生成细节也需要进一步明确。
- 原文存在计数不一致:附录 C 写总计 252 个问题,但分组数 119、14、122 相加为 255;正文写 15 个原始基线加 4 个扩展,附录 D 又写 14 个原始基线加 4 个扩展却声称共 19 个。这里保留已明确的实际评估组别,不替作者修正全集或基线数。
- 仅报告三次试验平均值不足以独立说明显著性。缓存的文字未交代统一置信区间、基线重跑预算及时间范围,速度和恢复率结论仍需结合完整实验产物复核。
相关工作与启发¶
- vs PySR:PySR 在离散表达式树上进化并优化常数,SMILE 先在符号网络上连续拟合再恢复结构。无噪声 Feynman 的 SSR 仍是 PySR 更高,SMILE 的优势主要体现在抗噪与简洁性 / 时间权衡。
- vs AI Feynman:二者都利用可分结构,但 SMILE 的残差判断作用于已恢复的符号子表达式,而不是仅依赖神经近似;结构分析仍然是启发式,不应当作完全新的可分性原理。
- vs ParFam / EQL:ParFam 需要指定函数族和多项式度数;EQL 的符号激活与本文有共同出发点。本文进一步把分解、门控剪枝和常数恢复串成流程,但没有在全基准上直接比较 EQL,不能宣称已实验验证全面优于它。
- 研究启发:将“表达式是否简短”“是否正确恢复”“有效域是否成立”分别检查,有助于防止把漂亮公式误认为真实规律。适合进一步设计含带符号输入、近奇点区域和强变量耦合的压力测试。
评分¶
- 新颖性: 4/5 — 结构分析与连续符号网络、离散恢复的整合有辨识度,部分思想已有相关基础。
- 实验充分度: 3/5 — 覆盖真实方程、黑箱和消融,但计数、时间口径及统计报告仍需澄清。
- 写作质量: 3/5 — 流程容易理解,通用逼近与实际浅网络、理论误差界与端点近似的边界需更明确。
- 价值: 4/5 — 对噪声科学数据的简洁公式恢复有实用启发,但不宜替代最高精度回归或规律验证。