跳转至

📐 优化/理论

🧠 NeurIPS2026 · 16 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (13) · 📷 CVPR2026 (22) · 🔬 ICLR2026 (220) · 🧪 ICML2026 (88) · 🤖 AAAI2026 (21) · 🧠 NeurIPS2025 (126)

🔥 高频主题: LLM ×2

Adam under Generalized Smoothness with Second-Moment-Type Stochastic Gradients

本文对有限时域校准、无偏差校正的 Adam 建立广义光滑性与二阶矩 ABC 噪声下的高概率收敛分析,证明置信度代价的 \(\delta^{-1/2}\) 指数不可一般消除,并区分 \(p<1\) 的期望上界与 \(1\leq p<2\) 的特定算法族最坏情形下界。

Amortized Optimal Transport from Sliced Potentials

以廉价的一维切片 Kantorovich 势函数作为特征,用共享线性系数预测原空间势函数,再恢复近似传输计划;RA-OT 与 OA-OT 减少训练成本并支持可变原子数,但并非所有场景下推理最快或生成质量最好。

Bayesian Optimization with Fisher Information Geometry: Gradient Bounds and Trust-Region Methods

本文用后验映射的拉回 Fisher 张量分离采集函数梯度中的模型几何与效用敏感性,并据此用正则化局部 Fisher 对角权重替换 TuRBO 的核长度尺度权重,在 SE 核基准上取得有竞争力的表现,但不提供外层贝叶斯优化的遗憾或全局收敛保证。

Bidirectional Information Flow (BIF) - A Sample Efficient Hierarchical Gaussian Process for Bayesian Optimization

BIF 用子高斯过程的采集图构造父模型软先验,再把父级真实响应按不确定性感知权重分给子模型持续学习,改善低预算组合任务的重建质量与学习轨迹,但这种反馈是有偏伪响应而非真实子任务分解。

Commutator Memory: Sparse, Path-Local Reading and Steering in Language Models

本文把两次训练更新的非交换残差分解为有符号的词元读出,在局部 SGD 条件下定位并干预训练次序差异,Qwen-3-4B 的定向干预使留出损失差距中位数缩小 32.0%,配对终点次序判别达到 66/72 = 91.7%。

Cumulative-Goodness Free-Riding in Forward-Forward Networks: Real, Repairable, but Not Accuracy-Dominant

本文证明累积 goodness 会在上游已分离样本上精确衰减深层块的局部判别梯度,并用去历史、难度门控和梯度补偿修复层健康,却发现修复没有成为准确率的主导收益来源,MGC 甚至使 CIFAR-100 的 Stage-1 单裁剪准确率下降 1.05 个百分点。

Dynamic Regret in Online Convex Optimization with Indicator Switching Costs

本文把二进制尺度重启的随机惰性 FTRL 分布交给切换感知元学习器,以最大耦合控制真实动作变化,在期望意义下获得分段常数比较器的近最优动态遗憾,并给出适用于小路径长度比较器的另一条保证。

Estimating and Orthogonalizing Unknown Pre-training Gradients for Continual Fine-tuning of Large Language Models

EoupCT 用冻结预训练模型和可学习软提示构造容易被新任务破坏的可微知识代理,再联合蒸馏与梯度投影保护历史任务和通用能力;在六个模型的 SuperNI/MMLU 子集实验中改善遗忘,但其“纯一阶”和“绝对零遗忘”表述需要限定。

Finite-Sample Performance of Gradient Descent in Logistic Regression with Gaussian Design

本文在正确设定的高斯逻辑回归中,用总体曲率分析与经验梯度的近似可逆性证明梯度下降线性进入统计误差邻域,并通过分开估计方向与范数得到高维下更尖锐的误差界,但大步长加速仅有局部保证,近最优区间的原文表述存在需要保留的条件疑点。

FluxLite: Inference-Time Proposal Control for Discrete Diffusion Models

FluxLite 在不重训离散扩散模型的前提下,联合调整稀疏跳转速率与补偿权重,以图散度保持目标边缘分布路径不变,并用局部规则 HEU 或小规模非负二次规划 D-VCG 缓解粒子权重退化。

Non-Linear Pricing Restores Tractability for a Data Seller

在已知买者线性估值与预算、按数据集分别定价的模型中,允许非线性价格反而把原先 APX-hard 的最优线性定价问题转化为可多项式求解的 LP,并保证存在总拐点数不超过买者数的最优方案;California Housing 构造实例还显示收益比至多 1.1、总拐点数至多 10。

Online Learning via Learned Latent Bayesian Tracking

本文离线学习适合分布漂移的低维参数生成空间和动态先验,在线用每个带标签样本做一次潜空间扩展卡尔曼滤波,再重建预测参数,在图像分类和时变无线接收中改善有限监督下的适应效果与计算成本。

QuanVI: Score-based Variational Inference via Quantum Maximally Mixed States

QuanVI 将 EigenVI 的单特征向量解改成低能子空间上的最大混合态,再用局部量子张量网络压缩密度算子,在链式结构的合成分布上扩展到 100 维,但局部窗口的表达能力和计算代价仍是主要限制。

Simple Extensions of Single-Objective Acquisition Functions and Hedge Strategies for Multi-Objective Bayesian Optimization

本文用单目标采集函数的向量帕累托搜索生成候选,再以预测均值的超体积筛选查询点,并用 MO-Hedge 自适应选择采集策略;在九个基准上表现有竞争力,但低运行开销的优势主要体现在批量设置,不能概括为所有设置都最快。

SimpleEvol: An Agent-Loop Framework for LLM-Driven Automated Heuristic Design with Minimal Human Priors

SimpleEvol 用单条“生成代码—执行评价—压缩记忆”搜索轨迹替代复杂的种群与进化算子编排,在十个 LLM 上获得最高的 TSP/CVRP 智能转化回归斜率,并在 GPT-5-mini 下取得更低的各规模测试 gap,但这不等于证明“先验越少必然越好”。

When One Leak Pays Forever: Context Binding and the Price of Deterring Collusion

论文用一次终止性泄露所能触及的未来价值流刻画联盟威慑的精确门槛,证明密钥真正按上下文隔离时只需覆盖单轮价值,而长期复用在无折扣的有限期内可把所需责任敞口放大到单轮的 \(T\) 倍。