跳转至

🧪 ICML2026 论文汇总

1844篇ICML2026论文解读,涵盖图像生成(141篇)、模型压缩(116篇)、AI 安全(114篇)、强化学习(110篇)、可解释性(91篇)、多模态 VLM(89篇)、优化/理论(88篇)、LLM Agent(83篇)等 50个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。


💡 LLM Reasoning (78)

Chain-of-Thought Reasoning in the Wild Is Not Always Faithful

本文在非对抗性、自然措辞的提示下(无人工注入偏见),揭示前沿LLM的链式推理(CoT)存在两种不忠实行为——隐式后验合理化(对逻辑对立的比较问题给出矛盾的相同答案并各自编造合理论证)和不忠实非逻辑捷径(在数学难题中跳过关键推理步骤却得出正确答案),生产模型不忠实率最高达13%,即使思考型模型(DeepSeek R1: 0.37%,Sonnet 3.7 thinking: 0.04%)也非完全忠实。

Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

作者先指出"纯数值奖励 RL"有三个硬伤(性能平台、自发反思无效、顽固失败),再把自然语言批评(critique)接进在线 RL:模型既学初始回答、又学"按批评做的自我精炼",并用一个 shaping 函数偏向"正确但陌生"的精炼、抑制错误精炼,从而在八个推理基准上把 Pass@1 平均提升约 +15.0~21.6%(Qwen 系列)。

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

提出 Prefix-RFT,通过从专家示范中采样前缀拼接模型续写来构建混合轨迹,在保持 RFT 目标导向优化的同时注入 SFT 的知识引导,在数学推理任务上显著超越独立 SFT、RFT 及已有混合方法。

Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

作者用注意力动力学给推理过程"显影"——发现模型在生成时存在一个"先铺垫(preplan)、后定锚(anchor)"的两拍节奏,并把刻画这个节奏的两个内部指标(WAAD/FAI)直接转成 RL 里的 token 级优势放大系数,让 GRPO 把信用集中打在真正决定下游推理走向的关键 token 上,在 Countdown、QA 和多个数学推理基准上稳定提点。

Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning

提出 BRIDGE 框架,将 SFT 与 RL 的整合建模为双层优化问题——SFT 作为上层教师通过轻量 LoRA 模块学习选择性地向 RL 学生传递有益监督信号,在五个数学推理基准上平均绝对提升超过 3 个百分点。

FloorplanQA: A Benchmark for Spatial Reasoning in LLMs Using Structured Representations

FloorplanQA 用 2,000 个 JSON/XML 格式的 2D 室内布局 + 16,000 道几何题(距离/可见性/路径/放置等)系统性诊断了 15 个前沿 LLM 的"纯符号空间推理"能力,发现它们能算简单距离却普遍栽在并集、规划和约束满足上,且 Python 工具增强能修复算术错误但救不了算法层面的失败。

Self-Play Only Evolves When Self-Synthetic Pipeline Ensures Learnable Information Gain

作者主张当下的"LLM 自博弈"之所以在几轮内就崩溃,根本原因是自合成数据没有提供可学习信息增益;他们用有界 MDL/epiplexity 把"可学习信息"形式化,并提出三个系统级设计——非对称协同演化、容量预算增长、主动信息寻取——共同保证三角色 (Proposer-Solver-Verifier) 自演化循环中可学习信息单调上升。

R2-Router: A New Paradigm for LLM Routing with Reasoning

本文提出 R2-Router,把"输出 token 预算"从被动估计量改造成可控变量,让路由器在 (LLM, 预算) 联合空间里搜索,用一个轻量的多头质量预测器把每个 LLM 从一个静态点扩展成一条质量-成本曲线,从而以 4–5× 更低的成本达到与现有路由器相当的质量。

A Formal Comparison Between Chain of Thought and Latent Thought

本文从计算复杂度理论出发,形式化比较 CoT(链式思维)与隐式思维(Looped Transformer / Coconut)的表达能力,证明隐式思维在多对数深度下严格达到 \(\mathsf{TC}^k\),而 CoT 最多到 \(\mathsf{TC}^{k-1}\);同时在概率设置下首次揭示 CoT 通过随机解码可支持 FPRAS 计数,反过来超越确定论隐式思维。

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

本文把"reasoning LLM 何时停止思考"从一个不可解释的阈值调参问题,重构为一个用户可指定 risk 容忍度的 conformal 风险控制问题:用两个阈值——上阈值在模型自信时停(控 false positive),新提出的参数化下阈值在模型在不可解题上"想不动"时强行停(控 false negative)——并通过 UCB 算法从校准集自动求出满足风险约束的阈值,在 AIME / GPQA / MathVision 上实现"准确率几乎不掉、token 大幅省"。

查看全部78篇「LLM Reasoning」论文 →


🦾 LLM Agent (83)

A Minimal Agent for Automated Theorem Proving

本文提出 AxProverBase——一个极简的 Lean 4 定理证明智能体,仅靠"编译器反馈 + 自管理笔记本 + 轻量工具搜索"三个组件,在不微调的前沿 LLM(Claude Opus)上达到甚至超越 Hilbert/Seed-Prover 等专用系统,成本却低出 100 倍。

A Systematic Study of Behavioral Cloning for Scientific Data Annotation

这篇论文搭了一个由 9 个程序化合成标注任务 + 虚拟标注员组成的受控框架,系统研究「行为克隆」(让 VLM 直接模仿人类在标注界面里点击、导航、撤销的完整操作轨迹)能否替代「直接预测标签」,并通过训练动态、缩放规律、迁移能力和线性探针四个维度,揭示了技能分层涌现、模型比训练数据更少犯错却仍会纠错、多任务预训练才能迁移、以及跨任务共享的「出错」内部表征等一系列发现。

ACON: Optimizing Context Compression for Long-horizon LLM Agents

Acon 用失败轨迹对比来优化自然语言压缩指南,同时压缩 agent 的历史和观察上下文,在 AppWorld、OfficeBench 和多目标 QA 上把峰值 token 降低 26% 到 54%,并保持或提升长程任务成功率。

AdaMEM: Test-Time Adaptive Memory for Language Agents

AdaMEM 把智能体记忆拆成「离线存的长期轨迹记忆 + 在线现合成的短期策略记忆」两层,让智能体在长程任务执行到一半时还能随当前状态动态刷新指导策略,配合一个只保留「真正改变了动作」的策略的微调技术 Step-MFT,在 ALFWorld、WebShop、HotpotQA 上相对静态记忆基线最高拿到 13~17% 的相对提升。

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

通过 Monte-Carlo rollout 量化"哪些回合的 thought / observation 可以省",再用冷启动 SFT + 双采样 omit-aware GRPO 训出能自适应跳过冗余思考和观测的 8B agent,五个基准上 token 用量大降而准确率与七大前沿模型持平。

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

这篇论文把网页 Computer-Use Agent 从逐步截图-调用 LLM-执行的循环,改造成类似 JIT 编译器的系统:把自然语言任务编译成可校验、可缓存、可并行调度的代码计划,从而让 JIT-Planner 比 Browser-Use 快 10.4×且准确率高 28pp,让 JIT-Scheduler 比 OpenAI CUA 快 2.4×且准确率高 9pp。

Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents

把"对黑盒 LLM Agent 做 RL"重写成"从最优策略后验里采样",用序贯蒙特卡洛(SMC)配一个轻量价值函数在测试时引导冻结的黑盒模型,不碰任何参数就实现 RL 式优化,在 AgentGym 三个环境上既超过 prompting 基线、又在放大测试时计算后反超需要全参数权限的 GRPO。

AgentXRay: White-Boxing Agentic Systems via Workflow Reconstruction

作者把"对黑盒 agent 系统反推一个等价白盒 workflow"作为新任务 AWR,用 MCTS 在 agent 原语序列空间中搜索,再配上一种基于评分动态着色的 Red-Black 剪枝来平衡深度与宽度,在五个真实领域上实现可解释的白盒重建。

Answer Only as Precisely as Justified: Calibrated Claim-Level Specificity Control for Agentic Systems

这篇论文把 agentic 系统里的“说得过细但证据不够”建模为 claim 级过度承诺问题,并提出 calibrated CSS:对每个原子 claim 在精确表述、粗粒度回退和省略之间做校准选择,在 LongFact 全量实验中将 OAU 从无后处理的 0.8460 提升到 0.9130,同时保留 0.9381 的特异性。

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

提出 AutoRPA 框架,通过翻译器-构建器流水线将 ReAct 风格 GUI Agent 的交互轨迹自动蒸馏为可复用的 RPA 函数,结合混合修复策略迭代优化代码,在保持甚至超越原始 Agent 成功率的前提下减少 82%~96% 的 token 消耗。

查看全部83篇「LLM Agent」论文 →


⚖️ 对齐 / RLHF (37)

TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning

针对"只优化准确率反而鼓励瞎猜、强行教拒答又过度保守"的两难,TruthRL 用一个区分"答对 / 幻觉 / 拒答"的三元奖励在 GRPO 上直接优化真实性,把幻觉率从 43.5% 压到 19.4%、真实性得分从 5.3% 拉到 37.2%。

Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards

本文先理论证明 RLVR(如 GRPO)训练中"提升准确率"与"减小校准误差"两个目标在 Fisher 度量下梯度方向负相关、不可调和,再提出 DCPO:让模型在推理轨迹后显式吐出一段 verbalized 置信度,给推理 token 和置信度 token 分配各自的 reward / advantage / 掩码梯度,从而在保持 GRPO 同等准确率的前提下把 ECE 从 0.435 降到 0.128(相对降 71.6%)。

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

MAHALO 把"标准化 PRM 训练 + 多动作头 DPO + 带 KV-cache 续存的 PRM 引导解码"拼成一套统一框架,让一个 LLM 在数学(可验证)、人类价值观(不可验证)、多轮辅导(交互式)三类目标上同时被对齐,并且在推理时能通过头权重与 PRM 选择平滑地切换偏好。

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

本文把 Bradley–Terry 奖励模型重写成一个贝叶斯非负因子分析(NFA)的生成过程——局部稀疏的实例隐变量 \(\bm{\theta}\) 与全局稀疏的奖励字典 \(\Phi\) 同时建模,以"先解耦再去偏"抑制 RLHF 中由长度/风格等捷径特征引起的 reward hacking,并通过 Weibull 重参数化的摊销变分推断把整个框架塞进现代 LLM 主干,在 Unified-Feedback、RewardBench、HHH、MT-Bench 上一致超过 BT、Ensemble、InfoRM 等强基线。

GIST: 用梯度子空间投影做 instruction tuning 的 targeted 数据选择

GIST 把"为 target task 挑 instruction tuning 数据"看作 gradient subspace alignment——证明 LESS 等用 Adam states 当 diagonal preconditioner 在 LoRA 上失效(cross-parameter 耦合 + 低秩 task subspace),改用 validation gradients SVD 抽 task-specific 低秩子空间 + cosine similarity 选样本;在 MMLU/TydiQA/BBH 上匹配或超越 LESS,只用 0.29% 存储和 25% 计算时间。

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

SPARD 用"安全投影交替优化(SPAG)+ 相关性-多样性 DPP 安全样本选择"两件套,把"微调后模型必须满足安全损失约束"显式写成约束优化问题,每步先做效用更新,再用闭式投影把参数拉回安全半空间,同时只用 3% 任务相关且彼此互异的安全样本,就把四种有害微调攻击的平均 ASR 从 SFT 的 87.93% 砍到 9.45%,几乎不掉下游精度。

Consistency Training Can Entrench Misalignment

本文提出"一致性非中性假说",通过在 108 个"模型有机体"上评估 7 种一致性训练方法,发现一致性训练并非对齐中性的——它系统性地抑制脆弱的奖励黑客和涌现性错位,但放大稳定的谄媚行为,分布偏移(而非分数选择)是主要驱动因素。

Operationalising the Superficial Alignment Hypothesis via Task Complexity

作者用"解决某任务到目标性能所需的最短程序长度"这一算法信息论指标(task complexity)重新定义了表面对齐假设(SAH),把"数据高效/参数高效/推理控制"这三种看似各说各话的证据统一成"在同一条长度–性能 Pareto 曲线上找短程序"的不同策略,并实测发现:把预训练模型适配到数学推理、机器翻译、指令跟随等任务上,常常只需要几千字节到几兆字节的信息,而后训练的作用是把"够到强性能所需的程序长度"压缩好几个数量级。

PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization

PICACO 把"让 LLM 在一个 prompt 里同时遵守多个甚至互相冲突的人类价值"形式化为最大化"价值集与响应之间的条件总相关性"(Total Correlation, TC),不动模型参数,通过 EM-like 的"响应增强 + 指令精炼"两步迭代自动搜索一条 meta-instruction,使 GPT-3.5 / LLaMA-3.1-8B / Gemini-1.5-Flash 在 Schwartz、HH 等 5 套最多 8 个价值的组合上都超过 OPRO、Modular Pluralism 等强基线。

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

把"该用什么奖励模型来对齐 LLM"建模成一个 Stackelberg 博弈,证明最优奖励是一个逐 prompt 的阈值奖励(高于阈值给满分 \(B\)、低于给 0),并用从基座模型采样的蒙特卡洛估计高效求出阈值,最后用 sigmoid 软化后无缝插进 CD/ARGS 等推理时对齐方法,在几乎零额外开销下把平均奖励和对 baseline 的 Win-Tie 率提到 66% 以上。

查看全部37篇「对齐 / RLHF」论文 →


👻 幻觉检测 (21)

A Unified Definition of Hallucination: It's The World Model, Stupid!

这是一篇 position paper,主张把翻译、摘要、开放问答、RAG、多模态、智能体等各路"幻觉"统一成同一件事——对一个"参考世界模型"的、用户可见的、不准确的世界建模:每个场景只是对"参考世界 \(W\)、视图函数 \(V\)、冲突策略 \(P\)"三件套做了不同选择,从而把碎片化的定义收敛成一个可比较、可生成大规模基准的通用模板。

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets (CAIA)

CAIA 用 17 个前沿大模型在 178 个时间锚定的加密货币真实任务上构建首个"对抗性高风险"agent 基准,发现:无工具时所有模型只有 12–28% 准确率(接近随机猜测),有工具时最强 GPT-5 也只到 67.4% vs. 人类入门分析师 80%;更致命的是模型 55.5% 的工具调用偏向"不可靠的网页搜索"而绕过权威链上数据,导致 Pass@k 指标系统性掩盖了"靠试错碰运气"的危险行为。

Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation

提出 GIFT 方法,通过追踪 VLM 在理解用户查询时视觉注意力的正向变化("注视转移")构建视觉显著性图,并在解码阶段同时增强视觉和查询 token 的注意力以保持跨模态融合平衡,在 CHAIR 上最高提升 20.7%,且仅增加 1.13× 延迟。

Automatic Layer Selection for Hallucination Detection

提出 FEPoID(内在维度的首个有效峰值)作为无需训练的自动层选择准则,并结合首句截断策略(FST),在多种 QA 和摘要幻觉检测基准上持续选出接近最优的中间层,显著超越已有基线方法。

Hallucinations Undermine Trust; Metacognition is a Way Forward

本文是一篇 position paper,论证"彻底消除 LLM 幻觉"在原理上无法逃避一个"区分度税"(discrimination gap → utility tax);作者主张把目标从"消灭幻觉"改为忠实表达不确定性(faithful uncertainty),并把这种 metacognition 视为 agentic LLM 调用工具时不可或缺的控制层。

Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

本文发现 LVLM 幻觉源于对正确视觉证据的"关注不足 + 生成中遗忘",并观察到注意力对视觉证据存在显著的层间差异(ILVAD),据此提出一个 train-free / plug-and-play 的方法:用层间差分构造视觉证据显著性图,再在生成过程中持续加权视觉证据 token 和"扎根于证据"的文本 token,在 5 个 LVLM × 5 个幻觉/综合 benchmark 上一致降低幻觉。

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

本文把 LLM 的下一 token 预测视为一个超大词表上的分类任务,将两个轻量级 OOD 检测器 NCI(特征与权重向量的接近度)与 fDBD(特征到决策边界的距离)迁移过来,配合"训练特征均值的解析代理 \(\mu_G\)"和"只在 top-\(k\) 候选 token 上算边界距离"两个适配,得到一个无训练、单样本的推理类幻觉检测器,在 CSQA / GSM8K / AQuA 上稳定优于困惑度、Semantic Entropy、SelfCheckGPT 等基线。

Hallucination is a Consequence of Space-Optimality: A Rate-Distortion Theorem for Membership Testing

本文把"LLM 记住随机事实"形式化为带连续置信分数的成员测试问题,证明在事实稀疏极限下最优记忆开销恰好等于事实/非事实输出分布之间的最小 KL 散度——即"率失真定理"——并由此推出:在 log-loss 目标下,给定有限记忆,最优策略不是弃答也不是遗忘,而是把一定比例的非事实和事实压在同一个高置信点上,幻觉是信息论意义下的最优误差形态。

Harnessing Reasoning Trajectories for Hallucination Detection via Answer-agreement Representation Shaping

本文针对大推理模型(LRM)的幻觉检测提出 ARS:不在文本层扰动 reasoning trace,而是直接在 trace 末端的潜表示上施加小扰动并续解码得到反事实答案,再用"答案是否一致"作为标签训一个轻量 contrastive 头来塑形 trace-conditioned answer embedding,使后续 embedding-based detector 把幻觉与真实回答分得更开(TruthfulQA 上 AUROC \(66.85\to 86.64\))。

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

本文提出 MM-Snowball 基准(4992 条 6 轮对抗对话)系统刻画多模态大模型在长对话中"幻觉滚雪球"现象,并据此设计训练无关的 CAVR 方法,在表征层刷新视觉信号、在 logit 层裁决文本-视觉冲突,从而显著压平后段对话的性能塌陷曲线。

查看全部21篇「幻觉检测」论文 →


📊 LLM 评测 (40)

Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning

本文提出 Agent World Model,一条从场景、任务、数据库、MCP 工具接口到验证器的全合成流水线,生成 1000 个可执行数据库驱动环境,并用它们训练工具调用 Agent,在 BFCLv3、\(\tau^2\)-bench 和 MCP-Universe 上取得更强的域外泛化。

Toward Training Superintelligent Software Agents through Self-Play SWE-RL

本文提出 Self-play SWE-RL (SSR),让同一个 LLM 在沙箱化代码仓里既扮演"造 bug 的 proposer"又扮演"修 bug 的 solver",仅以 Docker 镜像为输入、用一致性校验和 solve-rate 作奖励做联合 RL,在 SWE-bench Verified 与 SWE-Bench Pro 上分别自我提升 +10.4 / +7.8 分,并稳定优于使用人类标注 issue + 测试套件的"human-data"基线。

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

这篇论文把 AI benchmark 饱和定义为前沿模型之间失去可靠区分度,提出基于 leaderboard 不确定性的 saturation index,并分析 60 个文本 LLM benchmark,发现近一半已高饱和,年龄和测试集规模比私有测试集、开放式输出或模板多样性更能解释饱和。

Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum

本文系统研究了 SFT 中概率类目标函数的行为规律,发现标准 NLL 并非普适最优:在模型先验强的任务上先验倾向(prior-leaning)目标如 \(-p\) 显著优于 NLL(最高提升 16%),而在先验弱的任务上 NLL 仍然占优,揭示了由模型能力连续谱(model-capability continuum)主导的目标函数选择原则。

Spherical Steering: Geometry-Aware Activation Rotation for Language Models

本文提出 Spherical Steering:在 LLM 隐藏状态的单位超球面上,沿测地线把激活向量旋转到由对比样本估计出的"真实性方向",而不是像传统 activation addition 那样做线性加法,从而在保持激活幅值(norm)的同时显著提升 TruthfulQA / COPA / StoryCloze 等基准的多选准确率(+10% 量级),且不损伤开放式生成质量。

HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents

HiPER 把 LLM agent 的扁平 RL 改造成"高层规划子目标 + 低层执行原子动作"的两级 Plan-Execute 结构,并配套提出 Hierarchical Advantage Estimation (HAE) 把 GAE 沿子目标段切开做有界差分耦合的优势估计,在 ALFWorld / WebShop 上分别拿到 97.4% / 83.3% 成功率(Qwen2.5-7B),相对最强基线 GiGPO 提 +6.6% 与 +8.3%。

Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning

提出 GraphGPO,将所有 rollout 轨迹聚合为统一的状态转移图,利用图上全局最短路径信息为每一步计算基于距离的 advantage,实现比轨迹级归因更精细的信用分配,在 ALFWorld、WebShop、Sokoban 上显著超越 GRPO 和 GiGPO。

Who can we trust? LLM-as-a-jury for Comparative Assessment

这篇论文指出多个 LLM 评审在成对比较中可靠性差异很大,提出带评审判别参数的 BT-σ 模型,在没有人工校准标签的情况下同时学习候选输出排名和每个 LLM judge 的可靠性,从而比简单平均和标准 Bradley-Terry 聚合更接近人类排序。

BESPOKE: Benchmark for Search-Augmented Large Language Model Personalization via Diagnostic Feedback

提出 Bespoke 基准,通过 30 名标注者 3 周的真实聊天+搜索历史收集 2,870 个会话,构建包含细粒度偏好评分与诊断反馈的评测框架,系统评估搜索增强 LLM 的个性化能力,发现当前模型在所有配置下平均得分均不超过 60,个性化瓶颈在于历史推理而非生成。

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting

CapBencher 通过为每道题注入随机性(生成多个逻辑正确答案并随机选一个作为标准答案),将 benchmark 的 Bayes 准确率降到可控水平(如 50%),从而在公开发布 benchmark 的同时实现数据污染的黑盒统计检测——任何准确率显著超过 Bayes 上界的模型都被判定为存在污染。

查看全部40篇「LLM 评测」论文 →


⚡ LLM 效率 (48)

dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching

针对扩散式大语言模型 (dLLM) 因双向注意力无法复用 KV cache 而推理极慢的问题,本文提出训练无关的 dLLM-Cache,对静态 prompt 用长间隔缓存、对动态 response 用短间隔刷新+按 Value 余弦相似度选 25% 最"变化"的 token 做局部重算,在 LLaDA 8B / Dream 7B 上获得最高 9.1× FLOPs 加速且分数基本不掉。

Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills

SKILL-MOE 提出一个无需训练、以"技能"为路由信号的符号化 MoE 框架:从每个问题里抽取所需技能、按技能-模型档案在 16 个预训练 LLM 中为每条样本动态招募 k 个专家、再用任务级最优聚合器把多条 CoT 融成最终答案;配合按专家分桶的批量推理,单卡就能跑 16 个 7-8B 模型,平均比最强多智能体基线高 8.15%。

CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective

作者把"哪些 KV 缓存条目算关键"这个一直靠经验拍脑袋的问题,重新写成"最小化注意力输出扰动"的优化问题,推导出扰动的可解析上界(同时涉及注意力权重和经 \(W^O\) 投影后的 value 范数),并由此设计了一个即插即用的两阶段贪心选择算法,把 SnapKV/AdaKV/HeadKV 三种 SOTA 驱逐方法在 29 个长上下文数据集上的压缩损失平均砍掉一半以上。

Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs

Spiffy 把投机解码搬到扩散语言模型(dLLM)上:不另训草稿模型,直接用目标模型自己的分布"自投机",并把多步去噪状态组织成一张有向草稿图,再用离线校准的图结构最大化接受率,在 LLaDA / Dream / SDAR 上实现最高 8.6× 的模型推理次数削减和 6.3× 的 token 速率提升,且可证明保持输出分布无损。

Hyperparameter Transfer with Mixture-of-Experts Layers

本文把 μP/CompleteP 的最大更新参数化思想扩展到稀疏 MoE Transformer,给出 router、expert 上/下投影、expert bias 在 width/depth/专家数/专家宽度同时放大时的初始化与学习率缩放规则,并用一套三层 mean-field 的 DMFT 理论证明该参数化在 \(n_{\text{embd}},n_{\text{exp}},n_{\text{hid}},L\to\infty\)(固定激活稀疏度 \(\kappa\))下存在尺度不变极限,从 38M 激活基模迁移到 2B 总参的 MoE 上都能直接复用最优 LR / init,且零样本超参训出来的 MoE 在等激活参数下可与 dense GPT2 speedrun 持平甚至更优。

Kalman Linear Attention: Parallel Bayesian Filtering For Efficient Language Modelling and State Tracking

把序列混合重新解释成一次精确的贝叶斯滤波,用卡尔曼滤波器的"信息形式"把本该顺序递归的更新改写成可并行前缀扫描的 Möbius(分式线性)映射,得到一个即插即用、线性复杂度、却比 GLA 更具表达力、还自带显式不确定性的序列混合层 KLA。

OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference

本文把 KV cache eviction 重新表述为"逐层结构化剪枝"问题,借用 Optimal Brain Damage 的二阶 Taylor 近似推导出针对独立 value、独立 key、key-value 联合三种剪枝单位的闭式 saliency 分数,作为即插即用的"分数替换件"接入 H2O / TOVA / SnapKV / AdaKV 等现有 attention-only eviction 框架,在 LLaMA-3.1 / Qwen-2.5 的 RULER 与 LongBench 上获得稳定提升(AdaKV 在 query-agnostic RULER-4K 30% budget 上提升近 15%)。

SiameseNorm: Breaking the Barrier to Reconciling Pre/Post-Norm

针对 Pre-Norm 与 Post-Norm 在单流架构内无法共存的结构性矛盾,作者提出双流残差架构 SiameseNorm,让一条未归一化流保留 Pre-Norm 的恒等梯度高速路、一条归一化流保留 Post-Norm 的主路径表征控制,通过共享残差块耦合两条流,在 400M~15B 稠密/MoE 语言模型、ViT、DiT 上均稳定优于 Pre-Norm 基线,开销可忽略。

TEAM: Temporal-Spatial Consistency Guided Expert Activation for MoE Diffusion Language Model Acceleration

TEAM 针对 MoE 扩散语言模型(dLLM)"激活了大量专家却只接受少量 token"的固有错配,利用 block 内解码的时间一致性与空间一致性,为已解码 / 热 / 冷三类 token 设计差异化的专家激活与解码策略,在 SDAR 30B-A3B 上以近乎零精度损失换得最高 2.2× 加速。

OServe: Accelerating LLM Serving via Spatial-Temporal Workload Orchestration

OServe 把 LLM 服务的「资源分配 + 并行策略 + 请求路由」联合建模为流网络上的双层最大流问题,配合 LSTM 工作负载预测和基于 GPU 互联的 ad hoc 模型切换,应对真实流量在空间(不同请求类型)和时间(成分随时刻变化)两个维度的异质性,端到端 P99 延迟和吞吐相比 vLLM 平均提升 1.5×、最大 2×。

查看全部48篇「LLM 效率」论文 →


📚 预训练 (27)

Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings

作者指出主流位置编码 RoPE 把"内容(what)"和"位置(where)"耦合进了同一个相位里,从而在需要"按位置找内容 / 按内容定位置"的任务上表现糟糕;他们提出 PoPE,用 softplus 把幅度(管 what)和纯位置相位(管 where)拆开,仅是 RoPE 的小改动,却在诊断任务、音乐/基因组/语言建模上一致更优,并且零微调就能外推到 10 倍训练长度,超过专门做外推的 YaRN。

Inverse Depth Scaling From Most Layers Being Similar

本文通过对 LLM 隐藏态动力学的测量 + teacher-student toy model 的对照实验,证明 LLM 的 loss 与深度近似成反比(\(\alpha_\ell \approx 1\)),并将其归因于"绝大多数层在做功能相似的小步更新、通过 ensemble averaging 抵消误差"这一非高效但鲁棒的使用模式。

MOOSE-Star: Unlocking Tractable Training for Scientific Discovery by Breaking the Complexity Barrier

MOOSE-Star 把"训练一个能直接生成科学假设的 LLM"这个原本要在 \(\mathcal{O}(N^k)\) 组合空间里搜索的问题拆成"灵感检索 + 假设合成"两个序列子任务,再叠上层级树检索 + bounded composition + motivation 规划,把最优复杂度从指数级压到 \(\mathcal{O}(\log N)\),并放出 108,717 篇带分解标注的 TOMATO-Star 数据集。

AC-ODM: Actor–Critic Online Data Mixing for Sample-Efficient LLM Pretraining

AC-ODM 把"预训练数据域权重怎么动态调"建模成一个强化学习的连续控制问题,用 DDPG 的 Actor-Critic 在训练过程中实时感知模型状态、输出各域采样权重,并用"域间梯度对齐度"当奖励——理论上证明这等价于最大化梯度的建设性干涉(有效下降步长),在 Pythia-1B 上比强基线少用约 66% 步数就达到最优困惑度,MMLU 相对提升 27.5%、HumanEval pass@1 翻到 2.23 倍,而每步墙钟仅增 0.4%、显存仅增 2%。

If open source is to win, it must go public

这是一篇 ICML 2026 立场论文(position paper),论点是:当前形态的"开源 AI"无法像 Linux/PyTorch 那样真正民主化 AI 访问与提供公共产品,必须嵌入到"公共 AI(Public AI)"——由政府/国家实验室/大学/非营利机构提供的算力、推理、后训练、数据基础设施——之中,开源才能赢。

On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length

本文用一套精心控制"推理难度恒定、只变 horizon 长度"的 Sudoku/Rush Hour 任务,系统证明任务 horizon 本身就是 LLM agent RL 训练崩溃的独立根因,并提出 macro action 与 subgoal decomposition 两种 horizon-reduction 机制——它们不仅稳住训练,还让模型在更长 horizon 上实现强 zero-shot 泛化(horizon generalization)。

POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation

POET-X 把训练稳定但又慢又费显存的 POET(正交等价变换、谱保持优化器)做了一整套系统级提速降存:通过输入中心化重构、置换内核加速、块对角批并行、半存储 CNP 与 Triton 融合,相比原版 POET 实现 3× 显存下降、8× 速度提升,让单张 H100 就能预训练 8B~13B 的 LLM,而 AdamW 在同等设置下直接 OOM。

Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from k-Parity

本文用 \(k\)-parity 这一可解析任务把 Masked Diffusion Language Model(MDLM)的训练目标解构成"信号项 + 噪声项",从理论上证明噪声项扮演隐式正则器抑制 grokking、避开记忆陷阱,并据此提出 Signal-Rich Mask Sampling——把训练时的掩码率 \(t\) 从均匀 \(\mathcal{U}[0,1]\) 收紧到中段窗口,在 50M 模型上显著降 perplexity、在 8B 模型上预训练提升 8.8%、SFT 提升 5.8%。

Annotations Mitigate Post-Training Mode Collapse

作者发现 SFT 把模型对齐到一个低熵语义先验上、导致"指令模型越大越无聊"的反向 scaling,于是提出"标注锚定训练"——预训练阶段给文档配语义 tag、SFT 阶段对 tag 部分 mask loss,让推理时先采样语义再生成响应,从而在保持指令跟随能力的同时把语义多样性差距缩小 85%。

Constrained Bayesian Experimental Design via Online Planning

本文提出 COPEx:通过"离线预训练 amortized 后验网络 + 设计策略 + 在线多步 lookahead 场景树"的半摊销方案,让贝叶斯实验设计在测试时能动态适应预算 / 成本 / 转移约束,在受约束的 location finding、CES、cost-aware AL 三类任务上 EIG / RMSE 一致超过 VPCE、ALINE、RL-BOED 等基线。

查看全部27篇「预训练」论文 →


✏️ 知识编辑 (8)

CrispEdit: Low-Curvature Projections for Scalable Non-Destructive LLM Editing

把 LLM 编辑写成"最小化编辑损失 s.t. 能力损失不变"的约束优化, 用 Bregman 散度等价转化为 Gauss-Newton Hessian 的低曲率子空间投影, 再借 K-FAC + 一个无需显式构造投影矩阵的 Kronecker 特征基技巧, 让 3000 条编辑在 A40 上 6 分钟跑完, 同时把 LLaMA-3-8B 的 MMLU/IFEval/ARC-C/TruthfulQA/GSM8K 平均掉点压到 < 1%, 显著优于 AlphaEdit / MEMIT / 微调。

From Backward Spreading to Forward Replay: Revisiting Target Construction in LLM Parameter Editing

本文系统剖析了 locate-then-edit 编辑中 backward spreading 为什么能 work 又为什么 work 得不彻底,并提出 forward replay:把第一决定层作为优化变量、再通过标准前向传播得到后续各层 target,无需额外算力就能在 MEMIT/RECT/PRUNE/AlphaEdit 之上一致涨点。

Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

本文提出 UniKE——首个面向统一多模态模型 (UMM) 的"跨模态知识编辑"基准(2,971 个编辑主体、5,535 条 VQA 可验证实例),系统性地揭示了"文本侧编辑成功率 ~92% 但图像生成 VQA 仅 ~18.5%"的模态鸿沟,并通过"推理增强参数编辑"协议把 VQA 准确率最多拉高 18.6 个百分点,进一步用条件通路上的余弦漂移指标将根因定位到 LLM-to-DiT 投影瓶颈。

Reverse-Engineering Model Editing on Language Models

论文揭示 locate-then-edit 类知识编辑方法(ROME/MEMIT/AlphaEdit)的参数更新矩阵会通过其行空间泄露"被编辑主语"的指纹,并提出两阶段攻击 KSTER(先用 SVD 恢复主语,再用前后模型的熵差恢复 prompt),同时给出基于"语义诱饵"注入的子空间伪装防御方案。

AnyEdit++: Adaptive Long-Form Knowledge Editing via Bayesian Surprise

AnyEdit++ 用 token 级 Bayesian Surprise 找到长文本中的语义转折点,把 AnyEdit 的固定窗口切分改成结构感知的 Bayes-Chunk,并在数学、代码、新闻、诗歌等长文本知识编辑任务上稳定提升 BLEU 与 BERT Score。

KORE: Enhancing Knowledge Injection for Large Multimodal Models via Knowledge-Oriented Controls

KORE 通过两阶段"知识导向控制"为 LMM 注入新知识 — 一边把单条事实自动扩成结构化的多轮对话+指令任务(提升泛化),一边用先前知识的协方差矩阵零空间初始化 LoRA 适配器(最小化对旧能力的干扰),在 LLaVA-v1.5 / Qwen2.5-VL 上同时实现强适配和强保留。

Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence

本文从"维度坍塌"假设出发,证明参数级知识编辑会沿低奇异值方向被放大并随序列编辑线性累积,进而在多模型、多数据集、多评测维度上系统性地拖垮 LLM 核心能力,并指出一个简单的检索式基线 SCR 在所有设定下都优于现有参数编辑方法。

The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models

本文从优化角度证明:序列编辑(SE)之所以稳定,本质是"累积更新等价于一次性编辑(OTE)的解",而 AlphaEdit 的零空间投影、PRUNE/RECT 的后处理正则等花哨机制并非关键——只要保证 OTE-SE 对齐,去掉这些正则也能在 4 个主流 LLM 上稳定完成 2000 步序列编辑。


💬 LLM 其他 (39)

Position: Adversarial ML for LLMs Is Not Making Any Progress

这是一篇立场论文,作者认为对抗机器学习在 LLM 时代研究的问题相比传统分类器场景"更难定义、更难求解、更难评测",过去十年在 \(\ell_p\) 鲁棒等"玩具问题"上就进展缓慢,如今全面转向 LLM 后很可能再耗一个十年仍无法产出可度量、可复现的安全保证。

YAQA: 端到端 KL 最小化的 LLM 自适应权重量化

YAQA 把 LLM 权重量化的代理目标从「逐层激活误差」换成「端到端模型输出 KL 散度」,用 Kronecker 分解的 Hessian 草图给出第一个端到端误差界,相对 GPTQ/LDLQ 把 KL 再降约 30%,甚至比量化感知训练(QAT)更准,且推理速度不变。

Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision

本文提出 Compute as Teacher(CaT):把 GRPO 已经在采样的 G 条 rollouts 通过冻结锚模型"合成"出一个伪参考答案,再在非可验证领域用模型自己从该伪参考衍生的二元 rubric 给每条 rollout 打分作为 RL 奖励,从而在没有任何人工标注的情况下把推理算力直接变成监督信号,在 HealthBench 上相对基线最高提升 30%,并以 9× 更低的测试时算力匹配甚至超过 inference-time aggregation。

Multi-Agent Teams Hold Experts Back: 自组织 LLM 团队为什么留不住「专家」

本文借组织心理学的「强协同」标准(团队 ≥ 最强个体)系统评估自组织异质 LLM 团队,发现即便明确告知谁是专家,团队在前沿 ML 基准上仍比专家差 6.3%–41.1%,根因不是认不出专家,而是不肯让专家说了算——LLM 倾向「中间立场式整合」而非「认知让渡」,团队规模越大稀释越严重,而这套共识机制反过来让团队对对抗性成员异常稳健。

Stop Automating Peer Review Without Rigorous Evaluation

这是一篇立场论文:作者通过对 ICLR 2026 真实评审和 60 篇模拟评审的实证测量,发现当前 LLM 审稿存在 hivemind(高度趋同)+ paper laundering(零样本改写就能涨 0.45 分)两大失效,因此论证「在没有严格评估之前,不应让 LLM 直接生成审稿意见」,并呼吁建立一门"审稿自动化的科学"。

Optimizing Diversity and Quality through Base-Aligned Model Collaboration

作者提出 BACO,一种推理时 token 级路由框架:让"未对齐的 base 模型"和"对齐后的 instruct 模型"在同一次解码里逐 token 切换,用 logit 不确定度与内容词信号决定该信谁,从而在不再训练、不多次采样的前提下同时拿到 base 的多样性与 aligned 的质量,best router 相对最强 baseline 取得 21.3% 的多样性-质量联合提升。

Position: The ML Community Must Build an AI-Augmented Peer-Review Ecosystem

这是一篇立场论文,主张机器学习社区应当紧急建设一个"AI 增强"的同行评审生态——把 LLM 当作作者、评审人、领域主席(AC)三类角色的协作助手而非替代者,并指出真正的近期瓶颈不是更强的模型,而是缺少能记录"评分为何改变、哪句 rebuttal 化解了哪条质疑"的结构化过程数据。

Differential Syntactic and Semantic Encoding in LLMs

通过对共享句法结构或共享含义的句子做隐层表示平均得到"句法质心"和"语义质心",作者证明 DeepSeek-V3 等大模型的句子向量中相当一部分句法/语义信息是被线性叠加编码的,并且这两类信息在层间分布和正交消融上都呈现明显的可分离性——支持"句法相对自治"的语言学假说。

SAC-Opt: Semantic Anchors for Iterative Correction in Optimization Modeling

SAC-Opt 把 LLM 生成的优化求解器代码再"反向翻译"回结构化语义锚点(约束与目标),与原始问题描述的锚点逐条比对,只重写不一致的那条约束/目标并迭代到全部对齐,在 7 个公开数据集上平均提升 7.7%、ComplexLP 上提升 21.9%。

Why Are Linear RNNs More Parallelizable?

这篇论文用电路复杂度严格解释了为什么 Linear RNN 比传统非线性 RNN 更容易像 Transformer 一样并行:LRNN 可落在近似 log-depth 的算术电路类中,而非线性 RNN 能表达更难并行的 logspace / polynomial-time 完全问题,二者形成表达力与并行性的基本权衡。

查看全部39篇「LLM 其他」论文 →


📖 NLP 理解 (2)

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting

本文把"用户提供的损坏上下文会降低 LLM 性能"这个问题形式化为风险控制——以 zero-shot 表现作"安全基线",结合动态 early-exit(在中间层就出预测避免后层 overthink 有害上下文)+ context-aware 损失 + 改进的 Learn-then-Test 框架(保留负损失值用风险变换而非裁剪),在 9 个任务上既保证风险 ≤ user-specified \(\epsilon\),又获得 > 50% 的算力加速。

Causal Fine-Tuning under Latent Confounded Shift

本文提出 Causal Fine-Tuning (CFT):在标准 BERT 微调里嵌入一个 SCM 启发的"高级稳定特征 \(C\) + 低级混杂敏感特征 \(\Phi\)"分解,并用 front-door 风格的 do-calculus 调整公式做预测,在文本伪相关注入攻击下显著优于 SFT/SWA/WISE 等单域泛化基线。


✍️ 文本生成 (2)

Characterizing the Effect of Noise in Language Generation in the Limit

在 Kleinberg-Mullainathan 的"语言极限生成"形式化框架下,本文证明了对于均匀和非均匀生成,噪声水平 1 与任意有限噪声水平 \(i \geq 1\) 等价(层级坍缩),但无噪声与噪声 1 之间存在严格分离,并首次给出了非均匀噪声依赖可生成性的完整刻画。

Score-Repellent Monte Carlo: Toward Efficient Non-Markovian Sampler with Constant Memory in General State Spaces

SRMC 用一个 \(d\) 维的 running score 平均(而不是 \(|\mathcal{X}|\) 维的经验测度)来记录历史,再通过指数 score-tilt 把这段历史折成一个"排斥已访问区域"的代理目标 \(\pi_\theta\),套在任何 base MCMC kernel 外面,就能在通用状态空间下用常数内存实现非马尔可夫、低方差、保持归一化无关性的采样器。


🗣️ 对话系统 (5)

Is Your LLM Overcharging You? Tokenization, Transparency, and Incentives

本文把 LLM-as-a-Service 建模成"委托-代理"问题,证明现在主流的"按 token 收费"机制天然激励服务商把同一字符串重新切成更长的 token 序列来超额收费,并且即使强制服务商公开 next-token 分布,多收费而不被发现也只是 NP-Hard 而非不可行——作者给出一个简单启发式算法在保持合理性的前提下实测最多多收 11.2% 的 token,最后证明唯一能消除该激励的可加性定价机制是"按字符长度线性计费"。

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

针对"多轮交互式工具调用 Agent"后训练里两大瓶颈——高质量数据贵 + 用户模拟噪声毁 RL 信号,作者提出"自演化多 agent 数据合成 (AReaL-SEA)"配套生成可执行 verifier 当奖励,再配上"先 SFT 用户模型再做大 batch + 动态过滤 GRPO"的 RL recipe,在 τ²-bench 上把 Qwen3-235B 推到 Airline 73.0 / Telecom 98.3 的 pass^1,全面达到或超过 Claude/Gemini/GPT-5。

DiscoverLLM: From Executing Intents to Discovering Them

DiscoverLLM 把 "用户没想清楚自己要什么" 形式化为意图层级树的渐进发现过程,用可奖励的层级化用户模拟器训练模型在不清晰时主动发散探索、在清晰时收敛执行,在创意写作 / 技术写作 / SVG 三任务上比 CollabLLM 等 baseline 满意度 +10%、对话长度 -40%。

Not All Prefills Are Equal: PPD Disaggregation for Multi-turn LLM Serving

本文指出多轮对话场景下传统 Prefill-Decode 分离架构因每轮都要 P→D 重算并传输 KV 而严重低效,提出 PPD(Prefill-capable Decode)动态路由系统,让 decode 节点根据 SLO 权重决定是否本地处理 Turn 2+ 的 append-prefill,把 Turn 2+ TTFT 降低约 68%。

Context-Driven Incremental Compression for Multi-Turn Dialogue Generation

多轮对话里把整段历史拼进 prompt 既贵又会丢线索,本文提出 C-DIC:把对话看成交织的「话题线索」,在一块紧凑记忆里存可修订的逐线索压缩状态,每轮跑一个轻量的「检索 → 修订 → 写回」循环,并配套检索感知的截断时序反传(ra-TBPTT)训练,在数百轮对话上保持稳定的延迟和困惑度。


🌐 多语言/翻译 (3)

Optimizing Language Models for Crosslingual Knowledge Consistency

本文针对多语言 LLM 在不同语言间回答同一问题却给出冲突答案的问题,设计了一个用"另一种语言下回答的对数似然"作为 reward 的 RL 目标,证明其最优策略呈 product-of-experts 形式并在 \(\gamma_1\gamma_2=\beta^2\) 时保证跨语言偏好一致;据此推导出无需 reward model、无需 online 采样的 DCO(Direct Consistency Optimization) 算法,在 9 个 LLM、3 个多语言 QA 基准、26 种语言上同时提升跨语言一致性(RankC)与回答准确率。

Edit-Based Refinement for Parallel Masked Diffusion Language Models

ME-DLM 给 masked diffusion 语言模型(如 LLaDA)加一个"解码完再编辑修补"的轻量阶段:第一阶段照常 unmask 出粗稿,第二阶段用替换/删除/插入三种 token 级编辑做并行修正,监督信号来自 edit distance 的最短编辑脚本,在只用 1/8 扩散步数的情况下 HumanEval +11.6 / GSM8K +33.6 点反超 LLaDA-Instruct。

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

LiRA 在冻结的多语言编码器与英文 LLM 之间插一层 "锚定 + 一致性正则" 的轻量微调模块,把低资源语言的句向量按 \(\epsilon_1\)(锚定误差)与 \(\epsilon_2\)(翻译 KL 距离)这两个理论可控的量约束到共享英文语义空间,从而在检索、排序与推理三类任务上同时拿到稳定提升。


🔍 信息检索/RAG (26)

Graph-R1: Towards Agentic GraphRAG Framework via End-to-end Reinforcement Learning

Graph-R1 把 GraphRAG 重写成"知识超图环境 + 多轮 think–query–retrieve–answer 智能体 + 结果导向 GRPO"的端到端 RL 框架,用更轻量的 n 元超图构建和双路超边检索 + RRF 融合,在 6 个标准 RAG 数据集上把 7B 模型的 F1 从 Search-R1 的 46.19 拉到 57.82。

Understanding LoRA as Knowledge Memory: An Empirical Analysis

作者用 PhoneBook 与新构造的 PaperQA 基准做系统实证审计,把 LoRA 看作可独立训练 / 加载 / 组合的知识记忆单元,定量给出"秩 → 容量 → 效率 → 多模块组合 → 与 RAG/ICL 互补"全链路的设计准则。

Ranking-Free RAG: Replacing Re-Ranking with Selection in RAG for Sensitive Domains

本文提出 METEORA,用 DPO 训练的"理由生成器 + 统计肘部检测 + 同框架 Verifier"三件套,把 RAG 中不可解释、依赖 top-\(k\) 的 re-ranker 整段替换掉,在 6 个敏感领域数据集上同时拿到更高召回、80% 的证据量削减和 4.4× 的对抗鲁棒性提升。

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek 给 RL-trained 搜索 agent 增加一个 JUDGE 动作 + 用 BGE-reranker 计算"理想判断"作为过程奖励,使 agent 能在每次检索后软性"屏蔽"无效信息并重新查询;同时提出 FictionalHot 这一基于虚构实体的抗污染评测,Qwen2.5-7B 上平均 EM 达到 0.377,比 ZeroSearch 高 +3.1。

Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG

这篇论文设计了一套用模型内部信号(下一 token 引用预测概率)来测量多语言 RAG 中"语言偏好"的可控方法,发现六个开源大模型在长文生成时系统性地偏爱引用英文文档,并且在英文文档不相关时也照引不误——语言本身比文档相关性更能左右模型的引用选择。

HGMem: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

本文把多步 RAG 中的 working memory 从"扁平的事实列表"重构成一张超图——每条超边就是一个可被 update / insert / merge 的记忆点,借助超边天然连接 \(n\geq 2\) 个实体的能力,让记忆能在交互过程中持续合并低阶事实成高阶概念,从而显著提升需要"全局意义构建"的长上下文问答性能。

LEMUR: Learned Multi-Vector Retrieval

Lemur 将多向量相似性搜索转化为监督学习问题,用一个两层 MLP 将 token 级嵌入映射到低维潜空间,再利用现有单向量 ANNS 索引完成检索,比 PLAID/MUVERA 等方法快一个数量级。

Through the Stealth Lens: Attention-Aware Defenses Against Poisoning in RAG

本文指出现有 RAG 投毒攻击虽然能用少量恶意段落操纵 LLM 输出,但并非真正隐蔽——成功的低预算攻击必然会让模型把注意力过度集中在恶意段落上,因此作者用每段落归一化注意力分数 NPAS 和基于其方差的 AV Filter 把异常段落筛掉,在 4 数据集 × 5 LLM × 5 攻击的设定下把 RACC 比 Certified Robust RAG 最高拉高 20%。

Less Is More: Elevating RAG via Performance-Driven Context Compression

CORE-RAG 用"性能即奖励"的 GRPO 强化学习训练一个 1.5B 小压缩器,把检索到的 top-k 文档压成 ~3% 长度的摘要,结果不仅没掉点反而在 4 个 QA benchmark 上比满上下文 RAG 平均提升 3.3 EM。

Hierarchical Abstract Tree for Cross-Document Retrieval-Augmented Generation

Ψ-RAG 用"合并—坍缩"式的层次聚类替换 RAPTOR 的 k-means 来构建跨文档抽象树,并配上一个具备多轮重写能力的检索回答 Agent 与稀疏 BM25 混合索引,让 Tree-RAG 第一次能在语料级、跨文档多跳问答上追平甚至超越 Graph-RAG,平均 F1 比 RAPTOR 高 25.9%、比 HippoRAG 2 高 7.4%。

查看全部26篇「信息检索/RAG」论文 →


💻 代码智能 (22)

MARS: Modular Agent with Reflective Search for Automated AI Research

MARS 把自动化 AI 研究重构成"在软件仓库空间中搜索最优解"的问题,用 预算感知 MCTS + 模块化"设计-分解-实现"流水线 + 比较式反思记忆 三根支柱,在 MLE-Bench 上拿到开源框架 SOTA,金牌率 31.1%(Gemini-3-Pro-Preview),并出现 63% 的跨分支课程迁移这种"Aha! moment"。

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

作者用"语言无关的统一构造流水线 + 交互式安装 Agent + 三模型集成的 Issue 清晰度过滤",从 GitHub 上自动挖掘出 32,079 个跨 20 种语言、3,617 个仓库的可执行 SWE 任务(并附 12 万+ PR 衍生任务),每个任务都带预构建 Docker 镜像、fail-to-pass 测试以及实例级诊断元数据,为 SWE Agent 的大规模强化学习提供面向训练的、而非面向评测的稳定底料。

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

提出 CentaurEval,首个面向人机协作编程的统一评测框架,通过设计 45 个"协作必需"(Collaboration-Necessary) 任务模板,证明单独 LLM 仅 0.67% 通过率、人类独立仅 18.89%,而人机协作可达 31.11%,揭示 LLM 正从执行工具演变为共推理伙伴。

MatchFixAgent: Language-Agnostic Autonomous Repository-Level Code Translation Validation and Repair

MatchFixAgent 把仓库级代码翻译的"等价性验证 + 修复"全面 LLM 化:用 6 个并行语义子分析器(控制流 / 数据流 / IO / 库 API / 异常 / 规约)替代昂贵的跨语言互操作工程,再叠加一个测试生成 & 修复 Agent 和一个仲裁 Agent,仅 1650 行代码就把验证覆盖率从 71.6% 抬到 99.2%,可修复缺陷比例从 18.5% 抬到 50.6%。

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

RankTuner 提出 Relative Rank Indicator \(I_t\),用「真值 token 的实际排名 \(R_t\)」对比「模型分布下的期望排名 \(\mathbb{E}[R_t]\)」作为单一标量信号,把概率 \(p_t\)(任务对齐)和熵 \(H_t\)(内禀不确定性)拧成一个 token 级权重,在数学推理 SFT 上 Pass@1 普遍超过纯概率/纯熵的重加权 baseline。

AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms

AlgoVeri 构建了一个跨 Dafny、Verus、Lean 严格对齐的经典算法 verified code generation 基准,显示当前 LLM 在复杂全局不变量、系统级约束和显式证明搜索上仍有巨大缺口,尤其是 Lean 与 Verus 的成功率远低于 Dafny。

How can we assess human-agent interactions? Case studies in software agent design

提出 PULSE 框架——收集用户反馈、训练一个 ML 模型预测用户满意度、再用预测驱动推断(PPI)把真人标签和模型伪标签结合起来高效估计 agent 设计改动的效应——并把它部署到开源编程 agent OpenHands 上,跨 1.5 万用户、3.6 万会话做了首个大规模真实环境 agent 设计评估,结果置信区间比标准 A/B 测试窄了约 40%,还发现 benchmark 表现和真人偏好会反相关(gpt-5 在 6/7 benchmark 上赢 claude-sonnet-4,但真人在 4/7 任务子集上更偏好 claude)。

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO 把自治编码代理 (Autonomous Coding Agent, ACA) 当作和 LLM 同级的"一等抽象"来调用,让独立生成的模拟器和优化器在共享沙箱里通过执行结果互相校验,再叠加多样性记忆检索与 MBR/自一致性解码,在 9 个优化建模基准上 8 个拿到 SOTA、最高领先 28 个百分点。

BoostAPR: Boosting Automated Program Repair via Execution-Grounded Reinforcement Learning with Dual Reward Models

BoostAPR 给"用 RL 训 program-repair 模型"造了一套三阶段流水线——execution-verified SFT → 训序列级 + 行级双重 reward → PPO 时用行级模型把序列奖励重新分配到关键 edit lines;在 Qwen2.5-Coder-32B 上把 SWE-bench Verified 从 17.8% 推到 40.7% (+22.9pp),跨语言迁移到 Defects4J 取 24.8%。

MEnvAgent: Scalable Polyglot Environment Construction for Verifiable Software Engineering

MEnvAgent 用「规划–执行–验证」三阶段多智能体闭环 + 环境复用机制,自动为 10 种语言的真实仓库搭建可执行、可验证(Fail-to-Pass)的 Docker 环境,在自建的 MEnvBench 上把 F2P 率提升 8.6%、构建耗时降低 43%,并据此造出迄今最大的多语言可验证 SWE 训练集 MEnvData-SWE。

查看全部22篇「代码智能」论文 →


🎨 图像生成 (141)

WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation

WISE 构建了一个包含 1000 条知识密集 prompt 的文本到图像评测基准,用文化常识、时空推理和自然科学知识检验模型是否能把隐含语义转化成正确视觉内容,并发现现有 T2I 与统一多模态模型在世界知识生成上仍有明显短板。

DFlash: Block Diffusion for Flash Speculative Decoding

DFlash 用一个轻量级的"块扩散"草稿模型替代 EAGLE-3 那种自回归草稿器,并通过把目标模型的多层 hidden features 作为 KV 注入到草稿模型每一层,在单次前向中并行起草整块 token,端到端最高拿到 6× 无损加速,比 EAGLE-3 再快 2.5× 左右。

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

Eso-LMs 把 AR 与 Masked Diffusion 在 loss、注意力、采样三个层面深度融合:用一个 causal-on-shuffled-sequence 的去噪 Transformer 同时支持并行扩散和左到右 AR,从而首次让 MDM 在扩散阶段也能用上精确 KV cache,在 OWT 长上下文上比 MDLM 快 14–65×、比 BD3-LM 快 3–4×,并在 speed–quality Pareto 前沿上取得 SOTA。

SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith 用 designer-critic-orchestrator 三角 VLM agent 在「布局→家具→小物件」的层级树上逐层构建室内场景,并把 text-to-3D 生成、铰接物体检索与物理属性估计深度耦合到 agent 工具链中,从单条自然语言提示直接产出"可直接喂给物理仿真器"的稠密、可操作环境,每个房间平均 71 个物体(基线只有 11–23 个),物体间碰撞率 <2%、重力下稳定率 96%,远超此前所有方法。

GenExam: A Multidisciplinary Text-to-Image Exam

GenExam 把"画图考试"作为衡量 T2I 模型推理-理解-生成综合能力的金标准,给 10 个学科、1000 道题各配上 ground-truth 图 + 细粒度评分点,结果连最强闭源模型 Nano Banana Pro 也只有 70.2% strict 分,多数开源 T2I/统一 MLLM 不到 3%。

Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization

GCPO 把 GRPO 在 flow matching 后训练里"每一步都用同一个最终 reward 当 advantage"的步级优化改成"块级"——按 flow matching 自身的时间动态 \(L1_{rel}(x,t)\) 自适应地把连续若干步聚成 chunk,用规范化的 chunk-level 重要性比 \(r^i_j\) 做策略更新,从而平滑掉"最终好≠每步好"造成的错误梯度,在 HPSv3/ImageReward/GenEval/DPG 上相对 GRPO 取得最高 43% 的相对增益。

OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild

OmniAID 用一个"语义专家 + 通用伪影专家"的解耦 MoE 架构,在 CLIP-ViT 注意力权重 SVD 出的低秩残差子空间里分别学习"画了什么会露馅"和"怎么画都会露馅"两类伪造线索,再配上新的现代化数据集 Mirage,在 GenImage / Chameleon / Mirage-Test 三套基准上把通用 AIGI 检测平均准确率推到 95.9% / 91.4% / 88.4%。

Adversarial Flow Models

作者在 GAN 训练目标上加一个最优传输正则 \(\|G(z)-z\|^2\),把 GAN 的"任意搬运图"约束成 Wasserstein-2 最优搬运图,让纯 transformer 上的对抗训练第一次能稳定收敛并端到端做单步生成,ImageNet-256 上 1NFE FID 刷到 2.38(XL/2)和 1.94(112 层)。

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

作者指出 MLLM 类编辑奖励模型存在"注意力坍缩"问题——评分时不去比较原图与编辑后图、而是塌缩到 sink token 上做盲判,进而提出 SpatialReward:先让 8B 模型预测编辑区域的边界框、再以这些 box token 为锚做交错式跨图推理;配上一个 260K 样本的空间感知数据集和 GRPO 两阶段训练后,在三个 reward benchmark 上 SOTA,并把 OmniGen2 的 GEdit-Bench 分数拉升 +0.90(是 GPT-4.1 提升的两倍)。

PhysForge: Generating Physics-Grounded 3D Assets for Interactive Virtual World

把"造可交互 3D 物体"重新理解成"先做物理规划、再做物理生成"的两阶段问题——VLM 充当物理建筑师生成包含层级关系、材料、运动学约束的 "Hierarchical Physical Blueprint",扩散模型再用 KineVoxel Injection 把铰接参数和几何 voxel 协同去噪,配合 150k 资产、四层标注的 PhysDB 数据集,首次实现单视图到"可在物理引擎里抓握、推动、铰接"的 3D 资产生成。

查看全部141篇「图像生成」论文 →


🎬 视频生成 (32)

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

EPiC 用"基于第一帧可见性掩码"的方式从任意 in-the-wild 视频直接构造像素级对齐的 anchor 视频,再配一个仅 26M 参数(<1% backbone)、且只在可见区域生效的 Anchor-ControlNet,在冻结 CogVideoX-5B-I2V 主干、5K 视频、500 步训练的条件下,把 I2V 相机控制误差刷到 SoTA,并零样本泛化到 V2V。

LuVe: Latent-Cascaded Ultra-High-Resolution Video Generation with Dual Frequency Experts

LuVe 把 UHR 视频生成从"被动细节增强"重新定义为"主动内容补全"——通过三阶段级联(低分辨率运动 → 潜空间上采 → 高分辨率细化)+ 频域分析驱动的双频率专家(低频专家增强全局语义一致性、高频专家细化纹理),在 VBench 4K 上达 84.03 总分超过 UltraWan-4K 的 83.75。

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

VideoGPA 用一个几何基础模型(GFM)把生成视频重建成 3D 点云、再投影回原帧,用「重投影误差」作为自监督的几何一致性奖励,自动构造偏好对,并通过 DPO(LoRA 微调 ~1% 参数、仅 ~2500 对偏好样本)把预训练视频扩散模型对齐到 3D 一致的流形上,在不损失画质的前提下显著缓解物体形变与空间漂移。

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

T2AV-Compass 是首个针对文本到音视频(T2AV)生成的综合评估基准——500 条复杂提示 + 双层评估框架(低层信号指标 + 高层 MLLM 诊断),系统评估 15 个前沿 T2AV 系统,定量揭示了即便顶级模型也存在的"音频真实感瓶颈"现象(视频维度 85%+ 真实感 vs 音频仅 50%)。

Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization

QVG 是面向自回归视频扩散的训练免微调 KV-Cache 量化框架——通过语义感知聚类做 token 平滑、并以渐进残差多阶段压缩残差,在 LongCat-Video/HY-WorldPlay/Self-Forcing 上把 KV 显存压低到原来的 1/7,端到端延迟开销 <4%,2 bit 下质量大幅领先 KIVI/QuaRot 等 LLM 量化基线。

VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation

VAnim 把开放域 text-to-SVG 动画建模为「持久 DOM 树上的稀疏状态更新」+「Identification-First 运动规划」+「GRPO 渲染感知强化学习」,序列长度压缩 \(9.86\times\) 的同时保持拓扑一致,并显著超越 GPT-5.2、Gemini 3 Pro 与 LiveSketch。

Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention

Light Forcing 是首个为自回归(AR)视频扩散模型定制的稀疏注意力方案——块感知增长(CAG)量化每个生成块的累积误差贡献来动态分配稀疏度,分层稀疏注意力(HSA)通过帧级 → 块级二级掩码选择灵活捕捉历史依赖,在 Self Forcing 上实现 1.30× 端到端 / 3.79× 注意力加速且 VBench 总分 84.5 > 密集基线 84.1。

Self-Refining Video Sampling

把预训练 flow matching 视频生成器自身当作"去噪自编码器",在推理时同一噪声层级内用 Predict-and-Perturb 内循环反复纠偏 latent,再用模型自洽性算出的不确定度 mask 只精修动态区域,从而在不引入任何外部 verifier、不做任何额外训练的前提下显著改善视频的运动连贯性与物理合理性,人评偏好率超 70%。

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1 把文本到视频模型的 3D 一致性问题转化为强化学习后训练:用隐式相机条件和 3D-aware reward 对 Wan 2.1 等视频基础模型做 Flow-GRPO 对齐,在不改模型架构和推理流程的情况下显著减少几何幻觉,同时保持一般视频生成质量。

OLAF-World: Orienting Latent Actions for Video World Modeling

OLAF-World 通过序列级控制-效应对齐(Seq∆-REPA)学习可迁移的隐式动作——把无标注视频转化为动作可控的视频世界模型,实现跨上下文的零样本动作迁移;用 1 分钟的标注数据即可达到 AdaWorld 2 小时数据下的性能(旋转控制精度 0.4680 vs 0.6420)。

查看全部32篇「视频生成」论文 →


🧩 多模态 VLM (89)

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3 把"该往哪看、怎么看"这件事交给一个 MLLM 自己学:用纯强化学习(GRPO)训练它把一张图像并行地圈出最多 3 个最值得放大的子区域,靠"任务奖励 + 启发式奖励"双形态奖励解决纯任务奖励太稀疏的问题,在小/密集目标检测、遥感、自动驾驶、交互式分割上一致超过基线,还顺带提升了 RealWorldQA / MME 等通用理解能力。

VLA-Arena:评估视觉语言动作模型的开源框架

VLA-Arena 提出结构化 VLA 基准——通过任务结构、语言命令和视觉观察三个正交维度系统量化难度,用 170 个任务揭示现有 VLA 模型在泛化、视觉感知和安全性上的关键缺陷。

Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness

本文把生物免疫系统中的"阴性选择"原理搬到 CLIP 等 VLM 上:用 LLM 主动幻觉一批"看起来像但不是已知类"的文本描述作为语义抗体,再以一个轻量 adapter 把视觉特征推离这些抗体,从而在不重训骨干的情况下显著降低开放世界场景下的"高自信误判"。

Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Vision-Language Models

提出 Circle-RoPE,将图像 token 的 2D 坐标映射到与文本位置轴正交的环面上,形成锥体几何结构,使每个文本 token 到所有图像 token 的 RoPE 距离相等(PTD=0),消除跨模态伪位置偏置,同时通过逐层交替编码(AGE)保留图像内部空间结构。

VLANeXt:构建强大 VLA 模型的配方

本文系统探索 VLA 模型的设计空间,通过 500+ 对照实验提炼出 12 条关键设计原则——构建高效强大的 VLANeXt 模型,在 LIBERO 基准上超越 SOTA,并在真实机器人任务中验证了设计原则的有效性。

ECG-R1: Protocol-Guided and Modality-Agnostic MLLM for Reliable ECG Interpretation

ECG-R1 是首个面向心电图解读的"推理型"医学多模态大模型,通过协议引导的指令数据合成 + 信号/图像解耦编码 + 交错模态丢弃训练 + 基于诊断证据的过程奖励 RL 四件套,把心电诊断准确率从此前 SOTA GEM 的 74.7 提升到 80.3,并在任一模态缺失时保持跨模态一致性。

Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds

作者通过 pilot study 发现"显式把视觉提升到点云、再与 2D patch 融合"是 VLA 注入 3D 信息的最有效方式;为了解决 3D 数据稀缺和不同点云源(仿真/传感器/单目估计)的域差异,提出 Any3D-VLA:用 hybrid point cloud training 学到 source-agnostic 的几何表示,在真实抓取任务上 zero-shot 比最强 baseline 提升 29.2%(62.5% vs 33.3%)。

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

SAME 把多模态持续指令微调里 MoE-LoRA 的"灾难性遗忘"明确拆成 router drift 和 expert drift 两个独立来源,分别用谱感知的子空间约束更新路由器、用历史输入协方差做 Riemannian 预条件保护专家、再用任务级自适应冻结去掉冗余更新,在 CoIN / UCIT 及作者自建的 TriGap 长序列基准上稳定打过现有 MoE 持续学习 SOTA。

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

作者把 decoder-only MLLM 里的因果注意力掩码改一个"洞",让排在前面的图像 token 反过来去看后面的文本问题 token——这一行掩码修改不加任何参数、不改训练数据,在 3 个 LLM backbone 与 12 个多模态基准上平均涨 6.2 个点。

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

提出首个评测多模态大模型「从音视频上下文预测未来事件」能力的基准 FutureOmni(919 视频 / 1034 道选择题),发现连最强模型 Gemini 3 Flash 也只有 64.8% 准确率,并用一套带推理链的指令微调方法 OFF 把开源模型的预测与泛化能力同时拉高。

查看全部89篇「多模态 VLM」论文 →


🧠 VLM Reasoning (31)

Efficient Reasoning with Hidden Thinking

Heima 把多模态 LLM 的冗长 CoT 每个阶段(summary / caption / reasoning)蒸馏成一个特殊 thinking token,让模型在隐空间里"想",token 数从 100-200 量级降到 13-16 个的同时 zero-shot 准确率反而比 LLaVA-CoT 更稳;配套训练一个 LLM "interpreter"用 thinking token 的 hidden state 重建出文字推理链,从而验证压缩损失的信息论上界。

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

把 GUI grounding 从「一次性预测坐标」改写成「在屏幕上挪鼠标找目标」的交互式搜索,用一个带轨迹惩罚的稠密奖励 + GRPO 训练 VLM,让模型从渲染出来的光标得到视觉反馈来对齐数字坐标与屏幕位置,仅用 8K 样本就在 ScreenSpot-Pro 上把 GTA1 的 50.1% 提到 58.1%。

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

本文系统揭示了被广泛使用的 VSI-Bench 因 3D 标注漂移与帧采样不一致而存在结构性失效,进而重新标注 381 个场景、5365 个对象,并设计帧预算自适应 QA 与"删除查询对象帧"的 dummy 视频压力测试,构建出名为 ReVSI 的高保真空间智能基准;评估显示开源 VLM 在 ReVSI 上掉点最多 40%,且在 dummy 视频上幻觉率仍高,暴露出现有空间推理能力被 VSI-Bench 系统性高估。

Vision-aligned Latent Reasoning for Multi-modal Large Language Model

本文提出 VaLR:在 MLLM 的 CoT 推理每一步之前插入若干"潜在 token",并用 DINOv3/SigLIP/π³ 等视觉编码器的 patch 特征对这些 token 做表征对齐(REPA),从而在长链推理中持续把视觉信息"喂回"模型,把 Qwen2.5-VL 在 VSI-Bench 上的准确率从 33.0% 拉到 52.9%,并首次让 MLLM 表现出"推理越长越准"的 test-time scaling 行为。

Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding

作者把多模态在线蒸馏的 KL 损失沿贝叶斯链拆成"语言先验"和"视觉接地"两个子目标,发现两者梯度近乎正交、标准蒸馏只是被动取平分,提出 Visual Gradient Steering(VGS)主动把更新方向偏向视觉子空间,在 Qwen3-VL 8B→2B/4B 七个多模态推理基准上平均提升 +2.37%/+1.56%。

Imagination Helps Visual Reasoning, But Not Yet in Latent Space

本文用因果中介分析把「潜在视觉推理(用 MLLM 隐状态当 latent token 来做视觉想象)」拆成 \(X\to Z\to Y\) 的因果链,实证发现 latent token 既不随输入变化(输入-潜在断连)也几乎不影响答案(潜在-答案断连),从而质疑其必要性,并提出把视觉想象显式写成文本的简单替代法 CapImagine,在视觉感知基准上反超复杂的潜在空间方法。

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

作者造了一个程序化、分层难度的多步视觉推理基准 MentisOculi(五个"只能靠脑内成像解"的任务),系统检验前沿模型能否像人一样用"心理意象"辅助推理,结论是目前所有显式视觉策略(潜在 token、生成图像、视频)都无法稳定超越纯文本基线——更尖锐的是,统一多模态模型(UMM)即使被喂入正确的真值可视化也用不起来,暴露出"生成错误"叠加"解释错误"的双重瓶颈。

3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models

3ViewSense 认为 VLM 空间推理的瓶颈不是视觉特征不够或语言推理太弱,而是缺少稳定的三维中间表示,因此让模型先从单张图像诱导前视图、左视图、俯视图,再基于这些正交视图推理,在遮挡计数和视角一致空间推理上显著优于同规模 VLM。

Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning

本文把 VLM 的输出强制拆成 <recognition> 感知块和 <think> 推理块,再用一个"蒙眼"文本推理代理(拿不到图,只看 VLM 写下的感知文字)能不能答对题作为感知奖励 \(R_P\),配上结构化语言验证 SVV 作为结果奖励 \(R_O\);MoCA 用 \(R_P\) 当门控做模态级信用分配,让 7B 模型在 9 个 perception/reasoning/rich-modality benchmark 上同时提升,在多个指标上超过 GPT-4o。

Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models

本文把 VLM 空间推理从“被动看完所有视角再回答”改造成“按问题主动取景、更新认知地图、用可执行空间断言验证推理”的 agentic 流程,并用密集奖励微调 Qwen2.5-VL-3B,在 MindCube-Tiny 上取得 80.5% overall accuracy,尤其把 Rotation 子集提升到 85.0%。

查看全部31篇「VLM Reasoning」论文 →


⚡ VLM Efficiency (4)

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

本文用 Information Bottleneck 视角把量化感知训练 (QAT) 与知识蒸馏统一起来,提出 GRACE 框架(置信度门控解耦蒸馏 + 关系中心化核对齐 + 自适应 IB 控制器),让 INT4 量化的 LLaVA / Qwen-VL 不仅没掉点,反而在多个 benchmark 上超过 BF16 基线,同时实测 3× 吞吐 + 54% 显存节省。

Less Precise Can Be More Reliable: A Systematic Evaluation of Quantization's Impact on VLMs Beyond Accuracy

这篇用 70 万次实验跑遍了 16 种量化方法 × 10 种 VLM × 多项可靠性指标,发现量化不是单纯破坏者——它会通过抑制高 rank 低方差的频谱分量,同时提升 calibration、OOD 检测和噪声鲁棒性,但也会放大对协变量偏移和虚假相关的依赖。

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression

本文首次系统研究了带视觉Token压缩的大视觉语言模型(LVLM)的对抗鲁棒性,指出现有编码器攻击存在"优化-推理空间不匹配"问题,并提出 CAGE 攻击通过期望特征扰动 (EFD) 与排名-扰动对齐 (RDA) 两个目标,在未知压缩机制与未知Token预算下显著降低被压缩 LVLM 的鲁棒精度。

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large Vision-Language Models

发现 CLIP 中指代区域的视觉 token 与 [EOS] 文本 token 呈反直觉的低相似度现象(similarity reversal),据此提出 LiteLVLM——一种免训练的文本引导视觉 token 剪枝方法,在裁剪 66.7% token 后仍保留 90.3% 原始像素定位性能,同时实现 22% 推理加速和 2.3× 显存节省。


🎵 音频/语音 (36)

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

本文把多模态大模型的决策看成一次输入到输出的信息分解,借 Partial Information Decomposition (PID) 把 VL/全模态模型的预测互信息拆成"视觉独有 / 文本独有 / 冗余 / 协同"四项,发现协同项是预测视觉敏感性的最佳指标、全模态模型存在"视觉霸权"型协同瓶颈,并用 PID 得到的样本级分数指导 LoRA 重加权微调,在 MMStar/MMBench/POPE 上稳定提升 1–2 个百分点。

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

MECAT 用「多专家模型 + CoT 大模型推理」构造了 20k 条多视角细粒度音频字幕与 10 万条开放式 QA,并提出 DATE 指标(语义相似度 × 跨样本可区分度的调和平均),首次能稳定区分泛泛而谈与细节准确的音频模型输出。

Position: Text Embeddings Should Capture Implicit Semantics, Not Just Surface Meaning

本文是一篇 position paper:作者论证当前文本嵌入研究过度聚焦"表层语义"(词形 / 句法 / 主题相似),系统性忽略了语用、立场、社会语境等"隐式语义",并通过 7 个隐式语义数据集的实证显示——即便是 SOTA 嵌入相比 Bag-of-Tokens 也只有边际提升,呼吁把隐式语义作为嵌入研究的一等建模目标。

MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models

MoshiRAG 在 Moshi 这一全双工语音模型里加入一个特殊的 ⟨ret⟩ 触发 token,让模型边说边异步调用 LLM/搜索后端去取参考文档,利用"开口到关键词出现"的自然 keyword delay 把 2 秒以内的检索延迟完全藏起来,从而在 LlamaQ/WebQ/TriviaQA/HaluEval 上把语音模型的事实性拉到 GPT-4o Audio 量级,同时保留全双工实时性。

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

作者构造了一个让"文字说的"和"声音听的"故意打架的 2000 题 MCQ 基准 VoxParadox,证明当前 Audio LLM 在副语言任务上几乎只"读不听";再用一个按 prompt 自适应混合音频编码器中间层特征的轻量模块 PCLM 加上 DPO 偏好优化,把 Audio Flamingo 3 在 VoxParadox 上从 17.40% 拉到 65.20%。

CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

针对现代音乐生成模型已能同时吃「文本 + 歌词 + 参考音频」却没有统一评估手段的窘境,本文造了一套生态——110k 伪标注的 CMI-Pref-Pseudo、4,027 条人工标注的 CMI-Pref、统一基准 CMI-RewardBench,以及一个仅约 30M 参数、能在单一架构里处理所有模态组合的奖励模型族 CMI-RM,并证明它和人类判断高度相关、还能通过 top-k 过滤实现音乐生成的「推理时缩放」。

MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

MultiBreak 用"主动学习 + 不确定性引导改写"的迭代框架把多轮越狱数据集扩到 10,389 条对话、2,665 个独立有害意图,多样性 0.942 全面碾压前作,并在 DeepSeek-R1-7B / GPT-4.1-mini 上把 ASR 相比次优数据集分别提升 54% / 34.6%。

The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning

本文提出 FLAIR:让全双工口语对话模型(SDLM)在"听用户说话"的同时,把通常用来填 <SIL> 的步骤改成连续的隐式推理——通过一个 ELBO 训练目标 + 非因果"全局专家"提供后验,让因果 LLM 学会用一串嵌入向量"边听边想",从而显著提升问答质量却不引入任何推理延迟。

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

本文提出 SafeSearch——一个全自动、沙箱化、可扩展的红队框架,通过在真实搜索结果中注入单个 LLM 生成的不可靠网页来评测搜索 Agent 的安全性,并用 300 个测试用例对 17 个 LLM × 3 种 Agent 脚手架进行系统评测,发现最高 ASR 高达 90.5%、且常用的 reminder 防御几乎无效。

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

针对集中式多模态融合带来的"模态主导"和"虚假模态耦合"两个痼疾,GCL 把多模态学习重写为两阶段四 agent 的协议化协作:第一阶段由 Routing/Auditing agent 用边际预测增益逐样本决定哪些跨模态交流被允许,第二阶段由 Public-Factor/Aggregation agent 把共享语义与私有特化解耦后再聚合,在 MOSI/MOSEI/MIntRec 上拿到 SOTA。

查看全部36篇「音频/语音」论文 →


🔎 AIGC 检测 (11)

Feature-Augmented Transformers for Robust AI-Text Detection Across Domains and Generators

本文在「单阈值固定协议」下系统暴露 AI 文本检测器在跨数据集/跨生成器 shift 下的脆弱性,并提出把可学注意力加权的手工语言特征与 transformer [CLS] 表征融合,配合 DeBERTa-v3 backbone,在 M4 多域多生成器基准上达到 85.9% balanced accuracy,比强 zero-shot 基线(Fast-DetectGPT、RADAR、Log-Rank)高最多 +7.22。

AutoBaxBuilder: Bootstrapping Code Security Benchmarking

AUTOBAXBUILDER用LLM代理流水线自动生成Web后端安全评测场景、功能测试和端到端安全测试,把人工构建BAXBENCH式任务的成本降低约12倍,并构建出40个新场景的AUTOBAXBENCH来评估当代代码模型的正确性与安全性差距。

Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence

SurpMark 把"AI 文本检测"重构成似然无关假设检验:用代理 LM 算 token surprisal 后 k-means 离散成 k 个状态,估计一阶 Markov 转移矩阵,再用广义 Jensen-Shannon 散度(GJS)和预先建好的"人写 / 机写"参考转移矩阵比较,单次前向就给出黑盒、无需重训、无需 per-instance 重采样的判别分数。

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

本文发现:把 MLLM 直接微调去学生成器留下的低级伪影,会破坏它早期形成的语义表征(灾难性遗忘);于是提出 Deep-VRM——冻结早中层保住语义,只在 LLM 深层用一条 LoRA 旁路把伪影特征"残差注入"进去,让同一个 MLLM 不依赖任何外部专家检测器就拿下大多数 AIGI 基准的 SOTA。

Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook

DOVE 用率失真变分优化从 1 万篇人类文本中自动构造紧凑的"价值码本",再用不平衡最优传输度量人类与 LLM 长文本在价值空间上的分布差异,从而在 12 个 LLM 上把"评测—下游任务"相关性从基线 ≤24% 拉到 31.56%。

ForensicConcept: Transferable Forensic Concepts for AIGI Detection

针对 AI 生成图像(AIGI)检测器"在训练分布内很准、换个生成器就崩"且完全黑箱的问题,本文把检测器依赖的弥散证据显式抽成一本"取证概念码本",再用扩散特征(CleanDIFT)作外部生成痕迹参照、用邻域结构一致性指标 CKNNA 度量骨干网证据与扩散痕迹的几何对齐度,并通过把扩散码本注入目标骨干网实现跨生成器迁移;GenImage 平均准确率 92.0%,且 CKNNA 越高迁移收益越大。

CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

作者把"多模态假新闻检测"重新定义为"显式捕获模态间或与世界知识之间的冲突"任务,构建了带细粒度冲突标注的 14k 语料 CAC,并提出 CORE 框架通过冲突感知训练(CPT)重塑 MLLM 的概念边界,使其在 DGM4、MDSM、MMFakeBench、NewsCLIPpings 四个数据集上以 100–750 个样本就大幅超过专用 SOTA。

Dissect and Prune: Enhancing Robustness in AI-Generated Image Detection

针对现有 AI 生成图像(AIGI)检测器"看起来准、其实只会把图判成真"的预测不对称问题,本文提出 DEAR:用 inpainting 图像当探针、按通道激活与生成区域的对齐度(RAD)做"解剖",再把两端极值通道双侧剪掉、只重训线性分类头,让检测器丢掉脆弱的捷径特征,在未见生成器与后处理下显著更鲁棒。

Generating Robust Portfolios of Optimization Models using Large Language Models

本文提出一个轻量、无需训练的算法:用同一个 LLM 同时扮演"随机生成器"和"打分评审"两个角色,把生成概率前缀和达到 \(1-\alpha\) 的候选优化模型打包成 portfolio,从理论上证明只要"生成器"或"评审"任一与人类偏好对齐,portfolio 就一定包含高质量优化模型,并在 NL4LP 上用 GPT 验证 portfolio 在最差情况下也稳定优于随机采样。

LLM Self-Recognition: Steering and Retrieving Activation Signatures

这篇论文不在 token 层加水印,而是在生成时往 LLM 残差流注入一个随机稀疏的转向向量,让模型自带可检测的"激活签名",之后把文本回喂同一模型、从激活里用余弦相似度或轻量分类器把签名捞回来,在多种检测设定下达到 98% 以上准确率且几乎不损文本质量。

查看全部11篇「AIGC 检测」论文 →


🧊 3D 视觉 (30)

4DPC\(^2\)hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping

4DPC\(^2\)hat 是第一个面向"动态点云序列"(4D 点云)理解的多模态大模型:作者先用拓扑一致的构建流水线把 4.4 万个动画资产做成 20 万条跨模态 QA 数据集,再用"保留群组 token + 全局 token + 双向 Mamba"的时空架构避免把一帧压成单一向量,最后用"失败感知自举"反复挖出模型答错的题、合成针对性 QA 补训,使动作理解与时序推理大幅超越把视频逐帧喂给静态 3D 模型的做法。

EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation

EPS3D 是首个端到端前馈的开放词表 3D 全景分割框架:从无位姿多视图图像一次前向直接预测带语义/实例属性的统一 3D 全景高斯,靠 2D 基础模型蒸馏监督摆脱 3D 标注,并用语义-实例互增强模块让两路预测相互校正,在 Replica 上语义 mIoU 比 SOTA 高约 13%、每个场景仅需 1 秒。

Fast-SAM3D: 3Dfy Anything in Images but Faster

针对 SAM3D 单视图 3D 重建模型推理太慢的问题,本文做了第一份模块级时延剖析,发现性能瓶颈来自三种异质性(形状/布局动力学差异、纹理稀疏性、几何谱差异),并据此提出训练无关的 Fast-SAM3D 框架,用模态感知步缓存、时空 Token 雕刻与谱感知 Token 聚合三件套,在几乎不损质量的前提下把对象级速度推到 2.67×,重建 F-Score 反而从 92.34 微升到 92.59。

HOI-PAGE: Zero-Shot Human-Object Interaction Generation with Part Affordance Guidance

HOI-PAGE 让 LLM 先"想清楚"身体哪个部位该接触物体哪个部件,把推理结果写成一张「部件 affordance 图」(PAG),再用它去驱动 3D 部件分割、视频扩散和优化求解,从而在零样本、零 4D 训练数据的条件下生成可处理"多人单物 / 单人多物"等复杂场景的 4D 人-物交互序列。

AvAtar: Learning to Align via Active Optimal Transport

本文提出 AvAtar,一个基于最优传输(OT)的主动对齐框架,通过梯度传播量化候选查询对全局对齐结果的影响,并利用伴随状态法和共轭梯度法以线性复杂度高效求解,在网络对齐和跨域对齐任务上一致超越已有主动学习策略。

FSI2P: A Hierarchical Focus–Sweep Registration Network with Dynamically Allocated Depth

本文把人类“先扫一眼再逐块细看”的观察过程抽象为 Focus-Sweep 两阶段范式,用 Mamba 替换 Transformer 做图像-点云交互,并用强化学习动态决定每个尺度上的交互层数,在 RGB-D Scenes V2 和 7-Scenes 上拿到 I2P 配准的 SOTA。

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics–Physics Dual System

STABLE 把"任务指令→可仿真桌面场景"拆成 LLM-based Semantic Reasoner(出粗布局)和 flow-matching + SDF 损失的 Physics Corrector(修位姿),并让两者按 task-critical → background 三阶段交替迭代,最终在 MesaTask-10K 上把物体碰撞数压到 0、任务对齐 AwS 拉到 99.0%。

TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization

TideGS 把 3DGS 的参数表搬到 SSD 上,按"块"虚拟化并以 GPU VRAM 作为视锥可见工作集的缓存,配合三级异步流水线和轨迹自适应差分流式传输,在单张 24 GB GPU 上首次把可训练的高斯数量从约 11M(原生 3DGS)/ 105M(CLM)推到 超过 10 亿,且大场景重建质量优于所有评测的单卡基线。

APEIRIA: Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

本文提出 APEIRIA,把神经符号 3D 概念学习器的程序执行轨迹蒸馏成 3D MLLM 的自然语言 chain-of-thought,再通过 GRPO 强化学习把这种推理模式推广到开放词汇与深层嵌套指令,在 ScanRefer、Multi3DRefer、SQA3D、Scan2Cap 上同时超越传统 NS3D 方法和当前最强的 3D MLLM,并保留了符号系统的可解释性与模块可替换性。

PLAID: A Unified Data Model for Machine Learning on Heterogeneous Physics Simulations

PLAID 提出一套面向异构物理仿真数据的统一数据模型与开源库,配套发布 6 个覆盖结构力学和 CFD 的工业级数据集与可复现基准,把"变网格、变拓扑、变维度"的真实仿真数据真正变成机器学习社区可用的标准化 benchmark。

查看全部30篇「3D 视觉」论文 →


🎯 目标检测 (7)

HSGG: Training-Free Hierarchical Scene Graph Generation with Geometry-Guided Relation Reasoning

HSGG 先由整体到局部发现实体、再由局部向整体补充属性,随后用几何过滤和“看图预测减去几何诱发的错误先验”生成关系,在无任务专用训练的 SGDet 评测中取得 VG150 的 15.1 和 PSG 的 14.1 zR@100(原文 Table 1)。

Adversarially Robust Approximate Furthest Neighbor

这篇理论论文首次给出能抵抗自适应查询对手的近似最远邻数据结构,在保持与 Indyk 经典 oblivious 算法相近的 \(n\) 依赖查询复杂度的同时,证明传统随机投影最远邻算法会被自适应查询击穿。

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL 用"粗解析-细响应"两阶段 MLLM 框架把第一视角交互理解任务(描述+答问+像素掩膜)做成统一管线:第一阶段输出整图交互的全局描述并把最后一层 hidden state 当作语义先验,再通过新的 Analysis-guided Feature Synthesizer 注入到第二阶段,用 GRPO + 三路奖励(格式/答案/grounding 准确率)联合训练,在 Ego-IRGBench 上 cIoU 反超 Seg-Zero 8.37%。

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

FOCUS 通过"完全去除类别名 + 注意力 mask 优化 + GRPO IoU 奖励"两阶段训练,让 VLM 真正按视觉支持示例(而非语义先验)做 in-context 目标定位;7B 参数模型超 72B 模型,证明任务对齐的 inductive bias 比单纯 scaling 更重要。

Mixture Prototype Flow Matching for Open-Set Supervised Anomaly Detection

MPFM 把 OSAD 里传统的"单峰高斯原型"换成可学习的高斯混合原型空间, 用流匹配直接回归一个 GMM 形式的速度场, 再加一个互信息最大化正则防止原型崩塌, 在 9 个工业 / 医学 AD 数据集上以 10/1 个异常样本的设定打过 DRA / AHL / DPDL 等所有 SOTA.

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

针对多模态视觉验证器只输出 True/False 二值判断信号过粗、且文本解释易被 reward-hacking 的问题,本文提出 OmniVerifier-M1:用 bounding box 等符号化输出代替文本作为 meta-verification rationale 以支持 IoU 这种 rule-based reward,并在理论与实验上证明把二值判断与 meta-verification 解耦成两条独立 reward 流(而非合并成乘性 joint reward)能显著提升 SNR,最终把验证器升级为可驱动 region-level 自校正的 agentic 系统 M1-TTS。

Testing the Test: Score-Direction Instability in Class-Split Anomaly Detection

作者指出"类内拆分"(class-split) 异常检测基准在异常类与正常混合分布在表示空间重叠时是病态的——AUROC 会塌缩到随机甚至反转,方向取决于未知的异常类,并提出一个无需训练的"邻域类泄漏"指标 \(L_k\) 来在跑分前诊断这种基准失效。


✂️ 语义分割 (14)

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround 把 LMM-based 视觉定位从"用最后一层 \(\langle\text{SEG}\rangle\) token 当 prompt"的范式翻转为"用动态选中的中间层相似度图当 prompt",通过强化学习策略 SSC 让 \(\langle\text{SEG}\rangle\) 滑过所有 transformer 层、把相似度图同时当作 SAM 的软 logit mask 和反向监督信号,首次在单一框架内统一了 RES / RS / FP-RES / gRES / Multi-RS 五种视觉定位任务,并在 ReasonSeg test 上 cIoU +9.0%、gRefCOCO val N-acc +12.1%。

Refining Context-Entangled Content Segmentation via Curriculum Selection and Anti-Curriculum Promotion

CurriSeg 不动分割网络结构,只换训练计划:先用"时间损失统计 + 像素熵加权"的稳健课程把模型推到稳态,再用反课程的"频谱失明"微调(砍掉高频迫使模型读结构语义),就让 FEDER / FSEL / RUN 在 CHAMELEON / CAMO / COD10K / NC4K 等伪装/息肉分割基准上稳定涨 2–4%,零额外参数、训练时间还更短。

SPROUT: Supervise Less, See More — Training-free Nuclear Instance Segmentation with Prototype-Guided Prompting

SPROUT 是首个完全训练无关、零标注的病理核分割框架——用 H&E 染色先验在每张切片上自构高置信度前景/背景区域→提取原型→用部分最优传输(POT)做特征-原型软对齐→输出 SAM 的正/负点提示;在 MoNuSeg 等基准上 AJI 比训练方法高 8.2%。

Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models

GPUA 把 CLIP 这种语义有余而局部精度不足的 VLM 和 DINOv3 这种细粒度足但缺语义的 VFM 看作两种"视觉语言",用最优传输挖软对应再解正交 Procrustes 学一个保几何的线性映射,把 VFM 翻译进 VLM 空间——全程无监督、不更新任何预训练参数,零样本分类平均涨 11.8%。

无监督层级技能发现

HiSD 从无标签观测轨迹出发——通过最优传输进行技能分割,再用 Sequitur 文法诱导发现多层级技能层次,无需动作标签或奖励信号。

Activation-Free Backbones for Image Recognition: Polynomial Alternatives within MetaFormer-Style Vision Models

本文用 Hadamard 乘积构造 PolyMLP、PolyConv 和 PolyAttn,替代 MLP、卷积和注意力中的点激活/softmax,在 MetaFormer 风格骨干中无需常规激活函数也能在 ImageNet、鲁棒性和 ADE20K 分割上达到或超过激活式模型。

Beyond Detection: A Structure-Aware Framework for Scene Text Tracking

提出 SymTrack,一个无需检测的双分支场景文字跟踪框架,通过预测性 Token 校正(PTR)解决透视畸变导致的特征瓶颈,跨专家校准(CEC)消除文字实例间的高视觉歧义,自适应推理引擎(AIE)稳定细粒度定位,在三个基准上大幅刷新 SOTA(最高 +12.32% AUC)。

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

本文指出当前基于 query 的 LLM-conditioned 分割是"propose-then-select"——候选 mask 往往已经够准,错就错在选不对;为此提出 FlowSeg,让 LLM 条件嵌入在 decoder 每一层都参与 query refinement 并被新的视觉证据持续更新,再叠一个轻量边界细化模块,在 RefCOCO/+/g 和 ReasonSeg 上一致刷点。

Functional Attention: From Pairwise Affinities to Functional Correspondences

本文把 Transformer 里的 softmax 注意力重新解释为"两个学得到的函数基之间的最小二乘线性算子",借用形状匹配里的 functional maps 思想,把 \(n\times n\) 的点对亲和矩阵压缩成 \(k\times k\) 的紧致谱算子,在 PDE 求解、3D 点云分割和 OOD 推广上同时拿到 SOTA。

LightAVSeg: Lightweight Audio-Visual Segmentation

LightAVSeg 通过解耦 "语义筛选 (what)" 和 "空间定位 (where)",用全局通道调制替换 \(\mathcal{O}(N^2)\) 的跨模态注意力,让 AVS 模型在 20.5M 参数下达到 50.4 mIoU (MS3),并在 Snapdragon 8 Elite 上做到 163.4 ms 的端侧延迟,比 AVSegFormer-R50 快约 \(8\times\)。

查看全部14篇「语义分割」论文 →


🖼️ 图像恢复 (21)

Plan for Speed: Dilated Scheduling for Masked Diffusion Language Models

本文提出 Dilated Unmasking Scheduler (DUS):用「等距空隙」预定义不依赖模型置信度的 unmask 顺序,把每块 \(B\) 个 token 的 denoiser 调用次数从 \(\mathcal O(B)\) 降到 \(\mathcal O(\log B)\),在 LLaDA / Dream / DiffuCoder 上拿到 5.8× wall-clock 加速且质量优于基于置信度的并行 planner。

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

本文从表达力与可训练性两个维度系统比较连续扩散、离散掩码扩散、looped transformer,证明"连续扩散"在表达力上严格强于离散扩散并能模拟 looped transformer,但实际性能受限于解码与表征空间;据此提出 CCDD(Coevolutionary Continuous Discrete Diffusion)——在离散 token 空间和预训练 LLM 的上下文嵌入空间上同时扩散,由单一模型联合去噪,在 LM1B/OWT 上比 MDLM 困惑度降 25-35%,并以仅 8 步采样超过 MDLM 256 步效果。

DAPD: Dependency-Aware Parallel Decoding via Attention for Diffusion LLMs

DAPD 把 dLLM 单步并行解掩问题转化为「在自注意力诱导的 MRF 上选独立集」的动态图着色问题,无需训练即可同时解掩弱依赖位置,在 LLaDA / Dream 上把多问题混合提示的解码步数压到原始的 1/3.87,且准确率几乎不掉。

Early Decisions Matter: Proximity Bias and Initial Trajectory Shaping in Non-Autoregressive Diffusion Language Models

本文系统刻画了 masked 扩散语言模型 (dLLM) 在完全非自回归 (NAR) 解码下的失败机制——proximity bias 导致 confidence-based 采样退化为反向自回归并被 EOS 过早占满,再用一个 5M 参数的轻量 planner + EOS 温度退火只在第一步干预 unmasking 位置,就在 GSM8K 等推理任务上将 LLaDA 8B 的 NAR 解码平均提升 2.8–4.3 个点而几乎无额外开销。

DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention

DyLLM 是一种 training-free 的扩散 LLM 推理加速框架,利用相邻去噪步骤之间注意力上下文的余弦相似度识别"显著 token",只对这部分 token 重算 FFN 和注意力,配合显著感知的近似注意力,在 LLaDA / Dream 上把吞吐推到 7.6× / 9.6× 而几乎不掉点。

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion

多模态图像融合长期把共享表示放在二维特征网格上,导致全局外观(亮度/对比度/色调)和局部细节纠缠、难以独立调控;本文把"全局外观"挪到一个冻结的 1D tokenizer(TiTok-32)的紧凑 token 空间里,再用"选择性 token 编辑(STE)"只改少数几个 token-通道项来调控全局一致性,同时保留 2D 通路做细节恢复,在四个基准上取得多指标全面最优。

One-Step Residual Shifting Diffusion for Image Super-Resolution via Distillation

针对扩散超分模型推理慢的问题,本文提出 RSD(Residual Shifting Distillation):把 15 步的 ResShift 教师蒸馏成单步学生生成器,方法核心是「训练学生使得用它的输出再训出来的一个『假 ResShift』恰好等于真教师」——这等价于匹配教师与学生在所有时间步上的联合分布(而非 VSD 那样只匹配边缘);结果在 LPIPS / CLIPIQA / MUSIQ 上反超教师、超过同类蒸馏方法 SinSR,并以仅 174M 参数、0.5GB 显存、5 GPU·小时训练逼近大体量 T2I 超分模型的感知质量。

Degradation-Aware Metric Prompting for Hyperspectral Image Restoration

DAMP 用 6 个可解释的空间-光谱物理度量(高频能量比/纹理一致性/光谱曲率等)作为"退化提示" (DP) 代替黑盒嵌入与显式退化标签,再用 DP 作为门控驱动 Spatial-Spectral Adaptive MoE 选择不同的"空间专家/光谱专家",在 5 种 HSI 恢复任务和 2 种未见退化(运动模糊、Poisson 噪声)上同时取得 SOTA。

PODiff: Latent Diffusion in Proper Orthogonal Decomposition Space for Scientific Super-Resolution

PODiff 把扩散模型从像素空间搬到固定的、按方差排序的 POD 系数空间里跑,用极小的 MLP 就能在 \(640\times 480\) SST 降尺度任务上拿到与像素级扩散相当的精度,同时因为重构是线性的,集成方差可以通过 \(\Sigma_u=\Phi\Sigma_a\Phi^\top\) 解析回传到物理空间,得到空间上可解释、且校准良好的不确定性。

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution

ASASR 通过将 Flow Matching 的噪声先验从各向同性高斯替换为 Sobolev 谱着色噪声,结合对抗性流形引导生成硬负样本,构建 AS-DPO 框架,实现了超分辨率中感知质量与结构保真度的最优平衡。

查看全部21篇「图像恢复」论文 →


🛰️ 遥感 (3)

Any2Any: Unified Arbitrary Modality Translation for Remote Sensing

Any2Any 把遥感中的 RGB、SAR、NIR、MS、PAN 等传感器互译从一堆成对模型改成一个共享潜空间里的统一潜扩散模型,并用百万级 RST-1M 数据集和目标模态残差适配器,在 14 个已见翻译方向和多个未见模态组合上取得更好的保真度与泛化能力。

Localized, High-resolution Geographic Representations with Slepian Functions

本文用球面 Slepian 函数构造一种把表征容量集中在感兴趣区域 (ROI) 的地理位置编码器,并提出 Slepian-球面调和混合编码以同时兼顾局部高分辨率与全球粗粒度上下文,在五个分类、回归与图像增强预测任务上稳定超过 SH、Wavelet、RFF 等主流基线。

The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

作者指出视觉基础模型 (VFM) 在卫星图像上"看起来"很会预测,但在物理极端区段会沿物理坐标轴塌缩,于是用"结构同构"形式化"科学对齐"概念,并发布全球热带气旋基准 TC-Bench 与一套静态/动态/约束三层线性探针,系统揭露 DINO、CLIP、SigLIP、MAE 等冻结骨干在 \(P_c<980\) hPa 强气旋段的表征崩溃。


🧑 人体理解 (5)

WaveVerse: Scalable RF Simulation in Generative 4D Worlds

WaveVerse 把 LLM 驱动的"4D 室内场景+人体动作"生成与一套保留时空相位相干性的物理光线追踪器拼成一条 prompt 到 RF 信号的流水线,用合成数据显著提升 RF 成像与活动识别下游任务,且性能随仿真量持续上涨而不像已有方法那样饱和。

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

DiscoForcing 把"音乐 → 全身舞蹈"的离线生成问题改写成严格因果、有界延迟的流式问题,用一个 VQ-PAE 因果音乐编码器 + 潜空间 Diffusion Forcing + 混合时间噪声调度 + 时间引导采样,把音乐流实时翻译成可直接驱动 Unity 虚拟人和宇树 G1 人形机器人的 30 FPS 全身动作。

Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets

提出 Intrinsic Quality (IQ):用代理模型抽出嵌入后,把"邻域标签一致性 Consis"和"归一化谱熵有效秩 \(\tilde{r}_{\mathrm{ent}}\)" 加权融合,在不做完整训练、不要干净验证集的前提下给百万级人脸识别数据集打"可训练性"分数,在 WebFace4/12/42M 和注入噪声的设定上与下游 MFR-ALL 验证准确率排名一致性达到 Spearman = 1.0。

Learning Instance-Adaptive Low-Rank Orthogonal Subspaces for Clothes-Changing Person Re-Identification

把"衣服"这个语义概念显式建模成一个 实例自适应的低秩子空间(用 CLIP 文本描述的 SVD 主成分初始化、再靠图像 patch 的 cross-attention 精修),然后用几何约束强制身份特征与该子空间严格正交,从而在不用对抗训练的情况下做到换衣行人重识别的 SOTA(PRCC +5.9% Rank-1)。

MotionGRPO: Overcoming Low Intra-Group Diversity in GRPO-Based Egocentric Motion Recovery

MotionGRPO 把 head-mounted 设备的第一人称全身动作恢复转化为扩散采样上的 MDP,用 GRPO 配合"轨迹条件感知模型 + 4 个 joint-level 子奖励"的混合奖励做后训练;同时识别出"输入条件太强、组内样本几乎一样导致 advantage 方差消失"这一致命瓶颈,并用 Perlin 噪声注入条件来恢复组内多样性,在 AMASS/RICH 上把 MPJPE 从 EgoAllo 的 124.985 mm 降到 114.207 mm。


📹 视频理解 (17)

Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding

Video-MTR 是一个基于强化学习的多轮推理框架——通过门控双层奖励机制引导 MLLM 迭代选择关键视频片段,仅用 8K 数据实现长视频理解的 SOTA 性能,对标方法需要 257K~440 万样本(数据效率提升两个数量级)。

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

本文指出现有 Omni-LLM token 压缩方法对音频和视频"对称"处理是次优的,提出 OmniSIFT——先用时空显著性剪掉视频冗余得到"视觉锚点",再用这些锚点引导音频选择的两阶段非对称压缩框架,仅引入 4.85M 额外参数就在 Qwen2.5-Omni-7B 上保留 25% token 时一致超过现有压缩基线甚至原模型。

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP 把"经典力学的最小作用量原理"搬到视频语义流形上,把稀疏采样视频的缺帧补全建模为 Riemannian 流形上的两点边界值问题——用语义动力学替代概率生成来强制物体持久性,在隧道遮挡测试上准确率 83.9%(超扩散模型 12 个点)且推理加速 177×。

ProAct-VL: A Proactive VideoLLM for Real-Time AI Companions

ProAct-VL 通过分块输入-输出范式 + 轻量级 FLAG 决策头 + 过渡感知损失函数,使视频大语言模型在流式输入下能自主决定何时响应并生成短片段评论,同时实现 ~1 秒低延迟与强主动性——在游戏解说任务上响应时机 TimeDiff 仅 1.20 秒、触发 F1 = 63.25%,全面超越 GPT-4o 等离线模型。

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking

VideoTemp-o3 是统一的 Agent 视频理解框架——通过冷启动 SFT 的统一掩码策略 + 可感知奖惩的 IoU 奖励联合建模视频时间定位与问答,在长视频理解中实现高质量的多轮迭代定位与精准回答,超长视频(> 20 分钟)mIoU 15.6% 超过 Gemini-2.5-Pro 的 14.8%。

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

VideoSEAL 发现现有 agentic 长视频 QA 系统存在「答对但没看到证据」的失配问题,并把根因归结为「coupled agent 把规划和回答权混在一起」,提出 planner-inspector 解耦框架:planner 负责长视距证据搜寻、inspector 持有独占回答权并在像素级证据充分时才放行,在 LVBench 上把准确率从 48.2% 拉到 55.1%(↑20.5%)且 LongVideoBench 从 52.2% 升至 62.0%。

RELO: Reinforcement Learning to Localize for Visual Object Tracking

RELO 把视觉单目标跟踪中"哪里是目标"这件事重构成一个空间特征图上的 MDP,把每个空间位置当作 action,用 actor-critic + IoU/AUC 直接奖励替换掉传统的手工中心热图监督,并配合"先 warmup 回归 + 层对齐时序 token 传播"两个稳定化设计,在 LaSOText 上以 57.5% AUC 拿到 SOTA。

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

提出 AVTrack 数据集和 AVTracker 基线方法,针对复杂人体中心场景下的音视频实例分割与跟踪(AVIS)任务,通过定义 8 种挑战条件构建高难度评测基准,并设计三阶段局部-全局分治框架(ASR 分段聚合 → 局部说话人定位 → 全局身份关联),在 HOTA 指标上超越现有最优方法约 8 个百分点。

Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning

Foresee-to-Ground (F2G) 把视频时序定位(VTG)从直接时间戳回归重构为「识别-测量」两阶段问题——先用预测性时序感知 + 跨度证据编码器构建候选事件证据池,再用 LLM 在选中事件的约束下精确生成边界,使 Charades-STA [email protected] 提升 4.1 个点、ActivityNet 提升 6.7 个点。

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

本文针对 Partially Relevant Video Retrieval (PRVR) 中"短查询 vs 长视频"导致的查询歧义与时间稀疏监督问题,提出基于 Dirichlet 分布的层次证据学习框架 Holmes,在视频间用三重原则区分精确/多义/欠定查询并自适应校准标签,在视频内用带 dustbin 的柔性最优传输获得稠密对齐,在 ActivityNet/Charades/TVR 三个数据集上取得 SOTA。

查看全部17篇「视频理解」论文 →


🚗 自动驾驶 (8)

TSRBench: A Comprehensive Multi-task Multi-modal Time Series Reasoning Benchmark for Generalist Models

TSRBench 构造了一个覆盖 14 个领域、4 大维度(感知/推理/预测/决策)、15 个任务、4125 道题、同时支持文本/可视化/文本+图/嵌入四种模态输入的时间序列推理基准,系统评测 30+ 主流 LLM、VLM 与 TSLLM,揭示出"scaling 在感知/推理上仍成立但在预测上失效"以及"文本与可视化模态高度互补但当前模型几乎无法融合"等关键结论。

RoCA: Robust Cross-Domain End-to-End Autonomous Driving

RoCA 给端到端自动驾驶模型挂一个基于高斯过程的即插即用模块——学一组覆盖多样驾驶场景的基础 token 及其对应轨迹,对新场景按相似度概率推断未来轨迹,既在源域训练时用 GP 的不确定性正则化提升泛化,又在新域上用伪标签和主动学习高效适应,无需 LLM、不增加推理开销。

CoIRL-AD: Collaborative-Competitive Imitation-Reinforcement Learning in Latent World Models for Autonomous Driving

CoIRL-AD 用两个独立的演员分别扛模仿学习(IL)和强化学习(RL)、靠一个潜空间世界模型"想象"未来轨迹来给 RL 算长程奖励,再用一套"谁强谁带谁"的竞争机制让两者互相传递有益行为,从而在没有外部仿真器的离线真实驾驶数据上把 RL 稳稳整合进端到端驾驶,在跨城泛化和长尾场景上取得显著提升。

Mitigating Error Accumulation in Continuous Navigation via Memory-Augmented Kalman Filtering

把无人机连续 VLN 的 step-by-step 预测重写成"递归贝叶斯估计 = GRU 先验 + 记忆库似然 + 可学习卡尔曼增益"的闭环, 在 TravelUAV 上仅用 10% 数据微调就把 L1-Full 的 SR 从 17.6% 推到 25.9%, 同时把 100 步后还在不断累积的位置漂移压平到 30–40 米。

Constrained Multi-Objective Reinforcement Learning with Max-Min Criterion

本文把"max-min 多目标公平性"和"硬性约束满足"统一到同一个 MORL 框架中——通过占用测度 (occupancy measure) 重新表述为凸规划,再对偶出一个关于权重 \((u,w)\) 的凸优化问题,从而用一套投影梯度下降算法同时实现公平性和约束可行性,并给出几何收敛速率的理论保证。

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

DeepSight 把"未来世界预测"从显式像素重建(codebook 单帧)换成在 BEV 空间对 DINOv3 语义特征做多帧并行隐式预测,再叠加一个按需触发的 Adaptive Chain-of-Thought,让 Qwen2.5-VL-3B 在 Bench2Drive 闭环上 Driving Score 86.23 (+7.39)、Success Rate 71.36% (+13.63),且只多 ~4% 推理延迟。

Plug-and-Play Label Map Diffusion for Universal Goal-Oriented Navigation

本文提出 PLMD:把 BEV 语义图与障碍图合并成 Label Map,用 DDPM 在障碍先验调制下补全未探索区域的语义+障碍标签,作为即插即用模块挂在任意 GON 策略上,在 ON / IIN / MRON 三类任务的 HM3D/MP3D 上一致刷新 SOTA。

Threshold-Based Exclusive Batching for LLM Inference

本文系统刻画了 LLM 推理中 mixed batching (MB) 与 exclusive batching (EB) 的性能交叉条件,证明带宽受限 GPU 上 prefill–decode 同批会因带宽争抢拖慢 Attention,进而推导出基于 hazard rate 的最优相位切换阈值 \(\theta^*\) 和内存安全的批大小,并设计在线自适应调度器 EB+,在带宽受限硬件上吞吐最多提升 41.9%,非平稳流量下相对 MB 最多提升 36.4%。


🤖 机器人/具身智能 (53)

Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies

本文把 VLA 的动作解码从自回归(AR)或外挂连续扩散头改成"在统一 Transformer 内部对离散动作 token 做掩码扩散",配合按置信度自适应排序的并行解码和二次重掩码纠错,在 LIBERO 上达到 96.4% 平均成功率、SimplerEnv-Fractal 64.1% 总均分,且在 OOD 语言/视觉扰动下退化仅 0.8% / 20.4%,显著优于连续扩散和并行解码 baseline,同时保留了预训练 VLM 的多模态先验。

RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies

RoboMME 首次把人类认知里的"时序/空间/物体/程序"四类记忆系统性映射到 16 个长时机器人操控任务(770k 高质量时间步),并在 π0.5 底座上系统消融 14 种"记忆表征 × 集成方式",得出"感知记忆 + AdaLN 调制器"是当前最佳综合权衡的结论。

SpecPrune-VLA: Accelerating Vision-Language-Action Models via Action-Aware Self-Speculative Pruning

作者发现 VLA 推理是 compute-bound 的,剪枝才是对的路子,且连续动作步之间视觉信息高度重叠 → 提出 SpecPrune-VLA:用上一步的全局注意力 + 本步早期层的局部注意力 + 帧差动态 token 三路融合做静态剪枝,再加层内动态剪枝和速度感知的粗/细粒度切换控制器,免训练地在 LIBERO 上拿到 1.57× / 真机 1.70× 加速且成功率几乎无损。

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

DUST 用一套"分流式"多模态扩散 Transformer(MMDiT)把动作流与未来视觉嵌入流并排走,靠共享 attention 做跨模态融合,再配独立噪声调度和动作-视觉异步采样,让 VLA 同时学会"做什么动作"和"动作会产生什么后果",在 RoboCasa / GR-1 / Franka 真机上稳定刷过 GR00T-N1.5+FLARE。

Mixture of Horizons in Action Chunking

本文针对 VLA 模型中"动作块长度(horizon)选择"导致的"长视野规划 vs. 短视野精控"权衡问题,提出 Mixture of Horizons (MoH):把同一条动作块拆成多个不同长度的子块,用共享的 action transformer 并行预测,再用 2k 参数的线性门控融合,配合负载均衡损失和"跨 horizon 共识"的动态推理,使 \(\pi_{0.5}\) 在 LIBERO 上首次达到 99% 平均成功率,并把吞吐量提高到基线的 2.5 倍。

LangForce: Bayesian Decomposition of Vision-Language-Action Models via Latent Action Queries

LangForce 把 VLA 策略写成 \(\pi(a\mid v,\ell)=p(\ell\mid a,v)\,p(a\mid v)/p(\ell\mid v)\) 这一贝叶斯分解,引入可学习的 Latent Action Queries 在同一套 VLM 权重上同时跑"只看视觉"和"视觉+语言"双分支,并通过最大化动作与指令的对数似然比来直接惩罚"视觉捷径",在 SimplerEnv 上相对 QwenGR00T 基线提升 11.3 个绝对点。

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

LaRA-VLA 把 VLA 模型里的文本 CoT 和视觉 CoT 全部内化为连续 latent,通过三阶段 curriculum 训练(显式 CoT → latent 替换 → 动作专家适配)让推理留在 latent 空间里完成,推理延迟相比显式 CoT 降低高达 90%,控制频率重回实时区间。

Contrastive Representation Regularization for Vision-Language-Action Models

作者发现 VLA 模型里继承自 VLM 的表征被视觉外观主导、对机器人本体状态不敏感,提出 Robot State-aware Contrastive Loss(RS-CL)把本体感受状态之间的欧氏距离当作"软对比标签"重塑表征,并配合"view cutoff"的表征级增广,把 GR00T N1.5 在 RoboCasa-Kitchen 推到 69.7% SOTA,在真实 Franka 拾放任务上把成功率从 45.0% 抬到 58.3%。

From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model

BehaviorVLA 用因果三流 Mamba 编码器 (VBE) 把长视野演示压缩成时间不变的"行为原型 \(z_{\text{proto}}\)"+ 时间变化的"相位状态 \(z_{\text{phase}}\)",再用相位条件解码器 (PBD) 以 Predictor-Corrector 方式把行为骨架展开成相位对齐的高斯先验去引导流匹配策略,在 LIBERO/RoboTwin 2.0/CALVIN 三套基准刷新 SOTA,并且只用 50% 真机数据就追平 OpenVLA-OFT。

TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance

TimeRewarder 把"任务进度"形式化为视频帧对之间的归一化时间距离,仅用动作无关的专家视频自监督训练一个 ViT 距离回归器,并将相邻帧距离作为稠密奖励喂给 DrQ-v2,在 10 个 Meta-World 任务上以 200K 交互逼近 9/10 满分,甚至超过手工设计的环境稠密奖励。

查看全部53篇「机器人/具身智能」论文 →


🎮 强化学习 (110)

Dr. Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

Dr. Tulu 提出 RLER(Reinforcement Learning with Evolving Rubrics),让评估 rubric 在训练过程中与策略共同演化,把 RLVR 从短答案 QA 推广到带引用的长文深度研究任务,最终用 Qwen3-8B 训出的 DR Tulu-8B 在四个长文 deep research 基准上平均超 Tongyi DR-30B 15.6 个点,并以 1000 倍更低成本达到 OpenAI Deep Research 同等水平。

Agent Learning via Early Experience

本文提出 early experience 范式,让语言 Agent 在没有外部奖励的情况下利用自己尝试动作后的未来状态学习环境动态和决策反思,从而在 8 个 Agent 环境中稳定超过纯模仿学习,并为后续 GRPO 强化学习提供更好的初始化。

RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

RLVE 把语言模型 RL 训练的数据从"静态题库"换成 400 个可程序化生成题目、可算法验证奖励的"可验证环境",并让每个环境的题目难度随策略模型能力实时上调,从而把训练信号始终钉在模型能力前沿;在已被 RLVR 训到饱和的 1.5B 强模型上,RLVE 用约 1/3 的算力把六个推理 benchmark 平均提升 \(3.37\%\)(对照组继续原 RL 训练只涨 \(0.49\%\))。

Learning Unmasking Policies for Diffusion Language Models

本文把掩码扩散语言模型的解码过程显式建模为一个 MDP,用 GRPO 训练一个仅以 token 置信度为输入、参数量不到底座模型 0.01% 的单层 Transformer 策略,自适应地决定每一步要 unmask 哪些位置,在 semi-AR 设定下追平 Fast-dLLM 等手工启发式,在 full-diffusion 设定下显著反超并展现跨模型、跨任务、跨长度的迁移性。

d2: Improving Reasoning in Diffusion Language Models via Trajectory Likelihood Estimation

本文为掩码扩散语言模型(masked DLM)提出 d2 强化学习框架,核心是用两种"轨迹似然估计器"(d2-AnyOrder 对支持 any-order 解码的模型给出单次前向的精确估计,d2-StepMerge 对标准 MDM 给出可调精度的近似估计)来正确实现 GRPO,使 LLaDA-8B-Instruct 在 Sudoku/Countdown/GSM8K/MATH500 上分别达到 91.9% / 56.6% / 85.0% / 41.6%,全面超越 d1、wd1 等扩散 RL 基线。

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

BudgetMem 把"运行时智能体记忆抽取"重新组织成"过滤 → 实体/时间/主题并行 → 摘要"的模块化流水线,给每个模块挂上 LOW/MID/HIGH 三档预算接口,并用 PPO 训练一个共享的轻量路由器在 query 到来时为每个模块挑档位,从而在 LoCoMo、LongMemEval、HotpotQA 上同时改善了 F1/Judge 和单 query 平均成本。

The Shape of Reasoning: Topological Analysis of Reasoning Traces in Large Language Models

本文把 LLM 的 chain-of-thought 看作嵌入空间中的"点云", 用拓扑数据分析 (TDA) 提取持续同调特征作为推理质量的客观度量, 在 AIME 数据集上证明 TDA 特征对 Smith-Waterman 对齐分数的预测能力 (平均 \(R^2=0.236\)) 显著高于传统图统计 (平均 \(R^2=0.064\))。

Flow-Equivariant World Models: Memory for Partially Observed Dynamic Environments

FloWM 通过在隐空间中利用时间参数化对称性(流等变)维持结构化动态记忆——解决部分可观测环境下对象越界后失踪的问题,使长视野预测精度远超扩散和循环基线(3D Block World 210 步预测 SSIM 0.9525 vs DFoT 0.8885)。

EchoRL: Reinforcement Learning via Rollout Echoing

本文指出 RLVR 训练后期 GRPO 类方法因为一组 rollout 全部成功导致优势归零、梯度消失(advantage degeneration),提出 EchoRL:从 verified-success rollout 里基于步级熵峰值挑出"最艰难却走通了的"前缀 EchoClip,作为辅助 SFT 项加到 loss 上,在 4 个 RLVR 框架、5 个 backbone、10 个 benchmark 上稳定带来最高 5.6%/5.0% 的 ID/OOD 提升。

Reverse Flow Matching: A Unified Framework for Online Reinforcement Learning with Diffusion and Flow Policies

针对「在线 RL 里没有目标策略的直接样本」这个核心难题,本文提出反向流匹配(RFM):把训练扩散/流策略去拟合 Boltzmann 分布,转化成一个「给定中间噪声样本、估计后验均值」的问题,再用 Langevin Stein 算子构造零均值控制变量把现有的「噪声期望」与「梯度期望」两类方法统一成同一族估计器,从而第一次让流策略(而不止扩散策略)也能采样 Boltzmann 分布,并在连续控制基准上比扩散策略基线更稳更好。

查看全部110篇「强化学习」论文 →


🎁 推荐系统 (11)

Can Recommender Systems Teach Themselves? A Recursive Self-Improving Framework with Fidelity Control

RSIR 让序列推荐模型用自身预测能力生成新的合成用户交互序列、再训练一个新模型,并用基于排名的"保真度检查"过滤掉偏离用户偏好流形的样本,防止 self-consuming model collapse;在 4 个数据集 × 3 个主流 backbone 上稳定提升 NDCG/Recall 4–11%,并理论上证明该过程等价于沿用户偏好流形切空间的隐式正则化。

T-POP: Test-Time Personalization with Online Preference Feedback

T-POP 把"测试时对齐"和"神经决斗赌博机"拼在一起,在不动 LLM 参数的前提下,用每轮一对回复的在线偏好反馈在线学习个性化奖励函数,从而解决新用户个性化的冷启动问题。

Position: Neglecting the Sustainability of AI is Fuelling a Global AI Arms Race

这篇 position paper 借 Karl Marx 的"基础-上层建筑"框架,主张当下"sustainable AI"的讨论被环境维度独占而忽略了经济与社会维度,呼吁同时拉高气候意识与资源意识两条轴,并提出 CARAML 五层行动框架(个人 / 社区 / 工业 / 政府 / 全球)以抑制正在升级的"全球 AI 军备竞赛"。

RGMem: Renormalization Group-Inspired Memory Evolution for Language Agents

RGMem 借统计物理里的重整化群思想,把语言 agent 的长期对话记忆建模成"事件层 → 关系层 → 概念层"的多尺度系统,通过阈值触发的非线性算子把零散对话粗粒化成稳定的用户画像,从而打破"稳定 vs 可塑"权衡。

Incentivized Exploration with Stochastic Covariates: A Two-Stage Mechanism Design for Recommender System

RCB 把推荐系统里的"探索-利用"和"用户激励兼容"打包成一个动态贝叶斯激励兼容(DBIC)约束下的上下文 bandit 问题,提出冷启动 + IPGS 两阶段算法,在随机用户协变量场景下证明 \(\tilde{O}(\sqrt{KdT})\) regret、可插入任意 offline learning oracle,并量化"激励价格"——冷启动样本量随 \(\epsilon\) 收紧呈 \(1/\epsilon^2\) 增长。

Position: Stop Preaching and Start Practising Data Frugality for Responsible Development of AI

这篇 position paper 指出 ML 社区在"数据节俭"(data frugality)上长期"只说不做"——大家口头承认 coreset 能省能耗,却几乎没人真去汇报能耗和碳排放,并以 ImageNet-1K 为例算出下游训练 + 存储约 5.82 GWh / 2589 tCO2e 的保守下限,呼吁把数据节俭从口号变成可度量、可执行、可奖励的工程实践。

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving

本文把 LLM serving 中的 batch 条件当作安全评测的处理变量,提出安全提示与能力控制成对比较、人工/打分器校正、跨模型扩展、连续批处理组合和 batch-invariant kernel 消融组成的测试协议,结论是拒绝翻转真实存在但低频、模型特异且依赖具体服务栈。

GCIB: Graph Contrastive Information Bottleneck for Multi-Behavior Recommendation

GCIB 用"图信息瓶颈 + 跨行为对比学习"双管齐下,先在结构层把辅助行为图里与目标任务无关的边剪掉(最大化与目标行为的互信息、用 HSIC 替代项最小化与原始辅助图的互信息),再在特征层把去噪后的辅助表示和稀疏的目标表示做 InfoNCE 对齐,从而在四个多行为推荐基准上把 HR@10 / NDCG@10 相对最佳 baseline 再推高 7%–40%。

Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design

SkillPCF 把光子晶体光纤(PCF)的反向设计重塑为"记忆策略学习"问题:用 PPO 训练的控制器在每个轨迹片段从可演化技能库里挑 Top-K 个 memory 操作,执行器把它们落到轨迹记忆里,再用 MEEP 电磁仿真奖励同时优化控制器与技能库本身,在多 LLM 后端和经典优化基线上都拿到更好的设计成功率与仿真预算权衡。

Prompts for Public-Sector LLMs Should Be Governed as Commons

这是一篇 position paper:作者主张公共部门用的 LLM 提示词应当像开源 commons 一样被版本化、有出处、可审计、可否决,并用一座北美城市的 443 条社区提示词(增强到 3,317 条)跑了一个含五种治理状态的 pilot benchmark,给出可证伪的三个预测——治理化提示能改变输出分布、提升可审计性、缩短故障修复时延。

查看全部11篇「推荐系统」论文 →


🔄 自监督/表示学习 (28)

Data Augmentation of Contrastive Learning is Estimating Positive-incentive Noise

作者证明对比学习里的"预定义数据增强 (旋转/裁剪/翻转)"等价于对 Positive-incentive Noise (π-noise) 的点估计, 然后把 π-noise 从"点估计"升级为可学习分布, 训练一个 π-noise 生成器在原图上加可学噪声当增强 (PiNDA), 使 SimCLR / BYOL / SimSiam / MoCo / DINO 在 vision 上稳定涨点, 且天然适配 HAR / Reuters / Epsilon 等无人工增强的非视觉数据。

From Zero to Hero: Advancing Zero-Shot Foundation Models for Tabular Outlier Detection

本文提出 OutFormer —— 一个用 GMM/SCM/Copula 三类合成先验混合预训练、靠多臂老虎机自演化课程稳定多任务训练的表格 PFN,做到零样本表格异常检测:上下文 (in-context) 吃训练数据、前向一步给标签,在 ADBench 与两个新 1500+ 数据集 benchmark 上同时拿到 SOTA 排名和接近 shallow 模型的推理延迟。

LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models

针对 TabPFN-v2 等表格基础模型在浅层出现严重低秩坍缩、且最后一层 sample-attention 对预测信号贡献微弱的两个病灶,作者提出用径向基函数把每个标量扩展成一组局部响应(RaBEL)来打开"值方向"的自由度,并把双向注意力块从 F→S→N 重排成 S→N→F 以确保所有注意力路径都汇入读出,仅用 2M 参数就在主流表格 benchmark 上稳定胜过 7M 的 TabPFN-v2 和 27M 的 TabICL。

Towards One-for-All Anomaly Detection for Tabular Data

提出 OFA-TAD:用"邻居距离"作为跨域通用的异常线索,在多种特征变换诱导的度量空间里抽多视图距离表示,再用专家混合(MoE)门控自适应融合,训练一次即可直接泛化到未见过的表格数据集做异常检测,无需任何目标域微调。

LEC: Linear Expectation Constraints for Selection-Conditioned Risk Control in Selective Prediction and Routing Systems

针对大模型 selective prediction 中"UCB 风险界过于保守、能用阈值很少"这个老问题,作者把"接受后错误率 ≤ α"重写成一条关于选择/错误两个 0-1 指示函数的线性期望约束,由此推出一个只依赖校准集的有限样本充分条件(Eq. 5),既保持有限样本严格保证又显著比 UCB 紧,同时把同一套框架自然推广到两模型路由系统并联合标定两个阈值,在 CommonsenseQA / TriviaQA / ScienceQA / MM-Vet v2 上 power 普涨、TriviaQA 上比 Clopper-Pearson UCB 多接受 9.5% 样本。

PartCo: Part-Level Correspondence Priors Enhance Category Discovery

PartCo 通过显式利用 Vision Transformer 的补丁令牌中蕴含的部分级特征对应关系,引入一个即插即用的框架来增强广义类别发现——在 CUB / Stanford-Cars / ImageNet-100 等多个基准上将 SimGCD / SPTNet / FlipClass 等基线提升 2-10%。

Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts

作者提出 CaRE:在 ViT 每个 block 里塞一个 两级路由 MoE (BR-MoE) ——先靠"类感知器"按熵选 Top-M 个相关任务路由,再由这些路由各自激活 Top-K 任务专家并叠加一个共享 EMA 专家,于是哪怕任务序列拉到 300+ 也能既保留旧知识又持续吸纳新类,并把"长序列 CIL"这块此前没人正经做的空白填上(顺便发布了 1000 类的 OmniBenchmark-1K 基准)。

Zero-Flow Encoders

论文发现一个反直觉现象——用独立耦合训练的整流流(rectified flow)在 \(t=0.5\) 处处为零当且仅当源/目标分布相同("零流判据"),并把它推广到条件分布,证明 \(\mathbf{v}_{t=0.5}=0\) 等价于编码器 \(f(Y)\) 对预测 \(X\) 充分(条件独立),由此设计出一个无需仿真、无需参数化密度假设的最小二乘损失,统一地学习图模型中的马尔可夫毯和自监督表示,并天然规避对比学习的"捷径问题"。

NITP: Next Implicit Token Prediction for LLM Pre-training

NITP 通过用浅层表示作为隐式目标为最后隐藏状态提供连续的表示空间监督——补充标准 NTP 防止隐藏表示退化为低维各向异性配置,在 9B MoE 上 MMLU-Pro 提升 5.7%、推理任务普遍提升 4-6%,额外计算开销仅 ~2%。

Riemannian Metric Matching for Scalable Geometric Modeling of Distributions

把"数据流形的黎曼度量"重写成一个 carré du champ 算子,再用一条去噪式的条件回归损失让神经网络直接学这个算子,从而不建 kNN 图、不算大网络 Jacobian,就能在高维数据上以常数代价摊销地估计内蕴维度、切空间和测地路径,推理最高比基于 kNN 的扩散几何估计快约 400 倍。

查看全部28篇「自监督/表示学习」论文 →


📐 优化/理论 (88)

LiMuon: Light and Fast Muon Optimizer for Large Models

LiMuon 把 STORM 风格的动量方差缩减和随机 SVD(RSVD)一起塞进 Muon 优化器,把矩阵参数的动量从 \(m \times n\) 压成 \((m+n)\hat{r}\)、同时把求 \(\epsilon\)-稳态点的 SFO 复杂度从 \(\mathcal{O}(\epsilon^{-4})\) 降到 \(\mathcal{O}(\epsilon^{-3})\),在 Mamba-130M / Qwen2.5-0.5B / ViT 上同时取得更低 perplexity / 更高 accuracy 和更小显存。

Stability Analysis of Sharpness-Aware Minimization

本文从动力系统视角剖析 SAM 在鞍点附近的收敛不稳定:先在确定性梯度流下证明只要邻域半径 \(\rho > -1/\lambda_1\),鞍点就会变成 SAM 的吸引子;再在随机扩散框架下证明 SAM 的鞍点逃逸均方位移比 SGD 小 \(2\eta t^2|\lambda_j|^3\rho/B\);最后用 SAM 扩散公式解释 momentum 和 batch size 为什么是 SAM 取得 SOTA 泛化性能的真正幕后功臣。

Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning

UDS 提出一种用于 LLM 监督微调(SFT)的高效在线批选择框架:仅靠前向传播得到的 logits 矩阵核范数同时刻画样本的「优化效用 + 句内多样性」,再用 logits 的低维双线性随机投影与历史样本内存缓冲区做相似度匹配来度量「句间多样性」,两者加权后选 top-K 训练——既不依赖参考模型/验证集等外部资源,也不做额外反传,因此比全量 SFT 更快、且在多个基准上稳定超过现有在线批选择 SOTA。

Adaptive Preconditioners Trigger Loss Spikes in Adam

这篇论文把 Adam 训练中的 loss spike 归因于二阶矩预条件器与当前梯度平方的滞后解耦,并用预条件 Hessian 的梯度方向曲率解释和预测 spike 的发生。

URS:统一的神经路由求解器

提出统一数据表示(UDR)和混合偏差模块(MBM)来替代问题枚举——使单个神经模型能无需微调地零样本泛化到 110 个 VRP 变体(99 个未见过)。

Memory-Efficient LLM Pretraining via Minimalist Optimizer Design

本文用"自底向上拆解 Adam"的方式找出真正必须的两个组件——逐列梯度归一化 + 只在最后一层加一阶动量——把它们组合成 SCALE 优化器,用接近 SGD 的内存 (LLaMA 7B 上 13.74 GB) 达到了 Adam 级甚至超越 Muon/APOLLO 的预训练困惑度。

Mirror Descent Under Generalized Smoothness

本文提出一种基于任意范数及其对偶范数的 \(\ell*\)-广义光滑性概念,并通过"广义自界引理"把梯度对偶范数控制在初始次最优间隙之内,从而首次为镜像下降及其加速、乐观、Mirror Prox、随机、复合等变体在非欧几何下建立了与经典 \(L\)-smooth 下匹配的收敛率。

On the Convergence Rate of LoRA Gradient Descent

本文首次在不假设 adapter 矩阵有界、不要求重参数化损失 Lipschitz 平滑的前提下,证明了原始 LoRA 梯度下降的最小梯度范数以 \(O(1/\log T)\) 速率收敛(若参数范数有界则恢复经典 \(O(1/T)\)),并据此设计了与理论严格对应的自适应/归一化学习率,在 logistic regression、ResNet-18、TinyLlama 上验证了训练加速与稳定性提升。

RACO: Reward-free Alignment for Conflicting Objectives

RACO 把多目标 LLM 偏好对齐做成多目标优化问题——每个目标走自己的 DPO 损失,用 clipped CAGrad(CAGrad + 按用户权重剪裁系数)解决梯度冲突;理论证明收敛到尊重 user-specified 权重的 Pareto-critical 点(两目标场景下 clipping 严格加速),实证在 Qwen 3 / Llama 3 / Gemma 3 多模型族上一致拿到更好的 Pareto 折中。

RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization

本文基于 Transformer 层级 Hessian 的「行块对角占优」结构,把 Muon 优化器里昂贵的 Newton-Schulz 正交化换成一次行级 \(\ell_2\) 归一化,将每步预条件复杂度从 \(\mathcal{O}(mn\min(m,n))\) 降到 \(\mathcal{O}(mn)\),在 GPT-2 / LLaMA 预训练上 wall-clock 提速 13–44×、ppl 不降反略升。

查看全部88篇「优化/理论」论文 →


📐 学习理论 (45)

Formalizing Learning from Language Feedback with Provable Guarantees

本文为"从语言反馈中学习"(Learning from Language Feedback, LLF)这一 LLM 智能体常见但缺乏理论的决策范式建立了第一个形式化框架:在奖励潜在不可见的设定下给出可学习的充分假设、提出"迁移 eluder 维数"刻画其难度、证明信息丰富的语言反馈能比奖励学习指数级更快,并给出有理论保证的无悔算法 HELiX(在 Battleship、Minesweeper 上稳定胜过 CoT 提示基线)。

AI4SLT: Empirical Processes in Lean 4 for Formal Statistical Learning Theory

这篇工作把"基于经验过程的统计学习理论(SLT)"第一次系统地在 Lean 4 里从零形式化:补齐了 Mathlib 缺失的高斯 Lipschitz 集中、Dudley 熵积分定理、以及最小二乘(含 \(\ell_1\) 约束)回归的尖锐速率,约 3 万行 Lean 代码、无 sorry/axiom,并且全程用"人定证明策略、AI(Claude Code + Opus-4.5)写战术证明"的人机协作完成。

Unraveling Syntax: Language Modeling and the Substructure of Grammars

本文为「语言模型损失」和「上下文无关文法(CFG)的子结构」建立了一套基础定理,证明语言建模的 KL 散度可以沿子文法层级递归地线性分解;并通过在合成 PCFG 上训练小 transformer 发现:模型是并行地学习所有子文法的(不像儿童先掌握简单结构),而 PCFG 子文法预训练只对相对文法很小的模型有帮助,但能稳定地让内部表示更贴合文法的子结构。

Learning Credal Ensembles via Distributionally Robust Optimization

CreDRO 把「认知不确定性」重新定义为不同训练-测试分布偏移假设下模型之间的分歧,用分布鲁棒优化(DRO)给集成中每个成员分配不同的偏移强度来训练,再把它们的 softmax 转成类别概率区间、构成一个箱式 credal 集来量化不确定性,从而在 OOD 检测和医疗选择性分类上稳定超过现有 credal 方法。

On Regret Bounds of Thompson Sampling for Bayesian Optimization

这篇论文系统补齐了高斯过程 Thompson 采样(GP-TS)在贝叶斯设定下的遗憾分析:先构造了一个反例证明 GP-TS 对失败概率 \(\delta\) 只能做到多项式依赖(拿不到 \(\log(1/\delta)\)),再给出累积遗憾二阶矩上界把 \(\delta\) 依赖收紧 \(1/\sqrt{\delta}\) 倍、首个期望宽容遗憾的多对数上界、以及在更宽松 Matérn 条件下的 \(\tilde O(\sqrt T)\) 高概率遗憾上界,让 GP-TS 在理论保证上基本追平了被研究得最透的 GP-UCB。

On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective

本文首次为测试时自适应(TTA)建立可学习性理论框架,用 \((\epsilon,\delta)\)-Recovery Complexity 衡量分布漂移后模型把超额风险压到 \(\epsilon\) 所需时间,并配合 \((\epsilon,\rho)\)-TTA Learnability 把局部恢复推广到整条非平稳测试流,导出匹配阶的 minimax 上/下界,揭示了 TTA 的"适应速度—信息约束"内在权衡。

Finite-Width Neural Tangent Kernels from Feynman Diagrams

把量子场论里的费曼图搬到神经网络分析中,给"NTK 的有限宽度统计修正"提供一套图形化计算规则,让原本极繁琐的逐层递归推导变成"画图 + 套规则翻译",并据此证明了 NTK 的临界稳定性、ReLU 等尺度不变激活在对角线上无有限宽度修正,数值上在宽度 \(n\gtrsim 20\) 即与采样网络吻合。

On the Robustness of Langevin Dynamics to Score Function Error

这篇论文证明了一个反直觉的负面结果:即使分数函数的 \(L^2\)(乃至 \(L^p\))估计误差任意小,Langevin 动力学在高维下仍可能在任何多项式时间内都采不出接近目标分布的样本(总变差距离高达 \(1-e^{-\Omega(d)}\));而同样条件下扩散模型却能多项式时间成功——这从一个新角度论证了「扩散模型比 Langevin 动力学更可靠」,并给出一条实用警告:用数据初始化时必须用没参与训练分数的新鲜样本。

Provably Data-driven Multiple Hyper-parameter Tuning with Structured Loss Function

本文用「实代数几何 + 一阶谓词逻辑量词消去」给多维超参数调参第一次给出可证明的 generalization bound,把过去只能处理一维标量超参的 Balcan 2025 框架推广到任意 \(p\) 维、双层验证损失、近似内层优化等多种实际场景,并配出第一条匹配上界的下界。

Simple Algorithms for Bad Triangle Transversals with Applications to Correlation Clustering

本文为有符号图上的"坏三角形覆盖"问题(Bad Triangle Transversal, BTT)给出两个仅需单次解 LP 的简洁 2-近似算法,证明在完全图上 BTT 与 Correlation Clustering、MinSTC、Cluster Deletion 同时具有 \(\tfrac{2137}{2136}\) 的 NP-难逼近下界,并构造了一种新的 pivot 流程把任意可行 BTT 覆盖转化为最多 \(\tfrac{3}{2}|F|\) 错误的聚类,从而把 BTT 与 CC 最优值的差距从 2 收紧到 \(3/2\)。

查看全部45篇「学习理论」论文 →


🔗 因果推理 (19)

Causal-JEPA: Learning World Models through Object-Level Latent Masking

提出 C-JEPA,将 JEPA 的掩码预测从图像 patch 级别扩展到对象级别潜在表示,通过对象级掩码作为潜在干预迫使模型学习交互依赖的动态,在反事实推理上比无掩码基线提升约 20%,在控制任务中仅用 1% 的 token 即达到可比性能且规划加速 8 倍以上。

An Odd Estimator for Shapley Values

这篇论文证明 Shapley value 只依赖集合函数的 odd component,并据此提出 OddSHAP:用配对采样隔离 odd 信号、用 GBT 筛选高阶 odd Fourier 交互、再做稀疏 odd 回归,在中高维解释任务上显著优于灵活预算 Shapley 估计器。

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

本文构造了一个程序化生成的"合成 Web"环境,通过在搜索 rank 0 注入单条高可信度蜜罐误信息,因果性地测出 GPT-5 等前沿 LLM agent 在 1/数千的对抗污染下准确率从 65% 暴跌到 18%,且模型不会增加搜索、依然高置信度作答,揭示了根深蒂固的"位置锚定"失败模式。

From Observation to Intervention: A Causal Audit of Expert Importance in Mixture-of-Experts Models

作者用「逐 token 消融」的干预性审计去检验 MoE 剪枝里「观测性路由统计量能预测哪些专家可删」这一隐含假设,在三个高冗余 MoE 模型上得到一个干净的「三模型零结果」:60 个指标-层组合里没有任何观测指标在多重比较校正后能预测专家的因果重要性,说明现有剪枝方法之所以有效,不是因为指标真挑出了「没用的专家」,而是因为早中层的冗余让几乎任何选择准则都同样安全。

Outcome-Aware Spectral Feature Learning for Instrumental Variable Regression

针对非参数工具变量(NPIV)回归中 SpecIV 学到的谱特征"只看 X-Z 关系、不看结果 Y"的盲点,本文提出 Augmented Spectral Feature Learning:在 SpecIV 的对比损失里加上一项 Y 投影到 Z 特征上的回归损失,等价于对一个把 Y 信息拼进去的"增广算子" \(\mathcal{T}_\delta = [\mathcal{T} \mid \delta r_0]\) 做截断 SVD,从而在结构函数 \(h_0\) 与 \(\mathcal{T}\) 顶端奇异函数对齐很差的"坏"情形下也能用极低秩特征恢复因果效应。

Rank-Learner: Orthogonal Ranking of Treatment Effects

在观测数据上提出 Rank-Learner——第一个 Neyman-正交的两阶段处理效应排序学习器,用成对软标签 + 双重稳健修正项替代"先估 CATE 再排"的间接做法,在合成、半合成与 Criteo uplift 真实数据集上稳定优于 T/DR-learner 与非正交 plug-in ranker。

The (Marginal) Value of a Search Ad: An Online Causal Framework for Repeated Second-price Auctions

本文把搜索广告的真实价值建模为"赢拍 vs 输拍"的 treatment effect,在重复二价拍卖(SPA)binary 反馈下设计了一个利用支付规则的在线因果学习算法,得到 \(\widetilde\Theta(\sqrt{dT})\) 的极小极大最优 regret,比同设定下的一价拍卖严格更易学。

Unveiling the Structure of Do-Calculus Reasoning via Derivation Graphs

通过引入推导图(derivation graphs)显式表示 do-演算规则的所有等价变换——揭示因果表达式空间的结构,并证明最多 4 步规则应用可达任意等价表达式。

Tailoring Strictly Proper Scoring Rules for Downstream Tasks: An Application to Causal Inference

本文提出一个通用框架:通过让训练损失的局部二阶曲率 \(w_\ell(p)\) 匹配下游任务误差的曲率 \(w_{\text{task}}(p)\),可派生出与下游任务"几何对齐"的严格 proper scoring rule;将其应用到 IPW 估计 ATE,得到闭式损失 + 闭式 canonical 激活函数(解一个四次方程),在 IHDP / Jobs / Kang-Schafer / ACIC 2017 上稳定优于 log-loss 与 covariate balancing 类基线。

Causal Modeling of Selection in Evolution

论文指出"选择"其实分静态选择(一次性过滤)和演化选择(多代差异繁殖累积)两种,现有图模型把二者混为一谈、在演化数据上会得出错误的因果发现;作者定义了显式刻画演化的因果图模型,并证明它的条件独立约束可以用一个"团扩张 DAG"无损表示,从而能直接套用标准 PC/GES/CDNOD 算法、只需重新解释输出。

查看全部19篇「因果推理」论文 →


🔬 可解释性 (91)

Position: Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces!

这是 Kambhampati 团队的立场文(position paper),核心主张:把推理模型(如 DeepSeek-R1)在给出答案前吐出的「中间 token」称作 "reasoning trace / thinking trace"(推理痕迹/思考痕迹)是一种危险的拟人化——它(1)是一厢情愿、(2)几乎没有实证支持、(3)制造对模型的虚假信任、(4)把社区推向无意义的研究方向;作者用一系列实验证据(A 迷宫 trace 互换、trace 长度与问题复杂度脱钩、人类信任实验)论证 trace 的语义与最终解答正确性根本脱钩*,呼吁社区停止赋予中间 token "面向用户的可解释性",信任应来自对解答本身的验证。

Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory

本文把心理测量学里的 Item Response Theory (IRT) 中的 Graded Response Model (GRM) 搬到 LLM-as-a-Judge 上,把"评判分数"分解成评判者属性 \((\alpha, \beta)\) 与样本潜在质量 \(\theta\),再用 4 个可解释指标分两阶段(内在一致性 + 人类对齐)系统诊断 7 个主流 LLM 在 11 类评判准则上"是不是一台稳定的测量仪器"。

The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level

本文用 \(k\)-sparse probing 系统比较了 MoE 专家神经元与 dense FFN 神经元的多义性,发现 MoE 在稀疏路由压力下天然更接近单义,进而把分析单元从"神经元"升到"整个专家",用 LLM 自动给数百个专家打自然语言标签并通过因果触发实验验证,最终得出"专家既不是宽域领域专家、也不是 token 级处理器,而是细粒度任务专家"的结论。

CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features

通过把生成时 token 上的 SAE 激活与任务正确性做 Pearson 相关来挑选可解释的引导特征, 用正样本均值激活直接当系数, 不需对比数据集也不需反向传播, 就能在 Gemma-2 2B / LLaMA-3.1 8B 上把 MMLU 提 +3.3%、HarmBench 提 +27.1%, 且副作用率比微调更低。

All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs

这篇论文用 Overlap-Aware Sheaf Repulsion (OASR) 算法系统性地证伪了机理可解释性领域的隐含假设——"一个 LLM 能力对应一个独特的电路"——发现同一任务可被多个几乎不重叠 (IoU ~4–11%) 但都满足 faithful/sparse/complete 的电路或 sheaf 支撑,并给出"分布式稠密电路假设"作为理论解释。

Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning

本文把"通过迭代更新潜变量做推理"的模型重新解释为一个学到的吸引子动力系统,提出 Equilibrium Reasoners (EqR):用随机初始化 + 路径噪声两条轻量训练干预塑造吸引子地形,配合"深度(迭代步数 \(D\))+ 广度(多次随机重启 \(B\))"两轴测试时扩展和基于残差收敛的选轨规则,在训练时最多 16 步迭代的前提下,把 Sudoku-Extreme 的精确准确率从 feedforward 的 2.6% 推到 99.8%(等效展开 40,000 层)。

LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs

本文提出 LatentLens——一种无需训练的可解释性方法,用大语料库的上下文化文本 token 表示作为参照、对 VLM 中每层视觉 token 做最近邻检索并返回句子级描述,证明此前常用的 LogitLens/EmbeddingLens 严重低估了视觉 token 的可解释性(平均 68% vs 24%/32% 可解释),并揭示出"中层跃迁"现象。

Interpretability Can Be Actionable

这是一篇立场论文,主张「可解释性研究缺的不是新方法、而是评估准则」:研究该以 actionability(insight 能否驱动可解释性领域之外的具体决策/干预)为核心评估维度,作者沿 concreteness + validation 两个维度定义 actionability、分析阻碍、列出 5 个有杠杆的应用域、给出研究者 6 步 checklist。

学习尖峰分布中的通用 1/3 时间缩放

通过分析 softmax 与交叉熵在学习峰值概率分布时的数学性质,论文揭示了 LLM 训练损失呈现通用 1/3 幂律衰减的根本原因——这是一个与数据结构无关的架构层面的优化瓶颈。

Certified Circuits: Stability Guarantees for Mechanistic Circuits

提出 Certified Circuits 框架,通过基于删除的随机平滑为机械可解释性中的电路发现提供可证明的数据集级稳定性保证,使得发现的电路在概念数据集的有界编辑距离扰动下保持不变,从而产生更紧凑、更准确且 OOD 泛化更好的电路。

查看全部91篇「可解释性」论文 →


📦 模型压缩 (116)

Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video

本文通过识别"帧级单射性"的理论需求,提出 Causal Forcing 方法——用自回归教师模型替代双向教师进行 ODE 蒸馏初始化,避免 Self-Forcing 中的性能坍缩;相比 Self-Forcing 动态度 +19.3%、VisionReward +8.7%、指令遵循 +16.7%,同时保持相同推理延迟(0.69s)。

Entropy-Aware On-Policy Distillation of Language Models

针对在策略蒸馏中 reverse KL 在教师高熵区域引发多样性坍缩和梯度不稳的问题,提出根据教师 token 级熵值自适应混合 forward KL 与 reverse KL 的蒸馏策略,在六个数学推理基准上 Pass@8 最高提升 +5.05。

Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression

本文先用新基准 KVFundaBench 系统揭示「检索类长上下文压得动、推理类压不动」的关键不对称,并把原因归结到 KV 压缩破坏了少样本示例这一「语义单元」的完整性;据此提出 ShotKV——在 prefill 阶段保留整个 shot 作为不可分割单元、在 decoding 阶段做动态 token 级压缩,让 LG-GSM8K 在 40% 压缩率下从 baseline 46.0 提升到 47.33,并在长输入设置下端到端延迟降低 11.3%。

LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding

本文指出推测解码训练时长期用 KL 散度作为接受率的 proxy 是次优的——小容量 draft 模型在有限容量下 KL 最小化不蕴含接受率最大化;提出 LK losses(直接最大化负 log 接受率 + 与 KL 的 trust-region 混合)作为 plug-in 替代,4 个 draft 架构 × 6 个 target 模型(8B-685B)一致提升 8-10% 平均接受长度。

WUSH: Near-Optimal Adaptive Transforms for LLM Quantization

WUSH 为 LLM 的 weight-activation 低比特量化推导出闭式、数据自适应的 blockwise 线性变换,把 Hadamard 的均匀扩散能力和权重/激活二阶统计结合起来,在 W4A4 尤其是 MXFP4 场景下显著提升精度且几乎不牺牲 FP4 kernel 吞吐。

Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice

本文发现TabPFN和Mitra等表格基础模型在离散选择任务中虽然准确率高,却会违反价格-需求单调性和值得信任的时间价值估计,因此提出两阶段行为适配器,把TFM预测嵌入受经济理论约束的效用模型中,在保持100%行为有效性的同时回收大部分准确率收益。

Model Merging Scaling Laws in Large Language Models

作者用 10,866 个合并模型实测出一条形如 \(L=L_*+BN^{-\beta}+A_0 N^{-\gamma}/(k+b)\) 的双轴幂律:基座规模 \(N\) 决定 floor,专家数 \(k\) 决定 tail,且四种主流合并方法(Average、TA、TIES、DARE)都共用同一条曲线,从而把"合多少个专家、合到哪一步停"变成一个可预测、可预算的工程问题。

Task-Driven Subspace Decomposition for Knowledge Sharing and Isolation in LoRA-based Continual Learning

LoDA 把 LoRA 的下投影矩阵按「投影能量」拆成一个跨任务共享的通用子空间和一个真正只激活新任务的隔离子空间,再用梯度对齐训练上投影、并在融合时给通用分支闭式重标定,从而在多个持续学习 benchmark 上稳定刷过现有 LoRA-CL 方法。

FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA

本文指出联邦 LoRA 中朴素 factor-wise 平均的真正"敌人"是旋转不变性导致的潜在子空间错位,提出在客户端用正交 Procrustes 求解出旋转矩阵 \(R_i^t\) 对齐 \(A,B\) 因子后再聚合,理论与实验都证明能显著降低聚合误差且不增加通信开销。

Procedural Pretraining: Warming Up Language Models with Abstract Data

在标准语言/代码/数学预训练之前插入一段极轻量的"程序化数据"(形式语言、栈、元胞自动机等)"预热",仅 0.1–0.3% 额外 token 就能稳定提升下游性能,并让模型用 55–86% 的原始数据复现同等 loss——是一种把"推理脚手架"和"知识"解耦的预训练策略。

查看全部116篇「模型压缩」论文 →


🕸️ 图学习 (35)

Polynomial Neural Sheaf Diffusion: A Spectral Filtering Approach on Cellular Sheaves

PolyNSD 把 Sheaf 神经网络的"一步空间扩散"换成对归一化 sheaf 拉普拉斯的可学习 \(K\) 阶多项式谱滤波器,用 Chebyshev 三项递推稳定计算,单层就拥有 \(K\)-hop 感受野和可控的低/带/高通响应;意外的发现是只用对角 restriction maps 就能超越所有需要稠密大维 stalk 的现有 NSD,参数、显存、运行时间都大幅下降。

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

本文从知识图谱补全任务出发,证明并测量了"隐式推理所需的最小参数量"满足一条以图搜索熵为复杂度度量的线性 scaling law,每个参数最多支持约 \(0.008\) bit 推理信息,颠覆了"模型越大推理越强"的朴素直觉。

Graph-GRPO: Training Graph Flow Models with Reinforcement Learning

针对"图流模型(GFM)难以用强化学习对齐复杂目标"的痛点,本文提出 Graph-GRPO:先把 GFM 采样中不可微的蒙特卡洛速率矩阵推导成一个解析表达式,让整条去噪轨迹可微、可用 GRPO 训练;再配一个精炼策略对高分图反复"局部加噪—再生成",在 50 步去噪下就在 Planar/Tree 上拿到 95.0%/97.5% 的 V.U.N.,并在分子优化(蛋白对接、PMO)上全面超过此前的图 RL 与遗传算法方法。

Rethinking Feature Alignment in Generalist Graph Anomaly Detection: A Relational Fingerprint-based Approach

针对通用图异常检测中"PCA 对齐只统一维度、不统一语义"导致的负迁移问题,本文用一组 5 维"关系指纹"(邻域位置/方向/全局方向一致性 + 度 + 聚类系数)显式提取异常指示性线索作为跨域通用特征,再叠加一个 Transformer 域共享编码器和 SNR 引导的域自适应重校准模块,在 14 个数据集上几乎做到了"全员正迁移"的 SOTA。

Aitchison Embeddings for Learning Compositional Graph Representations

本文提出 AICoG,将节点表示为 simplex 上的潜在原型混合,并用 Aitchison 几何与 ILR 等距坐标学习图嵌入,在保持与欧氏 latent distance model 同等表达力的同时,让节点角色相似性具有基于相对比例 trade-off 的内生解释。

Fixed Aggregation Features Can Rival GNNs

本文提出 Fixed Aggregation Features (FAF):把多跳邻域用 mean/sum/max/min/std 等不可训练的聚合算子压成表格特征再喂给 MLP,在 14 个节点分类基准中有 12 个能与精调过的 GCN/GAT/GraphSAGE 乃至 Graph Transformer 打平甚至超越,从而对"GNN 的可训练邻域聚合到底有多必要"提出系统性质疑。

KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering

把 KBQA 从"一次性生成逻辑表达式"重新定义为"多轮决策过程",先用 Referenced Rejection Sampling 在金标动作序列的引导下生成可执行的推理轨迹做 SFT 冷启动,再用 GRPO 基于 F1 结果奖励优化策略,让 8B Llama 在 WebQSP / GrailQA / GraphQ 三个 benchmark 上同时超过 GPT-4 提示方法与图检索 SOTA。

Learnable Kernel Density Estimation for Graphs and Its Application to Graph-Level Anomaly Detection

LGKDE 用一个可学习的深度 MMD 度量把每个图嵌成"节点分布",再在该度量空间上叠加多尺度核密度估计,并通过"正常图密度高于其结构感知扰动版本"这一自监督对比信号端到端训练,从而首次为图级密度估计提供了既有一致性、收敛速率、鲁棒性、泛化界等理论保证、又在十余个图异常检测基准上稳定超越 GNN/对比/单类等强基线的统一框架。

MedCoG: Maximizing LLM Inference Density in Medical Reasoning via Meta-Cognitive Regulation

MedCoG 让 LLM 先对医学问题做"复杂度 / 熟悉度 / 知识密度"三维自评,再按需调用 SCoT、记忆和知识图谱三类知识,把推理密度(达到同等精度所需的理论开销/实际开销)拉到 6.2×,同时在 5 个 MedQA 系列 hard set 上把平均准确率从 AFlow 的 34.5 提到 37.5。

View Space:跨任意图的表示学习

本文提出视图空间概念,通过将图从 2 维(节点-特征)升到 3 维(节点-特征-视图),实现对任意特征维度和语义图的统一表示——首次让图模型像 NLP/CV 基础模型那样无需微调即可跨域推理,在 27 个下游任务上平均超越 GraphAny 8.93%。

查看全部35篇「图学习」论文 →


📈 时间序列 (45)

DAG: A Dual Correlation Network for Time Series Forecasting with Exogenous Variables

针对"未来协变量已知"的时间序列预测 (TSF-X), DAG 设计了一个双通路网络: 一条沿时间维捕获"历史外生→未来外生"的注意力模式并注入到"历史内生→未来内生"的预测里, 另一条沿通道维捕获"历史外生→历史内生"的模式并注入到"未来外生→未来内生"的预测里, 在 12 个公开/新发布 TSF-X 数据集上 10/10 拿下 MSE 最佳, 显著超过 TimeXer、TFT、TiDE、CrossLinear、PatchTST 等。

It's TIME: Towards the Next Generation of Time Series Forecasting Benchmarks

TIME 是面向时间序列基础模型(TSFM)的下一代基准——通过人工标注 + LLM 驱动的数据清洗、上下文对齐的任务设计、模式级别的评估视角,克服现有基准的数据重用、质量问题、任务配置不当和评估粒度低等四大痛点;50 个全新数据集 × 98 任务 × 12 TSFM 评估。

Do Time Series Foundation Model Benchmarks Hide Regime-Dependent Failures? Evidence from Traffic Speed Forecasting

这篇论文指出时序基础模型(TSFM)在交通速度预测上"平均指标好看、关键时刻失灵"——它用按交通状态分层的评测揭穿了聚合指标掩盖的灾难性失败,并提出无需重训的后处理方法 BMA,把"过渡态"的预测区间覆盖率拉回接近历史基线的水平。

U-Cast: A Surprisingly Simple and Efficient Frontier Probabilistic AI Weather Forecasting

U-Cast 用简单的 U-Net 主干 + 两阶段训练课程(MAE 预训练 → CRPS 微调) + MC-Dropout 实现了与复杂专业模型(GenCast)相当的概率性天气预报能力,同时减少 10× 训练计算和推理延迟——颠覆"前沿性能必须复杂"的行业刻板印象。

From Observations to States: Latent Time Series Forecasting

作者发现现有 TSF 模型即使预测精度高,其潜空间也常常是"时间错乱"的(Latent Chaos);他们提出 LatentTSF——先用 AutoEncoder 把观察压到一个高维潜状态空间,然后让任何主流 backbone 在这个空间内做未来预测(Pred + Align 双损失),最后再解码回观察空间——在 6 个标准 benchmark 上稳定降 MSE/MAE,并恢复了潜表征的时间局部性和频谱结构。

PATRA: Pattern-Aware Alignment and Balanced Reasoning for Time Series Question Answering

针对时间序列问答 (TSQA),PATRA 在表征端把序列显式拆成 full / trend / season 三类模式,并通过三组可学习对齐 token 与文本做深度交叉对齐;在训练端用 SFT + GRPO 两阶段强化学习,把判别式与生成式任务的奖励统一映射到 \([0,2]\) 解决难度失衡,从而在四类 TSQA 任务上全面超越文本 LLM、ChatTS 等多模态时序 LLM。

Adaptive Time Series Reasoning via Segment Selection

这篇论文提出 ARTIST,把时间序列问答变成“边推理边选择片段”的序贯决策问题,通过 controller-reasoner 架构和层级自博弈 RL,让模型只读取与问题相关的时间片段并提升推理准确率。

Semantics-Enhanced Retrieval-Augmented Time Series Forecasting

SERAF 给检索增强的时序预测加了一条"语义检索"通路:把每段历史时间序列自动翻译成一句结构化文字描述(季节/趋势/波动),既按数值相似度、又按文本语义相似度去历史库里捞两套"相似过去 + 对应未来",再自适应融合,从而在非平稳序列上检索到那些"数值上不像、但本质同型"的历史模式,在七个真实数据集上整体优于纯数值检索的 SOTA。

Spatiotemporal Imputation with Graph-Informed Flow Matching

针对时空数据缺失补全中"RNN/GNN 迭代传播误差累积、扩散模型靠问题无关高斯先验且采样慢"的问题,本文提出 GiFlow——用可观测信号的时空滤波构造一个"图先验"替代高斯先验,使流匹配的起点更贴近目标分布、传输路径更短,再配一个融合空间注意力/时间注意力/时空传播的混合向量场,在合成与真实数据集(空气质量、交通)上一致超过 SOTA。

TimeOmni-VL: Unified Models for Time Series Understanding and Generation

TimeOmni-VL 通过把时间序列转换为高保真图像(Bi-TSI)+ 引入理解引导的生成机制(CoT 作为扩散条件),首次实现在统一多模态框架中同时达成时间序列理解与生成任务,预测和插补均达业界最优。

查看全部45篇「时间序列」论文 →


🏥 医学图像 (28)

Turning Drift into Constraint: Robust Reasoning Alignment in Non-Stationary Multi-Stream Environments

本文把多个 MLLM 之间的推理"漂移"重新解释成 DPO 中的负样本约束,用 Plackett-Luce 偏好损失同时压制 N 个 source model 的发散轨迹,让 7B 学生模型在不需要 ground-truth 报告的前提下,仅用 10% 的 MIMIC-CXR 就在胸片分类与报告生成任务上超过所有 source teacher。

MEG-XL: Data-Efficient Brain-to-Text via Long-Context Pre-Training

MEG-XL 用 2.5 分钟(191k token)的 MEG 上下文做 mask token 预训练(比此前长 5–300×),再微调到 50 词的脑到文本任务上,仅用 1 小时数据就达到 SOTA 监督方法 50 小时的解码精度,并显著超过所有 brain foundation models。

Scaling Vision Transformers for Functional MRI with Flat Maps

把 3D fMRI 体积按"皮层展平图"投影成 2D 视频后直接喂给标准 spacetime MAE-ViT,得到一个在 2.1K 小时 HCP 数据上训练的 CortexMAE:在认知状态解码上大幅超 SOTA,验证 flat map 是体素 (volume) 和脑区平均 (parcellation) 之间的"goldilocks zone";同时发布首个开源 fMRI 基础模型基准 Brainmarks,给出 fMRI 模型的第一份系统 scaling law 与一个"个体特质预测仍打不过简单功能连接 baseline"的诚实 null result。

Auditing Sybil: Explaining Deep Lung Cancer Risk Prediction Through Generative Interventional Attributions

本文提出 S(H)NAP——基于 3D 扩散桥的「移除 + 插入」生成式干预框架,把 Sybil 这一前沿肺癌风险预测模型的决策反向拆解为「肺结节主效应 + 两两交互 + 背景」的 LMPI(线性+二阶交互模型),首次以因果而非相关的方式审计出它对 ECG 电极、衣物金属扣等院内伪影的依赖以及对外周肺结节的「径向不敏感」严重失败模式。

Factored Classifier-Free Guidance

本文识别出 CFG 在扩散模型反事实生成中存在「属性放大 (attribute amplification)」失效模式——单一全局 \(\omega\) 会把本不该改变的属性一起放大,并提出 FCFG:按因果图分组、为每组属性分配独立 guidance 权重,从而在 CelebA-HQ / EMBED / MIMIC-CXR 上显著降低非目标属性漂移、改善反事实可逆性。

CAME-Grad: The Double Dilemma in Multi-Task Radiology Report Generation — A Gradient Dynamics Analysis and Solution

本文用 SDE 框架分析放射学报告生成(RRG)多任务学习里"报告生成 vs 临床约束"梯度冲突的两面性——drift term 偏离 Pareto 最优 + diffusion term 衰减无法逃局部最优;提出 CAME-Grad 优化器(方向纠偏 + 能量注入 + 自适应融合)作为线性缩放的即插即用替代,在 MIMIC-CXR / IU X-Ray 上 8 个 RRG 方法平均临床效能 +2.3% / +1.9%。

DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home

针对"在家自己管健康"(Diagnosis-It-Yourself)这一被现有医疗大模型忽视的场景,本文一口气交付了数据集(DIYHealth-900K,90 万条多模态家庭健康问答)、模型(DIYHealthGPT,核心是新提出的 H2LoRA 参数高效微调机制)、基准(DIYHealthBench,首个覆盖 11 项家庭健康任务的评测),在通用与医疗专用基线上都取得 SOTA。

EEG-Based Multimodal Learning via Hyperbolic Mixture-of-Curvature Experts

EEG-MoCE 给 EEG-based 多模态学习(情绪/睡眠/认知)每个模态分配一个可学习曲率的 Lorentz 流形 expert,再用"曲率大→层级结构更丰富→在 fusion 中权重更高"的 curvature-aware attention 做跨模态融合,在 EAV/ISRUC/Cognitive 三个数据集上 cross-subject 准确率分别 +14.14%、+3.34%、+7.98%。

Federated Distillation for Whole Slide Image via Gaussian-Mixture Feature Alignment and Curriculum Integration

本文提出 FedHD:在异构联邦病理学场景下,用 Gaussian-mixture 特征对齐做「一对一」WSI 特征级蒸馏,再通过课程学习把跨机构合成特征逐步注入本地训练,使各机构能在不共享原始数据、不交换模型参数的前提下协作,且兼容异构 MIL 架构与特征提取器,在 TCGA-IDH / CAMELYON16 / CAMELYON17 上全面超越现有联邦与蒸馏基线。

Foundation VAEs for 3D CT Reconstruction, Augmentation, and Generation

本文论证了一个反直觉但实用的发现——在自然图像/视频上预训练的 Foundation VAE 不需要任何医学微调就能作为统一接口同时支持 CT 重建、增强、生成;其重建只是去噪不偏移边界,因此重建图既可做去噪增强(pancreatic / lung tumor NSD +3.9%),其潜空间又可承载 CT 条件扩散生成(FVD −3.9%,CT-CLIP +36.2%,多疾病忠实度 AUC +2.76%)。

查看全部28篇「医学图像」论文 →


🩺 医疗 LLM (4)

ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education

提出 ClinTutor-R1,首个面向临床苏格拉底式教学的一对多对齐视觉语言 Agent,通过多智能体模拟器 ClinEdu 构建 48k 对话数据集 ClinTeach,利用显式心智理论推理和三轴 rubric 强化学习,在学员扩展至 10 人时仍保持教学质量稳定,超越基线模型 20% 并达到 GPT-4o 水平。

Exploring Accurate and Transparent Domain Adaptation in Predictive Healthcare via Concept-Grounded Orthogonal Inference

ExtraCare 用一个"字典度量诱导的正交分解"把电子病历(EHR)患者表征拆成「跨域不变的标签信息」和「域特有的协变量残差」,既在两个真实 EHR 数据集上超过现有域适应基线,又能通过稀疏维度消融把每个隐变量映射回具体 ICD 医学概念,告诉临床医生"适应过程中保留了什么、丢掉了什么"。

MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings

作者提出一个把自由文本病例转成符合 HL7 FHIR R4 标准的"分阶段 LLM + 术语接地 + 修复循环"流水线,并据此从 MedCaseReasoning 构造出 1408 条结构化合成病例数据集 MedCase-Structured(成功率 82.5%),实验显示 GPT-5.4 / Gemini-3.1-Pro / Claude-Opus-4.6 在结构化 FHIR 输入上的诊断准确率比纯文本输入一致下降 4–23 个点。

A Machine-Learned Comorbidity Index

传统共病评分(Charlson、Elixhauser)是为死亡率手工调权的线性规则,换个临床结局就失准;本文用神经网络把一次住院的 ICD 诊断码压成一个标量分数,并通过最大化该分数与多个临床结局之间的归一化 HSIC(核依赖)来训练,使这一个分数能在死亡、再入院、住院时长、ICU 转入等多结局上给出一致的严重度排序,在 MIMIC-III/IV 上的依赖性指标显著超过传统指数与多种机器学习基线。


🧬 计算生物 (51)

Scalable Single-Cell Gene Expression Generation with Latent Diffusion Models

scLDM 用统一的多头交叉注意力块 (MCAB) 把可交换的基因表达数据编成固定长度、置换不变的潜变量集合,再用 DiT + 流匹配 + 联合多属性 classifier-free guidance 替代 Gaussian 先验,在多个 scRNA-seq 数据集上的重构、(有/无条件) 生成、扰动响应预测全面超过 scVI / scDiffusion / CFGen。

Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models

通过对预训练扩散/流模型的 score 输出乘以一个仅依赖时间步、变量 \(k\) 与 \(\sigma\) 的解析重标缩因子 \(r_t\),即可在推理阶段把采样分布"局部"地变得更尖或更平,而无需任何微调,对 DDIM 等确定性采样器也完全兼容。

Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback

IGSR 把符号回归拆成"LLM 提议基函数 ψ_j + 逐项影响力分数 Δ_j 剪枝"两步循环,并把这个循环嵌入 MCTS 来搜组合空间,在 6 个生物医学基准和 LLM-SRBench 上同时拿下最佳 MSE 与符号召回,还在湿实验里发现了 DNA 甲基化与 RNA Pol II 停顿的新关系。

Protein Circuit Tracing via Cross-layer Transcoders

作者把 NLP 中的 cross-layer transcoder 搬到蛋白质语言模型 ESM2 上,提出 ProtoMech 框架以 < 1% 的稀疏潜变量电路恢复 79% 的下游性能,并能沿电路 steering 设计出高 fitness 的蛋白变体,在 70%+ 案例中击败基线。

From Feasible to Practical: Pareto-Optimal Synthesis Planning

PareSP 用多目标 MCTS 搜索联合优化合成路径的成本 / 时间 / 可行性 / 环境影响——找到完整帕累托前沿而非单一"最佳"路径,在 USPTO 和 ASKCOS 基准上较单目标方法节省 23% 成本、35% 时间,同时保持 ≥ 95% 化学可行性。

Protein Language Model Embeddings Improve Generalization of Implicit Transfer Operators

本文把预训练蛋白质语言模型(pLM)的残基嵌入直接灌进可迁移隐式转移算子(TITO),训出 PLaTITO 在 mdCATH 上仅用 56 ms 轨迹和 1100 GPU 小时就让小到 19 M 参数的粗粒化 \(C_\alpha\) 模型在快折叠蛋白等离群系统的平衡采样上全面超过 BioEmu。

Constrained Flow Optimization via Sequential Fine-Tuning for Molecular Design

本文针对"在满足领域硬约束(如合成可达性、能量上界)的前提下最大化奖励(如结合亲和、偶极矩)"这一关键场景,提出 CFO 算法:用增广拉格朗日把约束生成式优化拆成一串带 KL 正则的标准微调子问题,自适应地更新罚因子 \(\rho_k\) 与对偶变量 \(\lambda_k\),在合成低维场景与 FlowMol 分子设计任务上同时给出可证收敛与显著的奖励—约束 Pareto 改进。

Flow Sampling: Learning to Sample from Unnormalized Densities via Denoising Conditional Processes

本文提出 Flow Sampling,把流匹配/扩散模型从"数据驱动"反转为"噪声驱动"——以源噪声样本为条件构造去噪扩散漂移,在 interpolant 上用 detached 模型采得 \(X_1\) 的能量梯度做回归目标,从而学到无数据情况下的高效扩散采样器,并自然推广到常曲率黎曼流形。

CoSiNE: 条件位点独立的抗体序列神经进化模型

CoSiNE 用神经网络参数化的条件位点独立连续时间马尔可夫链(CTMC)来建模抗体亲和力成熟过程,在保持可处理性的同时捕获位点间上位效应,并通过 Guided Gillespie 采样实现抗原特异性的抗体优化,在零样本变体效应预测上超越了现有语言模型和进化模型。

Cross-Chirality Generalization by Axial Vectors for Hetero-Chiral Protein-Peptide Interaction Design

本文提出 AFI(Axial Feature Injection),把轴向量特征以线性混合方式注入 \(E(3)\)-等变标量化模型的极向量通道,使其退化为 \(SE(3)\)-等变并对手性敏感;以此改造 UniMoMo 得到 PepMirror,仅用同手性(L-L)训练数据即可零样本生成异手性(D-L)多肽 binder,并通过湿实验在 CD38 靶点上验证为首个实验确证的 AI de novo D-肽设计框架。

查看全部51篇「计算生物」论文 →


⚛️ 物理/科学计算 (33)

Distribution Transformers: Fast Approximate Bayesian Inference With On-The-Fly Prior Adaptation

Distribution Transformer (DT) 把"先验分布"显式 token 化为一组高斯混合分量、把"观测"通过交叉注意力注入解码器,端到端学一个"先验+数据 → 后验"的映射,在保持与先验同族(GMM→GMM)以支持序贯滤波的同时,把推断时间从分钟级压到毫秒级,并允许测试时任意更换先验而无需重训。

Quantum latent distributions in deep generative models

研究「用量子处理器产生的隐空间分布」何时、为何能提升深度生成模型:理论上证明在一定网络假设下,量子隐空间分布能让生成器产出经典隐分布无法高效产生的数据分布;实验上用真实/模拟光子量子处理器在合成量子数据集与 QM9 分子数据集上做苹果对苹果的对照,发现源自量子干涉的统计量确实带来更好的生成性能。

Understanding Catastrophic Forgetting In LoRA via Mean-Field Attention Dynamics

作者把 Transformer 自注意力写成 token 间相互作用的平均场粒子系统,把 LoRA 视作低秩扰动,证明遗忘与"扰动模长"和"网络深度"两条相变曲线相关,并给出由 \(V\) 的特征值 gap 控制的长时稳定条件。

Foundation Inference Models for Ordinary Differential Equations

FIM-ODE 把"从含噪轨迹反推常微分方程向量场"这件事一次性摊销到预训练里:用一个只在低次多项式 ODE 先验上预训练的 8M 参数 Transformer 神经算子,单次前向就能零样本预测向量场,在 ODEBench 上以约 1/10 的参数、1/80 的训练数据匹配甚至超过符号回归基线 ODEFormer。

Rethink the Role of Neural Decoders in Quantum Error Correction

本文在 \(d\le9\) 的表面码上系统重做 MLP/3D-CNN/TCN/Transformer/GNN 五类神经解码器,并把"量化 + 剪枝 + FPGA 资源建模"作为一等公民放进训练流程,结论是:近期解码性能由数据量而非架构复杂度主导,且 INT4 + QAT 是实现微秒级实时解码的必要前提。

Learning to Refine: Spectral-Decoupled Iterative Refinement Framework for Precipitation Nowcasting

SDIR 把雷达 0–2 小时降水临近预报重新表述为"频域解耦的迭代精化"过程:先用 SFG-Former 提取稳定的低频天气骨架,再用 FR-Refiner(含 Fourier 神经算子)按频段逐步合成高频对流细节,并用一条对齐 Kolmogorov 湍流功率律的 PCPSD 损失替代会导致过平滑的纯 MSE,在 CIKM / Shanghai / SEVIR 三个 benchmark 上同时显著超过回归类与扩散类 SOTA。

REX: A Family of Reversible Exponential Stochastic Runge-Kutta Solvers

本文提出 Rex —— 一族基于 Lawson 指数积分器构造的、可代数反演的(随机)Runge-Kutta 求解器,把任意显式 (S)RK 格式自动转成可精确反演的 ODE/SDE 求解器,既保证任意高阶收敛与非零稳定域,又能在扩散模型的图像重建/编辑、流模型的 Boltzmann 采样上做到接近机器精度的反演。

TINNs: Time-Induced Neural Networks for Solving Time-Dependent PDEs

针对标准时空 PINN 把时间当成额外输入、全程共享一套权重导致"时间纠缠"的问题,TINNs 把网络权重本身写成时间的函数 \(u_{\theta(t)}(\mathbf{x})\),让空间表征随时间演化,并用一个紧凑的逐层时间嵌入避免超网络的参数爆炸,再配 Levenberg–Marquardt 二阶优化器,在多个时变 PDE 上把相对 \(L^2\) 误差压低最多 \(4\times\)、收敛快约 \(10\times\)。

Topology-Preserving Neural Operator Learning via Hodge Decomposition

本文提出 Hodge Spectral Duality (HSD) 神经算子,把流形 PDE 的解算子按 Hodge 正交分解拆成"低频拓扑分量(谱基底)+ 高频几何分量(FNO 辅助网格)"双分支,再用一个交换子修正项耦合二者,从而在复杂网格上同时获得高精度与守恒律保真。

A Call to Lagrangian Action: Learning Population Mechanics from Temporal Snapshots

本文从最小作用原理出发,提出 Wasserstein 拉格朗日力学(WLM)框架,学习二阶人口动力学而非传统梯度流的一阶动力学,从而能够捕捉周期性、旋转等更丰富的群体现象,并可在不需要参考过程的情况下完成插值与未来预报。

查看全部33篇「物理/科学计算」论文 →


🌍 地球科学 (2)

Scaling Laws of Global Weather Models

本文在统一的训练/评测协议下,对 5 个主流数据驱动天气模型(Aurora、AIFS、Pangu、GraphCast、SFNO)做了首个跨模型的缩放定律分析,发现天气模型偏爱"加宽而非加深"、计算预算应优先投给更多训练数据而非更大模型,且不同气象变量的缩放行为差异巨大——这些规律与 NLP/视觉的缩放定律截然不同。

(Sparse) Attention to the Details: Preserving Spectral Fidelity in ML-based Weather Forecasting Models

MOSAIC 用"概率扰动 + 在 HEALPix 球面网格上的 mesh-aligned 块稀疏注意力"同时解决了 ML 天气预报模型的两类频谱退化(确定性平均带来的谱衰减 + 粗化潜空间带来的高频走样),在 1.5° 分辨率上仅 214M 参数就匹敌甚至超过 6× 高分辨率的模型,单 H100 12 秒生成 24 成员 10 天预报。


📡 信号/通信 (2)

Joint Model and Data Sparsification via the Marginal Likelihood

JMDS 通过最大化边缘似然的统一目标同时实现模型和数据稀疏化——避免分阶段优化的次优性,在 CIFAR / ImageNet / WikiText 上以 5-10× 联合压缩比下保持优于独立稀疏化的性能。

Meta-learning Structure-Preserving Dynamics

把 modulation-based 元学习(hyper-network 把 latent code \(\bm{z}^{(k)}\) 映射成层级调制参数)系统性地引入 Hamiltonian / GENERIC 神经网络,提出两种新颖调制——latent multi-rank (MR) 与 latent SVD-like 调制,让一个共享网络在不知道系统参数 \(\bm{\mu}\) 的情况下少样本适配整族新参数实例,同时严格保持能量守恒 / 耗散结构。


👥 社会计算 (9)

SCOPE: Selective Conformal Optimized Pairwise LLM Judging

SCOPE 通过双向偏好熵(BPE)消除 LLM 评判中的位置偏差,结合保形风险控制实现有限样本 FDR 控制——在保持高覆盖率的前提下提供统计有效的风险界保证(覆盖率 0.583 时 FDR 仅 0.099 vs Vanilla 1.000 但 FDR 0.198)。

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias 把 LLM 的去偏问题重塑为「在自回归推理链上对概率质量做公平资源分配」:用轨迹级后缀边际作为资源单位,套 Jain 公平指数防止资源在易样本上塌缩,再配 cold-start SFT 与基于一致性过滤的在线自训练,仅用 20k 标注种子就让 Qwen3-8B 在 8 个 fairness/utility 基准上的平均分从 77.5 拉到 81.7,并把基础模型「自我纠错越纠越歪」的塌缩翻转成稳定 +0.4。

IDO: Incongruity-Aware Distribution Optimization for Multimodal Fake News Detection

IDO 通过显式建模模态间不一致性作为可学习的分布优化目标——同时拉近真新闻的多模态嵌入并扩大假新闻的不一致,在 Weibo / Twitter / Fakeddit 上 F1 较 SOTA 提升 3-7%、对未见过的假新闻泛化能力显著提升。

The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-modal Divergence

本文用测度论框架把 InfoNCE 损失提升到表示分布上的确定性"种群能量",证明 unimodal 情形是凸的且收敛到唯一 Gibbs 平衡,而对称多模态情形会出现持续的负对称 KL 耦合,从几何上必然产生 modality gap。

MIND: Multi-Rationale Integrated Discriminative Reasoning Framework for Multi-Modal Fake News

MIND 通过多视角理由生成 + 跨理由判别推理为假新闻检测提供可解释 + 鲁棒的判别框架——同时利用 LLM 生成的事实核查、模态一致性、语义合理性 3 类理由,在 Weibo / Twitter / Fakeddit 上 F1 较 SOTA 提升 4-8%。

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-Random Sequences

FLIPS 通过设计伪随机种子序列(仅模型所有者知晓种子)来生成模型独特"指纹响应"——攻击者即便微调或剪枝模型也无法消除指纹,黑盒查询场景下检测率 > 99%、误报率 < 1%。

Three Years of r/ChatGPT: Societal Impact Evaluations from Social Media Data

把 r/ChatGPT 子版三年(2022-12 至 2025-11)共 13.7 万帖子用稀疏自编码器(SAE)拆成可解释特征,再用分段线性变点拟合追踪每个特征的时间轨迹,发现"情感性使用"(心理治疗、情感依恋)在 GPT-4o 发布后骤增;并提出在线监测算法 PuLSE,证明它本可在 2024 年 10 月就报警——比 OpenAI 公开承认这一影响早了半年。

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases

这篇论文提出 alignment tampering:当待对齐模型生成“高质量但带偏见”和“低质量但无偏见”的响应时,RLHF 的成对偏好标签会把质量与偏见混在一起,导致奖励模型、PPO/DPO 和 Best-of-N 采样进一步放大原本不想要的偏见。

ObjEmbed: Towards Universal Multimodal Object Embeddings

ObjEmbed 训练一个通用的对象嵌入模型——通过结合检测、分割、检索、描述、分类等任务对齐多模态对象表示,在 OVD / OVS / Text2Image-Object / Open-Caption-Eval 等 11 项任务上单一嵌入超越或匹配任务特定 SOTA。


🛡️ AI 安全 (114)

遗忘并非删除:大语言模型机器遗忘中的可逆性调查

本文通过表征层面的诊断工具系统分析 LLM 遗忘的可逆性——发现许多遗忘方法只是抑制而非真正删除信息,提出四层遗忘分类体系区分真正的信息擦除与表面性能退化。

In-Training Defenses Against Emergent Misalignment in Language Models

针对「只在窄领域微调就让模型全局变坏」的涌现失配(Emergent Misalignment, EM)现象,本文第一次系统地比较了五类训练期防御手段,并提出用「对齐模型 vs 失配模型的困惑度差」自动挑选交错安全数据的 Interleaving++,在「防 EM、保留窄域学习、学得会良性任务、回答连贯」四条标准上同时达标。

Deep Sequence Models Tend to Memorize Geometrically; It Is Unclear Why

本文指出 Transformer / Mamba 在死记硬背图的边时并不会真的退化成查找表(联想记忆),而是会自发把节点嵌入排成一种编码了多跳全局结构的"几何记忆",并通过 path-star 实验证明这种几何让隐式推理变得反常地容易,但其出现既不能归因于监督、容量也不能归因于优化压力,留下一个新的"记忆之谜"。

When Benign Inputs Lead to Severe Harms: Eliciting Unsafe Unintended Behaviors of Computer-Use Agents

这篇论文研究"计算机操作智能体(CUA)在完全善意的输入下也会做出严重不安全行为"这一被忽视的风险,先给出意外行为的概念框架(四条判据 + 两大类危害),再提出 AutoElicit——一个用执行反馈迭代扰动善意指令、自动诱发并评估有害行为的智能体框架,在 Claude 4.5 Haiku / Operator / Claude 4.5 Opus 等前沿 CUA 上以最高 72.5%–86.7% 的成功率批量挖出长尾危害。

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

BioAgent Bench 给"用 LLM agent 跑生物信息学 pipeline"这件事造了一个端到端的评测套件——10 个真实 bioinformatics 任务 × 10 个 frontier/open-weight 模型 × 3 个 agent harness,配合 LLM 判官评分和 corrupted/decoy/prompt-bloat 三类扰动测试,发现前沿模型能完成 90%+ pipeline 但鲁棒性堪忧。

Position: Stop Chasing the C-index when Evaluating Survival Analysis Models

作者审计了 2023–2025 年 92 篇生存分析论文,发现约 72% 的工作所用评估指标(尤其是被滥用的 C-index)与其建模目标和删失假设不对齐,并提出"双螺旋阶梯假设"(Ladder Hypothesis):模型与指标必须站在同一级"删失假设"上,否则报告的性能与排名都可能是偏差伪影。

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench 把"AI agent 会不会真的动手做分子生物学"做成三道可自动判分的任务(设计 DNA 片段、规避合成筛查、操控移液机器人跑 Gibson Assembly),实测八个前沿模型在全部三项任务上都超过分子生物学博士专家的中位数,并用真实湿实验证明 o4-mini-high 写的脚本能在 OpenTrons 机器人上把 DNA 真的拼出来。

Old Habits Die Hard: How Conversational History Geometrically Traps LLMs

History-Echoes 框架用"马尔可夫链状态一致性"和"潜空间几何角度"两套视角分析 LLM 对话历史的 carryover 效应,发现两者 Spearman 相关 0.78——一旦某种行为(幻觉/谄媚/拒绝)出现,模型就被困在潜空间该状态对应区域里,难以跳出;其中"拒绝"陷阱最强,"幻觉"最弱,且话题不连贯时陷阱会消解。

PFT: Phonon Fine-tuning for Machine Learned Interatomic Potentials

本文提出 PFT (Phonon Fine-tuning),通过 Hessian-vector product 随机采样力常数列、并在 MLIP 微调时直接监督能量 Hessian 与 DFT 力常数对齐,配合 co-training 缓解灾难性遗忘,将 Nequix MP 在 MDR Phonon 基准上的声子热力学误差平均降低 55%,并将热导率 \(\kappa_{\text{SRME}}\) 从 0.446 降到 0.307,在 MPtrj 训练的模型中达到 SOTA。

Antidistillation Fingerprinting

这篇论文提出 Antidistillation Fingerprinting (ADFP),用代理学生模型估计哪些水印 token 最容易被蒸馏过程吸收,从而在几乎不牺牲教师输出质量的情况下,更可靠地检测第三方模型是否训练过教师模型输出。

查看全部114篇「AI 安全」论文 →


📂 其他 (70)

iWorld-Bench: A Benchmark for Interactive World Models with a Unified Action Generation Framework

iWorld-Bench 是首个专门为"交互式世界模型"设计的统一评测基准,提出一套能把文本 / one-hot / 相机内外参三种动作输入折算到同一指令空间的 Action Generation Framework,并基于 330K 视频精挑 4.9K 任务、9 项指标,对 14 个主流模型做了全维度对比。

Identifiable Equivariant Networks are Layerwise Equivariant

本文在一个架构无关的抽象框架下证明:只要参数满足"弱可辨识性",端到端 \(G\)-等变的深度网络一定存在等价参数化,使得每一层都对某个潜在群作用等变;这从理论上解释了"端到端等变会自动塌缩为逐层等变"这一长期被实验观察到的现象。

TabMGP: Martingale Posterior with TabPFN

把 TabPFN 这种预训练表格 Transformer 直接当作鞅后验(MGP)的预测规则,通过 in-context 前向滚动采样得到任意损失函数下参数 \(\theta\) 的可信集,避免了手工设计先验/似然和拷贝拉超参,且在 30 个真实/合成场景下覆盖率与可信集面积同时优于手工 MGP 与经典贝叶斯。

Test-Time Training with KV Binding Is Secretly Linear Attention

本文用四个「记忆悖论」反例 + 一套严格的展开定理,证明带 KV-binding 内循环的 TTT(如 LaCT、ViTTT)即便用多层 MLP + 动量也只是「学到的线性注意力算子」,并据此把它简化、并行化为标准线性注意力,吞吐提升 4× 而性能几乎不掉。

Rectified LpJEPA: Joint-Embedding Predictive Architectures with Sparse and Maximum-Entropy Representations

作者把 LeJEPA 的"投影后向各向同性高斯对齐"推广为"投影后向 Rectified Generalized Gaussian (RGG) 分布对齐",通过整流 + 截断广义高斯获得显式可控的期望 \(\ell_0\) 稀疏度,在 ImageNet-100 上 ResNet 编码器线性探针达到 \(85.08\%\) 同时把 \(\ell_0\) 稀疏度维持在 \(\sim 73\%\),明显优于 LeJEPA 的全密集表示。

Cascaded Flow Matching for Heterogeneous Tabular Data with Mixed-Type Features

TabCascade 把表格行拆成"低分辨率(类别 + 数值的离散化版本)"与"高分辨率(连续数值)"两段级联:先用 CDTD 学低分辨率联合分布,再用 flow matching 在低分辨率引导下生成数值细节,并通过数据相关耦合 + 可学非线性时间表收紧 transport cost;天然支持缺失值、零膨胀等"混合型特征"的生成,在 12 个数据集上 detection score 比 SOTA 提升 51.9%。

CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

本文构建了 CyberGym-E2E——首个覆盖"漏洞发现 → PoC 生成 → 补丁生成 → 功能回归测试"全生命周期的大规模真实世界 AI Agent 安全基准(920 个漏洞 × 139 个开源项目),并通过 agent 辅助 + 专家终审的四步流水线把人工成本压到最低;评测显示前沿模型在 patch-only 任务上能到 80%+,但在端到端任务上 S3 成功率最高仅 65.9%(GPT-5.4),漏洞发现而非补丁生成是真正的瓶颈。

Knowing Isn't Understanding: Re-Grounding Generative Proactivity with Epistemic and Behavioral Insight

这是一篇 ICML2026 Position 论文,主张生成式智能体的"主动性"不能只看是否更早、更自主、更持续地行动,而必须由两条联合约束规制——认识论合法性(agent 是否真的"理解"了情境)与行为承诺度(介入是否可逆、是否被迫升级),并把幻觉、对齐失败、不安全自治重新解释成"知道 / 行动"之间的错耦合(mis-coupling)。

Mapping Human Anti-collusion Mechanisms to Multi-agent AI Systems

这是一篇 position / taxonomy 论文:把人类社会几百年积累的反合谋经验(制裁、宽大与举报、监控审计、市场设计、治理)按生命周期分成五类,再逐条映射到多智能体 AI 系统的可实现干预(reward penalty、whistleblower agent、telemetry-first overseer、interaction protocol 设计、shutdown 机制等),同时指出 AI 场景独有的归因、身份流动、合作-合谋边界、对抗适应等开放挑战。

Sequential Group Composition: A Window into the Mechanics of Deep Learning

作者把"对一段群元素求累积乘积"这个统一任务作为显微镜,用群上 Fourier 分析 + AGF 框架证明两层网络会按 Fourier 能量从大到小逐个学习不可约表示(irrep),并刻画两层、RNN、深层 MLP 三种架构在序列长度 \(k\) 上分别需要 \(2^k\) 宽度、\(k\) 步、\(\log k\) 层的表达力鸿沟。

查看全部70篇「其他」论文 →