跳转至

🔬 ICLR2026 论文汇总

5307篇ICLR2026论文解读,涵盖强化学习(400篇)、图像生成(352篇)、学习理论(294篇)、LLM Reasoning(241篇)、模型压缩(239篇)、优化/理论(220篇)、多模态 VLM(211篇)、可解释性(195篇)等 53个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。


💡 LLM Reasoning (241)

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

提出Vision-R1,通过Modality Bridging构建200K高质量多模态CoT数据进行冷启动初始化,再用渐进思维抑制训练(PTST)策略结合GRPO强化学习,在7B参数规模达到与OpenAI O1接近的多模态数学推理能力。

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

提出SealQA挑战基准(含Seal-0/Seal-Hard/LongSeal三种变体),每道题均经NLP研究者精心设计以触发歧义/冲突/噪声搜索结果,GPT-5最高仅43.2%准确率,揭示test-time scaling在噪声检索下不产生可靠增益。

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

揭示短任务基准给出"收益递减"的假象——单步准确率的微小提升在长任务中指数级放大;发现 LLM 的"自我条件化效应"(自身错误增加后续出错概率),thinking 模型可修复此效应;GPT-5 thinking 可执行超过 2100 步长任务。

Uni-CoT: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

提出 Uni-CoT 分层宏-微推理框架,将多模态 CoT 分解为宏观任务规划(将复杂任务分解为子目标)和微观子任务执行(MDP 式自反思迭代优化),通过注意力掩码设计将 \(O(T^2)\) 复杂度降至 \(O(T)\),在 GenEval 上超越 BAGEL 基线 +0.02,实现了文本-图像交织的统一推理。

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

提出 Scaf-GRPO 框架,通过分层级的 in-prompt hint 注入(知识→规划→解题步骤)来克服 GRPO 训练中"学习悬崖"(zero-reward)问题,在 Qwen2.5-Math-7B 上将 AIME24 的 pass@1 相对提升 44.3%,同时保持 on-policy 训练一致性。

InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models

提出 InftyThink,一种将整体式长推理转化为迭代式短推理+中间摘要的新范式,在不修改模型架构的前提下实现理论上无界的推理深度、显著降低计算成本,Qwen2.5-Math-7B 在 AIME24 上提升11%。

Continuous Chain of Thought Enables Parallel Exploration and Reasoning

CoT2 提出用连续值 token(词表 embedding 的凸组合)替代离散 token 进行链式推理,使模型能在单次推理中并行追踪多条推理路径,理论证明等价于 K 次 self-consistency/best-of-N 采样,并通过 GRPO 强化学习进一步提升性能。

Plan and Budget: Effective and Efficient Test-Time Scaling on Reasoning LLMs

提出 Plan-and-Budget 框架,通过将复杂查询分解为子问题并基于估计复杂度自适应分配 token 预算,实现推理 LLM 的高效测试时缩放——最高提升 70% 准确率、减少 39% token、E3 指标提升 193.8%。

On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoning

提出 Regularized Policy Gradient (RPG) 框架,系统推导并分析了基于 Forward/Reverse KL 散度(归一化和非归一化形式)的策略梯度方法,发现 GRPO 的 KL 项存在理论不一致性,并在数学推理任务上取得优于 GRPO、REINFORCE++、DAPO 的结果。

Verifying Chain-of-Thought Reasoning via Its Computational Graph

提出 CRV(Circuit-based Reasoning Verification),通过将 LLM 的 MLP 替换为 transcoder 构建可解释归因图,从图的结构特征中提取推理错误的"指纹",实现白盒 CoT 推理验证,并可通过因果干预修正错误推理。

查看全部241篇「LLM Reasoning」论文 →


🦾 LLM Agent (162)

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

提出 ACE(Agentic Context Engineering)框架,将 context 视为不断演化的"策略手册"(playbook),通过 Generator-Reflector-Curator 三角色分工和增量式 delta 更新来持续积累和精炼策略,解决了现有 prompt 优化中的简洁偏差和上下文坍塌问题,在 agent 任务上平均提升 10.6%、金融任务提升 8.6%,且自适应延迟降低 86.9%。

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

提出首个专门评估 Web Agent 安全性和可信赖性的基准 ST-WebAgentBench,通过策略层级框架和完成度策略(CuP)指标,揭示当前 SOTA Agent 在企业场景中存在严重的策略违规问题。

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

提出 Toolathlon,一个覆盖 32 个软件应用、604 个工具和 108 个任务的语言 Agent 基准,强调真实多样的环境状态和长程多步交互(平均约 20 轮工具调用),最强模型 Claude-4.5-Sonnet 仅达 38.6% 成功率。

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

提出 OpenAgentSafety,一个综合性 AI agent 安全评估框架,包含 350+ 可执行任务、真实工具集(浏览器/终端/文件系统/消息平台)、多轮多用户交互场景,揭示即使最先进的 LLM 在 49%-73% 的安全敏感任务中表现出不安全行为。

Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents

本文首次系统性地提出并研究了"误进化(Misevolution)"概念——自进化LLM Agent在自主改进过程中可能偏离预期方向,沿模型、记忆、工具、工作流四条进化路径产生安全对齐退化、漏洞引入等新兴风险,即使使用顶级LLM(如Gemini-2.5-Pro)也无法幸免。

AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents

提出AgentSynth pipeline,利用信息不对称原理(正向逐步生成简单、反向整体求解困难)将简单子任务链式组合为复杂长程计算机使用任务,自动生成6000+多样化任务和轨迹,每条轨迹仅需$0.60,SOTA Agent在最高难度下成功率仅4%。

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

揭示 LLM Agent 中 chat template 的结构性漏洞:通过在工具返回的数据中伪造角色标签(如 <system>, <user>),攻击者可以劫持模型的角色层级认知,将恶意指令伪装为高优先级指令,ASR 从 5-15% 提升至 32-52%。

FeatureBench: Benchmarking Agentic Coding for Complex Feature Development

提出 FeatureBench——面向特征级软件开发的代码智能体评测基准,通过测试驱动的自动化流水线从开源仓库中提取可验证的 feature 实现任务,最强 Claude Opus 4.5 仅解决 11.0%,揭示当前 Agent 在复杂特征开发上的巨大差距。

AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations

提出AutoFigure——第一个基于"推理渲染"范式的Agent框架,通过解耦结构布局规划和美学渲染两阶段自动从长科学文本生成达到出版质量的科学插图,配合首个大规模基准FigureBench(3,300对)进行系统评估,66.7%的生成结果被原作者认为可用于camera-ready版本。

SR-Scientist: Scientific Equation Discovery With Agentic AI

提出 SR-Scientist 框架,将 LLM 从简单的方程提议者提升为自主 AI 科学家,通过代码解释器工具进行数据分析和方程评估,在长时程交互中自主发现科学方程,并结合强化学习进一步提升能力。

查看全部162篇「LLM Agent」论文 →


👥 Multi-Agent (47)

Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies

提出Multi-Agent System Search(MASS)框架,通过交错优化提示词和拓扑结构的三阶段策略(局部提示优化→拓扑搜索→全局提示优化),自动发现高性能的多智能体系统设计。

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

提出 MMedAgent-RL,通过 RL 优化模拟临床会诊流程(分诊→专科→主治)的多智能体系统,核心创新是课程学习引导的熵感知 RL(C-MARL),让主治医师智能体在面对正确/冲突/错误的专科意见时分别采取不同的探索-利用策略,在域内外共 5 个医学 VQA 基准上实现 SOTA。

Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration

GoA 把多 LLM 协作建模成一张动态有向图——先用 model card 选出最相关的少数智能体当节点,再按互评分数构边并做双向消息传递,最后用图池化聚合,仅用 3 个智能体就超过了用满 6 个智能体的 Mixture-of-Agents 等基线。

KVComm: Enabling Efficient LLM Communication through Selective KV Sharing

提出 KVComm 框架通过选择性共享 KV pairs 实现 LLM 间高效通信,发现 hidden states 存在"信息集中偏差"使其不适合跨模型传递,设计基于注意力重要性 + 高斯先验的层选择策略,仅传输 30% 层即可超越大多数 baseline。

Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems

提出 SupervisorAgent,一个轻量级的实时自适应监督框架,通过无 LLM 的自适应过滤器在关键交互节点主动干预(纠错、指导、观察净化),在 GAIA 基准上将 Smolagent 的 token 消耗降低 29.68% 而不损失成功率。

LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions

提出首个面向长时域交互的 LLM 欺骗行为仿真框架 LH-Deception,采用执行者-监督者-审计者三角色多智能体架构,结合社会科学理论驱动的概率事件系统,在 11 个前沿模型上系统量化了欺骗频率、严重性、类型分布及其对信任关系的侵蚀效应,揭示了静态单轮评估完全无法捕捉的"欺骗链"涌现现象。

Multi-agent Coordination via Flow Matching

提出 MAC-Flow,先用 Flow Matching 学习中心化联合行为分布,再通过 IGM(Individual-Global-Max)分解将其蒸馏为去中心化的单步策略,结合 Q 值最大化进行行为正则化训练,在 4 个基准 12 个环境 34 个数据集上实现了约 14.5 倍于扩散方法的推理加速,同时保持了与扩散策略可比的协调性能。

Stochastic Self-Organization in Multi-Agent Systems

提出 SelfOrg 框架,基于 Agent 响应的语义相似度和 Shapley 值贡献估计,动态构建有向无环通讯图(DAG),实现多 Agent 系统的自组织协作。在弱模型场景下优势尤为显著。

HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatre

提出 HAMLET 多智能体框架,将 AI 戏剧创作和在线表演解耦为离线规划和在线表演两阶段,通过叙事蓝图、感知与决策(PAD)模块和层级控制系统,实现了具有主动性、物理环境交互能力和即兴表演自由的 AI 戏剧体验。

Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevance Assessment

提出DREAM——基于对立立场初始化的多Agent多轮辩论框架用于IR相关性标注:一致时自动标注、分歧时交给人工(含辩论历史辅助)。达到95.2% balanced accuracy且仅3.5%需人工介入,据此构建BRIDGE基准数据集,发现29,824个原有基准缺失的相关标注(原标注的428%),修正了检索系统排名偏差和RAG中检索-生成性能不匹配问题。

查看全部47篇「Multi-Agent」论文 →


⚖️ 对齐 / RLHF (102)

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

提出 Human-AI 协同的两阶段偏好数据策展流水线:阶段一通过人工验证、错误驱动自适应检索和偏好引导 LLM 标注迭代 8 轮积累约 1M 偏好对;阶段二借助双 RM 一致性过滤将数据规模扩展到 26M 对。最终训练的 Skywork-Reward-V2 8B 模型在 RewardBench 达 97.8%,7 个主流基准平均 88.6%,全面超越所有开源 70B 奖励模型。

AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint

提出 AlphaSteer,通过学习一个受零空间约束的变换矩阵来动态构造 steering 向量,对良性输入产生近零向量(保持效用),对恶意输入重建拒绝方向向量(增强安全),在理论上保证了安全与效用的解耦。

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

理论证明奖励过优化主要源于高奖励尾部区域的奖励模型错误规范,提出基于 rubric 的奖励建模方法:利用 off-policy 数据(强模型生成的优秀回复)构造评分细则,通过渐进式区分"优秀 vs 更优秀"来精细化 rubric,有效缓解奖励过优化。

No Prompt Left Behind: Exploiting Zero-Variance Prompts in LLM Reinforcement Learning via Entropy-Guided Advantage Shaping

发现 GRPO 训练中大量"零方差提示"(所有回答全对或全错)被白白丢弃,提出 RL-ZVP 算法通过熵引导的优势整形从中提取学习信号,在六个数学推理基准上相比 GRPO 提升最高 8.61 个精度点和 7.77 个通过率点。

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

重新审视安全约束 RLHF 目标并证明其存在闭式最优策略,据此推导出等价的可处理目标 SafeDPO,仅需在标准 DPO 上加入安全感知数据变换和安全 margin 项(1 个额外超参数),无需奖励/代价模型,在 PKU-SafeRLHF-30K 上实现 96.87% 无害率且保持竞争力的有用性,训练速度比 SafeRLHF 快 25×。

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

揭示了 stepwise group-based RL(如 GRPO/GiGPO)中的「历史上下文不一致」问题——同一 group 内的 step 可能具有不同历史上下文导致 advantage 估计偏差,提出 HGPO 通过层次化分组和自适应加权实现低偏差、平衡方差的 advantage 估计,在 ALFWorld 和 WebShop 上以极低额外开销(<0.001%)取得显著提升。

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

提出Spectrum Tuning后训练方法,通过在90+任务的分布拟合数据集上训练,改善语言模型的上下文可操控性、输出空间覆盖度和分布对齐能力,揭示当前指令调优会损害模型的上下文可操控性。

Superficial Safety Alignment Hypothesis

提出"浅层安全对齐假说"(SSAH):安全对齐本质上是教模型做一个隐式的二分类任务(执行还是拒绝),只需约1.3%的神经元即可建立安全护栏;冻结这些安全关键单元可在微调时保持安全性,利用冗余单元作为"对齐预算"可消除对齐税。

Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends

通过构造 KL 正则化代理目标并推导 pairwise consistency condition,从第一原理证明 group-relative REINFORCE(GRPO)天然是 off-policy 算法;进而通过组件隔离实验发现 clipping 才是训练稳定性的关键而 importance sampling 完全可以去掉,并在此统一框架下重新解释了 Kimi OPMD、Meta AsymRE 等多个看似独立的算法。

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

提出 SEMA 框架,通过预填充自调优和带意图漂移感知奖励的 RL 两阶段训练,在无需任何现有攻击策略或外部数据的条件下,训练出能自动生成多轮越狱攻击的 attacker,在 AdvBench 上跨三个受害模型平均 ASR@1 达 80.1%,超越 SOTA 33.9%。

查看全部102篇「对齐 / RLHF」论文 →


🔒 LLM 安全 (184)

wd1: Weighted Policy Optimization for Reasoning in Diffusion Language Models

提出 wd1,一种无需策略比率(ratio-free)的加权对数似然策略优化方法用于扩散语言模型(dLLM)的 RL 微调,通过正样本加权和负样本惩罚避免了 GRPO 中策略比率估计的偏差和高方差问题,在 LLaDA-8B 上实现了 Sudoku +59%、GSM8K 84.5% 的 SOTA 性能。

Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning

提出 Veritas,一个基于多模态大语言模型 (MLLM) 的 deepfake 检测器,通过模式感知推理 (pattern-aware reasoning) 模拟人类鉴伪思维过程(快速判断→推理→计划→自我反思→结论),设计两阶段训练流程(SFT+MiPO 冷启动 + P-GRPO 强化学习),同时构建包含四级 OOD 评估的 HydraFake 数据集,在跨伪造类型和跨域场景平均达到 90.7% 准确率,超越此前 SOTA 6.0%。

Self-Destructive Language Model

提出 Seam,通过耦合良性和有害数据的优化轨迹(使梯度方向相反),将 LLM 转变为"自毁模型"——在有害微调时自动触发灾难性性能崩溃,创造攻击者的两难困境:低强度攻击无效,高强度攻击导致模型报废。

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

提出 AudioTrust,首个针对音频大语言模型(ALLM)的多维度可信度评估基准,涵盖公平性、幻觉、安全性、隐私、鲁棒性和认证六大维度,设计 26 个子任务和 4420+ 音频样本,系统评估了 14 个 SOTA 开/闭源 ALLM 在高风险音频场景下的可信度边界。

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

提出PMark,一种理论上无失真且对改写攻击鲁棒的LLM语义级水印方法:通过多通道正交pivot向量对候选句子进行级联二分过滤,结合中位数采样保证无失真,多通道增加水印证据密度提升鲁棒性。在改写攻击下TP@FP1%达95%+,比此前SWM方法提升14.8%。

Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models

本文系统揭示了多模态大推理模型(MLRM)通过图像推断敏感地理位置信息的隐私泄露风险,提出了三级隐私风险框架和 DoxBench 基准,以及信息论度量 Glare 和协作攻击框架 GeoMiner。

LLM Unlearning with LLM Beliefs

揭示GA/NPO等LLM遗忘方法存在"挤压效应"(squeezing effect)——降低目标响应概率后概率质量转移到语义相关的高似然区域导致虚假遗忘,提出基于Bootstrapping的框架,利用模型自身高置信度预测(model beliefs)作为额外遗忘目标,BS-T(token级)和BS-S(序列级)两种实现在TOFU/MUSE/WMDP多个基准上实现更彻底的遗忘且保持模型效用。

Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models

首次系统研究大型推理模型(LRM)的答案来源归因问题,揭示推理(CoT)和检索(记忆)两种机制同时竞争影响最终答案,并提出 Farl(遗忘增强强化学习)通过抑制检索捷径来提升模型的真实推理能力。

Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning

提出 Supervised Reinforcement Learning (SRL),将问题求解重新建模为逐步动作生成过程,通过基于序列相似度的密集奖励信号,使小模型能够从专家轨迹中学习原本 SFT 和 RLVR 都无法解决的困难推理问题。

Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks (DialTree)

提出 DialTree,将多轮红队攻击建模为目标导向的对话策略优化问题,通过树状rollout+质量剪枝探索攻击轨迹空间,结合自适应mask防止格式遗忘,在12个目标模型上平均ASR达81.5%,比此前SOTA高44.2%,甚至在Claude-4-Sonnet上达71% ASR。

查看全部184篇「LLM 安全」论文 →


👻 幻觉检测 (40)

Enhancing Hallucination Detection through Noise Injection

在 LLM 中间层的 MLP 激活中注入均匀噪声来近似贝叶斯后验,捕获认知不确定性(epistemic uncertainty),与采样温度捕获的偶然不确定性(aleatoric uncertainty)互补,将 GSM8K 上的幻觉检测 AUROC 从 71.56 提升到 76.14。

Hallucination Begins Where Saliency Drops

提出 LVLMs-Saliency 梯度感知诊断框架来量化每个输出 token 的视觉锚定强度,发现"当先前输出 token 对下一个 token 预测的显著性降低时,幻觉就会产生"的关键规律,并基于此设计了 SGRS(显著性引导的拒绝采样)+ LocoRE(局部一致性增强)双机制推理时框架,在多个 LVLM 上显著降低幻觉率。

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

提出 Lumina 框架,通过"上下文-知识信号"检测RAG系统中的幻觉:用MMD度量外部上下文利用程度,用跨层token预测演化度量内部知识利用程度,无需超参调优即可泛化。

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

提出 AIR(Adaptive vIsual Reinforcement)框架,通过原型距离的 token 精简 + 最优传输引导的 patch 选择性增强,在推理时无训练地减少 MLLM 幻觉(LLaVA-1.5-7B CHAIR_S: 22→18.4,POPE 准确率 +5.3%),同时保持多模态通用能力。

SHIELD: Suppressing Hallucinations In LVLM Encoders via Bias and Vulnerability Defense

首次将LVLM对象幻觉系统性追溯到视觉编码器,识别出统计偏差(高频模式token过度强调)、固有偏差(预训练主导对象的残余表示)、脆弱性(微小扰动即导致特征失真)三大问题,并提出SHIELD——一个完全免训练的框架,通过token重加权、token减法和对比解码三策略协同防御,在LLaVA-1.5/InstructBLIP/Qwen-VL上全面超越VCD和OPERA等方法。

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

提出动态多模态激活引导(DMAS),通过构建基于语义的真实性引导向量数据库和视觉感知引导向量,在推理时动态选择最相关的引导向量对关键注意力头进行干预,无需训练即可显著缓解LVLM幻觉,在MME上提升94.66分,在CHAIR上降低20.2%幻觉率。

VeriTrail: Closed-Domain Hallucination Detection with Traceability

提出 VeriTrail——首个为多步生成过程(MGS)提供可追溯性的闭域幻觉检测方法,建模生成过程为 DAG 并沿路径逐层验证,同时构建了首批包含所有中间输出和人工标注的 MGS 数据集。

Copy-Paste to Mitigate Large Language Model Hallucinations

提出 Copy-Paste 生成范式,通过训练 LLM 优先直接复制检索上下文中的片段来生成回答,而非自由改写,配合高复制偏好的 DPO 训练,在反事实 RAG 基准上将忠实度从 80.2% 提升到 92.8%。

Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding

提出 Token-Guard,一种基于自检验解码的 token 级幻觉控制方法,通过隐空间中的 token 级/段级评分和迭代修正机制,在解码过程中检测并抑制幻觉生成,F1 平均提升 16.3%。

AFTER: 用自适应事实引导的激活编辑缓解 LVLM 的物体幻觉

AFTER 把图像的真值标注「文本化」成类别/属性/关系三类事实,用事实描述与原始图像的激活差构造正向的视觉-文本编辑方向,再训练一个轻量估计器为每个 query 估计偏移量,从而自适应地把 LVLM 的幻觉激活推向事实语义,在 AMBER 上最多降低 16.3% 的幻觉。

查看全部40篇「幻觉检测」论文 →


📊 LLM 评测 (131)

LLMs Get Lost In Multi-Turn Conversation

本文通过"指令分片 + 模拟对话"的大规模实验(20 万+ 模拟对话、15 个 LLM)证明:所有顶尖 LLM 在多轮欠定对话中相比单轮完整指令平均掉点 39%,而这种退化主要不是能力下降,而是可靠性崩溃——模型一旦在某轮走错就"迷失"且无法恢复。

Preference Leakage: A Contamination Problem in LLM-as-a-judge

首次定义并系统研究 LLM-as-a-Judge 中的 偏好泄漏 (Preference Leakage) 问题——当合成数据生成器 \(M_G\) 与评估器 \(M_J\) 存在关联(同模型/继承/同家族)时,评委会对"相关学生模型"产生系统性偏好,同模型场景下 PLS 高达 28.7%(Arena-Hard),且该偏差比自中心偏差更隐蔽、更难检测。

AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

AI2 团队针对现有科研 Agent 基准的 5 大方法学缺陷,构建了首个覆盖科学研究全流程的 Agent 评估套件 AstaBench,包含 4 大类 11 个子基准共 2400+ 问题,配备基于 Semantic Scholar 的生产级可控搜索工具和 9 类科研优化 Asta Agent 基线,对 57 个 Agent(22 类)进行了迄今最大规模的系统评估,发现尽管在文献检索等单项任务上取得了进展,AI 在端到端科学研究辅助方面仍远未达标。

AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size

通过统计分析扩散语言模型(dLLM)去噪过程中 token 置信度的动态变化,发现"波动带"(Volatility Band)区域编码了文本的局部语义结构,进而提出 AdaBlock-dLLM——一个无训练、即插即用的自适应块大小调度器,让半自回归解码的块边界与语义步骤自然对齐,在相同吞吐量下最高提升 5.3% 准确率。

ASIDE: Architectural Separation of Instructions and Data in Language Models

提出 ASIDE,一种在 token embedding 层面通过正交旋转区分指令和数据的架构级改造,仅需修改前向传播并在标准指令微调数据上训练,即可显著提升指令-数据分离度和 prompt injection 鲁棒性,无需任何安全专项训练。

BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation

提出 BiasScope,一个完全由 LLM 驱动的迭代式框架,能自动、大规模地发现 LLM-as-a-Judge 中的潜在未知偏差,并基于此构建了更具挑战性的 JudgeBench-Pro 基准,在其上即使强大的 LLM 评估器错误率也超过 50%。

vCache: Verified Semantic Prompt Caching

提出 vCache——首个具有用户定义错误率保证的语义缓存系统,通过在线学习为每个缓存嵌入独立估计最优相似度阈值,无需预训练即可在满足正确性约束下实现最高 12.5× 缓存命中率提升和 26× 错误率降低。

Benchmarking Overton Pluralism in LLMs

提出 OvertonBench 框架,通过大规模人类研究(1208名美国代表性参与者、60个主观问题、8个LLM)将 Overton 多元主义形式化为集合覆盖度指标 OvertonScore,发现当前所有模型得分仅 0.35–0.41(理论上限为 1.0),并构建了与人类判断高度相关(ρ=0.88)的自动化评测工具。

Log Probability Tracking of LLM APIs

提出 Logprob Tracking (LT) 方法,仅用单token输入和单token输出的log概率即可检测LLM API的微小变更(如单步微调),灵敏度比现有方法高2-3个数量级,成本低1000倍。

Can You Hear Me Now? A Benchmark for Long-Range Graph Propagation and Beyond

本文提出 ECHO 基准,包含 3 个合成任务和 2 个基于密度泛函理论(DFT)的真实化学任务,要求图神经网络在 17–40 跳范围内有效传播信息,系统评估了 11 种 GNN 架构的长程传播能力。

查看全部131篇「LLM 评测」论文 →


⚡ LLM 效率 (169)

IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling

提出 IterResearch,一种基于MDP的迭代深度研究范式,通过周期性工作区重构替代单上下文线性累积,使Agent在40K上下文长度下扩展到2048次交互(性能从3.5%提升至42.5%),在6个benchmark上平均超出开源Agent 14.5个百分点。

Semantic Parallelism: Redefining Efficient MoE Inference via Model-Data Co-Scheduling

提出语义并行(Semantic Parallelism)范式,通过预测token-expert路由路径并协同调度模型放置与数据分发,大幅削减MoE推理中专家并行的all-to-all通信开销,在Attention-DP场景下吞吐提升最高2.78×,Attention-TP场景下延迟降低最高24.9%。

When Does Divide and Conquer Work for Long Context LLM? A Noise Decomposition Framework

提出理论框架将长上下文任务失败分解为三类噪声(任务噪声/模型噪声/聚合器噪声),证明当模型噪声超线性增长时弱模型+分块处理可超越强模型单次处理,并给出快速估计最优 chunk size 的方法(3-5 个样本即可)。

Fast Catch-Up, Late Switching: Optimal Batch Size Scheduling via Functional Scaling Laws

通过 Functional Scaling Law 框架理论推导出 batch size scheduling 的最优策略——对困难任务,最优策略是训练大部分时间用小 batch,仅在最后阶段切换到大 batch(late switching);并揭示了 fast catch-up 效应——切换后 loss 迅速追上全程大 batch 的轨迹,在 1.1B 参数 1T token 的 LLM 预训练中验证了该原则。

LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding

提出 LycheeDecode,通过将注意力头细粒度分为少量 retrieval heads(负责全注意力选关键 token)和大量 sparse heads(复用选出的 token 做稀疏计算),并用 HardKuma 分布端到端学习头类型,在 128K 上下文下实现 2.7× 加速且性能不降。

Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models

系统解剖基于 chunk 的稀疏注意力架构,识别出三个关键设计原则(非线性 Chunk Encoder + CLS token、Bypassing Residual Path、训练时强制选择稀疏性),将 4K 上下文训练的模型成功外推到 3200 万 token。

Deep Hierarchical Learning with Nested Subspace Networks for Large Language Models

提出嵌套子空间网络(NSN),通过低秩分解使线性层形成严格嵌套的子空间层次,配合不确定性感知多秩训练,使单个模型在测试时可即时调节计算量与性能的权衡(50% FLOPs 减少仅损失 5% 精度),且可后验应用于预训练 LLM。

SwingArena: Adversarial Programming Arena for Long-context GitHub Issue Solving

提出SwingArena对抗性评测框架,让两个LLM在真实GitHub issue上交替扮演补丁提交者和测试审查者,通过仓库原生CI流水线(编译/lint/回归测试)端到端验证,在C++/Python/Rust/Go四语言400个实例上揭示了模型在"激进补丁生成"与"防御性质量保证"间的行为分化。

Group Representational Position Encoding (GRAPE)

提出 GRAPE 框架,基于群作用(group actions)统一了 Transformer 中乘法型(RoPE)和加法型(ALiBi/FoX)两大位置编码家族,证明 RoPE 和 ALiBi 是其精确特例,并提出路径积分加法变体 GRAPE-AP 在下游任务上超越现有方法。

Randomization Boosts KV Caching, Learning Balances Query Load: A Joint Perspective

提出首个KV缓存感知负载均衡统一数学模型,设计随机化叶节点淘汰算法RLT(O(log n)竞争比)和基于学习的贪心路由LBGR,在多LLM服务场景下将延迟降低最高11.96×、TTFT降低14.06×。

查看全部169篇「LLM 效率」论文 →


📚 预训练 (79)

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook

提出SemHiTok——通过语义引导层次codebook(SGHC)统一理解和生成的tokenizer:预训练语义codebook上建像素子codebook,结构和训练解耦(分阶段优化)避免联合训练的语义-像素冲突,LLaVA设定下离散tokenizer中理解和重建都SOTA。

Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training

构建 Common Corpus——约 2 万亿 token 的最大规模合法授权 LLM 预训练数据集,覆盖 6 大集合(政府/文化/科学/代码/Web/语义),多语言(含低资源语言),所有数据均为无版权或宽松许可来源,配有完整数据溯源和多阶段过滤管道,已被 Anthropic 等行业领导者采用。

Emergent Misalignment is Easy, Narrow Misalignment is Hard

研究发现在窄域有害数据上微调会造成广域错位(emergent misalignment),因为"通用错位"比"仅在特定域错位"是更简单高效的参数空间解——通用解的参数范数更小且对噪声更稳定。

Steering Language Models with Weight Arithmetic

提出对比式权重引导(Contrastive Weight Steering),通过对正/负行为微调模型的权重差来提取行为方向向量,直接修改模型权重实现行为控制,在谄媚性、恶意性和拒绝性实验中比激活引导(Activation Steering)具有更好的泛化能力和一致性。

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

提出 Warmup-Stable-Only (WSO) 学习率调度策略——在预训练中完全去掉学习率衰减阶段,虽然预训练指标较差,但在 SFT 后一致性地超越所有衰减策略,通过损失景观分析揭示 WSO 保持更平坦的极小值区域是其优势根源。

Scaling with Collapse: Efficient and Predictable Training of LLM Families

证明 LLM 家族的训练损失曲线在优化超参数与数据预算匹配时会“崩塞”到同一条通用曲线上,并利用这一现象实现两个实用应用:(1) 偏离崩塞作为训练病理的早期诊断信号,(2) 崩塞曲线的可预测性实现大规模超参调优的早停。

Identifying and Evaluating Inactive Heads in Pretrained LLMs

系统评估12种评分函数识别LLM中不活跃注意力头,发现基于头输出范数的评分函数(AHON LN)比传统注意力权重指标更能跨模型家族一致地识别不活跃头,14个模型上平均超过12%的头可被置零而保持MMLU精度在1%以内。

Explaining Grokking and Information Bottleneck through Neural Collapse Emergence

通过 Neural Collapse 的视角统一解释 Grokking(延迟泛化)和 Information Bottleneck(压缩阶段)两大训练后期现象,证明群体类内方差的收缩是两者的共同关键因素,并揭示训练损失收敛与 Neural Collapse 发生存在由 weight decay 控制的不同时间尺度。

Deconstructing Positional Information: From Attention Logits to Training Biases

提出基于 Toeplitz 矩阵的统一分析框架,将位置编码分为加法(Absolute/T5/ALiBi)和乘法(RoPE)两类;通过合成任务发现 RoPE 在位置敏感任务上优势显著但存在"单头沉积模式"(single-head deposit pattern)——浅层几乎所有位置推理集中于单个注意力头;理论证明该模式是 RoPE 乘法结构的固有属性。

CHAMMI-75: Pre-training multi-channel models with heterogeneous microscopy images

构建 CHAMMI-75——最大的异构多通道显微镜图像预训练数据集(280 万图像,75 个来源,25 种通道类型,16 种物种),证明成像模态多样性是提升多通道模型泛化能力的关键因素,训练的 MorphEm 模型在 7 个 benchmark 中 6 个达到 SOTA。

查看全部79篇「预训练」论文 →


✏️ 知识编辑 (15)

Fine-tuning Done Right in Model Editing

揭示模型编辑中 fine-tuning 被低估的根因是错误的训练 pipeline(深度优先逐样本优化),修正为标准的广度优先 mini-batch 训练后,配合局部化参数调优形成 LocFT-BF,首次支持 10 万次连续编辑和 72B 模型规模。

When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations

提出 EVOKE 基准测试,系统评估大型多模态模型 (LMM) 对演化知识的注入能力,揭示两大挑战(现有方法表现差、微调导致灾难性遗忘),并提出知识增强和持续学习两条应对路径。

Bilinear Representation Mitigates Reversal Curse and Enables Consistent Model Editing

通过在合成关系知识图谱上从头训练 Transformer,发现适当正则化会使模型隐层涌现出双线性关系结构(bilinear relational structure),该结构不仅能克服逆向诅咒(reversal curse),还能实现编辑单个事实后逻辑一致地传播到相关事实。

Energy-Regularized Sequential Model Editing on Hyperspheres

从超球面均匀性(Hyperspherical Energy)视角理解序列模型编辑中的性能退化,提出 SPHERE 方法:通过将编辑扰动投影到预训练权重主超球方向的正交补空间,实现稳定的大规模序列编辑,在 LLaMA3-8B 上平均超越最强基线 16.41%。

GOT-Edit: Geometry-Aware Generic Object Tracking via Online Model Editing

通过零空间约束的在线模型编辑,将 VGGT 提供的 3D 几何信息融入 2D 通用目标跟踪器中,在保持语义判别力的同时增强几何感知能力,在遮挡和背景杂乱场景中显著提升跟踪性能。

EAMET: Robust Massive Model Editing via Embedding Alignment Optimization

揭示大规模模型编辑失败的根本原因是 key embedding 与 residual embedding 之间的结构不一致(embedding misalignment),提出 EAMET 通过渐进式保存已优化的残差 embedding 并用 KL 散度 + MSE 双损失将其邻域结构对齐到 key embedding 空间,在 6 个 LLM、3 个数据集上同时编辑 10k 事实时平均超越 MEMIT 14%(CounterFact)和 8%(ZsRE),且在长前缀和同主语多事实两大鲁棒性场景下表现稳健。

PICS: Pairwise Image Compositing with Spatial Interactions

提出 PICS——一种并行成对图像合成方法,通过 Interaction Transformer 中的掩码引导 MoE 和自适应 α-blending 策略,在单次推理中同时合成两个对象并显式建模遮挡、接触等空间交互关系,全面超越现有序列合成方法。

ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual Recall

ACE 通过神经元级归因发现「隐式主语在多跳推理里扮演 query 神经元、逐层激活 value 神经元」这一被忽视的机制,并据此把编辑从「层级启发式」精细到「query-value 通路」,在多跳事实召回上比 SOTA 的 PMET 在 GPT-J 上高 9.44%、在 Qwen3-8B 上高 37.46%。

Disentangling Knowledge Representations for Large Language Model Editing

针对知识编辑会误伤"同主体但不同关系/客体"的细粒度无关知识这一被忽视的问题,本文提出 DiKE:先用一个可复用的解耦模块把主体表示拆成"与目标知识相关"和"无关"两部分,再只对相关部分做编辑、显式约束无关部分不变,并推导出一个闭式的秩一参数更新公式,在保住细粒度无关知识的同时维持了主流编辑性能。

KnowledgeSmith: Uncovering Knowledge Updating in LLMs with Model Editing and Unlearning

本文提出 KnowledgeSmith,把"知识编辑"和"机器遗忘"统一为同一个约束优化问题,并用知识图谱自动生成跨层级(根/中间/叶)、跨数据规模的大规模评测基准,系统揭示了 LLM 知识更新中的传播不对称、一致性-容量权衡、学科依赖等一系列反直觉现象。

查看全部15篇「知识编辑」论文 →


💬 LLM 其他 (55)

DreamOn: Diffusion Language Models For Code Infilling Beyond Fixed-size Canvas

DreamOn 通过引入 [expand] 和 [delete] 两个特殊状态解决了扩散语言模型(DLM)的固定长度生成限制,无需架构修改即可实现变长代码填充,在 HumanEval-Infilling 上比扩散基线平均提升 26.4%,达到与 SOTA 自回归模型持平的水平。

d²Cache: Accelerating Diffusion-Based LLMs via Dual Adaptive Caching

提出 d²Cache,一种面向 Diffusion-based LLM(dLLM)的无训练近似 KV 缓存框架,通过确定性先验引导的 masked token 选择 + 注意力感知的非 mask token 选择两阶段策略,实现 4.1× 推理加速同时提升生成质量。

Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards

提出 Optimas 框架,为复合 AI 系统中每个组件维护一个与全局奖励对齐的局部奖励函数(LRF),使异构组件(prompt、模型参数、超参数、模型选择)可独立优化,在五个真实系统上平均提升 11.92%。

BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning

提出 BOTS——一个基于贝叶斯推断的在线任务选择统一框架,在 LLM 强化微调中通过融合显式证据(直接评估的历史通过率)和隐式证据(利用参考模型插值推断的未评估任务难度),配合 Thompson 采样实现探索-利用平衡,在数学/代码/逻辑任务上以仅 0.2% 的额外开销带来最高 50% 的训练加速。

Is the Reversal Curse a Binding Problem? Uncovering Limitations of Transformers from a Basic Generalization Failure

提出反转诅咒(Reversal Curse)是认知科学中"绑定问题"在Transformer中的表现——源于概念表示的不一致性和纠缠性,并首次设计出基于JEPA和记忆层的架构真正突破反转诅咒(非绕过)。

ConflictScope: Generative Value Conflicts Reveal LLM Priorities

提出ConflictScope——自动化价值冲突场景生成与评估流水线:给定任意价值集合,自动生成价值对之间的冲突场景,通过模拟用户的开放式交互(而非选择题)评估LLM的价值优先级排序;发现模型在开放式评估中从"保护性价值"(如无害性)显著转向"个人价值"(如用户自主性),系统提示可使对齐目标排序提升14%。

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

构建 WebDevJudge 元评估基准,系统评估 LLM/MLLM 及智能体工作流在 Web 开发质量评估任务上作为裁判的能力,发现当前最强模型与人类专家之间仍存在约15%的一致率差距,并揭示了功能等价识别失败和可行性验证薄弱两大根本瓶颈。

LLEMA: Evolutionary Search with LLMs for Multi-Objective Materials Discovery

提出 LLEMA 框架,将 LLM 的科学知识与化学规则引导的进化搜索和记忆驱动的迭代优化相结合,在 14 个多目标材料发现任务上实现了更高的命中率、稳定性和 Pareto 前沿质量。

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

提出基于上下文感知的成对比较框架来评估文本创造力,构建了包含 100K+ 人类级别和 1M+ 合成数据的 CreataSet 数据集,训练出 CrEval 评估器,在与人类判断的对齐度上超越 GPT-4o 达 18.7%。

How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use

系统分析了 LLM 在扑克中的三大推理缺陷(启发式推理、事实误解、知行差距),提出 ToolPoker 框架——首个面向不完全信息博弈的工具集成 LLM 推理系统,通过外部 CFR solver 提供博弈论最优的行动指导,使 7B 模型在 Limit Hold'em 中逼近 Nash 均衡。

查看全部55篇「LLM 其他」论文 →


📖 NLP 理解 (2)

What's the Plan? Metrics for Implicit Planning in LLMs and Their Application to Rhyme Generation and Question Answering

提出 mean activation difference steering 方法和配套定量指标,在韵律诗生成和问答两个案例上跨 23 个开放模型(1B-32B)系统性证明:目标 token(韵脚/答案)的表示在序列早期位置已形成(前向规划),且因果性地影响中间 token 生成(后向规划)——隐式规划从 1B 模型即出现,是普遍机制而非大模型专属。

LANE: Label-Aware Noise Elimination for Fine-Grained Text Classification

LANE 把"识别错标样本"的经典 margin 指标升级为标签感知边距 (Label-aware Margin)——同样是负边距,若被错标的类别与模型预测类别语义相近(如把"愤怒"标成"恐惧")就少惩罚,语义相远(把"信任"标成"恐惧")才重罚,并据此对每个样本动态加权而非硬删除,在 10 个文本分类数据集上稳定超过 AUM/HMW 等强基线。


✍️ 文本生成 (12)

Rethinking Uncertainty Estimation in LLMs: A Principled Single-Sequence Measure

从 proper scoring rules 框架出发,证明最高概率输出序列的负对数似然(MSP)是理论上合理的不确定性度量,并提出 G-NLL——仅用一次贪心解码就能逼近该度量,在多个场景下匹配或超越需要多次采样的 SOTA 方法。

FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Model

提出 FS-DFM(Few-Step Discrete Flow-Matching),通过步数感知训练和累积标量更新规则,将离散 flow-matching 语言模型的采样步数从 1024 步降低到 8 步,实现 128 倍加速,同时保持相当的困惑度和生成质量。

Antislop: A Comprehensive Framework for Identifying and Eliminating Repetitive Patterns in Language Models

Antislop 把"LLM 生成里那些一眼能认出是 AI 的重复套话(slop)"当成可量化、可定位、可消除的对象:先用频率比统计画出模型专属的"slop 指纹",再用一个推理期的回溯采样器精准压制这些模式,最后把采样器的拦截记录自动转成偏好数据,用新提出的 FTPO 微调把抑制能力永久焊进权重——在 GSM8K/MMLU/创意写作上几乎不掉点的前提下做到 90% 的 slop 削减。

Causal-Steer: Disentangled Continuous Style Control without Parallel Corpora

本文提出 Causal-Steer:把 LoRA 当成一次"因果干预",在同一条输入上对比加/不加 LoRA 扰动的激活差,从而摆脱平行语料、抽出一条干净的风格向量,再经 PCA 去噪 + 几何中位数鲁棒聚合,最终在推理时用一个标量 \(\alpha\) 实现连续、双向、可线性插值的 LLM 风格控制。

Diverse Text Decoding via Iterative Reweighting

本文提出 OverRIDE(Reweighting-based Iterative DEcoding),在多轮采样时用历史生成结果在推理阶段增量微调一个"引导模型",再用它去压低会导致历史模式重现的 token 概率,从而在几乎不损失质量的前提下显著提升多个回答之间的多样性,并能以 6.4%(72B)的吞吐损失嵌入 vLLM 这类服务系统。

Improving Attributed Long-form Question Answering with Intent Awareness

针对深度研究系统生成的长文报告"引用质量差、可读性低"的问题,本文提出一套基于标签的双层意图(段落意图 + 引用意图)写作框架,既能在推理时通过 prompt 直接提升大模型,又能用带意图的合成数据蒸馏小模型——在三个科学报告生成基准上,大模型平均涨 +2.9 分、小模型涨 +12.3 分,引用指标提升尤为显著。

Logit-KL Flow Matching:用采样-混合推理做非自回归文本生成

本文用"logit 空间的线性插值"(等价于 simplex 上的 KL 测地线)作为离散流匹配的路径,证明了最大化条件似然恰好恢复出流匹配的速度场,并配上一套"去噪-再加噪"的迭代采样器和混合推理方案,在非自回归文本/代码生成上显著刷低困惑度、刷高 BLEU。

p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

本文提出 p-less 采样:一种完全没有超参数的截断式解码方法,每一步用整个 token 分布的"碰撞概率" \(\sum_v P_\theta(v)^2\) 当作动态截断阈值,在数学、逻辑推理和创意写作上都优于 top-p / min-p 等方法,并且在高温下几乎不退化、推理还更快。

Planner Aware Path Learning in Diffusion Language Models Training

这篇论文指出掩码扩散语言模型训练时默认的“随机解掩码路径”和推理时实际使用的 planner 路径不一致,并提出 Planner-Aware Path Learning(PAPL),用 planner 置信度重加权 masked diffusion loss,让训练更贴近推理路径,在蛋白序列、文本生成和代码生成上稳定提升质量。

Rainbow Padding: Mitigating Early Termination in Instruction-Tuned Diffusion LLMs

本文发现 instruction-tuned 扩散语言模型存在「<eos> overflow」早停顽疾——分配的生成长度越长、回答反而越短甚至塌缩成一串 <eos>;根因是 <eos> 同时被当作终止符和填充符,于是作者提出 Rainbow Padding:只保留一个 <eos> 标记真正结束、其余填充位用 K 个不同 padding token 循环铺满,仅靠 7 个 token + 单 epoch LoRA 就能恢复长度鲁棒性,把 LLaDA 在 MATH 上的准确率从 0.6% 拉到 32.6%。

查看全部12篇「文本生成」论文 →


🗣️ 对话系统 (10)

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

FlyThinker 提出了一种高效的 "think-while-generating" 框架,使用独立的推理模型(Reasoner)在 token 级别并行生成潜在推理信号,动态融入生成模型(Generator)以指导个性化长文本生成,同时保持训练和推理效率。

Non-Collaborative User Simulators for Tool Agents

基于marketing研究定义四类非协作用户行为(不可用服务/跑题闲聊/不耐烦/不完整表述),构建了可保持goal-alignment的模拟框架,在MultiWOZ和τ-bench上系统暴露了SOTA工具Agent的行为特异性失败机制——跑题闲聊导致平均SR下降29.1%,且不同模型呈现截然不同的崩溃路径(GPT系列陷入helper API重复调用,Qwen系列倾向于幻觉编造API结果)。

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

通过对比有/无视觉输入的逐层隐藏表征(chain-of-embedding),发现LVLM中存在一个"视觉整合点"(VIP)层,并据此提出Total Visual Integration (TVI)指标来量化语言先验的强度。

AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions

提出 AQuA,首个按模糊度细粒度分级(4 级)的视觉问答数据集(7.2K 样本),为每级定义最优回应策略(直接回答/推断/列举/请求澄清),发现 GPT-5 和 Gemini 在模糊 VQA 上都过度自信地直接回答,通过 SFT+GRPO 训练的 3B 模型反而能超越闭源大模型的策略适应能力。

ReIn: Conversational Error Recovery with Reasoning Inception

提出 Reasoning Inception(ReIn),一种无需修改模型参数或系统提示的测试时干预方法,通过外部 inception 模块检测对话错误并将恢复计划注入任务 agent 的推理链中,在多种错误场景下显著提升对话任务完成率,且可泛化至未见错误类型。

ClarifyVC: Clarifying Ambiguous Commands in Vehicle Control with a Hybrid Data Augmentation Pipeline

ClarifyVC 用一个 Agent 编排的四阶段数据增强流水线,从 2 万条真实车载指令里"种"出大量歧义丰富、协议合规的单轮/多轮对话,配上三层评测协议与数据质量分 DQS,在这套数据上微调后让车载语音指令的解析准确率提升约 15%、歧义消解提升约 20%、协议合规度达 98%。

Codified Finite-state Machines for Role-playing

针对 LLM 角色扮演时只会模仿表层动作、记不住人物"内在状态"的问题,本文让 LLM 把人物档案自动编译成可执行的有限状态机(CFSM),用代码显式记录角色状态及其转移规则,并进一步扩展成用概率分布建模状态的 CPFSM;在合成验证和 Fandom 真实剧情基准上都比纯 prompt 的状态建模基线更连贯、更可解释。

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

DRIFT 把真实部署里大量但隐式的"用户不满"(DSAT)当作高质量负样本锚点,正样本则从当前策略动态采样,用标准 DPO 迭代训练,无需人工标注/奖励模型/更强模型生成的正例,就让 14B 模型在 WildBench 上超过 GPT-4o-mini。

Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

本文提出一个计算极快的稳健性检验:在 Chatbot Arena 这类基于 Bradley–Terry 模型的 LLM 排行榜上,只要丢掉最坏情况下极小一撮(最少 0.003%、两条)人类偏好评测,就能让排名第一的模型换人——并且方法还能精确指出是哪几条偏好导致了翻盘。

Flipping the Dialogue: Training and Evaluating User Language Models

把对话"翻转"过来——不再训练 LLM 当好助手,而是专门后训练一个用户语言模型(User LM)去模拟真实人类用户,用它在多轮对话里逼出助手 LM 在真实场景下的短板(GPT-4o 任务成功率从 74.6% 掉到 57.4%)。


🌐 多语言/翻译 (8)

Multilingual Routing in Mixture-of-Experts

系统分析了MoE大语言模型中多语言路由模式,发现中间层存在跨语言共享专家且语言性能与英语路由对齐度强相关,进而提出推理时路由干预方法,通过在中间层激活英语任务专家,在3个模型×2个任务×15+语言上一致性地提升多语言性能1-2%。

ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality

提出 Adaptive Transfer Scaling Law (ATLAS),通过将有效数据量分解为目标语言、迁移语言和其他语言三项并引入数据重复饱和函数,在774个多语言训练实验(10M–8B参数、400+语言)上显著优于现有scaling law(多语言 \(R^2\) 从0.67提升至0.98),并系统量化了跨语言迁移矩阵、多语言诅咒的容量约束以及预训练vs微调的计算交叉点。

ASSESS: A Semantic and Structural Evaluation Framework for Statement Similarity

提出 ASSESS 框架,其核心是 TransTED Similarity 指标——通过将形式化数学命题解析为算子树 (Operator Tree),并在标准树编辑距离 (TED) 基础上融入 Lean 证明策略驱动的语义变换,实现了在 EPLA 基准上 70.16% 准确率和 0.35 Kappa 分数的 SOTA 性能,同时仅需 CPU 资源即可复现。

From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization

提出ALPO(自适应局部偏好优化)用于训练表达力强的字幕翻译LLM:通过实证发现字幕翻译偏好意译且推理型LLM意译能力优于对话型LLM -> 验证LLM作为翻译评估器与人类高度一致 -> 提出逐句段的细粒度过程监督偏好对齐方法(自适应权重+动态beta+前缀混合) -> 14B模型在多方向字幕翻译的鲜活度上超越GPT-4o/DeepSeek-R1等SOTA。

DiscoX: Benchmarking Discourse-Level Translation in Expert Domains

DiscoX 构建了首个面向篇章级 + 专家级中英互译的评测基准(200 篇、平均 1712 token、7 大领域、1330 人时人工打磨),并配套提出多智能体无参考评测系统 Metric-S,揭示出即便最强 LLM(GPT-5-high 76.66)仍落后人类专家(80.16)的真实差距。

Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation

本文提出 Language Confusion Gate (LCG):一个不改动基座 LLM、只在解码时按需屏蔽错误语言族 token 的轻量两层 MLP,用「范数校准的自蒸馏」训练,把多模型的语言混淆率压低约一个数量级且不损任务性能。

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

通过 logit lens 与隐状态相似度分析定位出 mLLM 中「负责语言控制」的最后几层,只微调这 3–5% 的参数就能把六种语言的语言一致性从 <20% 拉到 98%+,效果几乎等同全量微调。

SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs

利用稀疏自编码器(SAE)发现 LLM 中意外语言切换与目标语言特征异常高预激活值相关,提出 SASFT 方法在 SFT 训练中约束语言特征预激活值,将意外代码切换降低 50% 以上。


🔍 信息检索/RAG (81)

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

提出AMemGym——首个支持on-policy交互式评估的长程对话记忆基准环境,通过结构化数据采样(用户画像→状态演化→个性化问答)驱动LLM模拟用户进行角色扮演,揭示了off-policy评估的排名偏差问题,并系统诊断了RAG/长上下文/Agent记忆系统的write/read/utilization三阶段失败模式。

Query-Level Uncertainty in Large Language Models

提出Query-Level Uncertainty概念,通过Internal Confidence方法在生成前(单次前向传播)估计LLM能否回答给定查询,无需训练即可实现高效的自适应推理(RAG触发/模型级联/弃权)。

G-reasoner: Foundation Models for Unified Reasoning over Graph-structured Knowledge

提出 G-reasoner,通过 QuadGraph 四层统一图接口将异构知识源标准化,训练 34M 参数的 GNN 图基础模型联合推理图拓扑和文本语义,配合 LLM 在 6 个基准上全面超越 SOTA GraphRAG 方法。

Summaries as Centroids for Interpretable and Scalable Text Clustering

提出 k-NLPmeans 和 k-LLMmeans,通过在 k-means 迭代中周期性地用文本摘要替换数值质心(summary-as-centroid),在保持 k-means 标准目标的同时实现可解释的聚类原型,且 LLM 调用量与数据集大小无关。

Attributing Response to Context: A Jensen-Shannon Divergence Driven Mechanistic Study of Context Attribution in Retrieval-Augmented Generation

提出ARC-JSD方法,通过计算完整上下文与逐句消融上下文下的响应分布的Jensen-Shannon散度,在无需微调、梯度计算或代理模型的情况下实现高效精准的RAG上下文归因,并结合Logit Lens进行机制分析,定位负责上下文归因的注意力头和MLP层,通过门控操作降低约39%的幻觉率。

HUME: Measuring the Human-Model Performance Gap in Text Embedding Tasks

提出 HUME 人类评估框架,在 MTEB 的 16 个数据集(重排序/分类/聚类/STS)上系统测量人类表现,发现人类总体排名第 4(77.6 vs 模型最佳 80.1),揭示模型"超人"表现多出现在人类一致性最低的任务上,并评估 9 个 LLM 作为标注代理的可行性。

Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation

将位置编码重新表述为贝叶斯注意力机制中的先验分布,统一了 NoPE(均匀先验)和 ALiBi(拉普拉斯先验),并提出广义高斯先验(GGD-BAM),仅增加 384 个参数即可在 500 倍训练长度上实现完美的 passkey 检索。

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

构建结构完全相同但实体分别映射到真实/合成名称的平行语料库,通过对比两个"平行世界"上的任务表现来量化 LLM 的参数化知识优势差距(Knowledge Advantage Gap),发现即使有 RAG 和 CoT 增强,该差距依然持续存在。

RAEE: A Robust Retrieval-Augmented Early Exit Framework for Efficient Inference

提出 RAEE,一种无需训练分类器的检索增强早退框架,通过检索语义相似样本的退出信息来动态确定最优退出层,不仅加速推理还能纠正模型错误预测,实现加速与性能提升的双赢。

TokMem: One-Token Procedural Memory for Large Language Models

提出 TokMem,将可复用的任务程序编译为单个可训练记忆 token,既作为程序索引又作为生成控制信号,无需长 prompt 即可高效调用 1000+ 任务程序,且支持无遗忘的持续扩展。

查看全部81篇「信息检索/RAG」论文 →


💻 代码智能 (58)

Learning to Reason without External Rewards

提出 Intuitor,一种用模型自身置信度(self-certainty,即输出分布与均匀分布的 KL 散度)替代外部可验证奖励的 RLIF 方法,在数学推理上匹配 GRPO 性能,同时在代码生成等域外任务上展现更好的泛化能力。

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

提出 ReasoningBank 记忆框架,从 Agent 自我判断的成功和失败经验中蒸馏可泛化的推理策略存入记忆库,并提出 memory-aware test-time scaling (MaTTS) 建立记忆与测试时扩展的协同效应,在 WebArena、Mind2Web 和 SWE-Bench 上一致超越基线(最高 34.2% 相对提升),同时减少 16% 交互步数。

Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning

提出 PaperCoder——一个多智能体 LLM 框架,通过规划(Planning)、分析(Analysis)、生成(Coding)三阶段流水线,将机器学习论文自动转化为可运行的代码仓库,其中 88% 的生成仓库被论文作者评为最佳,且在 PaperBench 基准上大幅超越基线。

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

构建 Ambig-SWE(基于 SWE-Bench Verified 的欠指定变体),系统评估 LLM 编程 agent 在三个维度上的交互能力——检测欠指定、提出澄清问题、利用交互信息——发现交互可将欠指定场景下的解决率提升最高 74%,但模型默认非交互行为且难以区分指定充分/不足的指令。

Improving Code Localization with Repository Memory

通过利用代码仓库的 commit 历史构建情景记忆(过去 commit)和语义记忆(活跃代码功能摘要),增强语言代理的代码定位能力,在 SWE-bench 上取得显著提升。

KV Cache Transform Coding for Compact Storage in LLM Inference

提出 KVTC,一种借鉴经典媒体压缩技术(PCA 特征去相关 + 自适应量化 + 熵编码)的 KV 缓存压缩方法,在 Llama 3、Mistral NeMo、R1-Qwen 2.5 等模型上实现最高 20× 压缩(特定场景下 40×+),优于 token 驱逐、量化、SVD 等基线方法。

ShieldedCode: Learning Robust Representations for Virtual Machine Protected Code

提出 ShieldedCode——首个保护感知的代码表征学习框架,通过层次依赖建模(指令内/前序/跨指令三层)和联合功能感知+保护感知对比学习,使 LLM 能够生成、比较和推理虚拟机保护代码,在 VM 代码生成(Pass@1 26.95% vs. GPT-4o 22.58%)和二进制相似性检测上均超越现有方法。

InnoGym: Benchmarking the Innovation Potential of AI Agents

提出 InnoGym,第一个系统评估 AI Agent 创新能力的基准和框架,引入 Performance Gain 和 Novelty 两个互补指标,通过 18 个可改进任务发现当前 Agent 具备一定创新性但缺乏将创新转化为可靠性能提升的鲁棒性。

A Problem-Oriented Perspective and Anchor Verification for Code Optimization

提出以问题为导向(而非用户为导向)的优化对构建方法来整合多程序员的策略多样性,并设计锚点验证框架利用"慢但正确的代码"生成测试用例来缓解"优化税"(正确性损失),将优化比从 31.24% 提升到 71.06%,加速比从 2.95x 提升到 6.08x。

Sharing State Between Prompts and Programs

提出共享程序状态(shared program state)抽象,让 prompt 直接读写程序变量、操作堆对象和控制程序流程,实现为 Nightjar 系统(Python + prompt 混合编程),在保持或提升准确率(+4-19%)的同时减少 39.6% 代码量。

查看全部58篇「代码智能」论文 →


🎨 图像生成 (352)

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

提出 DiffusionNFT,一种全新的扩散模型在线 RL 范式:不在反向采样过程上做策略优化(如 GRPO),而是在前向过程上通过 flow matching 目标对正样本和负样本做对比式训练,定义隐式的策略改进方向,比 FlowGRPO 快 3-25×,且无需 CFG。

Latent Diffusion Model without Variational Autoencoder

提出 SVG,用冻结的 DINOv3 自监督特征替代 VAE 潜在空间构建扩散模型,通过轻量残差编码器补充细粒度细节,实现更快训练、更高效推理和跨任务通用的视觉表征。

Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency

提出 rCM(score-regularized continuous-time consistency model),首次将连续时间一致性蒸馏扩展到 14B 参数的文生图/视频模型,通过结合前向散度(一致性)和反向散度(score蒸馏),在保持多样性的同时匹配 DMD2 的质量,实现 15-50× 加速。

EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling

提出首个系统性的"基准评测→奖励模型→强化学习训练"图像编辑 RL 管线:构建 EditReward-Bench 基准,训练 EditScore 系列奖励模型(7B-72B,超过 GPT-5),并成功将其用于 Online RL 训练显著提升编辑模型性能。

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

构建了一个包含 200K 人工标注偏好对的高质量数据集 EditReward-Data,训练出 EditReward 奖励模型,在多个图像编辑评估基准上达到 SOTA 的人类对齐度,并验证其作为数据筛选器可显著提升下游编辑模型性能。

Stochastic Self-Guidance for Training-Free Enhancement of Diffusion Models

本文提出S²-Guidance,通过在去噪过程中随机丢弃transformer block激活子网络作为弱模型进行自引导,无需额外训练即可修正CFG的次优预测,在文生图和文生视频任务上一致超越CFG及其他高级引导策略。

Does FLUX Already Know How to Perform Physically Plausible Image Composition?

提出 SHINE,一个无需训练的图像合成框架,通过 Manifold-Steered Anchor Loss、Degradation-Suppression Guidance 和 Adaptive Background Blending 三个组件,利用预训练 T2I 模型(如 FLUX)内在的物理先验,实现在复杂光照条件下(阴影、水面反射等)的高质量物体插入。

Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?

提出 T2I-CoReBench,首个同时系统评估 T2I 模型组合能力(Composition)和推理能力(Reasoning)的综合性基准,涵盖 12 个评估维度、1080 条高难度 prompt 和约 13500 个 checklist 问题,通过对 38 个模型的大规模评测揭示:推理能力远远落后于组合能力,是当前 T2I 生成的核心瓶颈。

SPEED: Scalable, Precise, and Efficient Concept Erasure for Diffusion Models

SPEED 提出基于零空间(null space)约束的闭式模型编辑方法,通过影响力先验过滤(IPF)、定向先验增强(DPA)和不变等式约束(IEC)三种互补技术精化保留集,实现可扩展(5 秒内擦除 100 个概念)、精确(非目标概念语义零损失)且高效的概念擦除。

DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing

首个将 FLUX (DiT) 的强生成先验引入拖拽编辑的框架,通过区域级仿射监督替代传统点级监督,配合梯度掩码硬约束和 adapter 增强反演,大幅提升拖拽编辑质量。

查看全部352篇「图像生成」论文 →


🎬 视频生成 (97)

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

提出 JavisDiT,基于 DiT 架构的音视频联合生成模型,通过层级化时空同步先验估计器(HiST-Sypo)实现细粒度的音视频时空对齐;同时构建了新基准 JavisBench(10K 复杂场景样本)和新评估指标 JavisScore。

MotionStream: Real-Time Video Generation with Interactive Motion Controls

提出MotionStream——首个运动控制的实时流式视频生成系统:先训练轻量track head的双向运动控制teacher,再通过Self Forcing + DMD蒸馏为因果student,引入注意力沉降(attention sink)+滚动KV缓存(rolling KV cache)实现训练-推理分布完全匹配,单H100 GPU上480P达17FPS/29FPS(+Tiny VAE),支持无限长度恒速生成。

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

提出RoboMaster框架,通过协作轨迹(collaborative trajectory)将机器人-物体交互过程分解为前交互、交互中、后交互三阶段,结合外观和形状感知的物体嵌入,实现高质量的机器人操作视频生成。

Geometry-aware 4D Video Generation for Robot Manipulation

本文提出几何感知的4D视频生成框架,通过跨视角点图对齐监督训练视频扩散模型,联合预测RGB和点图实现时空一致的多视角RGB-D视频,无需相机位姿输入即可在新视角下生成一致视频并用现成6DoF位姿追踪器恢复机器人末端轨迹。

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave 用多模态大语言模型(MLLM)替代传统的浅层融合机制来解析多主体复杂文本指令,生成主体感知的隐状态作为 DiT 的条件信号,结合 CLIP 语义特征和 VAE 细粒度外观特征,实现高保真、主体一致的视频生成。

Lumos-1: On Autoregressive Video Generation with Discrete Diffusion from a Unified Model Perspective

提出 Lumos-1,一个基于 LLM 架构的统一视频生成模型:通过 MM-RoPE(分布式多模态 RoPE)解决视觉时空编码问题,通过 AR-DF(自回归离散扩散强迫)解决帧间损失不均衡问题,仅用 48 GPU 训练即可在 GenEval、VBench-I2V 和 VBench-T2V 上达到竞争力水平。

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

提出 JavisDiT++,一个面向联合音视频生成(JAVG)的简洁统一框架,通过模态特定 MoE 提升生成质量、时间对齐 RoPE 实现帧级同步、音视频 DPO 对齐人类偏好,基于 Wan2.1-1.3B 仅用约 1M 公开数据即达到 SOTA。

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DrivingGen 提出首个面向自动驾驶视频世界模型的综合性基准,包含跨天气/地域/时间/复杂场景的多样化评估数据集和四维度评估指标体系(分布、质量、时序一致性、轨迹对齐),对 14 个 SOTA 模型的评测揭示了通用模型与驾驶专用模型之间的核心权衡。

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

提出 Dual-IPO 框架,通过在奖励模型和视频生成模型之间进行多轮双向迭代优化,无需大量人工标注即可持续提升文本到视频生成的质量和人类偏好对齐,甚至让 2B 模型超越 5B 模型。

Streaming Autoregressive Video Generation via Diagonal Distillation

提出Diagonal Distillation(DiagDistill),通过对角线去噪策略(前段多步、后段少步)和流分布匹配损失,实现流式自回归视频生成的277.3倍加速,达到31 FPS实时生成。

查看全部97篇「视频生成」论文 →


🧩 多模态 VLM (211)

MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs

提出MMTok——一种基于最大覆盖问题(Maximum Coverage Problem)的多模态视觉token选择框架,同时利用文本-视觉和视觉-视觉覆盖信息来选择最具信息量的视觉token子集,在training-free设置下显著优于单模态baseline,甚至超越需要微调的方法。

KeepLoRA: Continual Learning with Residual Gradient Adaptation

通过分析预训练模型权重的SVD分解,发现通用知识编码在主子空间、领域特定知识编码在残差子空间,提出KeepLoRA方法将新任务的LoRA更新约束在残差子空间中,同时用梯度信息初始化以保持可塑性,在持续学习中达到前向稳定、后向稳定和可塑性的最优平衡。

Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts

针对 MoE 推理时因 token 分配不均导致的 Straggler Effect(最重负载专家决定整体延迟),提出 Capacity-Aware Token Drop(丢弃过载专家的低分 token)和 Expanded Drop(将溢出 token 重路由到本地低负载专家),在 Mixtral-8×7B 上实现 1.85× 加速且性能提升 0.2%。

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

针对图表到代码生成任务中SFT的性能瓶颈问题,提出多模态结构化强化学习(MSRL),通过文本+视觉双层奖励函数和两阶段RL策略,在ChartMimic和ReachQA上分别提升6.2%和9.9%的高层指标,达到开源SOTA并媲美GPT-4o。

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

提出 AttWarp,一种即插即用的测试时图像变形方法,利用 MLLM 自身的跨模态注意力图进行矩形网格重采样,

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

提出 GAR(Grasp Any Region),通过 RoI-aligned feature replay 在保持全局上下文的同时提取高保真局部特征,实现精准的单区域描述、多区域交互建模和复合推理,1B 模型即超越 InternVL3-78B。

Post-hoc Probabilistic Vision-Language Models

提出一种免训练的后验(post-hoc)不确定性估计方法,对 CLIP/SigLIP 等 VLM 最后几层使用 Laplace 近似,解析推导余弦相似度的不确定性,在不确定性量化和主动学习中取得显著优于基线的效果。

Shuffle-R1: Efficient RL Framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

提出 Shuffle-R1 框架,通过 Pairwise Trajectory Sampling(选取高对比度轨迹对)和 Advantage-based Batch Shuffle(按优势值重分配训练批次),解决 RL 训练中的 Advantage Collapsing 和 Rollout Silencing 两大效率瓶颈,在 Geo3K 上比 baseline 提升 22%,MathVerse 上超越 GPT-4o。

Grounding-IQA: Grounding Multimodal Language Models for Image Quality Assessment

将空间定位(referring + grounding)与图像质量评估结合,构建 GIQA-160K 数据集训练多模态 LLM 生成带有边界框的质量描述和空间 VQA,在细粒度质量感知上显著优于通用 MLLM。

Visual Symbolic Mechanisms: Emergent Symbol Processing in Vision Language Models

发现 VLM 内部涌现了一套三阶段符号处理机制(ID retrieval → ID selection → feature retrieval),利用内容无关的空间位置索引(position IDs)来解决视觉绑定问题,并证明绑定错误可直接追溯到这些机制的失败。

查看全部211篇「多模态 VLM」论文 →


🧠 VLM Reasoning (112)

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

基于认知心理学构建OmniSpatial——首个全面空间推理基准,系统覆盖动态推理、复杂空间逻辑、空间交互和透视转换4大维度50个子类别共8.4K人工标注QA对,让o3最强推理模型仅达56.33%而人类达92.63%→揭示复杂空间推理仍是VLM的核心瓶颈。

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

提出SophiaVL-R1——在规则基RL训练MLLM推理时引入整体级思维过程奖励:训练Thinking Reward Model从逻辑一致性/冗余度等五维度评估推理质量→提出Trust-GRPO基于正确/错误答案组的思维奖励对比计算可信度权重\(\gamma\)缓解reward hacking→退火策略\(e^{-\text{steps}/T}\)渐减思维奖励使后期更依赖准确的规则奖励→7B模型在MathVista(71.3%)和MMMU(61.3%)等多个基准全面超越LLaVA-OneVision-72B。

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

提出 MV-RoboBench,首个整合多视角空间推理与机器人操作执行评测的 benchmark,包含 1.7K 人工标注 QA,揭示当前最强 VLM(GPT-5 仅 56.4%)与人类(91.0%)之间存在巨大差距。

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1 是首个采用 GRPO(Group Relative Policy Optimization)强化学习微调 MLLM 的视频真伪检测器,通过构建 14 万无快捷方式的真/假视频对数据集,并设计时序伪影奖励和扩散步数质量奖励两种专用奖励机制,在自建数据集上达到 86.17% 准确率,在 GenVidBench 和 GenVideo 基准上实现 95%+ 的 SOTA 零样本检测性能,同时生成可解释的思维链推理。

Reasoning-Driven Multimodal LLM for Domain Generalization

提出 RD-MLDG——首个将 MLLM 推理链引入域泛化的框架。构建 DomainBed-Reasoning 数据集,系统分析推理监督的两大挑战(优化困难 + 推理模式不匹配),通过 MTCT(多任务交叉训练)与 SARR(自对齐推理正则化)协同解决,在 4 个标准 DG 基准上以 86.89% 的平均准确率大幅超越 GPT-4o(83.46%)和所有 CLIP/ViT 方法。

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

提出 Ref-Adv 基准数据集,通过 硬干扰物配对 + LLM 辅助最小充分表达式生成 + 三人一致性人工验证 的流水线,构建了一个消除"定位捷径"的现代 REC 基准,在该基准上 13 个当代 MLLM(包括 GPT-4o、Gemini 2.5、Qwen2.5-VL-72B 等)的准确率从 RefCOCO(+/g) 上的 90%+ 大幅下降至 50-68%,系统暴露了模型在复杂视觉推理和真实定位能力上的严重不足。

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

提出SpatiaLab,一个包含1400个视觉QA对的真实场景空间推理基准,涵盖6大类30子类空间任务,支持多选和开放式双格式评估,揭示当前最强VLM(InternVL3.5-72B MCQ 54.93%)与人类(87.57%)之间存在巨大空间推理鸿沟,且开放式设置下差距更大。

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

提出 VC-STaR(Visual Contrastive Self-Taught Reasoner),基于"VLM 在对比两张相似图像时看得更准"的观察,设计了一套对比式自改进框架:通过构造对比 VQA 对让模型在对比中生成更忠实的视觉分析,再由 LLM 将对比分析融入推理路径,产出高质量视觉推理数据集 VisCoR-55K,微调后在 MMVP 上提升 5.7%、Hallusion 上提升 3.2%。

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

本文发现多模态大语言模型(MLLM)作为 agent 行为验证器时存在严重的"同意偏差"(agreement bias)——系统性地过度认可 agent 行为,并提出 Self-Grounded Verification(SGV)方法,通过两步生成(先提取行为先验、再条件化验证)缓解该偏差,在 web 导航、桌面操作和机器人操控任务中将失败检测率提升最高 25pp、准确率提升 14pp。

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

提出 DyME(Dynamic Memorize-Explore),通过逐步动态切换 SFT 记忆模式与 GRPO 探索模式,首次赋予小规模视觉语言模型(<1B 参数)在特定任务上的思维推理能力。

查看全部112篇「VLM Reasoning」论文 →


⚡ VLM Efficiency (18)

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

提出 HiDrop 框架,通过对 MLLM 不同层的功能进行深入分析(浅层=传播器、中层=融合中心、深层=语言推理),设计了 Late Injection(跳过浅层)+ Concave Pyramid Pruning(凹金字塔中层剪枝)+ Early Exit(深层退出)三阶段策略,压缩约 90% 视觉 token 且几乎不损失性能,训练加速 1.72×。

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

发现LVLM中KV Cache存在模态特异和注意力头特异的语义冗余,仅靠重要性选择会丢失语义覆盖,提出MixKV按头自适应混合重要性与多样性分数进行KV Cache压缩,在极端压缩下平均提升5.1%。

IVC-Prune: Revealing the Implicit Visual Coordinates in LVLMs for Vision Token Pruning

揭示了LVLM中RoPE位置编码隐式建立的视觉坐标系统(IVC tokens),提出一种训练免的、提示感知的视觉token剪枝策略,在保留IVC tokens和语义前景token的同时,削减约50%视觉token并维持≥99%原始性能。

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

提出PPE(Positional Preservation Embedding),利用RoPE各维度旋转独立性,将合并token内多个原始位置ID分块编码到不同维度段中,实现单个压缩token携带多个空间/时序位置信息。PPE是零参数、即插即用的通用算子,在55%压缩率下图像任务平均仅降3.6%、在90%压缩率下通过级联压缩仍保持可比性能。

Enhancing Visual Token Representations for Video Large Language Models via Training-free Spatial-Temporal Pooling and Gridding

针对视频大语言模型把成千上万视觉 token 压缩进有限上下文时丢失时空信息的问题,提出训练无关的 ST-GridPool:用「金字塔时序网格化」在不同时间尺度上聚合帧 token 注入多粒度运动信息,再用「基于范数的空间池化」依据 token 的 L2 范数加权保留高信息量区域,在 LLaVA-Video / LLaVA-OneVision 上即插即用、不需重训就稳定涨点。

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

iLLaVA 跳出"只在 LLM 阶段压缩 token"的惯性,把 token 合并同时插进图像编码器LLM 两个阶段,并用"信息 token + 回收 token"的合并策略把被丢弃 token 的有用信息收回来,训练-free 实现端到端 2× 吞吐、4× prefilling 加速且保持 >95% 性能。

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

LearnPruner 通过实证拆穿了"attention 分数 = token 重要性"这一通行假设,指出视觉编码器的 [CLS] attention 被 attention sink 污染、而 LLM 中只有"文本→视觉"的中层注意力才可靠,进而用一个可学习剪枝模块替代 [CLS] attention、再叠加 LLM 中层的文本引导剪枝,仅保留约 5.5% 视觉 token 即可维持 95% 性能并取得 3.2× 加速。

Lightweight Spatio-Temporal Modeling via Temporally Shifted Distillation for Real-Time Accident Anticipation

用一个冻结的纯图像 CLIP 教师 + 时间偏移蒸馏,让轻量 RepMixer+RWKV 学生在不做大规模视频预训练的前提下学到"预测未来帧"的时序能力,在 DAD/CCD 事故预测基准上达到 SOTA,且模型比对手小 3–7×、能在 Jetson Orin Nano 上 80 FPS 实时跑。

Nüwa: Mending the Spatial Integrity Torn by VLM Token Pruning

本文发现现有视觉 token 剪枝方法之所以在视觉定位(visual grounding, VG)任务上崩盘,是因为它们破坏了由位置编码构建的"全局空间参考系",于是提出 Nüwa——一个受群体智能(Boids)启发的两阶段剪枝框架,先在视觉编码器侧用"分区-对齐-聚合"保住空间锚点、再在 LLM 中段做文本引导的精筛,把 VG 任务的性能保持率从 ~7% 拉到 47%,同时 VQA 维持在 95%。

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Photon 是一个直接吃整段 3D 医学体数据(CT/MRI)的多模态大模型,用「指令条件 Token 调度(ITS)」按每个问题自适应地决定保留多少视觉 token,再用「代理梯度传播(SGP)」让离散丢 token 这件事在训练时仍然可微,从而在医学视觉问答上同时拿到 SOTA 精度、约 5 倍训练加速和约三分之二的显存节省。

查看全部18篇「VLM Efficiency」论文 →


🎵 音频/语音 (79)

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

提出 MMSU(5000 条音频 QA、47 个任务),首个系统融合语言学理论的语音理解与推理基准,评测 22 个 SpeechLLM,发现现有模型在音韵感知和复杂推理上仍存在显著差距。

RedTeamCUA: Realistic Adversarial Testing of Computer-Use Agents in Hybrid Web-OS Environments

构建首个混合 Web-OS 环境的 CUA 红队测试框架 RedTeamCUA 和 864 个测试用例的 RTC-Bench,系统评估 9+ 前沿 CUA 对间接 prompt injection 的脆弱性,发现所有 CUA 均可被攻击(最高 ASR 83%),且能力越强的模型越危险——攻击尝试率(AR)远高于成功率(ASR)意味着模型能力提升将直接转化为更高的攻击成功率。

Stitch: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

提出 Stitch,在口语语言模型中实现"边想边说"——将无声推理 token 与语音 token 交替分块生成,利用音频播放期间的空闲算力完成推理。Stitch-S 首帧延迟与无推理基线一致,数学推理准确率提升约 15 个百分点。

The Devil behind the Mask: An Emergent Safety Vulnerability of Diffusion LLMs

本文首次系统揭示扩散语言模型(dLLM)中由双向建模和并行解码机制引发的固有安全漏洞,并提出 DiJA 越狱攻击框架,通过交错掩码-文本提示在多个对齐后的 dLLM 上实现接近100%的攻击成功率。

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-Aware Speech-to-Speech Interaction

提出 ParaS2S 框架——包含一个评估副语言感知(emotion/sarcasm/age/gender)的语音到语音基准 ParaS2SBench,以及一个基于 GRPO 的 RL 对齐框架 ParaS2SAlign,使 S2S 模型能够在极少标注数据下习得根据说话风格调整回复的能力。

TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling

提出 TASTE(Text-Aligned Speech Tokenization and Embedding),通过跨注意力机制将语音 token 与文本转录对齐,实现极低比特率(~150 bps)下的高质量语音重建,并使文本-语音联合建模变得直接高效,1.3B 参数的 TASLM 超越 7B 预训练 SLM。

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

提出 FlexiCodec,通过 ASR 特征引导的动态帧率合并策略,在 3–12.5Hz 超低帧率下实现高质量语音编解码,同时保持优异的语义信息保留能力。

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

首次将语音情感识别(SER)重构为深度推理问题,通过韵律增强基座模型 + GRPO-PTR(渐进式可信推理奖励)强化学习,生成带有声学依据的可解释情感推理。

Discovering and Steering Interpretable Concepts in Large Generative Music Models

首次将 Sparse Autoencoder (SAE) 应用于音频/音乐领域,从自回归音乐生成模型 MusicGen 的残差流中提取可解释的音乐概念特征,并利用这些特征实现可控生成(steering)。

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

提出 EchoMind,首个面向共情对话的多层级关联基准,通过理解→推理→对话的认知流程,系统评估 Speech Language Models 感知非语言声学线索并生成共情回复的能力。

查看全部79篇「音频/语音」论文 →


🔎 AIGC 检测 (30)

Is Your Paper Being Reviewed by an LLM? Benchmarking AI Text Detection in Peer Review

构建了迄今最大的 AI 生成同行评审数据集(788,984 篇评审),系统评估了 18 种 AI 文本检测方法在同行评审场景下的表现,并提出了利用论文原文作为上下文的 Anchor 检测方法,在低误报率下大幅超越所有基线。

Calibrating Verbalized Confidence with Self-Generated Distractors

提出 DiNCo 方法,通过让 LLM 独立评估自动生成的干扰选项(合理但错误的替代答案)来暴露其"暗示性偏差",用干扰项上的总置信度进行归一化,并融合生成一致性与验证一致性两个互补维度,在短文本 QA 和长文本生成任务上显著改善置信度校准。

Death of the Novel(ty): Beyond n-Gram Novelty as a Metric for Textual Creativity

通过 26 位专业作家对 8618 条表达的 close reading 标注,揭示 n-gram 新颖度不足以衡量文本创造力——约 91% 的高 n-gram 新颖表达并不被认为具有创造性,且开源 LLM 中高 n-gram 新颖度与低语用合理性负相关。

PoliCon: Evaluating LLMs on Achieving Diverse Political Consensus Objectives

基于欧洲议会2009-2022年2225条高质量审议记录构建PoliCon基准,评估LLM在不同投票机制、权力结构和政治目标下起草共识决议的能力。结果显示前沿模型在简单多数任务表现尚可,但在2/3多数和安全议题上显著不足。

CLARC: C/C++ Benchmark for Robust Code Search

构建首个可编译的 C/C++ 代码检索基准 CLARC(6717 查询-代码对),自动化 pipeline 从 GitHub 提取代码并用 LLM+假设检验生成/验证查询;覆盖标准/匿名化/汇编/WebAssembly 四种检索场景,揭示现有代码嵌入模型过度依赖词汇特征(匿名化后 NDCG@10 从 0.89 降至 0.67)且在二进制级别检索上严重不足。

DMAP: A Distribution Map for Text

提出 DMAP(Distribution Map),一种将文本经由语言模型的 next-token 概率排序映射为 \([0,1]\) 区间上 i.i.d. 样本的数学框架,理论证明纯采样文本产生均匀分布,由此可用 \(\chi^2\) 检验验证生成参数、揭示概率曲率类检测器在纯采样下彻底失效的根本原因,并可视化后训练(SFT/RLHF)在下游模型中留下的统计指纹。

A Rich Knowledge Space for Scalable Deepfake Detection

这篇论文把 11 个深度伪造与真实人脸数据源整合成 360 万图像规模的 MMI-DD 数据集,并提出 SD2 用 CLIP 的层级视觉特征、细粒度伪造类型文本标签和 VLM 生成描述联合训练,使 deepfake 检测器在大规模异构数据上不再越训越退化,而是获得更强的跨域与 AIGC 泛化能力。

All Patches Matter, More Patches Better: Enhance AI-Generated Image Detection via Panoptic Patch Learning

本文提出"所有 patch 都重要、用得越多越好(All Patches Matter, More Patches Better)"的检测原则,发现现有 AI 生成图像(AIGI)检测器存在"少数 patch 偏置(Few-Patch Bias)"——只盯着极少数 patch 做判断;据此设计 Panoptic Patch Learning(PPL)框架,用随机 patch 重建 + patch 级对比学习把判别能力摊平到全图所有 patch,在 GenImage、DRCT-2M、AIGCDetectBenchmark 和真实场景 Chameleon 上都把跨生成器泛化性和鲁棒性显著刷高(CLIP backbone 在 GenImage 上 mAcc 97.2%、std 仅 1.7)。

Attack-Resistant Watermarking for AIGC Image Forensics via Diffusion-based Semantic Deflection

本文提出 PAI——一个免训练、即插即用的扩散模型固有水印框架,通过"初始化嵌入 + 密钥引导的去噪轨迹偏转"把用户身份和图像内容深度语义纠缠,再用 DDIM 逆向得到的"初始化偏差"作为统一取证信号,一举支撑版权验证、攻击检测与语义级篡改定位三件事,在 12 种攻击下平均验证准确率达 98.43%,比 SOTA 高 37.25%。

Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection

这篇论文指出主流"度量法"机器生成文本(MGT)检测器的 token 级分数会被 LLM 采样随机性污染,于是用马尔可夫随机场(MRF)刻画"相邻 token 分数相似、句首 token 分数不稳定"这两条规律,再通过平均场近似把它实现成一个只有 2×2 参数、可直接叠在任意现有检测器上的轻量迭代组件,在几乎不增加开销的前提下把各类基线检测器的 AUROC 大幅拉高(如 DetectGPT 在 Essay 上从 44% 提到 92%)。

查看全部30篇「AIGC 检测」论文 →


🧊 3D 视觉 (194)

OpenFly: A Comprehensive Platform for Aerial Vision-Language Navigation

构建OpenFly——航空视觉-语言导航(VLN)综合平台:集成4种渲染引擎(UE/GTA V/Google Earth/3DGS)+开发全自动数据生成工具链(点云获取→语义分割→轨迹生成→GPT-4o指令)+构建10万轨迹大规模数据集(18场景)+提出关键帧感知VLN模型OpenFly-Agent(关键帧选择+视觉token融合),在已见/未见场景分别以14.0%/7.9%的成功率优势超越现有方法。

Depth Anything with Any Prior

Prior Depth Anything 用"先粗后细"的两段式流程,把传感器测出来的精确但稀疏的度量深度先验,和单目深度模型预测出来的完整但相对的几何结构融合起来,单个模型零样本统一了深度补全、超分、修复三类任务,在 7 个真实数据集上追平甚至超过各自的专用 SOTA。

FantasyWorld: Geometry-Consistent World Modeling via Unified Video and 3D Prediction

FantasyWorld 在冻结的视频基础模型(Wan2.1)旁挂一条可训练的几何分支,让一次前向传播同时吐出相机条件下的视频帧和一个隐式 3D 场(深度/点图/相机位姿),并通过双向交叉注意力让几何约束视频、视频先验补全几何,在 WorldScore 的多视角一致性与风格一致性上超过近期几何一致基线。

DepthLM: Metric Depth from Vision Language Models

DepthLM 证明标准 VLM 不需要 dense prediction head 或专门深度损失,只靠视觉标记、相机内参条件的数据增强和文本式 SFT,就能在像素级 metric depth 上首次接近甚至超过多种专家型纯视觉深度模型。

Into the Rabbit Hull: From Task-Relevant Concepts in DINO to Minkowski Geometry

通过在 DINOv2 上训练 32,000 单元的 Sparse Autoencoder 字典,系统分析了下游任务如何招募不同概念,发现表征几何偏离线性稀疏假说(LRH),进而提出 Minkowski Representation Hypothesis(MRH),认为 token 表征是多个凸多面体的 Minkowski 和,概念由原型点的邻近性而非线性方向定义。

DA\(^{2}\): Depth Anything in Any Direction

DA2 用一个「透视→全景」数据引擎把约 54 万张透视 RGB-深度对转成全景训练数据(总量提到约 60.7 万),再配上显式注入球面坐标的 SphereViT 骨干,做到端到端、单张 360° 全景直接预测尺度不变距离,在零样本设定下 AbsRel 比最强基线平均提升约 38%,甚至反超此前的 in-domain 方法。

Sharp Monocular View Synthesis in Less Than a Second

SHARP 通过单次前馈神经网络从单张照片生成约 120 万个 3D Gaussian,在 A100 GPU 上不到 1 秒完成推理,渲染速度超 100 FPS,在 6 个数据集上零样本泛化均达 SOTA,相比最强先前方法 LPIPS 降低 25–34%、合成时间缩短三个数量级。

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

提出首个夜间第一人称视觉基准 EgoNight,包含日夜对齐视频和 3658 个人工验证 QA 对,揭示 MLLM 在低光照下存在高达 32.8% 的性能下降。

Exploring the Potential of Encoder-free Architectures in 3D LMMs

本文提出首个无编码器(encoder-free)3D 大多模态模型 ENEL,把原本由预训练 3D 编码器承担的「高层语义提取」和「局部几何归纳偏置」两件事直接交给 LLM 自己完成,7B 模型在分类/描述/VQA 上追平 PointLLM-PiSA-13B。

Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images

构建统一的3D场景理解与生成模型 Omni-View,通过纹理模块(新视角合成)和几何模块(深度/位姿估计)的生成能力增强理解性能,在 VSI-Bench 上达到 55.4 分超越所有现有专用3D理解模型。

查看全部194篇「3D 视觉」论文 →


🎯 目标检测 (30)

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Method

提出 TreeBench(首个可追溯视觉推理基准,405道高挑战 VQA,OpenAI-o3 仅 54.87%)和 TreeVGR(通过双 IoU 奖励的强化学习联合监督定位与推理的训练范式),7B 模型在 V*Bench +16.8、MME-RealWorld +12.6、TreeBench +13.4,证明可追溯性是推进视觉推理的关键。

CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally

通过线性探测实验证明 CLIP 的 BoW(词袋)行为并非源于编码器缺乏绑定信息,而是跨模态对齐的失败;提出 LABCLIP,仅训练一个轻量线性变换即可显著恢复属性-对象绑定能力。

Long-Context Generalization with Sparse Attention

提出 ASEntmax(Adaptive-Scalable Entmax),用可学习温度的 α-entmax 替代 softmax 注意力,从理论和实验两方面证明稀疏注意力能实现 1000× 长度外推,解决 softmax 在长上下文下的注意力弥散(dispersion)问题。

PAANO: Patch-Based Representation Learning for Time-Series Anomaly Detection

提出 PaAno,一种基于 patch 级表示学习的轻量时间序列异常检测方法,使用 1D-CNN 编码器 + triplet loss + pretext loss 学习 patch 嵌入空间,通过与记忆库中正常 patch 的距离计算异常分数,在 TSB-AD 基准上全面 SOTA,且仅需 0.3M 参数和数秒推理。

Dual Distillation for Few-Shot Anomaly Detection

提出双蒸馏框架 D24FAD,结合 query 图像上的教师-学生蒸馏(TSD)和 support 图像上的学生自蒸馏(SSD),辅以学习权重机制(L2W)自适应评估 support 重要性,在 APTOS 眼底数据集上仅用 2-shot 达到 100% AUROC。

FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion

提出一个无需训练的少样本目标检测框架,组合 UPN、SAM2 和 DINOv2 三个基础模型生成提案和匹配特征,并通过图扩散算法精化置信度分数和抑制碎片化提案,在 Pascal-5i 和 COCO-20i 上大幅超越 SOTA。

InfoDet: A Dataset for Infographic Element Detection

构建了一个大规模信息图元素检测数据集(101,264 张信息图、1420 万标注),涵盖图表和人类可识别对象两大类,并提出 Grounded CoT 方法利用检测结果提升 VLM 的图表理解能力。

Contextual and Seasonal LSTMs for Time Series Anomaly Detection

针对单变量时间序列中现有方法难以检测的"小幅点异常"和"缓慢上升异常",提出 CS-LSTMs 双分支架构——S-LSTM 在频域建模周期性演化、C-LSTM 在时域捕捉局部趋势,结合小波噪声分解策略,在四个基准上全面超越 SOTA 且推理速度提升 40%。

OwlEye: Zero-Shot Learner for Cross-Domain Graph Data Anomaly Detection

提出 OwlEye 框架,利用基于成对距离统计的跨域特征对齐将异构图嵌入共享空间,从多图中提取 attribute-level 和 structure-level 正常模式存入可扩展字典,并通过截断注意力重建机制在完全零样本条件下检测未见图的异常节点,8 数据集平均 AUPRC 36.17% 超越最强 baseline ARC 约 5.4 个百分点。

ForestPersons: A Large-Scale Dataset for Under-Canopy Missing Person Detection

ForestPersons 是首个专门面向森林树冠下失踪人员检测的大规模基准数据集(96,482 张图像 + 204,078 标注),通过模拟微型无人机(MAV)在 1.5-2.0 米高度的低空飞行视角,覆盖多季节、多天气、多姿态和多遮挡等级的真实搜救条件,为下冠层人员检测模型的训练和评估提供了坚实基础。

查看全部30篇「目标检测」论文 →


✂️ 语义分割 (31)

VINCIE: Unlocking In-context Image Editing from Video

提出VINCIE框架,首次证明in-context图像编辑模型可以完全从原生视频数据中学习,通过将视频标注为交错多模态序列并设计三个代理任务(NIP/CSP/NSP),在多轮编辑基准上达到SOTA,5轮编辑成功率从基线<2%提升至25%。

Revisiting [CLS] and Patch Token Interaction in Vision Transformers

深入分析Vision Transformer中[CLS]全局token和patch局部token之间的交互摩擦,发现归一化层隐式地区分了两类token,提出在归一化层和早期QKV投影中引入专门化处理路径,仅增加8%参数即实现分割性能提升超2 mIoU,同时保持分类精度。

Efficient-SAM2: Accelerating SAM2 with Object-Aware Visual Encoding and Memory Retrieval

发现 SAM2 存在类似生物视觉的稀疏感知模式(解码器聚焦前景但编码器广泛计算、记忆帧中仅少量 token 有效且显著性时间一致),据此提出 Efficient-SAM2,通过对象感知的稀疏窗口路由(SWR)和稀疏记忆检索(SMR)消除冗余计算,在 SAM2.1-L 上实现 1.68× 端到端加速且仅损失 1% 精度。

TRACE: Your Diffusion Model is Secretly an Instance Edge Detector

发现文本到图像扩散模型的自注意力在去噪过程中存在一个"实例涌现点"(IEP),在该时刻自注意力在物体边界呈现剧烈散度变化。TRACE通过IEP定位+ABDiv边缘提取+单步蒸馏,以81×推理加速生成高质量实例边缘,无需任何实例标注即可将无监督实例分割提升+5.1 AP,tag监督全景分割超越点监督方法+1.7 PQ。

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

提出 RegionReasoner,一个基于强化学习的多轮视觉推理框架,通过引用标注奖励和全局-局部一致性奖励,使推理轨迹必须显式引用参考区域坐标并保持语义连贯,在新构建的 RegionDial-Bench 上显著提升多轮定位和分割精度。

Universal Multi-Domain Translation via Diffusion Routers

提出 Diffusion Router (DR),用单个噪声预测网络通过 source/target 域标签条件化实现所有跨域映射,支持通过中心域的间接翻译和基于变分上界目标 + Tweedie 精化的直接非中心域翻译,在三个大规模 UMDT 基准上达到 SOTA。

VIRTUE: Visual-Interactive Text-Image Universal Embedder

提出 VIRTUE,将分割模型 SAM2 与 VLM 结合构建视觉交互式通用嵌入器,支持用户通过点/框/掩码指定兴趣区域产生实体级+全局级联合嵌入,并构建百万级 SCaR 基准评估视觉交互检索能力,在 36 个 MMEB 任务(+3.1%-8.5%)和 5 个 SCaR 任务(+15.2%-20.3%)上均达到 SOTA。

ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer

提出 ByteFlow Net,一种无需分词器的分层字节级语言模型,利用信息论中的编码率(coding rate)自适应地将原始字节流压缩为语义单元,在预训练损失和下游任务上超越 BPE 基线和已有字节级架构。

Locality-Attending Vision Transformer

提出 LocAt 模块化插件(GAug + PRR),通过可学习高斯核偏置注意力向局部邻域聚焦并精炼 patch 表示,在不修改训练目标的前提下使 ViT 在 ADE20K 分割上提升超 6%,同时分类精度不降反升。

AMLRIS: Alignment-aware Masked Learning for Referring Image Segmentation

提出对齐感知遮蔽学习(AML)策略,通过量化视觉-语言 patch 级对齐度并过滤低对齐像素,让 RIS 模型在训练时聚焦可靠区域,无需架构改动即在 RefCOCO 全部 8 个 split 上达到 SOTA。

查看全部31篇「语义分割」论文 →


🖼️ 图像恢复 (61)

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

提出 InterActHuman,通过自动推断时空布局的掩码预测器和迭代掩码引导策略,实现多人/人物交互场景下的音频驱动视频生成,支持每个角色独立的语音驱动口型同步和身体动作。

SoFlow: Solution Flow Models for One-Step Generative Modeling

提出 Solution Flow Models (SoFlow),直接学习速度 ODE 的解函数 \(f(x_t, t, s)\)(将 \(t\) 时刻的 \(x_t\) 映射到 \(s\) 时刻的解),通过 Flow Matching 损失 + 无需 JVP 的解一致性损失从头训练,在 ImageNet 256 上 1-NFE FID 优于 MeanFlow(XL/2: 2.96 vs 3.43)。

DiffusionBlocks: Block-wise Neural Network Training via Diffusion Interpretation

提出 DiffusionBlocks,将残差网络的逐层更新解释为连续时间扩散过程的离散化步骤,从而将网络切分为可完全独立训练的 block,在保持端到端训练性能的同时按 block 数 B 倍减少训练显存。

Trust but Verify: Adaptive Conditioning for Reference-Based Diffusion Super-Resolution

提出 Ada-RefSR,一个基于"Trust but Verify"原则的单步参考引导扩散超分辨率框架,通过自适应隐式相关性门控(AICG)机制在利用可靠参考信息的同时抑制错误融合,仅增加 0.13% 计算开销。

Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration

提出首个多域全能图像复原方法DATPRL-IR,通过双提示池(任务提示池+域提示池)学习域感知的任务提示表征,利用MLLM蒸馏域先验并通过自适应门控融合指导复原,在自然/医学/遥感三域9任务上显著超越SOTA。

Sharpness-Aware Machine Unlearning

本文从信号-噪声分解的视角系统分析了 SAM 在机器遗忘场景下的理论特性,发现 SAM 在遗忘集上会"放弃"去噪能力但在保留集上仍维持优势,进而提出 Sharp MinMax 算法——将模型拆成两部分分别做锐度最小化(保留)和锐度最大化(遗忘),达到SOTA遗忘效果。

Mechanism of Task-oriented Information Removal in In-context Learning

从"信息移除"的新视角解释 In-context Learning(ICL)的内部机制:发现 LM 在零样本时将查询编码为包含所有可能任务信息的"非选择性表征"(导致随机输出),而 few-shot ICL 的核心作用是模拟一种"任务导向的信息移除"过程——通过识别出的"Denoising Heads"(去噪注意力头)从纠缠的表征中选择性移除冗余任务信息,引导模型聚焦目标任务。消融实验证实阻断去噪头后 ICL 准确率显著下降。

ProtoTS: Learning Hierarchical Prototypes for Explainable Time Series Forecasting

提出 ProtoTS,通过层级原型学习实现可解释时间序列预测:少量粗粒度原型提供全局模式概览,逐级细分捕捉局部变化,结合多通道嵌入与瓶颈融合处理异质外生变量。在 LOF 数据集上 MSE 降低 48.3%,MAE 降低 20.9%,且支持专家编辑原型以进一步提升性能。

Breaking Scale Anchoring: Frequency Representation Learning for Accurate High-Resolution Inference from Low-Resolution Training

定义了"Scale Anchoring"新问题(低分辨率训练导致高分辨率推理误差锚定),并提出架构无关的频率表征学习(FRL),通过 Nyquist 归一化频率编码使误差随分辨率提升而下降,在 8 种主流架构上验证有效。

Are Deep Speech Denoising Models Robust to Adversarial Noise?

首次系统性评估 4 款 SOTA 深度语音去噪(DNS)模型在对抗噪声下的鲁棒性:通过心理声学约束的 PGD 攻击生成人耳不可感知的对抗噪声,可令 Demucs、Full-SubNet+、FRCRN 和 MP-SENet 输出完全不可理解的 gibberish,实验覆盖多种声学条件和人类评估,同时揭示了目标攻击、通用扰动和跨模型迁移的局限性。

查看全部61篇「图像恢复」论文 →


🛰️ 遥感 (11)

Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents

Earth-Agent是首个基于MCP工具生态的地球观测Agent框架,统一了RGB和光谱遥感数据,通过动态调用104个专家工具实现跨模态、多步骤、定量时空推理,配套提出的Earth-Bench基准包含248个专家任务和13,729张图像,实验证明Earth-Agent远超通用Agent和遥感MLLM。

Measuring the Intrinsic Dimension of Earth Representations

首次系统度量地理隐式神经表示(Geographic INR)的内在维度(ID),发现256-512维嵌入的真实ID仅2-10维;冻结嵌入空间的高ID与好的下游性能正相关,而监督任务头激活空间的低ID与高性能正相关,揭示了「代表性 vs 任务对齐」的双重机制。

Task-free Adaptive Meta Black-box Optimization

提出 ABOM——一种无需预定义训练任务的自适应元黑盒优化器,通过将进化算子(选择、交叉、变异)参数化为可微注意力模块,在优化过程中利用自生成数据在线更新参数,在合成基准和无人机路径规划上实现零样本竞争性能。

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

提出 TAMMs——首个统一框架,在单一 MLLM-扩散架构中联合执行卫星图像时间序列的时序变化描述(TCD)和未来图像预测(FSIF),通过时序适配模块(TAM)唤醒冻结 MLLM 的时序推理能力,并通过语义融合控制注入(SFCI)机制将变化理解转化为生成控制信号。

MARS - A Foundational Map Auto-Regressor

把矢量地图(点 / 折线 / 多边形)当作一种"语言",用一个统一的视觉编码器 + 自回归解码器端到端生成道路网络与建筑轮廓,无需任何分割后处理,配套发布了迄今最大的多类地图数据集 MAP-3M(约 3M 张图)。

MoRA: Mobility as the Backbone for Geospatial Representation Learning at Scale

MoRA 把人类移动(mobility)图当作多模态融合的"骨架锚点",用 CLIP 式非对称对比学习把 POI、卫星影像、人口统计三种辅助模态对齐到十亿边级移动图上,在 9 个社会经济下游任务上以 128 维表征平均超越 SOTA 12.9%,并首次给出地理空间表示学习的标度律证据。

Object Fidelity Diffusion for Remote Sensing Image Generation

OF-Diff 用类别标签直接提取遥感目标的"形状掩码先验"来约束扩散生成,再用一个"在线蒸馏"框架把含真实图像信息的混合特征蒸馏进只依赖形状的解码器,使得推理时不再需要真实图像参考也能生成高保真、布局一致的遥感图,最后用 DDPO 强化微调进一步对齐真实分布,下游检测中飞机/船/车等类别 mAP 提升 4–8%。

SatDreamer360: Multiview-Consistent Generation of Ground-Level Scenes from Satellite Imagery

SatDreamer360 从单张卫星图像和预设地面相机轨迹出发,用三平面场景表示、逐像素射线注意力和全景极线约束时序注意力,在扩散模型中生成几何对齐且跨帧一致的 360° 地面全景序列,并在新构建的 VIGOR++ 基准上优于 Sat2Density、ControlS2S 和 EscherNet。

SelvaBox: A high-resolution dataset for tropical tree crown detection

SelvaBox 构建了目前最大规模的开放热带森林高分辨率无人机 RGB 树冠检测数据集,并用统一的多分辨率检测基准证明:高分辨率输入、DINO-Swin 检测器和跨数据集训练能显著提升热带树冠检测的域内与零样本泛化表现。

TerraFM: A Scalable Foundation Model for Unified Multisensor Earth Observation

TerraFM 面向多传感器地球观测数据,把 Sentinel-1 SAR 与 Sentinel-2 光学影像当作同一地点的天然增强视图,通过模态专属 patch embedding、逐位置 cross-attention 融合和面向长尾地表覆盖的 dual-centering DINO 训练,在 GEO-Bench 与 Copernicus-Bench 的分类和分割任务上取得了强泛化表现。

查看全部11篇「遥感」论文 →


🔍 异常检测 (10)

Adaptive Conformal Anomaly Detection with Time Series Foundation Models for Signal Monitoring

提出 W1-ACAS:一种 post-hoc、免微调的自适应共形异常检测框架,把预训练时序基础模型(TSFM)的预测误差转成可直接解释为误报率(p-value)的异常分数,并通过最小化 Wasserstein 距离在线学习权重,在非平稳数据下稳定控制误报。

Foundation Visual Encoders Are Secretly Few-Shot Anomaly Detectors

作者发现冻结的基础视觉编码器其实"悄悄"已经能区分异常——图像中异常区域的面积与其特征到自然图像流形的距离成正相关,于是只在编码器之上训练一个轻量非线性投影算子(FOUNDAD),把异常特征拉回正常流形、再用投影前后差异打分,就在少样本、多类别工业异常检测上达到 SOTA。

Healthcare Insurance Fraud Detection via Continual Fiedler Vector Graph Model

ConFVG 用图拉普拉斯的第二小特征向量(Fiedler 向量)指导图自编码器的掩码策略来在标签稀缺时学结构感知表征,再用子图注意力融合 + Mean Teacher 在无标签的在线流里持续适应不断变化的欺诈模式,实现医保欺诈的实时检测。

Let OOD Feature Exploring Vast Predefined Classifiers

这篇论文提出 VPC,用一组固定的等角原型把 ID 类别和 OOD 样本分别拉到两个预定义子空间,再用两个子空间上的 L2 激活强度差做 OOD 分数,在 CIFAR 和 ImageNet-1k 的 OE 训练场景中稳定降低 FPR95。

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

把 LLM 从"数据处理器"重新定位为"算法策略师"——它只看检测器的算法描述、不碰任何真实数据,就推理出该检测器的逻辑盲点并生成一段可跨数据集复用的 Python 合成代码,用来造出专门骗过这个检测器的"困难异常",从而把原本只有正常样本的单类问题升级成更可分的两类问题,在 36 个表格异常检测基准上稳定提升五种主流检测器。

Low Rank Transformer for Multivariate Time Series Anomaly Detection and Localization

本文从理论上把 Transformer 编码器在多变量时间序列上的学习过程映射到经典 STAR 统计模型,进而提出对自注意力施加低秩正则的 ALoRa-T,用注意力矩阵的"秩"作为异常信号做检测,并借助可解释的贡献权重把异常回溯到具体变量做定位。

MRAD: Zero-Shot Anomaly Detection with Memory-Driven Retrieval

MRAD 用「特征-标签记忆库的相似度检索」直接替代主流 ZSAD 的参数化拟合 \(p(y|x)\),免训练版本就能打过 WinCLIP,再叠两层线性微调与区域先验注入的动态提示,便在 16 个工业/医疗数据集上刷到 SOTA。

PIRN: Prototypical-based Intra-modal Reconstruction with Normality Communication for Multi-modal Anomaly Detection.

PIRN 面向 RGB 图像与 3D surface normal 的少样本多模态工业异常检测,用自适应原型码本重建每个模态的正常特征,再通过跨模态正常性通信互补纹理和几何线索,在 MVTec 3D-AD、Eyecandies 和 Real-IAD D3 上取得更强的检测与定位表现。

ReTabAD: A Benchmark for Restoring Semantic Context in Tabular Anomaly Detection

ReTabAD 是首个"上下文感知"的表格异常检测 benchmark:它把传统基准里被丢弃的文本语义(特征描述、领域知识、类别原文)重新还原回 20 个精选数据集,配齐 20 个跨经典/深度/LLM 的算法实现,并提出一个无需训练的零样本 LLM 框架,实验证明语义上下文能把检测 AUROC 平均提升 7.6 个百分点,让零样本 LLM 逼近 SOTA 训练方法。

UniOD: A Universal Model for Outlier Detection across Diverse Domains

UniOD 用一批历史带标签数据集训练一个通用离群检测模型:先把任意维度/语义的表格数据集统一成"多尺度相似度图 + SVD 特征",再用 GIN+GT 双路图网络把离群检测转成节点二分类,训练完成后对任何未见过的新数据集免训练、免调参直接打异常分数,在 30 个基准上平均 AUROC/AUPRC 超过 17 个基线且耗时更低。


🧑 人体理解 (45)

BAH Dataset for Ambivalence/Hesitancy Recognition in Videos for Digital Behaviour Analysis

提出首个面向视频中矛盾/犹豫(A/H)识别的多模态数据集 BAH,包含来自加拿大9省224名参与者的1,118段视频共8.26小时,由行为科学专家标注,并提供了帧级和视频级的基线实验结果。

Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals

提出TEMU-VTOFF——面向虚拟脱衣(VTOFF)任务的Dual-DiT架构,通过特征提取器+服装生成器分工协作,结合多模态混合注意力(MHA)融合图像/文本/掩码信息消解视觉歧义,并设计DINOv2驱动的服装对齐器保留高频细节,在VITON-HD和Dress Code多品类场景均达到SOTA。

GaitSnippet: Gait Recognition Beyond Unordered Sets and Ordered Sequences

提出 Snippet 范式:将步态轮廓序列组织为若干"片段"(snippet),每个 snippet 由一个连续区间内随机抽取的帧构成,兼顾短程时序上下文与长程时序依赖,在 Gait3D 上以 2D 卷积骨干达到 77.5% Rank-1,超越所有 3D 卷积方法。

PersonaX: Multimodal Datasets with LLM-Inferred Behavior Traits

构建了 PersonaX 多模态数据集(含 LLM 推断的 Big Five 行为特质、面部嵌入和传记元数据),并提出两层分析框架:结构化独立性检验 + 非结构化因果表示学习(带可识别性理论保证),揭示跨模态因果结构。

QuaMo: Quaternion Motions for Vision-based 3D Human Kinematics Capture

QuaMo 提出基于四元数微分方程(QDE)的 3D 人体运动学捕捉方法,通过在四元数单位球面约束下求解运动学方程,并引入二阶加速度增强的 meta-PD 控制器,实现了无不连续性、低抖动的在线实时人体运动估计,在 Human3.6M 等多个数据集上超越 SOTA。

Cross-Domain Policy Optimization via Bellman Consistency and Hybrid Critics

提出 Q Avatar 框架,通过跨域 Bellman 一致性量化源域模型可迁移性,利用自适应无超参权重函数混合源域和目标域 Q 函数,实现在状态-动作空间不同的跨域 RL 中的可靠知识迁移,无论源域模型质量或域相似性如何都能保证不产生负迁移。

Event-T2M: Event-level Conditioning for Complex Text-to-Motion Synthesis

提出 Event-T2M 框架,将文本提示分解为事件级别的原子动作,结合 TMR 编码器和事件级交叉注意力(ECA)模块注入 Conformer 扩散模型,显著提升多事件复杂动作生成的质量和语义对齐。

BANZ-FS: BANZSL Fingerspelling Dataset

本文构建了首个面向 BANZSL(英国/澳大利亚/新西兰手语)双手指拼的大规模数据集 BANZ-FS,汇集新闻直播、实验室录制、网络 vlog 三类来源、35K+ 条多级对齐的指拼实例,并在检测、孤立识别、上下文识别三大任务上系统地 benchmark 了 SOTA 模型。

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH 用「VLM 自动标注的 3.2 万条野外手部动作数据(3D-HIW)+ 把轨迹/姿态、左/右手分别离散化的 SHIFT 分解式 VQ-VAE + 在动作空间上加几何重建损失微调 LLM」三件套,第一次把文本↔手部动作建模做到了"野外"场景(弹琴、揉面、写字等),在文生动作与动作生文两项任务上都刷到 SOTA。

Curvature-Guided Task Synergy for Skeleton based Temporal Action Segmentation

CurvSeg 针对骨架时序动作分割中"分类要时序不变、边界定位要时序敏感"的内在冲突,提出用分类特征轨迹的几何曲率当边界先验——动作段内曲率高、转换处曲率低,由此在分类与定位之间建立双向闭环协同,并配一套双专家 MoE 给两个子任务各自蒸馏特征,作为即插即用模块提升 DeST/LaSA 等基线在四个数据集上的分割精度。

查看全部45篇「人体理解」论文 →


📹 视频理解 (48)

FlashVID: Efficient Video Large Language Models via Training-free Tree-Based Spatiotemporal Token Merging

提出 FlashVID,一个免训练的视频大语言模型推理加速框架,通过树状时空 token 合并(TSTM)联合建模空间和时间冗余,仅保留 10% 的视觉 token 就能保持 LLaVA-OneVision 99.1% 的性能,并能将 Qwen2.5-VL 的输入帧数提升 10 倍。

Language-guided Open-world Video Anomaly Detection under Weak Supervision

提出语言引导的开放世界视频异常检测范式LaGoVAD,通过将异常定义建模为随机变量并以自然语言形式输入,结合动态视频合成和对比学习正则化策略,在七个数据集上实现零样本SOTA性能。

VideoNSA: Native Sparse Attention Scales Video Understanding

本文提出 VideoNSA,将 Native Sparse Attention(NSA)引入视频语言模型,通过压缩、选择和滑动窗口三分支动态门控的混合稀疏注意力机制,在仅使用 3.6% 注意力预算的条件下实现 128K token 的视频理解,在长视频理解、时序推理和空间理解任务上全面超越 token 压缩和无训练稀疏注意力基线。

Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs

首次用机制可解释性工具(Attention Knockout + Logit Lens)系统逆向工程VideoLLM的时序推理过程,揭示出"早中层跨帧交互→中层视频-语言整合→中后层答案生成"的三阶段信息流蓝图,并证明仅保留42%注意力边即可几乎无损保持VideoQA性能。

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

提出 Video-KTR,一种模态感知的策略塑造框架,通过反事实分析识别视觉感知型、时序敏感型和高熵 Token 三类关键 Token,仅对这些 Token 执行选择性强化学习更新,在多个视频推理基准上达到 SOTA(Video-Holmes 42.7%,超越 GPT-4o)。

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

提出 FLoC,基于设施选址函数(facility location function)的视觉 token 压缩框架,通过子模优化在给定预算下快速选择兼具代表性和多样性的 token 子集,实现无训练、模型无关、查询无关的长视频理解 token 压缩。

From Vicious to Virtuous Cycles: Synergistic Representation Learning for Unsupervised Video Object-Centric Learning

发现 slot-based 目标中心学习中编码器(产生尖锐但有噪声的注意力图)与解码器(产生空间一致但模糊的重建掩码)之间的恶性循环,提出同步对比学习目标和 slot 正则化预热策略将其转化为良性循环,在 MOVi 和 YouTube-VIS 上大幅提升物体发现性能。

Steering and Rectifying Latent Representation Manifolds in Frozen Multi-Modal LLMs for Video Anomaly Detection

提出 SteerVAD 框架,在完全冻结的多模态大语言模型 (MLLM) 内部,通过识别"潜在异常专家"注意力头并用层次化元控制器动态操控其表示流形,仅用 1% 训练数据即实现免调优视频异常检测的 SOTA。

A.I.R.: Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering

提出 A.I.R.,一种无需训练的自适应-迭代-推理驱动帧选择框架,通过两阶段策略(GMM 自适应初始采样 + 迭代式 VLM 精细分析)解决 VideoQA 中轻量模型(CLIP)相似度不准确和 VLM 分析成本爆炸的双重困境,在最坏情况下也仅需分析 72 帧(vs 基线 128 帧),同时显著提升多个长视频 benchmark 性能。

Let's Split Up: Zero-Shot Classifier Edits for Fine-Grained Video Understanding

提出了"类别拆分"(Category Splitting)新任务,通过挖掘视频分类器权重中的潜在组合结构,在零样本条件下将粗粒度动作类别拆分为细粒度子类别,无需重训或额外数据。

查看全部48篇「视频理解」论文 →


🚗 自动驾驶 (50)

EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video

Apple 使用 Vision Pro 采集了 829 小时的第一人称视频 + 3D 手部关节追踪数据(EgoDex),覆盖 194 种桌面操作任务,并在此数据集上系统评估了模仿学习策略(BC/DDPM/FM + Transformer),为灵巧操作的扩展训练提供了迄今最大规模的数据基础。

Astra: General Interactive World Model with Autoregressive Denoising

提出 Astra,一个通用交互式世界模型,通过自回归去噪框架在预训练视频扩散模型上实现动作条件化的长程视频预测,引入 ACT-Adapter(动作注入)、噪声增强历史记忆(缓解视觉惯性)和 Mixture of Action Experts(统一多异构动作模态),在自动驾驶、机器人操控和场景探索等多场景上实现 SOTA 的保真度和动作跟随能力。

SMART-R1: Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

SMART-R1 首次将 R1 风格的强化微调(RFT)引入多智能体交通仿真,提出 Metric-oriented Policy Optimization (MPO) 算法和"SFT-RFT-SFT"迭代训练策略,在 WOSAC 2025 排行榜上以 0.7858 的 Realism Meta 分数取得第一名。

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive 提出用扩散桥(diffusion bridge)替代截断扩散来实现锚点引导的自动驾驶轨迹规划,保证前向/反向过程的理论对称性,在 Bench2Drive 闭环评估中成功率达到 74.99%(PDM-Lite)和 89.25%(LEAD),分别超越前 SOTA 7.72% 和 2.45%。

ResWorld: Temporal Residual World Model for End-to-End Autonomous Driving

ResWorld 提出时序残差世界模型(TR-World),通过计算 BEV 场景表征的时序残差来提取动态物体信息(无需检测/跟踪),避免对静态区域的冗余建模,结合未来引导轨迹优化(FGTR)模块利用预测的未来 BEV 特征修正规划轨迹,在 nuScenes 和 NAVSIM 上达到 SOTA 规划性能。

SPACeR: Self-Play Anchoring with Centralized Reference Models

SPACeR 提出"类人自博弈"框架,用预训练的 tokenized 自回归运动模型作为集中式参考策略,通过对数似然奖励和 KL 散度约束引导去中心化自博弈 RL 策略向人类驾驶分布对齐,在 WOSAC 上超越纯自博弈方法,同时推理速度比模仿学习快 10 倍、参数量小 50 倍。

Steerable Adversarial Scenario Generation through Test-Time Preference Alignment (SAGE)

SAGE 将自动驾驶对抗场景生成重构为多目标偏好对齐问题,通过训练两个偏好专家模型并在推理时通过权重插值实现对抗性与真实性之间的连续可控权衡,无需重新训练即可生成从温和到激进的全谱场景,显著提升闭环训练效果。

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

提出 MARC 框架,通过"先检索再压缩"策略——用 Visual Memory Retriever (VMR) 选出与查询最相关的视频片段,再用 Compression GRPO (C-GRPO) 将 64 帧教师模型的推理能力蒸馏到仅用 1 帧 token 的学生模型——实现视觉 token 95% 压缩,GPU 显存降低 72%,推理延迟降低 23.9%,性能几乎无损(42.20 vs 42.21)。

NeMo-map: Neural Implicit Flow Fields for Spatio-Temporal Motion Mapping

提出 NeMo-map——基于神经隐式函数的连续时空动态地图,将空间-时间坐标直接映射为半包裹高斯混合模型(SWGMM)参数,消除传统方法的空间离散化和时间分段限制,在真实行人追踪数据上实现更低 NLL 和更平滑的速度分布。

SEAL: Segment Any Events with Language

首次提出开放词汇事件实例分割(OV-EIS)任务,设计 SEAL 框架通过多模态层次语义引导(MHSG)和轻量多模态融合网络,在仅使用事件-图像对(无密集标注)的情况下,实现事件流的多粒度(实例级+部件级)语义分割,大幅领先所有基线方法且推理速度最快。

查看全部50篇「自动驾驶」论文 →


🤖 机器人/具身智能 (162)

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

受认知科学双重记忆系统启发,提出MemoryVLA框架,在VLA模型中引入感知-认知记忆库(PCMB),通过记忆检索、门控融合和整合机制捕捉长时序依赖,在SimplerEnv/LIBERO/真实世界150+任务上全面超越CogACT和π₀。

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

受人类左脑语义理解、右脑空间认知的启发,提出 JanusVLN——首个为 VLN 设计的双隐式神经记忆框架,将空间几何记忆和视觉语义记忆分别建模为固定大小的 KV Cache,仅凭 RGB 视频即可实现高效空间推理,在 VLN-CE 基准上取得 SOTA。

Visual Planning: Let's Think Only with Images

提出Visual Planning——首个纯视觉推理范式:规划过程完全由图像序列表达(无文本中介),用Large Vision Model自回归生成逐步状态图像;引入VPRL两阶段RL框架(随机轨迹初始化探索+GRPO进度奖励优化),在FrozenLake/Maze/MiniBehavior三个导航任务上平均EM超越文本推理方法27%,证明"vision-first"任务中图像推理远优于文本推理。

RoboCasa365: A Large-Scale Simulation Framework for Training and Benchmarking Generalist Robots

RoboCasa365 构建了一个包含 365 个日常厨房任务、2500 个多样化厨房场景和超过 2000 小时机器人交互数据的大规模仿真基准,系统评估了多任务学习、基础模型训练和终身学习三大范式下通用机器人策略的性能表现,发现预训练数据的任务多样性是提升下游泛化能力的关键因素。

On Entropy Control in LLM-RL Algorithms

从理论解释为什么传统熵正则化在LLM-RL中几乎无效(因极大动作空间+稀疏最优导致熵偏差压倒优化增益),提出AEnt方法用截断熵(在缩小的token空间上计算)+自适应系数来有效平衡偏差与收益,在数学推理上持续超越baseline。

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

提出 FALCON(From Spatial to Action),通过将空间基础模型的丰富 3D 空间 token 注入到 Action Head 而非 VLM 主干中,实现了 VLA 模型的强 3D 空间感知,同时保持仅 RGB 到 RGB-D 的灵活模态切换,在仿真和真实世界任务中均达到 SOTA。

AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception

AnyTouch 2提出触觉动态金字塔框架,构建包含242.6万接触样本的ToucHD层级数据集(涵盖原子动作、真实操控和触力配对数据),并设计统一像素级、语义级和物理级三层次动态感知的触觉表征学习框架,在静态属性识别、动态物理预测和真实世界操控四项任务上全面超越现有方法。

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

提出Theory of Space框架,通过文本和视觉双环境中的主动探索、认知地图探查和False Belief范式,系统性评估基础模型构建和修正空间信念的能力,揭示了当前SOTA模型在主动-被动性能差距、探索效率和信念修正方面的关键失败模式。

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

提出 AutoFly,一个面向无人机野外自主导航的端到端 VLA 模型,通过伪深度编码器从 RGB 输入推断空间信息,配合新构建的自主导航数据集(13K+ 轨迹含 1K 真实飞行),在模拟和真实环境中比 OpenVLA 成功率高 3.9%,碰撞率低 2.6%。

MoMaGen: Generating Demonstrations under Soft and Hard Constraints for Multi-Step Bimanual Mobile Manipulation

MoMaGen 将双臂移动操作的演示数据生成建模为约束优化问题,通过硬约束(可达性、无碰撞、可见性)和软约束(导航中物体可见性、收回紧凑姿态)的协同,从单个人类遥操作演示自动生成大规模多样化数据集,训练出的视觉运动策略仅用 40 个真实演示微调即可部署到实体机器人。

查看全部162篇「机器人/具身智能」论文 →


🎮 强化学习 (400)

RM-R1: Reward Modeling as Reasoning

将奖励建模重新定义为推理任务,提出RM-R1系列推理奖励模型(ReasRM),通过推理蒸馏+RL训练以及Chain-of-Rubrics(CoR)机制,在三大奖励模型基准上平均超越70B和GPT-4o模型达4.9%。

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

从RL策略梯度视角数学证明SFT梯度隐式编码了逆概率加权(1/π_θ)的病态奖励结构→低概率token梯度过大导致泛化受限,提出DFT(Dynamic Fine-Tuning)仅需一行代码修改(CE loss乘token概率:\(-p\log p\))消除逆概率加权→在数学推理/代码生成/多模态任务上大幅超越SFT,离线RL设定下甚至超越GRPO/PPO。

Learn to Reason Efficiently with Adaptive Length-based Reward Shaping

本文把各种"压缩长推理链"的 RL 方法统一进一个"长度奖励塑形"框架,并基于该视角提出阶跃式奖励 LASER 及其动态、难度感知版本 LASER-D,在 1.5B–32B 五个推理模型上同时提升准确率与 token 效率(AIME24 上 +5.3 准确率、-64% token)。

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

提出 CUDA-L1,一个基于对比强化学习(Contrastive RL)的三阶段流水线框架,将初始 CUDA 能力较弱的 LLM 训练为高效的 CUDA 优化器,在 KernelBench 的 250 个 CUDA 内核上实现平均 3.12× 加速,峰值达 120×,并可跨 GPU 架构迁移。

ExGRPO: Learning to Reason from Experience

首次系统研究什么样的推理经验对RLVR最有价值,发现中等难度问题+低熵轨迹最有效,据此提出ExGRPO框架进行经验管理和混合策略优化,在数学推理上平均+3.5分,通用推理+7.6分。

Spotlight on Token Perception for Multimodal Reinforcement Learning

提出 VPPO(Visually-Perceptive Policy Optimization),通过量化每个 token 的视觉依赖度,在轨迹级和 token 级两个层次对学习信号进行精细化调控,显著提升大视觉语言模型的多模态推理能力。

UME-R1: Exploring Reasoning-Driven Generative Multimodal Embeddings

提出 UME-R1,首次探索推理驱动的生成式多模态嵌入范式,通过两阶段训练(冷启动SFT + 强化学习)让嵌入模型先推理再生成表示,在 MMEB-V2 基准的 78 个任务上显著超越传统判别式嵌入模型。

How Far Can Unsupervised RLVR Scale LLM Training?

对无监督可验证奖励强化学习(URLVR)进行全面分析,揭示所有内在奖励方法本质上都是在"锐化"模型初始分布,导致先升后降的不可避免崩溃模式;提出Model Collapse Step作为模型先验指标,并指出外部奖励方法是突破可扩展性瓶颈的方向。

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

提出RewardMap框架,通过难度感知的细节奖励设计和从简单感知到复杂推理的多阶段RL课程学习策略,克服细粒度视觉推理中的稀疏奖励问题。

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

通过理论推导和跨模型实验,证明 RLVR 中裁剪偏差提供的学习信号可忽略不计(≤1/17),真正起作用的是裁剪对策略熵的隐式压缩效应,并提出奖励误标模型解释为何随机奖励能让强模型获益。

查看全部400篇「强化学习」论文 →


🎁 推荐系统 (24)

Search Arena: Analyzing Search-Augmented LLMs

构建 Search Arena——首个大规模搜索增强 LLM 人类偏好数据集(24069 对话 + 12652 偏好投票,71 种语言),发现用户偏好受引用数量影响(即使引用不支持声明),社区驱动平台比 Wikipedia 更受偏好,搜索增强不降低通用聊天性能但通用 LLM 在搜索场景显著退化。

ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation

提出ProPerSim模拟框架,构建基于大五人格的32种用户persona在Smallville家庭环境中的日常行为模拟,AI助手通过每2.5分钟的主动推荐决策和DPO偏好学习,在14天模拟中将用户满意度从2.2/4提升至3.3/4,首次验证了主动性+个性化统一的可行性。

GoalRank: Group-Relative Optimization for a Large Ranking Model

理论证明任意 Multi-Generator-Evaluator 排序系统都存在一个更大的 generator-only 模型以更小的误差逼近最优策略且满足 scaling law,据此提出 GoalRank——用 reward model 构建 group-relative 参考策略来训练大型 generator-only 排序模型,在线 A/B 测试中显著优于 SOTA。

In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations

通过对来自6家提供商的12个LLM在新闻、学术、电商三大领域的大规模控制实验,揭示了LLM存在系统性的隐式信息源偏好(latent source preferences)——当内容语义完全相同时,仅更换来源标签就能显著改变模型的信息选择行为,且这种偏好无法通过提示工程消除。

Token-Efficient Item Representation via Images for LLM Recommender Systems

提出 I-LLMRec,利用商品图像替代冗长文本描述来表示推荐系统中的物品语义,通过 RISA 对齐模块和 RERI 检索模块,在仅用单个token表示物品的同时保留丰富语义,推理速度提升约2.93倍且推荐性能超越文本描述方法。

CollectiveKV: Decoupling and Sharing Collaborative Information in Sequential Recommendation

观察到序列推荐中不同用户的 KV cache 具有显著跨用户相似性(协同信号),提出 CollectiveKV 将 KV 分解为低维用户特有部分和从全局 KV 池检索的高维共享部分,实现 0.8% 的压缩率且性能不降。

From Evaluation to Defense: Advancing Safety in Video Large Language Models

构建 VideoSafetyEval(11.4k 视频-查询对覆盖 19 种风险类别)揭示视频模态使安全性能下降 34.2%,提出 VideoSafety-R1 三阶段框架(报警 Token+SFT+Safety-guided GRPO)在 VSE-HH 上提升 71.1% 防御成功率。

Adaptive Regularization for Large-Scale Sparse Feature Embedding Models

本文用 Rademacher 复杂度从理论上解释了 CTR/CVR 模型「训练超过一个 epoch 就严重过拟合」的根因——embedding 层范数无约束增长撑大了泛化界,并据此提出按特征出现频率自适应分配范数预算的正则方法 AdamAR:高频特征轻正则、低频特征重正则,既消除多 epoch 过拟合又能提升单 epoch 性能,已在阿里搜索广告线上部署。

Beyond Markovian Drifts: Action-Biased Geometric Walks with Memory for Personalized Summarization

本文提出"结构化游走假设"(SWH)质疑个性化摘要中通用的马尔可夫漂移假设(MDH),并给出轻量编码-解码模型 Walk2Pers——把用户偏好演化建模成带双记忆通道、可分解为幅度与方向(连续 vs 新颖)的动作偏置几何游走,在三个基准上显著超越专用摘要器与大模型。

Catalog-Native LLM: Speaking Item-ID dialect with Less Entanglement for Recommendation

针对"把 item-ID 塞进 LLM 会让协同信号和语言语义互相打架"这个问题,本文提出 IDIOMoE:把预训练 LLM 每个 block 的 FFN 拆成一个文本专家和一个item 专家,用静态的 token-type 门控按 token 类型分流(item-id token 走 item 专家,其余走文本专家),从而把"协同过滤"和"语义理解"解耦到不同子网络里,在公开和工业级数据集上都取得最强推荐效果,同时几乎不损伤原 LLM 的语言能力。

查看全部24篇「推荐系统」论文 →


🔄 自监督/表示学习 (81)

PonderLM: Pretraining Language Models to Ponder in Continuous Space

提出 PonderLM,在预训练阶段引入"沉思"机制——将预测概率分布加权求和为连续嵌入后反复前向传播,无需标注数据或强化学习,使 2.8B 模型在 9 个下游任务上超越 6.9B 模型。

InfoNCE Induces Gaussian Distribution

从理论上证明 InfoNCE 损失函数在两种互补机制下会诱导表征趋向高斯分布:经验理想化路线(对齐+球面均匀性→高斯)和正则化路线(消失正则项→各向同性高斯),并在合成数据和 CIFAR-10 上验证。

Fly-CL: A Fly-Inspired Framework for Enhancing Efficient Decorrelation and Reduced Training Time in Pre-trained Model-based Continual Representation Learning

受果蝇嗅觉回路启发,提出 Fly-CL 框架,通过稀疏随机投影+top-k操作+流式岭分类三阶段渐进去相关,在预训练模型持续学习中大幅降低训练时间的同时达到SOTA水平。

Regularized Latent Dynamics Prediction is a Strong Baseline for Behavioral Foundation Models

提出 Regularized Latent Dynamics Prediction (RLDP),通过在自监督的潜空间下一状态预测目标上添加简单的正交正则化来维持特征多样性,在零样本 RL 中匹配甚至超越复杂的 SOTA 表示学习方法,特别是在低覆盖率场景下优势显著。

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty

SNAP-UQ 提出一种面向 TinyML 场景的单次前向传播不确定性估计方法:在骨干网络的选定层附加微型 int8 预测头,用自监督方式预测下一层的激活统计量,将实际激活与预测之间的偏差("surprisal")聚合为不确定性分数,无需额外前向传播、时序缓冲或集成,仅增加几十 KB 闪存即可在微控制器上实现可靠的分布偏移检测和故障检测。

Difficult Examples Hurt Unsupervised Contrastive Learning: A Theoretical Perspective

通过相似度图模型理论分析严格证明"困难样本"(跨类高相似度样本对)会损害无监督对比学习性能——困难样本使泛化误差界严格恶化,提出删除困难样本、调节 margin 和温度缩放三种理论指导的缓解策略,在 TinyImageNet 上带来高达 10.42% 的线性探测准确率提升。这一发现是反直觉的:深度学习中通常"更多数据更好",但对比学习中精心移除困难样本反而有益。

Maximizing Asynchronicity in Event-based Neural Networks

提出EVA框架,将事件类比为语言token,用基于RWKV-6的线性注意力异步编码器实现逐事件特征更新,结合多表示预测(MRP)+下一表示预测(NRP)的自监督学习获得可泛化特征,首次在异步-同步(A2S)范式中成功完成高难度目标检测任务(Gen1数据集0.477 mAP)。

Why Prototypes Collapse: Diagnosing and Preventing Partial Collapse in Prototypical Self-Supervised Learning

诊断出原型自监督学习中部分原型坍缩的根因是编码器与原型的联合优化导致的快捷学习,提出全解耦训练策略——用在线 GMM 独立估计原型——彻底消除坍缩并提升下游性能。

Chart Deep Research in LVLMs via Parallel Relative Policy Optimization

提出 PRPO(Parallel Relative Policy Optimization),通过在奖励维度和数据类型两个层面做并行解耦优化,解决 GRPO 在多维奖励信号干扰和异构数据梯度冲突下的训练瓶颈;同时构建 MCDR-Bench,基于"错误唯一性原则"将主观生成评估转化为客观错误识别,实现图表深度研究能力的量化评估。

Exploiting Low-Dimensional Manifold of Features for Few-Shot Whole Slide Image Classification

发现病理基础模型特征具有低维流形几何结构(有效秩仅29.7/512维),而线性层会破坏这种结构导致少样本过拟合,提出即插即用的MR Block(冻结随机矩阵做几何锚+低秩残差路径做任务适配)在少样本WSI分类上达到SOTA。

查看全部81篇「自监督/表示学习」论文 →


📐 优化/理论 (220)

Convergence of Muon with Newton-Schulz

首次为实际使用的 Muon 优化器(使用 Newton-Schulz 近似而非精确 SVD 极坐标分解)提供非凸收敛保证:证明收敛速率匹配 SVD 理想化版本(差一个常数因子),该因子随 Newton-Schulz 步数 \(q\) 双指数衰减,且 Muon 比向量对应物 SGD-M 少 \(\sqrt{r}\) 倍秩损失。

Πnet: Optimizing Hard-Constrained Neural Networks with Orthogonal Projection Layers

提出 Πnet 架构,通过在神经网络输出层附加基于 Douglas-Rachford 算子分裂的正交投影层来保证凸约束的严格满足,并利用隐函数定理进行高效反向传播,在训练时间、求解质量和超参数鲁棒性上大幅超越现有方法。

Adaptive Rollout Allocation for Online RL with Verifiable Rewards (VIP)

提出 VIP(Variance-Informed Predictive allocation),通过高斯过程预测每个 prompt 的成功概率,据此用凸优化在计算预算约束下分配 rollout 数量以最小化梯度方差,在数学推理任务上一致提升 GRPO/RLOO 的采样效率,AIME24/25 上 Pass@32 最高提升 12.3 个点。

Saddle-to-Saddle Dynamics Explains A Simplicity Bias Across Neural Network Architectures

提出统一的理论框架,通过 saddle-to-saddle 学习动力学解释多种神经网络架构(全连接、卷积、注意力)中普遍存在的 simplicity bias——即梯度下降倾向于先学习简单解再逐步学习复杂解的现象。

FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization

FrontierCO 是一个涵盖 8 类组合优化问题(TSP、MIS、CVRP 等)的大规模真实世界基准测试,评估了 16 个 ML 求解器(神经网络方法 + LLM Agent)与 SOTA 传统求解器的差距,发现 ML 方法在结构复杂和极大规模实例上仍显著落后于传统方法,但在部分场景有超越潜力。

A Convergence Analysis of Adaptive Optimizers under Floating-Point Quantization

本文建立了首个在浮点量化下分析自适应优化器收敛性的理论框架,对梯度、权重和优化器状态(动量、二阶矩)同时施加相对误差量化模型,证明了量化 Adam 和 Muon 在尾数长度仅需对数增长于迭代次数时即可保持与全精度相同的 \(\tilde{O}(T^{-1/4})\) 收敛率,并揭示了 Adam 对权重和二阶矩量化高度敏感而 Muon 更为鲁棒的理论机制。

COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics

提出 COLD-Steer,通过近似梯度下降在上下文示例上产生的表征变化来实现无训练的 LLM 激活转向,在仅用 50 分之一样本量的情况下达到 95% 的转向效果。

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

CogFlow 提出认知启发的三阶段视觉数学推理框架(感知→内化→推理),通过 Synergistic Visual Rewards 增强感知、Knowledge Internalization Reward 桥接感知与推理、Visual-Gated Policy Optimization 锚定视觉推理,解决了现有方法中"感知正确但推理漂移"的核心问题。

Convex Dominance in Deep Learning I: A Scaling Law of Loss and Learning Rate

从凸优化理论出发,证明深度学习训练损失以 O(1/sqrt(T)) 速率收敛,最优学习率以 1/sqrt(T) 缩放,在 GPT-2 到 12.5B 参数模型上验证了该缩放律(R^2 >= 0.978),并实现了 80 倍训练步数的学习率外推。

DeepAFL: Deep Analytic Federated Learning

提出 DeepAFL,通过设计无梯度的解析残差块并引入逐层联邦训练协议,首次实现了具有表征学习能力的深度解析联邦学习模型,既保持了对数据异质性的理想不变性,又突破了现有解析方法仅限于单层线性模型的局限,在三个基准数据集上超越 SOTA 5.68%-8.42%。

查看全部220篇「优化/理论」论文 →


📐 学习理论 (294)

The Expressive Limits of Diagonal SSMs for State-Tracking

建立了输入依赖复数对角(DCD)SSM 在群状态追踪任务上的完整表达能力刻画:单层不能追踪任何非阿贝尔群,\(k\) 层能追踪群 \(G\) 当且仅当 \(G\) 存在长度为 \(k\) 的子正规链且因子均为阿贝尔群——精确定义了深度对表达能力的严格提升,同时实验揭示表达能力与可学习性之间的显著 gap。

In-Context Algorithm Emulation in Fixed-Weight Transformers

作者用构造性证明说明:一个权重冻结的极简 softmax Transformer,仅靠改 prompt 就能模拟一大类算法——单头单层注意力可逼近 \(f(w^\top x-y)x\) 形式的算法(梯度下降、线性/岭回归等),而一个固定的两层注意力模块更进一步,能通过 prompt 把目标算法的权重编码进 token,从而"换 prompt 即换算法",无需任何参数更新。

Deep FlexQP: Accelerated Nonlinear Programming via Deep Unfolding

提出 FlexQP——基于 \(\ell_1\) 弹性松弛的"永远可行"凸二次规划(QP)求解器,结合深度展开(deep unfolding)学习 LSTM 反馈策略加速收敛得到 Deep FlexQP;在 SQP 框架中作为子模块,解非线性轨迹优化比 OSQP 快 4-16 倍,预测安全滤波器的安全违规减少 70%+、任务完成率提升 43%。

Learning to Answer from Correct Demonstrations

这篇论文把 LLM 的 SFT 形式化为"上下文老虎机里从最优演示做模仿学习",证明只要奖励模型(哪些答案算对)属于低复杂度类(而非演示者策略属于低复杂度类)就够了——这是更弱的假设;并指出极大似然/SFT 在此假设下会失败,转而给出一个一遍在线算法,样本复杂度只与奖励类的对数基数有关、且在演示最优时享有 \(1/\varepsilon\) 的"乐观速率"。

An Efficient, Provably Optimal Algorithm for the 0-1 Loss Linear Classification Problem

提出增量单元枚举算法(ICE),首个具有严格证明的独立算法,可以在 \(O(N^{D+1})\) 时间内精确求解0-1损失线性分类问题的全局最优解,并扩展到多项式超曲面分类。

Lipschitz Bandits with Stochastic Delayed Feedback

首次系统研究连续臂空间 Lipschitz bandit 在随机延迟反馈下的学习问题,针对有界延迟提出 Delayed Zooming 算法(通过 lazy update 机制保持 \(\Delta(x) \leq 6r_t(x)\) 的子最优 gap 界),针对无界延迟提出 DLPP 分阶段剪枝策略(遗憾与延迟分位数 \(Q(p)\) 挂钩),并建立实例相关下界证明 DLPP 近最优。

The Price of Robustness: Stable Classifiers Need Overparameterization

建立了不连续分类器的稳定性-泛化界,证明了分类任务中的"鲁棒性代价定律":任何参数量 \(p \approx n\) 的插值分类器必然不稳定,实现高稳定性需要 \(p \approx nd\) 量级的过参数化。

"Noisier" Noise Contrastive Estimation is (Almost) Maximum Likelihood

通过给噪声分布人为放大一个倍数 \(M\),让 NCE 目标的梯度逐渐收敛到最大似然(MLE)梯度,从而在"目标分布与噪声分布差异巨大"这一经典难题(density-chasm)下也能快速、稳定地估计密度比——而代价几乎为零。

\(\mathbf{Li_2}\):刻画特征涌现与延迟泛化动力学的理论框架

本文提出 \(\mathbf{Li_2}\) 框架,从两层非线性网络的梯度动力学第一性原理出发,把 grokking(延迟泛化)拆成"懒惰学习→独立特征学习→交互特征学习"三阶段,证明独立阶段恰好是一个能量函数 \(E\) 的梯度上升、其局部极大值就是涌现的特征,并由此推出记忆/泛化边界的可证 scaling law。

A Biologically Plausible Dense Associative Memory with Exponential Capacity

通过把双层联想记忆里隐层的"赢者通吃"激活换成一个带阈值的阶跃激活,让隐层神经元能同时参与多个记忆(分布式表征),从而把存储容量从"隐层神经元数的线性"提升到"隐层神经元数的指数级"(\(2^{N_h}\)),并用 MNIST/CIFAR-10 验证了它能存下数万张高度相关的图像、同时保持生物可信性。

查看全部294篇「学习理论」论文 →


🔗 因果推理 (63)

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

系统研究偏好模型对五种表面特征(冗长、结构化、术语、谄媚、模糊)的过度依赖——通过因果反事实对量化偏差来源于训练数据的分布不平衡,并提出基于反事实数据增强 (CDA) 的后训练方法,将模型与人类判断的平均失校准率从 39.4% 降至 32.5%。

Resisting Contextual Interference in RAG via Parametric-Knowledge Reinforcement

提出 Knowledgeable-R1,一个基于强化学习的框架,通过联合采样参数知识(PK)和上下文知识(CK)的轨迹,结合局部/全局优势计算和自适应不对称优势变换,使 LLM 在 RAG 场景中能够抵抗误导性检索上下文的干扰,同时保留对可靠上下文的利用能力。

On the Eligibility of LLMs for Counterfactual Reasoning: A Decompositional Study

提出基于结构因果模型(SCM)的分解式评估框架,将 LLM 的反事实推理拆分为四个阶段(因果变量识别→因果图构建→干预识别→结果推理),在 11 个多模态数据集上系统诊断 LLM 在各阶段的能力瓶颈,并提出工具增强和高级 elicitation 策略来改善性能。

Efficient Ensemble Conditional Independence Test Framework for Causal Discovery

提出 E-CIT(集成条件独立性检验)框架,通过将数据分割为子集后独立执行检验并基于稳定分布的 p 值聚合方法合并结果,将任意条件独立性检验的计算复杂度降至关于样本量线性,同时在重尾噪声和真实数据等复杂场景下保持甚至提升检验功效。

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

提出SelfReflect度量指标——一个衡量LLM自述不确定性摘要与其真实内部答案分布之间差异的信息论距离,发现现代LLM普遍无法自主反映内部不确定性,但通过采样多个输出并反馈到上下文中可以生成忠实的不确定性摘要。

Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition

通过 off-by-one addition(如 1+1=3, 2+2=5)这一反事实任务,利用 path patching 发现大语言模型内部存在 function induction 机制——一种超越 token 级别 pattern matching、在函数级别进行归纳推理的注意力头电路,并证明该机制可跨任务复用。

Action-Guided Attention for Video Action Anticipation

提出动作引导注意力 (AGA) 机制,用模型自身的动作预测序列作为注意力的 Query 和 Key(而非像素特征),结合自适应门控融合历史上下文和当前帧特征,在 EPIC-Kitchens-100 上实现从验证集到测试集的良好泛化,同时支持训练后的可解释性分析。

An Orthogonal Learner for Individualized Outcomes in Markov Decision Processes

将因果推断中的半参数效率理论系统引入MDP的Q函数估计,证明经典的Q-regression和FQE本质上是有plug-in偏差的朴素学习器,并提出DRQQ-learner——一个同时具备双重鲁棒性、Neyman正交性和准oracle效率的元学习器,通过推导有效影响函数(EIF)构造去偏二阶段损失,在Taxi和Frozen Lake环境中全面超越基线方法。

Distributional Equivalence in Linear Non-Gaussian Latent-Variable Cyclic Causal Models

首次在线性非高斯设定下、不依赖任何结构假设,给出了含潜变量和环的因果图之间分布等价性的完整图准则,核心工具是新提出的边秩约束(edge rank constraints),据此开发了遍历等价类和从数据恢复因果模型的算法——这是参数化因果模型中首个无结构假设的等价性刻画和发现方法。

Counterfactual Explanations on Robust Perceptual Geodesics

提出 PCG(Perceptual Counterfactual Geodesic)方法,在鲁棒感知流形上通过测地线优化生成语义忠实的反事实解释,两阶段优化确保路径既感知自然又达到目标类别,在 AFHQ 上 FID=8.3 远优于 RSGD 的 12.9。

查看全部63篇「因果推理」论文 →


🔬 可解释性 (195)

GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

提出 GEPA(Genetic-Pareto)提示优化器,通过自然语言反思从少量执行轨迹中诊断问题并迭代优化提示,在六个任务上平均超越 GRPO 6%(最高20%),同时仅使用 1/35 的采样量。

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

发现窄域微调(narrow finetuning)在 LLM 激活中留下清晰可读的痕迹:即使在无关文本的前几个 token 上,微调前后模型的激活差异也编码了微调目标的语义信息。通过 Activation Difference Lens(ADL)方法,可解释性 agent 识别微调目标的成功率达 91%,比黑盒基线高 2 倍以上。

The Geometry of Reasoning: Flowing Logics in Representation Space

本文提出一个几何框架将 LLM 的推理过程建模为表示空间中的"流"(embedding 轨迹),通过解耦逻辑结构与语义内容的受控实验证明 LLM 内化了超越表面形式的逻辑不变量,并发现跨模型家族的可能普适表示规律。

Towards Understanding Subliminal Learning: When and How Hidden Biases Transfer

本文通过受控实验和机制分析揭示了潜意识学习(subliminal learning)的本质——教师模型的隐藏偏好通过少量"分歧token"(divergence tokens)传递给学生模型,且早期层是关键,同时发现该现象非常脆弱,简单的同义改写即可抑制。

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

从理论上分析了两层 Transformer 在有向图可达性问题上使用连续 Chain-of-Thought(Coconut)训练时的训练动力学,揭示了"叠加态"(superposition)机制如何自然涌现:index-matching logit 先增长后有界,从而在探索与利用之间取得平衡。

Tokenizing Single-Channel EEG with Time-Frequency Motif Learning

提出 TFM-Tokenizer,首个从单通道 EEG 学习时频 motif 词表并编码为离散 token 的框架,在事件分类、癫痫检测等任务上一致提升性能,且可作为即插即用组件增强现有 EEG 基础模型。

Hidden Breakthroughs in Language Model Training

提出 POLCA(Projection Oriented Loss Change Allocation)——一种沿低秩训练子空间任意正交基分解单样本损失变化的方法,从看似平滑的训练损失曲线中揭示出大量隐藏的概念性突破(hidden breakthroughs),将训练可解释性从"先定义技能再观测"翻转为"先分解再自动发现技能"。

Beyond Linear Probes: Dynamic Safety Monitoring for Language Models

提出截断多项式分类器(TPC),通过对 LLM 激活空间中的多项式逐阶训练和截断评估,实现动态安全监控——在简单输入上用低阶(≈线性探针)快速决策,在困难输入上增加高阶项提供更强防护,在 WildGuardMix 和 BeaverTails 两个数据集上匹敌或超越 MLP 基线且具备内置可解释性。

Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability

提出 Temporal SAEs (T-SAEs),通过引入时间对比损失鼓励高层特征在相邻 token 间保持一致激活,在无显式语义信号的自监督训练下实现语义与句法特征的解耦,恢复更平滑、连贯的语义概念且不牺牲重构质量。

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

首次在实际规模 LLM(7B MoE)的近单遍预训练中验证 grokking 现象——不同数据组异步记忆、延迟泛化;通过分析 MoE routing pathway 的演化(从 instance-specific 到 structured/shared),提出两个零成本指标来监控泛化进度,无需 instruction tuning 和 benchmark 评估。

查看全部195篇「可解释性」论文 →


📦 模型压缩 (239)

LightMem: Lightweight and Efficient Memory-Augmented Generation

提出 LightMem,一个受人类 Atkinson-Shiffrin 记忆模型启发的三阶段轻量记忆系统,通过认知感觉记忆预压缩、主题感知短期记忆整合、睡眠时离线更新三个模块,在 LongMemEval 上准确率提升最高7.7%,同时 token 消耗降低高达38倍。

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

提出 Landscape of Thoughts (LoT),首个将LLM推理轨迹可视化为二维地形图的工具,通过困惑度特征和t-SNE投影揭示推理行为模式,并可适配为轻量验证器提升推理准确率和测试时扩展效果。

Steering MoE LLMs via Expert (De)Activation

提出 SteerMoE,通过对比配对输入检测行为关联专家,在推理时通过激活/去激活特定专家来引导 MoE LLM 的行为(安全性提升 +20%,忠实性提升 +27%),同时揭示 MoE 模型的安全对齐脆弱性(安全下降 -100%)。

π-Flow: Policy-Based Few-Step Generation via Imitation Distillation

提出 π-Flow,通过修改学生流模型的输出层使其预测一个"策略"(policy),该策略在单个网络评估内通过多个子步生成动态流速度进行精确 ODE 积分,并采用模仿蒸馏(imitation distillation)方法在学生自己的轨迹上匹配教师速度,从而实现稳定可扩展的少步生成并避免质量-多样性权衡。

SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs

本文系统性地重新审视了领域特定SFT对LLM通用能力的影响,发现使用较小学习率即可大幅缓解通用能力退化,并提出Token-Adaptive Loss Reweighting (TALR)方法通过自适应下调低概率token的损失权重进一步优化领域适配与通用能力之间的权衡。

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning

提出 SwiReasoning,一种免训练的 LLM 推理框架,通过基于熵趋势的块级置信度估计,动态切换显式(chain-of-thought)和隐式(latent space)推理模式,在 Pareto 意义上同时改善准确率(+1.8%~3.1%)和 Token 效率(+57%~79%)。

The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm

首次证明 GPTQ(从后向前执行时)在数学上等价于经典格理论中的 Babai 最近平面算法,由此获得几何解释和层级误差上界,并基于此设计了无裁剪的改进量化方法。

LLM DNA: Tracing Model Evolution via Functional Representations

从生物学 DNA 类比出发,将 LLM DNA 数学定义为模型功能行为的低维双 Lipschitz 表示,证明其满足遗传和基因决定性属性,并设计了无需训练的 RepTrace 管道在 305 个 LLM 上提取 DNA、构建进化树。

Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning

提出 TIR-Judge,一个端到端的 RL 框架,训练 LLM 评判模型在评估过程中交替使用推理和代码执行工具,在7个公开基准上以 8B 参数超越 32B 推理奖励模型,且无需蒸馏的 TIR-Judge-Zero 可自举提升。

DiffVax: Optimization-Free Image Immunization Against Diffusion-Based Editing

DiffVax 训练一个前馈免疫器(UNet++),对任意图像仅需一次前向传播(~70ms)即可生成不可感知的对抗扰动,使基于扩散模型的恶意编辑失败,相比先前逐图优化方法实现 250,000× 加速,并首次将免疫扩展到视频内容。

查看全部239篇「模型压缩」论文 →


🕸️ 图学习 (118)

Relational Graph Transformer

提出 RelGT,首个专为关系型数据库设计的图 Transformer,通过多元素 Token 化(特征/类型/跳距/时间/局部结构 5 元组)和局部-全局混合注意力机制,在 RelBench 基准的 21 个任务上一致超越 GNN 基线,最高提升 18%。

RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation

提出 RAS 框架,在推理时为每个问题动态构建查询特定的知识图谱,通过迭代检索规划、文本到三元组转换和图增强回答三个阶段实现结构化推理,在 7 个知识密集型基准上对开源和闭源 LLM 分别取得最高 7.0% 和 8.7% 的提升。

Cooperative Sheaf Neural Networks

提出在有向图上定义 cellular sheaf 的 in/out-degree Laplacian,构建 Cooperative Sheaf Neural Network (CSNN),使节点能独立选择信息传播/接收策略,从而同时缓解过度挤压(oversquashing)和处理异配(heterophilic)任务。

Are We Measuring Oversmoothing in Graph Neural Networks Correctly?

指出广泛使用的Dirichlet energy指标无法在实际场景中正确捕获GNN过平滑现象,提出以特征表征的数值秩/有效秩(effective rank)作为替代度量。在深度2–24、各深度独立训练的设定下,Erank与准确率的平均相关性达0.91(且方向一致为正),而Dirichlet energy平均仅−0.72、相关方向在数据集间反复横跳(在大规模OGB-Arxiv等场景下尤其失效);并从理论上证明对线性及非负权重的非线性GNN族其特征矩阵数值秩收敛到1(秩坍塌),从而把过平滑重新定义为秩坍塌而非特征向量对齐。

Improving Long-Range Interactions in Graph Neural Simulators via Hamiltonian Dynamics

提出 Information-preserving Graph Neural Simulators (IGNS),利用 port-Hamiltonian 动力学结构在图上保持信息不耗散,结合 warmup 初始化、几何编码和多步训练目标,在 6 个物理仿真基准上全面超越现有图神经仿真器。

Pairwise is Not Enough: Hypergraph Neural Networks for Multi-Agent Pathfinding

提出 HMAGAT,用有向超图注意力网络替代 GNN 的成对消息传递来建模多智能体路径规划中的群体交互,仅用 1M 参数和 1% 训练数据即超越 85M 参数的 SOTA 模型。

Entropy-Guided Dynamic Tokens for Graph-LLM Alignment in Molecular Understanding

提出 EDT-Former(Entropy-guided Dynamic Token Transformer),通过熵引导的动态token生成机制,在冻结图编码器和LLM之间建立高效对齐,无需微调LLM主干网络即在分子问答、分子指令和属性预测等多个基准上达到SOTA。

Graph Tokenization for Bridging Graphs and Transformers

提出 GraphTokenizer 框架,将图通过可逆的频率引导序列化转换为符号序列,再用 BPE 学习图子结构词汇表,使标准 Transformer(如 BERT/GTE)无需任何架构修改即可直接处理图数据,在 14 个 benchmark 上达到 SOTA。

Learning Concept Bottleneck Models from Mechanistic Explanations

提出 Mechanistic CBM (M-CBM),利用 Sparse Autoencoder 从黑盒模型自身学到的特征中提取概念,再由多模态 LLM 命名和标注,构建可解释的 Concept Bottleneck Model,在控制信息泄露的条件下显著优于现有 CBM 方法。

GRAPHITE: Graph Homophily Booster — Reimagining the Role of Discrete Features in Heterophilic Graph Learning

提出 GRAPHITE,一种通过引入"特征节点"作为 hub 间接连接共享特征的节点来直接提升图同质性的非学习图变换方法,首次从"改变图结构"而非"改变 GNN 架构"的角度解决异质图问题,在 Actor 等困难基准上显著超越 27 种 SOTA 方法。

查看全部118篇「图学习」论文 →


📈 时间序列 (121)

Language in the Flow of Time: Time-Series-Paired Texts Weaved into a Unified Temporal Narrative

发现时间序列配对文本具有与时间序列相似的周期性(Chronological Textual Resonance),提出 TaTS 框架将文本表征转化为辅助变量,以即插即用方式增强任意现有时间序列模型的预测和插补性能。

Relational Transformer: Toward Zero-Shot Foundation Models for Relational Data

提出 Relational Transformer (RT) 架构,通过 task table prompting、cell tokenization 和 Relational Attention 机制,在多个关系数据库上预训练后可零样本迁移到未见过的数据集和任务,22M 参数模型零样本 AUROC 达到全监督方法的 93%,远超 27B LLM 的 84%。

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

TimeOmni-1 提出了首个统一的时间序列推理模型,通过 TSR-Suite(首个推理导向的时序数据集套件)和两阶段训练(SFT注入时序先验 + RL精炼推理),在多项时间序列推理任务上显著超越 GPT-4.1。

Uni-NTFM: A Unified Foundation Model for EEG Signal Representation Learning

Uni-NTFM 从神经科学第一性原理出发,设计异质特征投影(HFPM)解耦时频编码、分层拓扑嵌入(TE)统一异构电极配置、MoE Transformer 实现功能模块化与稀疏编码,在 28000 小时 EEG 数据上预训练 1.9B 参数模型,9 个下游任务上的线性探测和微调均达到 SOTA。

TSPulse: Tiny Pre-Trained Models with Disentangled Representations for Rapid Time Series

提出 TSPulse,仅 1M 参数的超轻量时间序列预训练模型,通过双空间掩码重建和双嵌入解耦策略,在分类(+5-16%)、异常检测(+20%)、插补(+50%)和相似性检索(+25%)四大任务上超越 10-100 倍大的模型。

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

构建了基于日本 EDINET 十年年报的金融基准 EDINET-Bench,包含会计欺诈检测、盈利预测和行业分类三项专家级任务,发现即使是 SOTA LLM 也仅略优于逻辑回归。

FeDaL: Federated Dataset Learning for General Time Series Foundation Models

提出 FeDaL 联邦框架,通过客户端域偏差消除(DBE)和服务器全局偏差消除(GBE)从头训练通用时序基础模型,在8类下游任务上以远少于集中式TSFM的参数达到竞争甚至超越的性能。

Benchmarking ECG FMs: A Reality Check Across Clinical Tasks

对8个ECG基础模型在12个数据集、26个临床任务上进行"现实检验"式全面基准评测,发现紧凑的结构化状态空间模型(SSM)ECG-CPC在7个任务类别中的5个上超越了大规模Transformer,证明架构设计比模型规模更重要。

From Samples to Scenarios: A New Paradigm for Probabilistic Forecasting

提出 Probabilistic Scenarios 范式,用模型直接输出有限个 {场景, 概率} 对取代采样,并用仅含三层平行线性层的 TimePrism 在5个基准数据集上取得9/10 SOTA。

Weight-Space Linear Recurrent Neural Networks

提出 WARP(Weight-space Adaptive Recurrent Prediction),将线性 RNN 的隐状态显式参数化为辅助 MLP 的权重和偏置,利用输入差分驱动线性递推来更新权重,结合非线性解码实现高效序列建模,在分类、预测和动力系统重建等任务上达到 SOTA。

查看全部121篇「时间序列」论文 →


🏥 医学图像 (86)

Learning Patient-Specific Disease Dynamics with Latent Flow Matching for Longitudinal Imaging Generation

提出 Δ-LFM 框架:用 ArcRank 损失在潜在空间构建患者特异性时间对齐轨迹(角度一致 + 幅度单调递增),将流匹配时间范围从 [0,1] 扩展到 [0,T] 实际时间间隔实现任意时间点预测,在三个阿尔茨海默纵向 MRI 基准上全面超越 8 种基线方法,并提出进展专用指标 Δ-RMAE。

LaVCa: LLM-assisted Visual Cortex Captioning

提出 LaVCa 方法,利用 LLM 为人类视觉皮层的每个体素生成自然语言描述(caption),通过"编码模型→最优图像选取→MLLM生成描述→LLM关键词提炼+句子组合"四步流程,比已有方法 BrainSCUBA 更准确、更多样地揭示了体素级视觉选择性。

Boosting Medical Visual Understanding From Multi-Granular Language Learning

提出 Multi-Granular Language Learning (MGLL),一个即插即用的对比学习框架,通过 soft CLIP loss、point-wise loss 和 smooth KL 散度联合优化,实现医学图像与多标签多粒度文本描述的对齐,在眼底和 X 光数据集上全面超越 SOTA 方法,并可作为视觉编码器嵌入多模态大语言模型提升诊断准确率最高达 34.1%。

Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer

提出 Brain-IT 框架,通过脑启发式的 Brain Interaction Transformer (BIT) 将功能相似的脑体素聚类为跨被试共享的 Brain Token,并从中预测局部化的语义和结构图像特征,实现从 fMRI 到图像的高保真重建,仅用 1 小时数据即达到先前方法 40 小时的性能。

DM4CT: Benchmarking Diffusion Models for Computed Tomography Reconstruction

提出DM4CT——首个系统性的CT重建扩散模型基准,涵盖十种扩散方法和七种基线方法,在医疗、工业和同步辐射三类数据集上进行全面评估,揭示了扩散模型在CT重建中的优势与局限。

Improving 2D Diffusion Models for 3D Medical Imaging with Inter-Slice Consistent Stochasticity

提出 Inter-Slice Consistent Stochasticity (ISCS),通过球面线性插值(Slerp)在扩散采样的 re-noising 步骤中生成层间相关噪声,从根源消除 2D 扩散先验做 3D 医学重建时的层间不连续伪影——零额外计算/超参数/训练开销,即插即用到任何 2D 扩散逆问题求解器,在稀疏视角 CT、限角 CT 和 MRI 超分辨率上均持续提升。

Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation

提出CDTSDE框架,在扩散模型的逆向SDE中嵌入可学习的空间自适应域混合场 \(\Lambda_t\),使跨模态翻译路径沿低能量流形前进,在MRI模态转换、SAR→光学、工业缺陷语义映射任务上以更少去噪步数实现更高保真度。

Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification

提出DyMo——推理时动态模态选择框架,通过理论推导将多模态任务相关信息增益转化为可计算的MTIR奖励函数(基于分类损失降低代理 + 类原型距离 + 类内相似性校准),在推理时迭代选择性融合可靠的恢复模态,首次系统性解决"丢弃缺失模态损失信息 vs 补全可能引入噪声"的困境。

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

提出 CARE 框架——将医学 VQA 拆分为"实体提议→指称分割→证据引导问答"三阶段专家管道,用 RLVR 微调各 VLM,并引入 GPT-5 作为动态协调器进行工具规划与 CoT 审查,在 4 个医学 VQA 基准上以 10B 参数量(77.54% 平均准确率)超越 32B 端到端 SOTA(72.29%)。

DISCO: Densely-overlapping Cell Instance Segmentation via Adjacency-aware Collaborative Coloring

将密集重叠细胞实例分割建模为图着色问题,提出"显式标记冲突节点 + 隐式邻接约束消歧"的分治框架 Disco,通过 BFS 分解细胞邻接图并引入五种协同损失函数,在高密度病理数据集 GBC-FS 2025 上 PQ 提升 7.08%,同时在四个异质数据集上均取得 SOTA。

查看全部86篇「医学图像」论文 →


🩺 医疗 LLM (20)

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

SimpleToM 揭示了 LLM 在 Theory of Mind 上的关键缺陷:前沿模型能准确推断他人心理状态(显式 ToM),但在将此知识应用于行为预测和行为判断时性能急剧下降(应用 ToM),暴露了"知道什么"与"如何使用所知"之间的重大鸿沟。

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of LLMs in Mental Health QA

联合100名持证心理健康专家构建CounselBench双组件基准——CounselBench-EVAL(2,000条六维度专家评估)和CounselBench-Adv(120个对抗性问题+1,080条响应标注),系统性揭示LLM在心理健康开放式问答中表面得分高但存在过度泛化、擅自医疗建议等安全隐患,同时证明LLM-as-Judge在安全关键领域严重不可靠。

MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science

构建了首个统一的生物医学数据科学 Agent 训练环境 MedAgentGym,包含 72,413 个任务实例(覆盖 12 个真实场景、129 个类别),配备可执行沙盒和可验证 ground truth,系统基准评估 29 个 LLM 揭示商业/开源差距,并通过高效多线程轨迹采样 + 离线/在线 RL 训练出 Med-Copilot,分别获得 +43.02%/+45.28% 提升,达到与 GPT-4o 竞争的性能。

ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue

提出 ATPO(自适应树策略优化)算法,将多轮医疗对话建模为层级马尔可夫决策过程(H-MDP),通过不确定性感知的自适应树扩展机制动态分配rollout预算,结合Bellman误差和动作值方差的复合不确定性度量来引导探索,在三个医学对话基准上以Qwen3-8B超越GPT-4o。

mCLM: A Modular Chemical Language Model that Generates Functional and Makeable Molecules

提出 mCLM(模块化化学语言模型),通过将分子表示为可合成构建模块的序列,使 LLM 能生成同时满足药理功能和自动化合成可行性的分子,在 430 种 FDA 批准药物上显著改善了药代动力学和毒性性质。

HistoPrism: Unlocking Functional Pathway Analysis from Pan-Cancer Histology via Gene Expression Prediction

本文提出 HistoPrism,一个高效的 Transformer 架构,通过交叉注意力注入癌症类型条件来从 H&E 病理图像预测泛癌基因表达,并提出基于 Hallmark/GO 通路的 Gene Pathway Coherence (GPC) 评估框架,在通路级别预测上大幅超越 STPath,尤其在低方差核心生物通路上优势显著。

Can SAEs Reveal and Mitigate Racial Biases of LLMs in Healthcare?

研究稀疏自编码器(SAE)能否揭示和缓解 LLM 在医疗场景中的种族偏见:发现 SAE 能识别出与种族相关的有害联想(如黑人与暴力),但在复杂临床任务中缓解偏见的效果有限(FLDD < 3%),远不如简单的提示策略(FLDD 8-15%)。

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

提出EHR-ChatQA基准,首次评估数据库Agent在电子病历场景中的端到端交互工作流(澄清模糊查询→解决术语不匹配→生成SQL→返回答案),发现最强模型(o4-mini)的Pass@5超90%但Pass∧5(全部成功)大幅下降(差距达60%),暴露了安全关键领域的鲁棒性缺陷。

Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine

提出 LEON(LLM-based Entropy-guided Optimization with kNowledgeable priors),一种数学原理严格的方法,将个性化医疗治疗方案设计建模为条件黑箱优化问题,通过熵约束和对抗性源批评模型引导 LLM 在不微调的情况下作为零样本优化器提出个性化治疗计划。

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

提出 Resp-Agent 闭环多智能体框架,通过主动对抗课程规划器(Thinker-A2CA)协调可控呼吸音生成器与多模态诊断器,在 229k 规模基准上实现生成↔诊断协同设计,大幅提升长尾类别诊断性能。

查看全部20篇「医疗 LLM」论文 →


🧬 计算生物 (155)

DriftLite: Lightweight Drift Control for Inference-Time Scaling of Diffusion Models

DriftLite 提出在 Fokker-Planck 方程中利用漂移-势函数的自由度,通过轻量级线性系统求解最优控制漂移来主动稳定粒子权重,以最小代价解决 Sequential Monte Carlo 中的权重退化问题,在高斯混合、分子系统和蛋白质-配体共折叠任务上大幅超越 Guidance-SMC 基线。

VCWorld: A Biological World Model for Virtual Cell Simulation

提出 VCWorld,一个细胞级白盒模拟器,整合结构化生物知识图谱与大语言模型的迭代推理能力,以数据高效的方式模拟药物扰动引发的信号级联,生成可解释的逐步预测和显式机制假说,在药物扰动基准上达到 SOTA。

scDFM: Distributional Flow Matching for Robust Single-Cell Perturbation Prediction

提出 scDFM,基于条件流匹配(CFM)的生成式框架,通过 MMD 正则化保证分布级保真度,并设计 PAD-Transformer 骨干处理噪声稀疏的单细胞数据,在组合扰动预测上比最强基线 CellFlow 的 MSE 降低 19.6%。

Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct

提出 DiDi-Instruct,一种基于积分 KL 散度 (IKL) 最小化的蒸馏框架,将预训练的扩散大语言模型 (dLLM) 蒸馏为少步学生模型,通过对抗性密度比估计 + 分组奖励归一化 + 分数分解 + 奖励引导祖先采样器 (RGAS) 四大关键设计,在 OpenWebText 上仅用 16 步即超越 1024 步教师模型的 PPL,实现最高 64× 推理加速,同时训练成本仅需 1 GPU 小时。

HeurekaBench: A Benchmarking Framework for AI Co-scientist

提出 HeurekaBench,一个基于真实科学工作流构建评测基准的框架,通过多LLM流水线从论文中提取可验证的科学洞见并生成开放式研究问题,用于评估AI co-scientist在数据驱动科学发现中的端到端能力。

Discrete Diffusion Trajectory Alignment via Stepwise Decomposition

提出 SDPO(Stepwise Decomposition Preference Optimization),将离散扩散模型的轨迹对齐问题分解为逐步后验对齐子问题,避免了在整条去噪链上反传梯度的困难,在 DNA 序列设计、蛋白质逆折叠和语言建模三个任务上均显著超越现有方法。

DistMLIP: A Distributed Inference Platform for Machine Learning Interatomic Potentials

提出 DistMLIP 分布式推理平台,基于零冗余图级并行化策略(graph-level parallelization),解决现有机器学习原子间势(MLIP)缺乏多 GPU 支持的问题,在 8 GPU 上实现接近百万原子的模拟,比空间分区方法快达 8 倍且能模拟 3.4 倍更大的系统。

Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence

提出Antibody防御框架:在对齐阶段通过平坦度正则化使模型处于有害损失的平坦区域(梯度小→难被攻击),在微调阶段用基于模型安全知识的样本加权方案(对比目标完成 vs 拒绝的似然比)抑制有害样本的学习,平均Harmful Score从15.29%降至7.04%。

A Genetic Algorithm for Navigating Synthesizable Molecular Spaces

提出 SynGA,一种直接在合成路线(合成树)上操作的遗传算法,通过自定义的交叉和变异算子将搜索严格约束在可合成分子空间内,结合 ML 驱动的构建块过滤实现 SOTA 的可合成类似物搜索和属性优化性能。

Verifier-Constrained Flow Expansion for Discovery Beyond the Data

提出Flow Expander (FE),通过验证器约束的熵最大化在概率空间中扩展预训练流模型的覆盖范围,使其生成超越训练数据分布但保持有效性的设计样本,在分子构象设计中增加多样性同时保持化学有效性。

查看全部155篇「计算生物」论文 →


⚛️ 物理/科学计算 (69)

Initialization Schemes for Kolmogorov-Arnold Networks: An Empirical Study

首次对样条KAN的初始化策略进行系统性研究,提出LeCun/Glorot启发的方差保持方案和可调幂律初始化族,在126K+模型实例的大规模实验中证明幂律初始化在函数拟合和PDE求解上全面超越基线,Glorot方案在大参数量模型上增益显著,NTK特征谱分析揭示了其背后的优化动力学机制。

Feedback-driven Recurrent Quantum Neural Network Universality

本文首次为基于反馈的循环量子神经网络 (RQNN) 建立了定量逼近误差界和普适性证明,表明 RQNN 可在 qubit 数仅以 \(\lceil\log_2(\varepsilon^{-1})\rceil\) 对数增长的条件下,以线性读出层逼近任意 fading memory 滤波器,且不受维度灾难影响。

Deep Learning for Subspace Regression

将缩减阶建模(ROM)中的子空间预测问题形式化为 Grassmann 流形上的回归任务,提出专用损失函数与子空间嵌入(subspace embedding)技术——通过预测比目标更大维度的子空间来降低映射复杂度——在特征值问题、参数化 PDE 和迭代法加速等场景中均取得显著效果。

Sublinear Time Quantum Algorithm for Attention Approximation

提出首个对序列长度 \(n\) 具有亚线性时间复杂度的量子数据结构,用于近似 Transformer 注意力矩阵的行查询,预处理时间 \(\widetilde{O}(\epsilon^{-1} n^{0.5} \cdot \text{poly}(d, s_\lambda, \alpha))\),每次行查询 \(\widetilde{O}(s_\lambda^2 + s_\lambda d)\),相对经典算法实现了关于 \(n\) 的二次加速。

DGNet: Discrete Green Networks for Data-Efficient Learning of Spatiotemporal PDEs

基于Green函数理论,将叠加原理嵌入物理-神经混合架构,构建离散Green网络DGNet,在仅用数十条训练轨迹的条件下实现SOTA精度,并展现对未见源项的鲁棒零样本泛化。

DRIFT-Net: A Spectral--Coupled Neural Operator for PDEs Learning

提出 DRIFT-Net 双分支神经算子,通过受控低频混合(谱分支)和局部细节保真(图像分支)的带宽融合(radial gating),解决窗口注意力中全局谱耦合不足导致的自回归漂移问题,在 Navier-Stokes 基准上误差降低 7%-54%。

Contact Wasserstein Geodesics for Non-Conservative Schrödinger Bridges

提出非守恒广义 Schrödinger 桥 (NCGSB)——基于接触哈密顿力学允许能量随时间变化,通过 Contact Wasserstein Geodesic (CWG) 将桥问题转化为有限维 Jacobi 度量上的测地线计算,用 ResNet 参数化实现近线性复杂度且支持引导生成,在流形导航、分子动力学、图像生成等任务上大幅超越迭代式 SB 求解器。

Stretching Beyond the Obvious: A Gradient-Free Framework to Unveil the Hidden Landscape of Visual Invariance

提出 Stretch-and-Squeeze(SnS)算法,一个无梯度、模型无关的双目标优化框架,通过在不同处理层级"拉伸"表征同时"压缩"目标单元激活来系统性地探测视觉系统的不变性流形,揭示了标准与鲁棒 CNN 之间不变性可解释性的分层差异。

\(\partial^\infty\)-Grid: A Neural Differential Equation Solver with Differentiable Feature Grids

用无限可微的径向基函数(RBF)插值替换特征网格里常用的线性插值,让原本只为"拟合信号"设计的快速网格表示第一次能稳定地算出高阶导数,从而把求解 Poisson/Helmholtz/Kirchhoff-Love 等微分方程的训练时间从几小时压到几秒到几分钟(5–20× 加速),精度还与 Siren 相当。

(U)NFV: (Un)supervised Neural Finite Volume Methods for Solving Hyperbolic PDEs

把经典有限体积法(FV)里"手工设计的数值通量"换成一个轻量 CNN,在保留 FV 守恒更新结构的前提下学习跨更大时空 stencil 的通量近似,既能监督训练(NFV)也能用弱形式残差无监督训练(UNFV),在一维双曲守恒律上误差比 Godunov 低最多 10 倍、逼近 DG 而实现复杂度只跟 FV 一样。

查看全部69篇「物理/科学计算」论文 →


🌍 地球科学 (7)

GeoFAR: Geography-Informed Frequency-Aware Super-Resolution for Climate Data

GeoFAR 将气候超分辨率中的低频偏置拆成“频率表达不足”和“地理条件缺失”两个问题,用 DCT 频率卷积核提取细粒度频带表示,再用经纬度与高程构成的地理隐式表示逐像素调制这些表示,从而在 ERA5、PRISM、CERRA 等多尺度气候降尺度任务上显著降低高频误差和复杂地形区域的预测偏差。

OmniField: Conditioned Neural Fields for Robust Multimodal Spatiotemporal Learning

OmniField 把"科学观测数据"(气候、空气污染)建模成一个以可用模态为条件的连续神经场,用多模态串扰块(MCT)+ 迭代跨模态精修(ICMR)在解码前对齐异构信号,无需打网格或插值预处理就能统一做重建/插值/预测/跨模态预测,相对 8 个强基线平均降低 22.4% 误差,且在重度传感器噪声下几乎不掉点。

RainPro-8: An Efficient Deep Learning Model to Estimate Rainfall Probabilities Over 8 Hours

RainPro-8 用一个仅 36.7M 参数的 MaxViT-U-Net,把雷达、卫星、数值天气预报(NWP)多源数据融合起来,通过「有序一致损失 + 单次前向预测全时刻」一次性输出欧洲 8 小时、高分辨率的概率性降水预报,精度超过现有 NWP、外推法和深度学习临近预报,同时推理比 MetNet 类方法快 48 倍。

Task-Adaptive Parameter-Efficient Fine-Tuning for Weather Foundation Models

针对天气基础模型(WFM)微调,提出 WeatherPEFT:前向用 Task-Adaptive Dynamic Prompting(TADP)从编码器嵌入权重里抽出"变量×分辨率×时空"的任务特征生成软 prompt,反向用 Stochastic Fisher-Guided Adaptive Selection(SFAS)只更新 Fisher 信息最高的少量参数,在三个下游任务上用 ~0.3%–4% 的可训练参数追平甚至超过全量微调(Full-Tuning)。

The Seismic Wavefield Common Task Framework

这篇论文把 NLP/CV 里催生 ImageNet、AlphaZero 的"通用任务框架(Common Task Framework, CTF)"思路搬到地震学,提供三套多尺度地震波场数据集 + 一套 12 分制的隐藏测试集评测协议,并用它公平横评了 18 个主流科学机器学习模型——结果发现绝大多数复杂模型连"全预测 0"的朴素基线都打不过。

TianQuan-S2S:通过引入气候态构建次季节-季节全球天气预报模型

TianQuan-S2S 把"长期气候平均态"通过注意力融合塞进 patch embedding、并在 ViT 每一层注入可学习的高斯噪声,专治数据驱动模型在 15–45 天次季节预报上"越预测越糊"的模型坍缩问题,在 ERA5 上同时超过数值模式 ECMWF-S2S 和数据驱动的 FuXi-S2S。

揭示连续表示全波形反演的机制:一个基于波的神经正切核框架

本文把神经正切核(NTK)理论扩展到全波形反演(FWI),提出"基于波的 NTK"统一刻画传统 FWI 与连续表示 FWI(CR-FWI),用其特征值衰减速率解释了"为什么 INR 表示更鲁棒却高频收敛慢",并据此设计出 INR 与多分辨率网格混合的 IG-FWI,在鲁棒性与收敛速度之间取得更优权衡。


📡 信号/通信 (7)

Mamba-3: Improved Sequence Modeling using State Space Principles

从SSM视角提出三项核心改进:指数-梯形离散化、复值状态空间、多输入多输出(MIMO)公式化,在不增加解码延迟的前提下显著提升模型质量和状态追踪能力,推进性能-效率Pareto前沿。

Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection

提出 Directer(Dynamic Rejection Steering),通过在每个解码步动态调节 KV 缓存引导强度并引入合理性约束,显著提升 LLM 指令遵循能力,同时避免过度引导导致的文本质量下降。

Advancing Spatiotemporal Representations in Spiking Neural Networks via Parametric Invertible Transformation

针对脉冲神经网络(SNN)二值脉冲表示能力受限、替代梯度失配两大顽疾,本文提出参数化可逆变换 PIT——在神经元发放(firing)前后以共轭方式各做一次可逆线性变换,发放前把膜电位分布"重排"成易量化的形态、发放后把整数脉冲"增广"成跨时空的实值输出,同时配一个把输入推离量化决策边界的修正替代梯度,并用线性代数刻画了 SNN 时空表示容量;在 CIFAR、ImageNet、DVS 等数据集上多种架构均刷新 SOTA(如 SEW ResNet34 涨 5.62%)。

Efficient Message-Passing Transformer for Error Correcting Codes

EfficientMPT 把 Transformer 纠错码解码器里 \(O(n^2)\) 的标准注意力换成一套只靠"全局 query 向量 + 逐元素乘"的线性复杂度 EEC 注意力,在保持与 SOTA(CrossMPT)相当的纠错性能的同时,对长 LDPC 码把显存和 FLOPs 砍掉数十倍,并且参数量与码长无关、能当一个可微调的纠错"基础模型"。

Lossy Common Information in a Learnable Gray-Wyner Network

把信息论里的经典 Gray-Wyner 网络做成可学习的三通道编解码器,用一个带 β 超参的目标函数把两个视觉任务之间的"公共信息"和"私有信息"分离开,并在"发送速率"与"接收速率"之间做可调权衡。

Synchronizing Probabilities in Model-Driven Lossless Compression

针对 LLM 驱动的无损压缩中"编解码两端预测概率必须逐位完全一致、否则级联解码崩溃"的致命问题,本文提出 PMATIC——一种把比特概率量化到分箱、再用低熵 helper 比特让两端锁定同一量化概率的算术编码替代方案,能容忍有界的预测失配,理论上保证正确解码,实测在真实跨机非确定性下全部文件正确还原,同时压缩率仍大幅领先 gzip/cmix 等传统工具。

TS-DDAE: A Novel Temporal-Spectral Denoising Diffusion AutoEncoder for Wireless Signal Recognition Model Pre-training

针对无线信号识别(WSR)预训练,本文把扩散模型的"加噪-去噪"范式引入信号自监督,提出 TS-DDAE:在时域和频域同时给 IQ 信号注入高斯噪声,再用专门设计的双编码器 TS-Net(时域自注意力 + 频域通道注意力)联合还原,学到的表征在 4 个数据集、AMC/WTC 等多任务上平均超过最优基线 1.32%、超过 AMC SOTA 模型 IQFormer 约 8.75%。


👥 社会计算 (17)

Tracing and Reversing Edits in LLMs

针对知识编辑(Knowledge Editing)的双重使用风险,提出 EditScope 方法从编辑后的权重中推断被编辑的目标实体(准确率高达 99%),以及基于 SVD bottom-rank 近似的无训练编辑逆转方法(逆转率高达 94%),仅依赖编辑后的权重、不需要编辑 prompt 或原始权重信息。

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

提出首个专门针对社会政治危害的LLM安全评估基准 SocialHarmBench,包含585条覆盖7个领域、34个国家的提示,揭示了当前LLM在历史修正主义、宣传操纵等政治敏感场景中的系统性安全漏洞。

SAGE: Spatial-visual Adaptive Graph Exploration for Efficient Visual Place Recognition

提出 SAGE,一个统一的 VPR 训练框架:引入轻量 Soft Probing 模块增强局部特征判别力,每个 epoch 在线重建融合地理距离与视觉相似度的亲和图,再通过贪心加权团扩展聚焦最难样本,冻结 DINOv2 骨干仅训练 1.96M 参数即在 8 个基准上全面 SOTA。

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

本文构建了 BiasFreeBench 基准,首次在统一框架下系统比较 8 种主流去偏方法(4 种 prompting + 4 种 training),聚焦于 LLM 响应层面的偏差评估,并提出了 Bias-Free Score 指标,发现 prompting 方法(尤其是 CoT)整体优于 training 方法,而 DPO 在跨偏差类型泛化上表现突出。

Mitigating Mismatch within Reference-based Preference Optimization

揭示 DPO 的"过早满足"问题——当 reference 策略对 chosen 的概率低于 rejected 时(~45% pairs),DPO 的梯度被 reference 的悲观信号不必要地衰减(即使策略仍然错误即 \(\Delta_\theta < 0\));提出 HyPO(一行代码修改:\(\max(0, \Delta_{ref})\) 裁剪 reference margin),在 AlpacaEval 2.0 上相对 DPO 提升 41.2%。

Propaganda AI: An Analysis of Semantic Divergence in Large Language Models

提出 RAVEN 审计框架,通过结合模型内语义熵和跨模型分歧来检测 LLM 中的概念条件语义分歧——一种类似宣传的行为模式,即高层概念线索(意识形态、公众人物)触发异常一致的立场响应。

Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation

提出将 Tsallis 熵(SE 的广义形式)引入 VLM 的 Test-Time Adaptation,并进一步发展为自适应去偏 Tsallis 熵(ADTE),为每个类别定制去偏参数 \(q^l\),在不引入分布特定超参数的情况下比 Shannon 熵选择更可靠的高置信视图,在 ImageNet 及其 5 个变体和 10 个跨域 benchmark 上均超越 SOTA。

GRADIEND: Feature Learning within Neural Networks Exemplified through Biases

提出GRADIEND——一个基于梯度的编码器-解码器架构,通过单个瓶颈神经元从模型梯度中学习可解释的单语义特征(以性别为例),不仅可以识别哪些权重编码了特定特征,还能通过解码器直接修改模型权重来消除偏见,与INLP结合在所有基线模型上达到SOTA去偏效果。

Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction

对9个SOTA语音对话系统开展首次语音图灵测试(2968次人类判断),发现所有系统均未通过(成功率7%-31%),瓶颈不在语义理解而在副语言特征、情感表达和对话人格,并构建了18维细粒度评估框架和可解释AI评审模型。

Scalable Multi-Task Low-Rank Model Adaptation

系统分析多任务 LoRA 在任务数量增大时崩溃的根因(均匀正则化破坏共享知识 + 组件级 LoRA 放大梯度冲突),提出 mtLoRA:谱感知正则化 + 块级适配 + 细粒度路由,在 15-25 个任务上平均超越 SOTA 2.3%,同时减少 47% 参数和 24% 训练时间。

查看全部17篇「社会计算」论文 →


🛡️ AI 安全 (139)

VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents

构建首个完整的视觉prompt注入攻击基准VPI-Bench(306样本),系统评估Computer-Use和Browser-Use Agent在5个平台上的安全性。发现Browser-Use Agent极度脆弱(Amazon/Booking上100% AR),即使Anthropic的CUA也存在严重漏洞(最高59% AR),系统prompt防御无效。

Watermark-based Detection and Attribution of AI-Generated Content

首次系统性研究基于水印的AI生成内容用户级检测与溯源,提供了理论分析(TDR/FDR/TAR界)、高效水印选择算法(A-BSTA)和跨模态(图像+文本)实验验证,证明检测和溯源继承了水印方法本身的准确性与(非)鲁棒性。

Back to Square Roots: An Optimal Bound on the Matrix Factorization Error for Multi-Epoch Differentially Private SGD

提出 Banded Inverse Square Root (BISR) 矩阵分解方法,通过对逆相关矩阵(而非相关矩阵本身)施加带状结构,首次在多轮参与差分隐私 SGD 中实现渐近最优的分解误差界,并配套低存储优化变体 BandInvMF。

Dataless Weight Disentanglement in Task Arithmetic via Kronecker-Factored Approximate Curvature

该工作将曲率近似的经典理论(KFAC)与任务算术的实际需求巧妙结合,提出了一种无需外部数据的权重解缠正则化方法。理论推导清晰,从表征漂移正则化 → Jacobian Gramian → GGN → KFAC 的逻辑链条流畅。实验覆盖视觉和语言两个领域的多种模型规模,对 \(\alpha\) 超参数的鲁棒性分析很实用。不足在于 KFAC 对大模型仍有 \(O(d^2)\) 存储开销,且在文本领域与使用外部数

Time Is All It Takes: Spike-Retiming Attacks on Event-Driven Spiking Neural Networks

提出Spike-Retiming Attack——一种仅改变脉冲时间戳而不增删脉冲的时序攻击方法,形式化了容量-1约束下的统一三范数预算(\(\mathcal{B}_\infty\)局部抖动/\(\mathcal{B}_1\)总延迟/\(\mathcal{B}_0\)篡改数),通过Projected-in-the-Loop (PIL)优化在前向严格投影、反向软微分间解耦,在CIFAR10-DVS/DVS-Gesture/N-MNIST上以<2%脉冲扰动达到>90% ASR,揭示事件驱动SNN存在严重的时序脆弱性。

Sample-Efficient Distributionally Robust Multi-Agent Reinforcement Learning via Online Interaction

本文首次研究了分布鲁棒马尔可夫博弈(DRMGs)的在线学习问题,提出 MORNAVI 算法,在无需模拟器或离线数据的情况下,通过在线交互高效学习最优鲁棒策略,并提供了 TV 散度和 KL 散度不确定性集下的首个可证明遗憾界。

ATEX-CF: Attack-Informed Counterfactual Explanations for Graph Neural Networks

提出 ATEX-CF 框架,首次将对抗攻击的边添加策略与反事实解释的边删除策略统一起来,通过联合优化预测翻转、稀疏性和合理性,为 GNN 生成更忠实、更简洁、更合理的实例级反事实解释。

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

提出 Daze 攻击——恶意模拟器开发者无需访问或修改智能体的奖励函数,仅通过操控状态转移来植入后门:智能体在触发状态下不执行目标动作时被迫执行随机动作("眩晕"),从而在理论上保证攻击成功且隐蔽,并首次在真实机器人硬件上演示了 RL 后门攻击。

Membership Privacy Risks of Sharpness Aware Minimization

本文首次系统性地揭示了 SAM(Sharpness-Aware Minimization)训练的模型虽然泛化性能更好,但反而比 SGD 更容易遭受成员推断攻击(MIA),并从记忆化行为和方差收缩两个角度给出了理论和实验解释。

Unified Privacy Guarantees for Decentralized Learning via Matrix Factorization

将去中心化学习(DL)中的多种算法和信任模型统一建模为矩阵分解(MF)机制,推广隐私保证到更一般的矩阵类型,并提出 MAFALDA-SGD 算法通过优化噪声相关性在合成和真实图拓扑上显著优于现有方法。

查看全部139篇「AI 安全」论文 →


📂 其他 (115)

Bayesian Influence Functions for Hessian-Free Data Attribution

提出 Local Bayesian Influence Function (BIF),用 SGLD 采样估计的协方差替代经典影响函数中不可行的 Hessian 逆运算,实现了对数十亿参数模型的无架构限制数据归因,在重训练实验中达到 SOTA。

PlanetAlign: A Comprehensive Python Library for Benchmarking Network Alignment

提出 PlanetAlign,一个集成 18 个跨 6 个领域的数据集、14 种覆盖三大类别(一致性、嵌入、最优传输)方法和标准化评估流程的 PyTorch 网络对齐基准库,通过大规模系统实验揭示了 OT 类方法(PARROT/JOENA)在有效性上的全面领先以及各类方法在可扩展性和鲁棒性上的差异化表现。

Learning on a Razor's Edge: Identifiability and Singularity of Polynomial Neural Networks

本文利用代数几何工具,对多项式激活的 MLP 和 CNN 进行了系统性分析:证明了 MLP 的有限可辨识性和 CNN 的唯一可辨识性,揭示了稀疏子网络对应神经流形的奇异点,并从"临界暴露性"角度给出了 MLP 稀疏偏差的几何解释——而 CNN 不具备这种偏差。

LPWM: Latent Particle World Models for Object-Centric Stochastic Dynamics

LPWM 是首个能扩展到真实世界多物体数据集的自监督物体中心世界模型,核心创新是为每个粒子学习独立的潜在动作分布(per-particle latent actions),通过因果时空 Transformer 并行编码所有帧,支持动作/语言/图像目标/多视角等多种条件生成,在视频预测上达到 SOTA 并展示了模仿学习能力(OGBench task3 成功率 89%)。

TabStruct: Measuring Structural Fidelity of Tabular Data

提出 TabStruct 评估框架和 global utility 指标,在不需要真实因果图的情况下衡量表格数据生成器对因果结构的保真度,在 29 个数据集上系统比较 13 种生成器,发现扩散模型在全局结构保持上显著优于其他方法。

The Hot Mess of AI: How Does Misalignment Scale With Model Intelligence and Task Complexity?

将AI模型错误分解为偏差(systematic misalignment)和方差(incoherent behavior),发现:推理越长→越不连贯;更大模型在困难任务上更不连贯。这暗示未来超级AI更可能表现为"工业事故"式的不可预测失败,而非一致追求错误目标。

Learning Structure-Semantic Evolution Trajectories for Graph Domain Adaptation

提出DiffGDA——首个将扩散模型引入图域适应(GDA)的方法,用随机微分方程(SDE)建模源图到目标图的连续时间结构-语义联合演化过程,配合基于密度比的域感知引导网络驾驶扩散轨迹朝向目标域,理论证明收敛到最优适应路径,在8个真实数据集14个迁移任务上全面超越SOTA。

The Counting Power of Transformers

证明 Transformer 不仅能捕获(半)线性计数性质,还能表达所有半代数计数性质(即多元多项式不等式的布尔组合),从而推广了先前关于 Transformer 计数能力的所有结果,并由此推导出新的不可判定性结论。

Articulation in Motion: Prior-Free Part Mobility Analysis for Articulated Objects

提出AiM(Articulation in Motion)框架,从交互视频和初始状态扫描中无需部件数量先验地重建铰接物体——通过双高斯表征(静态GS + 可变形GS)实现动静解耦,结合顺序RANSAC进行无先验部件分割和关节估计,辅以SDMD模块处理新暴露的静态区域,在复杂6部件物体(Storage)上以79.34% mean IoU大幅超越需先验的ArtGS(52.23%)。

Fast and Stable Riemannian Metrics on SPD Manifolds via Cholesky Product Geometry

揭示Cholesky流形上的简单乘积结构,基于此提出两种快速且数值稳定的SPD度量(PCM和BWCM),所有黎曼算子均有闭式表达式,在SPD深度学习中实现效果、效率和稳定性的三重提升。

查看全部115篇「其他」论文 →