🧠 NeurIPS2026 论文汇总¶
233篇NeurIPS2026论文解读,涵盖优化/理论(16篇)、计算生物(11篇)、时间序列(11篇)、AI 安全(10篇)、可解释性(10篇)、强化学习(10篇)、学习理论(9篇)、多模态 VLM(9篇)等 50个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。
💡 LLM Reasoning (8)¶
- Advancing Entropy-Level Credit Assignment in RLVR via Proximal Entropy Policy Optimization
-
PEPO 将成功推理轨迹中 token 的更新权重改为相对邻域的不确定性,并保持每条轨迹的总权重不变,在数学推理主实验中优于所比较的 GRPO 与全局熵基线,但趋势鲁棒性和跨任务推广均有明确边界。
- Diversity Combining for Multi-Path LLM Reasoning
-
本文用正确性相关与设计效应解释多路径推理的收益饱和,并从有标签的离线四路径试运行估计固定部署预算;在五个模型–任务组合上,选取 4–10 条路径保留了 32 路径二元多数票准确率的 96%–103%,但这一评测指标不等同于开放答案的实际相对多数投票准确率。
- Externalized CPDAG Summaries Improve LLM Causal Deduction
-
Structured Thinking 先让同一个大语言模型生成受格式约束的 CPDAG 摘要,再依据该图判断因果命题是否在所有相容 DAG 中成立,在 Corr2Cause 上将 Qwen3.5-27B 主种子 F1(YES) 从 73.01 提升到 86.36,但结构合法性和全等价类推理仍没有形式化保证。
- Provable Test-Time Scaling for Beam Search in LLM Reasoning
-
本文在只能采样下一 token、不能读取完整 logits 的设定下,用低频 token 过滤改进束搜索,并在前缀似然与正确性对齐的条件下,将搜索所需样本对最难一步覆盖系数的依赖从最坏情形二次降至近线性;真实 LLM 矩阵乘法实验的准确率由 37.2% 提升至 38.8%。
- Reasoning-Trace Collapse: Evaluating the Loss of Explicit Reasoning During Fine-Tuning
-
本文把“答得对”与“仍会输出完整显式推理”分开评测,发现无推理轨迹的常规微调可让模型在 Chemistry 上准确率提高而有效推理率降至零附近,并用推理区域损失掩码缓解这一结构性退化,但效果依赖模型与任务。
- SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance
-
SAGE 在后训练中用“操作是否对应未解决约束”和“新状态是否接近目标结构”两类软势函数同时引导候选采样与奖励,在保留普通推理时解码的前提下改善长程推理;Qwen3.5-35B 的数学平均准确率由 GRPO 的 61.92% 提升至 64.86%。
- Structured Sparse Memory for Recurrent Reasoning
-
CoSE 用因子化 FiLM 条件分支与 rank-32 实例残差替代庞大任务表,在受控 ARC 实验中将任务记忆参数缩至约 1/15 并提高 pass@2;结合合成数据、循环计算和延长训练的 CHARM 系统达到 ARC-AGI-1 / 2 公共评测 84.0% / 46.7%,不能把这一系统成绩全部归因于 CoSE。
- Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning
-
这篇诊断研究把扩散生成和奖励评分统一计入推理预算,发现 Dream-7B 的确定性 top-1 PRM 引导不如独立采样加任务匹配 ORM,并通过候选池、终局评分和读出消融拆出失败发生的位置。
🦾 LLM Agent (4)¶
- AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering
-
AgentHop 将 1,011 道科学文献四选题放入七工具、三重预算沙箱,用论文召回、条件转化率、调用模式与资源失败四个轴解释智能体为何答错;论文测试中 Gemini-3 Pro 的准确率为 89.1%,但相近总分也可能掩盖不同的检索与综合瓶颈。
- ContractBench: Can LLM Agents Preserve Observation Contracts?
-
ContractBench 用虚拟时钟、字节校验和 HTTP 轨迹验证评测智能体是否遵守工具产物的跨步骤契约,在本文 38 个模型变体的实验快照中,最高成功率为 77.8%,且规模或版本升级并不保证可靠性提高。
- MoMHa: Multi-Objective Optimization of LLM Harnesses over Accuracy, Safety, and Tokens
-
MoMHa 在不更新模型权重的前提下,让 proposer 根据执行轨迹改写 Python 程序外壳,联合优化准确率、行为安全和 Token 成本;作者报告合成与真实基准的联合均值领先,但指标缩放、两阶段定义和成本口径存在需澄清的来源冲突。
- ToolSearcher: Optimizing Tool Selection at Scale via Reinforcement Learning
-
ToolSearcher 用类别约束课程、首次发现目标工具的事件级优势和按轨迹进度分配的信用训练多轮工具选择器,在 StableToolBench 上将 Qwen2.5-7B-Instruct 的整体 F1 从 GDPO 的 0.496 提升到 0.513,并改善 AppWorld 中由独立执行智能体完成任务的结果。
👥 Multi-Agent (4)¶
- AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems
-
AgentGrad 用单智能体干预寻找可修复失败的提示,以干预前后的中间输出差异提取文本梯度,再按共同纠错模式聚类与抽象;GPT-5-mini 五项任务平均较未优化提示提高 11.76 个百分点,但部分性能和成本概括需以表格中的例外为准。
- DAGent: Evaluate-then-Grow Planning for Deep Research Agents
-
DAGent 让规划智能体先评估已完成子任务、再增量扩展研究 DAG,并用分层证据传递与 DAGRPO 结构奖励改进执行:无训练 Qwen3-32B 在三个基准上达到 47.3 / 55.3 / 65.0 Pass@1,比同架构先规划后修补变体高 5.3 / 4.8 / 4.0 个百分点。
- Measuring Collapse and Correction in Homogeneous-Panel LLM Debate
-
本文将同一模型的三智能体辩论拆成保留正确、坍塌、纠错与未修复四类转移,结合辩论前筛查和逐轮轨迹定位风险;但离线冻结回放在阻止 29 次坍塌的同时丢失 108 次纠错,说明风险信号不等于有效控制策略。
- XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication
-
XBridge 用确定性词汇锚点映射传递完整上下文 token,再用成对训练的交叉注意力桥读取发送者隐状态,在三个异构模型配对的七项任务上均优于 128-token 文本摘要通信,并在指定 H200 测试中把单样本延迟从 1.70 秒降至 0.15 秒。
⚖️ 对齐 / RLHF (2)¶
- Authority Bias in Language Models: Source Deference and User Agreement Are Not Interchangeable
-
论文固定错误答案、只改变背书者,用方向移除与独立拟合的归因补丁证明:在三个开放权重模型家族中,服从错误来源与迎合用户具有可选择性干预的差异,不能用同一种迎合评测代替。
- Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment
-
GAPO 在当前策略附近沿批次平均偏好间隔的下降方向构造临时几何锚点,以各偏好对的间隔退化量调低脆弱样本的更新权重,在多个对齐评测和受控噪声实验中取得改进,但不保证所有模型、指标都胜出。
🔒 LLM 安全 (5)¶
- Contrastive Representation Shaping for LLM Unlearning
-
CLReg 用同一遗忘样本的增强视图作正对、保留样本作负对,在基础遗忘目标之外塑形隐藏表示,改善多组实验的综合遗忘分数,但表示分离本身不等于知识删除,也不提供隐私保证。
- LLM Alignment–Utility Asymmetry under Semantic-Preserving Transformations
-
本文通过原始表示与语义保持表示之间的配对评测,发现任务能力的迁移并不保证安全行为同步迁移,并用良性数据条件、协议对照和防御性监督分析限定这一经验结论。
- Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems
-
本文以 SkillCascade-Bench 的 213 个经过筛选的案例说明:逐技能审查通过不等于联合执行安全;在三类智能体系统与八种模型的沙箱压力测试中,作者报告平均成功率 89.4%,而面向行为组合的防御只取得部分改善。
- Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models
-
论文用 DSAR 衡量推理轨迹与最终答案的安全判定不一致,并提出 SARA,将早期安全意识、整段推理安全和答案安全联合用于在线强化学习,在两个 DeepSeek 系模型上改善受扰动推理的一致性,但并非所有场景或安全指标都优于答案奖励基线。
- UnlearningSoup: Is Repeated Tuning Necessary for Large Language Model Unlearning?
-
UnlearningSoup 把训练式大语言模型遗忘中的部分重复调参改为评测驱动的权重插值:EfficientSoup 从原模型和两个已训练遗忘模型搜索,PerformanceSoup 合并已有候选,在多个基准上改善经验性遗忘—保留质量并降低选模成本,但并不取消基础遗忘训练或提供认证遗忘保证。
👻 幻觉检测 (1)¶
- The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining
-
论文从生成前的作答—弃答 logit 间隔定位稀疏的作答—弃答电路(Commit-Abstain Circuit,CAC),发现早期作答积累与晚期弃答纠偏不足的模式,再用分量级贡献训练轻量策略,将报告的平均决策准确率从 0.692 提升至 0.814,而非证明答案内容准确率提高。
📊 LLM 评测 (5)¶
- LLM Judge Validation Under Sparse Overlap: From Inference to Design
-
本文把 LLM 裁判验证中的重叠标注数量和分配方式当作统计设计问题:用一致性估计的方差分析规划重叠样本,再以分层分配改善代表性;真实基准上低重叠会显著改变部署结论和裁判排名,但分层降低误拒的同时可能增加误批。
- OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models
-
OTROPE 在语义嵌入空间中用最优传输重加权旧模型的人类标注残差,再校正新模型的代理评测均值,无需响应概率即可降低跨模型偏好胜率估计误差,但有效性依赖表征覆盖与残差可迁移性,并非所有偏移设置都优于 PPI。
- SciR: A Controllable Benchmark for Scientific Reasoning in LLMs
-
SciR 先生成可验证的演绎、归纳与因果发现问题,再将前提改写为多篇科学体裁文本,通过分别改变推理复杂度与前提混淆来诊断 LLM;即使使用符号求解器,文档形式化仍是显著瓶颈。
- Solving Every Step Is Not Enough: Milestone Oracles Reveal a Composition Gap in LLM Math Reasoning
-
OracleLadder 固定教师编写的数学子目标,用“逐个子目标独立测试”和“原题逐级提供路线及答案”交叉诊断六个模型,发现经筛选的 354 道 NuminaMath 题中,33–48% 属于子目标均可解但原题仍未恢复的组合缺口;排除自动复核标记的评分问题后仍为 24–37%,但这不是纯粹的内部组合能力因果测量。
- SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation
-
SpanUQ 将离线多样本回答的声明一致性蒸馏到冻结 LLM 的隐状态探针,用集合预测定位语义跨度并输出连续不确定性,五个分别训练的骨干探针取得 0.908–0.944 AUROC,同时支持比整段拒答更细粒度的风险筛选。
⚡ LLM 效率 (6)¶
- Adaptive Mass-Segmented KV Compression for Long-Form Reasoning
-
AMS 不替换 token 重要性评分器,而是先用注意力质量分布自适应切段并分配保留配额,再在段内评分筛选,从而缓解长推理中连续区域被清空的问题;Math500 上 AMS-Expected 在 256-token 缓存预算下比 AdaKV-ExpE2 高 16.0 个百分点。
- Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models
-
ADAS 在不训练模型、不改变基础采样器停止规则的前提下,用候选位置对本轮已选位置的注意力及后者的不确定性动态折扣置信度,在低去噪调用次数条件下改善并行解码质量;两种模型的任务与方法平均收益分别为 9.11 和 10.46 个百分点。
- Block Sparse Flash Attention
-
BSFA 在 FlashAttention-2 内先精确计算所有因果可见的 QK 分数,再用离线校准的块最大值阈值跳过低分块的 V 读取、PV 和 softmax 状态更新,在 Llama-3.1-8B 的 LongBench 上以 39.78% 对比稠密基线 40.24% 的分数,获得最长 10 个样本上 1.13× 的端到端预填充加速。
- Fractional State Space Transition for Long Sequence Modeling
-
Frac 用共享几何时间尺度上的有限指数模式近似分数阶长记忆,再加入逐 token 控制和独立读写路由,在保持有界递归状态的同时将 1.3B 模型的 LongBench 平均分从 GDN 的 16.0 提高到 17.9,但并非所有任务或速度指标都领先。
- It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs
-
Synth 把有来源的百科种子扩写为多任务指令与推理数据,使最终 Baguettotron 学生模型从随机初始化经一个训练流程获得指令和事实能力;600M 型号在种子实体上的可核验事实精度为 79.3%,但这一结果不代表广泛知识覆盖,也不包含免费获得教师和数据生成的假设。
- SEED: Self-Speculative Decoding via Implicit Encoder–Decoder
-
SEED 把原有解码器模型的末两层训练成草稿生成器,复用上轮完整模型验证留下的深层 KV 缓存,在任务专属微调与自适应树验证设置下,使 Qwen3-1.7B/4B 的平均解码速度达到 AR 基线的 2.6/2.7 倍,同时保持或提升任务质量。
📚 预训练 (1)¶
- Spectral-Sphere-Constrained Hyper-Connections
-
s²HC 将多流残差矩阵从非负双随机约束放宽到保持均值的谱范数球面,用零和子空间上的动态旋转与有界缩放实现非退化混合,在三个从头预训练的语言模型上将八项评测平均准确率提高到 47.1、50.2 和 50.7。
✏️ 知识编辑 (1)¶
- Open-Vocabulary Domain Unlearning
-
本文把视觉域遗忘从“训练过的类别上失效”推进到“未参与遗忘训练的类别也应失效”,通过 Fisher 掩码限制视觉参数更新,再用定向流形散射(TMS)强化局部几何扰动,在少样本 CLIP 分类实验中改善遗忘与保留的折中,但不构成数据删除或语义保留的认证保证。
🗣️ 对话系统 (1)¶
- Mutable Transcripts: Mitigating Context Pollution through Editable Conversation State
-
本文让用户用自然语言重写整段对话的历史状态,而不是继续追加纠正消息;17 人的受控研究支持其可用性,三个代表性案例显示保留记录更短,但并未证明长期任务性能或总 API 成本改善。
🌐 多语言/翻译 (1)¶
- One Threshold Does Not Fit All Languages: Language-Conditional Deferral for Reliable and Efficient Low-Resource Text Classification
-
本文给同一个低成本多语言分类器配置逐语言保形阈值,缓解混合校准掩盖的语言覆盖率缺口,并把可靠性代价显式转化为各语言的人工转交预算;保证针对全部流量中的错误自动输出概率,而非自动输出的条件准确率。
🔍 信息检索/RAG (1)¶
- LogicTree-RAG: Logic Tree-guided Retrieval-Augmented Generation for Long-form Patent Drafting
-
LogicTree-RAG 先把研究论文组织为可检索、可递归扩展的证据关联逻辑树,再按章节混合遍历生成长篇专利说明书草稿,在 Pap2Pat 测试集上得到 20.22k 输出 tokens、43.79 覆盖度和 66.34 的来源结合事实性,但这些结果不等于可专利性或法律有效性认证。
💻 代码智能 (5)¶
- CodeScaler: Scaling Code LLM Training and Test-Time Inference via Reward Models
-
CodeScaler 把高质量执行反馈蒸馏为代码奖励模型,用严格代码提取和奖励塑形支撑无需在线执行的强化学习与候选重排序,在 DeepCoder 上让 8B/14B 策略的四项基准平均 Avg@8 分别超过 RLVR 1.55/4.23 个百分点。
- Counterfactual Rollout Replay: Forkable Environments as Free Process Rewards for Software Engineering Agents
-
CRR 在训练时恢复软件工程轨迹中的少量决策状态,用原轨迹与替代动作后续轨迹的终局回报差评价原动作,在同一八卡 H100 节点、40.125 小时训练窗口内,将 SWE-bench Verified 的 pass@1 从延长训练 GRPO 的 36.7% 提高到 41.7%,但不免除分叉执行成本。
- CTE-Bench: Counterfactual Trace Evaluation for Stateful Software Simulators
-
CTE-Bench 用真实执行生成软件干预前后的响应轨迹,在固定未来调用上评测模型能否持续预测干预效果:正确历史答案可见时影响步骤准确率为 54.3%–61.5%,自由滚动时降至 24.8%–33.2%,整条轨迹完全正确的比例最高仅 1.2%。
- Execution Guided Line-by-Line Code Generation
-
EG-CFG 在推理时预览并执行代码前缀的多种短续写,把运行轨迹注入提示,再通过双分布无分类器引导逐 token 生成、逐行刷新反馈;使用 DeepSeek-V3-0324 时,论文报告 MBPP / HumanEval / DS-1000 准确率分别为 96.6% / 99.4% / 69.9%,但依赖可执行的已提供测试与额外搜索计算。
- Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation
-
MemDocAgent 用依赖与目录层级共同约束的遍历顺序,以及可读取、写入和验证的 RepoMemory,让单一智能体连续生成组件、模块和仓库三级文档;在 20 个 Python 仓库上,Qwen3-Coder 配置取得 0.979 完整度、0.916 真实性和 0.690 有用性,但验证失败后的保覆盖回退并不保证每篇文档都可信。
🎨 图像生成 (6)¶
- All Roads Lead to Rome: Flow-driven Multi-Anchor Exploration for Open-Environment Active 3D Mapping
-
本文用条件流匹配生成多个长期探索锚点,再通过障碍感知规划、探索模式聚类与层次路径选择决定机器人怎么走,在 AiMDoom 同难度评测及难度迁移、AiMDoom→MP3D 跨数据集迁移中提高建图覆盖率,但不提供任意开放环境的泛化保证。
- One View Is Enough: In-the-Wild Monocular Pretraining for Novel View Generation
-
OVIE 用冻结深度模型把 30M 张单图转换为局部有效的伪视图训练对,以遮罩重建与感知损失学习可见区域、以全图对抗先验补全未知区域,最终仅凭源图和目标位姿单次前向生成新视角,在 H100 上达到 116 FPS,并能通过多视图微调提升域内表现。
- Panoptic Scene Program Diffusion Transformer
-
PSP-DiT 把包含实例、属性、关系与数量的全景场景程序变成与图像共同去噪的潜变量,用区域归属和循环一致性监督约束其视觉实现,在匹配的内部基线上将 GenEval 2 从 32.8 提升至 38.2,同时报告约 1.12 倍推理时延。
- PixelDiT2: Representation-Grounded Pixel Diffusion Transformers
-
PixelDiT2 在每次像素去噪时重新编码当前噪声图像,以冻结 DINO 的逐块表示和时间步适配器提供空间条件,在不引入自编码器的前提下取得 ImageNet-256 的 FID 1.46(600 epochs)和 ImageNet-512 的 FID 1.48(680 epochs)。
- Rethinking Cross-Layer Information Routing in Diffusion Transformers
-
DAR 将扩散 Transformer 的逐层残差累加改为时间步感知的历史子层输出注意力,在 ImageNet 256×256 上以 600K 步取得无 CFG 的 ODE FID 7.56,相比训练 1.75M 步的 SiT 基线降低 2.11,并能与 REPA 的表征对齐损失结合。
- Revisiting Diffusion Fine-Tuning for Unsupervised Domain Adaptation
-
MUSE 将扩散生成器的适应拆成仅由源域标签训练的共享语义分支和目标域条件化风格分支,一次源域参与的微调支持多个目标域生成桥接数据,在三个闭集分类基准上提升下游 UDA 平均准确率,并相对 Terra 将生成器微调时间缩短至原来的约一半至四成。
🎬 视频生成 (8)¶
- Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
-
SplitMoE 将视频扩散 Transformer 的稀疏专家分成语义与通用两组,用干净 VAE 特征引导语义路由,在总参数 27B、激活参数 14B 的预算下改善同源基线的视频质量,而非让所有专家强行承担等量 token。
- GLARE: Generating Listening Heads with Appropriate Reactions
-
GLARE 将倾听者的点头、微笑等反馈建模为有类别和时间边界的事件,通过韵律条件流匹配与训练期反应监督,在 RealTalk 和 Seamless 上提高反应一致性,但其指标衡量的是单参考一致性,而不是唯一正确的社交反应。
- Motion Forcing: Decoupling Ego and Object Motion via Sparse Inputs for Structured Video Generation
-
Motion Forcing 将稀疏物体轨迹与相机运动先转为动态深度,再用共享扩散骨干渲染 RGB 视频,在 Waymo 上取得 FVD 157.8、FVMD 205.2、Physics-IQ 33.2,以部分视觉分布相似度换取更好的运动一致性与物理合理性。
- PhyProbe: Rethinking Physical Consistency Evaluation in Generated Videos
-
PhyProbe 在冻结的视频编码器上训练轻量评分头,用异构数据提供的排序、严重程度回归与端点锚定共同学习单视频物理违规分数,在四个物理基准中的三个取得最高成对准确率,但其分数仍是感知合理性的代理而非物理定律检验。
- PISCO: Precise Video Instance Insertion with Sparse Control
-
PISCO 用可变密度条件训练、编码前补帧与编码后掩码,以及深度和外观增强,把少量实例关键帧传播到已有视频;在 PISCO-Bench 上,14B 模型的首尾帧控制将全视频 FVD 从 VACE 的 371 降至 204,但比较方法的输入条件并不相同。
- Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models
-
DyMoS 在图像到视频模型的早期去噪中,仅对文本条件分支的“非参考帧查询→参考帧键”自注意力 logits 减去可调偏置,使 Wan 2.2 的 VBench Dynamic Degree 从 51.7 提升至 64.8,但更强动态性并不自动意味着更真实的运动或更高的参考保真度。
- Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution
-
ReMind用事件帧图、可靠锚点训练和保留原始时空地址的KV缓存教视频生成器跨遮挡恢复状态,在STEVO-Bench取得最高总分300.9,但状态推进仅14.5%,证据仍主要支持短时恢复而非长期不可见物理演化。
- ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing
-
ViTeX-Bench 用真实视频配对训练数据、冻结评测集和三轴 13 项指标揭示文字正确、运动稳定与背景保留之间的差异,并提供带运动对齐字形条件的 ViTeX-Edit-14B 参考编辑器,其字符准确率均值在受测视频原生编辑器中最高,但并非所有指标最优。
🧩 多模态 VLM (9)¶
- Beyond Prediction: Steering VLM Agents with Retrospective World Modeling
-
RWM 让 VLM 智能体根据相邻观测的文本信念状态反推前一轮动作,并把动作与转移的一致性转成训练奖励;完整配置在四类交互任务上取得原表报告的 0.81 Overall 成功率,但其提升同时涉及回溯推理、双层 GAE、外部评审和 SCR,不能全部归因于 SCR。
- Binding Multiple Modalities via Multimodal Wasserstein Barycenter
-
BaryBind 用可学习的 Wasserstein 重心映射替代固定模态锚点,再围绕重心对多模态差向量做体积对比学习,在 VAST 骨干上的零样本检索与分类实验中取得提升,但其公开公式的对偶推导、势函数抵消及部分实验数字存在需要核实的不一致。
- Exemplar2VQA: A Scalable Exemplar-Driven Visual Question Answering Generation Framework via Multi-Agent Coding
-
Exemplar2VQA 将空间问答样例编译成可复用的仿真采图与几何标注程序,以四角色协作及执行反馈减少生成错误,仅用约 10K 合成样本便将 Qwen2.5-VL-3B 在 VSI-Bench 多项选择子集上的作者报告平均分从 35.3 提升至 42.9。
- MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
-
MulTaBench 用“多模态确有互补收益”和“目标感知表示优于冻结嵌入”两道经验筛选,构建包含 20 个图像–表格与 20 个文本–表格任务的基准,并发现表示适配的收益可推广到新学习器,但并非每个入选数据集都稳定受益。
- SemMSA: Latent Semantic-Aided Robust Multimodal Sentiment Analysis with Incomplete Data
-
SemMSA 将残缺的文本、视觉和音频证据送入冻结 LLM,递归追加连续隐状态获得辅助语义,再用实例内核谱对齐和实例间分离学习稳健表示,在十档模态内缺失率平均评测中取得 MOSI Acc-2 74.36/73.91、MOSEI 79.61/79.38、SIMS 75.46。
- Spherical Interpolation for Backward-Compatible Multimodal Representations
-
在不重建旧图库索引的条件下,先用 Procrustes 将新模型查询对齐到旧空间,再与同一输入的旧模型查询做球面插值;多数平均检索增益来自两端表示的互补,而支持集选权重进一步提高兼容成功率。
- The Alignment Illusion in Multimodal Large Language Models
-
本文在 13 个多模态大语言模型中用等范数噪声与无关图像检验内部视觉—文本对齐,发现共享 MLP 权重足以制造高相似度,并提出主角度间隙区分单方向塌缩与多方向结构,但明确指出几何结构不能单独证明模型使用了与问题相关的视觉内容。
- Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
-
Argus 用统一的单步 GUI 点击记录比较不同可观测接口下的不确定性方法,发现固定模型时方法排序较易跨数据集迁移,而跨模型与开放权重到 API-only 的迁移明显减弱,且错误识别能力不能代替概率校准或空间覆盖检验。
- Who Says What: Symbolic Trimodal Binding Mechanisms in Audio-Visual LLMs
-
本文在受控成功轨迹上用表征分析和激活干预解释视听大模型如何经由时间与位置 ID 绑定“谁说了什么”,据此以现成活跃说话人检测器生成视觉提示,并通过可选轻量微调改善对话理解,但免训练收益依赖模型的视觉标记理解能力。
🧠 VLM Reasoning (2)¶
- Can Linguistic Reasoning Vectors Enhance Multimodal Reasoning Ability?
-
LIFT 从基础大语言模型中提取“有无推理过程时,同一答案 token 的隐状态差”,将其注入对应视觉语言模型的语言层,在不更新主干的条件下,把两个模型的六任务平均准确率从 66.6/67.8 提升到静态干预的 68.3/69.0,向量适配后达到 69.1/69.4。
- OneCanvas: 3D Scene Understanding via Panoramic Reprojection
-
OneCanvas 将多视角图像的 patch 特征提升到 3D 后,作为独立连续 token 放到统一全景坐标系,用原生 RoPE 表达角度与帧序、用加性嵌入表达度量位置,再以合成空间课程预训练和真实问答适配,在 SQA3D、VSI-Bench、SPBench 分别取得 65.3、71.3、72.1。
⚡ VLM Efficiency (2)¶
- Beyond Selection: Token Parameterization for Extreme Visual Token Compression
-
Braco 不再从原始 patch 中挑出少数 token,而是用 DCT 低频骨干、基坐标嵌入、预算相关的坐标组织与稀疏池化空间残差构成紧凑视觉接口,在 576→16 token 时保留 94.0 的 Vanilla 归一化综合得分,并将全流水线 prefill 延迟降至 40.59 ms。
- G2TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
-
G2TR 在分离编码器统一多模态模型的 LLM 预填充之前,利用 VAE 潜在锚点选择并合并理解侧视觉词元;保留 50% 词元时,BAGEL 的理解相对平均分为 99.0%、编辑为 98.0%,预填充 FLOPs 降低约 1.94 倍,但并非所有任务都无损。
🎵 音频/语音 (5)¶
- Audible World Models: Spatially Aware Sound Generation for 3D Worlds
-
Audible World Models 将全景生成、声源语义解析、干声合成和几何声学连接起来,把声音存为三维世界的持久状态;在保持较强语义匹配的同时,得到更准确的运动相关方向线索,但目前仍是静态世界的离线构建系统。
- OpenWhistle: A Large-Scale Longitudinal Dataset and Benchmark of Bottlenose Dolphin Vocalizations
-
OpenWhistle 将单一海豚群体的多年水下录音整理为约 18 万声哨声的预训练语料和 8,354 声专家标注子集,用会话级划分与冻结表示线性探测建立类型分类和检测基准,语料内预训练的 Wav2Vec2.0 达到 81.1% 分类准确率和 75.6% 检测 mAP,但不涉及海豚语言意义的解码。
- Passing: An Endless Journey through Reconstructed Spacetime with AI-Generated Sound
-
Passing 将一段单轨列车窗景重采样为可分支播放的非线性时空旅程,让观众的在场状态间接改变视觉路径,再由经过装置适配的 SpecMaskFoley 实时生成声音,呈现的是展览案例与创作观察,而非声音还原精度的受控实验。
- Reconstructing the Vocal Tract with Differentiable Acoustic Simulation
-
本文把声道建模为可微的动态声学管道,用频域求解、平滑湍流门控和神经几何参数化,从声音反推声道面积及 MRI 可视化;默认配置的前向合成达到实时的 71.5 倍,但重建结果是声学兼容的几何解释,不是唯一的解剖真值。
- SENSE: Semantic Neural Speech Synthesis from Brain Dynamics via Spatial Graph Encoding
-
SENSE 用电极几何图编码和仅在语义一致试次上学习的 EEG 语义条件,改善被动听觉 N400 数据中的脑电到语音波形重建;未见被试上的 WER 从 FE-Phoneme 的 1.1231 降到 0.9948,但仍远非可靠语言恢复。
🔎 AIGC 检测 (1)¶
- Can Pixels Alone Reveal Image Origin? Minimax Limits and Learnable Interfaces for Passive Provenance
-
本文以总变差距离精确刻画仅凭像素进行被动来源验证的最优鲁棒分离上限,并将这一统计界限与具体验证器的接口信息暴露风险分开,有限状态验证支持理论恒等式,而图像实验并未给出真实图像上的鲁棒性证书。
🧊 3D 视觉 (8)¶
- DirectUV: Image-Conditioned UV Texture Generation with Surface-Aware Positional Encoding
-
DirectUV 在冻结的 Flux VAE 潜在 UV 空间直接生成网格纹理,把三维表面坐标写入各注意力头的旋转位置编码,并将参考图和粗 UV 仅作为条件,在 GSO 上取得 25.13 PSNR、0.9527 SSIM,同时改善跨 UV 岛的一致性与细节。
- M-plicits: Neural Implicit Surfaces via Nested Multiscale Residuals
-
M-plicits 用全域粗 SIREN 加逐级窄带监督的残差 SIREN 重建有向点云,并让追踪、网格提取和属性映射复用这一层级,在较小参数量下获得实时渲染与较强的合成测量噪声鲁棒性,但并非所有精度和速度指标都胜出。
- NRF-GS: Neural Residual Fields for Expressive and Compact Gaussian Splatting
-
NRF-GS 用共享的低频/高频神经残差分支替换逐高斯球谐外观,在不改增密与剪枝规则的情况下,以更少的高斯获得更高的平均 PSNR,但并非在感知质量或渲染速度上全面胜出。
- Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction
-
AFG 在冻结的 CUT3R/TTT3R 推理流程中,用相邻帧内部特征的变化生成一个正值帧级写入权重,与 token 门相乘以减少重复帧覆盖历史,在不丢帧、不再训练且保持恒定记忆的条件下将 KITTI 平均 ATE 从 68.54 m 降至 43.96 m,但并非所有序列和误差指标都改善。
- SceneScaffold: Active Scene-State Construction for Unified 3D Scene Understanding
-
SceneScaffold 把固定的 100 个视觉 token 分配给细节、实体、空间参照、关系和全局摘要,在语言推理前组织场景证据,相比 3D-LLaVA 将 ScanRefer / Multi3DRefer 的 mIoU 从 43.3 / 42.7 提高到 47.0 / 47.9。
- Seeing Speech: Learning Visible Articulatory Dynamics for Speech-Driven 3D Facial Animation
-
Seeing Speech 将面部运动按展宽、张口和前突三个坐标方向学习,通过语音—发音记忆检索局部运动特征,再用拓扑感知残差组合成三维网格动画,在 VOCASET 和 TFHP 上降低面部与嘴唇重建误差,但并未恢复真实发音器官的生理机制。
- Seg3DParts: Segmentation-Grounded Controllable Part-Level 3D Generation
-
Seg3DParts 将外部提供的部件分割分别注入两阶段 3D 生成器,并让各部件潜变量交换结构信息,在保留训练时相对坐标的空间中直接输出独立网格;其优势是可指定分解方式且减少部件互穿,而不是自动发现未知部件。
- Towards Generalizable 3D Anomaly Detection via Relational Inconsistency Modeling
-
GRIM 用正常点云生成局部关系破坏作为监督,通过边感知图细化与样本内簇偏差建模学习缺陷判据,在 Anomaly-ShapeNet 达到 97.4/94.5 的物体级/点级 AUROC,直接迁移到 Real3D-AD 仍达到 83.6/89.6。
🎯 目标检测 (1)¶
- Beyond Normal References: Discriminative Few-Shot Anomaly Detection
-
IDEAL 利用固定的少量正常与带掩码异常参考,先消除正常局部变化,再提取多样的本征偏差方向并进行投影评分,在无需目标域重训练的条件下改善已见及未见异常检测;MVTecAD 的 N1A1 设置达到 96.3 / 96.8 的图像级 / 像素级 AUROC。
✂️ 语义分割 (3)¶
- Preference-Guided Adaptation for Open-Vocabulary Semantic Segmentation via Prompt Disagreement
-
本文把不同提示模板产生的局部分割分歧转成一次二选一监督,用区域局部偏好优化和区域外一致性适应开放词汇分割模型;在真值驱动的偏好 oracle 实验中,CAT-Seg-L 的 MESS 平均 mIoU 从 35.26 提升至 45.88。
- Universal Cross-Prompt Adversarial Attacks on Promptable Concept Segmentation
-
AdvPCS 从提示变化、概念感知与时序记忆三个层面评估可提示概念分割的脆弱性,在受控数字输入实验中使 SA-CO 文本提示下的三模型平均视频 mIoU 从 70.24% 降至 4.61%,但这不等于对任意提示、模型或现实输入都成立的失效保证。
- When Noise Meets Long-Tail: Feature-Threshold Dual Calibration for Robust Pseudo-Labeling
-
FTC-Seg 在教师—学生半监督分割中同时用原型残差重建改善噪声下的特征、用标注准确率和类别分布偏差调整伪标签阈值,在 2% 标注的四个基准上,DINOv2-S 配置相对 UniMatch V2 提升 2.09–8.54 个 mIoU 百分点,但并非所有配置都最优。
🖼️ 图像恢复 (4)¶
- Beyond Spatial-Domain Supervision: A Relation Constrained Space for Multi-Modal Image Fusion
-
RCS-Fusion 不把源图像当成理想融合图像,而是从冻结的 DINO/CLIP 特征学习关系监督空间,用共享、互补和冲突协调约束训练不同融合骨干,Transformer 版本在 M3FD 的融合图像检测中取得 0.730 mAP。
- i-DEQ: A stable inertial deep equilibrium model for image restoration
-
i-DEQ 将带重启的惯性优化嵌入显式能量型深度均衡模型的训练与推理,在小规模图像恢复实验中获得接近 ELDER 的重建质量并显著缩短均衡求解时间,但理论保证是有条件的驻点复杂度,实际训练也并非始终稳定。
- Learning Where and What to Restore for Composite Image Restoration
-
CART 在一个 U-Net 内用窗口级空间路由分配恢复算力,再用多热退化监督塑造的任务特征控制图像级通道路由,在 CDD-11 上取得 29.95 dB 平均 PSNR,但其速度优势伴随比 MoCE-IR 更高的参数量与峰值内存。
- Multidimensional Observer Model and Perceptual Dimensions of Human Image Quality Assessment
-
本文把图像表示为低维感知空间中的高斯分布,用带噪采样后的参考距离比较拟合人类选择,发现 CORnet-S Multi 模型在 BAPPS、PieAPP、NIGHTS 上分别以 3、9、96 维达到自身超随机性能的 95%,表明不同质量判断任务需要不同的感知结构。
🛰️ 遥感 (2)¶
- PolyTopoBench: A Benchmark for Complex Vector Polygon Generation from Remote Sensing Imagery
-
PolyTopoBench 用两套航空影像、四类地物和 11 个公开基线,把多边形评测拆为区域、环边界和完整环结构,揭示即使复杂实例的 IoU 达到 0.9,其拓扑错误率仍为 84%–100%。
- SatNav: A Scalable Benchmark for Long-Horizon UAV Vision-Language Navigation from Satellite Imagery
-
SatNav 用卫星影像和 OpenStreetMap 自动构造 118,494 个长时程导航 episode,并以 SwiftVLN 隔离比较记忆设计:只保留短期记忆会使两个测试集的成功率均下降 21.3 个百分点,而真实飞行迁移仍只得到 18 个 episode 的初步验证。
🧑 人体理解 (7)¶
- BiMoGen: Bidirectional Motion-Text Generation via Unified Masked Discrete Diffusion
-
BiMoGen 用统一运动文本词表和双向掩码扩散模型同时完成运动生成与运动描述,通过先对齐后条件生成的训练及生成感知自纠错,在 HumanML3D 上取得 T2M R@1 0.555、M2T CIDEr 60.2,但并非所有指标都优于已有统一模型。
- FactorizedHMR: A Hybrid Framework for Video Human Mesh Recovery
-
FactorizedHMR 先确定性估计躯干、体型与相机坐标轨迹,再固定这些结构,用掩码流匹配补全四肢、头部和世界运动;主要收益体现在严重遮挡与轨迹漂移,而不是所有常规指标均领先。
- GazeFlow: From Human Gaze Behavior to Generative Egocentric Gaze Prediction
-
GazeFlow 用视频局部特征和全局任务 token 条件化整段视线轨迹的流匹配生成,在 EGTEA Gaze+ 上取得 F1 0.491、平均角度误差 9.01,同时改善轨迹位移统计,但其默认模型依赖未来帧,不能直接当作在线眼动追踪器。
- PoseBridge: Bridging the Skeletonization Gap for Zero-Shot Skeleton-Based Action Recognition
-
PoseBridge 不另加 RGB 动作识别分支,而是把姿态估计过程中尚未被关节坐标压缩掉的视觉语义保留下来,再用骨架条件桥接与语义原型适配完成零样本识别,在 Kinetics-200/400 的八个测试划分上比最强被比较基线提高 13.3–17.4 个百分点。
- Re:Cognize: Open-Set Comic Character Re-Identification
-
Re:Cognize 用同一阅读顺序下的四种图库协议分离漫画角色的身份出现与身份维护,发现直接按预测标签扩充图库会损害随机种子下的识别,而 Re:Cast 通过角色均值、页内证据和跨页绑定,在明确条件下恢复部分正确标签更新的收益。
- STRIDE: Automated Evaluation of Text-to-Trajectory Alignment across Diverse Contexts
-
STRIDE 将文本描述的人群情境预编译为行为问题、确定性测量函数和期望区间,再对生成轨迹逐项核验;其基准包含 936 个情境,Text-Crowd 的总体得分为 0.645,而人工对基准答案的同意率为 80%,但后者只来自有限的标注子集。
- Towards Unified Dynamic Face Landmark Detection
-
本文用“人脸部位 + 归一化序列位置”描述关键点,再通过图像条件化查询与迭代解码,让同一模型联合学习不同标注格式并按需预测关键点;统一 ViT-B 在 WFLW、300W、AFLW-19 上的完整集 NME 分别为 4.05、2.80、1.02,优势是接口与训练统一,而非所有指标全面领先。
📹 视频理解 (1)¶
- TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining
-
TT-VidT 用保持完整空间信息的首帧锚点和紧凑的可学习运动 token 重建后续帧,在约 170 万视频、8 epoch 的共享配方下突出提升运动敏感任务,同时将 TT3D 编码器计算量降至 456.1 GF,但不意味着通用视频理解或严格外观—运动解耦的全面领先。
🚗 自动驾驶 (5)¶
- AutoExpert: Automating 3D LiDAR Annotation from Expert-Crafted Guidelines
-
AutoExpert 把专家指南中的文本规则和少量二维示例转化为可训练的检测器,再用视觉语言模型提供实例尺度与朝向先验、以固定尺度多假设检验定位三维框,最终在 AutoExpert-nuScenes 上达到 25.4 mAP3D,而不依赖目标任务的三维训练标注。
- DriveHierarchy: A Benchmark for Diagnosing VLM Driving Capabilities from Open-Loop Understanding to Closed-Loop Execution
-
DriveHierarchy 将视觉语言模型的驾驶能力组织为感知落地、上下文记忆、心智推理和闭环执行四层,用统一开环任务及 100 个交互仿真场景诊断 15 个模型,并在 Qwen3-VL-8B 上展示仅补强开环薄弱能力即可把闭环综合分从 0.902 提高到 8.021,但这不等于真实道路安全保证。
- Driving Video Retrieval for Complex Queries with Structured Grounding
-
STRIVE-D 在独立驾驶视频上用弱标签排序目标校准运动规则,再按查询复用或适配规则并融合视觉与词法检索,使 DrivingDojo 的 Acc@1 从主表最强稠密基线的 14.6% 提升至 26.8%,但不是直接让 LLM 读取视频并判断真实几何。
- Markovian Dynamics Enforcer: Feasibility Preserving Correction on Learned Dynamics Manifolds
-
MaDE 从无控制标签的状态转移学习逆动力学和物理残差,再在控制空间校正预测轨迹,使输出严格服从其学习到的离散动力学映射,并尽力减少不等式违反;inD 上已知模型残差显著降低,但位置预测误差明显上升,不能据此宣称真实物理或安全性得到保证。
- Progressive Risk Estimation for Accident Anticipation
-
PRE-ACT 用距离事件的连续进度监督和同视频片段排序,改进仅看过去滑动窗口的交通风险预测,在 FPR 不超过 0.1 的设置下将 CAP 的 mAUC 从 TOP 的 0.429 提升到 0.481,并用 Separation Score 检查整段风险曲线的误报倾向。
🤖 机器人/具身智能 (6)¶
- Action Chunking Proximal Policy Optimization with Feedback Correction
-
ACPPO-Corr 用低频动作块规划器与逐步反馈校正器共同扩展 PPO,保留仅输入状态的价值网络,在 25 个模拟机器人任务上将最终归一化四分位均值相对 PPO 提升 30.4%,而不是提升 30.4 个成功率百分点。
- Behavioral Foundation Models for Quality Diversity
-
BFM-QD 冻结离线预训练的行为基础模型,在其潜码空间而非策略权重空间构建高质量、多样化的行为档案,并用闭式后向推断引导小步变异,在稀疏导航和接触操作中显著改善搜索,但仍需要环境 rollout 与预训练投入。
- GeoWind2Plan: Mission-Time 3D Urban Wind Prediction for Energy-Efficient UAV Planning
-
GeoWind2Plan 将建筑几何和背景风转换成任务走廊内的三维平均风场,再联合优化无人机路径与速度;在街区 A、4 m/s 背景风下,CFD 复评能耗由无风感知规划的 \(13.3\pm1.8\) 降至 \(12.5\pm1.5\) Wh/km,而 20% 走廊的风场推理约需 3 秒。
- Language-Conditioned World Modeling for Visual Navigation
-
本文构建语言条件视觉导航数据集,并比较“扩散世界模型 + 潜空间演员–评论家”与“统一自回归动作/图像预测”两种替代方案:前者在已见环境的图像结构保真度上更强,后者在未见环境的离线轨迹预测上更好,但实验不验证真实闭环控制。
- Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents
-
本文把物体的运动历史编码为语言描述、稀疏三维锚点与视觉锚点相互关联的记忆,在长时第一人称视频上提高语义轨迹检索,并以昂贵的一次性构建换取亚秒级在线查询。
- ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries
-
ProCompNav 先在未知环境中收集同类物体,再递归寻找能区分候选的属性并向用户提是非问题,在模拟 CoIN-Bench 的三个划分上将成功率提升至 23.7%、28.1%、17.0%,同时显著缩短用户模拟器的回答。
🎮 强化学习 (10)¶
- AlphaPareto: Formulaic Alpha Discovery with LLM-Guided Multi-Objective Reinforcement Learning
-
AlphaPareto 用冻结 LLM 编码当前因子池,让 MaskPPO 在知道已有信号的条件下逐 token 搜索公式,并通过自适应多目标奖励兼顾预测力、排名稳定性、扰动鲁棒性与多样性,在 CSI300、CSI800 和全市场取得 3.92%、5.70% 和 10.10% 的样本外 IC。
- From Weak Data to Strong Policy: Q-Targets Enable Provable In-Context Reinforcement Learning
-
QTPT 将共享参数 Transformer 的行为动作预测替换为上下文条件化的 Q 目标回归,使固定权重模型能从同一任务的奖励与转移历史中改进决策;弱行为数据上的实验收益较明显,但理论依赖覆盖与可实现性,不能解释为任意低覆盖数据上的保证。
- HaM-World: Soft-Hamiltonian World Models with Selective Memory for Planning
-
HaM-World 把选择性历史记忆与作用于部分潜在坐标的软哈密顿先验接入同一个规划模型,在六个状态输入控制任务上四项最终回报第一、两项第二,但想象预测优势局限于规划相关时域,且消融中记忆的影响明显大于几何结构。
- Learning Chance-Constrained MDPs with Bellman Distributional Certificates
-
论文将累计成本超标事件改写为剩余预算上的贝尔曼递推,在有界后继支持与认证规划预言机条件下得到近匹配的确定性策略样本复杂度,并为随机策略提供局部近似 KKT 优化与独立安全验证,合成及电网仿真实验展示了统计保守性与期望成本替代约束的区别。
- Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching
-
LFIRL 将冻结扩散策略提供的局部动作分数转成软 Q 梯度监督,再依次拟合价值、校准状态偏移并回归奖励,移除了奖励学习与策略优化的交替回路,在包含扩散预训练的计时口径下比最快基线通常快约 2–3 倍,但并非每项奖励质量指标都最优。
- Modeling Quantum Neural Network Gradient With Reinforcement Learning
-
RLQ-Grad 用带谱归一化的经典 PPO 策略,根据量子神经网络的训练状态产生替代更新信号,在给定分类模拟实验中提高验证准确率并降低额外求导开销,但不证明真实梯度恢复或普遍绕过贫瘠高原。
- Replay-buffer engineering for noise-aware quantum circuit optimization
-
本文把量子电路优化的瓶颈从“换一个智能体”转向“更有效地复用经验”:以退火可靠性回放提高样本效率、以分块评估减少量子—经典调用、以仅迁移回放缓存加速噪声适应,但不同任务的精度、门数和收敛速度优势并不统一。
- Safe Score Matching: Diffusion Policies with Hamilton-Jacobi Reachability for Online Safe Reinforcement Learning
-
Safe Score Matching(SSM)用学习到的 Hamilton–Jacobi 安全价值切换扩散策略的奖励与恢复训练目标,在在线安全强化学习中兼顾多模态动作表达与低违规成本,但其硬约束问题定义不等于学习后的策略具有严格安全保证。
- Trust Guided Decision Transformer
-
TGDT 用已实现转移的滚动下一状态预测误差先筛选可信历史后缀,再用冻结的 IQL critic 对候选动作排序,在长时域导航上改善回报与持续高误差,但不提供闭环覆盖率或安全保证。
- Verifying Neural Networks with Reinforcement Learning
-
Rsb 用图结构观测与 actor-critic 学习重加权 Fsb 的神经元分支分数,在不替代验证逻辑的前提下,将 600 个困难测试实例中的求解数量从 148 提高到 165,但奖励定义、特征掩码和部分统计存在原文不一致,需与性能收益分开理解。
🎁 推荐系统 (2)¶
- Goal-Conditioned Supervised Learning for Multi-Objective Recommendation
-
MOGCSL 把会话未来的多种累计奖励保留为目标向量,以普通交叉熵训练一个目标条件的下一物品预测器,再用统计目标或双 CVAE 选择推理目标,在购买预测与训练成本上取得优势,但并非所有点击指标都领先,也不保证指定目标真正可达。
- Rethinking Personalized Generation: Test-Time Alignment via Factorized Ranking Models
-
本文把个性化生成从“微调生成器”改写为“选出已有的合适候选”,用默认 2.8M 参数的 MLP 读取冻结生成器的表示来排序,在九个数据集上优于四种通用奖励模型,但仍落后于针对数据集微调的 8B 奖励模型;单轨迹解码引导只回收部分候选选择收益。
🔄 自监督/表示学习 (6)¶
- Beyond Missing Rates: Rethinking Incomplete Multi-View Clustering with Protocol Divergence
-
论文用实际缺失率与完整样本比例揭示不完整多视图聚类的评测协议分歧,并提出只融合当前样本已观测视图的 CRAFT:在信息匹配的不完整训练中赢得 13 个条件中的 12 个,另以完整视图训练后的固定检查点评测跨协议部署。
- Efficient Dataset Distillation for Pre-Trained Self-Supervised Models via Statistical Flow Matching
-
SFM 把冻结预训练视觉骨干上的线性梯度匹配近似解释为类别中心之间的相对向量匹配,再用一次计算的全局统计量监督合成图像,在每类一张图像的分类实验中改善精度;其约 10 倍显存节省、4 倍加速来自单增强 SFM 与十增强 LGM 的跨预算比较,而不是同预算收益。
- Handwritten Text Recognition Lives in the High-Pixel Variance Subspace
-
本文用像素 PCA 投影与冻结编码器探针研究手写文本识别的信号分布,在六个拉丁文字基准上发现高方差像素方向更利于转录,且 MAE 的真实数据预训练表示取得 5.5% 平均探针 CER,结合语言解码器并全量微调后取得 4.5% 平均 CER。
- I Have a Stream: Making Self-Supervised Learning Work on Continuous Video
-
StreamMAE 不改变 MAE 的像素重建目标,而以更强正则化、样本级 DataDrop 和运动偏置两阶段裁剪适配按时间顺序读取的视频流,在 WT++12h 上改善分类、分割和深度迁移,并在多数指标上接近同数据的离线 i.i.d. MAE。
- Latent Video Prediction for World Modeling: An Evaluation Uncovering Intriguing Favorable Evidence
-
本文以统一读出协议评测四个冻结视频编码器,发现 V-JEPA 系列在退化输入下更能保留可用的动作语义,并在有限的模拟操作实验中支持更可靠的规划,但这些结果不是生成质量评测,也未因果隔离预训练目标。
- Structure-Guided Masked Autoencoders for Ultra-High Resolution Scientific Image Understanding
-
SGMA 将内容自适应四叉树 token 化与跨尺度结构条件掩码共同用于 MAE 预训练,让标准 ViT 在固定序列预算下保留科学图像微结构;SpringXCT 的 SGMA-SAM 达到 95.68% Dice,PAIP 的 SGMA-SAM 2 达到 83.21%,而最高 24.8 倍推理加速来自另一个较短序列配置。
📐 优化/理论 (16)¶
- Adam under Generalized Smoothness with Second-Moment-Type Stochastic Gradients
-
本文对有限时域校准、无偏差校正的 Adam 建立广义光滑性与二阶矩 ABC 噪声下的高概率收敛分析,证明置信度代价的 \(\delta^{-1/2}\) 指数不可一般消除,并区分 \(p<1\) 的期望上界与 \(1\leq p<2\) 的特定算法族最坏情形下界。
- Amortized Optimal Transport from Sliced Potentials
-
以廉价的一维切片 Kantorovich 势函数作为特征,用共享线性系数预测原空间势函数,再恢复近似传输计划;RA-OT 与 OA-OT 减少训练成本并支持可变原子数,但并非所有场景下推理最快或生成质量最好。
- Bayesian Optimization with Fisher Information Geometry: Gradient Bounds and Trust-Region Methods
-
本文用后验映射的拉回 Fisher 张量分离采集函数梯度中的模型几何与效用敏感性,并据此用正则化局部 Fisher 对角权重替换 TuRBO 的核长度尺度权重,在 SE 核基准上取得有竞争力的表现,但不提供外层贝叶斯优化的遗憾或全局收敛保证。
- Bidirectional Information Flow (BIF) - A Sample Efficient Hierarchical Gaussian Process for Bayesian Optimization
-
BIF 用子高斯过程的采集图构造父模型软先验,再把父级真实响应按不确定性感知权重分给子模型持续学习,改善低预算组合任务的重建质量与学习轨迹,但这种反馈是有偏伪响应而非真实子任务分解。
- Commutator Memory: Sparse, Path-Local Reading and Steering in Language Models
-
本文把两次训练更新的非交换残差分解为有符号的词元读出,在局部 SGD 条件下定位并干预训练次序差异,Qwen-3-4B 的定向干预使留出损失差距中位数缩小 32.0%,配对终点次序判别达到 66/72 = 91.7%。
- Cumulative-Goodness Free-Riding in Forward-Forward Networks: Real, Repairable, but Not Accuracy-Dominant
-
本文证明累积 goodness 会在上游已分离样本上精确衰减深层块的局部判别梯度,并用去历史、难度门控和梯度补偿修复层健康,却发现修复没有成为准确率的主导收益来源,MGC 甚至使 CIFAR-100 的 Stage-1 单裁剪准确率下降 1.05 个百分点。
- Dynamic Regret in Online Convex Optimization with Indicator Switching Costs
-
本文把二进制尺度重启的随机惰性 FTRL 分布交给切换感知元学习器,以最大耦合控制真实动作变化,在期望意义下获得分段常数比较器的近最优动态遗憾,并给出适用于小路径长度比较器的另一条保证。
- Estimating and Orthogonalizing Unknown Pre-training Gradients for Continual Fine-tuning of Large Language Models
-
EoupCT 用冻结预训练模型和可学习软提示构造容易被新任务破坏的可微知识代理,再联合蒸馏与梯度投影保护历史任务和通用能力;在六个模型的 SuperNI/MMLU 子集实验中改善遗忘,但其“纯一阶”和“绝对零遗忘”表述需要限定。
- Finite-Sample Performance of Gradient Descent in Logistic Regression with Gaussian Design
-
本文在正确设定的高斯逻辑回归中,用总体曲率分析与经验梯度的近似可逆性证明梯度下降线性进入统计误差邻域,并通过分开估计方向与范数得到高维下更尖锐的误差界,但大步长加速仅有局部保证,近最优区间的原文表述存在需要保留的条件疑点。
- FluxLite: Inference-Time Proposal Control for Discrete Diffusion Models
-
FluxLite 在不重训离散扩散模型的前提下,联合调整稀疏跳转速率与补偿权重,以图散度保持目标边缘分布路径不变,并用局部规则 HEU 或小规模非负二次规划 D-VCG 缓解粒子权重退化。
📐 学习理论 (9)¶
- Adaptive inference for functionals of M-estimands
-
本文把非参数 M-估计目标的光滑泛函推断扩展到已知采样策略的自适应数据,通过一步偏差校正配合逐轮条件方差稳定化,或在方差收敛到随机非零极限时采用自归一化,构造渐近有效的置信区间;动态定价模拟显示普通 GLM 和仅加逆倾向权重的 GLM 会欠覆盖。
- Cheap and Powerful Tests for Supervised Subspaces: Per-Component Inference for PLS
-
把偏最小二乘(PLS)监督子空间的显著性转化为留出预测相关性检验,用 NB 修正提供有明确经验适用范围的快速近似、用置换提供总体独立性零假设下的有限样本有效检验,并严格区分原始分量的顺序推断与旋转后坐标的解释。
- Concise and Logically Consistent Conformal Sets for Neuro-Symbolic Concept-Based Models
-
COCOCO 对神经符号概念模型的概念与任务标签分别校准,再用一次演绎—溯因交集修正删除双方无法支持的候选,在明确的覆盖损失边界下获得更小且相互一致的集合,并以 COCOCO* 支持自适应大小预算。
- Cost-Aware Best-LLM Identification using Dueling Feedback
-
本文把“以给定置信度找出两两偏好中的最佳模型”建模为异质成本决斗老虎机,用单位成本拒绝证据分配比较预算、跟踪抽样并通过最佳臂假设检验停止,获得几乎处处的渐近成本保证,但有限实验中置信区间版本 DCTAC 比主算法 DCTAS 更省成本。
- Estimation of the Label-Noise Transition Matrix with Performance Guarantees via Selective Classification
-
本文先用单侧选择性分类筛出各类别的高纯度子集,再以其中全部噪声标签的经验频率估计转移矩阵,将误差分解为子集纯度偏差、学习次优性和接受样本的统计波动,而不要求逐点恢复准确的类别后验概率。
- Even Sharper Bounds for Transductive Learning and Its Applications
-
本文以交换随机游走上的双参数熵闭合证明 Bernstein 型上确界集中,再用局部复杂度控制直推经验风险最小化,在有界损失及相应局部化条件下同时去掉旧结果的样本量失衡限制与额外置信度对数因子,并给出可实现 VC 分类和经验核谱应用。
- Nonparametric In-Context Learning under Growing Geometric Complexity: Minimax Optimality and Local Geometry-Adaptivity of Transformers
-
本文给出复杂度随样本量增长的异质流形混合上的非参数上下文学习极小极大率,并证明结构知情 Transformer 能逼近达到该率的切空间局部多项式估计器;实际训练模型的最优性仍需要足够任务数和足够小的经验风险优化间隙。
- The Price of Locality: Why Forward-Forward Underperforms Backpropagation?
-
这篇机制分析论文用条件性的局部收敛理论、表示核与误差信号谱分析,以及分组训练和更新谱干预,解释 Forward-Forward Algorithm(FFA)为何常落后于反向传播(BP);放宽 CNN12 的层间梯度隔离可把准确率从 53.02% 提高到 78.74%,但仍未达到 BP 的 85.67%。
- Two-Fidelity Best-Action Identification for Stochastic Minimax Tree
-
2FFS 在已知快评估偏差包络、慢评估对节点真实 minimax 值无偏的模型下,用端点证书和递归预算自适应选择扩树或采样,在合成树上保持高准确率并显著减少节点访问,而停止与成本保证需要额外正则条件。
🔗 因果推理 (1)¶
- Where Root Cause Analysis Fails: A Retrieval-Reranking Decomposition
-
本文把根因分析的排名准确率拆成“根因是否进入候选集”和“进入后能否排到前面”,审计四个数据集的六个测试套件,并用多信号检索与单次 LLM 重排序说明两类失败需要不同修复,而不是只增加因果图或推理能力。
🔬 可解释性 (10)¶
- Can Circuit Alignment Predict OOD Generalization?
-
本文用同类电路跨域相似度减去异类电路相似度构造电路对齐分数(CAS),在不使用目标域数据的源域模型选择中取得 PACS 平均 Spearman 相关系数 0.88,但其 OOD 排名一致性依赖额外的单调性假设,并非完全无数据的权重诊断。
- Deep Minds and Shallow Probes
-
本文从最终读出层的坐标对称性推导浅层探针的多项式层级,并以低秩 CP 探针读取交互概念、以探针可见商空间迁移概念读出,在跨 token 一致性任务上获得 16.8–20.0 个百分点的 AUROC 提升,同时明确区分迁移准确率与概念覆盖。
- Interpretable but Fragile? Robustness of Concept Bottlenecks under Geometric-Semantic Perturbations
-
论文用共享生成器区分潜空间几何变化和生成器概念变化,比较普通分类器与概念瓶颈模型的预测稳定性及平滑分类器证书,发现可解释性不带来统一的鲁棒性优势,而是改变敏感性出现的位置;结论限于生成器原生输入及具体任务条件。
- Listening to the Wise Few: Query-Key Alignment Unlocks Latent Correct Answers in Large Language Models
-
冻结大语言模型后,先校准一个注意力头,再用提示末尾查询与各选项行末键的旋转位置编码前点积选择答案,揭示内部选择与最终输出之间的差距;特定零样本配置在 HellaSwag 和 HaluDialogue 上分别提高 27.4 和 49.8 个百分点,但并非所有模型都获益。
- Parameter symmetries determine representational geometry in overparameterized nonlinear networks
-
本文在一隐层非线性网络中,将保持全局函数不变的参数对称性归结为特征添加、复制与缩放,证明它们可以显著改变表征几何,并给出最小范数选择恢复几何可辨识性的充分条件。
- PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations
-
PersonaManifold 将 LLM 人设激活建模为弯曲且各向异性的低维流形,通过局部度量加权的图最短路衡量相似性并生成插值人设,使三种 7–8B 模型的 BST 综合三元组一致率较欧氏距离提高 5.1–6.1 个百分点,优势主要出现在高偏离人设对。
- PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders
-
PULSE 用少量带标签的发现样本定位与上下文示例效用相关的 SAE 特征,再分别用于完整示例集合排序和可缓存的逐例检索,在六个文本任务上改善示例选择,但这些特征目前只有关联性而非因果干预证据。
- SMILE: Bridging Continuous Optimization and Discrete Symbolic Recovery
-
SMILE 先从数据识别可分解结构,再拟合固定符号激活网络,最后通过剪枝、常数重拟合与梯度舍入恢复简洁表达式,在 SRBench 的高噪声条件下取得较强符号恢复能力,但并非无噪声恢复率或预测精度全面领先。
- The Shape of Events: Edge-Based Inductive Biases via Cross-Domain Distillation
-
本文把标准知识蒸馏用作分析工具,将事件域教师的预测迁入RGB学生,发现颜色变化耐受性、形状偏好及高频带噪声耐受性可以共同迁移,但伴随干净准确率下降和对几何连续性破坏的敏感,而不是获得全面鲁棒性。
- Witness Overlap: Directional Provenance Inside Open-Weight Model Families
-
在已知同族且权重对齐的开放权重模型中,Witness Overlap 引入第三个检查点,比较两个候选端点各自向目标与见证者的更新重叠,以较低重叠端预测父模型;Frobenius 余弦在 16 个 LLM 家族的 1,542 个单见证三元组上取得 95.3% 定向准确率。
📦 模型压缩 (5)¶
- CASS: Contribution-Aware Structured Sparsity for Model Merging
-
CASS 用无标签任务样本识别贡献突出的注意力头和 FFN 神经元,再过滤任务向量或约束微调梯度,以减少模型合并干扰,例如将 ViT-B/16 上 Task Arithmetic 的 20 任务平均准确率从 65.02% 提升到 69.99%。
- Distilling What Matters: Confidence-Aware Selective Distillation for Large Language Models
-
CaRE-KD 按教师与学生的相对置信度逐 token 选择前向或反向 KL,并用 MC-dropout BALD 拒绝教师不确定而学生较确定的监督,在所测模型上改善蒸馏质量,达到 MBPP 62.4、GSM8K 73.9,但收益并非每个任务都成立,训练开销也明显增加。
- Importance-Aware OBS Pruning for Diffusion Models
-
本文把提示词相关的空间重要性注入 OBS 的逐层重建目标,在不微调的情况下改善高稀疏率扩散模型的主体保真度,但全局掩码系数消融与给出的精确公式存在未解释的一致性问题。
- Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer
-
FGQ 在 VGGT 的逐块训练后量化中,用各几何任务的归一化平方梯度给通道重建误差加权,使有限的校准能力优先保护敏感特征;W4A4 下,7-Scenes 的平均完整性误差由 QuantVGGT 的 0.085 降到 0.059,但并非所有指标都恢复到 FP16。
- Stabilizing the Dynamic Low-Rank Training
-
SDLRT 在动态低秩训练中保留上一轮刚被截断的主要奇异方向,用补偿基扩展和截断容差负反馈缓解高压缩下的秩坍缩,并在六项 SuperGLUE 验证任务上取得 85.15% 的平均准确率。
🕸️ 图学习 (6)¶
- Efficient Dynamic Algorithms for Graph Neural Networks with Non-Linear Propagation
-
本文用残差证书、端点缩放和选择性推送维护动态无向图上的非线性传播不动点,在度归一化误差下证明确定性的摊销更新界,并展示非线性能够提升静态分类准确率而不明显增加动态传播成本。
- HoTS: Homophily-Aware Temperature Scaling for Graph Neural Network Calibration
-
HoTS 用预测熵和辅助 GCN 估计的局部同质性生成节点级正温度,以理想化 CSBM 的逆同质性温度规律为结构先验,在不改变预测类别的前提下取得 18 个数据集上的最佳平均 ECE 4.79%,但并非逐数据集或逐覆盖率都最优。
- Neural Structural Reasoner: A Brain-inspired Architecture for Reasoning over Structured Knowledge
-
NSR 将实体、关系及关系链绑定到可读的网络单元与连接,通过关系关联检索和显式图路径传播完成链接预测,在 Nations 上取得 MRR 0.8142,但其优势随数据集变化,且静态加速实现的效率不能直接等同于在线脑启发动力学的效率。
- Relation-Aware Graph Foundation Model
-
REEF 把可跨图共享的关系语义作为图基础模型的迁移单元,用语义超网络生成聚合器、分类器及数据集投影,在三个目标图的 1-shot 分类中达到 48.66%、48.65%、47.72% 准确率,但对未见关系、零样本任务和计算成本仍有明确边界。
- Spectral Reversal: Counteracting Singular Value Bias for Graph Prompting
-
SRP 在冻结 GNN 的各层用奇异值软掩码优先读取弱方向,并用零空间 PCA 补充被原权重丢弃的特征,再把低秩提示加到聚合后的激活上;在 GraphCL 预训练的 5-shot Cora 上达到 68.11% 准确率,但并非所有数据集都优于最强基线。
- Understanding and Mitigating Under-Confidence in GNNs from the Final Layer
-
SCAR 从 GNN 的末层分类器解释欠置信,训练时单独减小末层权重衰减,推理时按节点与训练集的邻接关系将表示拉向预测类别原型,在多种节点分类设置中降低 ECE,但不保证预测标签或准确率始终不变。
📈 时间序列 (11)¶
- AdaST: Adaptive Coupling for Spatial-Temporal Forecasting
-
AdaST 将时空输入分成时间专属、空间专属和时空耦合三种表示,分别建模后用相关度调制的门控自适应重组,在四个短期传感器预测基准上取得表中最佳结果,其中 PurpleAir 的 MAE 从最强对照的 0.511 降至 0.489。
- Beyond Empirical Support: Structured Outlier Generation via Sinkhorn Optimal Transport
-
SBOG 用 Sinkhorn 支持度能量寻找潜空间边界锚点,在局部扰动中挑选低支持但语义受控的候选以合成异常,使 CARLA 的五数据集平均逐点 F1 从 0.362 提升至 0.432,并改善图像分布外检测;这些结果衡量下游效用,不等于恢复真实异常分布。
- DiffPTS: Rethinking Diffusion ELBO for Probabilistic Time Series Forecasting
-
DiffPTS 将历史条件下的高斯均值与方差估计器和去噪网络一起训练,用扩散 ELBO 导出的高斯负对数似然替代手工方差监督,在九个基准上改善 CRPS/MSE,其中 Traffic 相对 NsDiff 从 0.378/0.637 降至 0.270/0.456,但这不意味着校准指标也全面最优。
- Kairos: Toward Adaptive and Parameter-Efficient Time Series Foundation Models
-
Kairos 把时间序列的局部复杂度和实例级频谱差异分别交给混合粒度编码与动态旋转位置编码处理,再并行预测多个未来块,以 53M 参数在 GIFT-Eval 达到 0.738 的归一化 MASE,但概率预测与逐任务表现并非全面领先。
- Multivariate Time Series Forecasting needs Cross Variable Loss
-
CvLoss 不改预测骨干,而是在逐点 MSE 之外约束不同变量预测片段之间的残差差异,在论文汇总的 114 个同骨干比较单元中得到 111 胜、2 平、1 负,且推理时无需计算该损失。
- Progressive Memory Transformer: Memory-Aware Attention for Time-Series
-
PMT 把随滑动窗口更新的可写记忆显式暴露为中尺度表示,并分别监督 token、记忆和序列摘要,在七个低标签分类数据集上取得平均 84.4% 准确率,同时用线索保留探针验证记忆确实携带跨窗口信息。
- Raw-Routed Mixture of Adapters: A Causal Intervention for Routing Collapse in Time Series Foundation Models
-
RR-MoA 让轻量门控读取实例归一化之前的输入、让适配器专家继续读取冻结基础模型的隐状态,从路由输入端修复信息缺失,在作者报告的 54 个配对比较中均优于固定适配器,但基础版本仍不及从头训练的线性预测器。
- Revitalizing Medical Time Series with Vision-Informed Retrieval: A Vision-Language Perspective
-
ViRe 将同一 EEG/ECG 数值片段绘成波形,用冻结 CLIP 的视觉特征作为查询,从时间和通道数值 token 中检索证据;六个基准的六指标综合均值由 Medformer 的 77.90 提升到 82.90,但不是六个数据集全部领先,也不是患者级诊断准确率。
- TimeES: Probabilistic and Deterministic Time Series Forecasting via Evolutionary Spectra
-
TimeES 用轻量网络预测逐时间步的复数谱幅度,再以固定傅里叶相位和跨预测区间共享的频率随机变量合成轨迹,统一确定性与概率预测;九个概率预测数据集上的平均结果较强,但 ILI 明确退步,谱恢复与不确定性训练也仍有需要审慎理解的边界。
- TimeTok: Granularity-Controllable Time-Series Generation via Hierarchical Tokenization
-
TimeTok 将时间序列编码成具有由粗到细语义的离散 token 前缀,通过粒度块自回归补充细节、条件流匹配解码控制输出粒度,在条件细化和生成分布指标上表现突出,但并非所有下游预测指标最优。
🏥 医学图像 (8)¶
- Aegis: Generative Gradient Masking for Privacy-Preserving Medical Federated Learning
-
Aegis 在客户端每个本地 epoch 后加入任务相关合成图像的梯度更新,以增加线性泄漏中的样本混合;在三种 MedMNIST 模态上将所测重建率降至 9.38%–11.63%,但这不是零泄漏或差分隐私保证。
- DeepArrhythmia: Segment-Contextualized ECG Arrhythmia Classification via Selective Evidence Acquisition
-
DeepArrhythmia 在 10 秒心电片段中按 R 峰输出逐心搏标签,并根据初步预测的片段置信度选择是否追加数值与形态证据,在四个数据集上展示了上下文和生理证据的价值,但路由并非在所有指标上优于始终使用丰富证据。
- FOCUS: Benchmarking Retinal Model Generalization from Foundation Vision Encoders to Multimodal LLMs
-
FOCUS 将十个眼底数据集的疾病标签和三类基础模型的预测接口接入同一评测层,发现模型排序能力、校准与亚群表现并不一致,而 MLLM 的监督微调主要改善二元决策和校准,平均 AUROC 增益很小。
- Information Bottleneck-Guided Adaptive Hypergraph Transformer for Brain Disease Diagnosis
-
IBAHGT 将固定近邻超图上的自适应消息传递与全局 Transformer 并行结合,再用节点级融合及信息瓶颈辅助训练提高 fMRI 脑网络分类表现,在随机划分的 ABIDE / ADNI 上取得 77.6% / 86.3% 准确率,但其互信息推导存在不能忽略的条件与符号问题。
- Modeling Whole-Slide Images as Dynamic Tumor Microenvironment Fields
-
TMEvolve 将病理全切片建模为可反复更新的潜在区域场,通过区域内扩散和概念引导的有向边界交互学习切片表示,在四个生存队列中的三个获得最高平均 C-index,但这种“演化”是表示细化而非真实肿瘤时间进程。
- Multimodal LLMs Outperform Pathology Foundation Models in Cross-Domain Histological Similarity
-
MOSAIC 用六个组织病理队列中的三图相似度选择,把同类跨域样本与异类同域样本直接对置,发现零样本多模态大语言模型通常比病理基础模型的欧式嵌入距离更能抵抗采集来源捷径,但优势不等于临床诊断能力,也不意味着跨域任务已经可靠解决。
- SheafStain: Sheaf-Theoretic Schrödinger Bridge for Spatially and Biologically Coherent Virtual Staining
-
SheafStain 在非配对薛定谔桥中加入邻域 VFM 空间条件、重叠区域一致性损失和病理监督,再通过自适应补块与加权拼接生成 H&E 对应的 IHC,在两个乳腺病理数据集的 1024×1024 拼接区域上显著减少接缝,但不提供诊断正确性的保证。
- Tokenizer-Generator Coupling in Medical Image Generation
-
这是一项以“分词器—生成器—采样器”三元组为单位的受控因子研究:在 ChestMNIST-64 的 70 个生成配置中,重建质量不能可靠预测生成质量,量化器排序随生成器变化,而验证集选择的低步数采样可将 LFQ-1024 + D3PM 的 FID-192 从 0.44 降至 0.09。
🩺 医疗 LLM (1)¶
- MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models
-
MedKIT 将 6,196 条有时间戳的肿瘤学证据转成同事实、多任务探针,比较 12 种知识整合方法与 5 个模型,发现“更新后能复述事实”通常并不意味着能在开放式推理或生成中使用事实。
🧬 计算生物 (11)¶
- At FullTilt: Real-Time Open-Set 3D Macromolecule Detection Directly from Tilted 2D Projections
-
FullTilt 将已对齐的二维倾斜序列直接送入带多类别视觉提示的三维检测器,以跨倾角行注意力融合、近零倾角查询初始化和训练期几何增强替代三维体数据滑窗检测,在三个真实 cryo-ET 数据集上实现亚秒级零样本检测,但仍需要模拟数据预训练和输入对齐。
- Beyond Drug Discovery: The Nanotechnology Molecular Optimization (NMO) Benchmark
-
NMO 用三个受电极结合约束的纳米物理任务检验分子优化的真实迁移能力,并以显式锚位的 GGS 表示、随机分子预训练和遗传引导 GFN 找到具有物理研究价值的候选,但完整模型并非三个任务的 AUC 都最优。
- CellMSA: Context Modeling for Single-Cell Representation Learning
-
CellMSA 将跨批次与相关类型细胞按基因对齐,用低维上下文提取基因对依赖并引导目标细胞编码,在有标签辅助检索的整合评测、无测试标签检索的分类评测和结合 STATE-ST 的扰动预测中取得较强结果。
- Data-Driven Soft Labeling Scales DNA Read Classification to Whole-Body Cell-Type Deconvolution
-
Syto 用参考数据中甲基化模式对应的细胞类型分布替代单一来源硬标签,再将读段分类、样本解卷积与比例校准分开建模,在 39 类细胞的伪混合样本上把最佳报告配置的 MSE 从 CelFiE 的 \(3.28\times10^{-4}\) 降到 \(0.88\times10^{-4}\),但这不是临床癌症检测验证。
- Evolutionary foraging in grids: Intermittent search dynamics emerge in finite, depletable landscapes
-
在有限、资源不可再生的二维网格中,让步长、速度和转角的经验分布通过遗传算法演化,而不是预设幂律运动;所得轨迹的二阶、四阶位移矩更符合间歇搜索模型,但这不等于证明智能体显式切换状态或该策略具有全局最优觅食性能。
- FlyAOC: Evaluating Agentic Ontology Curation of Drosophila Scientific Knowledge Bases
-
FlyAOC 把果蝇基因知识库整理做成从大型全文语料检索到本体化候选输出的端到端评测,显示多智能体的上下文分区能改善已知可恢复注释的召回,但语义得分不等于生物事实的精确验证。
- LEMON-ZEST: Evolution-Informed Tokenization for Efficient Protein Language Modeling
-
LEMON-ZEST 将进化保守片段聚类为共享词元,以随机切分和双头编码器同时学习全局检索表征与残基信息,使 200M 参数模型在多个折叠层级检索指标上超过大型基线,但并非所有分类层级或下游任务都最优。
- PHOEBI: An Open-World Benchmark for Multi-Label Bacterial Identification in Phase-Contrast Microscopy
-
PHOEBI 用六种细菌的 40 个混合组合、约 120,000 张相差显微图像检验“见过菌种、没见过组合”的多标签识别,发现逐图训练的分类器严重失效,而冻结特征上的几何原型解码更稳定,但其优势必须相对全阳性基线和组合级置信区间解读。
- PocketVE: Stable and Property-Guided Structure-Based Drug Design with Variance-Exploding Diffusion
-
PocketVE 将保留蛋白–配体共同坐标尺度的 VE/EDM 去噪、训练期口袋扰动和推理期多性质 CFG 联合起来,在 CrossDocked2020 上相对 guided TAGMol 将三维有效率从 58.6% 提高到 80.6%、应变能从 457.4 降至 127.9,但不宣称这些收益可单独归因于 VE,也不宣称全面领先所有对接指标。
- Preserving DEG Rankings for Gene Discovery in Histology-Based Spatial Gene Expression Prediction
-
本文把病理图像预测空间基因表达的目标从“每个基因的空间曲线是否相似”转向“组织对比中该优先研究哪些基因”,用形态学代理分组、可微 U 统计量和跨基因相关损失改善 DEG 排序及通路重合度,但不保证提升传统空间表达 PCC。
⚛️ 物理/科学计算 (5)¶
- Mechanism-Aware Ensemble Conditioning for Data-Limited Emulation of Extreme Events
-
本文将参考轨迹牵引的随机粗模型集合压缩为动力学敏感性条件,通过 FiLM 调制既有时序校正器,在少量高分辨率训练数据下改善 QG 极端事件的面积与频率统计,但不保证整体分布或所有尾部指标优于长数据基线。
- Neural Harmonic Measure Operator
-
NHMO 学习只依赖几何的调和测度密度,将边界条件通过归一化积分变成解的边界贡献,再用学习的 lift 补充源项及近似误差,在 3D MCB-B 五类 Poisson 问题上优于所比较的四种基线,并将同一几何上的重复求解变成缓存矩阵乘法与 lift 前向计算。
- Phaedra: Learning High-Fidelity Discrete Tokenization for the Physical Sciences
-
Phaedra 将物理场潜变量分为多维形态 token 与高精度一维幅值 token,再学习重组解码,使分布内 PDE 重建 nMAE 从 FSQ 的 2.603 降至 1.522,并把 65.0 GB 科学数据压缩为 3.44 GB。
- PR-Smoother: Simulator-Preserving Non-Gaussian Smoothing for Data Assimilation
-
PR-Smoother 在物理状态空间中学习非高斯初值后验与未来观测条件化的逐步校正,同时保留既定模拟器,用仅含观测窗口的变分目标联合估计状态、物理参数和传感器偏置,在非线性 Lorenz–96 与 16,384 维流体系统上验证了这一设计。
- Soft Geometric Inductive Bias for Object Centric Dynamics
-
本文把已给定的对象状态编码为 Clifford 多向量,用不强制精确等变的几何乘积层和块因果 Transformer 学习下一时刻状态,在墙面碰撞、各向异性约束和真实交通轨迹等对称性破缺场景中改善预测与自回归 rollout。
🌍 地球科学 (1)¶
- ThousandWorlds: A benchmark for climate emulation of potentially habitable exoplanets
-
ThousandWorlds 将五个全球气候模型的 1,689 次潮汐锁定水世界模拟统一成低数据量的参数到气候平均场回归基准,并用同星球 GCM 分歧衡量模拟器的实用精度,其中 GPLFR 在完整基准上的归一化几何平均 RMSE 为 0.462。
📡 信号/通信 (1)¶
- Geometric Inductive Biases for Semi-Supervised Equalization: The Constellation-Aware Transformer
-
CAT 把已知星座点与接收信号从第一层起联合建模,并用双向 FIR 信号分支处理符号间干扰,在逐块半监督适应中减少所需导频,但这一收益依赖足够的导频与接收端训练计算,并非无监督或跨信道零样本解码。
🛡️ AI 安全 (10)¶
- A Unified Uncertainty Representation for Graph Neural Networks via Doubly-Spectral Stochastic Expansion
-
DSS-GNN 把节点表示展开到图频率与随机混沌阶数两个谱轴,以确定性求积传播不确定性;独立模式在 14 个校准基准上取得比较方法中最低的平均 Brier,混合模式则在多数节点 OOD 场景和全部 7 个 GOOD 概念偏移设置上优于所列基线。
- Anchoring Adversarial Trajectories to Data Manifolds: A Bilevel Transfer Optimization Framework
-
MABT 将经验流形锚定与面向局部代理模型不确定性的双层初始化学习结合,在受控 ImageNet 跨模型评估中提高错误迁移率,但其流形解释、未知模型分布近似和收敛结论均有明确边界。
- ASIRF: An Agentic Framework for Context-Dependent Sensitive Information Redaction
-
ASIRF 把敏感属性的定义从模型固定标签移到推理时知识库,通过“上下文分类→定义检索→值提取”适配新领域;作者报告,在 80 个模型—领域组合中,至少一种架构的召回率在 68 个组合上超过 OPF,但多智能体并不始终优于同样具有检索工具的单智能体。
- GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
-
GT-HarmBench 用六类双人双选项博弈组织 1,535 个战略交互评测样本,报告 15 个模型的平均功利主义准确率为 0.62,并在独立的八模型实验中观察到制度描述干预带来 +0.13 至 +0.18 的聚合改善,但这些结果衡量文本建议而非真实制度执行或部署安全。
- How Much Must a Private Mempool Hide? Exact Leakage Thresholds for Sandwich Attacks
-
本文在无手续费恒定乘积自动做市商的单订单模型中,证明区间泄漏的安全边界主要由交易规模的下端点决定,而非区间宽度,并严格区分全类型保障、后验期望激励与交易后残余风险。
- Less Supervision, Better Generalization: Weakly Supervised Fake Region Localization in Diffusion-Edited Images
-
ReGFLoW 用图像级真假标签训练双编码器与 VAE 重建引导的区域评分网络,在部分编辑与全合成混合评测中取得更高的跨生成器平均 F1,但付出明显的域内定位精度代价,且仅部分编辑时并未超过最强掩码监督基线的 OOD 均值。
- Rank-Constrained Adaptation for Reliable Real-World Performance
-
MARLA 用冻结 ERM 模型在有任务标签的留出适配集上的错误概率构建加权特征子空间,仅在该子空间内学习低秩 logit 修正,在不使用子群标签的条件下改善最差群体准确率,同时明确区分无、部分和完整子群知识的模型选择条件。
- Social Choice Foundations for Simulation-Augmented Generation
-
本文把模拟增强生成中的代表性路由形式化为比例聚类:先预测模拟响应的观点嵌入,再用 SEAR 选择少量模拟器;在明确的奖励分解与误差假设下给出近似代表性保证,并在两个模拟池上优于聚类和随机路由基线,但不研究最终回答的综合生成。
- Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
-
TRACE 将具身强化学习中的梯度泄漏视为有时间关联的隐私问题,在严格的有序逐步梯度可见性假设下,以时序学习评估观察与动作泄漏,主实验达到约 18.8 dB PSNR,并表明轻量压缩不能替代序列级隐私保护。
- Watermarking Should Be Treated as a Monitoring Primitive
-
本文通过观察者威胁模型与受控文本、图像实验论证:在实体绑定持久且推断可靠时,水印可能支持重复归因,因此治理应同时约束内部归因访问和设计相关的外部来源识别,而不能只检验单份内容的水印鲁棒性。
📂 其他 (3)¶
- Building Transformation Layers for Riemannian Neural Networks
-
本文把全连接层重新解释为点到超平面的有符号响应,用多切空间与可计算伪距离构造流形全连接层,再通过乘积流形扩展卷积,在十种几何实例上验证了表达灵活性,但性能与计算成本仍依赖具体几何和数据。
- D-GAP: Improving Out-of-Domain Robustness via Dataset-Agnostic and Gradient-Guided Augmentation in Amplitude and Pixel Spaces
-
D-GAP 用任务损失对傅里叶振幅的梯度决定逐频率跨域混合强度,再融合像素混合结果,在四个真实数据集上相对各自最佳通用方法平均提升 5.3 个百分点,但无目标标签不等于训练时不访问目标数据。
- Position: Let’s Strengthen Verifiability If We Can’t Enforce Reproducibility
-
本文以五个 ML/CV 顶会 2021–2025 年的代码可用性调查为依据,主张在难以强制完整复现的现实下,把实验日志检查和预测文件上的指标重算纳入投稿、评审与出版流程;这是部分一致性核验提案,而非已经证明有效的反作弊系统。
🧠 MoE / 混合专家 (1)¶
- SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization
-
SpecDrop 用固定类别到分支映射、非零跨类别软权重和定分母融合塑造模块专门化,在可信类别标签可用于推理的视觉任务上优于不使用标签的匹配基线,但标签感知的稠密输出掩码准确率更高,且模糊文本划分上的路由增益接近零。
📄 world_models (1)¶
- StarWM: Self-Supervised Trained Attention Routing for Robust World Models
-
StarWM 用自监督动力学信号决定空间注意力,再用停止梯度和双流解码器约束重建信息的去向,使世界模型在随机视频干扰下保留可预测实体;但连续视频背景仍会混淆默认路由,奖励引导变体 StarWM-R 才进一步改善跨条件表现。