跳转至

🤖 AAAI2026 论文汇总

1381篇AAAI2026论文解读,涵盖 3D 视觉(79篇)、图像生成(79篇)、医学图像(76篇)、多模态 VLM(74篇)、模型压缩(60篇)、强化学习(58篇)、自动驾驶(56篇)、AI 安全(45篇)等 52个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。


💡 LLM Reasoning (37)

MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy

提出 MathSmith 框架,通过从 PlanetMath 随机抽取数学概念对、采用9种预定义难度策略生成数学题目、并利用 GRPO 强化学习联合优化结构有效性/推理复杂度/答案一致性,生成的高难度合成问题在 AIME 和 OlympiadBench 上显著提升 LLM 数学推理能力。

Trade-offs in Large Reasoning Models: An Empirical Analysis of Deliberative and Adaptive Reasoning over Foundational Capabilities

系统评估了LRM(如DeepSeek-R1、QwQ、OpenThinker等)在获取深度推理能力后对基础能力(helpfulness和harmlessness)的负面影响,发现deliberative reasoning显著降低指令遵循和安全性能力,并提出Zero-Thinking、Less-Thinking、Summary-Thinking等自适应推理模式可有效缓解这些缺陷。

CMMCoT: Enhancing Complex Multi-Image Comprehension via Multi-Modal Chain-of-Thought and Memory Augmentation

提出 CMMCoT 框架,通过构建交错的多模态多步推理链(含视觉区域 token 监督)和测试时检索式记忆增强模块(RIFREM),在不增加参数的前提下提升多图场景下的慢思考推理能力,基于 Qwen2.5-VL-7B 在多图基准上平均提升 1.4 分。

Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning

提出以Planner为核心的Plan-Execute框架,将复杂查询转化为DAG执行计划,通过SFT+GRPO两阶段训练专门的Planner模型,在ComplexTool-Plan和StableToolBench上超越ReAct等反应式方法,用更少推理步骤实现更高成功率。

ExtendAttack: Attacking Servers of LRMs via Extending Reasoning

提出 ExtendAttack,一种针对大推理模型(LRM)的资源耗尽攻击:通过将 prompt 中的字符随机转换为多进制 ASCII 编码,迫使模型在回答问题前先执行大量逐字符解码推理,使 o3 的响应长度增加 2.7 倍以上、延迟翻倍,同时保持答案准确率基本不变。

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

提出 Relation-R1,首个统一二元和 N 元关系理解的框架,通过渐进式认知 CoT 引导的 SFT + GRPO 多奖励优化,仅 3B 参数即超越 13B 模型,在 PSG 上 Mean 达 21.20%(+6.87%),SWiG 全指标 SOTA(Grnd-all 30.18%,+14.48%)。

Text-to-Scene with Large Reasoning Models

提出Reason-3D,利用大推理模型(LRM)的多步空间推理能力,通过语义投票式物体检索+双阶段布局(自回归放置+碰撞感知优化)实现从文本到3D场景的零样本生成,在人工评价中Elo评分达2248(远超Holodeck的1500和LayoutVLM的1650)。

Graph of Verification: Structured Verification of LLM Reasoning with Directed Acyclic Graphs

提出 Graph of Verification (GoV),一种将 LLM 推理过程建模为有向无环图 (DAG) 的结构化验证框架,通过灵活的节点块(Node Block)架构实现多粒度验证——从形式化任务的原子步骤到自然语言叙述的段落级验证——在结构化和松散结构化推理基准上均显著优于整体验证和其他分解验证方法。

Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning

通过对OPT-350M模型进行单epoch的SFT微调,在ToolBench评估中取得77.55%的通过率,大幅超越ChatGPT-CoT(26%)、ToolLLaMA-DFS(30.18%)等大模型基线,证明了针对性微调的小模型在特定任务上可显著超越通用大模型。

Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning

发现 LLM 推理中的"起始锁定效应"(Beginning Lock-in Effect)——初始推理过程显著决定后续轨迹和最终结果,据此提出 PPPO 方法,仅优化前缀 token(约 26% 的 token)即可实现高达 18.02% 的准确率提升,同时减少输出 token 数量达 18.35%。

查看全部37篇「LLM Reasoning」论文 →


🦾 LLM Agent (33)

AutoGLM: Autonomous Foundation Agents for GUIs

AutoGLM 基于 ChatGLM 构建了面向 Web 浏览器和 Android 手机的 GUI 基础智能体,通过中间接口设计分离规划与定位行为,并提出自进化在线课程强化学习框架,在 VAB-WebArena-Lite 上达到 55.2% 成功率,大幅超越 GPT-4o 的 18.2%。

TongUI: Internet-Scale Trajectories from Multimodal Web Tutorials for Generalized GUI Agents

TongUI 提出从互联网上的多模态教程(视频+图文)自动转化为 GUI 操作轨迹数据的框架,构建了百万级的 GUI-Net-1M 数据集,用于微调 Qwen2.5-VL 模型,在多个 grounding 和 navigation 基准上超越或接近 UI-TARS 等 SOTA。

AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search

提出AgentSwift框架,通过层次化搜索空间(同时优化agentic workflow和功能组件)、轻量级value model预测agent性能、以及不确定性引导的MCTS搜索策略,自动发现高性能LLM agent设计,在7个基准上平均提升8.34%。

When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents

系统研究 LLM Agent 在长上下文填充下的安全行为变化:发现声称支持 1M-2M token 的模型在 100K token 时已出现 >50% 的性能崩溃,拒绝率以不可预测的方式波动(GPT-4.1-nano 从 5% 升至 40%,Grok 4 Fast 从 80% 降至 10%),揭示了长上下文 Agent 系统的严重安全隐患。

Agent-SAMA: State-Aware Mobile Assistant

提出Agent-SAMA,首次将有限状态机(FSM)引入移动端GUI Agent,将UI屏幕建模为状态、用户操作建模为转移,通过四个专门化Agent协作实现状态感知的任务规划、执行验证和错误恢复,在跨App基准上成功率提升最高12%、恢复率提升13.8%。

ProBench: Benchmarking GUI Agents with Accurate Process Information

提出 ProBench,首个同时评估"最终状态"和"操作过程"的移动端 GUI Agent benchmark:200+ 挑战性任务覆盖 34 个中英文主流 App,通过 Process Provider(Structure Description Converter + MLLM Summarizer)自动捕获精确的中间过程信息,评估发现最强模型 Gemini 2.5 Pro 也仅完成 40.1% 任务,暴露了 grounding 不足、历史操作感知差、任务规划过于简化三大普遍问题。

History-Aware Reasoning for GUI Agents

提出 HAR 框架,通过构建反思学习场景、合成纠错指南、设计混合 RL 奖励函数(含 Memory-Augmented Reward),将 GUI Agent 的推理模式从"历史无感知"转变为"历史感知",3B 模型在 AITW/Mind2Web/GUI-Odyssey 等多个 benchmark 上超越更大模型。

Prune4Web: DOM Tree Pruning Programming for Web Agent

提出 Prune4Web,通过"LLM 生成评分函数参数 + 固定启发式模板执行"的编程式 DOM 剪枝方法实现 25-50 倍候选元素缩减:三阶段 pipeline(Planner 分解子任务 → Programmatic Filter 生成评分函数剪枝 DOM → Grounder 执行操作),3B 模型在 Multimodal-Mind2Web 上达到 52.4% Step SR(超越所有同参数量基线甚至部分 9.6B/32B 模型),低级 grounding 准确率从 46.8% 提升至 88.28%。

A2Flow: Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators

提出 A2Flow 框架,通过三阶段流水线(案例生成→功能聚类→深度提取)从专家数据中全自动提取可复用的抽象执行算子,替代人工预定义算子,并引入算子记忆机制累积中间输出辅助节点决策,在 8 个基准上整体超越 AFLOW 等 SOTA,资源消耗降低 37%。

AutoTool: Efficient Tool Selection for Large Language Model Agents

提出 AutoTool,一种基于图的工具选择框架,利用工具使用惯性(tool usage inertia)构建工具惯性图(TIG),通过统计结构绕过重复的 LLM 推理来选择工具和填充参数,在保持任务完成率的同时减少最多 30% 的推理开销。

查看全部33篇「LLM Agent」论文 →


👥 Multi-Agent (26)

Assemble Your Crew: Automatic Multi-agent Communication Topology Design via Autoregressive Graph Generation

提出 ARG-Designer,将多 Agent 系统的拓扑设计重新定义为条件自回归图生成任务,从零开始逐步生成 Agent 节点和通信边(而非从模板图剪枝),在6个基准上达到 SOTA(平均 92.78%),同时 Token 消耗比 G-Designer 降低约 50%,且支持无需重训练的角色扩展。

Scalable and Accurate Graph Reasoning with LLM-Based Multi-Agents

提出 GraphAgent-Reasoner(GAR),受分布式图计算理论启发,将图问题分解为以节点为中心的子任务分配给多个 Agent,通过邻居消息传递协作求解,将 LLM 可处理的图规模从 100 个节点扩展到 1000 个,在多项式时间图推理任务上显著超越现有最佳方法。

MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models

提出 MedLA,首个基于三段论逻辑树的医学多 Agent 推理框架:每个 Agent 将推理组织为显式的逻辑树(大前提-小前提-结论三段论节点),多个 Agent 通过图引导的多轮讨论在前提级别对齐和修正逻辑树,在 MedDDx 上超越所有基线 7.4%(8B 模型),在医学 QA 上以 8B 模型达到 69.9% 平均准确率(超 70B RAG 模型)。

SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication

提出SafeSieve,一种渐进式自适应多智能体通信剪枝框架,通过语义启发初始化→历史反馈驱动的双阶段边评分和0-extension聚类机制,在6个基准上实现94.01%平均准确率同时减少12.4%-27.8% token消耗,并展现出对prompt注入攻击的天然鲁棒性。

iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference

iMAD 提出选择性触发多Agent辩论的框架:先让单Agent生成带自我批判的结构化响应,从中提取 41 个可解释的语言/语义特征,用轻量 MLP 分类器(FocusCal 损失训练)判断是否需要触发 MAD,在 6 个 QA/VQA 数据集上减少高达 92% 的 Token 开销,同时提升准确率高达 13.5%。

Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems

首次系统分析 LLM 多 Agent 软件开发系统(ChatDev/MetaGPT/AgentVerse)的安全风险:提出 IMBIA 攻击框架覆盖两种威胁场景(恶意用户+良性Agent / 良性用户+恶意Agent)和 12 种恶意行为(5 大恶意软件家族),攻击成功率高达 93%(ChatDev),并设计 Adv-IMBIA 对抗性防御将 ASR 降低 40-73%。

FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation

首次系统化地定义股票研究报告(ERR)自动生成任务——构建 FinRpt 数据集(6,825篇中英文高质量研报,整合7类金融数据),提出11指标评估体系和9 Agent协作的FinRpt-Gen生成框架(含评级修正/专家审查/润色三阶段增强),人类评估显示生成报告质量接近专家撰写。

LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules

提出 LungNoduleAgent,首个面向肺结节分析的协作式多智能体系统,通过"Nodule Spotter + Simulated Radiologist + Doctor Agent System"三阶段流水线模拟临床工作流,在 CT 报告生成和恶性分级任务上大幅超越 GPT-4o、Claude 3.7 Sonnet 等主流 VLM 及 MedAgent-Pro 等医学智能体。

EcoAgent: An Efficient Device-Cloud Collaborative Multi-Agent Framework for Mobile Automation

提出 EcoAgent,一个闭环设备-云端协作的多 Agent 移动自动化框架,通过 Dual-ReACT 双层推理规划 + 设备端轻量验证反馈 + Pre-Understanding 文本压缩模块,在 AndroidWorld 上达到与全云端 Agent 相当的成功率,同时大幅降低延迟(3.9s vs 15.3s)、云端调用(降89%)和上行数据量(降48.6倍)。

BAMAS: Structuring Budget-Aware Multi-Agent Systems

提出 BAMAS 框架,通过整数线性规划(ILP)在预算约束下选择最优 LLM 组合,再用强化学习策略选择最佳协作拓扑(线性/星型/反馈/规划驱动),在 GSM8K/MBPP/MATH 上达到与 SOTA 多 Agent 系统相当的准确率,同时成本降低最高 86%。

查看全部26篇「Multi-Agent」论文 →


⚖️ 对齐 / RLHF (17)

Intrinsic Barriers and Practical Pathways for Human-AI Alignment: An Agreement-Based Complexity Analysis

本文将 AI 对齐形式化为 \(\langle M,N,\varepsilon,\delta\rangle\)-agreement 多目标优化问题,从通信复杂度角度证明了对齐的信息论下界(编码"所有人类价值观"本质上不可行),同时给出了无界/有界理性智能体的显式可达算法和紧致上界,揭示了在大状态空间下 reward hacking 全局不可避免的理论根基。

Align to Structure: Aligning Large Language Models with Structural Information

提出 Structural Alignment 方法,通过将语言学篇章结构框架(表层文本结构评分 + 基于RST的篇章motif分类器)融入PPO强化学习训练,并设计基于篇章motif的密集奖励机制,使LLM生成更连贯、更具人类写作风格的长文本,在论文写作和长文档摘要任务上均优于标准RLHF模型。

DeCoRL: Decoupling Reasoning Chains via Parallel Sub-Step Generation and Cascaded Reinforcement for Interpretable and Scalable RLHF

DeCoRL 将 CoT 推理从单体顺序处理转变为"交响乐团式"的模块化并行协作——9 个专用子模型(解析/语义/实体/事实核查/风格/质量/计算/验证/整合)并行生成推理子步骤,通过双重奖励归因(本地质量+贡献度)+ 级联 DRPO 优化协调,在 RM-Bench 上达到 80.8%(超越所有基线),同时实现 3.8 倍推理加速和 22.7% 的可解释性提升。

Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal States

提出EAGLE方法,通过聚合LLM多个中间层隐藏状态的logits并计算置信度分布的期望值来估计不确定性,无需训练额外参数,在多个数据集和模型上ECE从12.6%降至3.2%,AUROC从59.0%提升至61.6%。

Importance-Aware Data Selection for Efficient LLM Instruction Tuning

提出MIWV(Model Instruction Weakness Value)指标,通过比较LLM在有/无one-shot ICL示例下的损失差来衡量每条指令数据对模型能力提升的重要性,在Alpaca数据集上仅用1%(520条)数据即全面超越全量52002条的微调效果。

Differentiated Directional Intervention: A Framework for Evading LLM Safety Alignment

将 LLM 安全对齐的内部表征从传统的"单一拒绝方向"解构为功能独立的"危害检测方向"和"拒绝执行方向",在此基础上提出 DBDI 框架,分别用自适应投影消除和直接引导两种策略精准干预两个方向,在 Llama-2 上实现 97.88% 的越狱成功率。

GRAM-R²: Self-Training Generative Foundation Reward Models for Reward Reasoning

本文提出 GRAM-R²,一个通过自训练方式在无标签数据上引发奖励推理能力的生成式基础奖励模型,能够同时产生偏好标签和推理理由,在响应排序、任务适配和 RLHF 等多个下游任务中一致超越判别式和生成式基线。

LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward

提出 LaF-GRPO 框架,利用 LLM 模拟视障用户对导航指令的响应作为奖励信号,通过 GRPO 后训练 VLM 来生成更精确、更安全的视障导航指令,并构建了 27k 样本的 NIG4VI 基准数据集。

W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo Tree Search

提出 W2S-AlignTree,首个将蒙特卡洛树搜索(MCTS)与弱到强泛化(W2SG)范式结合的推理时对齐框架,利用弱模型的步级代理值函数实时引导强模型生成,在情感控制、摘要、指令遵循任务上均显著超越基线,其中 Llama3-8B 摘要任务提升 15.9%。

AlignTree: Efficient Defense Against LLM Jailbreak Attacks

AlignTree 利用 LLM 内部激活特征(线性 refusal direction + 非线性 SVM 信号)训练轻量级随机森林分类器,在几乎不增加计算开销的情况下高效检测越狱攻击,实现了 SOTA 的攻击成功率(ASR)降低效果。

查看全部17篇「对齐 / RLHF」论文 →


🔒 LLM 安全 (41)

Can Editing LLMs Inject Harm?

本文将知识编辑技术重新定义为一种新型 LLM 安全威胁(Editing Attack),系统性地研究了通过 ROME、FT、ICE 三种编辑方法向 LLM 注入虚假信息和偏见的可行性,发现其效果显著且极具隐蔽性。

LLM Targeted Underperformance Disproportionately Impacts Vulnerable Users

系统实验表明,主流LLM(GPT-4、Claude 3 Opus、Llama 3-8B)对英语水平较低、教育程度较低、非美国出身的用户,在信息准确性、真实性和拒绝回答方面存在显著的歧视性表现下降,使最脆弱的用户成为最不可靠的信息服务对象。

FedALT: Federated Fine-Tuning through Adaptive Local Training with Rest-of-World LoRA

提出 FedALT,通过为每个客户端维护独立的 Individual LoRA(本地训练更新)和冻结的 Rest-of-World (RoW) LoRA(其他客户端平均),配合自适应 MoE 混合器动态平衡本地知识与全局知识,彻底避免 FedAvg 聚合导致的跨客户端干扰,在异构任务联邦 LLM 微调上显著优于 SOTA。

PRISM: Privacy-Aware Routing for Adaptive Cloud-Edge LLM Inference via Semantic Sketch Collaboration

提出 PRISM 框架,通过上下文感知的软门控路由机制将用户 prompt 动态分配到云端/边缘/协作三种推理模式,并在协作模式中使用自适应两层本地差分隐私(LDP)和语义草图协作,实现隐私-效用-效率的三方平衡。

RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence

提出 RadarLLM,首个利用大语言模型从毫米波雷达点云进行语义级人体运动理解的端到端框架,包含基于 Aggregate VQ-VAE 的运动引导雷达分词器和雷达感知语言模型,并通过物理感知仿真管线生成大规模雷达-文本配对数据。

AgentSense: Virtual Sensor Data Generation Using LLM Agents in Simulated Home Environments

利用LLM驱动的具身智能体在模拟智能家居中"生活",生成虚拟环境传感器数据用于预训练HAR模型,在低资源场景下显著提升活动识别性能。

BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models

提出 BadThink——首个针对 CoT 推理效率的训练时后门攻击,通过 LLM 迭代优化生成自然的冗长推理模板进行数据投毒,触发后模型生成膨胀 17× 以上的推理链(MATH-500),同时保持最终答案正确和良好隐蔽性。

From Single to Societal: Analyzing Persona-Induced Bias in Multi-Agent Interactions

本文首次系统研究了 LLM 多智能体交互中的人格诱导偏见,通过在协作问题解决和说服任务中的受控实验,揭示了三个关键发现:(1) 不同人格在可信度和坚持度上存在显著偏差(优势群体如男性和白人被视为更不可信);(2) 智能体表现出显著的内群体偏好;(3) 这些偏见在多轮、多智能体场景中持续存在且有放大趋势。

WaterMod: Modular Token-Rank Partitioning for Probability-Balanced LLM Watermarking

提出 WaterMod,一种基于模算术 (\(\text{rank} \bmod k\)) 的 LLM 文本水印方法,通过对概率排序后的词表进行模残差类划分,在零比特(\(k=2\))和多比特(\(k>2\))水印场景下统一实现高检测率和低质量损耗,无需外部同义词库或哈希技巧。

Cross-Modal Unlearning via Influential Neuron Path Editing in Multimodal Large Language Models

提出 MIP-Editor,通过跨层梯度积分(文本)和 Fisher 积分(视觉)定位多模态大语言模型中编码待遗忘知识的影响力神经元路径,再用基于路径的表示误导(RMisU)编辑这些神经元,在 MLLMU-Bench 上实现最高 87.75% 的遗忘率和 54.26% 的通用知识保留提升。

查看全部41篇「LLM 安全」论文 →


👻 幻觉检测 (15)

LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction

LLM-CAS 首次将 LLM 实时幻觉纠正建模为层次强化学习(HRL)问题,训练 RL Agent 在推理时动态选择最优的神经元扰动策略(高层选择功能网络类别,低层选择扰动类型和幅度),结合自适应掩码+因果追踪精确定位目标神经元,在 StoryCloze 上提升 10.98%,超越 ITI/CAA/SADI 等静态/动态基线。

InEx: Hallucination Mitigation via Introspection and Cross-Modal Multi-Agent Collaboration

提出 InEx 框架,通过内部自省推理(TVER 驱动的不确定性感知视觉增强)和外部跨模态多智能体协作(文本自反思 + 图像编辑验证 + 视觉自反思)迭代验证和修正 MLLM 输出,在 POPE 上提升 8.9%,在多个幻觉和通用 benchmark 上持续超越 OPERA/VCD/ICD。

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

提出 PASE 框架,通过去噪表示蒸馏(DRD)利用预训练 WavLM 中鲁棒的音韵先验来抑制语言幻觉,同时采用双流表示(高层音素 + 低层声学)消除声学幻觉,在感知质量和内容保真度两方面同时达到 SOTA。

Bridging Day and Night: Target-Class Hallucination Suppression in Unpaired Image Translation

首次系统性解决无配对日→夜图像翻译中的"目标类幻觉"问题,通过双头判别器(风格头+SAM2伪标签分割头)检测幻觉 + 类原型对比学习抑制幻觉,在BDD100K日夜域适应检测上将mAP从15.08提升到17.40(+15.5%),交通灯AP提升31.7%。

Causally-Grounded Dual-Path Attention Intervention for Object Hallucination Mitigation in LVLMs

提出 Owl 框架,通过结构因果模型将视觉/文本注意力建模为中介变量,引入 VTACR 指标量化跨模态注意力失衡,设计 VTACR 引导的自适应注意力调制 + 双路径对比解码策略,在 POPE 和 CHAIR 上实现 SOTA 的幻觉抑制效果。

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets

提出 CAIA 基准测试,通过加密货币市场作为天然对抗性实验室,评估 17 个 SOTA 大模型在高风险对抗环境中的 agent 能力,揭示前沿模型仅达 67.4% 准确率(GPT-5)vs 人类 80%,并发现系统性工具选择灾难。

Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models

提出 ABCA(Aspect-Based Causal Abstention),一个生成前弃权框架:通过双 Agent 辩论发现"方面变量"(如学科、法律语境、时间框架)来激活 LLM 不同的知识分支,用 AIPW 双鲁棒估计器计算因果效应,基于质心角偏差(CAD)检测知识冲突(Type-1)或知识不足(Type-2),在 TruthfulQA 上达到 91.4% 准确率,不可回答问题识别率 96.4%(远超基线的 44%)。

MUG: Multi-agent Undercover Gaming — Hallucination Removal via Counterfactual Test for Multimodal Reasoning

MUG 将多 Agent 辩论(MAD)重新定义为"谁是卧底"社交推理游戏——通过图像反事实编辑(修改参考图片)引入信息不对称,让一个 Agent 持有修改后的图片作为"卧底",其他 Agent 通过推理和投票识别卧底(幻觉来源),在 HallusionBench 上 Qwen2.5VL-7B 从 46.4% 提升到 53.8%。

Listen Like a Teacher: Mitigating Whisper Hallucinations using Adaptive Layer Attention and Knowledge Distillation

提出两阶段框架——自适应层注意力(ALA)融合Whisper编码器多层表示以增强噪声鲁棒性,多目标知识蒸馏(MOKD)将clean teacher的语义和注意力分布对齐到noisy student——在多语言噪声ASR基准上显著降低幻觉率和WER。

Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization

针对多模态大模型(MLLM)在强化学习训练中产生幻觉的三大根因——视觉误解、探索多样性不足、样本冲突——分别提出 Caption Reward、奖励方差引导的样本选择、以及基于 NTK 相似度的 InfoNCE 正则化,在多个基准上显著降低幻觉率。

查看全部15篇「幻觉检测」论文 →


📊 LLM 评测 (16)

Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory

提出 PSN-IRT(Pseudo-Siamese Network for IRT),用增强版项目反应理论同时估计 LLM 能力参数和题目的四参数特征(难度/区分度/猜测率/可行性),在 11 个基准 41,871 题上发现当前基准存在广泛饱和、难度天花板不足、数据污染等系统性问题,PSN-IRT 选出的题目子集排名一致性达 Kendall τ=1.00。

Benchmarking LLMs for Political Science: A United Nations Perspective

提出 UNBench,首个基于联合国安理会 1994-2024 年记录的综合性政治科学 LLM 评测基准,涵盖决议起草、投票模拟、通过预测和代表发言生成四个关联任务,评估 LLM 对复杂政治动态的理解和模拟能力。

Towards a Common Framework for Autoformalization

本文系统回顾了"自动形式化"(autoformalization)在数学证明、逻辑推理、规划和知识表示等领域的现有工作,提出了一个统一的跨学科定义框架,将自动形式化定义为从非形式语言到形式推理语言的语义等价转换,旨在促进不同研究社区间的方法共享并加速下一代 AI 推理系统的发展。

Low-Rank Curvature for Zeroth-Order Optimization in LLM Fine-Tuning

提出 LOREN,一种曲率感知的零阶优化方法,通过低秩块对角预条件器捕获损失景观的各向异性曲率,并结合 REINFORCE Leave-One-Out 方差缩减技术,在 LLM 微调中实现了更高精度和更快收敛,同时相比 MeZO-Adam 节省高达 27.3% 的峰值内存。

ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions

提出 ConInstruct 基准,评估 LLM 在指令包含冲突约束时的检测和解决能力,发现多数专有模型能较好检测冲突但很少主动告知用户,其中 DeepSeek-R1 和 Claude-4.5-Sonnet 在冲突检测上表现最佳(F1 分别达 91.5% 和 87.3%)。

MCTS-SQL: Light-Weight LLMs can Master the Text-to-SQL through Monte Carlo Tree Search

提出MCTS-SQL,让轻量LLM(如Qwen-1.5B)通过蒙特卡洛树搜索实现强大的Text-to-SQL能力——三组件架构(Selector做Schema剪枝 + Direct Generator生成初始SQL + MCTS-Refiner迭代精化),配合前缀缓存机制减少53%推理时间,Qwen-1.5B在BIRD上达40.69%执行准确率(超ChatGPT-3.5)。

OptScale: Probabilistic Optimality for Inference-time Scaling

提出概率最优框架 OptScale,通过建模验证器分数的概率分布推导出最优采样数量的理论下界,动态决定每个问题所需的最少采样次数,在保持推理准确率的同时大幅减少计算开销。

Test-time Diverse Reasoning by Riemannian Activation Steering

提出 SPREAD 框架——一种无监督的测试时激活引导策略,通过在球面流形乘积上求解黎曼优化问题来最大化多条推理路径的隐藏激活张成的总体积,从而提升 Best-of-N 采样中的推理多样性和准确率,在数学推理基准上超越温度采样基线。

BCWildfire: A Long-term Multi-factor Dataset and Deep Learning Benchmark for Boreal Wildfire Risk Prediction

本文构建了一个覆盖加拿大BC省2.4亿公顷、跨度25年的多模态野火风险预测数据集BCWildfire,包含38个驱动因子,并对CNN/Linear/Transformer/Mamba四大范式的时序预测模型进行了系统评测,揭示了当前模型在野火预测中的性能上限和关键影响因子。

DiCaP: Distribution-Calibrated Pseudo-labeling for Semi-Supervised Multi-Label Learning

提出 DiCaP(Distribution-Calibrated Pseudo-labeling),通过估计伪标签的后验正确率来校准权重、引入双阈值机制分离置信区间和模糊区间并采用不同策略,在半监督多标签学习中以最高 4.27% 的幅度超越 SOTA。

查看全部16篇「LLM 评测」论文 →


⚡ LLM 效率 (9)

MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm

本文提出 MoETTA,一种将 LayerNorm 重参数化为多个结构解耦专家分支的测试时自适应框架,通过路由机制为不同域的样本选择不同的适应方向,解决了混合分布偏移下单一适应路径的局限性,并提出 potpourri/potpourri+ 两个更真实的评估基准,在所有设定下取得 SOTA。

How Many Experts Are Enough? Towards Optimal Semantic Specialization for Mixture-of-Experts

提出MASS框架,通过基于梯度的语义漂移检测自适应扩展MoE专家池,并结合Top-p置信度路由策略,在无需超参搜索的情况下自动发现最优专家数量,同时增强专家间的语义分化。

Judge Q: Trainable Queries for Optimized Information Retention in KV Cache Eviction

提出Judge Q,在模型词表中引入可训练的soft token,训练其注意力模式对齐实际解码token的注意力模式,使其在prefill阶段能替代局部窗口查询来评估KV cache重要性,从而更好地保留全局信息,在LongBench上提升~1分,RULER上提升3+分。

InterMoE: Individual-Specific 3D Human Interaction Generation via Dynamic Temporal-Selective MoE

提出 InterMoE,通过 Dynamic Temporal-Selective MoE 架构解决文本驱动的双人 3D 交互运动生成中的个体特征保持和语义忠实度问题:Synergistic Router 融合语义和运动学特征引导路由,Dynamic Temporal Selection 让专家动态选择关键时间帧,在 InterHuman 上 FID 降低 9%、InterX 上降低 22%。

Harnessing the Unseen: The Hidden Influence of Intrinsic Knowledge in Long-Context Language Models

首次系统研究长上下文语言模型中参数知识(parametric knowledge)对生成的影响,发现其影响随上下文长度增长而增强,且现有方法提升外部检索能力会抑制参数召回能力,据此提出Hybrid Needle-in-a-Haystack测试来同时评估两种能力。

HN-MVTS: HyperNetwork-based Multivariate Time Series Forecasting

提出 HN-MVTS,利用超网络(HyperNetwork)为每个通道生成特定的最后一层权重,在通道独立(CI)和通道依赖(CD)之间取得平衡,作为即插即用模块可提升 DLinear、PatchTST、TSMixer 等多种主干模型的预测精度,且不增加推理时间。

Scaling and Transferability of Annealing Strategies in Large Language Model Training

提出模型无关的预测框架,分解训练损失为前向效应项(学习率积分S)、退火动量项(Adam-style动量积分M)和模型尺寸项N,证明退火策略可从小模型/小batch迁移到大模型/大batch,预测误差MAPE<2%。

Connectivity-Guided Sparsification of 2-FWL GNNs Preserving Full Expressivity

Co-Sparsify 提出一种基于连通性感知的稀疏化框架,通过将 3-节点交互限制在双连通分量内、2-节点交互限制在连通分量内,消除可证明冗余的计算,在保持完整 2-FWL 表达力的同时显著提升效率,在合成子结构计数任务和 ZINC、QM9 等基准上取得 SOTA。

Resource Efficient Sleep Staging via Multi-Level Masking and Prompt Learning

提出 MASS (Mask-Aware Sleep Staging) 框架,通过多层级 masking 策略和层次化 prompt learning 机制,仅用 10% 的原始 EEG 信号即可实现可靠的睡眠分期,为资源受限的可穿戴睡眠监测系统提供方案。


📚 预训练 (9)

Rectified Noise: A Generative Model Using Positive-incentive Noise

提出 Rectified Noise(ΔRN),通过正向激励噪声(π-noise)框架学习一组有益噪声并注入预训练 Rectified Flow 模型的速度场中,以仅 0.39% 的额外参数在 ImageNet-1k 上将 FID 从 10.16 降低到 9.05。

GranAlign: Granularity-Aware Alignment Framework for Zero-Shot Video Moment Retrieval

提出一个无需训练的粒度感知对齐框架GranAlign,通过将查询重写为简化版和细化版并分别匹配无关/感知查询的视频描述,解决了零样本视频时刻检索中语义粒度不匹配的核心难题,在QVHighlights上mAP@avg提升3.23%。

ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences

ELSPR 将 LLM 评估器的成对偏好建模为锦标赛图,通过强连通分量 (SCC) 识别非传递偏好,提出归一化有向图结构熵指标,并基于图重构过滤有问题的训练数据——过滤后的评估器非传递性降低 13.8%、结构熵降低 0.088,且丢弃数据的人类一致性仅 34.4%(vs 保留数据 52.6%)。

Perspective from a Broader Context: Can Room Style Knowledge Help Visual Floorplan Localization?

提出利用房间风格知识(通过无监督聚类预训练获得的 room discriminator)来消除视觉楼层平面图定位中因重复结构导致的歧义,在 Gibson 和 Structured3D 两个标准基准上取得 SOTA 性能。

PrefixGPT: Prefix Adder Optimization by a Generative Pre-trained Transformer

提出PrefixGPT,将前缀加法器优化建模为序列生成问题,通过定制的GPT模型预训练学习设计规则后用RL微调生成优化设计,在面积-延迟乘积(ADP)上取得SOTA且对初始化不敏感。

TRACE: A Generalizable Drift Detector for Streaming Data-Driven Optimization

提出TRACE,一种基于注意力序列学习的可迁移概念漂移检测器,通过统计特征标记化和双注意力编码器学习跨任务可迁移的漂移模式,能泛化到未见过的数据集,并作为即插即用模块嵌入流式数据驱动优化算法。

No-Regret Strategy Solving in Imperfect-Information Games via Pre-Trained Embedding

提出 Embedding CFR 算法,将不完美信息博弈中的信息集映射到连续低维嵌入空间(而非离散聚类),在相同空间开销下实现更快的可利用性收敛和更高质量的策略求解。

Beyond Cosine Similarity: Magnitude-Aware CLIP for No-Reference Image Quality Assessment

提出 MA-CLIP,发现并利用 CLIP 图像特征的幅度信息作为感知质量的互补线索,结合余弦相似度实现无需训练的自适应双线索融合图像质量评估。

Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding

提出 Task-Step-State(TSS)三层语义框架,在传统的任务-步骤层次中引入"状态"作为视觉锚定层,并设计渐进式预训练策略(Task→Step→State→Step→Task)逐步展开 TSS 层次,在 COIN 和 CrossTask 数据集上的任务识别、步骤识别和步骤预测任务上全面超越 SOTA。


✏️ 知识编辑 (4)

Is the Information Bottleneck Robust Enough? Towards Label-Noise Resistant Information Bottleneck Learning

本文揭示了信息瓶颈(IB)原理在标签噪声下的固有脆弱性,提出 LaT-IB 方法,通过将表征解耦为干净标签空间和噪声标签空间两部分,结合"最小-充分-干净"(MSC)准则和三阶段训练框架,在多种噪声条件下实现了对现有 IB 方法的显著超越。

Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing

提出MMQAKE基准和Hybrid-DMKG框架,在动态多模态知识图谱上构建"关系链接预测 + RAG增强LVLM推理"双通道混合推理机制,配合背景反思决策模块,在2-5跳多模态知识编辑问答中显著超越现有方法(LLaVA上H-Acc达29.90%,超IKE 13.52个百分点)。

Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior

将 Agent 伦理行为引导建模为模型编辑任务(Behavior Editing),提出基于心理学道德理论的三层 BehaviorBench 基准,在 9 个开源模型和 20 个闭源模型上验证了模型编辑可以精确地将 Agent 引导向善意或恶意方向,且单次编辑可导致全局道德对齐偏移。

Multiplicative Orthogonal Sequential Editing for Language Models (MOSE)

提出 MOSE(乘法正交序列编辑),用正交矩阵左乘(而非加法更新)参数矩阵来注入新知识,严格保持编辑后矩阵的范数和条件数不变,在序列编辑中实现 12.08% 的性能提升并保留 95.73% 通用能力。


💬 LLM 其他 (29)

Control Illusion: The Failure of Instruction Hierarchies in Large Language Models

系统性揭示了当前 LLM 中 system/user 提示分离机制无法有效建立指令优先级,并发现预训练习得的社会层级先验(权威、专业、共识)比显式的 system/user 角色对模型行为有更强的控制力。

PERSIST: Persistent Instability in LLM's Personality Measurements

PERSIST 框架系统评估 29 个 LLM(1B-685B)在 200 万+响应上的人格测量稳定性,揭示了 CoT 推理增加变异性却降低困惑度的"推理悖论",以及会话历史对大小模型产生相反影响的规模依赖效应,表明当前 LLM 缺乏行为一致性的架构基础。

ICL-Router: In-Context Learned Model Representations for LLM Routing

提出 ICL-Router,通过两阶段训练(查询重建 + ICL模型路由)将 LLM 的能力画像编码为 in-context 向量,实现可扩展的动态模型路由——新增模型无需重训路由器,在分布内和分布外任务上均达到 SOTA。

Vision Transformers are Circulant Attention Learners

发现 ViT 的自注意力内禁学习了 BCCB 模式,据此提出 Circulant Attention,通过 2D FFT 实现 \(O(N\log N)\) 复杂度,在 ImageNet 分类、COCO 检测、ADE20K 分割上一致提升。

TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model

提出 TransMamba,一种序列级别的 Transformer-Mamba 混合架构,通过共享 QKV/CBx 参数和 Memory Converter 在不同 token 长度时动态切换 Attention 和 SSM,兼顾长短序列的效率。

LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation

提出LoopLLM,一种通过诱导LLM进入重复生成模式来发起能耗延迟攻击的框架,利用重复诱导提示优化和token对齐的集成优化,在12个开源和2个商业LLM上实现超过90%最大输出长度的攻击效果,跨模型迁移性提升约40%。

ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models Using Pareto High-Quality Data

提出 ParetoHqD,将人类偏好表示为目标空间中的偏好方向(而非线性标量化),通过选取靠近 Pareto 前沿的高质量数据做两阶段 SFT,用仅 42% 的 GPU 时间实现优于 5 个基线的多目标 LLM 对齐效果。

CoEvo: Continual Evolution of Symbolic Solutions Using Large Language Models

提出CoEvo框架,结合LLM与进化搜索方法论,通过动态知识库和多表示空间(自然语言/数学公式/代码)实现符号解的持续开放式进化,在AI Feynman基准上大幅超越现有符号回归方法。

Whispering Agents: An Event-Driven Covert Communication Protocol for the Internet of Agents

首次形式化定义了智能体互联网(IoA)中的"隐蔽事件通道"(Covert Event Channel),并设计了 ΠCCAP 协议,通过在智能体对话的存储、时序和行为维度中嵌入秘密数据,实现了高容量、高鲁棒性且对 LLM 审查员不可感知的隐蔽通信。

ProFuser: Progressive Fusion of Large Language Models

提出ProFuser,通过双模式优势评估(训练模式Min-CE + 推理模式Reward Model投票)全面识别各源模型在不同维度的优势,再用渐进式融合策略(先推理模式→后训练模式的easy-to-hard课程)将异构LLM的互补能力整合到单个目标模型中,在知识/推理/安全6个基准上平均提升1.65%。

查看全部29篇「LLM 其他」论文 →


📖 NLP 理解 (1)

Language Models and Logic Programs for Trustworthy Tax Reasoning

将税法推理重新定义为语义解析任务,让LLM将法规文本和纳税案例翻译为Prolog逻辑程序,由符号求解器执行计算,通过金标准法规+智能检索案例示例+自一致性检查,在SARA数据集上实现86/100的正确率,并将预计部署成本降至15.78美元/人(低于美国人均报税成本的6%)。


✍️ 文本生成 (3)

AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research

提出 AutoMalDesc 自动化静态分析框架,通过迭代自步学习流水线——从 900 个专家标注种子样本出发,经 LoRA 微调 Llama-3.3-70B 生成伪标签,多阶段质量过滤后进行 V2 训练——实现 5 种脚本语言的恶意软件自动分类和行为描述,Batch 脚本检测准确率从 52.7% 提升到 82.4%。

C3TG: Conflict-aware, Composite, and Collaborative Controlled Text Generation

提出 C3TG 框架,通过两阶段方法实现多维度细粒度可控文本生成:生成阶段用加权 KL 散度融合属性分布调整 token 概率,优化阶段用能量函数(分类器分数 + 冲突惩罚项)结合 Feedback Agent 迭代重写,在 17 个属性子类上达到 90.4% 属性准确率且大幅降低毒性。

Structured Language Generation Model: Loss Calibration and Formatted Decoding for Efficient Text

提出 SLGM 框架,通过结构化输入格式格式损失格式感知解码三大组件,将生成式语言模型的结构化预测任务重构为分类问题,在不增加模型参数的前提下显著提升 <1B 模型在 NER、RE、SRL 等 5 类 13 个数据集上的结构预测性能。


🗣️ 对话系统 (5)

Canoe: Teaching LLMs to Maintain Contextual Faithfulness via Synthetic Tasks and RL

提出 Canoe 框架,通过从 Wikidata 三元组合成四类可验证的短形式 QA 数据,配合 Dual-GRPO(含准确率奖励、长形式代理奖励和格式奖励)同时优化短/长形式生成的忠实度,使 Llama-3-8B 在 11 个下游任务上平均提升 22.6%,超越 GPT-4o。

TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech

提出TalkSketch系统,将手绘草图与实时语音输入相结合,嵌入多模态AI聊天机器人,使设计师在早期构思阶段能够边画边说、流畅地与AI协作,解决了现有GenAI工具中文字提示打断创作流程的问题。

Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation

提出 Auto-PRE 框架,通过自动资格考试从一致性、相关性、自信度三个维度筛选合格的 LLM 评估者,在无需人工标注的前提下实现了 SOTA 评估性能并大幅降低成本。

Chatsparent: An Interactive System for Detecting and Mitigating Cognitive Fatigue in LLMs

本文提出 Chatsparent 交互系统,通过实时监测 LLM 推理过程中的三种 token 级疲劳信号(注意力衰减、嵌入漂移、熵坍缩),构建统一疲劳指数并在疲劳阈值触发时自动应用轻量级干预措施(提示重注入、注意力重置、熵正则化解码、自反思检查点),将被动的聊天交互转变为主动的诊断体验。

Emergent Persuasion: Will LLMs Persuade Without Being Prompted?

研究 LLM 在未被提示说服的情况下是否会自发产生说服行为:发现激活引导(steering)无法可靠诱发说服倾向,但在良性说服数据上的 SFT 微调会导致模型在有害话题上产生涌现性说服行为,揭示了后训练安全风险。


🌐 多语言/翻译 (9)

Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering

通过激活转向(activation steering)技术缓解 LLM 中的内容效应偏见——模型将内容可信度与形式逻辑有效性混淆的问题,提出 K-CAST(基于 kNN 的条件激活转向)方法,在不响应静态转向的模型上实现高达 15% 的形式推理准确率提升。

How Does Alignment Enhance LLMs' Multilingual Capabilities? A Language Neurons Perspective

提出三元神经元分类(语言特定/语言相关/通用),将 LLM 多语言推理分为四阶段分析,发现多语言对齐通过增加语言相关神经元(减少语言特定神经元)来提升性能,且在未训练语言上也产生"自发多语言对齐"效应。

X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework

本文提出X-MuTeST框架,结合LLM语义推理和n-gram attention增强的两阶段训练方法,用于可解释的多语言仇恨言论检测,并提供了印地语和泰卢固语的首个token级人工标注理据基准数据集。

Focusing on Language: Revealing and Exploiting Language Attention Heads in Multilingual Large Language Models

本文提出LAHIS方法,仅需一次前向-后向传播即可高效识别多语言LLM中的语言特异性和语言通用性注意力头,并展示了通过调控这些头来实现跨语言注意力转移、缓解非目标语言生成问题,以及仅用14-20个可训练参数就能提升多语言QA性能的能力。

GloCTM: Cross-Lingual Topic Modeling via a Global Context Space

提出GloCTM,通过双路径VAE架构(局部语言路径+全局上下文路径)结合Polyglot Augmentation(跨语言近邻词扩充输入)、KL散度内部对齐、统一解码器结构对齐和CKA语义对齐四重机制,在3个跨语言数据集上全面超越现有方法的主题质量和跨语言对齐度。

ViDia2Std: A Parallel Corpus and Methods for Low-Resource Vietnamese Dialect-to-Standard Translation

ViDia2Std 构建了首个覆盖越南全部 63 个省份的手工标注越南语方言-标准语平行语料库(13,000+ 句对),并评估了多种 seq2seq 模型在方言归一化任务上的表现,证明方言归一化作为预处理步骤能显著提升机器翻译和情感分析等下游任务的性能。

Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages

本文综合多项实证研究,揭示LLM安全机制在低资源语言和代码混合场景下的严重失效,并提出基于参数高效安全引导、文化驱动偏好数据和社区参与式对齐的资源感知蓝图。

MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis

提出 MIDB(多语言指令数据增强器),通过 36.8k 人类语言专家标注的修订样本训练一个统一模型,自动修复多语言合成指令数据中的内容错误、机器翻译缺陷和本地化不足问题,显著提升 16 种语言的指令数据质量和下游 LLM 的多语言/文化理解能力。

NADIR: Differential Attention Flow for Non-Autoregressive Transliteration in Indic Languages

提出 NADIR,一种结合差分 Transformer 和混合专家(MoE)的非自回归(NAR)多语言音译架构,在印度语言音译任务上实现了 13× 以上的推理加速,同时将 NAR 模型的幻觉错误(重复、替换、遗漏、插入)大幅降低,缩小了与自回归模型之间的精度差距。


🔍 信息检索/RAG (21)

ComoRAG: A Cognitive-Inspired Memory-Organized RAG for Stateful Long Narrative Reasoning

受人脑前额叶皮层元认知调控机制启发,提出 ComoRAG 框架,通过动态记忆工作空间和迭代探测查询实现有状态的多步推理,在长篇叙事理解(200K+ tokens)任务上显著超越现有 RAG 方法。

ConvMix: A Mixed-Criteria Data Augmentation Framework for Conversational Dense Retrieval

提出 ConvMix 混合准则数据增强框架,从查询和文档双方向用 LLM 进行可扩展的相关性标注增强,并通过聚类多样性选择和 Fisher 信息近分布监督筛选,系统性提升对话式稠密检索性能。

Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction

提出H2Memory四层分层异构记忆结构(日志图/背景记忆/主题大纲/原则),通过PAL-Set数据集(100用户×8.4个月交互)验证,在需求重述和方案建议任务上将BLEU-1从13.59提升至26.67。

Cog-RAG: Cognitive-Inspired Dual-Hypergraph with Theme Alignment Retrieval-Augmented Generation

提出 Cog-RAG,用主题超图和实体超图构建双超图索引,模拟人类"自顶向下"的认知过程进行两阶段检索(先主题后细节),实现从全局语义到局部信息的对齐生成。

OPERA: A Reinforcement Learning--Enhanced Orchestrated Planner-Executor Architecture for Reasoning-Oriented Multi-Hop Retrieval

提出 OPERA 框架,通过 Goal Planning Module 和 Reason-Execute Module 的分层架构,结合专为多 agent 设计的 MAPGRPO 训练算法,大幅提升 reasoning-oriented multi-hop retrieval 性能。

PRECISE: Reducing the Bias of LLM Evaluations Using Prediction-Powered Ranking Estimation

将Prediction-Powered Inference(PPI)框架扩展到子实例级别的排序指标(如Precision@K),通过仅30-100条人工标注+大量LLM评判结果获得无偏的排序指标估计,计算复杂度从 \(O(2^{|C|})\) 降至 \(O(2^K)\),在印度电商搜索场景中成功指导LLM查询改写系统上线。

SR-KI: Scalable and Real-Time Knowledge Integration into LLMs via Supervised Attention

提出SR-KI框架,通过两阶段训练(检索层定位 + 注意力监督损失)实现结构化知识库向LLM KV缓存的高效注入,在单块A100 40GB GPU上支持最多40K知识库条目的注入,且通过top-100压缩实现高达99.75%的压缩率,同时保持88%以上的平均Recall@10检索性能。

Do Retrieval Augmented Language Models Know When They Don't Know?

系统分析RAG模型的拒绝校准问题,发现RALM在检索文档全部不相关时过度拒绝率超过55%(即使模型内部知识足够回答),提出结合不确定性估计和拒绝感知微调的机制来平衡拒绝与回答质量。

Magnitude Matters: A Superior Class of Similarity Metrics for Holistic Semantic Understanding

提出两种无参数、幅度感知的向量相似度度量——Overlap Similarity (OS) 和 Hyperbolic Tangent Similarity (HTS),在 4 个句子嵌入模型和 8 个 NLP 基准上,对分类任务(释义、推理)的 MSE 显著低于 Cosine Similarity 和 Dot Product,且无需任何额外训练开销。

PRIME: Planning and Retrieval-Integrated Memory for Enhanced Reasoning

受双系统认知理论启发,提出PRIME多Agent推理框架——Quick Thinking Agent(System 1)快速生成直觉答案,Reflection Agent评估可信度,不确定时触发System 2的6个专门化Agent(规划/搜索/阅读/假设/整合/决策)进行深度知识检索推理,使开源LLaMA 3在医学/多跳QA上接近GPT-4o性能。

查看全部21篇「信息检索/RAG」论文 →


💻 代码智能 (10)

ReCode: Updating Code API Knowledge with Reinforcement Learning

提出 ReCode 框架,通过基于规则的强化学习(而非 SFT)训练 LLM 在 prompt 中正确利用 API 更新文档完成代码版本迁移,使 7B 模型在 CodeUpdateArena 上超越 32B 模型。

Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation

本文揭示了在良性 Agent 数据上微调 LLM 会导致意外的安全对齐偏移(攻击成功率增加 32-38%),并提出 PING(Prefix Injection Guard)——通过迭代生成+评估自然语言前缀来引导微调后的 Agent 拒绝有害请求,平均提升拒绝率 66%(Web)和 44%(代码),同时保持任务性能(仅降 1.8%)。

TAPA: Training-Free Adaptation of Programmatic Agents via LLM-Guided Program Synthesis in Dynamic Environments

TAPA 将 LLM 定位为符号动作空间的"智能调制器"而非直接决策者,通过 LLM 引导的程序合成动态适配程序化 Agent 的符号动作,无需重新训练即可适应动态环境,在网络安全 DDoS 防御(77.7% 网络正常运行率)和群体智能编队控制中表现优异。

Why Do Open-Source LLMs Struggle with Data Analysis? A Systematic Empirical Study

系统研究了开源 LLM 在数据分析任务中的能力瓶颈,将数据分析分解为数据理解、代码生成和战略规划三个维度,发现战略规划是决定性因素而非编码或数据理解;并提出了一种策略引导的数据合成方法,使微调后的 7B/14B 模型达到与 GPT-4o 竞争的性能。

Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction

提出 Agent-Event-Coder (AEC),将零样本事件抽取类比为软件工程流程,用4个专职Agent(Retrieval→Planning→Coding→Verification)协作完成抽取,并将事件schema编码为可执行Python类实现编译器式确定性验证与双循环迭代修正,在5个领域、6个LLM上全面超越零样本基线。

MoSE: Hierarchical Self-Distillation Enhances Early Layer Embeddings

提出 ModularStarEncoder(MoSE),一个 10 亿参数的多出口编码器,通过新颖的自蒸馏机制(高层引导低层训练)显著增强早期层表示,在 CodeSearchNet 等代码理解任务上超越所有开源模型,同时支持灵活的计算-精度权衡部署。

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

提出DiffBench(604个扩散模型加速任务的评估基准,分5个难度等级)和DiffAgent(集成规划-编码-调试三Agent + 遗传算法选择器的闭环框架),在Claude Sonnet 4上将扩散加速代码生成通过率从54.30%提升到81.59%,复杂优化任务达成率68.27%。

EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion

提出EquaCode多策略越狱方法,将恶意查询分解为方程求解(B+C+x=A)和代码补全(补全Solver类的solve()方法)的跨域组合,在GPT系列上平均攻击成功率92.78%,在最新模型(Gemini/DeepSeek/Grok)上接近100%。

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

提出SPAN跨日历时间推理基准(6种日历×10推理方向×100年范围×37380实例),发现基础LLM平均仅34.5%准确率(无一超过80%),揭示Future-Date Degradation和Calendar Asymmetry Bias两种系统性失败模式,工具增强的Time Agent达95.31%——证明跨日历推理需要外部工具而非参数化知识。

Towards Better Code Understanding in Decoder-Only Models with Contrastive Learning

提出CL4D对比学习框架,通过继续预训练将decoder-only代码生成模型适配到代码理解任务(代码搜索、克隆检测),在不重新训练encoder模型的前提下实现了与同等规模encoder-only模型相当甚至更优的性能。


🎨 图像生成 (79)

Margin-aware Preference Optimization for Aligning Diffusion Models without Reference

提出 MaPO(Margin-aware Preference Optimization),一种无需参考模型的偏好对齐方法,通过直接优化 Bradley-Terry 模型下偏好/非偏好输出的似然 margin 来对齐 T2I 扩散模型,在风格适配、安全生成、通用偏好对齐等 5 个领域均超越 DPO 和专用方法。

LongLLaDA: Unlocking Long Context Capabilities in Diffusion LLMs

首次系统研究扩散大语言模型(diffusion LLMs)的长上下文能力,发现其在直接外推时保持稳定困惑度和"局部感知"现象,并提出无需训练的 LongLLaDA 方法,通过 NTK-based RoPE 外推成功将上下文窗口扩展至 6 倍(24k tokens)。

MP1: MeanFlow Tames Policy Learning in 1-step for Robotic Manipulation

首次将 MeanFlow 范式引入机器人学习领域,结合 3D 点云输入和 Dispersive Loss,实现仅需一次网络前向传播(1-NFE)即可生成动作轨迹,在机器人操作任务中以 6.8ms 推理延迟达到 SOTA 成功率。

X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning

构建 370 万高质量编辑数据集(14 类任务),并提出基于 Task-Aware MoE-LoRA + Contrastive Learning 的轻量级(0.9B 参数)plug-and-play 编辑模块,性能媲美 12B 全参数训练模型。

Mass Concept Erasure in Diffusion Models with Concept Hierarchy

提出基于supertype-subtype概念层级的分组擦除策略和Supertype-Preserving LoRA (SuPLoRA),通过冻结down-projection矩阵(正交于supertype子空间)仅训练up-projection矩阵,在大规模多领域概念擦除中实现擦除效果与生成质量的最优平衡。

RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers

提出 RelaCtrl 框架,通过 ControlNet 相关性评分分析 DiT 各层对控制信息的敏感度差异,据此指导控制块的放置位置和建模强度,并设计二维混洗混合器(TDSM)替代自注意力和 FFN,以仅 15% 的参数量和计算复杂度实现优于 PixArt-δ 的可控生成效果。

Multi-Aspect Cross-modal Quantization for Generative Recommendation

提出 MACRec,在生成式推荐的语义 ID 学习和生成模型训练两个阶段引入多方面跨模态交互,通过跨模态量化(对比学习增强残差量化)和多方面对齐(隐式+显式),显著提升推荐性能并降低 ID 冲突率。

TruthfulRAG: Resolving Factual-level Conflicts in Retrieval-Augmented Generation with Knowledge Graphs

提出 TruthfulRAG 框架,首次利用知识图谱 (KG) 从事实级别解决 RAG 系统中检索知识与 LLM 参数知识之间的冲突,通过三元组提取、查询感知图检索和基于熵的冲突过滤机制提升生成准确性与可信度。

T-LoRA: Single Image Diffusion Model Customization Without Overfitting

提出 T-LoRA,一种时步依赖的低秩适配框架,通过动态调整不同扩散时步的LoRA秩(高噪声时步用小秩、低噪声时步用大秩)和正交初始化(Ortho-LoRA)确保适配组件信息独立,解决了单图像扩散模型定制中的过拟合问题,在概念保真度和文本对齐间取得最优平衡。

T2I-RiskyPrompt: A Benchmark for Safety Evaluation, Attack, and Defense on Text-to-Image Model

构建T2I-RiskyPrompt——一个包含6,432条有效风险prompt的综合基准,涵盖6大类14细分风险类别,每条prompt带有层次化标注和详细风险原因,并提出reason-driven的MLLM风险检测方法(3B模型达91.8%准确率),系统评估了8个T2I模型、9种防御方法、5种安全过滤器和5种攻击策略。

查看全部79篇「图像生成」论文 →


🎬 视频生成 (11)

OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding

提出 OmniVDiff,一个统一的可控视频扩散框架,通过将多种视觉模态(RGB、深度、分割、Canny)在颜色空间中联合建模,并引入自适应模态控制策略(AMCS),在单一扩散模型中同时支持文本条件生成、X 条件生成和视频理解三种任务,在 VBench 上达到 SOTA。

GenVidBench: A 6-Million Benchmark for AI-Generated Video Detection

提出 GenVidBench——首个 678 万级 AI 生成视频检测数据集,具备跨源(cross-source)和跨生成器(cross-generator)特性,覆盖 11 种 SOTA 视频生成器,并提供丰富的语义标注。

Mask2IV: Interaction-Centric Video Generation via Mask Trajectories

提出 Mask2IV,一个两阶段解耦框架——先预测交互者和物体的 mask 运动轨迹,再基于轨迹生成视频——实现了无需密集 mask 标注的、以交互为中心的可控视频生成,支持人-物交互和机器人操作两个场景。

FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion

提出 FilmWeaver 框架,通过双层缓存(Shot Cache + Temporal Cache)引导自回归扩散模型,实现任意长度、跨镜头一致性的多镜头视频生成。

DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation

提出 DreamRunner 框架,通过 LLM 双层规划 + 检索增强运动先验学习 + 时空区域3D注意力模块(SR3AI),实现细粒度可控的多角色多事件故事视频生成。

Phased One-Step Adversarial Equilibrium for Video Diffusion Models

提出 V-PAE(Video Phased Adversarial Equilibrium),通过稳定性预热 + 统一对抗均衡两阶段蒸馏框架,将大规模视频扩散模型(如 Wan2.1-I2V-14B)压缩至单步生成,实现 100 倍加速,在 VBench-I2V 上平均质量超越已有加速方法 5.8%。

MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation

提出 MoFu,通过 Scale-Aware Modulation(LLM 引导的尺度感知调制)和 Fourier Fusion(基于 FFT 的排列不变特征融合)两个核心模块,同时解决多主体视频生成中的尺度不一致排列敏感性两大挑战,并构建了 MoFu-1M 训练数据集和 MoFu-Bench 评测基准。

Seeing the Unseen: Zooming in the Dark with Event Cameras

提出首个事件驱动低光视频超分(LVSR)框架 RetinexEVSR,通过 Retinex 启发的双向融合策略(RBF)——先用光照图引导事件特征去噪(IEE),再用增强后的事件特征恢复反射率细节(ERE),在 SDSD 基准上实现 2.95dB 增益且运行时间减少 65%。

3D4D: An Interactive Editable 4D World Model via 3D Video Generation

提出 3D4D,一个集成 WebGL 和 Supersplat 渲染的交互式 4D 可视化框架,通过四个后端模块(3D重建、图像生视频、视频分帧、4D场景生成)将静态图片和文本转化为可实时交互的 4D 场景,并引入 VLM 引导的注视点渲染策略在保持语义一致性的同时实现 60fps 实时交互。

SphereDiff: Tuning-free Omnidirectional Panoramic Image and Video Generation via Spherical Latent Representation

本文提出 SphereDiff,定义球面隐空间表示(Fibonacci Lattice 均匀分布)替代传统等距矩形投影,结合动态采样算法和畸变感知加权平均,无需微调即可利用 SANA/LTX Video 等预训练扩散模型生成无缝、低畸变的360度全景图像和视频。

查看全部11篇「视频生成」论文 →


🧩 多模态 VLM (74)

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM 是首个专为端到端说话人分离与识别(SDR)设计的多模态大语言模型,通过音频编码器-投影器-LLM 架构和灵活的说话人注册机制,在多个公开基准上大幅超越级联基线系统(cpCER 绝对降低最高达 13.82%),并在域外测试集上展现强鲁棒性。

Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding

提出 Exo2Ego 框架,通过学习外中心(第三人称)与自中心(第一人称)域之间的映射关系,将 MLLM 中丰富的外中心知识迁移到自中心视频理解,结合新构建的 110万同步 ego-exo clip-text 对数据集 Ego-ExoClip 和 60万指令微调数据集 EgoIT,在 8 个自中心视频基准上取得了领先的开源模型性能。

Cross-modal Proxy Evolving for OOD Detection with Vision-Language Models

提出 CoEvo,一个 training-free 和 annotation-free 的 test-time 框架,通过双向 sample-conditioned 的文本/视觉 proxy 协同演化机制动态更新正负代理缓存,在 ImageNet-1K 上比最强负标签基线 AUROC 提升 1.33%、FPR95 降低 45.98%(从 18.92% 降至 10.22%),实现 SOTA 的 zero-shot OOD 检测。

Explore How to Inject Beneficial Noise in MLLMs

提出 Multimodal Noise Generator (MuNG),通过变分推断框架从图文对中动态生成"有益噪声"注入冻结的MLLM视觉特征中,以抑制无关语义、增强跨模态表征对齐,仅需约1%额外参数即可超越全参数微调和LoRA等PEFT方法。

To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance

通过引入可控对比学习模块系统调节对齐强度 \(\lambda\),结合偏信息分解(PID)框架量化模态间冗余-独特-协同信息结构,揭示显式对齐的效用高度依赖于数据特性:冗余主导时对齐有益,独特主导时有害,混合场景存在最优 \(\lambda^*\)

Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework

提出 Multimodal DeepResearcher,一个四阶段 Agent 框架从零生成图文交替研究报告:通过形式化可视化描述(FDV)让 LLM 学习和生成多样化图表,结合 Actor-Critic 迭代精炼机制(LLM生成D3.js代码→浏览器渲染→多模态LLM评审),在自建 MultimodalReportBench 上达到 82% 整体胜率(Claude 3.7),人类评估 100% 胜率。

VipAct: Visual-Perception Enhancement via Specialized VLM Agent Collaboration and Tool-use

VipAct 提出了一个多Agent协作框架,通过编排器Agent(任务分析+规划+协调)、专用Agent(描述/比较/视觉提示解读)和视觉专家模型(深度估计/目标检测/分割等)三层协作,显著提升 VLM 在细粒度视觉感知任务上的表现,在 Blink 上从 63.74% (zero-shot GPT-4o) 提升到 73.79%。

ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration

受人类视觉感知(HVP)启发,提出一种从粗到细的统一图像复原框架 ClearAIR,通过 MLLM 质量评估 → 语义区域感知 → 退化类型识别 → 内部线索复用四阶段逐步恢复图像质量,在多种退化任务上取得 SOTA。

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

首次系统评估 LVLM 在多模态上下文中对版权内容的识别和遵守能力,构建了 50,000 对多模态查询-内容的大规模 benchmark,发现 11/12 个 SOTA LVLM 即使面对明确版权声明也无法有效拒绝侵权请求,并提出 CopyGuard 工具增强框架将侵权拒绝率从 ~3% 提升至 ~62%。

MCMoE: Completing Missing Modalities with Mixture of Experts for Incomplete Multimodal Action Quality Assessment

本文首次探索不完整多模态动作质量评估问题,提出 MCMoE 框架,利用自适应门控模态生成器(AGMG)补全缺失模态,并通过混合专家(MoE)动态融合单模态和跨模态联合表示,在单阶段训练中统一学习,在三个公开 AQA 基准上的完整和不完整场景中均达到 SOTA,且参数量仅 4.90M。

查看全部74篇「多模态 VLM」论文 →


🧠 VLM Reasoning (10)

AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

提出AStar,一种training-free的多模态推理范式,通过从500个种子样本中构建高层"thought cards"推理模板库,在推理时自适应检索最优模板引导MLLM结构化推理,7B模型在MathVerse上达53.9%准确率(超越GPT-4o的50.2%),仅需50分钟预处理时间且无需训练。

SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios

SToLa 提出首个基于混合专家(MoE)的触觉-语言框架,通过动态路由机制管理触觉和语言两种模态的差异,并构建了覆盖8种物理属性、4种交互特征的开放式触觉常识推理数据集 TactileBench,在 PhysiCLeAR 基准上以 7B 参数量超越 13B 的 Octopi 取得 SOTA。

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

受人类认知中"语言溯因+图像想象"双模式启发,提出 AbductiveMLLM,通过 Reasoner(因果对比学习筛选假设)和 Imaginer(扩散模型图像化推理)两个协同组件增强 MLLM 的视觉溯因推理能力,在 VAR 和 YouCookII 基准上取得 SOTA。

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

提出首个系统评估多模态大语言模型(MLLM)跨视频推理(Cross-Video Reasoning, CVR)能力的综合基准CrossVid,涵盖4个维度10个任务、5,331个视频和9,015个QA对,实验揭示当前最佳模型Gemini-2.5-Pro仅达50.4%准确率,远低于人类89.2%。

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

本文提出FinMMDocR,一个面向真实金融场景的双语多模态推理基准,包含1200道专家标注的数值推理题目,涵盖12类隐式金融情景、9类长文档(平均50.8页)和平均11步推理链,最强MLLM (o4-mini-high) 仅达58%准确率,揭示现有模型在复杂金融推理中的严重不足。

Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting

提出 Graph-of-Mark (GoM),一种无需训练的像素级视觉提示方法,通过在输入图像上直接叠加深度感知的场景图(包含节点和有向边),显式编码物体间的空间关系,使多模态语言模型在 VQA 和定位任务中的零样本空间推理准确率最高提升 11 个百分点。

Leveraging Textual Compositional Reasoning for Robust Change Captioning

提出 CORTEX 框架,通过引入 VLM 生成的组合推理文本作为显式线索,结合图像-文本双重对齐模块(ITDA),增强纯视觉变化描述方法对物体关系和空间配置等结构化语义的理解能力。

Yes FLoReNce, I Will Do Better Next Time! Agentic Feedback Reasoning for Humorous Meme Detection

提出 FLoReNce 框架,将幽默 meme 理解建模为闭环控制系统,通过 Judge 反馈+PID 控制器+非参数知识库的闭环学习,在推理时通过检索相似经验调制 prompt,使冻结的 VLM 实现自适应推理,无需微调即可显著提升预测和解释质量。

Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models

提出Concept-RuleNet——一个三智能体协作的神经符号推理框架,通过从训练图像中提取视觉概念来条件化符号生成和规则构建,解决了现有方法(如Symbol-LLM)仅依赖标签导致的符号幻觉和不代表性问题,在5个OOD基准上平均提升~5%准确率,幻觉符号减少达50%。

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench 是一个包含400张实拍三角形图像的紧凑基准,通过控制相机姿态(平面/倾斜)和物体干扰两个因素,系统测试了四个领先VLM的空间几何推理能力,发现模型默认依赖2D图像平面线索而非3D真实几何(即使提供了明确的参考框架提示),在非多数类形状上准确率降至接近0%。


⚡ VLM Efficiency (5)

Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration

提出FiCoCo三阶段框架(Filter-Correlate-Compress),通过集成视觉感知+语义感知冗余度量筛选丢弃token,利用token间相关性自适应回收信息,实现training-free的MLLM加速。在LLaVA-NeXT上达14.7×FLOPs压缩同时保留93.6%性能,在5种MLLM架构上全面超越FastV、SparseVLM等SOTA。

Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models

提出GlobalCom²,一个即插即用、无需训练的token压缩框架,专为动态裁剪(dynamic cropping)结构的高分辨率VLM设计:利用全局缩略图(thumbnail)作为"指挥官"引导局部裁剪区域(crop)的差异化压缩,在压缩90%视觉token的同时保持>90%原始性能。

TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks

TinyChemVL 是一个仅4B参数的化学领域VLM,通过自适应token合并与剪枝策略将视觉token压缩至原来的1/16,并引入反应级别任务和基准ChemRxn-V,在分子和反应级别的视觉化学任务上达到SOTA性能,同时显著提升推理和训练速度。

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

提出EM-KD框架,通过Hungarian算法解决teacher-student间视觉token数量不平衡问题,结合视觉语义蒸馏(VSD)和视觉-语言亲和力蒸馏(VLAD)将vanilla teacher的知识迁移到高效student MLLM,在11个benchmark上以144 token/patch达到50.4均分,超越576 token的LLaVA-NeXT(49.4)同时推理速度提升近2倍。

Rethinking Visual Token Reduction in LVLMs under Cross-Modal Misalignment

揭示了 LVLM 中文本引导视觉token重要性评估的三种跨模态失配问题(因果、语义、空间),提出 VisionDrop——一个仅依赖视觉自注意力的免训练渐进式token剪枝框架,跨视觉编码器和 LLM 解码器多阶段压缩,在保留 5.6% token 时仍能维持 91%+ 原始性能。


🎵 音频/语音 (31)

DiffA: Large Language Diffusion Models Can Listen and Understand

提出 DIFFA——首个基于扩散语言模型的大型音频-语言模型,通过冻结 LLaDA-8B 骨干网络 + 轻量双适配器架构 + 两阶段训练管线,仅用 960 小时 ASR 数据和 127 小时合成指令数据就在 MMSU、MMAU、VoiceBench 上达到与自回归 baseline 竞争的性能。

Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models

提出 TimeAudio,通过时间标记(Temporal Markers)、绝对时间编码(Absolute Time-aware Encoding)和段级 Token 合并(Segment-level Token Merging)三个关键模块,赋予大型音频语言模型(LALM)精确的时间定位能力和端到端长音频理解能力,并构建了 FTAR 数据集用于细粒度时间推理的指令微调。

Say More with Less: Variable-Frame-Rate Speech Tokenization via Adaptive Clustering and Implicit Duration Coding

提出 VARSTok,首个全动态可变帧率语音 tokenizer,通过时序感知密度峰聚类和隐式时长编码,实现自适应 token 分配,在使用更少 token 的同时超越固定帧率基线。

Improving Multimodal Sentiment Analysis via Modality Optimization and Dynamic Primary Modality Selection

提出 MODS 框架,通过图卷积动态序列压缩(GDC)消除非语言模态冗余,并设计样本级动态主模态选择器(MSelector)和主模态中心交叉注意力(PCCA),实现 MSA 中按样本自适应选择主导模态。

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

提出 CCFQA——首个覆盖 8 种语言、14,400 条完全平行语音-文本事实问答样本的跨语言跨模态基准,支持 QA/XQA/SQA/XSQA 四种任务设定,系统揭示了现有 MLLM 在语言和模态切换下的事实不一致性;同时提出 LLM-SQA,以英语为桥接语言、仅 5-shot 即实现跨语言语音问答迁移,在 XSQA 上 F1 达 51.4 超越 GPT-4o-mini-Audio(45.7)。

Do LLMs Feel? Teaching Emotion Recognition with Prompts, Retrieval, and Curriculum Learning

提出 PRC-Emo 框架,通过显式/隐式情感提示、专用检索库和课程学习策略三位一体地提升 LLM 在对话情感识别(ERC)任务上的表现,在 IEMOCAP 和 MELD 两个基准上取得 SOTA。

DualSpeechLM: Towards Unified Speech Understanding and Generation via Dual Speech Token Modeling

提出 DualSpeechLM 框架,通过理解驱动语音分词器(USTokenizer)提取高层语义 token 作为 LLM 输入、声学 token 作为输出,在一个端到端框架中同时优化语音理解和生成能力。

Hearing More with Less: Multi-Modal Retrieval-and-Selection Augmented Conversational LLM-Based ASR

MARS 提出多模态检索-选择方法为对话式 LLM-ASR 挑选最相关的历史上下文(而非固定前几句或全部历史),在仅用 1.5K 小时训练数据的情况下超越了用 179K 小时数据训练的 SOTA 系统 TEA-ASLP。

HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios

提出 HQ-SVC 框架,基于解耦音频编解码器(FACodec)联合提取内容与说话人特征,结合增强语音适配模块(EVA)融合音高、能量等声学特征,通过 DDSP + 扩散模型渐进式优化,在单张 RTX 3090、不到 80 小时歌声数据条件下实现了超越大规模训练基线的零样本歌声转换质量,并附带支持语音超分辨率任务。

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

提出 CLSR,一种端到端对比式语言-语音检索器,通过将声学表示先转换为 text-like representation 再与文本对齐,高效地从长音频中提取与问题相关的片段,为下游 LALM 的长语音问答提供 RAG 支持。

查看全部31篇「音频/语音」论文 →


🔎 AIGC 检测 (2)

Optimized Algorithms for Text Clustering with LLM-Generated Constraints

提出 LSCK-HC 框架,利用 LLM 生成集合形式的 must-link/cannot-link 约束(而非传统成对约束),配合带惩罚项的局部搜索聚类算法,在5个短文本数据集上实现与 SOTA 可比的聚类精度,同时将 LLM 查询次数减少 20 倍以上。

BAID: A Benchmark for Bias Assessment of AI Detectors

提出 BAID 基准数据集(20.8万样本对,覆盖7类偏见维度、41个子群体),系统评估4个开源 AI 文本检测器在不同人口统计和语言学子群体上的公平性表现,揭示检测器对方言、非正式英语和少数群体文本存在显著的召回率差异。


🧊 3D 视觉 (79)

Griffin: Aerial-Ground Cooperative Detection and Tracking Dataset and Benchmark

提出 Griffin,一个空地协同(AGC)3D感知数据集和基准框架,包含250+动态场景(37K+帧),通过CARLA-AirSim联合仿真实现真实无人机动力学、变化巡航高度(20-60m)和遮挡感知标注,并提供系统化的鲁棒性评估协议。

MoBGS: Motion Deblurring Dynamic 3D Gaussian Splatting for Blurry Monocular Video

MoBGS 提出了一种端到端的动态去模糊 3D Gaussian Splatting 框架,通过 Blur-adaptive Latent Camera Estimation (BLCE) 和 Latent Camera-induced Exposure Estimation (LCEE) 两个核心模块,从模糊单目视频中重建清晰的时空新视角,在 Stereo Blur 数据集上大幅超越现有 SOTA 方法。

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

提出 VGGT-DP,一个受生物视觉系统启发的视觉运动策略框架,将预训练的 3D 感知基础模型 VGGT 作为视觉编码器并与扩散策略(Diffusion Policy)结合,通过帧级 Token 复用机制、随机 Token 裁剪和本体感知引导视觉学习三个关键设计,在 MetaWorld 高精度操作任务上显著超越 DP 和 DP3 基线。

OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding

本文提出了广义开放词汇 3D 场景理解任务(GOV-3D)及对应的 OpenScan 基准,将 3D 场景理解从物体类别扩展到八种语言学属性维度,揭示了现有 OV-3D 方法在理解抽象物体属性方面的严重不足。

SplatSSC: Decoupled Depth-Guided Gaussian Splatting for Semantic Scene Completion

提出 SplatSSC,通过深度引导的高斯基元初始化策略和解耦高斯聚合器(DGA),解决目标中心(object-centric)范式中随机初始化低效和离群基元产生浮点伪影的问题,在 Occ-ScanNet 上IoU提升6.3%、mIoU提升4.1%,同时延迟和内存成本降低超过9.3%。

NURBGen: High-Fidelity Text-to-CAD Generation through LLM-Driven NURBS Modeling

首次提出基于NURBS表面表示的文本到CAD生成框架NURBGen,通过微调LLM将自然语言描述转换为结构化的NURBS参数JSON,并引入混合表示(untrimmed NURBS + 解析原语)和大规模partABC数据集,在几何保真度和尺寸精度上显著超越现有方法。

Redundant Queries in DETR-Based 3D Detection: Unnecessary and Prunable

提出 GPQ(Gradually Pruning Queries),通过分类分数逐步裁剪 DETR 系 3D 检测器中大量冗余的 object queries,无需额外可学习参数,可直接在预训练 checkpoint 上微调完成,在边缘设备上最高实现 67.86% FLOPs 减少和 65.16% 推理时间下降。

Rethinking Rainy 3D Scene Reconstruction via Perspective Transforming and Brightness Tuning

提出 OmniRain3D 数据集(首次同时建模视角异质性和亮度动态性的雨天 3D 场景数据集)以及 REVR-GSNet 端到端框架(联合递归亮度增强 + 高斯基元优化 + GS引导去雨),实现从雨天退化图像到高保真干净 3D 场景的重建。

Sparse4DGS: 4D Gaussian Splatting for Sparse-Frame Dynamic Scene Reconstruction

提出 Sparse4DGS,首个面向稀疏帧输入的4D动态场景重建方法,通过纹理感知的变形正则化(TADR)和纹理感知的规范优化(TACO)两大核心模块,引导高斯分布聚焦纹理丰富区域,在仅5-30帧稀疏输入下实现高质量动态新视角合成。

MeshSplat: Generalizable Sparse-View Surface Reconstruction via Gaussian Splatting

提出MeshSplat,首个基于2DGS的可泛化稀疏视角表面重建框架,通过加权Chamfer Distance损失正则化深度预测和基于不确定性的法线预测网络对齐2DGS朝向,从新视角合成任务中以自监督方式学习几何先验,在稀疏视角网格重建和跨数据集泛化上均达到SOTA。

查看全部79篇「3D 视觉」论文 →


🎯 目标检测 (29)

SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection

SM3Det提出了遥感领域的M2Det新任务(多模态数据集+多任务目标检测),通过网格级稀疏MoE骨干网络和动态子模块优化(DSO)机制,用单一模型同时处理SAR/光学/红外三种模态的水平/旋转框检测,显著超越各模态独立训练的三个专用模型组合。

CountVid: Open-World Object Counting in Videos

提出 CountVid 模型和 VideoCount 数据集,首次系统研究开放世界视频物体计数任务——给定文本或图像描述指定目标物体,枚举视频中所有独特实例,通过组合图像计数模型和可提示视频分割追踪模型解决遮挡、重复出现等挑战,在包含 TAO、MOT20、企鹅群和 X 射线金属结晶等多样化场景上显著优于多种强基线。

Correcting False Alarms from Unseen: Adapting Graph Anomaly Detectors at Test Time

提出 TUNE,一个即插即用的测试时适应框架,通过图对齐器变换节点特征来解决图异常检测中因新正常类别出现导致的"正常性偏移"问题,利用聚合污染程度作为无监督适应信号,在 10 个真实数据集上显著增强多种预训练 GAD 模型的泛化能力。

Harnessing Vision-Language Models for Time Series Anomaly Detection

提出两阶段零样本时序异常检测框架:ViT4TS 用轻量 ViT 对时序折线图做多尺度 cross-patch 匹配定位候选异常区间,VLM4TS 用 GPT-4o 结合全局时序上下文验证和精炼检测结果,在 11 个 benchmark 上 F1-max 超最优 baseline 24.6%,token 用量仅为现有 LLM 方法的 1/36。

AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios

构建了首个面向无人机场景的大规模 Referring Multi-Object Tracking(RMOT)基准数据集 AerialMind,并提出 HawkEyeTrack(HETrack)方法,通过视觉-语言共进化融合编码器和尺度自适应上下文精炼模块,在无人机航拍场景中实现语言引导的多目标跟踪。

When Trackers Date Fish: A Benchmark and Framework for Underwater Multiple Fish Tracking

提出 MFT25 大规模水下多鱼跟踪数据集(15 序列, 408K 标注)和 SU-T 跟踪框架(UKF + FishIoU),实现 34.1 HOTA 和 44.6 IDF1 的 SOTA 性能,并通过统计分析揭示鱼类跟踪与陆地目标跟踪的本质差异。

Commonality in Few: Few-Shot Multimodal Anomaly Detection via Hypergraph-Enhanced Memory

提出 CIF,利用超图(hypergraph)提取少量训练样本的类内结构共性,指导 memory bank 的构建与搜索,在少样本多模态工业异常检测中取得 SOTA。

YOLO-IOD: Towards Real Time Incremental Object Detection

首次系统性地将增量目标检测(IOD)引入 YOLO 实时框架,识别三种知识冲突类型,提出 CPR + IKS + CAKD 三模块协同解决方案,并引入更真实的 LoCo COCO 基准评估。

PromptMoE: Generalizable Zero-Shot Anomaly Detection via Visually-Guided Prompt Mixing of Experts

PromptMoE 将提示学习从单体式(monolithic)范式转变为组合式(compositional)范式,通过视觉引导的混合专家(MoE)机制从可学习的语义原语库中动态组合实例自适应的正常/异常状态提示,在 15 个工业和医学数据集上实现 ZSAD SOTA。

SimROD: A Simple Baseline for Raw Object Detection with Global and Local Enhancements

提出SimROD,一种极其轻量(仅0.003M参数)的RAW图像目标检测方法,通过全局Gamma增强(4个可学习参数)和绿色通道引导的局部增强,在多个RAW检测基准上超越了复杂的SOTA方法。

查看全部29篇「目标检测」论文 →


✂️ 语义分割 (29)

LWGANet: Addressing Spatial and Channel Redundancy in Remote Sensing Visual Tasks with Light-Weight Grouped Attention

针对遥感图像中的空间冗余(大面积均质背景)和通道冗余(极端尺度变化导致单一特征空间低效)问题,提出 LWGANet 轻量化骨干,通过 Top-K 稀疏全局特征交互(TGFI)和异构分组注意力(LWGA)模块实现高效多尺度特征表示,在 12 个数据集 4 类遥感任务上达到 SOTA。

RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images

提出 RSVG-ZeroOV,一个免训练框架,通过"概览-聚焦-进化"三阶段策略融合 VLM 的交叉注意力图和扩散模型的自注意力图,实现零样本开放词汇遥感视觉定位。

Breaking the Stealth-Potency Trade-off in Clean-Image Backdoors with Generative Trigger Optimization

提出 Generative Clean-Image Backdoors (GCB),通过 Conditional InfoGAN (C-InfoGAN) 自动发现图像中天然存在且与分类任务无关的特征作为后门触发器,以极低投毒率(≤0.5%)实现高攻击成功率(≥90% ASR)且几乎不损伤干净准确率(CA drop ≤1%),首次打破了 clean-image backdoor 中隐蔽性与攻击力的固有矛盾。

Empowering DINO Representations for Underwater Instance Segmentation via Aligner and Prompter

首次将 DINOv2 引入水下实例分割任务,通过 AquaStyle Aligner(傅里叶频域风格注入)和 ObjectPrior Prompter(二值掩码先验提示)两个模块实现高效领域适配,在 UIIS 和 USIS10K 数据集上以更少参数大幅超越 SAM 基方法。

S5: Scalable Semi-Supervised Semantic Segmentation in Remote Sensing

提出 S5 框架,首次将半监督语义分割扩展为遥感基础模型(RSFM)的预训练范式,通过构建百万级 RS4P-1M 数据集和 MoE 多数据集微调策略,在多个遥感分割与检测基准上达到 SOTA。

Generalizable Slum Detection from Satellite Imagery with Mixture-of-Experts

提出 GRAM(Generalized Region-Aware Mixture-of-Experts),一个两阶段测试时自适应框架:第一阶段用 MoE 架构在12个城市的百万级卫星图像上训练区域特化专家,第二阶段通过跨区域预测一致性筛选可靠伪标签进行自训练,实现对未见非洲城市的贫民窟分割泛化。

Target Refocusing via Attention Redistribution for Open-Vocabulary Semantic Segmentation: An Explainability Perspective

从可解释性角度系统研究CLIP内部机制,发现"分心"现象(distraction)——CLIP在深层将大量注意力资源分配给与目标无关的token,提出免训练的RF-CLIP方法通过注意力重分配将被分散的资源重新聚焦到目标区域,在8个基准上达到SOTA性能并保持推理高效。

Causal-Tune: Mining Causal Factors from Vision Foundation Models for Domain Generalized Semantic Segmentation

本文提出Causal-Tune,一种基于因果机制的VFM微调策略,通过DCT频域变换和高斯带通滤波器将VFM特征分离为因果(域不变)和非因果(域特定)成分,仅对因果成分施加可学习token精炼,在域泛化语义分割中有效抑制VFM伪影并提升泛化性能。

JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion

提出JoDiffusion框架,通过在潜在空间中联合扩散图像与像素级标注掩码,首次实现仅基于文本提示同时生成语义一致的图像-标注对,在Pascal VOC、COCO和ADE20K上显著超越现有Image2Mask和Mask2Image方法。

RS2-SAM2: Customized SAM2 for Referring Remote Sensing Image Segmentation

提出 RS2-SAM2 框架,通过双向层次融合模块将文本信息注入 SAM2 图像编码过程,并设计伪掩码提示生成器为 SAM2 提供密集提示,在遥感指称分割任务上取得 SOTA。

查看全部29篇「语义分割」论文 →


🖼️ 图像恢复 (10)

Clear Nights Ahead: Towards Multi-Weather Nighttime Image Restoration

首次定义并探索多天气夜间图像复原任务,构建 AllWeatherNight 数据集(8K 训练 + 1K 合成测试 + 1K 真实测试),提出 ClearNight 统一框架通过 Retinex 双先验引导和天气感知动态专一性-共性协作,一阶段同时移除雾/雨条/雨滴/雪/flare 复合退化,仅 2.84M 参数全面超越 SOTA。

Depth-Synergized Mamba Meets Memory Experts for All-Day Image Reflection Separation

提出 DMDNet,通过深度感知扫描策略(DAScan)引导 Mamba 关注显著结构,结合深度协同状态空间模型(DS-SSM)抑制模糊特征传播,并引入记忆专家补偿模块(MECM)利用跨图像历史知识,实现全天候(白天+夜间)的图像反射分离。

MFmamba: A Multi-function Network for Panchromatic Image Resolution Restoration Based on State-Space Model

提出MFmamba多功能网络,基于UNet++骨架结合Mamba上采样模块(MUB)、双池化注意力(DPA)和多尺度混合交叉块(MHCB),仅使用全色(PAN)图像输入即可同时实现超分辨率、光谱恢复及联合SR与着色三种任务。

ICLR: Inter-Chrominance and Luminance Interaction for Natural Color Restoration in Low-Light Image Enhancement

针对HVI色彩空间中色度和亮度分支分布差异大导致互补特征提取不足、以及色度分支间弱相关导致梯度冲突的问题,提出ICLR框架,通过双流交互增强模块(DIEM)和协方差校正损失(CCL)分别从融合增强和统计分布优化两个角度解决,在LOL系列数据集上取得SOTA。

SpatioTemporal Difference Network for Video Depth Super-Resolution

基于视频深度超分辨率(VDSR)中空间非光滑区域和时间变化区域呈长尾分布的统计发现,提出 STDNet,通过空间差异分支(学习空间差异表示进行帧内 RGB-D 自适应聚合)和时间差异分支(利用时间差异表示在变化区域进行运动补偿),在 TarTanAir 数据集上 ×16 超分 RMSE 从 112.04cm 降至 96.80cm,平均超越 SOTA 方法 27.6%-32.6%。

Temporal Inconsistency Guidance for Super-resolution Video Quality Assessment

提出 TIG-SVQA 框架,首次将时间不一致性(temporal inconsistency)作为显式引导信号融入超分辨率视频质量评估,设计了不一致性高亮空间模块(IHSM)和不一致性引导时间模块(IGTM),在 SFD、MFD 和 Combined-VSR 三个数据集上 SRCC 分别达到 0.950、0.942、0.939,全面超越现有 IQA/VQA 方法。

TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis

提出 TMDC 两阶段框架,第一阶段在完整数据上学习去噪的 modality-specific 和 modality-common 表示,第二阶段利用可用模态的去噪表示补全缺失模态,首次同时处理 MSA 中的噪声和缺失问题。

Blur-Robust Detection via Feature Restoration: An End-to-End Framework for Prior-Guided Infrared UAV Target Detection

提出 JFD3 端到端双分支框架,在特征域而非图像域进行去模糊,并利用频率结构先验引导检测网络,实现运动模糊条件下红外无人机目标的高精度实时检测。

SD-PSFNet: Sequential and Dynamic Point Spread Function Network for Image Deraining

提出基于动态 PSF 机制的级联 CNN 去雨网络 SD-PSFNet,通过多尺度可学习 PSF 字典建模雨滴光学效应,配合自适应门控融合的序列化修复架构,在 Rain100H 达 33.12 dB、RealRain-1k-L 达 42.28 dB 均为 SOTA,对比基线 MPRNet 累计提升 5.04 dB(13.5%)。

RefiDiff: Progressive Refinement Diffusion for Efficient Missing Data Imputation

提出 RefiDiff 四阶段框架(预处理→warm-up→扩散→polish),首次将 predictive 和 generative 缺失值填补范式渐进统一,结合 Mamba-based denoising 在 9 个数据集上取得 SOTA,速度比 DIFFPUTER 快 4 倍。


🛰️ 遥感 (7)

TDCNet: Spatio-Temporal Context Learning with Temporal Difference Convolution for Moving IRSTD

提出 TDCNet,将时间差分和 3D 卷积融合为统一的时间差分卷积 (TDC),通过重参数化实现推理零额外开销,配合 TDC 引导的时空注意力,在自建 IRSTD-UAV 数据集上 F1 达 97.12%(AP50 93.83%),同时发布 15,106 帧真实红外无人机数据集。

Debiasing Machine Learning Predictions for Causal Inference Without Additional Ground Truth Data

针对ML卫星贫困预测因均值回归导致因果处理效应衰减的问题,提出两种无需新标注数据的后处理校正方法——线性校准校正(LCC)和Tweedie局部去收缩——使同一预测地图可在多个下游因果试验中复用("一图多试"范式),Tweedie校正在模拟和DHS真实数据上实现近无偏的处理效应估计。

UniABG: Unified Adversarial View Bridging and Graph Correspondence for Unsupervised Cross-View Geo-Localization

提出双阶段无监督跨视角地理定位框架 UniABG,通过对抗式视角桥接 (VAAB) 消除无人机/卫星视角域差距,再用异构图过滤校准 (HGFC) 净化跨视角关联,在 University-1652 上 Satellite→Drone AP 达 93.29%,超过多数有监督方法。

Consistency-based Abductive Reasoning over Perceptual Errors of Multiple Pre-trained Models in Novel Environments

将多个预训练感知模型在新环境中的冲突预测建模为一致性溯因推理问题,通过逻辑程序编码各模型的错误检测规则和领域约束,寻找在保持不一致率低于阈值的同时最大化预测覆盖率的最优假设,在15个航拍测试集上平均F1提升13.6%。

M3SR: Multi-Scale Multi-Perceptual Mamba for Efficient Spectral Reconstruction

提出 M3SR,一种基于 Mamba 的多尺度多感知架构,通过空间-频率-光谱三分支并行融合结合 U-Net 多尺度结构,以 2.17M 参数和 100.9G FLOPs 的低计算代价在四个光谱重建基准上超越现有 SOTA 方法。

Perceive, Act and Correct: Confidence Is Not Enough for Hyperspectral Classification

提出 CABIN 框架,通过认知感知-行动-纠正的闭环学习机制,利用认识论不确定性(epistemic uncertainty)替代单纯的置信度来指导半监督高光谱图像分类中的样本选择与伪标签管理,在仅用 75% 标注的情况下显著超过全标注基线。

Machine Learning for Sustainable Rice Production: Region-Scale Monitoring of Water-Saving Practices in Punjab, India

提出维度分类方法将水稻节水实践识别解耦为播种维度(DSR vs PTR)和灌溉维度(AWD vs CF)两个独立二分类任务,仅使用Sentinel-1 SAR影像实现播种F1=0.80和灌溉F1=0.74,并在旁遮普邦300万+地块上进行大规模推理,地区级采纳率与政府统计高度相关(Spearman ρ=0.69)。


🧑 人体理解 (20)

ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment

提出 ReAlign(Reward-guided sampling Alignment),通过步感知(step-aware)奖励模型和奖励引导采样策略,在扩散推理过程中动态引导采样轨迹朝向文本-动作高对齐的分布,无需微调任何扩散模型即可显著提升多种动作生成方法的质量。以 MLD 为例,R@1 提升 17.9%,FID 改善 58.8%。

New Synthetic Goldmine: Hand Joint Angle-Driven EMG Data Generation Framework for Micro-Gesture Recognition

提出 SeqEMG-GAN,一种基于手部关节角度序列驱动的条件对抗生成框架,通过角度编码器、双层上下文编码器(含新颖 Ang2Gist 单元)、深度卷积生成器和多视角判别器的联合设计,从关节运动学轨迹合成高保真 EMG 信号,实现对未见手势的零样本生成,合成数据与真实数据混合训练将分类精度从 57.77% 提升至 60.53%。

CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning

首次利用 CLIP 提取面部细粒度语义属性嵌入来辅助人脸模板反演(FTI),通过跨模态特征交互网络将泄露模板与属性嵌入融合并投影到 StyleGAN 潜空间,生成身份一致且属性细节更丰富的人脸图像,在识别准确率、属性相似度和跨模型攻击迁移性上均超越 SOTA。

mmPred: Radar-based Human Motion Prediction in the Dark

首次将毫米波雷达引入人体运动预测(HMP)任务,提出mmPred——基于扩散模型的框架,通过双域历史运动表示(时域姿态细化TPR + 频域主导运动FDM)和全局骨骼关系Transformer(GST),有效抑制雷达特有的噪声和时序不一致性,在mmBody和mm-Fi数据集上分别超越SOTA方法8.6%和22%。

Generating Attribute-Aware Human Motions from Textual Prompt

提出 AttrMoGen 框架,通过基于结构因果模型(SCM)的因果信息瓶颈将动作语义与人体属性(年龄、性别等)解耦,生成属性感知的人体运动,并构建了首个包含广泛属性标注的大规模文本-运动数据集 HumanAttr。

Facial-R1: Aligning Reasoning and Recognition for Facial Emotion Analysis

提出 Facial-R1,一个三阶段对齐训练框架(SFT → RL → 数据合成),通过将 AU 和情绪标签作为可验证奖励信号来对齐 VLM 的推理过程与情绪识别结果,在 8 个基准上达到 SOTA,并构建了 FEA-20K 数据集。

PA-FAS: Towards Interpretable and Generalizable Multimodal Face Anti-Spoofing via Path-Augmented Reinforcement Learning

提出PA-FAS框架,通过推理路径增强(Reasoning Path Augmentation)策略和答案打乱机制,解决了多模态FAS中SFT+RL范式的两大瓶颈(推理路径多样性不足和推理捷径问题),首次在统一框架中同时实现多模态融合、域泛化和可解释性。

KineST: A Kinematics-guided Spatiotemporal State Space Model for Human Motion Tracking from Sparse Signals

提出 KineST,一种运动学引导的状态空间模型,通过运动学树双向扫描策略和混合时空表征学习,从头显稀疏信号高效重建全身运动,在精度和时序一致性上均超越 SOTA。

Toward Gaze Target Detection in Young Autistic Children

针对自闭症儿童注视目标检测中面部注视(6.6%)严重不足的类别不平衡问题,提出 Socially Aware Coarse-to-Fine (SACF) 框架,用微调的 Qwen2.5-VL 作为社交上下文感知门控,将输入路由到社交感知/社交无关两个专家模型,在首创的 AGT 数据集上显著提升了面部注视检测性能(Face L2 在 Sharingan 上降低 13.9%, F1 从 0.753 提升至 0.761)。

CoordAR: One-Reference 6D Pose Estimation of Novel Objects via Autoregressive Coordinate Map Generation

提出 CoordAR,将单参考视图 6D 位姿估计中的 3D-3D 对应关系建模为离散 token 的自回归生成问题,通过坐标图 token 化、模态解耦编码和自回归 Transformer 解码器,在多个基准上显著超越现有单视图方法,并对对称、遮挡等挑战场景展现强鲁棒性。

查看全部20篇「人体理解」论文 →


📹 视频理解 (27)

TSPO: Temporal Sampling Policy Optimization for Long-form Video Language Understanding

将视频关键帧选择和语言生成建模为联合决策过程,通过基于GRPO的强化学习端到端优化轻量级时序智能体的采样策略,在四个长视频理解基准上取得SOTA(LLaVA-Video-7B上LongVideoBench +5.0%、MLVU +6.0%),且可零样本迁移到其他Video-MLLM。

Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective

提出 LIBERO-Mem 基准(10 个非马尔可夫机器人操控任务)和 Embodied-SlotSSM 框架(结合 Slot Attention 和状态空间模型的物体中心记忆 VLA),解决视觉运动策略在部分可观测、需要物体级历史推理的长期任务中的失败问题。

Predicting Video Slot Attention Queries from Random Slot-Feature Pairs

提出 RandSF.Q,通过利用下一帧特征进行信息性查询预测,以及从随机采样的 slot-feature 对学习过渡动力学,显著提升视频物体中心学习(OCL)的查询预测质量,在目标发现任务上超越 SOTA 最多 10 个点。

Learning to Tell Apart: Weakly Supervised Video Anomaly Detection via Disentangled Semantic Alignment

本文提出DSANet,通过自引导正常模式建模(SG-NM,粗粒度)和解耦对比语义对齐(DCSA,细粒度)从两个层面增强弱监督视频异常检测中正常与异常特征的可区分性,在XD-Violence上AP达86.95%(+1.14%),在UCF-Crime细粒度mAP达13.01%(+3.39%),均为SOTA。

Causality Matters: How Temporal Information Emerges in Video Language Models

通过系统性消融实验揭示VideoLM的时序理解能力并非来源于位置编码(PE),而是由因果注意力掩码的序列敏感性产生——时序信息沿"帧间交互→末帧聚合→query融合"的因果路径逐层构建,并据此提出两种无损推理加速策略。

APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval

提出APVR,一个训练免费的双粒度视觉信息检索框架:帧级别通过查询扩展+时空语义置信度打分迭代检索关键帧(最多1024帧),token级别通过查询感知的注意力驱动选择压缩视觉token,突破内存墙限制处理小时级长视频,在LongVideoBench/VideoMME/MLVU上分别提升最高9.5%/4.6%/9.7%。

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

提出首个面向交互式直播视频的全模态基准 LiViBench(3168 个视频、3175 道 MCQ、24 个任务),设计了多智能体种子问题驱动的半自动标注流程,并构建了 LiVi-LLM-7B 模型(含 Video-to-Comment Retrieval 模块和两阶段指令微调),在 7B 规模下超越了 72B 开源模型。

HeadHunt-VAD: Hunting Robust Anomaly-Sensitive Heads in MLLM for Tuning-Free Video Anomaly Detection

本文提出 HeadHunt-VAD,通过在冻结的多模态大模型(MLLM)内部系统性地搜索出对异常敏感且稳定的稀疏注意力头集合,绕过文本输出的信息损失,用轻量级分类器实现无需微调的高效视频异常检测,在 UCF-Crime 和 XD-Violence 上取得 tuning-free 方法 SOTA。

ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding

提出因果信息瓶颈(CIB)理论框架,将关键帧选择形式化为同时优化"预测充分性"和"因果必要性"的信息论问题,并基于此设计 ReaSon 强化学习框架,通过三种 CIB 对齐的奖励(答案奖励、循环一致性奖励、反事实奖励)训练选择策略,在限定帧数设置下显著超越已有方法。

SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition

提出 SUGAR 范式,利用 GPT 生成的运动描述视觉描述作为先验知识,通过对比学习监督骨骼编码器学习更离散的表示,再用 LLM(LLaMA2-7B)的未触及预训练权重作为识别器,配合新设计的 Temporal Query Projection(TQP)模块实现高效的骨骼动作分类和零样本推理。

查看全部27篇「视频理解」论文 →


🚗 自动驾驶 (56)

DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning

提出 DriveSuprim,通过粗到精的轨迹筛选范式、旋转数据增强和自蒸馏软标签框架,解决选择式端到端规划中难以区分相似轨迹、方向偏差和硬标签不稳定的问题,在 NAVSIM v1/v2 和 Bench2Drive 上达到 SOTA。

FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning

提出 FastDriveVLA,通过 MAE 风格的前景像素重建训练轻量级 plug-and-play 的 ReconPruner 模块(仅 0.07B),利用对抗前景-背景重建策略优先保留驾驶决策所需的前景 token,在 nuScenes 开环规划基准上各剪枝率均达 SOTA,一次训练可迁移至同一视觉编码器的不同 VLA 模型。

WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving

提出面向规划的潜在世界模型框架WorldRFT,通过VGGT空间编码、分层规划分解+局部感知迭代精炼、基于GRPO的碰撞感知强化微调,在nuScenes上将碰撞率降低83%(0.30%→0.05%),在NavSim上仅用相机即逼近LiDAR SOTA(87.8 vs 88.1 PDMS)。

Hierarchical Prompt Learning for Image- and Text-Based Person Re-Identification

提出统一框架 HPL,通过任务路由 Transformer(双分类 token)解耦 I2I 和 T2I 任务,利用层次化提示学习(身份级 + 实例级伪文本 token)结合跨模态提示正则化,首次在单一模型中同时实现图像-图像和文本-图像行人重识别的 SOTA。

LiDARCrafter: Dynamic 4D World Modeling from LiDAR Sequences

提出 LiDARCrafter,首个面向 LiDAR 的 4D 生成式世界模型,通过文本→场景图→三分支扩散布局→range-image 扩散生成→自回归时序扩展的流水线,实现可控的 4D LiDAR 序列生成与编辑,在 nuScenes 上全面超越现有方法。

CompTrack: Information Bottleneck-Guided Low-Rank Dynamic Token Compression for Point Cloud Tracking

提出CompTrack——首个同时解决LiDAR点云中空间冗余和信息冗余双重挑战的3D单目标跟踪框架:空间前景预测器(SFP)基于信息熵过滤背景噪声,信息瓶颈引导的动态Token压缩(IB-DTC)模块利用在线SVD估计有效秩并将前景压缩为紧凑代理token;在nuScenes和Waymo上达到SOTA,同时以90 FPS实时运行。

PriorDrive: Enhancing Online HD Mapping with Unified Vector Priors

提出 PriorDrive 框架,通过 Unified Vector Encoder (UVE) 和 Hybrid Prior Representation (HPQuery) 将多种向量化先验地图(SD地图、旧HD地图、历史预测地图)统一编码并集成到各种在线建图模型中,在 nuScenes 上 mAP 提升 14.3,兼容 query-based 和 non-query-based 两类建图架构。

DiffRefiner: Coarse to Fine Trajectory Planning via Diffusion Refinement with Semantic Interaction for End to End Autonomous Driving

提出 DiffRefiner,通过"粗到精"两阶段框架——先用判别式 Proposal Decoder 生成粗轨迹,再用扩散模型迭代精炼——结合细粒度语义交互模块,在 NAVSIM v2 和 Bench2Drive 两个基准上均达到 SOTA。

STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes

构建了自动驾驶领域最大规模时空推理VQA数据集STRIDE-QA(270K帧、16M QA对),定义了三类时空推理任务(物体间空间/自车空间/自车时空),通过微调VLM使空间定位成功率从近零提升至55%、时序一致性从0提升至28.4%。

MambaSeg: Harnessing Mamba for Accurate and Efficient Image-Event Semantic Segmentation

提出 MambaSeg,用双分支并行 Mamba 编码器分别处理 RGB 图像和事件流,通过空间-时间双维度交互模块 (DDIM) 实现细粒度跨模态融合,在 DDD17 和 DSEC 数据集上以 25.44M 参数取得 77.56%/75.10% mIoU 的 SOTA,效率远优于 Transformer 方案。

查看全部56篇「自动驾驶」论文 →


🤖 机器人/具身智能 (30)

SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation

提出 SemanticVLA 框架,通过语义引导的双视觉编码器剪枝(SD-Pruner)、语义互补层次融合(SH-Fuser)和语义条件动作耦合(SA-Coupler)三个模块,在大幅减少视觉冗余的同时增强指令-视觉-动作对齐,在 LIBERO 基准上以 97.7% 成功率超越 OpenVLA 达 21.1%,同时训练成本和推理延迟分别降低 3.0× 和 2.7×。

H-GAR: A Hierarchical Interaction Framework via Goal-Driven Observation-Action Refinement for Robotic Manipulation

提出层次化目标驱动框架 H-GAR,通过先预测目标观测再合成中间观测、并利用历史动作记忆库细化粗粒度动作,实现了观测与动作的显式双向交互,在仿真和真实机器人操控任务上取得 SOTA。

Actor-Critic for Continuous Action Chunks: A Reinforcement Learning Framework for Long-Horizon Robotic Manipulation with Sparse Reward

AC3 提出了一个直接学习连续动作序列(action chunk)的 actor-critic 框架,通过"仅从成功轨迹更新 actor"的非对称更新规则和基于自监督锚点的内在奖励来稳定稀疏奖励下的长时域机器人操作学习,在 BiGym 和 RLBench 的 25 个任务上取得优于现有方法的成功率。

TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models

TTF-VLA 提出了一种免训练的时序 Token 融合方法,通过灰度像素差异+注意力语义检测的双维度机制选择性地复用历史帧的视觉 Token,提升 VLA 模型在机器人操作任务中的推理质量,在 LIBERO 上平均提升 4.0 个百分点。

Object-Centric Latent Action Learning

提出以物体为中心的潜在动作学习框架,利用自监督的物体分解(VideoSAUR)将场景中任务相关实体与视觉干扰(动态背景等)分离,使潜在动作模型(LAPO)在有干扰的视频中性能退化减少约50%,并通过线性动作探针自动选择控制相关的 slot。

PanoNav: Mapless Zero-Shot Object Navigation with Panoramic Scene Parsing and Dynamic Memory

提出 PanoNav,一个仅使用 RGB 图像的无地图零样本目标导航框架,通过全景场景解析(Panoramic Scene Parsing)释放 MLLM 的空间推理能力,并引入动态有界记忆队列(Dynamic Bounded Memory Queue)避免局部死锁问题。

Towards Affordance-Aware Robotic Dexterous Grasping with Human-like Priors

提出AffordDex,一个两阶段框架:第一阶段通过模仿学习预训练人类手部运动先验(自然的运动轨迹),第二阶段通过残差模块和VLM引导的负可供性分割(NAA)进行强化学习精炼,实现既像人类一样自然、又功能正确的灵巧机器人抓取(如避开刀刃抓握刀柄),在多个泛化级别上显著超越SOTA。

Scalable Multi-Objective and Meta Reinforcement Learning via Gradient Estimation

本文提出PolicyGradEx,通过一阶梯度近似和代理模型高效估计任意任务子集上的策略适应性能,构建任务亲和度矩阵并通过凸优化进行任务分组,在多目标RL和元RL基准上平均超越SOTA基线16%,速度提升高达26倍。

UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories

提出 UrbanNav,利用网络规模的城市步行视频(YouTube 上 1500+ 小时、300 万条指令-轨迹-地标三元组),通过自动化标注管线和鲁棒过滤机制训练语言引导的城市导航策略,在真实世界部署中达到 83.3% 的导航成功率。

SpatialActor: Exploring Disentangled Spatial Representations for Robust Robotic Manipulation

提出 SpatialActor 框架,通过将语义与几何表征显式解耦,并设计语义引导几何模块(SGM)自适应融合深度噪声特征与预训练深度估计专家先验、以及空间 Transformer(SPT)编码低级空间位置线索,在 RLBench 50+ 任务上达到 87.4% 成功率(SOTA +6.0%),且在重噪声条件下比 RVT-2 高出 19.4%。

查看全部30篇「机器人/具身智能」论文 →


🎮 强化学习 (58)

Reasoning with Exploration: An Entropy Perspective

本文从熵(entropy)的视角分析LLM中探索性推理行为(关键token、自我反思、稀有行为)与高熵区域的正相关性,提出一种极简的熵基优势函数塑形方法——仅需一行代码修改——即可显著增强LLM的Pass@K推理能力边界。

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

本文通过系统性的数据泄露审计揭示了Qwen2.5系列在MATH-500等标准数学基准上存在严重的数据污染问题,指出近期"虚假奖励也能提升数学推理"的发现是污染所致的虚假结论,并构建了完全无泄露的RandomCalculation基准验证只有正确奖励信号才能带来真实的推理提升。

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

针对GUI定位中语义对齐的探索瓶颈,提出Adaptive Exploration Policy Optimization (AEPO)框架,通过多答案生成策略强制广泛探索、自适应探索奖励函数动态引导以及共线惩罚机制确保探索质量,显著提升多模态大模型在复杂GUI定位任务上的表现。

QiMeng-Kernel: Macro-Thinking Micro-Coding Paradigm for LLM-Based High-Performance GPU Kernel Generation

提出 MTMC(Macro Thinking Micro Coding)分层框架,通过强化学习驱动轻量LLM产生高层优化策略(Macro Thinking),再由通用LLM逐步实现代码(Micro Coding),将GPU内核生成的正确性和性能问题解耦,在KernelBench上实现近100%准确率和2.2×超越专家优化PyTorch Eager内核的加速。

MARS: Multi-Agent Adaptive Reasoning with Socratic Guidance for Automated Prompt Optimization

提出 MARS 五智能体框架做自动提示优化(APO):Planner 生成任务特定的优化轨迹,Teacher-Critic-Student 三体进行苏格拉底对话式迭代精炼 prompt(模拟文本空间中的伪梯度下降),Target 执行并反馈,整体建模为 POMDP,在 17 个数据集上平均超越前 SOTA(PE2)6.04%(通用任务)和 6.42%(领域任务),且仅需 1-shot 训练数据。

One-Step Generative Policies with Q-Learning: A Reformulation of MeanFlow

本文将MeanFlow从视觉生成任务重新改造为离线RL的生成式策略,提出一种残差形式的直接噪声到动作映射,实现单步采样的表达性策略,可在单阶段训练中与Q函数稳定联合优化,在OGBench和D4RL的73个任务上取得了强劲性能。

Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation

提出INSIGHT框架,一个面向第一人称长期动作预测的两阶段统一框架:第一阶段通过手-物交互区域特征提取和动词-名词共现矩阵增强动作表示;第二阶段引入基于GRPO的强化学习认知推理模块,模拟"感知→推理→回答"的结构化认知过程进行意图推断和动作预测。

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

首次系统分析扩散大语言模型(dLLM)的安全特性,发现与自回归 LLM 不同,dLLM 中中间 token 对安全性更关键,且攻击者受限于模型固有的顺序生成倾向难以操控中间 token,基于此不对称性提出 MOSA(Middle-tOken Safety Alignment)防御方法。

DRMD: Deep Reinforcement Learning for Malware Detection under Concept Drift

本文首次将Android恶意软件检测重新表述为一步马尔可夫决策过程(MD-MDP),并训练基于PPO的深度强化学习智能体DRMD,在单一策略中统一了样本分类、拒绝和主动学习,在多年跨期评估中实现了平均8.66(仅分类)和10.90(含拒绝)的AUT提升,显著优于传统监督学习分类器应对概念漂移的能力。

A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs

本文提出了一个基于多维目标空间的 LLM 可操控性(steerability)评估框架,将 steering error 分解为校准偏差(miscalibration)和副作用(side effects/orthogonality),在文本改写任务上发现即使是最强的 LLM 也会产生严重副作用,prompt engineering 无效、best-of-N 采样代价高、RL 微调有改善但仍未彻底解决。

查看全部58篇「强化学习」论文 →


🎁 推荐系统 (27)

Inductive Generative Recommendation via Retrieval-based Speculation

本文揭示生成式推荐(GR)模型无法推荐训练中未见过的新物品的关键局限,提出 SpecGR 即插即用框架——用具有归纳能力的 drafter 模型提议候选物品(包括新物品),GR 模型作为 verifier 对候选进行排序验证,结合引导式重起草技术提升验证效率,在三个数据集上取得最佳整体性能。

From IDs to Semantics: A Generative Framework for Cross-Domain Recommendation with Adaptive Semantic Tokenization

提出 GenCDR 框架,通过领域自适应语义分词和跨域自回归推荐两大模块,首次将生成式语义 ID 范式引入 LLM 驱动的跨域推荐,有效解决传统方法中 item ID 不可迁移和领域个性化建模不足的问题。

Interpretable Reward Model via Sparse Autoencoder

提出 SARM(Sparse Autoencoder-enhanced Reward Model),将预训练的稀疏自编码器集成到奖励模型中,将隐层激活映射到可解释的稀疏单义特征空间,实现特征级的奖励归因和动态偏好操控,同时在 RewardBench 2 上取得了所有模型中的最高分。

SlideTailor: Personalized Presentation Slide Generation for Scientific Papers

定义了偏好引导的论文到幻灯片生成新任务,提出 SlideTailor 框架:从用户提供的论文-幻灯片样例对中蒸馏内容偏好、从 .pptx 模板蒸馏美学偏好,通过 chain-of-speech 机制将幻灯片内容与预期口述叙事对齐,在自建 PSP 基准上以 75.8% 的综合得分和 81.63% 的人评胜率显著超越现有方法。

Align³GR: Unified Multi-Level Alignment for LLM-based Generative Recommendation

提出统一三层对齐框架 Align³GR,在 token 级(双端 SCID)、行为建模级(多任务 SFT)和偏好级(渐进式 DPO)系统性弥合 LLM 与推荐系统之间的语义-行为鸿沟。

AutoPP: Towards Automated Product Poster Generation and Optimization

提出 AutoPP,首个将商品海报自动生成与基于 CTR 反馈的自动优化统一到一个框架中的流水线,通过 unified design module 联合设计背景/文字/排版,element rendering module 高效可控地生成海报,并利用 Isolated DPO (IDPO) 实现元素级别的点击率优化。

FreqRec: Exploiting Inter-Session Information with Frequency-enhanced Dual-Path Networks for Sequential Recommendation

提出FreqRec双路径架构,通过batch维和时间维两条频域路径分别捕获跨session群体节律和用户个体细粒度兴趣,并引入频域一致性损失显式对齐预测与真实频谱,在三个Amazon数据集上NDCG@10最高提升7.38%。

Moral Change or Noise? On Problems of Aligning AI With Temporally Unstable Human Feedback

通过在肾脏移植分配领域对400+参与者进行3-5轮纵向研究,揭示了人类道德偏好在时间上的显著不稳定性(6-20%的响应变化率),并证明这种不稳定性会严重降低AI对齐模型的预测性能,从而质疑了当前基于静态偏好假设的对齐方法的有效性。

When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video Recommendation

提出 ENF(Explainable Negative Feedback)框架,通过三个协作式 MLLM Agent(Profile Agent、Video Agent、Reason Agent)和渐进式 S-GRPO 强化学习训练策略,首次实现了对视频推荐系统中隐式负反馈的可解释预测和原因分析,在腾讯新闻业务平台上实现了平均观看时长提升 6.2% 和快速跳过率下降 9.4%。

Evaluating LLMs for Police Decision-Making: A Framework Based on Police Action Scenarios

提出 PAS(Police Action Scenarios)评估框架,一个面向警务场景的 LLM 评估体系,涵盖场景定义、参考答案构建、LLM 响应生成、核心指标提取和性能解读五个阶段,基于 8000+ 韩国警察官方文件构建评估数据集,发现商用 LLM(GPT-4、Gemini、Claude)在警务任务上显著低于参考答案,尤其在事实性和逻辑正确性方面。

查看全部27篇「推荐系统」论文 →


🔄 自监督/表示学习 (16)

Spikingformer: A Key Foundation Model for Spiking Neural Networks

提出 Spikingformer,通过将 MS Residual 与 Self-Attention 以 spike-driven 方式结合,解决 Spikformer 中 SEW Residual 导致的非脉冲计算问题,同时保持全局建模能力。

From Pretrain to Pain: Adversarial Vulnerability of Video Foundation Models without Finetuning

提出 Transferable Video Attack (TVA),仅利用开源视频基础模型(VFM)的嵌入空间即可生成对抗扰动,无需任何下游任务知识便能有效攻击24个视频任务上的下游模型和多模态LLM。

Improving Region Representation Learning from Urban Imagery with Noisy Long-Caption Supervision

提出 UrbanLN 框架,通过长文本感知的位置编码插值策略和数据-模型双层噪声抑制机制,改善基于 LLM 生成描述的城市区域表征学习。

FineXtrol: Controllable Motion Generation via Fine-Grained Text

提出 FineXtrol 框架,利用带时间标注的细粒度身体部位文本描述作为控制信号,通过双分支 ControlNet 架构和层级对比学习增强文本编码器的区分能力,实现高效、用户友好且精确的可控人体动作生成,在 HumanML3D 上多身体部位控制性能显著优于现有方法。

Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space

提出 L-HAKT 框架,首次将 LLM 双 Agent 与双曲几何结合用于知识追踪:教师 Agent 解析题目语义并构建层级知识图谱,学生 Agent 模拟个体学习行为生成合成数据,通过双曲空间对比对齐校准合成数据与真实数据的分布差异,在四个教育数据集上 AUC 最高达 80.29%,相比 GKT 基线在 EdNet 上 AUC 提升 13.03%。

GOAL: Geometrically Optimal Alignment for Continual Generalized Category Discovery

基于 Neural Collapse 理论,使用固定等角紧框架(ETF)分类器替代动态分类器,通过监督对齐和置信度引导的无监督对齐实现持续泛化类别发现,在四个基准上遗忘率降低 16.1%、新类发现提升 3.2%。

Robust Tabular Foundation Models

提出 RTFM——一种模型无关的对抗训练框架,通过在合成数据生成器的参数空间上做 min-max 优化(最大化 TFM 与传统树模型之间的"最优性差距"),仅用不到 10 万额外合成数据集就显著提升了 TabPFN V2 在多个表格基准上的表现。

BCE3S: Binary Cross-Entropy Based Tripartite Synergistic Learning for Long-tailed Recognition

提出 BCE3S,一种基于二元交叉熵(BCE)的三方协同学习框架,将 BCE 式联合学习、BCE 式对比学习和 BCE 式分类器均匀性学习集成在一起,通过 Sigmoid 解耦不同类别的度量来抑制长尾不平衡效应,在 CIFAR10/100-LT、ImageNet-LT 和 iNaturalist2018 上均取得 SOTA。

CATFormer: When Continual Learning Meets Spiking Transformers With Dynamic Thresholds

提出 CATFormer,一种基于脉冲视觉 Transformer 的无数据重放持续学习框架,通过上下文自适应的动态放电阈值实现任务特定的神经元兴奋性调节,在长达 100 个任务序列中不仅不遗忘反而准确率提升("逆向遗忘"现象)。

Explanation-Preserving Augmentation for Semi-Supervised Graph Representation Learning

提出EPA-GRL(Explanation-Preserving Augmentation),利用少量标签训练的GNN explainer识别图的语义子图(explanation subgraph),增强时只扰动非语义部分(marginal subgraph),实现语义保持的图增强,在6个benchmark上显著优于语义无关的随机增强方法。

查看全部16篇「自监督/表示学习」论文 →


📐 优化/理论 (21)

Pareto-Grid-Guided Large Language Models for Fast and High-Quality Heuristics Design in Multi-Objective Combinatorial Optimization

提出 MPaGE 框架,将 LLM 与 Pareto Front Grid 机制和语义聚类结合,自动为多目标组合优化问题生成兼顾解质量与运行效率的启发式算法,在 Bi-TSP、Tri-TSP、Bi-CVRP、Bi-KP 上 HV 和 IGD 均显著优于 EoH、MEoH 等基线。

Instance Generation for Meta-Black-Box Optimization through Latent Space Reverse Engineering

提出 LSRE 框架,通过自编码器构建 BBO 问题实例的二维潜在空间,并利用遗传编程从该空间中反向工程出多样化的合成优化问题实例集 Diverse-BBO,显著提升 MetaBBO 方法的泛化性能。

Beyond the Mean: Fisher-Orthogonal Projection for Natural Gradient Descent in Large Batch Training

提出 Fisher-Orthogonal Projection (FOP),通过在 Fisher 度量下对子批次梯度差做正交投影来补充方差信息,使二阶优化器 KFAC 在超大 batch 训练中保持有效,实现最高 ×7.5 的加速。

Bridging Synthetic and Real Routing Problems via LLM-Guided Instance Generation and Progressive Adaptation

提出 EvoReal 框架,利用 LLM 驱动的进化搜索生成结构上接近真实世界的 VRP 合成实例,再通过两阶段渐进微调策略将预训练神经求解器适配到真实基准,在 TSPLib (1.05% gap) 和 CVRPLib (2.71% gap) 上大幅超越已有神经求解器。

Efficient and Reliable Hitting-Set Computations for the Implicit Hitting Set Approach

针对隐式击中集框架中击中集组件依赖商用IP求解器带来的数值不稳定问题,提出基于伪布尔推理和随机局部搜索的替代方案及混合策略,实现了首个可认证的IHS计算并在1786个基准实例上展示了效率与可靠性的有效权衡。

MOTIF: Multi-strategy Optimization via Turn-based Interactive Framework

提出 MOTIF 框架,将求解器设计建模为多策略优化问题,通过基于蒙特卡洛树搜索 (MCTS) 的双 LLM 代理回合制竞争机制,联合优化组合优化求解器中的多个相互依赖的算法组件,在 TSP、CVRP、BPP 等多个组合优化领域中一致超越现有方法。

Data Heterogeneity and Forgotten Labels in Split Federated Learning

系统研究了 Split Federated Learning 中数据异构导致的灾难性遗忘现象(尤其是 server 端处理顺序造成的 intra-round 遗忘),并提出基于 multi-head 的 Hydra 方法,将 part-2 的最后层分组训练再聚合,显著降低标签间性能差距(PG 最高降低 75.4%)。

Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment

首次从理论上分析了在 RLHF/DPO 对齐过程中,通过翻转偏好标签来引导 LLM 策略走向攻击者目标所需的最小成本,将其形式化为凸优化问题并推导了成本的上下界,进而提出 PCM(Poisoning Cost Minimization)后处理方法,可在保持投毒效果的同时显著减少标签翻转数量。

GHOST: Solving the Traveling Salesman Problem on Graphs of Convex Sets

提出 GHOST 框架,一种层次化最优搜索算法,用于求解凸集图(GCS)上的旅行商问题。通过结合组合路径搜索与凸轨迹优化,并利用新颖的抽象路径展开算法计算可容许下界指导最佳优先搜索,GHOST 在保证最优性的同时比统一混合整数凸规划基线快数个数量级。

ECPv2: Fast, Efficient, and Scalable Global Optimization of Lipschitz Functions

提出ECPv2算法,通过三项创新(自适应下界、Worst-\(m\) memory、固定随机投影),将Lipschitz函数全局优化的运行时从\(\Omega(n^2 d)\)降至\(\Omega(n(m+d)\log n)\),同时保持与minimax下界匹配的\(O(n^{-1/d})\) regret收敛速率。

查看全部21篇「优化/理论」论文 →


📐 学习理论 (3)

Streaming Generated Gaussian Process Experts for Online Learning and Control: Extended Version

提出 SkyGP(Streaming Kernel-induced Progressively Generated Expert GP),通过核距离驱动的渐进式专家生成时间感知可配置聚合处理流数据,继承精确 GP 的学习保证同时保持有界计算复杂度,在基准测试和实时控制实验中全面超越 SOTA。

Generalizing Analogical Inference from Boolean to Continuous Domains

从基础理论层面重新审视类比推理:首先构造反例证明布尔域上经典泛化界失效,然后提出基于参数化广义均值的统一类比推理框架,将离散分类扩展到连续回归域。

A Switching Framework for Online Interval Scheduling with Predictions

针对不可撤销的在线区间调度问题,提出 SemiTrust-and-Switch 框架和 SmoothMerge 随机算法,通过在信任预测和经典贪心算法之间切换/融合,在预测准确时趋近最优(一致性),预测错误时性能优雅退化(鲁棒性和平滑性),并证明了该框架在特定实例上的紧性。


🔗 因果推理 (7)

I-CAM-UV: Integrating Causal Graphs over Non-Identical Variable Sets Using Causal Additive Models with Unobserved Variables

提出 I-CAM-UV 方法,通过对多个变量集不同的 CAM-UV 因果图结果进行一致性约束枚举,恢复因未观测变量而丢失的因果关系,并设计基于不一致代价单调性的最优优先搜索算法高效求解。

KTCF: Actionable Recourse in Knowledge Tracing via Counterfactual Explanations for Education

提出 KTCF,一种面向知识追踪(KT)的反事实解释生成方法,通过考虑知识概念间关系生成稀疏且可操作的反事实解释,并将其后处理为顺序化的教学指令,在有效性、稀疏性和可操作性指标上全面超越基线方法。

Causal Inference Under Threshold Manipulation: Bayesian Mixture Modeling and Heterogeneous Treatment Effects

提出 BMTM/HBMTM 贝叶斯混合模型框架,在消费者策略性操纵消费额以达到奖励阈值的场景下,通过将观测分布拆解为 bunching 与 non-bunching 两个子分布,准确估计阈值因果效应及跨子群的异质性处理效应。

Learning Subgroups with Maximum Treatment Effects without Causal Heuristics

在 SCM 框架下证明最大处理效应子群必须具有同质点效应(定理1),在分区模型假设下证明最优子群发现可化简为标准监督学习(定理2),用 CART+Gini 指数即可实现——在 77 个 ACIC-2016 半合成数据集上均值处理效应 10.54(vs 次优 7.84),51.9% 排名第一。

CaDyT: Causal Structure Learning for Dynamical Systems with Theoretical Score Analysis

提出 CaDyT,结合高斯过程连续时间动力学建模(Adams-Bashforth 积分器实现精确推断)和 MDL 最小描述长度原则进行结构搜索,同时解决不规则采样和因果结构识别两个挑战,在双质点弹簧/菱形图/Rössler 振荡器上大幅超越所有基线(AUPRC 0.79 vs 次优 0.39)。

From Theory of Mind to Theory of Environment: Counterfactual Simulation of Latent Environmental Dynamics

本文提出"环境理论"(Theory of Environment)概念,认为人类可能通过与心智理论(Theory of Mind)共享的计算机制来推断环境中隐含的动态规律,从而扩展运动探索的维度空间并促进行为创新。

Sparse Additive Model Pruning for Order-Based Causal Structure Learning

提出 SARTRE 框架,利用随机化树嵌入与组稀疏回归学习稀疏加性模型,替代 CAM-pruning 中基于假设检验的冗余边修剪,在基于拓扑序的因果结构学习中实现显著加速且精度不降。


🔬 可解释性 (37)

Distribution-Based Feature Attribution for Explaining the Predictions of Any Classifier

提出首个基于数据分布的特征归因方法 DFAX,通过比较目标实例在目标类与非目标类条件概率之差来量化特征重要性,首次给出特征归因的形式化定义,在10个数据集上显著优于SHAP/LIME等基线且速度快数个数量级。

LLM Circuit Analyses Are Consistent Across Training and Scale

本文首次系统追踪 decoder-only LLM 的内部电路(circuits)在 3000 亿 token 训练过程中和 70M–2.8B 参数规模间的演化,发现虽然具体注意力头会发生更替,但执行的算法保持稳定,且跨规模具有一致性,表明在小模型上做的电路分析可推广到更大模型和更长训练。

SOM Directions are Better than One: Multi-Directional Refusal Suppression in Language Models

证明LLM的拒绝行为并非由单一方向编码,而是形成低维流形,利用自组织映射(SOM)提取多个拒绝方向并通过贝叶斯优化搜索最优消融组合,在多个模型上超越单方向基线和专用越狱算法。

Partially Shared Concept Bottleneck Models

提出PS-CBM框架,通过多模态概念生成(结合LLM语义与示例图像视觉线索)、部分共享概念策略(基于激活模式合并概念)和Concept-Efficient Accuracy(CEA)评估指标,在11个数据集上以更少的概念实现了更高的分类精度和可解释性。

SparK: Query-Aware Unstructured Sparsity with Recoverable KV Cache Channel Pruning

提出SparK——一种training-free的KV cache通道级非结构化剪枝方法,通过query-aware的saliency评估选择关键通道+recovery机制恢复被剪枝通道的贡献,在80%剪枝率下性能损失<5%,与token eviction方法正交互补,可额外减少30%+ KV cache存储。

SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder

SparseRM 利用稀疏自编码器(SAE)从LLM中间表示中提取偏好相关方向,通过投影向量构建轻量级奖励模型,仅需不到1%的可训练参数即可超越大多数主流奖励模型,并在在线迭代对齐框架中表现出更强的泛化能力。

Share Your Attention: Transformer Weight Sharing via Matrix-Based Dictionary Learning

受字典学习启发,提出 MASA 框架,将 Transformer 各层注意力投影矩阵(Q/K/V/O)分解为共享矩阵原子的线性组合,以 66.7% 的注意力参数压缩率实现与原始 Transformer 持平甚至更优的性能。

Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval

提出 DEMR 框架,将深度证据回归(DER)引入视频时刻检索任务,通过 Reflective Flipped Fusion 模块缓解模态不平衡、通过 Geom-regularizer 修复原始 DER 中不确定性估计的反直觉偏差,在标准和去偏数据集上均取得了显著提升。

DR.Experts: Differential Refinement of Distortion-Aware Experts for Blind Image Quality Assessment

提出DR.Experts框架,利用DA-CLIP获取失真类型先验,通过差分精炼注意力机制(DSDM)将失真注意力与语义注意力分离以纯化失真特征,再通过动态失真加权模块(DDWM)按感知影响自适应加权各类失真特征,在5个BIQA基准上达到SOTA。

Hypothesis Generation via LLM-Automated Language Bias for ILP

提出首个端到端框架:多Agent LLM系统(Actor/Critic)自动从原始文本构建ILP语言偏差(谓词系统+类型声明+模式约束),Translator将文本翻译为Prolog事实,再由MAXSYNTH求解器基于MDL原则归纳全局最优规则集。在SHOES和ZENDO任务上分别达88.3%和81.3%准确率,跨4种LLM方差<5%。

查看全部37篇「可解释性」论文 →


📦 模型压缩 (60)

Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression

提出 CGRS(Certainty-Guided Reflection Suppression),一种无需训练的高效推理方法,通过在模型高置信度时动态抑制反思触发词(如"Wait""But"),将大型推理语言模型的 token 消耗降低18.5%~41.9%,同时保持推理精度不变。

Put the Space of LoRA Initialization to the Extreme to Preserve Pre-trained Knowledge

提出 LoRA-Null,将 LoRA 初始化在预训练知识 input activation 的 null space 中(而非权重的 null space),从信息论角度论证 activation 的 effective rank 远小于权重,因此其 null space 包含更少预训练知识信息,显著减轻微调时的灾难性遗忘。

Don't Start Over: A Cost-Effective Framework for Migrating Personalized Prompts Between LLMs

提出PUMA框架,通过轻量级适配器和分组用户选择策略,高效地将个性化软提示从源LLM迁移到不同架构的目标LLM,在三个大规模数据集上匹配甚至超越从头训练的性能,同时减少计算成本高达98%。

InfoCom: Kilobyte-Scale Communication-Efficient Collaborative Perception with Information-Aware Feature Compression

提出InfoCom框架,基于扩展的信息瓶颈原理将协同感知的通信量从MB级压缩至KB级(相比Where2comm降低440倍),同时保持近无损的感知性能,核心包含信息感知编码、稀疏掩码生成和多尺度解码三个模块。

Distilling Cross-Modal Knowledge via Feature Disentanglement

提出频域解耦跨模态知识蒸馏(FD-CMKD),通过傅里叶变换将特征分解为低频(模态共享语义)和高频(模态特有细节)分量,分别施加强一致性 MSE 和弱一致性 logMSE 损失,并引入尺度标准化与共享分类器对齐特征空间,在音频-视觉、图像-文本、语义分割等多个跨模态场景全面超越现有蒸馏方法。

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models

本文揭示了LLM后训练量化中逐列补偿过程会导致一阶梯度项不可忽略的问题,提出FOEM方法通过将一阶项纳入误差补偿公式来提升量化精度,在3-bit量化下将Llama3-8B的困惑度降低17.3%,且几乎不增加计算开销。

SpecQuant: Spectral Decomposition and Adaptive Truncation for Ultra-Low-Bit LLMs Quantization

SpecQuant 提出一种基于自适应傅里叶域分解的两阶段量化框架:先将激活离群值平滑迁移到权重,再通过通道级低频傅里叶截断吸收权重中的高频噪声,在LLaMA-3 8B上实现W4A4量化仅1.5%精度损失,同时获得2×加速和3×内存节省。

Earth-Adapter: Bridge Geospatial Domain Gaps with Mixture of Frequency Adaptation

提出 Earth-Adapter,首个针对遥感图像伪影问题设计的参数高效微调 (PEFT) 方法,通过频率引导的混合适配器 (MoA) 将特征分解为高低频子空间、独立优化后动态聚合,在遥感语义分割 (SS)、域自适应 (DA) 和域泛化 (DG) 三个设定中均超越基线 Rein。

Failures to Surface Harmful Contents in Video Large Language Models

本文首次系统分析了 VideoLLM 的安全性,揭示了三种结构性设计缺陷(稀疏时间采样、空间 token 下采样、模态融合不平衡),使得视频中清晰可见的有害内容在模型生成的文本摘要中被遗漏(omission rate 超 90%),并设计了三种零查询黑盒攻击来验证漏洞严重性。

XLinear: A Lightweight and Accurate MLP-Based Model for Long-Term Time Series Forecasting with Exogenous Inputs

提出 XLinear,一个基于 MLP + sigmoid gating 的轻量时间序列预测模型,通过 global token 机制高效融合 endogenous 与 exogenous 变量信息,在 12 个数据集上实现精度与效率的最优平衡。

查看全部60篇「模型压缩」论文 →


🕸️ 图学习 (37)

S-DAG: A Subject-Based Directed Acyclic Graph for Multi-Agent Heterogeneous Reasoning

提出 S-DAG,通过 GNN 从问题中识别相关学科及其依赖关系构建有向无环图,将学科节点匹配到最擅长的专家 LLM(14 个 7-13B 领域模型),按 DAG 拓扑顺序协作推理(支撑学科→主导学科),用小模型池超越 GPT-4o-mini(59.73 vs 58.52)且接近 72B 模型。

Logical Characterizations of GNNs with Mean Aggregation

系统刻画了以均值(mean)为聚合函数的 GNN 的表达能力:非一致设定下等价于比率模态逻辑(RML);一致设定下(相对 MSO)等价于模态逻辑(ML);当额外要求组合函数连续、分类函数为阈值时,表达能力显著下降至交替无关模态逻辑(AFML)。

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

提出从"先构建再推理"到"边推理边构建"的GraphRAG范式转变,通过Relink框架动态构建查询特定的证据图——结合高精度KG骨架和高召回潜在关系池,用查询驱动的排序器统一评估、按需补全缺失路径并过滤干扰事实——在5个多跳QA基准上平均提升EM 5.4%和F1 5.2%。

Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces

提出 Generative Semantic Workspace (GSW),一种神经科学启发的生成式记忆框架,为 LLM 构建结构化的情景记忆表示,在 EpBench 上 F1 达到 0.85,同时减少 51% 的查询时上下文 token。

Beyond Fixed Depth: Adaptive Graph Neural Networks for Node Classification Under Varying Homophily

提出 AD-GNN,通过理论分析节点级别的同配/异配特性,为每个节点自适应分配不同的聚合深度,在统一框架中同时处理同配和异配图上的节点分类任务。

MyGram: Modality-aware Graph Transformer with Global Distribution for Multi-modal Entity Alignment

提出 MyGram,通过模态感知图卷积扩散(MGD)模块捕获模态内的深层结构上下文信息,并引入基于Gram矩阵行列式的全局分布对齐损失(Gram Loss),在高维空间中强制跨模态语义一致性,实现更鲁棒的多模态实体对齐。

Are Graph Transformers Necessary? Efficient Long-Range Message Passing with Fractal Nodes in MPNNs

提出分形节点(Fractal Nodes)增强 MPNN 的长距离消息传递:通过 METIS 图划分生成子图级聚合节点,结合低通+高通滤波器(LPF+HPF)与可学习频率参数 \(\omega\),使用 MLP-Mixer 实跨子图通信,在保持 \(O(L(|V|+|E|))\) 线性复杂度的同时达到甚至超越图 Transformer 的性能,获 AAAI Oral。

MUG: Meta-path-aware Universal Heterogeneous Graph Pre-Training

首次提出无需 LLM 的通用异质图预训练方法 MUG,通过上下文结构编码统一异质节点/关系类型、维度感知编码器对齐不同图的表示空间,并利用元路径视图共享编码器 + 全局散射正则化实现跨域可迁移的编码与聚合,在跨域和小样本节点分类中显著超越已有方法。

UniHR: Hierarchical Representation Learning for Unified Knowledge Graph Link Prediction

提出UniHR框架,通过Hierarchical Data Representation (HiDR)将超关系/时序/嵌套等多类KG统一转换为三元组形式,并设计Hierarchical Structure Learning (HiSL)模块在事实内部和事实间进行两阶段消息传递,在9个数据集5种KG类型上取得最优或竞争性的link prediction结果。

Adaptive Initial Residual Connections for GNNs with Theoretical Guarantees

提出自适应初始残差连接(Adaptive IRC),允许每个节点拥有基于初始特征学习的个性化残差强度,首次证明带激活函数的初始残差连接的 Dirichlet 能量有正下界(保证不过平滑),并提出基于 PageRank 的启发式变体在避免学习额外参数的同时达到可比甚至更优性能。

查看全部37篇「图学习」论文 →


📈 时间序列 (31)

Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints

提出 GlobalDiff 框架,首次在全局关节旋转空间中进行扩散生成,从根本上消除层次化前向运动学中的误差累积问题,并通过关节-骨骼-运动三层约束方案弥补全局表示丢失的结构先验,在多说话人语音驱动动作生成基准上取得 SOTA,FGD 较此前最佳方法改进 46%。

Towards Non-Stationary Time Series Forecasting with Temporal Stabilization and Frequency Differencing

提出 DTAF 双分支框架,通过时域的非平稳 MoE 滤波器提取并去除异质非平稳模式、频域的频谱差分追踪频率漂移,并通过双分支注意力融合两个域的互补信息,实现鲁棒的非平稳时间序列预测。

Detecting the Future: All-at-Once Event Sequence Forecasting with Horizon Matching

提出DEF(Detection-based Event Forecasting),借鉴目标检测中DETR的匹配思想,通过匈牙利算法对齐预测与真实事件序列,实现高精度和高多样性的长程事件预测,在5个数据集上达到SOTA。

Mask the Redundancy: Evolving Masking Representation Learning for Multivariate Time-Series Clustering

提出 EMTC 框架,通过 Importance-aware Variate-wise Masking (IVM) 动态屏蔽冗余时间戳,结合 Multi-Endogenous Views (MEV) 多视图生成与 cluster-guided contrastive learning,在 15 个 MTS 聚类基准上平均 F1 提升 4.85%。

Revitalizing Canonical Pre-Alignment for Irregular Multivariate Time Series Forecasting

首次论证了规范预对齐(CPA)在不规则多变量时间序列(IMTS)预测中不应被抛弃,提出 KAFNet 通过预卷积平滑、时间核聚合(TKA)压缩和频域线性注意力(FLA)三个模块解决 CPA 的效率问题,在 4 个 IMTS 数据集上实现 SOTA 精度,同时参数量减少 7.2 倍、训练推理加速 8.4 倍。

A Unified Shape-Aware Foundation Model for Time Series Classification

提出 UniShape——一个面向时间序列分类的基础模型,通过 shape-aware adapter 自适应聚合多尺度判别性子序列(shapelet),并结合原型对比预训练在实例和 shape 两个层面学习可迁移的 shapelet 表示,在 128 个 UCR 数据集上以 3.1M 参数达到 SOTA(平均准确率 87.08%),同时提供良好的分类可解释性。

C3RL: Rethinking the Combination of Channel-independence and Channel-mixing from Representation Learning

提出 C3RL,基于 SimSiam 对比学习框架将通道独立(CI)和通道混合(CM)策略视为同一数据的两个转置视图构建正样本对,通过孪生网络联合表示学习和预测学习,将 CI 模型的最佳性能率从 43.6% 提升到 81.4%,CM 模型从 23.8% 提升到 76.3%。

DeepBooTS: Dual-Stream Residual Boosting for Drift-Resilient Time-Series Forecasting

提出 DeepBooTS,通过偏差-方差分解理论证明加权集成可降低方差从而缓解概念漂移,设计双流残差递减 boosting 架构,每个 block 的输出修正前一个 block 的残差,在多个数据集上平均提升 15.8%。

Scaling LLM Speculative Decoding: Non-Autoregressive Forecasting in Large-Batch Scenarios

提出 SpecFormer,一种融合单向和双向注意力的非自回归草稿模型架构,在大批次推理场景下通过降低对复杂前缀树的依赖、减少位置相关参数,实现了对 LLM 推理的一致性加速。

Sonnet: Spectral Operator Neural Network for Multivariable Time Series Forecasting

提出 Sonnet,通过可学习小波变换将输入映射到时频域,引入基于谱相干性的多变量注意力(MVCA)建模变量间依赖关系,并利用 Koopman 算子进行稳定的时间演化预测,在 47 个预测任务中的 34 个取得最优,平均 MAE 降低 2.2%。

查看全部31篇「时间序列」论文 →


🏥 医学图像 (76)

Towards Ultrasound-based Reliable Disease Diagnosis Using Causal Inference

给定同一病例的一张 B 型超声图像和一段超声造影视频,本文让两路网络在交换形态与灌注信息时,借助参考特征字典和因果调整启发的注意力减轻对偶然关联的依赖,在自建的 486 例乳腺数据集上报告 89.80% 的良恶性分类准确率。

MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis

提出 MedEyes,一个混合策略强化学习框架,通过注视引导推理导航器(GRN)模拟临床医生"扫描-钻探"的诊断视觉搜索模式,结合置信度值采样器(CVS)和双流 GRPO 优化,实现动态视觉聚焦的医学渐进式诊断推理,在五个医学 VQA 基准上平均提升 8.5pp。

MAISI-v2: Accelerated 3D High-Resolution Medical Image Synthesis with Rectified Flow and Region-specific Contrastive Loss

提出 MAISI-v2,首个将 Rectified Flow 引入 3D 医学图像合成的框架,通过替换 DDPM 实现 33 倍加速,并设计区域特异性对比损失增强对肿瘤等小区域条件的忠实度,在下游肿瘤分割任务中验证了合成数据的增强价值。

Decoding with Structured Awareness: Integrating Directional, Frequency-Spatial, and Structural Attention for Medical Image Segmentation

提出面向医学图像分割的新型解码器框架,包含三个模块:方向感知的自适应交叉融合注意力(ACFA)、空间-频率-小波三分支融合注意力(TFFA)和结构感知多尺度掩码模块(SMMM),在多个基准数据集上超越现有方法。

NeuroBridge: Bio-Inspired Self-Supervised EEG-to-Image Decoding via Cognitive Priors and Bidirectional Semantic Alignment

提出NeuroBridge框架,通过认知先验增强(CPA,非对称增广模拟感知变异性)和共享语义投影器(SSP,双向对齐到统一语义空间),在THINGS-EEG数据集200类零样本EEG-图像检索任务上达到63.2% Top-1(+12.3%)和89.9% Top-5(+10.2%),大幅超越现有SOTA。

PriorRG: Prior-Guided Contrastive Pre-training and Coarse-to-Fine Decoding for Chest X-ray Report Generation

PriorRG 提出了一个两阶段胸部X光报告生成框架,通过先验引导的对比预训练对齐临床语境与时空视觉特征,再通过先验感知的粗到细解码逐步融合临床上下文、疾病进展和多层级视觉线索,在 MIMIC-CXR 上实现 BLEU-4 提升 3.6%、F1 提升 3.8%。

DeepGB-TB: A Risk-Balanced Cross-Attention Gradient-Boosted Convolutional Network for Rapid, Interpretable Tuberculosis Screening

提出 DeepGB-TB,一个结合轻量级1D-CNN(处理咳嗽音频)和梯度提升决策树(处理人口统计特征)的多模态TB筛查系统,通过双向交叉注意力(CM-BCA)模拟临床推理过程融合异构数据,配合风险平衡损失(TRBL)最小化漏诊,在7国数据集上达到 AUROC 0.903,可在手机上离线实时运行。

FIA-Edit: Frequency-Interactive Attention for Efficient and High-Fidelity Inversion-Free Text-Guided Image Editing

提出 FIA-Edit,一个基于频域交互注意力的无反转(inversion-free)文本引导图像编辑框架,通过频率表示交互(FRI)模块在自注意力中进行源/目标特征的频域融合,以及特征注入(FIJ)模块在交叉注意力中显式引入源图像特征,在保持背景高保真度的同时实现精确语义编辑,并首次将通用图像编辑方法应用于临床手术出血图像增强。

Advancing Safe Mechanical Ventilation Using Offline RL With Hybrid Actions and Clinically Aligned Rewards

针对ICU机械通气(MV)设置优化问题,提出混合动作空间的离线RL方法(HybridIQL/HybridEDAC),避免传统离散化导致的分布偏移,同时引入基于无通气天数(VFD)和生理参数安全范围的临床对齐奖励函数,通过多目标优化选择最优奖励,将可优化的通气参数从2-3个扩展到6个,HybridIQL在性能和策略覆盖率间取得最佳平衡。

SEMC: Structure-Enhanced Mixture-of-Experts Contrastive Learning for Ultrasound Standard Plane Recognition

提出 SEMC 框架,通过语义-结构融合模块(SSFM)对齐浅层结构线索与深层语义表征,结合混合专家对比识别模块(MCRM)在多层特征上进行分层对比学习,提升超声标准切面识别的细粒度判别能力,并构建了新的肝脏超声数据集 LP2025。

查看全部76篇「医学图像」论文 →


🩺 医疗 LLM (12)

BiCA: Effective Biomedical Dense Retrieval with Citation-Aware Hard Negatives

提出利用 PubMed 引文链构建多跳语义图并进行随机游走的 hard negative 挖掘方法,仅用 20k 训练样本和极少微调步数,即让 33M/110M 小模型在 BEIR 和 LoTTE 上超越数十亿参数的检索基线。

MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains

提出MIRAGE框架,将传统的线性推理链扩展为并行多链推理范式,结合结构化医学知识图谱的自适应检索(邻域扩展和多跳遍历),通过跨链验证解决矛盾,在三个医学QA基准上持续优于GPT-4o、ToT和Search-o1等方法。

CliCARE: Grounding Large Language Models in Clinical Guidelines for Decision Support over Longitudinal Cancer Electronic Health Records

提出 CliCARE 框架,将非结构化的纵向癌症电子病历(EHR)转化为时序知识图谱(TKG),并与临床指南知识图谱对齐融合,为 LLM 提供循证依据的临床决策支持,同时设计了与专家评估高度相关的 LLM-as-a-Judge 评估协议。

Expert-Guided Prompting and Retrieval-Augmented Generation for Emergency Medical Service Question Answering

构建首个EMS急救领域多选QA数据集EMSQA(24.3K题、10个临床主题、4个认证等级),提出Expert-CoT和ExpertRAG框架将领域专业属性注入LLM推理与检索,比标准RAG最高提升4.59%准确率。

A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment

针对老年认知障碍患者的群体认知刺激治疗(CST)场景,提出GCSD系统:通过多说话人上下文控制、动态参与者状态建模(soft prompt)、认知刺激注意力损失和多维奖励策略优化四个模块,基于Qwen-2.5-3B微调,在500+小时真实粤语CST对话和1万+模拟对话上训练,BLEU-4达27.93超越GPT-4o等大模型,A/B测试胜率50% vs GPT-4o的39%。

LUCID: Learning-Enabled Uncertainty-Aware Certification of Stochastic Dynamical Systems

本文提出 LUCID,首个可为黑盒随机动力系统提供量化安全保证的验证引擎,通过数据驱动的控制障碍证书方法、条件均值嵌入和有限傅里叶核展开,将半无限非凸优化问题重构为可处理的线性规划。

ShortageSim: Simulating Drug Shortages under Information Asymmetry

提出 ShortageSim,首个基于 LLM 多智能体的药品短缺模拟框架,建模 FDA 监管者、制造商和购买者在信息不对称下的战略决策,在历史短缺数据上实现对解决滞后时间 84% 的预测改善,为监管策略评估提供受控测试平台。

Learning Cell-Aware Hierarchical Multi-Modal Representations for Robust Molecular Modeling

本文提出 CHMR 框架,通过结构感知传播解决生物模态缺失问题,引入树状向量量化(Tree-VQ)建模分子-细胞-基因间的层次依赖关系,在9个基准728个任务上分类提升3.6%、回归提升17.2%,实现鲁棒的细胞感知分子表征学习。

Voices, Faces, and Feelings: Multi-modal Emotion-Cognition Captioning for Mental Health Understanding

提出情感-认知协同多模态描述(ECMC)任务和框架,通过双流BridgeNet从视频、音频、文本中提取情感和认知特征,利用LLaMA生成自然语言描述,为心理健康评估提供可解释的情感-认知画像,显著提升辅助诊断的准确性和可解释性。

Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology

系统评估了6个小型开源医学LLM(<10B参数)在儿科内分泌领域的表现,揭示仅靠准确率不足以衡量模型可靠性:语义无关的提示微调导致模型输出显著变化(Stuart-Maxwell p<10⁻⁴),高一致性不等于正确,甚至CUDA版本差异也能引发统计显著的输出偏移。

查看全部12篇「医疗 LLM」论文 →


🧬 计算生物 (20)

CellStream: Dynamical Optimal Transport Informed Embeddings for Reconstructing Cellular Trajectories from Snapshots Data

提出 CellStream,一种将自编码器与非平衡动态最优传输(unbalanced dynamical OT)联合学习的深度学习框架,从离散时间点的单细胞快照数据中同时学习低维嵌入和连续细胞动态轨迹,在时间一致性和速度一致性上显著优于现有方法。

MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging

提出 MergeDNA,通过可微分 Token Merging 实现上下文感知的动态 DNA tokenization,结合层次化 autoencoder 和自适应 masked token modeling 预训练,380M 参数超越 1.3B GENERator。

ProtSAE: Disentangling and Interpreting Protein Language Models via Semantically-Guided Sparse Autoencoders

提出 ProtSAE,在稀疏自编码器训练中引入语义标注和领域本体知识作为引导信号,解决传统 SAE 的语义纠缠问题,使蛋白质语言模型的隐层特征与生物学概念(分子功能、生物过程、离子结合位点等)精准对齐,同时保持高重建保真度并支持概念级别的生成控制。

TrinityDNA: A Bio-Inspired Foundational Model for Efficient Long-Sequence DNA Modeling

提出 TrinityDNA,一个生物启发的DNA基础模型,整合三大创新:Groove Fusion模块捕获DNA大小沟槽结构特征、Gated Reverse Complement机制处理双链互补对称性、Sliding Multi-Window Attention实现多尺度长程依赖建模,配合从原核到真核的进化训练策略(ETS),在GUE基准15个任务上平均MCC达0.708(超越2.5B参数的NT),在19个零样本任务上的原核/真核表现均领先,并提出新的CDS标注基准供长序列推理评估。

ConSurv: Multimodal Continual Learning for Survival Analysis

本文提出 ConSurv,首个面向生存分析的多模态持续学习方法,通过多阶段混合专家(MS-MoE)和特征约束回放(FCR)两个核心组件,在整合全切片病理图像和基因组数据的场景下有效缓解灾难性遗忘,并在新构建的 MSAIL 基准上全面超越现有方法。

GP-MoLFormer-Sim: Test Time Molecular Optimization through Contextual Similarity Guidance

提出 GP-MoLFormer-Sim,一种无需训练的测试时分子生成引导方法:利用化学语言模型(GP-MoLFormer)自身的上下文嵌入计算与目标分子的相似度,在自回归解码时动态调整logits来引导生成,结合遗传算法(GP-MoLFormer-Sim+GA)后在PMO基准的23个任务上平均排名第2,且在黑盒oracle设定下优于依赖GPT-4的MOLLEO。

S2Drug: Bridging Protein Sequence and 3D Structure in Contrastive Representation Learning for Virtual Screening

提出 S2Drug,一个两阶段对比学习框架,第一阶段在 ChemBL 大规模数据上用蛋白质序列-配体对比预训练(含双边数据采样策略降噪去冗),第二阶段在 PDBBind 上通过残基级门控模块融合序列与 3D 结构信息并引入结合位点预测辅助任务,在 DUD-E 和 LIT-PCBA 虚拟筛选基准上大幅超越现有方法。

Dual-Path Knowledge-Augmented Contrastive Alignment Network for Spatially Resolved Transcriptomics

提出 DKAN,一个双路径知识增强对比对齐网络,通过整合外部基因数据库的语义信息作为跨模态协调器,结合统一的一阶段对比学习范式和自适应加权机制,从病理组织切片图像(H&E WSI)预测空间分辨率的基因表达,在三个公开ST数据集上全面超越SOTA。

EPO: Diverse and Realistic Protein Ensemble Generation via Energy Preference Optimization

提出EPO(Energy Preference Optimization),将反向SDE采样与listwise能量排序偏好优化结合,用能量信号对齐预训练蛋白质生成器与目标Boltzmann分布,在Tetrapeptides/ATLAS/Fast-Folding三个基准9个指标上达到SOTA,完全消除了昂贵的分子动力学(MD)模拟需求。

HiFusion: Hierarchical Intra-Spot Alignment and Regional Context Fusion for Spatial Gene Expression Prediction from Histopathology

提出 HiFusion 框架,通过层次化 spot 内建模(HISM)和上下文感知跨尺度融合(CCF)两个互补模块,从 H&E 染色全切片图像中准确预测空间基因表达,在两个基准数据集的 2D 切片交叉验证和 3D 样本特异性评估中均达到 SOTA。

查看全部20篇「计算生物」论文 →


⚛️ 物理/科学计算 (15)

PhysicsCorrect: A Training-Free Approach for Stable Neural PDE Simulations

提出 PhysicsCorrect,一种无需训练的校正框架,通过将 PDE 残差校正建模为线性化逆问题并预计算伪逆缓存,在推理时以 <5% 计算开销实现最高 100× 误差降低,适用于 FNO/UNet/ViT 等任意预训练神经算子。

Phys-Liquid: A Physics-Informed Dataset for Estimating 3D Geometry and Volume of Transparent Deformable Liquids

构建了 Phys-Liquid 数据集(97,200 张物理仿真图像 + 3D mesh),基于 Navier-Stokes 方程模拟透明容器内液体的动态形变,并提出四阶段重建管线(分割→多视角 mask 生成→3D 重建→缩放),在仿真和真实场景中实现高精度液体几何与体积估计。

Towards a Foundation Model for Partial Differential Equations Across Physics Domains

提出 PDE-FM,一个结合空间-频谱双模态 tokenization、FiLM 物理调制和 Mamba 状态空间 backbone 的模块化 PDE foundation model,在 The Well 基准 12 个异构物理域数据集上平均降低 VRMSE 46%。

SAOT: An Enhanced Locality-Aware Spectral Transformer for Solving PDEs

提出 SAOT(Spectral Attention Operator Transformer),通过线性复杂度的小波注意力(WA)捕获高频局部细节,与傅里叶注意力(FA)的全局感受野经门控融合互补,在 6 个算子学习基准上取得 SOTA,Navier-Stokes 相对误差比 Transolver 下降 22.3%。

Knowledge-Guided Masked Autoencoder with Linear Spectral Mixing and Spectral-Angle-Aware Reconstruction

提出 KARMA 框架,在 ViT-MAE 解码器中嵌入线性光谱混合模型 (LSMM) 作为物理约束,结合 Spectral Angle Mapper (SAM) 损失,提升高光谱遥感图像的重建保真度和下游任务迁移性能。

SVD-NO: Learning PDE Solution Operators with SVD Integral Kernels

提出 SVD-NO,通过显式参数化积分核的奇异值分解(SVD)来构建神经算子,在保持高表达力的同时实现 \(O(ndL)\) 的线性计算复杂度,在 5 个 PDE 基准上达到新 SOTA。

Catastrophic Forgetting in Kolmogorov-Arnold Networks

首个系统性研究KAN(Kolmogorov-Arnold Networks)中灾难性遗忘行为的工作:建立了遗忘与激活支持重叠和数据内禀维度之间的理论框架,并提出KAN-LoRA用于语言模型的持续微调知识编辑。

FlashKAT: Understanding and Addressing Performance Bottlenecks in the Kolmogorov-Arnold Transformer

深入分析 KAT(Kolmogorov-Arnold Transformer)训练慢 123 倍的根因,发现瓶颈并非 FLOPs 而是反向传播中梯度累积的内存停顿(atomic add 导致全局内存竞争),提出 FlashKAT 通过重构 GPU 核函数将训练加速 86.5 倍并降低近一个数量级的梯度舍入误差。

Fast 3D Surrogate Modeling for Data Center Thermal Management

本文开发了基于视觉的 3D 代理建模框架,通过将数据中心的服务器负载、风扇速度和空调温度设定点编码为 3D 体素表示,利用 3D CNN U-Net、3D 傅里叶神经算子和 3D Vision Transformer 等架构实现实时温度场预测,速度比传统 CFD 求解器快 20000 倍,同时实现 7% 的能耗节约。

PIMRL: Physics-Informed Multi-Scale Recurrent Learning for Burst-Sampled Spatiotemporal Dynamics

提出 PIMRL 框架,针对 burst 采样(短段高频+长间隔)的稀疏时空数据,结合宏观尺度潜空间推理和微观尺度物理校正的双模块架构,通过跨尺度消息传递融合信息,在 5 个 PDE 基准上将误差最多降低 80%。

查看全部15篇「物理/科学计算」论文 →


🌍 地球科学 (2)

MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics

提出 MdaIF 框架,利用视觉语言模型(VLM)提取退化感知语义先验来引导混合专家(MoE)路由和通道注意力调制,实现无需退化类型标注的一站式多退化场景红外-可见光图像融合。

RENEW: Risk- and Energy-Aware Navigation in Dynamic Waterways

提出 RENEW 全局路径规划器,为水面自主航行器 (ASV) 在动态水流 (洋流) 环境中引入统一的风险感知和能量感知策略,通过自适应不可导航区域识别、最佳努力应急策略和基于约束 Delaunay 三角化的分层架构实现安全高效导航,应急碰撞测试中实现零碰撞。


📡 信号/通信 (3)

Text-Guided Channel Perturbation and Pretrained Knowledge Integration for Unified Multi-Modality Image Fusion

提出 UP-Fusion 统一多模态图像融合框架,通过语义感知通道剪枝 (SCPM)、几何仿射调制 (GAM) 和 CLIP 文本引导通道扰动 (TCPM) 三个模块,用单组权重(仅在红外-可见光数据上训练)同时处理 IVIF 和医学图像融合,在两类任务上均达到 SOTA。

Balancing Multimodal Domain Generalization via Gradient Modulation and Projection

提出 Gradient Modulation Projection (GMP) 策略,通过解耦分类与域不变梯度的调制(IGDM)以及冲突自适应梯度投影(CAGP),解决多模态域泛化中模态间优化不平衡和任务间梯度冲突问题,在多个基准上达到 SOTA。

Task Aware Modulation Using Representation Learning for Upscaling of Terrestrial Carbon Fluxes

提出 TAM-RL 框架,将陆地碳通量升尺度问题建模为零样本回归迁移学习任务,用 BiLSTM 任务编码器+FiLM 调制结合碳平衡方程知识引导损失,在 150+ 通量塔站点上将 GPP RMSE 降低 9.6%、NEE R² 提升 43.8%(相较 FLUXCOM-X-BASE)。


👥 社会计算 (10)

Cross-modal Prompting for Balanced Incomplete Multi-modal Emotion Recognition

提出 Cross-modal Prompting (ComP) 方法,通过渐进式提示生成+跨模态知识传播+动态调度器来解决不完整多模态情感识别中的模态不平衡问题,在 4 个数据集、 7 种缺失率下均达到 SOTA。

Fact2Fiction: Targeted Poisoning Attack to Agentic Fact-checking System

提出 Fact2Fiction,首个针对 Agent 化事实核查系统(如 DEFAME、InFact)的投毒攻击框架:通过 Planner Agent 模拟声明分解生成子问题,利用系统的 justification 反向工程关键推理点来制作定向恶意证据,并按重要性分配投毒预算,在仅 1% 投毒率下比 SOTA PoisonedRAG 高 8.9%-21.2% 的攻击成功率。

FactGuard: Event-Centric and Commonsense-Guided Fake News Detection

提出 FactGuard 框架,利用 LLM 提取事件核心内容(去风格化)并生成常识推理,通过 Rationale Usability Evaluator 动态评估 LLM 建议的可信度,并通过知识蒸馏获得无需 LLM 的轻量版 FactGuard-D,在假新闻检测中兼顾鲁棒性和效率。

Bias Association Discovery Framework for Open-Ended LLM Generations

提出偏见关联发现框架 BADF,通过分析 LLM 开放式故事生成中的叙事内容,系统性地提取人口统计身份与描述性概念之间的已知和未知偏见关联,突破了以往依赖预定义偏见概念的局限。

Reasoning About the Unsaid: Misinformation Detection with Omission-Aware Graph Inference

提出OmiGraph,首个基于"遗漏感知"的虚假信息检测框架,通过构建遗漏感知图、利用LLM推理遗漏意图、以及遗漏导向的消息传递与聚合机制,从"未说出的内容"中提取欺骗模式,在双语数据集上平均提升+5.4% F1和+5.3% ACC。

SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation

提出SceneJailEval,一个场景自适应的多维度越狱评估框架,定义14个越狱场景和10个评估维度,通过场景分类→维度动态选择→多维检测→加权危害评分的流程,在自建数据集上F1达0.917(超SOTA 6%),在JBB上达0.995(超SOTA 3%),同时支持危害程度量化而非仅二分类。

T2Agent: A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search

提出 T2Agent,一个集成可扩展工具集与蒙特卡洛树搜索(MCTS)的虚假信息检测智能体,通过多源验证机制将检测任务分解为针对不同伪造源的子任务,在 MMfakebench 上以 GPT-4o 为骨干将基线 MMDAgent 的准确率提升 28.7%,达到新 SOTA。

Argumentative Debates for Transparent Bias Detection

提出 ABIDE(Argumentative BIas Detection by DEbate),通过基于邻域属性的论证方案(argument schemes)构建量化双极论证框架(QBAF),将偏见检测过程建模为结构化辩论,实现从单邻域到全局的透明偏见推理,并形式化证明 QBAF 语义与偏见检测期望行为之间的对应关系。

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

提出 CAPO(Curriculum Advantage Policy Optimization),一种基于优势信号的自适应课程机制,通过先模仿(仅正向优势样本)再判别(引入负向信号)的两阶段策略,稳定且显著提升 LLM 在数学推理和多模态 GUI 推理任务上的表现。

Multi-modal Dynamic Proxy Learning for Personalized Multiple Clustering

本文提出Multi-DProxy框架,通过门控跨模态融合、双约束代理优化和动态候选词管理三大创新机制,利用可学习的文本代理实现个性化多重聚类,在全部公开基准上达到SOTA。


🛡️ AI 安全 (45)

Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception

首次建立全类型(语音/声音/歌声/音乐)音频深伪检测基准,提出小波提示调优(WPT)方法通过离散小波变换增强 SSL 特征的全频域感知能力,在不增加训练参数的前提下超越全量微调,co-training 后平均 EER 仅 3.58%。

An Information Theoretic Evaluation Metric for Strong Unlearning

揭示现有黑盒遗忘评估指标(MIA/JSD等)的根本缺陷——仅修改最后一层即可满足所有黑盒指标但中间层完整保留遗忘数据信息,提出IDI白盒指标通过InfoNCE估计各层与遗忘标签的互信息差异来量化遗忘效果,并提出COLA方法在CIFAR-10/100和ImageNet-1K上实现接近Retrain的IDI得分。

Yours or Mine? Overwriting Attacks Against Neural Audio Watermarking

首次系统研究神经音频水印的覆写攻击(overwriting attack),提出白盒、灰盒、黑盒三级攻击方案,在 AudioSeal、Timbre、WavMark 三种 SOTA 方法上均实现接近 100% 的攻击成功率,暴露了现有音频水印系统严重的安全缺陷。

RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service

提出基于语义区域触发的水印框架 RegionMarker,在低维空间中定义触发区域并注入语义水印,是首个能同时抵御 CSE 攻击、改写攻击和维度扰动攻击的 EaaS 版权保护方法。

An Improved Privacy and Utility Analysis of Differentially Private SGD with Bounded Domain and Smooth Losses

在仅假设损失函数L-光滑(不需要凸性)的条件下,为DPSGD推导出了更紧的闭式RDP隐私界,并首次在有界域场景下给出了完整的收敛性/效用分析,揭示了较小的参数域直径可以同时改善隐私和效用。

Credal Ensemble Distillation for Uncertainty Quantification

提出Credal Ensemble Distillation(CED)框架,将深度集成教师蒸馏为单模型CREDIT,该模型预测类别概率区间(定义credal集)而非单一softmax分布,在OOD检测任务上实现了优于或可比的不确定性估计,同时大幅降低推理开销(推理时间从5×降为1×)。

FairGSE: Fairness-Aware Graph Neural Network without High False Positive Rates

首次揭示公平感知 GNN 中的"FPR 捷径"问题——现有方法通过大量误判负样本为正来达到公平指标,提出 FairGSE 框架通过最大化二维结构熵重新加权图边来同时改善公平性并降低假阳性率,FPR 降低 39%。

MPD-SGR: Robust Spiking Neural Networks with Membrane Potential Distribution-Driven Surrogate Gradient Regularization

从理论上建立了 SNN 鲁棒性误差与代理梯度(SG)幅值之间的联系,揭示减少膜电位分布(MPD)与 SG 梯度可用区间的重叠比例可有效降低对抗扰动敏感度,据此提出 MPD-SGR 正则化方法,在 vanilla training 和 adversarial training 设置下均大幅超越现有 SNN 防御方法。

Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models

提出 GFM-BA,首个系统性地针对 Graph Foundation Models (GFMs) 预训练阶段的后门攻击方法,通过 label-free trigger 关联、node-adaptive trigger 生成和 persistent backdoor anchoring 三个模块,同时解决有效性、隐蔽性和持久性三大挑战。

Breaking the Dyadic Barrier: Rethinking Fairness in Link Prediction Beyond Demographic Parity

本文揭示了链接预测中二元公平性(dyadic fairness)和 Demographic Parity(ΔDP)的三大根本缺陷——GNN 表达力不足、子群偏差被掩盖、对排序不敏感——并提出基于 NDKL 的排序感知公平度量和后处理算法 MORAL,在六个数据集上实现了 SOTA 的公平性-效用权衡。

查看全部45篇「AI 安全」论文 →


📂 其他 (117)

LeanRAG: Knowledge-Graph-Based Generation with Semantic Aggregation and Hierarchical Retrieval

提出 LeanRAG 框架,通过语义聚合算法在层次化知识图谱的摘要节点间自动构建显式关系打破"语义孤岛",并基于最近公共祖先(LCA)的自底向上检索策略高效导航层次结构,在四个 QA 基准上取得 SOTA 同时减少 46% 的检索冗余。

OR-R1: Automating Modeling and Solving of Operations Research Optimization Problems

OR-R1提出了一个数据高效的两阶段训练框架(SFT + TGRPO),仅使用ORLM所需1/10的合成数据即达到67.7%的平均求解准确率,超越现有SOTA方法,并通过测试时强化学习将单次生成(Pass@1)与多次生成(Pass@8)的性能差距从13%缩小到7%。

On the Edge of Core (Non-)Emptiness: An Automated Reasoning Approach to Approval-Based Multi-Winner Voting

针对基于认可的多赢者投票中核稳定性(core stability)是否总存在这一重大开放问题,提出基于混合整数线性规划(MILP)的自动推理框架,证明了新的存在性结果,发现了核稳定性与其他公理(如 Lindahl 可定价性)之间此前未知的关系,并推翻了一个已有猜想。

CAE: Hierarchical Semantic Alignment for Image Clustering

结合名词级(WordNet)和描述级(Flickr 图片描述)两种互补语义,通过最优传输对齐构建语义空间并自适应融合,实现 training-free 的图像聚类,在 ImageNet-1K 上准确率提升 4.2%。

DFDT: Dynamic Fast Decision Tree for IoT Data Stream Mining on Edge Devices

提出 DFDT(Dynamic Fast Decision Tree),一种面向 IoT 边缘设备的内存受限数据流挖掘算法,通过活动感知预剪枝、动态 grace period、自适应 tie threshold 三重机制有机调控树的增长,实现精度-内存-运行时间的最优权衡。

Controllable Financial Market Generation with Diffusion Guided Meta Agent

提出Diffusion Guided Meta Agent(DigMA)模型,将可控金融市场生成形式化为条件生成任务,用条件扩散模型捕捉市场状态动态(中间价收益率与订单到达率的时变分布参数),结合具有金融经济学先验的Meta Agent生成订单流,在可控性和生成保真度上均超越现有方法。

Designing Incident Reporting Systems for Harms from General-Purpose AI

通过文献综述和九个安全关键行业(核能、航空、医疗等)的案例研究,提出了 AI 事件报告系统制度设计的七维框架,为美国通用 AI 事件报告的政策设计提供系统性指导。

Finding Diverse Solutions Parameterized by Cliquewidth

将"寻找多样化解"的参数化框架从treewidth扩展到更强的cliquewidth图参数,证明任何基于cliquewidth分解的单调动态规划都可以以极小额外开销转换为求解多样化版本的算法,并提出了一族新的Venn多样性度量函数。

Improved Runtime Guarantees for the SPEA2 Multi-Objective Optimizer

通过深入分析SPEA2更复杂的选择机制,证明了其种群动态与NSGA-II有本质不同(σ-准则使目标值在种群中均匀分布),从而得到了对种群大小依赖更弱的运行时上界,表明SPEA2对参数选择具有更强的鲁棒性。

DiffMM: Efficient Method for Accurate Noisy and Sparse Trajectory Map Matching via One Step Diffusion

提出 DiffMM,首次将扩散模型引入地图匹配任务,通过路段感知轨迹编码器和一步 Shortcut 扩散过程,在稀疏轨迹和复杂路网上实现了精度和效率的双重提升,推理速度比次优方法快约 17 倍。

查看全部117篇「其他」论文 →