💬 ACL2026 论文汇总¶
1409篇ACL2026论文解读,涵盖 LLM 安全(115篇)、LLM 评测(96篇)、LLM Agent(82篇)、LLM Reasoning(82篇)、多模态 VLM(82篇)、信息检索/RAG(73篇)、音频/语音(70篇)、可解释性(63篇)等 38个方向。每篇含一句话总结、核心思想、方法详解、实验结果与局限性分析,5分钟读懂一篇论文核心思想。
💡 LLM Reasoning (82)¶
- Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
-
本文发现 LLM 逻辑推理存在"逻辑相变"现象——性能在特定复杂度阈值处突然崩塌而非平滑退化,提出逻辑复杂度度量(LoCM)来量化这一现象,并设计神经符号课程调优框架(NSCT),通过自适应神经-符号对齐和复杂度感知课程优化,在五个基准上平均提升 naive prompting +1.26 和 CoT +3.95 准确率。
- Semantic-Aware Logical Reasoning via a Semiotic Framework
-
提出 LogicAgent,一个基于格雷马斯符号方阵(Semiotic Square)的逻辑推理框架,通过多视角语义分析和反思验证,在语义复杂和逻辑复杂双重挑战下实现 SOTA 逻辑推理性能。
- DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models
-
DRP 让"短 CoT 老师 (GPT-4o)"在"长 CoT 学生 (R1-Distill-Qwen)"自己的推理轨迹上做技能级分步+剪枝/重写,再把这条"裁掉冗余但保留学生说话风格"的轨迹蒸馏回学生,在 GSM8K 把 7B 模型 token 从 917 砍到 328(−64%)的同时把 Pass@1 从 91.7% 提到 94.1%,且在 AIME/AMC/MATH500 等 OOD 任务上同时降 token、涨准确率。
- TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
-
TemplateRL 通过从小规模种子集合用 MCTS 抽象出结构化推理模板,在强化学习训练中引入这些模板作为显式指导,显著提升 LLM 多步推理效率和稳定性,在 AIME 上相比 GRPO 提升 99%。
- Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization
-
论文系统反驳"CoT 不算可解释性"这一近年流行结论:用 Filler Tokens、FUR、faithful@k 与 Causal Mediation Analysis 四种互补指标证明,被 Biasing Features(hint verbalization)判为不忠实的 CoT 里超过一半其实"以其它方式"忠实地反映了模型推理;不忠实主要来自"自然语言对分布式计算做了 lossy 压缩"导致的不完整(incompleteness),而非真不忠实——增大采样预算可让 hint 出现概率涨到 90%,未明示 hint 的 CoT 也能因果性地传递 hint 影响。
- Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
-
提出 Render-of-Thought(RoT),首次将文本 CoT 推理步骤渲染为图像,利用预训练视觉编码器作为语义锚点将 LLM 隐状态对齐到视觉嵌入空间,实现 3-4 倍 token 压缩和显著推理加速,同时保持推理链的可分析性。
- LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
-
本文把 LLM 的 chain-of-thought 推理看成在表征空间里的一条几何轨迹,发现 (a) 每个推理步骤都占据一个线性可分的子空间且越深层越清晰、(b) 正确与错误解在早期重叠、在后期系统性分叉,由此能在尚未输出答案时以 ROC-AUC 0.87 预测最终对错,并据此提出"轨迹引导"做推理修正和长度控制。
- Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
-
系统性研究了 RLVR 训练中 LLM 的熵动态,揭示正优势 token 是熵崩塌的主要驱动因素,并提出 Positive-Advantage Reweighting 方法通过动态调整正优势 token 的损失权重来有效调控模型熵。
- MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
-
MTR-Bench 构建了一个包含 4 类、40 个任务、3600 个实例的自动化多轮推理评测框架,显示当前前沿推理模型在交互式、动态反馈环境中仍远未可靠。
- Parallel Test-Time Scaling for Latent Reasoning Models
-
本文首次将并行测试时缩放(parallel TTS)引入潜在推理模型,提出两种基于不确定性理论的随机采样策略(MC-Dropout 和加性高斯噪声)以及一个步级对比训练的潜在奖励模型(LatentRM),使得在连续向量空间中进行推理的模型也能通过并行采样+聚合获得稳定的性能提升。
🦾 LLM Agent (82)¶
- OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
-
OctoTools是一个免训练、用户友好且易于扩展的多智能体框架,通过标准化工具卡封装异构工具、Planner-Executor分离范式和任务特定工具集优化算法,在16个多样化基准上实现了比GPT-4o平均+9.3%、比AutoGen/LangChain等框架最多+10.6%的准确率提升。
- Mem^p: Exploring Agent Procedural Memory
-
本文提出 Mem^p 框架,系统性地研究如何为 LLM Agent 构建可学习、可更新、终身演化的程序性记忆——通过将过去的任务轨迹蒸馏为细粒度的分步指令和高层脚本抽象,并配合动态更新机制(添加/验证/反思/淘汰),在 TravelPlanner 和 ALFWorld 上实现了成功率持续提升和执行步数大幅减少。
- MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents
-
MAGMA 把 LLM agent 的记忆拆成语义 / 时间 / 因果 / 实体四张正交关系图,再用 intent 路由 + 适应性 beam search 在合适的图上做 policy-guided traversal 检索,并配以"快路径同步入库 + 慢路径异步 LLM 巩固"双流写入;在 LoCoMo 上 Judge 0.700 全面超过 A-MEM / Nemori / MemoryOS,同时 query latency 仅 1.47s(比次优快 40%)。
- OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation
-
OPeRA 是一个从真实 Amazon 购物过程中采集的用户行为数据集,把 persona、网页观察、细粒度动作和即时 rationale 放在同一条时间轴上,用来评估 LLM 是否真的能模拟特定用户的下一步购物行为。
- ExpSeek: Self-Triggered Experience Seeking for Web Agents
-
ExpSeek 提出了一种基于步级熵自触发的经验主动寻求框架,让 Web Agent 在交互过程中根据自身信号判断何时需要指导、获取什么指导,在 Qwen3-8B/32B 上分别实现 9.3% 和 7.5% 的绝对提升。
- From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms
-
本文用「Storage → Reflection → Experience」三阶段演化框架把 LLM Agent 记忆机制做系统综述,用形式化定义把三阶段对应为「轨迹保留 → 轨迹精化 → 跨轨迹抽象」三种 functional signature,并用"Why-How-What"三层 RQ 串起整个 storyline,重点展开 Experience 阶段的两大变革性机制 — Active Exploration 与 Cross-Trajectory Abstraction。
- MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End RL
-
MemSearcher 把搜索 agent 的"历史拼接"换成"LLM 自管理的紧凑内存"——每轮只看
(question, memory)而不是(question, t₁, a₁, o₁, …),并用 multi-context GRPO 把整条 trajectory 的 advantage 传播到每一轮独立优化,在 7 个 QA benchmark 上 3B/7B/14B 全面超过同尺寸 ReAct baseline(7B 甚至超 32B ReSearch),context 长度恒定 <4K token。 - AgencyBench: Benchmarking the Frontiers of Autonomous Agents in 1M-Token Real-World Contexts
-
提出AgencyBench——一个包含138个真实世界任务的综合基准,评估6种核心智能体能力,每个场景平均需90次工具调用和100万token,通过用户模拟agent和Docker沙箱实现全自动化评估。
- TiMem: Temporal-Hierarchical Memory Consolidation for Long-Horizon Conversational Agents
-
TiMem 将长程对话记忆组织成显式时间包含的五层 Temporal Memory Tree,并用复杂度感知检索在细粒度事实和高层 persona 之间动态取舍,在 LoCoMo 和 LongMemEval-S 上同时提升准确率并显著减少召回上下文长度。
- Verified Critical Step Optimization for LLM Agents
-
CSO 从 agent 自己失败的轨迹中找出“换一个动作就能让任务成功”的 verified critical steps,只在这些关键决策点构造 DPO 偏好对,从而用更少、更可靠的监督提升长程 LLM agent 的后训练效果。
👥 Multi-Agent (39)¶
- LLM-Based Human-Agent Collaboration and Interaction Systems: A Survey
-
本文首次系统性梳理"LLM 基础的人-agent 协作系统(LLM-HAS)"——把人重新拉回 agent loop,从环境/画像、人类反馈、交互类型、编排范式、通信结构 5 个维度建立统一分类,并补充了一个 A1–A5 的 Human Agency Scale 量化"任务里到底该让人参与多深"。
- AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage
-
AutoReproduce 提出了一个多智能体框架,通过"论文谱系"算法从引用文献中挖掘隐式领域知识,实现端到端的论文实验自动复现,在自建基准 ReproduceBench 上的代码执行率达 94.87%,性能差距仅 19.72%。
- Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
-
TraceElephant 主张多智能体失败归因应在开发者真实可见的完整执行轨迹下评测,并提供 220 条失败 trace、责任 agent 与关键失败 step 标注,证明 full observability 能将 step-level 归因从输出-only 的 16% 提升到 28%-30% 以上。
- When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning
-
这篇论文指出多智能体辩论中的 LLM 会因为“谁说的”而不是“说了什么”改变立场,并通过响应匿名化与 Identity Bias Coefficient 量化和削弱这种身份驱动偏差。
- Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games
-
提出一个协作式多智能体框架用于自动生成高质量剧本杀游戏脚本和训练数据,通过两阶段训练策略(CoT 微调 + GRPO 强化学习配合 ScoreAgent 奖励塑形)增强 VLM 在不完全信息下的多跳推理能力,在 WhodunitBench 上显著提升 VLM 的叙事推理、事实提取和欺骗抵御能力。
- SILO-BENCH: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems
-
本文提出 SILO-BENCH,一个角色无关的多智能体 LLM 分布式协调基准,包含 30 个算法任务、三个通信复杂度级别、54 种配置共 1620 个实验,揭示了关键的"通信-推理鸿沟":智能体能自发形成合理通信拓扑并积极交换信息,但系统性地无法将分布式状态整合为正确答案。
- PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation
-
PosterForest 用一个同时编码论文层次语义和海报空间布局的 Poster Tree 作为中间表示,再让 Content Agent、Layout Agent 和 Feedback Agent 递归协同优化,训练-free 地生成科学海报,并在人评中获得 59.2% overall preference,明显优于 P2P 和 Paper2Poster。
- AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
-
AgenticEval 把 LLM 安全评估重新定义为「持续、自我演化的红队过程」:Specialist 把非结构化法规文本拆成原子规则知识库,Generator 围绕每条规则生成多模态多形式的 Question Group,Evaluator + Analyst 不断把当轮失败转化为下一轮更狠的攻击策略,三轮迭代后 GPT-5 对 EU AI Act 的合规率从 72.50% 暴跌到 36.36%,揭示静态 benchmark 严重高估了大模型的安全水位。
- ATLAS: Adaptive Trading with LLM AgentS Through Dynamic Prompt Optimization and Multi-Agent Coordination
-
提出 ATLAS 多智能体金融交易框架和 Adaptive-OPRO 提示优化方法,通过专业化分析师智能体准备异构市场信息,并基于延迟噪声反馈动态优化中央交易智能体的指令提示,在多种市场波动环境中显著超越基线。
- ConSensus: Multi-Agent Collaboration for Multimodal Sensing
-
ConSensus 是一个无需训练的多智能体传感器融合框架,它把不同传感模态交给专门 agent 独立解释,再用语义融合、统计共识和混合仲裁得到最终判断,在 5 个多模态传感 benchmark 上比单 agent 平均提升 7.1% accuracy,并把融合 token 成本降到多轮 debate 方法的约 1/12.7。
⚖️ 对齐 / RLHF (38)¶
- WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback
-
WildFeedback 从真实用户与 ChatGPT 的多轮对话中自动识别满意/不满意反馈,把自然发生的用户偏好转成偏好训练样本和逐例 checklist 评估标准,使小型开源指令模型在通用 benchmark 与真实用户偏好测试上都比 UltraFeedback 训练更贴近用户需求。
- AgentV-RL: Scaling Reward Modeling with Agentic Verifier
-
把奖励模型从"单轮打分"重塑为"前向+后向双 agent + 工具调用"的多轮审议流程,并通过 SFT+GRPO 把多 agent 能力蒸馏到单个 4B 模型中,使其在 BoN 选择上比 70B 量级 ORM 高 25.2%。
- RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
-
RbtAct 把作者 rebuttal 视为“哪些评审意见真的促成修改”的隐式监督,构建 7.5 万条 review-rebuttal 段级映射,并用 SFT+DPO 训练 8B 模型生成更具体、更可执行的论文评审反馈。
- Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models
-
本文首次系统研究了 SFT 中的"不完全学习现象"(ILP)——即模型收敛后仍无法正确复现部分训练数据,识别了五种反复出现的原因(知识缺失、知识冲突、数据内部矛盾、左侧遗忘、不充分优化),并提出诊断框架和针对性缓解策略。
- Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling
-
提出 Plan-RewardBench,一个面向复杂工具增强场景的轨迹级偏好基准,用于评估奖励模型在多步规划、工具使用和错误恢复等场景下区分优劣智能体轨迹的能力。
- ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation
-
把开放式文本生成的 Best-of-N 选样建模为「在生成文本的相似度图上找模态簇」的问题——用 n-gram Jaccard 构图 + 递归 Fiedler 向量谱聚类 + 中心度选 centroid,不需要任何 reward model / LLM-judge 就把 self-consistency 推广到摘要 / 代码 / 数学等无标准答案的任务。
- SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
-
本文提出 SFTMix,一种基于 Mixup 的指令微调方法,通过训练动态将 SFT 数据集分为高置信度和低置信度子集,在隐表示空间对两者进行线性插值并施加 Mixup 正则化,在不依赖高质量数据集的情况下,跨 LLM 家族和数据集规模一致性地提升指令遵循能力。
- P-Check: Advancing Personalized Reward Model via Learning to Generate Dynamic Checklist
-
P-Check 把个性化奖励建模从“给用户历史塞进 judge”改成“先为当前用户和当前问题生成带权重的动态评价 checklist,再用它指导奖励打分”,在 PRISM、Arena、BESPOKE 的个性化偏好预测和下游生成任务上都显著优于 persona、记忆检索和微调奖励模型基线。
- PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs
-
PERSA 用“教授示范 + 教授偏好奖励 + 只更新高层 LoRA 的 PPO”把通用 LLM 调成特定教师的编程反馈风格,在 APPS、PyFiXV、CodeReviewQA 上显著提升风格一致性,同时基本保持 100% 诊断正确率。
- Alignment Data Map for Efficient Preference Data Selection and Diagnosis
-
提出 Alignment Data Map,一个通过联合考量回复质量(quality)和回复变异性(variability)来可视化、选择和诊断偏好数据的分析工具,仅用 33% 数据即可达到全量训练的对齐效果。
🔒 LLM 安全 (115)¶
- SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging
-
本文提出 SafeMERGE,一种轻量级后微调框架,通过余弦相似度检测偏离安全行为的微调层,仅将这些层与安全模型的对应层合并,在四个 LLM 上显著降低有害输出同时保持甚至提升任务性能。
- A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?
-
本文给"计算机使用智能体 (CUA)"的安全研究做了第一次系统化梳理,把 124 篇相关论文整理成"内在威胁 × 外在威胁 × 防御 × 评测"四维分类框架,并指出现有 CUA 的最大缺口是 UI grounding 鲁棒性与跨平台对抗评测。
- How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study
-
本文系统研究如何通过 SFT 增强大型推理模型(LRM)的安全性,发现直接蒸馏安全响应效果有限的根因是五种风险推理模式(尤其是"弱犹豫"),提出针对性的蒸馏策略将 PAIR 攻击成功率从 63% 降至 13%,并发现短推理链和模板推理在安全性上与长推理链表现相当。
- Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
-
本文提出一种基于指令引用的提示注入防御方法,不压制 LLM 的指令遵循能力,而是让模型在响应中引用正在执行的指令,然后通过标签过滤移除与原始指令不相关的响应,在部分场景下将攻击成功率降至接近 0%。
- Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks
-
这篇论文系统研究 LLM 生成的有偏增强数据如何在监督微调中被继承、放大并影响下游任务,并用六类偏见生成框架、十个任务和三类缓解方法揭示了“合成数据越多不一定越安全”的复杂现象。
- Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage
-
这篇论文提出认知合谋攻击这一安全问题:多个代理只公开发布真实但经过叙事编排的证据碎片,也能诱导 LLM 受害代理形成错误因果信念,并在下游验证层中继续传播。
- Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
-
提出表征对比评分(RCS)框架,通过分析 LVLM 内部中间层表征的几何结构,用轻量投影和对比评分区分恶意意图与良性分布偏移,在跨攻击类型泛化的严格评估协议下实现 SOTA 越狱检测性能。
- Topic-Based Watermarks for Large Language Models
-
本文提出基于主题的轻量水印方案 TBW,将词表按语义主题聚类为"绿色列表"(而非随机分区),根据输入提示选择语义对齐的主题列表进行 logit 偏置,在保持与无水印文本相当的困惑度的同时,显著提升了对释义和词汇扰动攻击的鲁棒性。
- Instant Personalized Large Language Model Adaptation via Hypernetwork
-
Profile-to-PEFT 用一个 hypernetwork 把用户画像直接映射成个性化 LoRA 参数,避免 OPPU 为每个用户重新训练 adapter,从而实现更快、更可扩展、可面向未见用户泛化的 LLM 个性化。
- PIArena: A Platform for Prompt Injection Evaluation
-
本文提出 PIArena,一个统一且可扩展的提示注入(Prompt Injection)评估平台,集成了多种 SOTA 攻击和防御方法,支持即插即用评估,并设计了基于策略的自适应攻击方法,系统性地揭示了现有防御在泛化性、自适应攻击和任务对齐场景下的关键局限。
👻 幻觉检测 (28)¶
- Hallucination Detection in LLMs with Topological Divergence on Attention Graphs
-
TOHA 把 LLM 的 attention 矩阵当成带权图,用拓扑数据分析里的 Manifold Topology Divergence 度量「response 子图相对 prompt 子图的拓扑新颖度」,并发现存在跨数据集稳定的「幻觉感知头」——只用 10 个这样的头做平均,就能在 RAG 场景下做到 training-free + 比 SelfCheckGPT 快 70× 且 ROC-AUC 显著领先。
- The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination
-
系统性揭示了"推理陷阱"悖论:增强LLM推理能力(无论通过RL、蒸馏还是可切换推理模式)会系统性地放大工具幻觉,且这一效应与推理本身而非RL训练相关联,现有缓解策略(提示工程、DPO)面临不可避免的可靠性-能力权衡。
- Through the Magnifying Glass: Adaptive Perception Magnification for Hallucination-Free VLM Decoding
-
本文提出 Perception Magnifier (PM),一种视觉解码方法,在每个自回归解码步基于多层注意力迭代识别关键视觉区域并自适应放大,通过提升关键区域的有效分辨率来缓解 VLM 的视觉幻觉,同时保持空间结构完整性和推理能力。
- Mechanisms of Prompt-Induced Hallucination in Vision–Language Models
-
在受控的目标计数任务里把"模型听 prompt 不看图"的幻觉行为定位到 LLaVA-OneVision / Qwen-VL / Janus-Pro 早期层 (主要是 L0-1) 的 3-10 个 attention head,对它们做 mean ablation 不需要任何再训练就让 prompt-following 从 42–64% 掉到 <11%,把真实计数恢复率推到 70–78%,并能 zero-shot 迁移到颜色识别任务 (PIH 抑制 40–95%)。
- FaithLens: Detecting and Explaining Faithfulness Hallucination
-
本文提出 FaithLens,一个 8B 参数的忠实性幻觉检测模型,通过高质量数据合成+三维过滤(标签正确性、解释质量、数据多样性)进行冷启动 SFT,再用基于规则的强化学习(预测正确性奖励+解释质量奖励)进一步优化,在 12 个任务上超越 GPT-5.2 和 o3,同时提供高质量的解释性输出。
- HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
-
本文提出 HalluAudio,首个大规模跨领域(语音/环境声/音乐)的音频幻觉检测基准,包含 5000+ 人工验证的 QA 对和系统化的对抗性提示设计,通过多维指标(准确率/幻觉率/Yes-No偏差/拒绝率/错误类型)评估主流 LALM,揭示了当前模型在声学锚定、时间推理和音乐属性理解方面的显著缺陷。
- Stable-RAG: Mitigating Retrieval-Permutation-Induced Hallucinations in Retrieval-Augmented Generation
-
揭示 RAG 系统对检索文档排列顺序高度敏感的问题,提出 Stable-RAG:通过对文档排列产生的隐状态做谱聚类识别主导推理模式,再用 DPO 对齐将幻觉输出引导向正确答案,在三个 QA 数据集上实现准确率和推理一致性的双重提升。
- FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification
-
FinGround 是一个面向金融文档问答的三阶段 "verify-then-ground" pipeline:(1) finance-aware 混合检索;(2) 把答案拆成原子 claim 并按"数值/时间/实体属性/比较/监管/计算"六类 taxonomy 用 type-routed 策略验证 (其中 computational claim 用公式重构 + 算术再校验);(3) 对未支持的 claim 进行 grounded 重写并加段/单元格级引用——把 GPT-4o 蒸馏到 8B 检测器实现 91.4% F1、18× 加速,端到端将 hallucination rate 相比 GPT-4o+CoT 降 78%。
- Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
-
本文提出 MPD 框架,通过语义感知正交子空间投影分离幻觉成分,并仅选择性更新与幻觉最相关的少量参数,在减少 23.4% 幻觉的同时保持 97.4% 的通用生成能力,不引入额外推理开销。
- Two Pathways to Truthfulness: On the Intrinsic Encoding of LLM Hallucinations
-
本文发现 LLM 内部编码真实性信号存在两条不同的信息通路:Question-Anchored(依赖问题到回答的信息流)和 Answer-Anchored(从生成答案本身提取自包含证据),两者与知识边界紧密关联,并据此提出 Mixture-of-Probes 和 Pathway Reweighting 两种通路感知的幻觉检测方法,AUC 提升达 10%。
📊 LLM 评测 (96)¶
- Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models
-
提出 OlymMATH,首个统一自然语言评估和形式化定理证明的奥赛级数学基准,包含350题双语(中英文)题目,涵盖OlymMATH-EASY/HARD(200题数值答案)和OlymMATH-LEAN(150题Lean 4形式化),揭示最强模型在HARD子集上仅58.4%准确率。
- ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
-
提出 ResearchBench,首个大规模评估LLM科学发现能力的基准,基于"灵感驱动假设生成"的理论分解,覆盖12个学科1386篇论文,将科学发现分解为灵感检索、假设组合、假设排序三个充分子任务,发现LLM在跨学科灵感检索上表现出色。
- Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models
-
本文系统综述了 134 篇关于 LLM 证据基础文本生成的论文,首次提出统一分类学(归因方式 × 引用特征 × 任务),分析了 300 个评估指标并归纳为七大维度六种方法,为该碎片化领域提供了全景式参考框架。
- EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
-
提出 EngiBench——首个面向真实工程问题求解的多层级 LLM 评测基准,把任务按三档难度 (基础知识检索 → 上下文推理 → 开放式建模) 组织、配以三种受控变体 (扰动 / 知识增强 / 数学抽象),覆盖三大工程子领域 1,760 题,发现即使 GPT-4.1 / Claude 3.7 Sonnet 在 Level 3 开放式工程任务上也明显落后于人类专家。
- WildIFEval: Instruction Following in the Wild
-
WildIFEval 是一个从真实用户对话里抽取、规模达 7,523 个任务 / 24,731 条约束的单轮约束生成基准:它把每个用户指令自动分解成细粒度约束、归入 8 大类别,并用 LLM 评委做"严格/柔性"双评分,从而首次大规模刻画真实指令里约束的分布与共现,并揭示出"约束数一多、模型整体成功率骤降但单约束成功率几乎不变"的容量瓶颈。
- Can We Predict Before Executing Machine Learning Agents?
-
本文证明 LLM 可作为隐式 "world model",仅凭 task 描述 + verified data report + 两份代码,就能预测 ML 解的优劣(DeepSeek-V3.2-Thinking 61.5% 准确率);据此构造 ForeAgent,把 AIDE 的 Generate-Execute-Feedback 循环改成 Predict-then-Verify 循环,在 MLE-Bench 上获得 6× 加速 + 3.2× 搜索空间 + +6% Beat Ratio。
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
-
本文提出 Finch(FinWorkBench),一个从真实企业环境(Enron 数据集等)构建的金融会计工作流基准,包含 172 个复合工作流和 1,710 个电子表格(2700 万单元格),即使最强的 GPT 5.1 Pro 花费平均 16.8 分钟也仅通过 38.4% 的工作流,揭示了前沿 AI Agent 在真实企业场景中的严重不足。
- NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment
-
NovBench 把“论文引言中的新颖性主张”和“审稿人对新颖性的文字评价”配对成 1,684 条基准样本,并用相关性、正确性、覆盖度、清晰度四个维度系统揭示:当前通用 LLM 和审稿专用 LLM 都能写出流畅评价,但仍难以真正理解和完整判断学术新颖性。
- arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
-
提出 arXiv2Table 基准(1,957 张表、7,158 篇论文),通过引入干扰论文、模式无关的用户需求和基于 QA 的无标注评估框架,实现更真实的 LLM 文献综述表格生成评估,并提出迭代批处理生成方法。
- BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
-
作者搭了一个"坏科学家" pipeline:让一个不做任何真实验的生成 agent 用五种"表演式造假"策略写出看似严谨实则站不住的论文,再喂给由 o3 / o4-mini / GPT-4.1 组成的多模型评审 agent,结果造假论文的接收率最高冲到 82%,而且评审常常一边在评语里点出诚信问题、一边照样打出接收分(concern-acceptance conflict),现有缓解手段几乎只比随机猜强一点。
⚡ LLM 效率 (23)¶
- Saber: Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for DLMs
-
本文提出 Saber,一个面向扩散语言模型(DLM)的免训练采样算法,通过自适应加速(根据已建立的上下文动态调整并行解码量)和回溯增强重遮蔽(撤销被新上下文证伪的 token)两种策略,在代码生成上平均提升 Pass@1 1.9% 的同时实现 251.4% 的推理加速。
- CreditDecoding: Accelerating Parallel Decoding in Diffusion Large Language Models with Trace Credit
-
本文提出 CreditDecoding,一种无需训练的并行解码加速方法,通过累积 token 级历史证据(轨迹信用)来增强正确但置信度不足的 token,在 LLaDA-8B-Instruct 上实现最高 5.48 倍加速且准确率提升 0.48。
- Native Hybrid Attention for Efficient Sequence Modeling
-
本文提出 Native Hybrid Attention (NHA),将线性 RNN 的长期记忆槽与滑动窗口的短期精确 token 拼接后通过单次 softmax 注意力统一处理,实现层内和层间混合的原生统一——无需额外融合参数即可动态分配长短期注意力权重,在 recall 密集和常识推理任务上超越 Transformer 和其他混合基线。
- Lizard: An Efficient Linearization Framework for Large Language Models
-
Lizard 用一个"Gated Linear Attention(全局压缩)+ Anchor Window Attention(局部精度)+ 可学习 gate 替代 RoPE"的混合 subquadratic 注意力替换预训练 Transformer 的 softmax attention,只用 0.04B token 蒸馏就能在 5-shot MMLU 上把现有 linearization 方法甩开 9.4–24.5 分,并配套一个 tensor-core 友好的训练算法把吞吐量提升 32%。
- CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling
-
CoMeT 给已有 LLM 加一个"全局记忆 + FIFO 临时记忆"的双记忆插件,分块处理输入实现常数显存、线性时间复杂度,仅在 32k 上下文上微调就能在 1M token 内任意位置精确找回密码,并提出层级流水线并行让 16×80GB GPU 就能微调 128k 上下文。
- Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios
-
提出多层级任务画像引导的数据合成框架解决 LLM 路由的冷启动问题,并设计 TRouter——一种将任务类型作为隐变量的路由方法,通过变分推断建模查询-成本-性能关系,在冷启动和域内设置下均实现有效路由。
- 专业化的幻觉:揭示混合专家模型中的"常设委员会"
-
通过引入 CommitteeAudit 框架,作者发现 MoE 模型中存在一个"常设委员会"——一个紧凑的、持久的专家组合,在不同领域始终被激活并占据大部分路由权重,这与广泛假设的领域特定专业化形成鲜明对比,揭示了稀疏计算内在的集中化结构。
- Alloc-MoE: Budget-Aware Expert Activation Allocation for Efficient Mixture-of-Experts Inference
-
把 MoE 推理的"激活专家个数"抽象成全局预算 \(B\),先用动态规划在层间做最优 Top-K 分配(Alloc-L),再用全局 Top-(K·T) 选择在 token 间重分配(Alloc-T),在 DeepSeek-V2-Lite 上把激活预算砍掉一半还能保持精度,prefill 加速 1.15×、decode 加速 1.34×。
- Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
-
提出 PTE(Prefill Token Equivalents),一个基于硬件感知的工具集成推理效率度量指标,统一了内部推理和外部工具使用的成本,并通过大规模实验揭示了四种 TIR 低效模式:确认性工具使用、工具混合、缺乏工具先验和工具格式崩溃。
- 阈值差分注意力:无 Sink、超稀疏且非分散的长上下文注意力
-
TDA 通过结合长度自适应阈值和差分抑制视图,实现无注意力 Sink、99% 精确稀疏、且性能竞争力的长上下文 Transformer 注意力。
📚 预训练 (12)¶
- FOREVER: Forgetting Curve-Inspired Memory Replay for Language Model Continual Learning
-
作者把 Ebbinghaus 遗忘曲线的"间隔回放"思路从"训练步数"重新对齐到"模型时间" (parameter update norm \(\Delta_t = \|\Theta_t - \Theta_{t-1}\|_2\) 累积)——既用累积模型时间 \(\tau_t\) 决定何时回放,又用最近更新强度 \(\mu_t\) 与基线 \(\mu_0\) 的不稳定比 \(r_t\) 自适应控制如何回放 (regularization 强度);在 3 个 CL 基准、4 种 backbone (0.6B–13B) 上一致超越 SOTA,OP +1.2%、BWT +0.9% vs 最强 baseline VBM。
- Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
-
本文提出 Data Mixing Agent,首个基于模型的端到端领域重加权框架,通过在大量数据混合轨迹上使用 CQL 强化学习训练小型代理来学习可泛化的数据混合启发式,在数学推理持续预训练中平衡源领域和目标领域性能,且可泛化到未见过的源领域、目标模型和领域空间。
- Toward Consistent World Models with Multi-Token Prediction and Latent Semantic Enhancement
-
从理论上分析了多 Token 预测(MTP)如何通过梯度耦合机制诱导表示收缩性从而促进信念状态的涌现,但同时揭示了 MTP 的"结构性幻觉"问题(隐空间中的非法捷径),并提出 LSE-MTP 框架通过隐一致性损失和语义锚定损失将预测锚定到真实隐状态轨迹,在合成图和真实曼哈顿出租车导航上显著改善路径合法性和鲁棒性。
- On the Proper Treatment of Units in Surprisal Theory
-
这篇论文指出 surprisal theory 中“下一个单位”的单位选择一直被预训练语言模型 tokenizer 悄悄决定,因而提出一个把模型 token、语言学单位和实验 ROI 明确分离的有限状态转导框架,并在 MECO 眼动数据上验证不同单位库存会改变 surprisal 对阅读时间的预测问题本身。
- Compact Example-Based Explanations for Language Models
-
本文提出选择相关性分数(Selection Relevance Score),一种无需重训练的指标来评估训练样本子集作为示例解释的质量,并证明常见的"选最高影响力"策略常不如随机选择,进而提出平衡影响力与代表性的新策略。
- Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective
-
作者用概率层级化上下文无关文法 (HPCFG) 构造一组"无污染、有边界、可精确采样"的形式语言作为受控测试床,并提出"判别式 AUC 测试"作为统一指标,在 18 个 LLM、6 个家族、6 种语言上系统比较 FT 与 ICL:FT 在 in-distribution 上稳定胜出,但在 out-of-distribution 上两者打平,ICL 的归纳偏置与 FT 相近但对 token 敏感得多。
- Is a Document Educational or Just Wikipedia-Style? -- Pitfalls of Classifier-Based Quality Filtering
-
这篇论文发现Classifier-based Quality Filtering会把“Wikipedia式写法”误当成“更有教育价值”,简单改写就能让低质量网页越过预训练数据过滤阈值,FineWeb-Edu约7%的样本会因此翻转过滤决策。
- KoCo: Conditioning Language Model Pre-training on Knowledge Coordinates
-
提出知识坐标条件化预训练(KoCo),将每个文档映射为三维语义坐标(来源、内容、稳定性),作为文本前缀注入预训练,使模型获得显式的上下文感知能力,在 10 个下游任务上提升性能、加速收敛约 30%,并有效缓解幻觉。
- SAGE: Sign-Adaptive Gradient for Memory-Efficient LLM Optimization
-
本文提出 SAGE 优化器,通过 Lion 风格的符号更新方向和一个 \(O(d)\) 内存开销的自适应阻尼缩放因子,解决了轻量级优化器在嵌入层上失败的"嵌入层困境",在 Llama 模型(最大 1.3B)上以显著更低的优化器内存达到新的 SOTA 困惑度。
- Demystifying Data Organization for Enhanced LLM Training
-
这篇论文系统研究 LLM 训练中“样本出现顺序”的影响,复用已有样本级质量/难度分数,提出边界强化、循环复习、连续课程和局部多样性四条数据组织原则,并用 STR 与 SAW 在预训练和 SFT 中稳定提升性能。
✏️ 知识编辑 (10)¶
- EvoEdit: Evolving Null-space Alignment for Robust and Efficient Knowledge Editing
-
提出 EvoEdit,通过动态演化零空间投影器实现大规模序列知识编辑,在保持原有知识的同时高效注入新知识,在 10K 编辑量级下仍保持 SOTA 性能,且比 AlphaEdit 快 3.5 倍。
- One Mask to Rule Them All: On Hidden Facts after Editing and How to Find Them
-
这篇论文发现 ROME / MEMIT 并没有真正覆盖旧知识,而是通过共享的过度注意力机制压制旧知识;一个稀疏二值 mask 就能反转多数编辑,并把新编辑成功率从 98% 降到 38%。
- Spectral Characterization and Mitigation of Sequential Knowledge Editing Collapse
-
论文从 SVD 谱结构解释顺序知识编辑为何会让 LLM 一般能力崩溃,并提出 REVIVE,在原始权重的奇异向量基中滤除会干扰 dominant singular subspace 的更新分量,使 MEMIT、RECT、AlphaEdit 等编辑器在 10,000 到 20,000 次连续编辑下同时保持编辑成功率和通用能力。
- FABLE: Fine-grained Fact Anchoring for Unstructured Model Editing
-
本文发现现有非结构化模型编辑方法虽能整体性回忆编辑文本但无法进行细粒度事实访问,提出FABLE框架通过两阶段层次化策略将细粒度事实锚定到浅层、整体性叙事整合到深层,并构建UnFine诊断基准进行系统评估。
- Aligning Language Models with Real-time Knowledge Editing
-
引入CRAFT(持续更新的中文金融知识编辑数据集)和KEDAS(基于多样化编辑增强和自适应推理的知识编辑对齐范式),解决现有知识编辑方法在实时场景中成功率-局部性-可迁移性难以兼顾的问题。
- Can Factual Opinions Be Edited (Manipulated) in Large Language Models?
-
本文指出现有知识编辑技术不仅能改原子事实、还能被用来篡改"公众人物的记录立场"(factual opinion),为此构建了带证据的 FOE 基准,并发现现有方法只能做到"表面改观点、证据却前后矛盾",进而提出一个两阶段的 Self-Generated Evidence-Aligned 方法,让编辑后的模型在不依赖显式指令的情况下也能自圆其说地给出与篡改观点一致的证据。
- CLaRE-ty Amid Chaos: Quantifying Representational Entanglement to Predict Ripple Effects in LLM Editing
-
CLARE 提出了一种轻量级的表示层面方法,通过单个中间层的前向激活量化事实间的纠缠程度,用于预测模型编辑的连锁效应,相比梯度方法平均提升 62.2% Spearman 相关性,同时快 2.74 倍、内存减少 2.85 倍。
- HiEdit: Lifelong Model Editing with Hierarchical Reinforcement Learning
-
HiEdit 用分层强化学习把"终身模型编辑"拆成 high-level 选层 + low-level 算梯度更新两个子任务,让 hypernetwork 按知识自适应地只动一半的层,把强基线 RLEdit 平均再提 8.48%。
- Representation Interventions Enable Lifelong Knowledge Memory Control in LLMs
-
这篇论文提出 RILKE,把终身知识编辑从“改模型权重”转成“在隐藏表示空间施加低秩干预”,通过鲁棒训练、查询自适应路由和共享子空间模块,在 1,000 次非结构化知识编辑后仍保持接近满分的编辑成功率和较好的泛化能力,同时显著降低存储开销。
- The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models
-
提出 SA-MCQ 诊断框架揭示知识编辑中的"表面合规"现象——编辑器在标准基准上达到高分但并未真正覆写内部信念,模型在判别式自评中会回退到原始参数记忆,递归编辑还会累积表征残留导致认知不稳定。
💬 LLM 其他 (61)¶
- A Study of LLMs' Preferences for Libraries and Programming Languages
-
首次系统研究8个LLM在代码生成中对库和编程语言的偏好行为,发现LLM严重偏好NumPy等流行库(45%的使用不必要)和Python语言(58%的高性能任务仍选Python),且自然语言推荐与实际代码选择不一致。
- Confidence Estimation for LLMs in Multi-turn Interactions
-
首次系统研究多轮对话场景下的 LLM 置信度估计,提出两个核心准则(per-turn 校准 + 信息增加时单调性)、对应的 InfoECE 指标和 Kendall's \(\tau\) 评估、Hinter-Guesser 数据集构造范式,并提出新颖的 P(SUFFICIENT) logit 探针——结果发现现有方法(verbalized / SC / P(TRUE))在多轮场景中校准和单调性都很差,而 P(SUFFICIENT) 在 GUESS 上 InfoECE 降到 5.27(vs P(TRUE) 79.97)、\(\tau\) 达 81.51,但任务远未解决。
- 当 TableQA 遇到噪声:复杂问题与大表的双重去噪框架
-
通过分解问题中的语义单元并构建证据树进行透明化表格修剪,EnoTab 框架在处理复杂问题和超大表格时实现显著性能提升,通过双重去噪机制有效缓解噪声数据对推理的负面影响。
- One Persona, Many Cues, Different Results: How Sociodemographic Cues Impact LLM Personalization
-
本文系统比较了 6 种常用的人物画像提示方式(姓名/显式提及/对话历史各两种变体)在 7 个 LLM 和 4 个任务上的效果,发现虽然平均响应跨提示方式高度相关,但不同提示方式产生的人物画像间差异显著不同,过于显式的提示导致更强的个性化偏差,警示不应基于单一提示方式得出偏差结论。
- Generative Interfaces for Language Models
-
本文提出 Generative Interfaces (GenUI),让 LLM 不再用单一聊天框回复用户,而是基于"交互流图 + 有限状态机"的结构化中间表示和"自适应奖励驱动的迭代精化",在线生成一个为查询量身定制的可交互 Web 界面,在 100 条 UIX prompt 上相比 Claude 3.7 聊天 UI 取得 84% 的总体偏好胜率。
- MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models
-
提出 MulDimIF 多维约束框架,从约束模式(3种)、约束类别(4类13子类)和约束难度(4级)三个维度系统评估 LLM 的指令遵循能力,并通过 GRPO 训练显著提升模型性能,发现改进主要源自注意力模块的参数更新。
- Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
-
作者系统综述了 LLM 时代 AI 辅助 peer review 全流程的方法:把"review 生成"分为 fine-tuning / agent / RL / 生成增强 四大范式,把"after-review"分为 rebuttal / meta-review / paper revision 三类,再给出"human / reference-based / LLM-based / aspect-oriented"四象限评测分类法,最后从 novelty、自动评测、跨域、多模态、伦理 6 个方向讨论未来。
- Automatic Combination of Sample Selection Strategies for Few-Shot Learning
-
本文提出 ACSESS 方法,通过前向选择、后向选择和 Datamodels 三种机制自动识别互补的样本选择策略并加权组合,在 23 种策略、5 个 ICL 模型和 3 种梯度少样本学习方法、6 个文本和 8 个图像数据集上验证了组合策略一致优于单一策略和 ICL 专用基线。
- Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics
-
Min-k Sampling 通过分析排序 logit 分布的局部结构来检测"语义悬崖"(高置信候选与低质量尾部噪声的分界点),实现了严格的温度不变性截断,在极端温度下仍保持稳健的推理和创意写作质量。
- Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection
-
本文提出 FinFRE-RAG,一种两阶段框架,通过重要性引导的特征降维将高维表格交易数据序列化为自然语言,并结合标签感知的检索增强上下文学习,使开源 LLM 在金融欺诈检测上的 F1/MCC 大幅提升,缩小了与专用表格分类器的性能差距。
📖 NLP 理解 (34)¶
- It's High Time: A Survey of Temporal Question Answering
-
本文提供了时序问答(TQA)的全面综述,提出了基于语料时间性、问题时间性和模型时间能力三个维度的统一分析框架,系统梳理了从规则管道到 Transformer/LLM 时代的 TQA 方法演进、基准数据集和评估策略,并识别了未来挑战。
- A Computational Method for Measuring "Open Codes" in Qualitative Analysis
-
提出一种基于理论的计算方法,通过LLM增强的代码合并算法和四个无需ground truth的指标(Coverage, Overlap, Novelty, Divergence),系统评估人类和AI在归纳定性编码中的表现。
- Agree, Disagree, Explain: Decomposing Human Label Variation in NLI through the Lens of Explanations
-
将LiTEx推理分类法从"标签一致下的解释变异"扩展到"标签不一致"场景,发现标注者可能标签不同但推理类似,推理类别的一致性比标签一致性更好地反映解释的语义相似度。
- Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
-
用修辞结构理论(RST)解析长文档的篇章结构,构建一棵句子级层级树并对中间节点做 LLM 摘要增强,最后在树上做结构感知的多粒度检索,使长文档 QA 在 QASPER / QuALITY / NarrativeQA / MultiFieldQA-zh 四个 benchmark 一致超越固定切块和 RAPTOR 语义聚类。
- MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training
-
MTSQL-R1把多轮 Text-to-SQL 从“一次性翻译”改造成可与数据库和对话记忆交互的长程智能体训练问题,通过自教式 warm-start SFT 与多层级 GRPO 奖励,让小规模 Qwen3 模型在 CoSQL 和 SParC 上超过强闭源提示基线与短程 SFT/RL 基线。
- Table Question Answering in the Era of Large Language Models: A Comprehensive Survey
-
全面综述了 LLM 时代表格问答(TQA)研究,从五个维度(表格格式、问题复杂度、答案格式、模态、领域)系统化分类任务设置,按核心挑战(表格理解、复杂查询、大输入、数据异构、知识集成)组织建模方法,覆盖 277 篇论文,并前瞻性讨论了强化学习、可解释性等新兴方向。
- Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers
-
这篇论文系统比较 12 个推理 LLM 在完整多选题和只看选项的多选题上的表现,发现测试时推理确实会让模型在 choices-only 场景中高于随机,但推理轨迹显示其中不全是浅层作弊,也包含推断缺失问题、排除错误选项和调用事实知识等更像“策略性应试”的行为。
- ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering
-
ASTRA 把复杂表格自适应重构为语义树,再用文本树导航和符号代码执行双模式推理回答问题,在 AIT-QA、SSTQA 和 HiTab 上分别达到 91.6%、81.9% 和 90.1% 准确率,超过强 LLM 和已有表格结构化方法。
- Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?
-
这篇论文构建 ReCo 阅读理解认知复杂度数据集,并系统评估 8 个 LLM 是否能自动判断题目所需的证据范围和表述转换层级,结果显示强模型能接近但仍明显低于专家,尤其不擅长识别完整证据集合和细粒度词序转换。
- Lost in the Prompt Order: Revealing the Limitations of Causal Attention in Language Models
-
本文深入研究了大语言模型在多选题问答中对提示组件顺序的敏感性,通过系统性实验排除了训练偏差和记忆衰退假说,揭示了因果注意力掩码是导致 QOC(问题-选项-上下文)顺序性能大幅下降的根本机制。
✍️ 文本生成 (17)¶
- Frankentext: Stitching Random Text Fragments into Long-Form Narratives
-
提出Frankentext范式,让LLM在极端约束下(90%文本逐字复制自人类写作)拼接随机人类文本片段为连贯长篇叙事,揭示现有AI文本检测器在混合作者场景下的严重失败(72%的Frankentext被误判为人类写作)。
- ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline
-
本文提出 ConlangCrafter,一个基于 LLM 的多跳管道,将构造语言(conlang)设计分解为音系、语法、词汇三个模块化阶段,通过随机性注入保证类型学多样性、通过自精炼循环保证内部一致性,并提出了一个包含类型学多样性分析和翻译一致性评估的自动评估框架。
- XtraGPT: Context-Aware and Controllable Academic Paper Revision via Human-AI Collaboration
-
本文提出 XtraGPT——首个面向学术论文修改的开源 LLM 套件(1.5B-14B),通过在 7,000 篇顶会论文和 140,000 个标准引导的指令-修改对上微调,实现上下文感知的段落级可控修改,7B 版本匹配 GPT-4o-mini,14B 版本超越 GPT-4o-mini,人类评估显示修改后论文预测评分平均提升 0.65 分。
- In-depth Research Impact Summarization through Fine-Grained Temporal Citation Analysis
-
这篇论文提出“科研影响力摘要”任务:先从论文的引文上下文中识别真正揭示影响的细粒度意图,再生成随时间演化的影响力叙事,比单纯引用数更能说明一篇论文如何被后续工作采用、批评和改造。
- Adaptive Planning for Multi-Attribute Controllable Summarization with Monte Carlo Tree Search
-
本文提出 PACO,把"多属性可控摘要"重新表述为一个寻找"属性控制顺序"的规划问题,并用一个定制的 Monte Carlo Tree Search(节点是完整摘要、动作是单属性调整)在 prompt 阶段就找到最优调整路径,无需任何属性专用训练,用 Llama-3.2-1B 即可达到 Llama-3.3-70B baseline 的可控性,70B+PACO 全面超越所有现有方法。
- Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style
-
作者设计一项 81 人预注册在线研究,让被试用 GPT-o4-mini 起草+人工 post-edit 重写婚礼誓词、道歉信等"在意个人风格"的文本,发现 post-edit 确实能显著拉近被试自身风格、远离 LLM 风格,但被编辑后的文本仍系统性地比独立写作更"AI 味"——而被试自己却感知不到这种残留风格痕迹。
- Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety
-
作者用 UFLI K–2 英语阅读课程对应的 2,580 篇 GPT-4o / Llama-3.3-70B 生成故事,对三个 8B 模型(Llama 3 / Granite 3.3 / Apertus)做 4 种 SFT 设计(baseline / Good Stories / Rewarded SFT / 模拟儿童读音错误),证明 小模型 + 合适 SFT 策略 可在 Spache 可读性、句法复杂度、毒性等 K-2 关键指标上超过 zero-shot GPT-4o 与 Llama-3.3-70B,其中 Rewarded SFT 最稳定、几乎无幻觉。
- EDUMATH: Generating Standards-aligned Educational Math Word Problems
-
作者把"按 K-12 数学课程标准生成应用题(MWP)"任务系统化,搜集了 11,000+ 由真实美国教师标注的 MWP 训练数据 STEM,用 SFT + KTO + ModernBERT 过滤训出 EDUMATH-12B/30B 两个开源 SOTA 生成器,并在 3-5 年级真实学生身上做了第一个 RCT,发现学生在 LLM 题与人写题上正确率相当但几乎一致偏好定制 LLM 题。
- FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
-
本文提出 FACTS(Fast, Accurate, and Privacy-Compliant Table Summarization),通过三阶段 Agentic 工作流自动生成可复用的离线模板(SQL 查询 + Jinja2 模板),实现快速、准确、隐私合规的查询聚焦表格摘要,在 FeTaQA、QTSumm 和 QFMTS 三个基准上全面超越基线。
- Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models
-
论文在英日双语口语对话语料上用 MASK / NTP / TTP 三种微调任务训练 BERT / GPT-2 / TurnGPT / LLaMA-3 8B / Qwen-3 8B,再用 t-SNE 可视化和 silhouette 聚类量化"哼哈词"(backchannel 如 uh-huh)和"语气词"(filler 如 um)的表征质量;发现微调能让这些被视为"语义漂白"的功能词在嵌入空间里被显著区分开,并让模型在 NLG 生成时自然地说出多种 backchannel/filler,向"像人一样对话的 LM"迈出可量化的第一步。
🗣️ 对话系统 (26)¶
- Simulated Students in Tutoring Dialogues: Substance or Illusion?
-
这篇论文提出了一套面向数学辅导对话的模拟学生评测框架,发现简单 prompting 往往只会生成“看似会答题的学生”,而 SFT 和 DPO 更接近真实学生行为,但在错误复现和个体差异建模上仍然远未解决。
- APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI
-
把对话长期记忆建成"领域无关本体支撑的属性图 + 只追加事件存储 + ReAct 多工具检索代理"三件套——构建时永不覆盖、检索时再做时序冲突解析,在 LOCOMO 拿到 88.88%(比 MIRIX 高 3.5 个点)、LongMemEval 拿到 86.2%(比最强 RAG baseline 高 13.7 个点)。
- Preference Learning Unlocks LLMs' Psycho-Counseling Skills
-
本文构建了面向心理咨询回复质量的 PsyCoPref 偏好数据集,并用奖励模型、DPO 与迭代式偏好学习训练 LLM,使 8B 模型在心理咨询回复上相对 GPT-4o 达到 87.0% 的胜率。
- SPASM: Stable Persona-driven Agent Simulation for Multi-turn Dialogue Generation
-
本文提出 SPASM,一个以稳定性为核心的人设驱动多轮对话模拟框架,通过模块化人设生成、自我中心上下文投影(ECP)和终止检测三个组件,在 LLM-LLM 对话中大幅减少角色漂移和"回声"现象,构建了 45,000 段高质量多轮对话数据。
- Context-Agent: Dynamic Discourse Trees for Non-Linear Dialogue
-
作者提出 Context-Agent,把多轮对话历史建模为"话题树森林"(每棵树代表一个独立话题、每条分支代表一次指令细化/分叉),按导航意图而非语义相似度组织节点,并配套提出 NTM 基准评测非线性长程对话,在多种 LLM 上同时提升任务完成率并降低 token 消耗。
- Author-in-the-Loop Response Generation and Evaluation: Integrating Author Expertise and Intent in Responses to Peer Review
-
本文将学术论文作者回复(rebuttal)生成重新定义为"作者在回路"任务,提出 Re3Align 数据集(3.4K 论文、440K 句级编辑标注、15K 审稿-回复-修改三元组)、REspGen 可控生成框架和 REspEval 20+ 指标评估套件,在 5 个 SOTA LLM 上系统验证了作者输入、可控性和评估引导精修的效果。
- Disambiguation-Centric Finetuning Makes Enterprise Tool-Calling LLMs More Realistic and Less Risky
-
提出 DiaFORGE 框架,通过消歧中心的合成数据生成管线 + 推理链微调 + 动态评估体系,让开源 LLM 在面对近重复企业 API 时的工具调用成功率比 GPT-4o 高 27 个百分点、比 Claude-3.5-Sonnet 高 49 个百分点。
- Metro: Towards Strategy Induction from Expert Dialogue Transcripts for Non-collaborative Dialogues
-
Metro 把专家对话 transcript 自动归纳成一片 "Strategy Forest"——以 K-Means 聚类的对话状态为根节点的树,节点是 LLM 扩展的 micro-principle 动作、分支是按 Wilson 置信下界 + MCTS 风格价值回传打分剪枝后的完整动作轨迹,推理时直接 retrieve 一棵树、并行抽取 short-term(breadth)和 long-term(depth)建议,无需任何训练就在 P4G / CB 两个非合作对话任务上比 PRINCIPLES、PPDPP、GDP-Zero 等基线平均涨点约 10%。
- Reasoning Gets Harder for LLMs Inside A Dialogue
-
这篇论文提出 Boulder 动态基准,证明 LLM 在孤立推理题上表现很好,但同一问题嵌入任务型对话后会显著退化,主要原因来自多轮上下文、对话角色约束和工具调用负担。
- STRIDE-ED: A Strategy-Grounded Stepwise Reasoning Framework for Empathetic Dialogue Systems
-
本文提出 STRIDE-ED 框架,通过构建覆盖正/中/负情绪的全面共情策略体系,设计任务对齐的多阶段认知CoT推理,结合策略感知数据精炼和SFT+PPO两阶段训练,在多个开源LLM上实现共情对话SOTA,情感准确率达57.25%,BLEU-4达4.67。
🌐 多语言/翻译 (63)¶
- Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
-
本文提出 MulTypo——一个基于各语言键盘布局和 10 指打字习惯的多语种 typo 生成算法,并用它系统评测 18 个开源 LLM 在 12 种语言、5 类下游任务上的鲁棒性,证明 typo 对生成与推理任务影响最大、指令微调反而更脆弱、且 typo 影响存在跨语种和跨方向的非对称性。
- Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
-
构建非字面翻译元评估数据集 MENT(7,530 条人工标注),揭示传统指标和 LLM-as-Judge 在非字面翻译评估上的不可靠性,并提出 RATE 智能体评估框架,通过反思核心智能体动态调用子智能体,提升 3.2+ 点人类判断相关性。
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
-
LaoBench 是首个大规模、多维度的老挝语 LLM 评测基准,包含 17000+ 条专家精选样本,覆盖文化-知识应用 / 老挝 K12 课纲 / 老-中-英三语翻译三大维度,并独创"开源 7k + 黑盒 10k + 开放式 500"三段式设计——其中 10k 黑盒子集通过受控服务发分数防污染,主流闭源模型(GPT-5-High、Gemini-2.5-Pro 等)仍落后人类专家 ~10-20 个百分点,老挝语文化推理与翻译保真度依然是远未解决的难题。
- Evaluating the Impact of Verbal Multiword Expressions on Machine Translation
-
本文首次系统评测动词类多词表达式(VMWE:动词成语 VID、动词-小品词 VPC、轻动词构式 LVC)对机器翻译质量的影响,在 8 个 MT 系统 × 7 个语言对 × 两类 QE 模型 + 人工 DA 评分上证明:VMWE 普遍掉点,且掉点幅度与"非组合性"严格正相关(VID > VPC > LVC),即使 GPT-4.1/GPT-5.1 也无法消除这一退化。
- Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI
-
作者组织 19 位母语专家对 9 种语言、9 个领域、11 个 SOTA LLM 共 16 个数据集做了 8.8k 例的人机文本判别,发现专家平均准确率高达 87.6%(远高于"接近随机"的早期结论),并进一步揭示:用显式说明差异的 prompt 改写后机器文本能把检测准确率压到 72.5%,但人在分不清来源时反而倾向选机器文本,挑战了"human-like 等于 liked-by-human"的隐含假设。
- TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
-
这篇论文构建了首个面向香港终审法院判词英中翻译的句级平行数据集 HKCFA Judgement 97-22,并提出模拟专业法律翻译流程的 TransLaw 多智能体系统,在自动指标、人类法律译者评测和成本分析上都显著优于单一翻译 agent。
- Digitizing Nepal's Written Heritage: A Comprehensive HTR Pipeline for Old Nepali Manuscripts
-
首个端到端的古尼泊尔语手写文本识别 (HTR) 完整 pipeline:用 "合成 Devanagari → 印刷 Nagari → 古尼泊尔手稿" 三阶段迁移学习 + 20 种数据增强 + 字节级 BPE + script-aware decoder,把 CER 从 fine-tuned TrOCR baseline 的 9.6% 降到 4.9%,并开源代码、模型与 Streamlit web 应用。
- Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs
-
本文提出 LocQA 基准(12 种语言、49 个地区、2156 个地域相关问答),通过地域模糊问题(如"紧急电话号码是多少?")揭示 LLM 的隐式偏差:跨语言上存在持续的美国中心默认行为(模型回答的 50% 包含美国答案 vs 数据中仅 26%),语言内部存在人口规模驱动的"人口概率引擎"效应,且指令微调加剧了全球偏差。
- LQM: Linguistically Motivated Multidimensional Quality Metrics for Machine Translation
-
提出LQM(Linguistically Motivated Multidimensional Quality Metrics),一个六层语言学驱动的机器翻译错误分类体系(社会语言学→语用学→语义→形态句法→正字法→字形),并在7种阿拉伯方言上构建3850句双向平行语料库,通过专家标注6113个错误跨度揭示现有MT系统在方言和文化感知翻译上的系统性不足。
- Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates
-
提出 Source-Shielded Updates (SSU),一种基于源数据驱动参数重要性评分的列级冻结策略,在仅使用无标签目标语言数据进行持续预训练时,将源语言性能退化从全量微调的 20.3% 降低至 3.4%,同时保持与全量微调相当甚至更优的目标语言性能。
🔍 信息检索/RAG (73)¶
- PL-MTEB: Polish Massive Text Embedding Benchmark
-
PL-MTEB 为波兰语文本嵌入构建了覆盖分类、聚类、句对分类、检索和语义相似度的 30 任务评测集,并系统评测 30 个波兰语和多语言 embedding 模型,显示大模型整体领先但任务类型、训练数据泄漏和模型规模都会显著影响结论。
- ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
-
ReasonEmbed 提出三项技术创新——ReMixer 非平凡合成数据方法(82K 高质量样本)、Redapter 自适应推理强度加权训练和多骨干实现——在 BRIGHT 基准上以 38.1 的 nDCG@10 显著超越所有现有文本嵌入模型约 10 个点。
- HyperMem: Hypergraph Memory for Long-Term Conversations
-
HyperMem 用"超图(hyperedge 连接 ≥3 个节点)"代替传统 RAG 的 pairwise 边,把长期对话记忆组织成"主题 → 情节 → 事实"三层结构,通过粗到细检索 + 超图嵌入传播解决多 episode 跨时间相关性的检索碎片化问题,在 LoCoMo benchmark 上 LLM-as-judge 准确率打到 92.73%(前 SOTA 86.49%)。
- CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation
-
CiteGuard 提出了一个检索增强的智能体框架,通过扩展的检索动作(包括全文搜索和上下文检索)为科学引用归属提供更忠实的基础,在 CiteME 基准上相对基线提升 10 个百分点,达到 68.1% 准确率,接近人类表现(69.2%)。
- End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning
-
本文提出 MHGPO(Multi-Agent Heterogeneous Group Policy Optimization),一种无需 critic 的多智能体 RL 方法,通过异构组相对优势估计和反向奖励传播,在三智能体搜索系统(Rewriter→Reranker→Answerer)中实现端到端优化,捕获隐式跨智能体依赖和跨轨迹关联,在 HotpotQA 等多跳 QA 基准上显著优于 MAPPO 和 GRPO 基线。
- VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG
-
VideoStir 提出了一种结构化且意图感知的长视频 RAG 框架,通过将视频建模为时空图进行多跳 clip 检索 + 训练意图相关性评分器进行帧级筛选,在不依赖辅助文本工具的前提下达到了与 SOTA 长视频 RAG 方法可比的性能。
- Beyond Chunks and Graphs: Retrieval-Augmented Generation through Triplet-Driven Thinking
-
T2RAG 把 RAG 的最小检索单元从"文本块/知识图谱节点"换成原子三元组:离线把语料抽成一堆三元组命题建索引,在线则让 LLM 把问题分解成带
?占位符的可搜索三元组、迭代地从三元组库里检索证据填空,直到所有占位符解完再生成答案——在六个数据集上平均提升最多 11%,同时检索成本降低最多 45%。 - RiTeK: A Dataset for Large Language Models Complex Reasoning over Textual Knowledge Graphs in Medicine
-
RiTeK 构建了两个大规模医学文本知识图谱(TKG)和对应的复杂推理 QA 数据集,涵盖 6 种拓扑结构和丰富的文本描述,评估了 11 种检索方法并揭示了现有 LLM 驱动检索系统在医学 TKG 推理上的严重不足。
- ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering
-
作者把 Search-R1 / R1-Searcher 这类"搜索 + 推理"RL 框架从单轮问答扩展到多轮对话问答,提出 ChatR1:用 PPO 端到端联合优化 reasoning / search / answer,并设计"intent-aware reward"——用历史人工 rewrite 与模型自发 search query 的 token-F1 作为 turn-level dense reward,在 5 个 CQA 数据集上以 3B 主干击败 ChatGPT/Claude,并大幅提升域外迁移能力。
- Quantifying and Improving the Robustness of Retrieval-Augmented Language Models Against Spurious Features in Grounding Data
-
本文提出 SURE 框架,系统评估 RAG 生成端对检索文档中风格、来源、逻辑、格式、元数据等语义无关虚假特征的敏感性,并用 SURE 生成的合成数据通过 SFT/DPO 显著提升 RALM 鲁棒性。
💻 代码智能 (49)¶
- SWE-QA: Can Language Models Answer Repository-level Code Questions?
-
SWE-QA 构建了一个覆盖 15 个真实 Python 仓库、720 个高质量问答对的仓库级代码问答基准,用 GitHub issue 归纳问题类型并用人工校验答案,实验显示单纯 LLM 直接回答很弱,RAG 与 OpenHands/SWE-agent 这类工具化 agent 才能接近真实开发问答需求。
- CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment
-
本文提出 CodeRL+,将执行语义对齐集成到 RLVR 训练管道中,通过让模型推断变量级执行轨迹来弥合代码文本表示与执行语义之间的差距,在代码生成上平均 pass@1 提升 4.6%,在代码推理和测试输出生成基准上分别提升 15.5% 和 4.4%。
- ReCode: Reinforcing Code Generation with Reasoning-Process Rewards
-
ReCode 通过 CRPL 训练能评价代码推理过程质量的奖励模型,并用 CG-GRPO 只在代码执行正确时激活过程奖励,从而在避免 reward hacking 的同时提升代码生成模型的 Pass@1。
- RExBench: Can coding agents autonomously implement AI research extensions?
-
RExBench 把 coding agent 放进真实 AI 论文代码库中,让它们实现专家设计的研究扩展并用受控执行结果评分,发现当前最强 agent 也只有约三分之一成功率,距离自主完成科研扩展仍有明显差距。
- EET: Experience-Driven Early Termination for Cost-Efficient Software Engineering Agents
-
提出 EET——一种基于历史经验驱动的早停方法,在补丁生成和补丁选择阶段识别无效迭代并提前终止,将 SE Agent 总成本降低 19%-55%(平均 32%),同时几乎不损失任务性能(最多 0.2%)。
- SciCoQA: Quality Assurance for Scientific Paper–Code Alignment
-
本文提出 SciCoQA,首个用于检测科学论文与其代码实现之间差异的基准数据集,包含 635 个差异实例(92 个真实 + 543 个合成),评测 22 个 LLM 后发现最强模型仅能检测 46.7% 的真实差异,揭示了自动化科学质量保证中的关键能力缺口。
- SecureVibeBench: Evaluating Secure Coding Capabilities of Code Agents with Realistic Vulnerability Scenarios
-
提出 SecureVibeBench,首个仓库级多文件编辑的安全编码基准,从41个OSS-Fuzz项目中构建105个C/C++安全编码任务,通过级联静态+动态分析精确还原漏洞首次引入的场景,评估发现最佳Agent(SWE-agent + Claude Sonnet 4.5)仅23.8%的代码同时满足功能正确性和安全性。
- CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases
-
提出 CodeWiki,一个基于层次化分解和递归多智能体处理的开源框架,用于自动生成仓库级代码文档,并构建了 CodeWikiBench 基准,在七种编程语言上以 68.79% 的质量分数超越了闭源系统 DeepWiki(64.06%)。
- Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults
-
通过建立大规模 Linux 内核故障定位基准 LinuxFLBench,揭示现有 LLM Agent 在复杂系统中的局限,并提出 LinuxFL+ 框架通过目录感知和潜在原因双维扩展,以低成本显著提升故障定位精度。
- AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor
-
本文构建首个系统性评测「LLM 监控器是否能可靠识别模型不当行为」的基准 AutoMonitor-Bench(3,010 个配对样本,覆盖安全违规 / 谄媚偏见 / 规约博弈三类),在 22 个开闭源监控模型上揭示了漏检率(MR)与误报率(FAR)之间的系统性 trade-off,并通过 153k 样本 SFT 实验证明:在易构造不当行为上微调难以泛化到隐式的规约博弈。
🎨 图像生成 (5)¶
- Multimodal Large Language Models for Multi-Subject In-Context Image Generation
-
这篇论文提出 MUSIC,把多模态大语言模型的视觉推理能力引入多主体 in-context 图像生成,通过自动合成训练数据、视觉 CoT 和语义驱动空间布局规划,显著缓解多个参考主体同时生成时的主体遗漏、身份混淆和语义漂移问题。
- ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis
-
这篇论文提出 ANCHOR 数据集,用 70K+ 来自 5 家新闻媒体的抽象 caption 暴露 T2I 模型在多主体、上下文推理和细粒度 grounding 上的失败,并提出 SAFE 用 LLM 抽取关键主体、在 embedding 层强化主体表示来提升图文一致性。
- From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons
-
本文提出 FLUID,用严格因果注意力和熵感知 Elastic Horizon 把预训练自回归 LLM 高效适配为扩散式并行生成模型,在只用 2.7B 适配 tokens 的情况下取得接近强 AR 模型、优于现有扩散基线的推理和代码生成表现。
- MENTOR: Efficient Autoregressive Image Generation with Balanced Multimodal Control
-
MENTOR 用统一自回归 decoder 和两阶段多模态训练,把参考图像与文本指令对齐到同一生成前缀中,在仅 3M 训练数据和 8 张 A100 约 1.5 天训练预算下,取得了较好的概念保持与 prompt following 平衡。
- Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding
-
这篇论文提出训练无关的 TBDN 框架,用 Hint Instruction 让 LVLM 更关注最终 query,用 Query Contrastive Decoding 抑制先验幻觉,再把更准确的文本描述交给扩散模型,在 CoBSAT 和 T2I Fast Mini-ImageNet 上显著提升文本到图像上下文学习性能。
🎬 视频生成 (4)¶
- Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement
-
提出 VideoRepair,首个免训练、模型无关的文本到视频自校正框架,通过 MLLM 检测细粒度文本-视频不对齐,保留正确区域并选择性修复问题区域,在 EvalCrafter 和 T2V-CompBench 上跨四种 T2V 骨干模型一致提升对齐质量。
- OSCBench: Benchmarking Object State Change in Text-to-Video Generation
-
提出 OSCBench——首个专门评估文生视频模型中物体状态变化(OSC)能力的基准,基于烹饪场景构建 1,120 条提示覆盖常规/新颖/组合三类场景,揭示即使最强 T2V 模型在 OSC 准确率上也仅达 0.786。
- Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity
-
提出 Local Optimization + Representation Continuity (ReCo) 训练策略,通过在局部窗口内优化并约束隐状态的平滑过渡,实现自回归视频生成模型训练速度提升 2 倍且不牺牲生成质量。
- TeachMaster: Generative Teaching via Code
-
TeachMaster 提出 Generative Teaching 范式,用代码作为教育视频的可解释中间表示,让规划、代码生成、配音、调试、同步和布局智能体协作生成完整课程视频,在接近人工质量的同时把 45 小时课程制作成本降到传统方式的约 0.3%。
🧩 多模态 VLM (82)¶
- PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection
-
PRISM 发现 MLLM 视觉特征的非零均值会造成 Global Semantic Drift,从而污染基于相似度的数据选择,并用训练免的均值重中心化和低相关样本筛选,在只保留约 30% 视觉样本的情况下达到 101.7% 相对性能,同时把端到端 GPU 时间降低约 70%。
- AdaTooler-V: Adaptive Tool-Use for Images and Videos
-
本文指出现有"thinking with images" MLLM 普遍存在盲目工具调用问题——所有视觉问题都强行 zoom-in/抽帧,反而 overthinking 降准、增推理成本;为此提出 AdaTooler-V,引入 AT-GRPO 强化学习算法用样本级 Tool Benefit Score 动态调节奖励尺度(工具有效时鼓励、无效时惩罚),让 7B 模型在 V* 高分辨率基准上达到 89.8%,超过 GPT-4o 与 Gemini 1.5 Pro。
- UniversalRAG: 多模态语料库的检索增强生成
-
UniversalRAG 提出一个通用的任意到任意 RAG 框架,通过模态感知路由和粒度感知检索,动态地从异构多模态语料库(文本、图像、视频,不同粒度)中选择最合适的知识源进行检索和生成,避免统一嵌入空间中的模态间隙问题,在 10 个基准上大幅超越单一模态和统一方法。
- A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
-
系统综述基于多模态大语言模型(MLLM)的视觉丰富文档理解(VRDU),从特征表示/融合和训练范式两个维度梳理OCR-based和OCR-free方法,并讨论数据稀缺、多页文档、多语言支持、RAG和智能体等新兴方向。
- From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck
-
本文提出 MM-Mem,一种受模糊痕迹理论启发的金字塔式多模态记忆架构——将记忆分为感知缓冲层(视觉为主)、情景流层(事件级摘要)和符号图式层(知识图谱)三个层级,通过 SIB-GRPO(语义信息瓶颈+强化学习)自底向上压缩冗余、通过熵驱动自顶向下检索,在 4 个长视频 benchmark 上实现 SOTA。
- TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
-
本文提出 TEMA(Text-oriented Entity Mapping Architecture),首个面向多修改文本的组合图像检索(CIR)框架,通过 MMT 解析助手(PA)增强修改实体覆盖、实体映射模块(EM)解决子句-实体对齐问题,并构建了 M-FashionIQ 和 M-CIRR 两个多修改基准数据集,在原始和多修改场景中均取得最优性能。
- Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects
-
本文提出一个系统性的LVLM推理效率分类体系,围绕编码-预填充-解码三阶段推理流水线分析瓶颈,揭示了"视觉token主导"导致的系统性效率屏障,并梳理了从信息密度塑形、长上下文注意力管理到内存带宽突破的完整优化技术图谱。
- Prune-then-Merge: Towards Efficient Multi-Vector Visual Document Retrieval
-
本文提出 Prune-then-Merge,一个两阶段的免训练多向量文档压缩框架——先通过自适应注意力剪枝移除低信息 patch,再对剩余高信号 patch 进行层次聚类合并,在 29 个 VDR 数据集上将近无损压缩范围从 50-60% 扩展到 60-70%,并在 80%+ 高压缩率下显著优于单阶段方法。
- MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems
-
提出 FlowVerse 基准(将数学问题信息分为 DI/EI/RP/OQ 四个组件并构建六个变体版本)和 MathFlow 模块化管线(将感知和推理解耦为独立阶段),训练专门的感知模型 MathFlow-P-7B 从数学图表中提取关键信息,显著提升各类推理模型的视觉数学问题解决能力。
- GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance
-
GuideDog 用「专家规范驱动的银标生成 + 人工核验金标」流水线,从 269 段全球行走视频中构建出 22K 张第一视角行人场景图文对(含 818 题 QA 基准),首次让 MLLM 在 BLV(盲与低视力)导航任务上有了规模化、地理多样、标准化的训练与评测数据。
🧠 VLM Reasoning (32)¶
- Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
-
本文是一篇立场论文(position paper),主张多模态大语言模型(MLLM)可以显著推进跨学科科学推理,提出了四阶段研究路线图(广泛知识识别→类比推理泛化→洞察性推理→创造性假设生成),系统综述了 MLLM 在数学、物理、化学和生物四个领域的应用现状、五大挑战和八个未来方向。
- ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection
-
本文形式化定义了多模态错误检测任务,并构建了 ErrorRadar 基准——包含 2,500 道来自真实学生作答的 K-12 多模态数学题,评估 MLLM 在错误步骤识别(STEP)和错误类型分类(CATE)两个子任务上的能力,发现最强模型 GPT-4o 仍落后人类评估约 10-15%。
- Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
-
本文提出 Laser,通过动态窗口对齐学习(DWAL)在潜在空间中进行视觉推理,使模型在推理过程中维持未来语义的"概率叠加态"而非逐 token 精确预测,实现"先全局后局部"的认知层次,在 6 个基准上以仅 6 个推理 token(减少 97%+)达到潜在推理方法的 SOTA,超越 Monet 平均 5.03%。
- Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
-
提出GPRO框架,通过元推理控制器在每个token生成步动态路由计算到三条路径(快速/感知重检/推理反思),解决LVLM的过度思考问题,同时提升精度和效率。
- What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning
-
本文提出 UILoop(UI-in-the-Loop)范式,将 GUI 推理从传统的"屏幕→动作"重构为"屏幕→UI 元素→动作"的循环过程,通过 UI 元素驱动的强化微调教模型显式地定位、理解和利用关键 UI 元素,在 GUI 推理任务上达到 SOTA 性能。
- MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models
-
本文提出 MMErroR,一个包含 1997 个样本的多模态错误推理基准,每个样本嵌入一个单一推理错误,覆盖 6 大领域和 4 种错误类型,要求 VLM 不仅检测推理链中的错误存在,还要分类错误类型(视觉感知错误/知识应用错误/问题理解错误/推理错误),评测 12 个代表性 VLM 后发现最强模型 Gemini-3-Pro-Preview 也仅达 66.65% 准确率。
- TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos
-
本文提出 TemporalVLM,通过时间感知的片段编码器(重叠滑动 Video Q-Former + 融合模块)提取局部细粒度时间特征,再用 BiLSTM 聚合全局长程依赖,首次在 Video LLM 中引入 LSTM,在密集视频描述、时序定位、高光检测和动作分割四项任务上超越先前方法。
- PROGRESSLM: Towards Progress Reasoning in Vision-Language Models
-
本文把“从单帧观察判断任务完成到哪一步”定义为 VLM 的进度推理能力,构建 Progress-Bench 和 ProgressLM-45K,并证明显式学习“情景检索 + 心理模拟”比单纯提示推理更稳定。
- VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
-
VL-Calibration 将 LVLM 的口头置信度拆成视觉置信度和推理置信度,并用图像扰动 KL、token 熵与 token 级优势重加权训练模型,在 13 个视觉推理基准上同时降低 ECE、提升准确率。
- GeoRC: A Benchmark for Geolocation Reasoning Chains
-
提出 GeoRC,首个由GeoGuessr冠军级专家撰写的地理定位推理链基准(800条推理链,500个场景),评估VLM生成可审计推理链的能力,发现闭源VLM虽能匹敌人类定位准确率但推理链质量仍大幅落后,开源VLM则几乎等同于纯幻觉基线。
⚡ VLM Efficiency (6)¶
- HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding
-
本文提出 HERMES,基于对 MLLM 解码器层级注意力偏好的机制性分析,将 KV 缓存概念化为层级记忆框架(浅层=感觉记忆、中层=工作记忆、深层=长期记忆),实现免训练的高效流式视频理解,在减少 68% 视频 token 的条件下仍保持或提升准确率,TTFT 延迟仅 <30ms,比前 SOTA 快 10 倍。
- HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models
-
本文发现视觉编码器中存在层级注意力模式——中层关注主体对象、深层关注全局信息,据此提出 HiPrune,一种免训练、模型无关的视觉 token 剪枝方法,通过选择三类 token(Anchor/Buffer/Register)保留不同层级的视觉信息,仅用 1/3 token 保持 99.3% 性能,FLOPs 减少 58.7%。
- MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
-
针对 MoE 多模态大模型在专家并行(EP)推理下被"最慢专家"拖累的 straggler 问题,MACS 用视觉 token 的熵当作语义重要性权重来重估专家负载,并按 batch 的实时模态构成动态缩放各专家容量,是一个无需训练的推理框架,在 12 个多模态基准上几乎不掉点(平均保留 vanilla 99.7%)而显著优于按 token 计数的 CAI-MoE。
- From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
-
揭示 MLLM 推理中视觉冗余的两种来源——ViT 密集 tokenization 导致的固有冗余(IVR)和深层语义饱和导致的次生冗余(SSR,且其表现形式因骨干架构不同而异),提出 HalfV 框架分别处理两类冗余,在 Qwen2.5-VL 上实现4.1倍 FLOPs 加速且保留96.8%性能。
- APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention
-
APB-V 用面向序列并行的近似注意力和系统级负载均衡加速长视频 LMM 推理,在保留完整视觉 embedding 的同时,在 64 帧 1440p 设置下相对 FlashAttn、ZigZagRing 和 APB 分别达到 12.72×、1.70× 和 1.18× 加速,且没有显著性能损失。
- ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
-
ReGATE 用冻结的 text-only teacher 估计哪些输出 token 需要视觉信息,再结合 student 的历史学习难度动态选择训练 token,让 MLLM 在不改架构、不加参数的情况下用更少 token 更快训练,并在多个图像和视频 benchmark 上达到或超过标准微调。
🎵 音频/语音 (70)¶
- Full-Duplex-Bench-v2: A Multi-Turn Evaluation Framework for Duplex Dialogue Systems with an Automated Examiner
-
作者提出 Full-Duplex-Bench-v2,让一个 GPT-Realtime 扮演的 Examiner 通过 WebRTC 与被测全双工模型实时对话,按 Daily/Correction/Entity/Safety 四类任务、Fast/Slow 两种节奏对其打 turn-taking、instruction-following、task-specific 三类分,发现 GPT-Realtime、Moshi、Freeze-Omni 都会随对话推进性能持续下滑,且开源模型在 correction 和 entity tracking 上尤其拉胯。
- SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
-
这篇论文把语音质量评估从“给一个分数”扩展为“可解释的语音评审”,构建了含 32,207 条多语音频和 128,754 条标注的 SpeechEval 数据集,并用 CoT 指令微调与 GRPO 训练出 SQ-LLM,在质量评分、成对比较、改进建议和深伪检测四类任务上整体优于现有语音大模型与专家模型。
- MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models
-
提出 MTR-DuplexBench,一个针对全双工语音语言模型(FD-SLM)的多轮综合评估基准,通过创新的轮次分割方法解决了全双工对话中轮次边界模糊和上下文不一致的挑战,涵盖对话特性、对话质量、指令遵循和安全性四个维度,实验揭示了现有 FD-SLM 在多轮交互中性能持续衰退的问题。
- S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models
-
S2S-Arena 提出一个直接在语音模态评测 S2S 模型的 benchmark,用四级副语言交互协议、1,243 条语音样本和 1,001 次 pairwise comparison 揭示当前系统在复杂语气、情绪、说话风格和表达控制上的明显差距。
- ZipVoice-Dialog: Non-Autoregressive Spoken Dialogue Generation with Flow Matching
-
提出 ZipVoice-Dialog,首个基于流匹配的非自回归零样本对话语音生成模型,通过课程学习策略和说话人轮次嵌入两个简单设计,解决了流匹配直接用于对话场景时的语音不可懂和轮次混乱问题,同时发布了首个大规模开源对话语音数据集 OpenDialog(6.8k 小时)。
- ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
-
本文提出 ControlAudio,一个统一的渐进式扩散建模框架,通过三阶段渐进训练(TTA 预训练→时序控制微调→时序+可懂语音联合训练)和渐进引导采样,在单个扩散模型中实现文本引导、时序精确控制和可懂语音生成三种能力,在时序精度和语音清晰度上显著超越现有方法。
- Closing the Modality Reasoning Gap for Speech Large Language Models
-
本文提出 TARS(Trajectory Alignment for Reasoning in Speech),一个基于强化学习的框架,通过表示对齐和行为对齐两种密集奖励信号,将语音条件下的推理轨迹与文本条件下的推理轨迹对齐,在 7B 规模模型中达到 SOTA,MRR(模态恢复率)接近甚至超过 100%。
- StressTest: Can YOUR Speech LM Handle the Stress?
-
提出 StressTest 基准评估语音语言模型(SLMs)对句子重音含义的理解能力,发现现有模型几乎无法基于重音模式推理说话者意图,并通过合成数据管线 Stress-17k 训练的 StresSLM 在重音检测和推理任务上大幅超越前沿模型。
- [b] = [d] − [t] + [p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic
-
系统性地证明自监督语音模型(S3M)的表示空间中存在线性的音韵特征向量,这些向量满足类似 word2vec 的向量算术关系,且其缩放比例与声学测量呈连续相关性。
- MSU-Bench: Musical Score Understanding Benchmark
-
MSU-Bench 是首个针对完整乐谱理解的人工标注基准,包含 150 首作品的 1800 个生成式 QA 对,覆盖四级难度,评估揭示了 LLM/VLM 在乐谱定位和幻觉方面的严重不足,而 ABC 记谱法的文本输入显著缓解了这些问题。
🔎 AIGC 检测 (17)¶
- Authorship Attribution in Multilingual Machine-Generated Texts
-
现有「机器生成文本作者归属(attribution,即判断一段文本出自哪个具体 LLM 还是人类)」研究几乎全是单语种(尤其英语)的,这篇论文首次形式化定义了多语言作者归属(ML-MGT)和跨语言迁移(CL-MGT)两个问题,在 18 种语言 × 8 个生成者(7 个 LLM + 人类)上系统评测了统计法、微调编码器、对比学习、微调解码器等一整套现有方法,发现微调/对比方法能适配多语言(最佳 macro-F1 > 0.9),但跨不同语系/书写体系迁移时严重退化,揭示了真实多语言场景的难度。
- ExaGPT: Example-Based Machine-Generated Text Detection for Human Interpretability
-
ExaGPT 把"判定一段文本是人写还是 LLM 生成"这件事重构成"在数据存储里找哪一侧的相似 span 更多",通过 BERT 嵌入 + k-NN 检索 + 动态规划做最优 span 切分,既给出可解释证据(最相似的检索 span 例子)又在 1% FPR 下把准确率刷到比此前可解释检测器最高高出 +37.0 个点。
- Frame In, Frame Out: Measuring Framing Bias in LLM-Generated News Summaries
-
本文提出 FIFO,用 LLM jury 加专家校准的方式在 XSum 上大规模测量 LLM 新闻摘要是否引入 framing bias,并发现若干高容量模型的框架化表达比例高于人工摘要基线。
- MASH: Evading Black-Box AI-Generated Text Detectors via Style Humanization
-
本文提出 MASH(多阶段风格人性化对齐),通过风格注入 SFT → DPO 对齐 → 推理时精炼三阶段流水线,训练一个仅 0.1B 参数的改写器,在黑盒设置下以 92% 的平均攻击成功率规避 AI 文本检测器,同时保持优秀的语言质量。
- When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection
-
揭示了个性化场景下 MGT 检测器的"特征反转陷阱"——通用域中区分人写文本和机器文本的特征在个性化域中发生反转,导致检测器性能骤降甚至翻转,并提出 StyloCheck 框架通过量化检测器对反转特征的依赖程度来预测跨域性能变化,预测相关性达 0.85 以上。
- AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images
-
AEGIS 是首个面向学术图像伪造取证的综合基准,覆盖 7 大学术图类与 39 子类、4 种伪造策略(整图捏造、参考图改写、局部修复、局部编辑)和 25 个生成模型,提出取证范围判别、文字伪影识别、操作类型分类、篡改像素定位四项任务,对 25 个 MLLM 与 9 个专家模型联评后发现:即使 GPT-5.1 综合分仅 48.80%,专家模型像素 IoU 仅 30.09%,凸显「生成进化快于取证」与「MLLM 推理 vs 专家模型敏感度」的结构性互补。
- Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection
-
提出 RACE(Rhetorical Analysis for Creator-Editor Modeling),利用修辞结构理论(RST)构建逻辑图来建模文本"创作者"的思维架构,同时提取篇章单元级特征捕获"编辑者"的语言风格,实现四类细粒度 LLM 生成文本检测(人写/LLM写/LLM润色人文/人改写LLM文)。
- C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection Derived from Real-World Prompts
-
C-ReD 构建了一个覆盖五类中文写作场景、九个 LLM 生成器和真实使用式 prompt 的中文 AI 生成文本检测基准,并显示检测难度强烈依赖领域、生成器和 prompt,而在 C-ReD 上微调能显著提升对未见模型和外部中文数据的泛化。
- Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences
-
本文引入 Persuaficial——一个覆盖六种语言的高质量 AI 生成说服性文本多语言基准,系统评估了 LLM 生成的说服性文本与人类撰写的说服性文本在自动检测难度上的差异,发现微妙的 AI 说服比人类说服更难检测(F1 下降约 20%),而过度强化的说服反而更容易被发现。
- DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection
-
DetectRL-X 构建了一个 345.6 万样本、多语言、多域、多攻击、多长度和二/三分类并行的 LLM 生成文本检测基准,证明现有检测器在真实多语言和人机协作写作场景下仍存在明显鲁棒性短板。
🤖 机器人/具身智能 (11)¶
- GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
-
GoViG 提出一个只靠第一视角初始与目标观测就能生成导航指令的新任务,并把它拆成"先想象中间画面再写指令"两步,用 Anole-7B 在 token 级 MSE + 标签平滑 CE 双目标下联合训练,配合 one-pass / interleaved 两种多模态推理策略,把 BLEU-4 从基线 0.08 推到 0.32 并在跨域真实视频上保持 0.27。
- Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
-
SkillNav 把视觉语言导航任务拆解成 5 个原子技能(方向调整、垂直移动、停顿、地标识别、区域识别)+ 1 个时序规划技能,每个技能用合成数据微调一个 DUET 子 agent,再用 training-free 的 VLM router 做时序重排 + 子目标定位 + 技能选择,在 GSA-R2R 上取得 SOTA 泛化能力(Test-N-Scene SPL 48% vs. 之前最高 43%)。
- Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
-
Libra-VLA 把机器人动作分解为"离散宏方向(macro-intent)+ 连续微姿态(micro-pose)"的混合动作空间,再用 System 2(VLM + 并行 coarse-action head)低频规划、System 1(diffusion transformer + 独立 SigLIP 编码器)高频精修,通过 intent buffer 实现真正异步执行,在 LIBERO 上拿到 97.2% SoTA、LIBERO-Plus 零样本 79.5%(比之前 OpenVLA-OFT+ 高 10 个点)。
- Limited Linguistic Diversity in Embodied AI Datasets
-
本文对主流 VLA 训练语料(RT-1、BRIDGE、TacoPlay、Language Table、LIBERO)做系统性"语言多样性体检",从词汇/语义/句法三维度量化发现:VLA 数据仅 < 2% 指令唯一、RT-1 整库只有 49 个 unique word、否定/条件句 < 1%,远逊于指令调优语料(OASST2 93%、Alpaca 99.8% 唯一),这种"模板化贫乏"或许正是 VLA 模型对 paraphrase 脆弱、泛化失败的根源。
- Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection
-
这篇论文提出 REFORM,把多模态伪造检测从“直接拟合标签”改成“学习可验证的取证推理过程”,并通过 ROM 推理标注数据集、双解码器和 GRPO 训练,在 ROM、DGM4 与 MMFakeBench 上取得更强的跨域泛化和可解释检测结果。
- VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
-
本文提出 VLN-NF 基准——首个要求 VLN agent 在 3D 部分可观测环境中识别虚假前提指令并输出 NOT-FOUND 的任务,配套提出 REV-SPL 评估指标和 ROAM 两阶段混合框架,ROAM 达到 6.1 REV-SPL,比监督基线提升 45%。
- When Does Language Matter? Multilingual Instructions Reveal Step-wise Language Sensitivity in Vision-Language-Action Models
-
本文把 LIBERO 机器人操作基准翻成十种语言,首次系统揭示 VLA 模型在非英语指令下成功率暴跌 30–50%,并发现"语言影响在执行步上高度不均匀"——只有少数关键步对语言敏感却主导失败,据此提出一种只在这些步上做推理时表征对齐的方法,把多语言成功率大幅拉回。
- GROKE: Vision-Free Navigation Instruction Evaluation via Graph Reasoning on OpenStreetMap
-
GROKE 提出完全不用视觉就评测导航指令好不好——把 OSM 地图序列化成 JSON,让 Gemini-3 Pro 当 follower agent 沿图执行指令,用 Navigation Error / SR / SDTW 反过来当指令质量的 proxy;相比启发式 baseline 在 Map2Seq 上降低 navigation error 68.5%,且 NE 与人类对"指令清晰度"的判断显著相关 (\(r = -0.31, p < 0.01\))。
- ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation
-
提出 ElasticFlow:用平均速度场 (MeanFlow) 取代瞬时速度场学习语言条件机器人动作,配合 "弹性时间区间 \(\Delta t=t-r\)" 显式编码控制粒度,实现 1-NFE 单步推理 (∼71Hz),在 LIBERO-Long、CALVIN ABC-D 等长程任务上超过 OpenVLA 与 \(\pi_0\)。
- Mango: Multi-Agent Web Navigation via Global-View Optimization
-
Mango 在网页导航前先构建网站的全局近似结构,再用 Thompson Sampling 在候选 URL 间动态分配有限导航预算,使 LLM web agent 不必总从首页盲目探索,并在 WebVoyager 和 WebWalkerQA 上显著超过 AgentOccam、WebWalker 等基线。
🎮 强化学习 (46)¶
- RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization
-
RL-PLUS 提出混合策略优化方法,通过多重重要性采样(MIS)解决外部数据分布不匹配问题,以及探索式优势函数(EAF)引导模型学习低概率但正确的推理路径,成功突破 RLVR 导致的能力边界坍塌,在六个数学推理基准上达到 SOTA(平均 53.4),且跨模型一致提升最高达 69.2%。
- AttnPO: Attention-Guided Process Supervision for Efficient Reasoning
-
提出 AttnPO,一个利用模型内在注意力信号进行步级信用分配的低开销过程监督 RL 框架,通过识别 Key-Focus Heads(KFH)区分冗余和关键推理步骤,在大幅缩短推理长度的同时显著提升准确率。
- CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning
-
提出 CE-GPPO 算法,通过 stop-gradient 操作重新引入 PPO 裁剪区间外低概率 token 的梯度信号,实现对策略熵的精细化协调控制,在探索-利用之间取得更好平衡。
- A Goal Without a Plan Is Just a Wish: Efficient and Effective Global Planner Training for Long-Horizon Agent Tasks (EAGLET)
-
EAGLET 把长程 agent 任务拆成「全局 planner + 局部 executor」两个模块,通过「同源共识过滤合成 SFT 冷启动 + 用执行器能力增益作奖励的 GRPO 微调」两步训练出一个即插即用的 planner,三个长程任务上刷新 SOTA 且训练成本仅为 RL baseline 的 1/8。
- Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
-
本文指出 RLVR 中传统的 token 级探索-利用权衡是测量方式的伪象,提出在隐状态语义空间中用 Effective Rank (ER) 和其时间导数 (ERV/ERA) 来解耦探索与利用,并据此设计 VERL 方法实现两者的同步提升,在高考数学等基准上获得高达 21.4% 的提升。
- Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study
-
首次系统研究 LLM 强化学习后训练的缩放行为,在 Qwen2.5 系列(0.5B-72B)上发现性能与训练资源之间遵循幂律关系,且学习效率随模型规模增大呈饱和趋势。
- LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
-
LoVeC 教 LLM 在长文本生成过程中每写完一句就追加一个 0–10 的
<confidence>数字标签,用 GRPO(在线,需 oracle fact-checker)或 DPO(离线偏好对)训练让该标签与 GPT-4o 判定的事实性对齐,单次解码即可输出可校准、可机器解析的置信度,比 SOTA LUQ 在 Brier/ECE/Spearman 上全面更好且推理速度快 20 倍。 - d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models
-
针对扩散语言模型(dLLM)RL 的两大可靠性瓶颈 —— 奖励稀疏 / 概率估计偏差 —— 作者提出 d-TreeRPO:把 rollout 组织成树,用叶子节点的可验证奖励自下而上算出步级 advantage;同时理论证明「模型越自信,单步前向概率估计越准」,并设计时间调度的自蒸馏 loss 在训练后期收紧策略,最终在 LLaDA-8B-Instruct 上 Sudoku +86.2% / Countdown +51.6% / GSM8K +4.5% / Math500 +5.3%。
- KnowRL: Exploring Knowledgeable Reinforcement Learning for Factuality
-
KnowRL 把"原子事实校验"作为过程级奖励直接塞进 GRPO 训练循环,对慢思考模型的 CoT 每一步进行事实判定,同时用"拒答给正奖励"教模型识别自己的知识边界,在 SimpleQA Incorrect Rate 上直降 20.3% 的同时不损失(甚至略升)GPQA / AIME 等推理能力,并展现出英文知识 → 中文 QA 的跨语言迁移。
- NaviMaster: Learning a Unified Policy for GUI and Embodied Navigation Tasks
-
NaviMaster 把 GUI 操作和具身导航都改写成“视觉目标定位 + 动作执行”的统一 MDP,并用混合轨迹上的 GRPO 与距离感知密集奖励训练一个 Qwen2.5-VL-7B 策略,在 OOD GUI、空间可供性预测和 ObjectNav 上都超过单域训练与主流基线。
🎁 推荐系统 (22)¶
- Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
-
本文发布 Amazon Reviews 2023 大规模数据集(570M reviews / 48M items)并基于它构建 BLaIR 基准,覆盖序列推荐 / 协同过滤 / 商品搜索 (短 query + 复杂 query) 三大场景,benchmark 了 11 个顶尖 LLM 作为语义编码器,发现它们在 BLaIR 上的排名与 MTEB 几乎不相关(Spearman -0.476),并指出推荐场景对语义编码器有独特要求。
- From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents
-
本文提出Memora基准和FAMA指标,将长期记忆评估从浅层事实检索扩展到跨越数周至数月的记忆整合与突变处理,揭示现有LLM和记忆agent在处理频繁知识更新时的系统性失败。
- MemRec: Collaborative Memory-Augmented Agentic Recommender System
-
MemRec 用一个轻量级 LLM 专门管理一张动态"协同记忆图"(把多个 user 与 item 的语义记忆通过交互边相连),然后把蒸馏后的"协同记忆面(facets)"喂给重量级推理 LLM 做最终推荐;通过"Curate-then-Synthesize"压噪 + 异步 \(O(1)\) 标签传播更新,在 4 个 benchmark 上 H@1 相对 SOTA i2Agent 提升 +15% 到 +29%,数据稀疏用户上更是相对 Vanilla LLM 提升 +91.4%。
- Mirroring Users: Towards Building Preference-aligned User Simulator with User Feedback in Recommendation
-
作者把推荐系统里的"用户反馈日志"重写成一个 LLM 能理解的"用户记忆 + 曝光列表"统一仿真场景,再用 EKB 消费者决策模型生成显式的 chain-of-thought 决策过程作为"clarification",通过不确定性分解 + 拒绝采样蒸馏出 10K 高质量 SFT/DPO 数据,让 3B 的 Llama 用户模拟器在 8 个领域的真实用户行为预测上超过 GPT-5 和 Gemini-2.5-Flash。
- Culinary Crossroads: A RAG Framework for Enhancing Diversity in Cross-Cultural Recipe Adaptation
-
作者发现标准 RAG 在创意任务上"给了多样上下文也产出不多样",于是设计 plug-and-play 的 CARRIAGE:查询重写 + diversity-aware MMR 重排 + sliding-window 动态上下文 + 对比性上下文注入,把"上下文多样性"真正传导到"输出多样性",在西班牙语跨国菜谱适配上同时改善 lexical/semantic/ingredient diversity 与 CultureScore,对 closed-book LLM 达到 Pareto efficiency。
- IceBreaker for Conversational Agents: Breaking the First-Message Barrier with Personalized Starters
-
本文提出 IceBreaker,通过两步"握手"——共鸣感知兴趣蒸馏捕获触发兴趣 + 交互导向启动语生成配合个性化偏好对齐——解决对话智能体的"首条消息壁垒",在全球最大对话产品之一的 A/B 测试中提升用户活跃天数 +1.84‰ 和点击率 +94.25‰。
- ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning
-
本文提出 ReRec,一个基于强化微调(RFT)的推荐助手框架,通过双图增强的奖励塑形提供细粒度奖励信号、推理感知的优势估计对推理步骤进行差异化监督、以及在线课程调度器动态调整训练难度,使 LLM 能处理复杂的多步推理推荐查询,在 RecBench+ 基准上显著超越现有方法。
- From Past To Path: Masked History Learning for Next-Item Prediction in Generative Recommendation
-
提出掩码历史学习(MHL)训练框架,通过在生成式推荐的自回归训练中加入掩码历史重建辅助任务,结合熵引导的自适应掩码策略和课程学习调度器,使模型从仅预测"下一个是什么"转向理解"为什么形成这条路径",在三个数据集上显著超越SOTA。
- HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation
-
提出 HARPO 框架,将对话推荐重新定义为以推荐质量为优化目标的结构化决策问题,通过层次化偏好学习、基于价值网络的树搜索推理、虚拟工具操作和多智能体精炼四大组件,在 ReDial、INSPIRED 和 MUSE 三个基准上显著超越现有方法。
- What Makes LLMs Effective Sequential Recommenders? A Study on Preference Intensity and Temporal Context
-
本文揭示现有 LLM 推荐系统的二元偏好建模丢失了偏好强度和时间上下文两个关键信息,提出 RecPO 框架通过自适应奖励边际将这两个因素纳入偏好优化,在五个数据集上显著超越 S-DPO 等基线。
🔄 自监督/表示学习 (1)¶
- LLMSurgeon: Diagnosing Data Mixture of Large Language Models
-
LLMSurgeon 把“这个 LLM 到底训练在什么数据上”形式化为 Data Mixture Surgery,并用代理分类器的软混淆矩阵反演生成文本中的领域分布,从而在只访问模型输出的条件下估计预训练数据混合比例。
🔗 因果推理 (7)¶
- Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation
-
本文系统研究了 LLM 在六种语言上的多语言反事实样本生成能力,通过直接生成和翻译两种路径对比,发现翻译路径的标签翻转率更高但需要更多编辑,识别出四类常见错误模式,并验证多语言反事实数据增强优于跨语言增强,尤其对低资源语言更有效。
- Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size
-
本文首次为"上下文夹带效应"(contextual entrainment)建立缩放定律,发现更大的模型在语义上下文中更能抵抗虚假信息(负指数),但在非语义上下文中更容易复制无关 token(正指数),揭示了语义过滤和机械复制两种功能的对立缩放行为。
- ClimateCause: Complex and Implicit Causal Structures in Climate Reports
-
ClimateCause 构建了首个针对气候报告中复杂和隐式因果结构的专家标注数据集(874 条因果关系),支持嵌套因果、多事件拆解、相关性方向和时空语境标注,并提出基于因果图语义复杂度的可读性度量,LLM 基准测试显示因果链推理仍是重要挑战。
- Function Words as Statistical Cues for Language Learning
-
作者一边用 186 种语言的 Universal Dependencies 语料证明"功能词高频 + 句法可预测 + 短语边界对齐"这三条分布性质是跨语种普适的,另一边在英语上构造 7 个反事实变体训练 GPT-2 small,证明 transformer 学习者只有在三条性质同时满足时学得最好,并发现一个 Goldilocks 效应——功能词必须既够高频又够多样才能既可靠又有区分度。
- Evaluating Counterfactual Strategic Reasoning in Large Language Models
-
本文用重复囚徒困境和石头剪刀布的标签扰动、收益扰动与联合反事实版本评测 LLM 的策略适应能力,发现很多模型在熟悉博弈中看似会玩,但在收益结构改变后仍沿用模板化策略。
- iTAG: Inverse Design for Natural Text Generation with Accurate Causal Graph Annotations
-
提出 iTAG 框架,通过逆向设计的三阶段流程(参数化因果图构建→基于 CoT 的概念赋值→结构保持的文本生成)生成同时具有极高因果图标注准确率和文本自然度的数据,可作为真实标注数据的实用替代品进行文本因果发现算法基准测试。
- Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective
-
本文提出 CmIR(因果模态不变表示学习),基于因果推理理论将每种模态显式解纠缠为因果不变表示和环境特定虚假表示,通过不变性约束+互信息约束+重建约束的优雅目标函数确保不变表示具有跨环境的稳定预测关系,在多模态情感/幽默/讽刺检测上取得 SOTA,尤其在 OOD 和噪声场景下表现突出。
🔬 可解释性 (63)¶
- Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs
-
作者构建了首个 Video-LLM 谄媚基准 ViSE (367 视频 / 6,367 多选题 / 7 类谄媚场景),在 9 个 SOTA Video-LLM 上系统揭示"模型为了迎合用户而抛弃视觉证据"的普遍现象,并提出两种 training-free 缓解方法:(i) 关键帧选择降谄媚最高 22.01% (并通过注意力分析证明它消除"首帧偏置"和"中间层不稳定");(ii) representation steering 在最难场景下平均降 35.69%,在 LLaVA-OneVision 上 5 个类别 MSS 降到接近 0。
- Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation
-
通过规则化问题分解方法构建可验证的中间推理链数据集,揭示 CoT 推理链的语义正确性与最终答案准确率不可靠地相关(正确链仅 28% 导致正确答案),且最可解释的推理链并非最提升性能的——冗长的 R1 链性能最优但用户评为最不可解释。
- Curing "Miracle Steps" in LLM Mathematical Reasoning with Rubric Rewards
-
本文发现当前 LLM 数学推理中存在大量"Miracle Steps"——推理链中凭空跳跃到正确答案的现象,并提出 Rubric Reward Model (RRM),一种基于问题特定评分标准的过程奖励函数,在 RL 训练中显著减少 Miracle Steps 71% 并将 AIME2024 的 Verified Pass@1024 从 26.7% 提升至 62.6%。
- The Impact of Off-Policy Training Data on Probe Generalisation
-
这篇论文系统比较 on-policy natural、on-policy incentivised、on-policy prompted 和 off-policy 四类训练数据对 LLM 激活探针泛化的影响,发现文本表面可见行为较稳健,而欺骗、迎合、sandbagging 等“意图型”行为极易受领域偏移影响,并提出用 on-policy incentivised 测试集预判真实监控中的泛化失败。
- Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States
-
这篇论文用 Qwen3-14B 上的探针、残差去混淆、trace-anchor 和 causal steering 实验证明:线性探针看似能 100% 区分演绎、归纳、溯因推理,但实际检测到的是数据源和题目格式,而不是隐藏状态中的推理模式。
- Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
-
论文用少量 prompt 中 SAE 特征的跨层共激活图自动发现 LLM 中表示概念和关系的语义模块,并证明对这些模块进行消融和放大能在最高 98% 的单概念/关系场景、最高 90% 的组合场景中可预测地操控 Gemma 2 2B 的关系推理输出。
- Compositional Steering of Large Language Models with Steering Tokens
-
本文提出组合引导 token,通过自蒸馏将行为指令压缩为输入空间的嵌入向量,并训练专用组合 token
来捕获"组合"的通用概念,在未见过的行为组合、未见过的行为以及未见过的组合数量上均展现强泛化能力。 - Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining
-
用 sparse crosscoder 在同一 LLM 的多个 pretraining checkpoint 间训练一个共享特征字典,并提出 Relative Indirect Effect (RelIE) 度量逐特征的因果重要性如何在 token 数量推移中"涌现/维持/消失",从而首次在 Pythia/OLMo/BLOOM 上观察到 LLM 从"特定子词检测器"逐步内化为"抽象句法/跨语言检测器"的概念级演化轨迹。
- MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models
-
作者提出 MINED——首个多模态时间敏感知识评测基准,包含 2104 条 (subject, hypernym, property, attribute-list) 四元组、6 个维度(Cognition / Awareness / Trustworthiness / Understanding / Reasoning / Robustness)共 11 个子任务,4208 道题,在 15 个 LMM 上跑下来 Gemini-2.5-Pro 拿到最高平均 CEM=63.07 但仍漏掉 ~15% 知识;进一步用 FT-LLM / IKE 等知识编辑方法在 single editing 下能把 LLaVA-v1.5 和 Qwen-VL 的过时知识有效更新,但 lifelong editing 下大幅退化(FT-LLM 平均掉 43.2%)。
- Probing Semantic Alignment, Lexical Invariance, and Syntactic Influence in LLM Metaphor Processing
-
这是一篇诊断性分析论文:作者不比拼性能,而是从语义属性对齐、词法不变性、句法影响三个互补维度探针 LLM 的隐喻处理,发现"在隐喻 benchmark 上的高分"可能来自异质的浅层信号(语义漂移 + 稳定词法锚 + 对句法不规则的启发式敏感)而非稳健的整合式语义理解。
📦 模型压缩 (59)¶
- Stable On-Policy Distillation through Adaptive Target Reformulation
-
本文提出 Veto,一种目标层面的重构方法,通过在 logit 空间构建教师-学生的几何桥接分布来稳定 on-policy 知识蒸馏,单一参数 \(\beta\) 同时在 forward KL 中充当自适应梯度否决器(抑制低置信度 token 的有害梯度)和在 reverse KL 中充当果断性旋钮(平衡奖励驱动和输出多样性),在 GSM8K 上比 SFT 提升 9.2%。
- Enabling Agents to Communicate Entirely in Latent Space
-
本文提出 Interlat,一个让 LLM 智能体完全在潜空间中通信的框架——发送方直接传递最后一层隐状态作为"思维"的表示,接收方通过通信适配器解释这些潜空间消息,并通过潜空间推理进一步压缩到仅 8 个 token 同时保持竞争性能,实现高达 24× 的通信加速。
- Find Your Optimal Teacher: Personalized Data Synthesis via Router-Guided Multi-Teacher Distillation
-
提出 PerSyn(Personalized data Synthesis),通过"先路由再生成"范式让路由器为每个 prompt 分配最优教师模型,综合考虑学生可学习性和教师响应质量,比传统"先生成再选择"范式高效且效果更好,在指令微调和数学推理两个场景中一致超越所有基线。
- FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration
-
本文提出 FastKV,通过将上下文缩减(prefill 阶段的 Token-Selective Propagation)与 KV 缓存压缩(decoding 阶段的层级 KV 保留)解耦,在 LLaMA-3.1-8B-Instruct 上实现 prefill 1.82× 和 decoding 2.87× 加速,同时在 LongBench 上精度下降控制在 1% 以内。
- Not All Directions Matter: Towards Structured and Task-Aware Low-Rank Model Adaptation
-
本文提出 StructLoRA:先用信息瓶颈过滤掉低秩更新里与任务无关的方向,再用训练期图神经网络协调不同层的 LoRA 更新,在语言、视觉和多模态任务上稳定超过 LoRA / AdaLoRA / DoRA / Sensitivity-LoRA,同时保持推理零额外开销。
- Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
-
提出 E-GRM 框架,利用模型并行解码的收敛行为估计不确定性,仅在必要时触发 CoT 推理,并通过混合损失训练的判别式评分器精细评估推理路径质量,在多个奖励模型基准上实现 SOTA 同时降低 62% 推理延迟。
- GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts
-
本文提出 GlimpRouter:在 step 级 LRM 协同推理中,先让小模型只解码每个推理步的"第一个 token",用它的熵 \(\mathbf{H}_{\text{init}}\) 估计该步难度,低则小模型续写、高则切换到大模型;training-free,无需大模型 verifier,在 AIME25 上比独立大模型准确率 +10.7% 同时延迟 −25.9%,且与 token-level Speculative Decoding 正交叠加。
- DeepPrune: Parallel Scaling without Inter-Trace Redundancy
-
本文提出 DeepPrune,通过训练专门的判断模型从部分推理轨迹预测答案等价性,结合在线贪心聚类算法动态剪枝冗余的并行 CoT 路径,在保持竞争准确率(3 个百分点以内)的同时减少 65.73%-88.50% 的 token 消耗。
- The Pitfalls of KV Cache Compression
-
这篇论文指出 KV cache 压缩在多指令提示中会导致选择性遗忘和系统提示泄露,问题来自不同指令被不均匀驱逐以及关键 token 被错误删除,并提出白名单保留和 fair eviction 两种简单改造来显著降低泄露、稳定指令遵循。
- LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization
-
将无标签提示优化形式化为决斗老虎机(dueling bandit)问题,提出 Prompt Duel Optimizer (PDO),通过 Double Thompson Sampling 高效选择信息量最大的提示对进行比较,结合 top-performer 变异策略扩展搜索空间,在 BBH 和 MS MARCO 上以更少的 judge 调用次数找到更强提示。
🕸️ 图学习 (24)¶
- From Nodes to Narratives: Explaining Graph Neural Networks with LLMs and Graph Context
-
本文提出 Gspell,一个轻量级后验解释框架,通过将 GNN 节点嵌入投影到 LLM 嵌入空间并构建混合提示(软提示+文本),使 LLM 能够直接推理 GNN 内部表示并生成自然语言解释和解释子图,在文本属性图(TAG)上实现了忠实性与可解释性的良好平衡。
- MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation
-
MegaRAG 利用 MLLM 在长文档每一页并行抽取实体-关系并合并为多模态知识图谱(MMKG),再用"子图引导"的二轮 refinement 补全跨模态、跨页关系,配合双路检索与两阶段答案生成显著优于 GraphRAG/LightRAG/VisRAG,在 SlideVQA(2k) 上准确率 64.85%(baseline 最高 27.66%)。
- ARK: Answer-Centric Retriever Tuning via KG-augmented Curriculum Learning
-
提出ARK框架,通过三维答案充分性评分(Forward+Backward+Retriever对齐)筛选正样本,利用LLM构建的知识图谱生成渐进难度的困难负样本进行课程对比学习,在10个数据集上平均提升14.5% F1。
- AgentGL: Towards Agentic Graph Learning with LLMs via Reinforcement Learning
-
提出 AgentGL,首个基于强化学习的智能体图学习(AGL)框架,让 LLM 智能体通过图原生搜索工具自主导航文本属性图(TAG),在节点分类和链接预测任务上分别实现最高 17.5% 和 28.4% 的绝对准确率提升。
- LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning
-
LegalGraphRAG 用事实图、 ontology 图和规则图构成层级法律图谱,再用 Researcher-Auditor-Adjudicator 三代理流程完成检索、验证和裁决,在法律判决生成中提升准确性与证据可追溯性。
- Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval
-
本文提出 ARK:一个 training-free 的知识图谱检索 agent,只暴露「全局词法搜索」和「单跳邻居展开」两个最小工具,让 LLM 自主在广度和深度之间切换,无需种子节点或固定跳数;在 STaRK 三图上把 Hit@1 平均推到 59.1%,最高比 training-free baseline 提升 31.4%,并可把策略 label-free 蒸馏进 Qwen3-8B。
- Collaboration of Fusion and Independence: Hypercomplex-driven Robust Multi-Modal Knowledge Graph Completion
-
M-Hyper 把多模态知识图谱实体编码为双四元数(biquaternion)的四个正交基,分别承载结构 / 视觉 / 文本三个独立模态以及一个融合模态,通过 Hamilton 乘积同时实现"模态独立保留"和"成对充分交互",在 DB15K / MKG-W / MKG-Y 三个数据集上以最低显存、最短训练时间打败 18 个 baseline。
- ComplianceNLP: Knowledge-Graph-Augmented RAG for Multi-Framework Regulatory Gap Detection
-
ComplianceNLP 是一个端到端的金融监管合规系统,把 12,847 条 SEC / MiFID II / Basel III 法规构造成知识图谱来增强 RAG 检索,配合 LEGAL-BERT 的多任务义务抽取和门槛打分的差距分析,在 RegObligation / GapBench 上以 87.7 F1 击败 GPT-4o+RAG 3.5 个点,并通过领域知识蒸馏 + Medusa 推测解码实现 \(2.8\times\) 推理加速;4 个月并行运行处理了 9,847 条更新,达到 96.0% 召回率和 3.1× 分析师效率提升。
- TagRAG: Tag-guided Hierarchical Knowledge Graph Retrieval-Augmented Generation
-
TagRAG 用“对象标签 + 领域标签链”替代 GraphRAG 中昂贵的实体社区划分和全图摘要,在保持全局知识整合能力的同时显著降低构图与检索成本,并在 UltraDomain 四个领域上以小模型 Qwen3-4B 获得高于 NaiveRAG、GraphRAG、LightRAG 和 MiniRAG 的胜率。
- AutoPKG: An Automated Framework for Dynamic E-commerce Product-Attribute Knowledge Graph Construction
-
提出 AutoPKG,一个多智能体 LLM 框架,从多模态电商商品内容自动构建 Product-Attribute 知识图谱(PKG),通过类型归纳 Agent、属性键发现 Agent、属性值提取 Agent 和集中式 KGD 决策 Agent 实现动态本体的持续演化和规范化,在 Lazada 数据集上取得 0.953 WKE(类型)和 0.724 WKE(属性键),线上 A/B 测试推荐 GMV 提升 7.89%。
📈 时间序列 (8)¶
- STReasoner: Empowering LLMs for Spatio-Temporal Reasoning in Time Series via Spatial-Aware Reinforcement Learning
-
STReasoner 用网络 SDE 合成带图结构和文本语义的时空时间序列数据,再通过时间序列编码器、三阶段训练和空间感知 S-GRPO,让 LLM 学会基于时间动态与空间依赖做显式推理。
- Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback
-
定义 Time-RA 新任务将时间序列异常检测从二分类升级为生成式推理诊断(检测+分类+原因解释),构建首个包含约 4 万样本、10 个领域、20 种异常类型的多模态基准 RATs40K,并通过 AI 反馈标注流程和 LLM 微调验证了该范式的可行性。
- TSAQA: Time Series Analysis Question And Answering Benchmark
-
TSAQA 是一个统一的时间序列问答基准:它把 6 类时序分析任务(异常检测、分类、表征、比较、数据变换、时间关系)全部铸造成 3 种封闭式题型(判断题 TF、选择题 MC、以及新提出的拼图题 PZ),跨 13 个领域共 210k 样本,用统一协议零样本评测 LLM 与时序基础模型——结果显示即便最强商用模型 Gemini-2.5-Flash 也只有 65.08 的平均准确率,基准仍有很大挑战空间。
- A Unified Framework for Modeling Heterogeneous Financial Data via Dual-Granularity Prompting
-
提出FinLangNet框架,通过双模块架构(DeepFM处理静态特征 + 双粒度提示机制的Transformer处理时序行为)实现多尺度信用风险预测,在滴滴金融平台部署后实现KS提升6.3pp和坏账率下降9.9%。
- Test of Time: Rethinking Temporal Signal of Benchmark Contamination
-
这篇论文证明“cutoff 之后性能下降”并不是稳健的 benchmark contamination 证据:同一批源文档只要从原文填空题换成 LLM 改写题,时间衰减信号就会显著改变甚至消失。
- STK-Adapter: Incorporating Evolving Graph and Event Chain for Temporal Knowledge Graph Extrapolation
-
本文提出 STK-Adapter,通过在 LLM 每一层嵌入三个 MoE 模块(ST-MoE 捕捉时空结构、EA-MoE 建模事件链语义、CMA-MoE 深度跨模态对齐),解决现有方法将 TKG 嵌入与 LLM 浅层对齐导致的时空信息丢失和逐层稀释问题,在四个基准数据集上显著超越 SOTA。
- ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning
-
ODTQA-FoRe 提出面向未来数值预测和预测后推理的开放域表格问答任务,并用 TimeFore 三代理框架把表格检索、SQL 取数、专用时间序列预测和答案规范化串成一个可评测 baseline。
- Temporal Leakage in Search-Engine Date-Filtered Web Retrieval: A Retrospective Forecasting Case Study
-
本文对 Google 和 DuckDuckGo 的日期过滤器进行系统审计,发现搜索引擎日期过滤在回顾性预测评估中严重失效——71%(Google)和 81%(DuckDuckGo)的问题至少有一个页面包含重大截止日期后信息泄漏,导致预测 Brier 分数从 0.24 虚降至 0.10。
🩺 医疗 LLM (47)¶
- CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning
-
作者构造了一个覆盖 13 种语言(含 Amharic、Yoruba、Swahili 等低资源语言)、共 15,774 条开放问答的医学推理数据集 CureMed-Bench,并提出 Cure-Med:一个两阶段「code-switching 感知的 SFT + 课程式 GRPO」框架,把推理正确性和语言一致性联合优化,在 7B 上将语言一致率 / 推理正确率拉到 85.21% / 54.35%,在 32B 上拉到 94.96% / 70.04%。
- HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks
-
HeteroRAG 构建了 270 万张图文对 + 五类语料的 MedAtlas 知识库,把医学多模态 RAG 拆成三件套——按模态分训的 ModCLIPs 拉报告、按语料定制 query 的 MQG 拉文档、用 HKPT 偏好微调对齐跨模态与多源知识——让 7B 模型在 11 个数据集上稳定击败 4-5× 参数量的开源 Med-LVLM。
- Language Reconstruction with Brain Predictive Coding from fMRI Data
-
本文提出 PredFT,一个结合主网络(语言解码)和侧网络(脑预测编码表征)的端到端 fMRI-to-Text 解码模型,通过从大脑预测相关脑区(PTO 区域)提取前瞻性语义表征并融合到解码过程中,在 LeBel 数据集上 BLEU-1 达 34.95%(Sub-1),相比最强基线 MapGuide 提升 7.84 个百分点。
- Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation
-
本文提出 DyReMe 动态医学诊断评估框架,通过 DyGen 模块生成包含鉴别诊断和误诊因素等临床干扰项的全新诊断案例,并通过 EvalMed 模块从准确性、真实性、帮助性和一致性四个维度评估 LLM,揭示现有静态基准高估了 LLM 的诊断能力——GPT-5 在 DyReMe 上准确率下降 8.25%,12 个 LLM 均暴露出显著的可信度不足。
- Beyond the Individual: Virtualizing Multi-Disciplinary Reasoning for Clinical Intake via Collaborative Agents
-
提出 Aegle 框架,通过图结构多智能体架构虚拟化多学科会诊(MDT),将解耦并行推理和动态拓扑引入门诊问诊流程,在24个科室53项指标上超越SOTA模型。
- Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA
-
研究社会身份标记(性取向和宗教信仰)如何扭曲LLM在医疗问答中的准确率和置信度校准,发现"同性恋"标记在9个LLM上一致导致性能下降和校准危机,且交叉身份产生非加性的特异性伤害。
- "Excuse Me, May I Say Something…" CoLabScience: A Proactive AI Assistant for Biomedical Discovery
-
CoLabScience 通过 PULI(正无标注学习干预)框架,训练一个能在生物医学团队讨论中主动判断何时介入、如何介入的 LLM 助手,利用 GRPO 和强化学习协调器从流式对话中自动识别最佳干预时机并生成科学建议。
- Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical Evidence
-
本文构建 MedCounterFact 数据集——用无义词、医学术语、非医学物品和有毒物质系统替换临床试验中的干预措施——发现前沿 LLM 在反事实医疗证据面前几乎无条件遵从上下文,即便"证据"表明海洛因或芥子气有疗效也自信回答,揭示了忠实度与安全之间缺乏明确边界的严重问题。
- HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering
-
本文提出 HypEHR,一个仅 22M 参数的洛伦兹双曲模型,将医学编码、就诊记录和问题嵌入双曲空间,通过层级感知正则化对齐 ICD 本体结构,在 MIMIC-IV 电子病历问答任务上接近 LLM 方法的效果。
- MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation
-
本文提出 MARCH,一个模拟放射科住院医-专科医-主治医层级协作流程的多智能体框架,通过三阶段(初始报告起草、检索增强修订、共识驱动定稿)生成 CT 报告,在 RadGenome-ChestCT 数据集上 CE-F1 达 0.399,比最佳基线 Reg2RG 的 0.253 提升 57.7%。
🧬 计算生物 (5)¶
- ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway
-
本文提出 ToxReason,一个基于不良结局路径 (AOP) 框架的化学毒性机理推理基准,整合药物-靶点实验数据与毒性标签,要求模型从分子起始事件推理到器官级不良结局;通过 GRPO 强化学习训练的 4B 模型在毒性预测(F1 71.4%)和推理质量上均超越 GPT-5 等大模型。
- AROMA: Augmented Reasoning Over a Multimodal Architecture for Virtual Cell Genetic Perturbation Modeling
-
提出 AROMA 框架,通过整合文本证据、知识图谱拓扑信息和蛋白质序列特征的多模态架构,结合两阶段训练策略(SFT + GRPO),实现了可解释且精确的基因扰动效应预测。
- ProtoCycle: Reflective Tool-Augmented Planning for Text-Guided Protein Design
-
ProtoCycle提出一种将LLM作为规划器、结合轻量级工具环境的反思式智能体框架,用于文本引导蛋白质序列设计:它用多轮“规划-工具调用-评估-反思”循环替代一次性文本到序列生成,在 Mol-Instructions 上将 ProTrek 提升到 14.681、Retrieval 提升到 0.936,并只用约 2,000 条 SFT 轨迹和在线 RL 达到接近/超过专用蛋白质设计模型的语言对齐效果。
- BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
-
BioTool 构建了一个覆盖 NCBI / Ensembl / UniProt 三大生物医学数据库 34 个常用工具、7,040 条经人工核验的「查询–API 调用」对的指令微调数据集,用它微调 4B 量级开源 LLM 后,工具调用质量超过 GPT-5.1 / Gemini-3 Pro / Claude-4.5-Sonnet 等商业大模型 15% 以上。
- ChemAmp: Amplified Chemistry Tools via Composable Agents
-
提出"工具放大"新范式(区别于传统的工具编排),通过 ChemAmp 框架将化学专用工具(UniMol2、Chemformer等)作为可组合积木块动态构建任务专用超级智能体,在分子设计、反应预测等四个核心化学任务上超越专用模型和通用LLM,同时推理token成本减少94%。
👥 社会计算 (44)¶
- Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation
-
作者用 30.8K 条 X 平台健康类 Community Notes 的实证分析揭示出"首条 helpful verdict 中位延迟 17.6 小时、87.9% 笔记永远无评级"的系统性慢响应问题,提出 CrowdNotes+ 框架——以 (1) 证据增强和 (2) 效用引导自动化 两种模式让 LLM 写 note,并配以"相关性→正确性→帮助性"三级评估;15 个 LLM 在新 benchmark HealthNotes 上全面超过人工 note 的 73.19% helpfulness(最高 o3 模型达 81.15%)。
- Justice in Judgment: Unveiling (Hidden) Bias in LLM-assisted Peer Reviews
-
作者用"只改作者元数据、不改论文内容"的反事实评测在 9 个 LLM 上系统性地审计了 LLM 同行评议偏见,发现所有模型都对名校(RS)有显著好感、对资深 PI 与高产作者更宽容,且关键是:当模型在 hard rating 上看似中立时,soft rating(基于 token 概率的期望评分)暴露出更强的隐藏偏见,揭示了"对齐只是把偏好藏起来而没消除"的对齐失败模式。
- Bayesian Social Deduction with Graph-Informed Language Models
-
提出 GRAIL(Graph Reasoning Agent Informed through Language),一个混合推理框架,将概率推理外化到因子图模型、用 LLM 处理语言理解和交互,在社交推理游戏 Avalon 中首次击败人类玩家(67% 胜率),且资源消耗远低于大规模推理模型。
- VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking
-
VeriTaS 用一个季度更新的七阶段自动化流水线,把专业事实核查机构的真实多语种图文视频声明转成标准化、可解释、可评测的多模态事实核查基准,并显示当前最强多模态模型离可靠 AFC 仍有明显距离。
- Inertia in Moral and Value Judgments of Large Language Models
-
本文用"大规模随机 persona × 道德 / 价值问卷"的范式系统地测出 7 个主流 LLM 在 Harm / Fairness 维度上有高度稳定的"价值惯性"——任何 persona 都很难推动它们的回答方向,并提出 Inertia Index 和 Steerability 两个可量化指标揭示这种偏好其实分布不均、与对齐目标对齐。
- Is this chart lying to me? Automating the detection of misleading visualizations
-
提出 Misviz(2604张真实世界误导性可视化)和 Misviz-synth(57665张合成可视化)基准,覆盖12种误导类型,系统评估MLLM、规则检查器和图像分类器在检测误导性图表上的表现,揭示该任务仍极具挑战性。
- Who Gets Which Message? Auditing Demographic Bias in LLM-Generated Targeted Text
-
本文首次系统分析 LLM 在人口统计条件下生成定向消息时的偏见行为,提出 Persuasion Bias Index (PBI) 指标,发现 GPT-4o/Llama/Mistral 在气候传播中对男性和年轻人使用更强势的说服策略,且上下文提示会系统性地放大这些差异。
- Among Us: Language of Conspiracy Theorists on Mainstream Reddit
-
分析5亿条Reddit评论的10年纵向数据,发现活跃于阴谋论社区的用户在主流社区中也展现出可检测的独特语言模式(平均87%分类准确率),但这些模式高度依赖社区上下文,社区特定模型比全局模型高出最多17个百分点。
- MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
-
作者把多模态立场检测重构成一个 4 阶段 multi-agent pipeline——CLIP 检索相似样本提供 few-shot CoT、文本/图像/跨模态冲突 3 个专家 agent 各自分析、3 个立场(支持/反对/中立)的 debater agent 互相辩论、最后一个 adjudicator agent 做 self-reflection 出最终标签,5 个数据集上 in-target 和 zero-shot 都超过包括 GPT-4V、TMPT、MV-Debate 在内的强 baseline。
- Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning
-
本文提出 Prompt-Level Distillation,把教师模型在训练样本上的推理规律抽取、聚类并消解冲突后写入学生模型的 system prompt,在不更新参数的情况下显著提升小模型的推理分类能力。
🛡️ AI 安全 (5)¶
- OmniCompliance-100K: A Multi-Domain Rule-Grounded Real-World Safety Compliance Dataset
-
本文构建了首个大规模、多领域、基于真实案例的 LLM 安全合规数据集 OmniCompliance-100K,包含 12,985 条人工整理的法规/政策规则和 106,009 条通过 Web 搜索智能体采集的真实合规案例,覆盖 AI 安全、数据隐私、金融、医疗等 9 个领域,并通过广泛的基准实验揭示了当前 LLM 在安全合规能力上的系统性短板。
- On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference
-
这篇论文指出 Transformer 安全推理中常用的“洗牌后公开中间激活”防御并不安全,并提出一种先把不同随机置换下的激活对齐、再解线性方程抽取权重的攻击,在 Pythia-70m 和 GPT-2 上能以约 1 美元查询成本恢复近似可用的模型权重。
- Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF
-
提出 Reverse Constitutional AI (R-CAI),通过反转 Constitutional AI 的原则为"毒性宪法",结合批评-修正循环和概率截断的 RLAIF 机制,实现自动化、可控的多维度对抗毒性数据合成,同时通过概率截断解决奖励黑客导致的语义退化问题(语义连贯性提升15%)。
- UniVid: 统一视频审核的视觉语言模型
-
UniVid 通过用统一的策略感知字幕 VLM 替代 1000+ 个黑盒分类器,将视频审核系统从不可维护的"碎片化"架构演进为可解释、可复用的"端到端"审核系统,在 ByteDance 平台生产部署中相比传统方案违规泄漏率下降 42.7%。
- Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI
-
论文主张课堂 AI 不该把"沉默、回避眼神、语码转换"这类文化情境化的信号直接读成"低参与、不专心、能力差"的教育判断,提出神经符号框架 NSCR:先把多模态信号落成带不确定性、来源和文化作用域的类型化事实,再通过可执行推理与治理策略组合出有据声明,证据不足或有刻板印象风险时主动弃答(DEFER)。
📂 其他 (3)¶
- Automated Knowledge Component Generation and Interpretable Knowledge Tracing in Coding Problems
-
这篇论文用 LLM 自动为开放式编程题生成和聚类 Knowledge Components,并提出 KCGen-KT 将学生在每个 KC 上的掌握度转成 soft token 输入 Llama 3,在 CodeWorkout 和 FalconCode 上同时提升正确率预测与学生代码生成。
- NSF-SciFy: Mining the NSF Awards Database for Scientific Claims
-
NSF-SciFy 从 NSF 奖项摘要中抽取 2.8M 科学 claims 和 investigation proposals,构建了比现有科学 claim 数据集大几个数量级的资源,并展示了它能显著提升 claim / proposal 抽取模型。
- Qayyem: A Real-time Platform for Scoring Proficiency of Arabic Essays
-
Qayyem 是首个支持跨题目(cross-prompt)多维度(multi-trait)阿拉伯语自动作文评分的 Web 平台,集成了从特征工程到 SOTA 神经模型的多种评分方案,支持端到端的学术写作评估工作流。