跳转至

🦾 LLM Agent

🧠 NeurIPS2026 · 4 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (30) · 📷 CVPR2026 (42) · 🔬 ICLR2026 (162) · 💬 ACL2026 (82) · 🧪 ICML2026 (59) · 🤖 AAAI2026 (33)

🔥 高频主题: LLM ×2

AgentHop: A Diagnostic Benchmark for Agentic Multi-Hop Scientific Question Answering

AgentHop 将 1,011 道科学文献四选题放入七工具、三重预算沙箱,用论文召回、条件转化率、调用模式与资源失败四个轴解释智能体为何答错;论文测试中 Gemini-3 Pro 的准确率为 89.1%,但相近总分也可能掩盖不同的检索与综合瓶颈。

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench 用虚拟时钟、字节校验和 HTTP 轨迹验证评测智能体是否遵守工具产物的跨步骤契约,在本文 38 个模型变体的实验快照中,最高成功率为 77.8%,且规模或版本升级并不保证可靠性提高。

MoMHa: Multi-Objective Optimization of LLM Harnesses over Accuracy, Safety, and Tokens

MoMHa 在不更新模型权重的前提下,让 proposer 根据执行轨迹改写 Python 程序外壳,联合优化准确率、行为安全和 Token 成本;作者报告合成与真实基准的联合均值领先,但指标缩放、两阶段定义和成本口径存在需澄清的来源冲突。

ToolSearcher: Optimizing Tool Selection at Scale via Reinforcement Learning

ToolSearcher 用类别约束课程、首次发现目标工具的事件级优势和按轨迹进度分配的信用训练多轮工具选择器,在 StableToolBench 上将 Qwen2.5-7B-Instruct 的整体 F1 从 GDPO 的 0.496 提升到 0.513,并改善 AppWorld 中由独立执行智能体完成任务的结果。