跳转至

📊 LLM 评测

🧠 NeurIPS2026 · 5 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (3) · 🔬 ICLR2026 (131) · 💬 ACL2026 (96) · 🧪 ICML2026 (40) · 🤖 AAAI2026 (16) · 🧠 NeurIPS2025 (38)

🔥 高频主题: LLM ×4 · 推理 ×2

LLM Judge Validation Under Sparse Overlap: From Inference to Design

本文把 LLM 裁判验证中的重叠标注数量和分配方式当作统计设计问题:用一致性估计的方差分析规划重叠样本,再以分层分配改善代表性;真实基准上低重叠会显著改变部署结论和裁判排名,但分层降低误拒的同时可能增加误批。

OTROPE: Optimal Transport-based Robust Off-policy Evaluation for Large Language Models

OTROPE 在语义嵌入空间中用最优传输重加权旧模型的人类标注残差,再校正新模型的代理评测均值,无需响应概率即可降低跨模型偏好胜率估计误差,但有效性依赖表征覆盖与残差可迁移性,并非所有偏移设置都优于 PPI。

SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

SciR 先生成可验证的演绎、归纳与因果发现问题,再将前提改写为多篇科学体裁文本,通过分别改变推理复杂度与前提混淆来诊断 LLM;即使使用符号求解器,文档形式化仍是显著瓶颈。

Solving Every Step Is Not Enough: Milestone Oracles Reveal a Composition Gap in LLM Math Reasoning

OracleLadder 固定教师编写的数学子目标,用“逐个子目标独立测试”和“原题逐级提供路线及答案”交叉诊断六个模型,发现经筛选的 354 道 NuminaMath 题中,33–48% 属于子目标均可解但原题仍未恢复的组合缺口;排除自动复核标记的评分问题后仍为 24–37%,但这不是纯粹的内部组合能力因果测量。

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

SpanUQ 将离线多样本回答的声明一致性蒸馏到冻结 LLM 的隐状态探针,用集合预测定位语义跨度并输出连续不确定性,五个分别训练的骨干探针取得 0.908–0.944 AUROC,同时支持比整段拒答更细粒度的风险筛选。