⚡ LLM 效率¶
🧠 NeurIPS2026 · 6 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (1) · 📷 CVPR2026 (8) · 🔬 ICLR2026 (169) · 💬 ACL2026 (23) · 🧪 ICML2026 (48) · 🤖 AAAI2026 (9)
- Adaptive Mass-Segmented KV Compression for Long-Form Reasoning
-
AMS 不替换 token 重要性评分器,而是先用注意力质量分布自适应切段并分配保留配额,再在段内评分筛选,从而缓解长推理中连续区域被清空的问题;Math500 上 AMS-Expected 在 256-token 缓存预算下比 AdaKV-ExpE2 高 16.0 个百分点。
- Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models
-
ADAS 在不训练模型、不改变基础采样器停止规则的前提下,用候选位置对本轮已选位置的注意力及后者的不确定性动态折扣置信度,在低去噪调用次数条件下改善并行解码质量;两种模型的任务与方法平均收益分别为 9.11 和 10.46 个百分点。
- Block Sparse Flash Attention
-
BSFA 在 FlashAttention-2 内先精确计算所有因果可见的 QK 分数,再用离线校准的块最大值阈值跳过低分块的 V 读取、PV 和 softmax 状态更新,在 Llama-3.1-8B 的 LongBench 上以 39.78% 对比稠密基线 40.24% 的分数,获得最长 10 个样本上 1.13× 的端到端预填充加速。
- Fractional State Space Transition for Long Sequence Modeling
-
Frac 用共享几何时间尺度上的有限指数模式近似分数阶长记忆,再加入逐 token 控制和独立读写路由,在保持有界递归状态的同时将 1.3B 模型的 LongBench 平均分从 GDN 的 16.0 提高到 17.9,但并非所有任务或速度指标都领先。
- It's All Training: A Fully Synthetic Single-Stage Recipe for LLMs
-
Synth 把有来源的百科种子扩写为多任务指令与推理数据,使最终 Baguettotron 学生模型从随机初始化经一个训练流程获得指令和事实能力;600M 型号在种子实体上的可核验事实精度为 79.3%,但这一结果不代表广泛知识覆盖,也不包含免费获得教师和数据生成的假设。
- SEED: Self-Speculative Decoding via Implicit Encoder–Decoder
-
SEED 把原有解码器模型的末两层训练成草稿生成器,复用上轮完整模型验证留下的深层 KV 缓存,在任务专属微调与自适应树验证设置下,使 Qwen3-1.7B/4B 的平均解码速度达到 AR 基线的 2.6/2.7 倍,同时保持或提升任务质量。