SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
Comments ASPLOS'24
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
Comments ASPLOS'24
专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI
Comments 12 pages, 2 figures
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 54 pages, 25 figures
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
Comments Findings of The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP-findings 2023)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted to ICASSP 2024
专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
Comments EMNLP 2023
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
Comments Tech report
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
Comments Accepted by AAAI 2021
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 15 pages, 10 figures, published as a workshop Paper at ICLR: Beyond tabula rasa in RL (BeTR-RL). arXiv admin note: substantial text overlap with arXiv:2002.09253
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
你的模型多样性,而非方法,决定推理策略
机构 * UIUC(伊利诺伊大学香槟分校) ; Capital One
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.AI
AI总结 本文提出模型多样性影响推理策略,通过理论框架分析推理不确定性,验证了不同模型在深度精炼和并行采样中的表现差异。
Comments This is a full-length extension of the workshop paper that appeared in the ICLR 2026 Workshop on LLM Reasoning
CGES:面向高效准确自一致性的置信引导早停方法
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.CL
AI总结 提出贝叶斯框架CGES,通过自适应停止采样减少自一致性推理调用次数,在5个推理基准上平均减少58%调用且精度损失仅0.4个百分点。
Comments Extended version. A preliminary version was accepted at the Efficient Reasoning Workshop @ NeurIPS 2025. Code: https://github.com/EhsanAghazadeh/cges
顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Meta
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG
AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。
Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission
多模态医学诊断中的公平性与演示选择
机构 * Arizona State University(亚利桑那州立大学) ; University of Rochester(罗切斯特大学) ; University of Virginia(弗吉尼亚大学) ; UCL(伦敦大学学院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Central Florida(佛罗里达中央大学)
专题命中 测试时计算 :reasoning(abstract,comments);分类 cs.LG
AI总结 本文提出FADS方法,通过基于聚类的采样提升多模态医学影像诊断的公平性,减少性别、种族和族裔相关差异,同时保持高准确性。
Comments 10 pages (including 2 pages of references), 4 figures. This work explores fairness in multi-modal medical image reasoning using in-context learning
不要放弃BATON:通过智能体子任务探索和感知转换的记忆实现长程机器人操作
机构 * University of Southern California(南加州大学) ; University of Central Florida(中佛罗里达大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究针对长程机器人操作的误差累积与子任务转换问题,提出BATON方法,通过子任务探索与感知转换记忆,在RoboMemArena基准上提升任务成功率11.6%、累计成功率14.9%。
Le Critique:用于大语言模型强化学习的特权值函数
机构 * Mistral AI(米斯特拉尔人工智能公司) ; Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。
天生不连贯?大型语言模型的道德自我一致性研究
机构 * Cornell University(康奈尔大学) ; Cornell Tech(康奈尔科技学院) ; Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。
Comments 88 pages; pages 16 to 88 are the appendix
思维漏斗:通过提前投票和展开剪枝实现高效测试时缩放
机构 * Korea University(高丽大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对大型推理模型多样本推理成本过高的问题,提出FoT方法,通过识别犹豫信号剪枝无产出轨迹,在保持准确率的同时大幅降低推理成本且可跨架构和任务迁移。
Comments 20 pages, 8 figures
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
SPADE:用于精确且低成本分布式边缘云推理的推测解码
机构 * IIT Bombay(印度理工学院孟买分校)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 SPADE是一种集成推测解码的分布式边缘云推理框架,通过边缘草稿模型与云端验证模型的协作,减少76%云端模型调用且不损失准确率,降低了LLM部署的成本与推理时间。
NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。
超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cognizant AI Lab(高知特人工智能实验室)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI
AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。