Generating Diverse Hypotheses for Inductive Reasoning
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
Comments NAACL 2025
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
Comments NAACL 2025
专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments Accepted to MATH-AI at NeurIPS 2024
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
Comments Accepted by NeurlPS 2024
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
Comments Published at EMNLP 2023
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
Comments arXiv admin note: text overlap with arXiv:2204.08770
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
代理验证在回路求解器协调 for 无细胞大规模MIMO下行功率控制
专题命中 测试时计算 :verifier(title,abstract)
AI总结 本文提出VISO-PC框架,通过代理在求解器间路由以优化无细胞大规模MIMO下行功率控制,提升公平性并减少运行时间。
Comments This is the version 1. 6 pages, 5 figures, 4 tables. This paper presents a agentic verifier-aware orchestration formulation for cell-free massive MIMO power control
当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制
专题命中 测试时计算 :verifier(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。
Pair-In, Pair-Out: 面向高效LLM的潜在多令牌预测
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) ; AI Platform, Xiaohongshu Inc.(小红书人工智能平台) ; University of Electronic Science and Technology of China(电子科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出Pair-In, Pair-Out (PIPO)方法,通过统一潜在压缩和多令牌预测,并训练轻量级置信度头消除验证器开销,在保持可靠性的同时实现推理加速。
Comments Project Page: GitHub.com/RedAI-Infra/PIPO
大型语言模型中推理时引发的概率变换的经验表征
机构 * Bloch School of Management, Regnier Institute for Entrepreneurship & Innovation, University of Missouri–Kansas City(布洛赫管理学院、雷尼创业与创新研究所、密苏里大学堪萨斯城分校) ; Department of Computer Science, School of Science and Engineering, University of Missouri–Kansas City(计算机科学系、科学与工程学院、密苏里大学堪萨斯城分校)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过经验观察发现,在多种推理时流程(如思维链、自我细化、检索增强和验证器引导修订)下,候选答案的概率变换遵循近似的对数比率关系,并分析了其系数变化和鲁棒性。
Comments 22 pages, 11 figures, 5 tables
超越语义:无理由中间标记的不合理有效性
机构 * School of Computing and AI(计算与人工智能学院) ; Arizona State University(亚利桑那州立大学) ; Amazon AGI(亚马逊人工通用智能) ; Yale University(耶鲁大学)
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 通过从零训练Transformer模型于形式可验证推理轨迹,发现模型在正确与损坏轨迹上表现相似,且损坏轨迹在分布外任务上泛化更好,挑战了中间标记反映或诱导可预测推理行为的假设。
Comments Published in Transactions on Machine Learning Research (TMLR)
为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展
机构 * Mila, McGill University(Mila,麦吉尔大学) ; Mila, Université de Montréal(Mila,蒙特利尔大学) ; Microsoft Research, Mila(微软研究院,Mila) ; Google DeepMind, Mila(谷歌DeepMind,Mila)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。
解毒经验提升LLM代理的测试时间推理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。
从尺度到速度:面向图像编辑的自适应测试时间缩放
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; AMAP, Alibaba Group(阿里巴巴集团高德地图) ; University of Queensland(昆士兰大学)
专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
通过内部激活监控生成过程中的涌现奖励黑客行为
机构 * Technical University of Berlin(柏林技术大学) ; BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 通过分析内部激活来监控生成过程中的奖励黑客行为,提升微调语言模型的安全性。
Journal ref ICLR2026 Workshop: Principled Design for Trustworthy AI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Accpeted by AAAI 2026
机构 * KAIST(韩国科学技术院) ; University of California, Berkeley(加州大学伯克利分校) ; KRAFTON
专题命中 测试时计算 :planning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG
机构 * DataArc Tech Ltd.(DataArc科技有限公司) ; IDEA Research, International Digital Economy Academy(IDEA研究所、国际数字经济学院) ; Gaoling School of Artificial Intelligence, Renmin University of China(法律人工智能学院,中国人民大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
能力路由守卫:防御大型推理模型免受以推理为中心的越狱攻击
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 本研究提出能力路由守卫(CRG),一种针对闭源大型推理模型的模型无关推理时护栏,可有效缓解多种以推理为中心的越狱攻击,同时保留良性效用并避免过度拒绝问题。
Think2Go:基于大语言模型推理的生成式下一个兴趣点(POI)推荐
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 Think2Go框架统一SFT与RL推理,通过优势加权机制校准策略优化,解决现有POI推荐模型的意图捕捉不足问题,提升推荐性能与稳健性。
Comments Accepted by KDD 2026 Research Track Cycle 1 (Oral presentation)
CASHEW: 通过迭代轨迹聚合稳定多模态推理
机构 * Arizona State University(亚利桑那州立大学) ; NewsBreak
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。
通过表示工程解锁大语言模型和大视觉语言模型的多语言推理能力
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; The University of Hong Kong(香港大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 研究针对LLMs和LVLMs在多语言推理中英语表现优于低资源语言的问题,提出无训练的推理时方法MRRE,通过在特定层注入两个预计算向量增强多语言推理能力,实验证明该方法有效提升非英语推理及输入输出语言一致性。
Comments ACL2026 main