S*: Test Time Scaling for Code Generation
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI
Comments ICLR 2025 camera ready version
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Presented at the 13th Conference on Engineering, Project and Production Management
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
Comments 22 pages, preprint
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
Comments ICLR 2024; 23 pages; code: https://github.com/GFNOrg/gfn-lm-tuning
专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) ; Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.AI
AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。
Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM
xChk:自带身份——基于验证者确定充分性的异构认证
专题命中 测试时计算 :verifier(title)
AI总结 xChk作为自带身份的参考身份提供商,让用户通过异构证明注册并在OIDC令牌中披露声明,依赖方应用自身策略,支持人工参与高风险操作认证,生产部署实现双边RP评估及特定依赖方登录。
Comments 19 pages, 4 figures. Reference implementation at https://in.xchk.io; one documented RP (crabbyed.com, Appendix B)
机构 * Selftok Team(Selftok团队) ; Media Technology Institute(媒体技术研究所) ; Huawei(华为)
专题命中 测试时计算 :reasoning(title)
更多正确质量,更差答案:幂采样为何会失效及如何修复
机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能 State Key Laboratory)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG
AI总结 研究发现幂采样存在悖论,即提升正确轨迹概率却降低下游推理性能,归因于剂量与覆盖不匹配,提出修复后的支持保留幂采样器可逆转损失并优于标准多采样推理。
Comments 16 pages, 8 figures, 1 table. Haohui Yang and Jiaxing Sun contributed equally. Xiujun Ma is the corresponding author
MERA:面向大规模智能体系统的技能适配型模型演化与路由
机构 * Gradient ; Soochow University(苏州大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG
AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。
Comments Preliminary version in CAIS RL-Eval
重新思考推理时缩放:效率极限与语言信号
机构 * Duke University(杜克大学) ; Together AI ; University of Chicago(芝加哥大学) ; Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI
AI总结 本研究分析推理时缩放的效率极限,发现非推理模型存在无法突破的推理底线,多数投票优于复杂框架,还识别出正确性的语言信号,为高效推理智能体提供了新路径。
Comments update figures, writings
基于动作中心图的推理时缩放与情景记忆的衔接
机构 * Florida International University(佛罗里达国际大学) ; Stanford University(斯坦福大学) ; NEC Laboratories America(美国NEC实验室) ; Singapore Management University(新加坡管理大学)
专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出GAMER框架,通过动作中心图衔接推理缩放与情景记忆,采用双流时间差分学习优化决策,在多基准上较普通基线提升了20.81%的成功率与6.17%的进度率。
超越成功率:攻防安全代理的成本感知评估
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI
AI总结 研究通过成本-成功率视角评估语言模型安全代理,在攻防挑战中比较固定成本下模型性能,发现红蓝队任务扩展模式不同,进攻性CTF性能与测试时计算量有关,防御性SOC调查更依赖工具使用等,强调安全代理基准应考量经济效率与运营契合度。
QLPO:用于长度感知策略优化的象限加权采样
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(北京大学软硬件协同人工智能系统北京市重点实验室) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Institute of Computational Social Science, Peking University (Qingdao)(北京大学(青岛)计算社会科学研究院)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 针对大型推理模型长思维链响应致高延迟成本问题,提出QLPO方法,通过先过度生成候选响应,再按特定规则重采样训练组,实现隐式长度控制,在多模型中改善准确率与长度权衡,减少响应长度并保持推理性能。
Comments 18 pages, 7 figures, 6 tables. Accepted at COLM 2026
从聊天机器人到数字同事:向持久自主人工智能的范式转变
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出LLM从聊天机器人向数字同事的范式转变,通过认知核心(思考型LLM)和工具增强任务执行(OpenClaw工作站系统)两个维度,实现持久工作、状态持久化、可重用技能和自改进能力。
Comments The paper is available on the project website: https://from-chatbot-to-digital-colleague.github.io/
针对多跳检索增强生成智能体的显著性诱导:威胁与防御
机构 * National University of Defense Technology(国防科技大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。
Comments 18 pages, 4 figures, 12 tables
DICE: 用于稳定多智能体LLM协调的熵正则化均衡选择
机构 * University of Arizona(亚利桑那大学) ; Hong Kong Baptist University(香港浸会大学)
专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 提出DICE框架,通过熵正则化均衡选择(HQRE)解决多智能体LLM协调中的不稳定性,实现线性收敛和有限贝叶斯遗憾,在11个基准上平均提升4.3-8.5个百分点。
面向长时程移动GUI代理的任务状态表示
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; School of Software, Beihang University(北京航空航天大学软件学院)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。
Comments Preprint. 9 pages, 3 figures
用竞争奖励解决大语言模型中的过度拒绝问题
机构 * Carnegie Mellon University(卡内基梅隆大学) ; SynthLabs
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。
不可信AI代理的认证推测执行
机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) ; College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) ; Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)
专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);分类 cs.LG
AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。
Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)
TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) ; University of Notre Dame(圣母大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。
并非所有不变式都同等重要:利用SLM通过精选训练数据加速程序验证
机构 * Hebrew University of Jerusalem, Israel(特拉维夫大学) ; Amherst College, USA(阿默斯特学院) ; VMware Research by Broadcom, USA(Broadcom VMware 研究)
专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);分类 cs.LG
AI总结 提出Wonda数据筛选流水线,通过AST归一化和LLM语义重写从原始验证器输出中提取高质量训练不变式,微调小语言模型(SLM)后,在多个模型上使不变式正确性和加速率翻倍甚至三倍,小模型性能媲美大模型。
Comments A preprint of the ICML 2026 paper with the same title
人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号
机构 * College of Science and Engineering(科学与工程学院) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学) ; Doha, Qatar(卡塔尔多哈)
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI
AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。
AVIS: 视觉语言模型的自适应测试时缩放
机构 * AI Center-Toronto, Samsung Electronics(三星电子多伦多AI中心) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; York University(约克大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出AVIS,通过轻量策略联合优化视觉上下文缩放和推理缩放,利用无训练的关键多样性剪枝和自适应自一致性,在多种基准上提升精度-计算权衡。
Comments Project page: https://avis-vlm.github.io/
从标注验证集输出统计量预测推理时缩放增益
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 提出一种基于标注验证集输出统计量的轻量级方法,通过三个核心特征(提示级一致性扩散、标签辅助的首个正确样本位置、完成长度方差)结合熵特征,使用岭回归预测最佳-of-N推理缩放增益,达到Spearman ρ=0.90的相关性。