arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1997 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1997 篇

2605.07243 2026-05-22 cs.CL 57%

SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

SpecBlock:带有动态树草案的块迭代推测解码

Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) MetaX Zhejiang Normal University(浙江师范大学) Soochow University(苏州大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究提出了一种结合路径依赖性和低成本草案的块迭代草案方法SpecBlock,通过动态树草案和路径依赖机制提高LLM推理效率,同时在部署时利用验证器反馈进行成本感知适应,从而在速度和成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04708 2026-05-22 cs.CL 57%

Accelerated Test-Time Scaling with Model-Free Speculative Sampling

加速测试时间缩放与模型无关的推测采样

Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati

机构 * KAIST(韩国科学技术院) Amazon AGI(亚马逊人工智能实验室) AirSignal

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出STAND,一种无需模型的推测解码方法,通过利用推理轨迹中的冗余性,显著提升推理效率而不牺牲准确性,经多个模型和任务评估,STAND在保持准确性的同时将推理延迟降低了60-65%。

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19192 2026-05-22 cs.AI cs.CR 57%

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

幻觉作为利用:证据承载多模态智能体

Guijia Zhang, Hao Zheng, Harry Yang

机构 * Shenzhen University(深圳大学) HKUST(香港科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文研究了多模态智能体中幻觉导致授权失败的问题,提出证据承载多模态智能体(ECA)方法,通过分解工具调用、获取类型证书并使用确定性门控来授权,从而将模型的模糊信念转换为可审计的残余,提高了系统的安全性。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11060 2026-05-21 cs.SE cs.AI 57%

Code Researcher: Deep Research Agent for Large Systems Code and Commit History

Code Researcher: 用于大型系统代码和提交历史的深度研究代理

Ramneet Singh, Sathvik Joel, Abhav Mehrotra, Nalin Wadhwa, Ramakrishna B Bairi, Aditya Kanade, Nagarajan Natarajan

机构 * Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Code Researcher,一种用于大型系统代码和提交历史的深度研究代理,通过多步骤推理和全局上下文收集,有效解决系统代码崩溃修复问题,显著优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11675 2026-05-21 cs.AI 57%

Epistemic Regret Minimization: Label-Free Causal Critique Beyond Outcome Reward

知识悔恨最小化:超越结果奖励的无标签因果批评

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种名为知识悔恨最小化(ERM)的框架,通过评估模型推理轨迹的因果结构而非答案本身,来改进因果批评,从而在没有正确答案的情况下进行无标签操作,并在多个前沿LLM上实验表明,ERM在因果批评任务中表现优于传统方法。

Comments 43 pages, 22 tables, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05431 2026-05-20 cs.CL 57%

Self-Filtered Distillation with LLMs-generated Trust Indicators for Reliable Patent Classification

基于LLM生成信任指标的自过滤蒸馏用于可靠专利分类

Yongmin Yoo, Xu Zhang, Longbing Cao

机构 * Frontier AI Research Centre, School of Computing, Faculty of Science and Engineering, Macquarie University(前沿人工智能研究中心,计算机学院,科学与工程学院,麦考瑞大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出自过滤蒸馏方法,通过将LLM生成的推理作为信任指标而非真实标签,提升专利分类的可靠性,实验显示在USPTO-2M数据集上宏F1指标提升了38.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08141 2026-05-19 cs.LG 57%

SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training

SCOPE-RL: 稳定和定量控制强化学习后训练中的策略熵

Chen Wang, Zhaochun Li, Jionghao Bai, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SCOPE-RL框架,通过温度自适应的正样本构造正则化项,稳定并定量控制强化学习后训练中的策略熵,实验表明其在Pass@1和Pass@$k$任务上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18031 2026-05-19 quant-ph cs.AI 57%

Quantum Sidecar Architectures for Hybrid AI Training and Inference: Stateful Protected Registers, Stateless Reset-and-Reprepare Circuits and Quantum Weight-State Outlook

用于混合AI训练和推理的量子Sidecar架构:状态保护寄存器、无状态重置和重新准备电路以及量子权重状态展望

Y. Mo, G. D. Su

机构 * Independent Researcher(独立研究者;BroadLink公司) BroadLink Co., Ltd.(杭州电子科技大学副教授) Associate Professor, Hangzhou Dianzi University

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于未来混合AI训练和推理的量子Sidecar架构家族,通过状态保护寄存器和无状态重置和重新准备模式,为优化器侧采样、适配器或专家选择、检索、路由和推理路径提案提供有界信号生成器,并引入了量子权重状态Sidecar作为受限的量子表示。

Comments 14 pages, 8 figures. Architecture and small-scale simulation study; no hardware experiment or quantum-advantage claim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG 57%

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16462 2026-05-19 cs.CR cs.AI 57%

Asking Back: Interaction-Layer Antidistillation Watermarks

反向提问:交互层反知识蒸馏水印

Guang Yang, Amir Ghasemian, Fengchen Liu, Zhong Wang, Ninareh Mehrabi, Homa Hosseinmardi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出交互层反知识蒸馏水印,通过教师模型的行为特征进行水印,验证其在不同模型上的有效性与鲁棒性。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15626 2026-05-18 cs.LG 57%

IO-SVD: Input-Output Whitened SVD for Adaptive-Rank LLM Compression

IO-SVD:输入-输出白化SVD用于自适应秩LLM压缩

Ali Abbasi, Chayne Thrash, Haoran Qin, Hamed Pirsiavash, Soheil Kolouri

机构 * Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 IO-SVD通过构建KL感知的双侧白化空间,结合高效异质秩分配策略,实现LLM压缩时的性能与效率平衡,实验表明其在压缩过程中性能损失小且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15051 2026-05-15 cs.LG cs.PF 57%

An Interpretable Latency Model for Speculative Decoding in LLM Serving

为LLM服务中的推测解码开发一个可解释的延迟模型

Linghao Kong, Megan Flynn, Michael Peng, Nir Shavit, Mark Kurtz, Alexandre Marques

机构 * MIT(麻省理工学院) Red Hat AI(红帽人工智能)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出一个可解释的延迟模型,用于LLM服务中的推测解码,通过Little定律推断有效批处理大小,并分解预填充、草稿和验证的请求需求,以解释延迟变化及系统配置影响。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14907 2026-05-15 cs.AI 57%

KGPFN: Unlocking the Potential of Knowledge Graph Foundation Model via In-Context Learning

KGPFN:通过上下文学习解锁知识图谱基础模型的潜力

Yisen Gao, Jiaxin Bai, Haoyu Huang, Zhongwei Xie, Yufei Li, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong, China(香港科技大学计算机科学与工程系) Department of Computer Science and Engineering, HKBU, Hong Kong, China(香港城市大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 KGPFN通过结合先验数据拟合网络与上下文学习,统一了可转移关系规律与推理时的上下文学习,有效提升知识图谱推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12904 2026-05-14 cs.LG 57%

VIP-COP: Context Optimization for Tabular Foundation Models

VIP-COP:表格基础模型的上下文优化

Yilong Chen, Xueying Ding, Leman Akoglu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 VIP-COP通过显式选择机制优化上下文,提升表格基础模型性能,具备快速、预算感知、黑盒兼容和可解释性等优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11986 2026-05-13 cs.AI 57%

On the Limitations of Large Language Models for Conceptual Database Modeling

大型语言模型在概念数据库建模中的局限性

Arthur F. Siqueira, Carlos D. S. Nogueira, Eduarda Farias, Claudio E. C. Campelo, Júlia Menezes

机构 * Systems and Computing Department(系统与计算系)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在生成实体关系图方面的能力,发现其在复杂场景中可靠性下降,存在不一致和模糊性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 57%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10235 2026-05-13 cs.CL 57%

Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

在检索前路由:激活大语言模型的潜在路由能力用于RAG与长上下文选择

Yiwen Chen, Kuan Li, Fuzhen Zhuang, Deqing Wang, Zhao Zhang, Liwen Zhang, Yong Jiang, Shuai Wang, Minhao Cheng

机构 * Beihang University(北航) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Pre-Route框架,通过结构化推理提前决策,利用轻量级元数据进行任务分析和信息需求预测,实现可解释且高效的路由决策,实验表明其在成本效益上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01202 2026-05-13 cs.IT cs.AI math.IT 57%

Forget BIT, It is All about TOKEN: Towards Semantic Information Theory for LLMs

忘掉BIT,一切关于TOKEN:面向大语言模型的语义信息理论

Bo Bai

机构 * Bo Bai(白波)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出语义信息理论,将TOKEN作为意义载体,重构注意力机制和Transformer模型,建立预训练、强化学习和推理中的信息度量方法,明确下一token预测与格兰杰因果推断的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10223 2026-05-12 cs.AI cs.SE 57%

Beyond Autonomy: A Dynamic Tiered AgentRunner Framework for Governable and Resilient Enterprise AI Execution

超越自主性:一种动态分层代理运行框架用于可控且具有弹性的企业AI执行

Kai Pan, Rong Hou

机构 * a2alab(a2alab实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出动态分层代理运行框架,通过风险自适应分层、权力分离架构和容错设计,解决企业AI执行中的可控性和可靠性问题。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09278 2026-05-12 cs.AI 57%

EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium

EquiMem:通过博弈论均衡校准多智能体辩论中的共享内存

Yuqiao Meng, Sakshi Sunil Narvekar, Luoxi Tang, Rupali Rajendra Vaje, Yingxue Zhang, Muchao Ye, Zhaohan Xi

机构 * Binghamton University, State University of New York(宾夕法尼亚州立大学布林茅尔分校) University of Iowa(爱荷华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EquiMem,通过博弈论均衡校准多智能体辩论中的共享内存,解决传统方法在过滤错误信息时的不足,提升内存增强推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG 57%

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04899 2026-05-12 cs.LG 57%

A geometric relation of the error introduced by sampling a language model's output distribution to its internal state

语言模型输出分布采样引入的误差与内部状态的几何关系

Albert F. Modenbach

机构 * Department of Mathematics, King's College London, United Kingdom(伦敦国王学院数学系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究揭示语言模型输出分布采样误差与内部状态几何结构的关系,通过几何方法分析token嵌入空间,发现其曲率在棋类任务中反映模型对问题的内部表示。

Comments 12 Pages, 10 Figures, 2 Appendices. To appear in Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14234 2026-05-12 cs.LG 57%

Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision

计算作为教师:将推理计算转化为无参考监督

Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten

机构 * University of Oxford(牛津大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Meta Superintelligence Labs(元宇宙超级智能实验室)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出计算作为教师框架,通过推理计算生成参考估计,实现无监督学习,尤其在非可验证领域如医疗指导中表现优异,测试时计算开销减少9倍。

Comments Published as a conference paper at ICML 2026. 23 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08386 2026-05-12 cs.AI 57%

SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents

SkillLens: 适应性多粒度技能重用以实现成本高效的LLM代理

Yongliang Miao, Ziyang Yu, Liang Zhao, Bowen Zhu, Hasibul Haque

机构 * Emory University(埃默里大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 SkillLens通过分层技能进化框架实现多粒度技能重用,解决技能重用中的相关性与成本矛盾,提升LLM代理在MuLocbench和ALFWorld中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05777 2026-05-08 cs.CL 57%

Estimating the Black-box LLM Uncertainty with Distribution-Aligned Adversarial Distillation

通过分布对齐对抗蒸馏估计黑盒大语言模型的不确定性

Huizi Cui, Huan Ma, Qilin Wang, Yuhang Gao, Changqing Zhang

机构 * School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院) School of Future Technology, Tianjin University, China(天津大学未来技术学院) Georgia Tech Shenzhen Institute, Tianjin University, China(Georgia Tech深圳研究院) School of Artificial Intelligence, Tianjin University, China(天津大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DisAAD方法,通过生成-判别架构引导轻量级代理模型学习黑盒LLM的输出分布高质量区域,从而有效估计其不确定性。实验表明,即使代理模型仅占目标LLM大小的1%,也能实现可靠的不确定性量化。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01520 2026-05-05 cs.CV cs.CL 57%

MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

MIRL:基于互信息的强化学习用于视觉-语言模型

Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao

机构 * School of Mathematics, Tianjin University, Tianjin, China(天津大学数学学院) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) Shanghai Advanced Institute of Finance (SAIFS), East China Normal University, Shanghai, China(上海先进金融研究所(SAIFS),东华大学) ENN Group, Digital Technology Research Institute, China(ENN集团,数字技术研究院) Nanyang Technological University, Singapore(南洋理工大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 MIRL通过利用生成描述与视觉输入之间的互信息,解决视觉语言模型在复杂推理任务中的感知误差和幻觉问题,提升回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02443 2026-05-04 cs.LG 57%

Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE

某些头部,不确定尾部:专家-样本用于测试时缩放在细粒度MoE

Yuanteng Chen, Peisong Wang, Nanxin Zeng, Yuantian Shao, Shuang Qiu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Nanjing University of Science(南京理工大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文研究细粒度MoE在测试时缩放中的性能优化,提出Expert-Sample方法通过保留高置信度选择并引入可控随机性提升生成多样性。

Comments 25 pages, 13 figures

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV 57%

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA 57%

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15808 2026-04-30 cs.AI 57%

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

推理时的验证扩展:通过测试时的评分指南验证实现自我进化深度研究代理

Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室) Singapore Management University(新加坡管理学院) The Renmin University of China(中国人民大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出通过测试时评分指南验证实现深度研究代理的自我进化,通过迭代验证策略模型输出,提升验证能力,实验显示在GAIA和XBench-DeepSearch上准确率提升8%-11%。

Comments ACL'2026-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏