arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 11 篇

2602.03249 2026-04-10 cs.AI cs.LG 86%

Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning

Accordion-Thinking:通过动态摘要实现的自我调节步骤摘要以提高LLM推理的效率和可读性

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Wenlei Shi, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * Sun Yat-Sen University(中山大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) University of California, Merced(加州大学默塞德分校)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Accordion-Thinking框架,通过动态摘要实现LLM推理的自我调节,减少历史token依赖,提升效率和可读性,实验显示其在48GB GPU内存配置下实现三倍吞吐量且保持准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07666 2026-04-10 cs.LG cs.AI 84%

An Imperfect Verifier is Good Enough: Learning with Noisy Rewards

完美验证者并非必需:在有噪声奖励下学习

Andreas Plesner, Francisco Guzmán, Anish Athalye

机构 * Handshake AI ETH Zurich(苏黎世联邦理工学院)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过引入噪声探讨强化学习在有噪声奖励下的鲁棒性,发现15%的噪声率下验证准确率接近干净基线,表明不完美验证不影响RLVR效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07922 2026-04-10 cs.AI cs.CL 81%

SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking

SAT:通过分步自适应思维平衡推理准确性和效率

Weiyang Huang, Xuefeng Bai, Kehai Chen, Xinyang Chen, Yibin Chen, Weili Guan, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Technologies(华为技术有限公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAT框架,通过分步自适应思维在保持核心推理结构的同时实现推理步骤的动态剪枝,从而在减少推理token数量的同时维持或提升准确率。

Comments accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21872 2026-04-10 cs.AI 79%

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08322 2026-04-10 cs.CV 78%

Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data

Fundus-R1: 基于公共数据训练具备知识感知推理能力的视网膜图像阅读MLLM

Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin, Bangxiang Lan, Jingyu Liu, Jianfeng Dong, Xirong Li

机构 * Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本文提出Fundus-R1,通过公共数据集训练具备知识感知推理能力的视网膜图像阅读MLLM,采用RAG方法生成知识感知推理轨迹,并通过过程奖励增强RLVR,实验证明其在三个基准测试中优于多个基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08291 2026-04-10 cs.GT cs.CR cs.OS 78%

VCAO: Verifier-Centered Agentic Orchestration for Strategic OS Vulnerability Discovery

VCAO:以验证者为中心的代理协调用于战略操作系统漏洞发现

Suyash Mishra

专题命中 测试时计算 :verifier(title);reasoning(abstract)

AI总结 VCAO通过博弈论方法优化操作系统漏洞发现,利用多代理系统在资源约束下实现高效漏洞检测,相比传统方法提升漏洞发现效率并降低误报率。

Comments 13 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08369 2026-04-10 cs.AI cs.CL cs.MA 73%

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

不要过度思考:跨回合动作一致性作为LLM代理的自由自适应计算信号

Khushal Sethi

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 TrACE通过测量跨回合动作一致性,实现LLM代理的自适应计算分配,无需训练或外部验证,在多步序列决策任务中提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02535 2026-04-10 cs.CL cs.AI 62%

ModeX: Evaluator-Free Best-of-N Selection for Open-Ended Generation

ModeX:无需评估器的开放生成最佳-N选择

Hyeong Kyu Choi, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ModeX提出一种无需外部评估器的最佳-N选择方法,通过识别主导语义共识的模态输出,提升开放生成任务的鲁棒性与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13993 2026-04-10 cs.CL cs.AI 62%

Chunks as Arms: Multi-Armed Bandit-Guided Sampling for Long-Context LLM Preference Optimization

片段作为手臂:多臂老虎机引导的长上下文LLM偏好优化采样

Shaohua Duan, Pengcheng Huang, Xinze Li, Zhenghao Liu, Xiaoyuan Yi, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Microsoft Research Asia, China(微软亚洲研究院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系及人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LongMab框架,利用多臂老虎机策略从长上下文中选择最有信息量的片段,生成高质量多样化的响应,用于直接偏好优化训练,提升长上下文推理能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07758 2026-04-10 cs.CV cs.AI 57%

DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics

DailyArt: 从单张静态图像中通过潜在动态发现关节

Hang Zhang, Qijian Tian, Jingyu Gong, Daoguo Dong, Xuhong Wang, Yuan Xie, Xin Tan

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 DailyArt通过合成介导推理解决单张图像中关节估计问题,无需多视角输入或显式部分标注,实现关节参数同时恢复和部分级新状态合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG 57%

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏