arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-22 至 2026-05-22 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2605.21810 2026-05-22 cs.AI cs.MA 79%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23224 2026-05-22 cs.CV 78%

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3:长视频多跳推理的原生交错线索搜索

Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本研究提出Video-o3框架,通过迭代发现显著视觉线索、细粒度检查关键片段以及适应性终止,提升长视频多跳推理能力,实验表明其在MLVU和Video-Holmes上分别达到72.1%和46.5%的准确率。

Comments 27 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22156 2026-05-22 cs.LG cs.AI 73%

One-Way Policy Optimization for Self-Evolving LLMs

单向策略优化用于自演化大语言模型

Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Dartmouth College(达特茅斯学院) Alibaba(阿里巴巴)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21996 2026-05-22 cs.SE cs.AI 70%

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

从片段到轨迹:软件工程代理的特权过程监督

Murong Ma, Tianyu Chen, Yun Lin, Shuai Lu, Qinglin Zhu, Yeyun Gong, Zhiyong Huang, Peng Cheng, Yan Lu, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) King’s College London(伦敦国王学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出Patches-to-Trajectories (P2T)方法,通过利用开发者撰写的参考补丁来改进软件工程代理的训练过程,提高训练效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21980 2026-05-22 cs.CV cs.AI 70%

Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow

通过跨模态信息流解读并增强大视觉-语言模型中的情感电路

Chengsheng Zhang, Chenghao Sun, Zhining Xie, Xinmei Tian

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception(脑启发智能感知与认知MOE实验室) Cognition, University of Science(认知,科学大学) AIPD, Tencent(AIPD,腾讯)

专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于转向向量的因果归因框架,用于描述性情感推理,通过构建专用数据集揭示了三阶段'适应-聚合-执行'机制下的情感电路,发现视觉情感线索在中间层通过情感特定的注意力头进行聚合,随后在深层通过情感通用路径转换为叙述生成,并通过调控情感信息路由增强注意力流和语义激活,从而提升性能并缓解情感幻觉。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI 62%

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16299 2026-05-22 cs.SE cs.AI 57%

ACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference Optimization

ACE:通过对抗性单元测试生成和偏好优化的自进化LLM编码框架

Yixu Huang, Xinglei Yu, Zhongyu Wei

机构 * School of Data Science Fudan University(数据科学学院 复旦大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出ACE框架,通过基于求解器-对抗架构的执行中心监督,实现自进化代码生成,无需真实代码或外部奖励模型,实验表明其在CodeContests、MBPP和LiveCodeBench上均优于现有求解器-验证器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07243 2026-05-22 cs.CL 57%

SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

SpecBlock:带有动态树草案的块迭代推测解码

Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) MetaX Zhejiang Normal University(浙江师范大学) Soochow University(苏州大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究提出了一种结合路径依赖性和低成本草案的块迭代草案方法SpecBlock,通过动态树草案和路径依赖机制提高LLM推理效率,同时在部署时利用验证器反馈进行成本感知适应,从而在速度和成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04708 2026-05-22 cs.CL 57%

Accelerated Test-Time Scaling with Model-Free Speculative Sampling

加速测试时间缩放与模型无关的推测采样

Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati

机构 * KAIST(韩国科学技术院) Amazon AGI(亚马逊人工智能实验室) AirSignal

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出STAND,一种无需模型的推测解码方法,通过利用推理轨迹中的冗余性,显著提升推理效率而不牺牲准确性,经多个模型和任务评估,STAND在保持准确性的同时将推理延迟降低了60-65%。

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19192 2026-05-22 cs.AI cs.CR 57%

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

幻觉作为利用:证据承载多模态智能体

Guijia Zhang, Hao Zheng, Harry Yang

机构 * Shenzhen University(深圳大学) HKUST(香港科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文研究了多模态智能体中幻觉导致授权失败的问题,提出证据承载多模态智能体(ECA)方法,通过分解工具调用、获取类型证书并使用确定性门控来授权,从而将模型的模糊信念转换为可审计的残余,提高了系统的安全性。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏