arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-31 至 2026-07-31 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 13 篇

2607.27914 2026-07-31 cs.LG cs.SY eess.SY 新提交 83%

Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

仅精确动作值不够:针对多区域VAV控制的推理模型的展开验证强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 该研究针对多区域VAV控制,测试前沿LLM的控制能力及TD3引导的RFT效果,发现RFT未产生持续改进,需先开展状态转移聚焦的监督微调。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27823 2026-07-31 cs.CV 新提交 82%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 测试时计算 :verifier(title,abstract)

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27760 2026-07-31 cs.IR cs.AI 新提交 79%

Hierarchical Latent Reasoning for LLM-based Recommendation

面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新 73%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27415 2026-07-31 cs.AI 新提交 70%

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

基于动作中心图的推理时缩放与情景记忆的衔接

Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Stanford University(斯坦福大学) NEC Laboratories America(美国NEC实验室) Singapore Management University(新加坡管理大学)

专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出GAMER框架,通过动作中心图衔接推理缩放与情景记忆,采用双流时间差分学习优化决策,在多基准上较普通基线提升了20.81%的成功率与6.17%的进度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27656 2026-07-31 cs.LG cs.CL 新提交 62%

Looped Transformers with Source-Centered State Evolution

以源为中心的状态演化循环Transformer

Bum Jun Kim, Kohei Hayashi, Shunsuke Kamiya, Masanori Koyama, Yusuke Iwasawa, Yutaka Matsuo

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 62%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27733 2026-07-31 cs.AI 新提交 57%

VeriSkill: A Self-Evolution Framework for Program Verification Skills

VeriSkill:一种用于程序验证技能的自进化框架

Changguo Jia, Tianqi Zhao, Zhiyou Xiao, Weiming Zhang, Minghui Zhou

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出专为程序验证设计的自进化框架VeriSkill,可将验证失败归因于技能缺陷并迭代优化技能,实验显示其在多种场景下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27578 2026-07-31 cs.AI 新提交 57%

What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering

提示词为何构成图:提示词图工程的充要条件

Sandeco Macedo

机构 * Federal Institute of Goiás(戈亚斯联邦学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过文献分析构建了将提示词视为图节点的定义,提出提示词图工程的四个条件及操作化测试,明确其边界并应用于六个系统,为相关实践提供可操作定义与共享术语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27269 2026-07-31 cs.LG 新提交 57%

Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

超越KV重建:推测解码中MLA草稿模型的功能重建

Weiye Shi, Fanxu Meng, Muhan Zhang

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24162 2026-07-31 cs.CR cs.AI 版本更新 57%

Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation

解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM

Kaisheng Fan, Yishu Gao, Xunzhu Tang, Tegawendé F. Bissyandé, Weizhe Zhang

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) University of Luxembourg(卢森堡大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-07-31 cs.CR 新提交 50%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

Comments This work is currently in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 50%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏