arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-21 至 2026-07-21 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 13 篇

2607.10139 2026-07-21 cs.LG cs.AI 版本更新 84%

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型

Ning Liu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 79%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17531 2026-07-21 cs.CL cs.AI 新提交 73%

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration

预言机差距与信号保真度:一种用于测试时协作的固定池诊断方法

Jie Hu

机构 * Research Institute of China Telecom(中国电信研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究测试时协作收益不均衡问题,将固定候选池选择器或验证器净收益分解为可测量因素,通过实验表明收益受预言机差距和信号保真度限制,框架可在协作前进行预部署诊断,估计相关指标。

Comments 13 pages, 2 figures, 8 tables. Code: https://github.com/AmGarfield/OracleGap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17535 2026-07-21 cs.CR cs.CL 新提交 70%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

针对多跳检索增强生成智能体的显著性诱导:威胁与防御

Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

机构 * National University of Defense Technology(国防科技大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 66%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 测试时计算 :verifier(abstract,comments);分类 cs.AI、cs.LG

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17290 2026-07-21 cs.LG cs.AI cs.LO 新提交 62%

Lookahead Branching for Neural Network Verification

神经网络验证中的前瞻分支

Liam Davis, Duo Zhou, Huan Zhang, Guy Katz, Clark Barrett, Haoze Wu

机构 * Amherst College(阿默斯特学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hebrew University of Jerusalem(耶路撒冷希伯来大学) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究神经网络验证中前瞻分支策略,提出通用集成方法,以FSB为例说明,还阐述其能生成加速验证的引理,通过在两个验证器中实例化,实现验证时间加速及解决实例数增加。

Comments Accepted to IJCAI 2026. Lookahead branching is part of the Marabou and $α$-$β$-CROWN verifiers

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17247 2026-07-21 cs.LG cs.AI 新提交 62%

Distilled Reinforcement Learning for LLM Post-training

用于大语言模型训练后处理的蒸馏强化学习

Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang

机构 * College of Elite Engineers, Nankai University(南开大学精英工程师学院) Zhongguancun Academy(中关村学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology(哈尔滨工业大学) College of Software, Nankai University(南开大学软件学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型训练后处理问题,提出蒸馏强化学习方法,集成教师监督到RL目标,含反向重要性采样等三个组件,能有效转移知识,在家族内和跨家族蒸馏实验中性能大幅优于标准RL和OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22385 2026-07-21 cs.CL cs.AI cs.CV 62%

LLM-Guided Exemplar Selection for Few-Shot Wearable-Sensor Human Activity Recognition

基于大语言模型的示例选择用于少样本可穿戴传感器人体活动识别

Elsen Ronando, Sozo Inoue

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology, Kitakyushu, Japan(九州工学院生命科学与系统工程研究生院,日本)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的示例选择方法,通过语义先验和结构几何线索提升少样本可穿戴传感器人体活动识别的性能。

Comments This paper has been accepted for presentation at ABC 2026. The manuscript is under revision prior to camera-ready submission

Journal ref International Journal of Activity and Behavior Computing 2026, Vol. 2026, No. 1, 1-34

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17715 2026-07-21 cs.CL 新提交 57%

C$^2$KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference

C$^2$KV:用于高效大语言模型推理的压缩可组合键值缓存重用

Chuheng Du, Junyi Chen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Chaoyue Niu, Shengzhong Liu, Guihai Chen, Fan Wu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 研究针对长上下文LLM推理成本高问题,提出C$^2$KV框架,联合优化KV提取与推理拼接,学习可组合压缩的KV缓存流形,引入轻量级边车提取器及协同训练策略,显著降低缓存成本,实现推理加速并保持生成质量。

Comments 12 pages, 9 figures, accepted by ACM SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16673 2026-07-21 cs.CL 新提交 57%

SpecLA: Efficient Speculative Decoding for Linear-Attention Models

SpecLA:线性注意力模型的高效推测解码

Zhibin Wang, Xuying Han, Zhaohua Yang, Fuliang Liu, Xue Li, Rong Gu, Sheng Zhong, Chen Tian

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究针对线性注意力模型自回归解码效率低的问题,提出SpecLA推测解码运行时,通过拓扑感知内核验证、存储紧凑因子及置信度修剪等方法,在NVIDIA H100上实现了比自回归解码高达1.70倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16431 2026-07-21 cs.CL 新提交 57%

RIMS: Preference Optimization via Smoothed Multi-pair Aggregation for Small-Scale LLM Retrieval-Augmented Generation

RIMS:通过平滑多对聚合进行偏好优化以实现小规模语言模型检索增强生成

Pei Tian, Zihan Dong, Tianci Liu, Linjun Zhang, Haoyu Wang

机构 * Columbia University(哥伦比亚大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) SUNY Albany(纽约州立大学奥尔巴尼分校)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对小规模语言模型检索增强生成中对噪声证据敏感的问题,提出RIMS框架,通过合成偏好数据、软聚合机制及偏好优化,实现更好性能,在多基准测试中优于现有方法

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16251 2026-07-21 cs.LG 新提交 57%

Learning Spatio-Temporal Foundation Models from Pure Synthetic Data

从纯合成数据中学习时空基础模型

Yutong Feng, Shiyuan Piao, Yutong Xia, Xu Liu, Wenqi Fan, Fugee Tsung, See-Kiong Ng, Yuxuan Liang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16596 2026-07-21 cs.DC 新提交 50%

Cold-Start Model Delivery in Kubernetes Inference Serving: An Empirical Study of OCI-Based Distribution and Its Integrity

Kubernetes推理服务中的冷启动模型交付:基于OCI的分发及其完整性的实证研究

Georgii Kliukovkin

专题命中 测试时计算 :verifier(abstract)

AI总结 研究Kubernetes推理服务中模型冷启动交付问题,通过在KServe平台实现oci+native://和oci+fetch://两条新交付路径进行分析,对比不同交付路径在不同模型大小下的表现,提出服务时完整性设计并验证其对交付时间的影响。

Comments 8 pages, 2 figures, 3 tables. Submitted to IEEE Access. Benchmark harness and data: https://github.com/kliukovkin/oci-model-delivery-bench

详情

展开后加载摘要…

URL PDF HTML 收藏