arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-07 至 2026-07-07 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2607.01237 2026-07-07 cs.CL cs.AI 新提交 88%

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05222 2026-07-07 cs.CV 新提交 78%

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

面向科学传播中图表-图像连贯性锚定的多模态推理类型学

Avina Nakarmi, Sohom Sen, Xun Song, Sreyashi Samaddar, Aritra Dasgupta

机构 * New Jersey Institute of Technology(新泽西理工学院) Brooklyn College(布鲁克林学院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本研究提出R1-R5多模态推理类型学,刻画科学文献中图表、图像与文本的协同推理缺口,可系统识别连贯性锚定状态,缩小不同人群解读科学结论的认知差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02914 2026-07-07 cs.AI 新提交 77%

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models

Oyster-II:大语言模型中用于建设性安全对齐的强化学习

Jiyang Guan, Yong Xie, Jun Chen, Jiexi Liu, Zipeng Ye, Defeng Li, Jiayu Shen, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴人工智能全球研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究大语言模型安全等问题,指出传统策略不足。基于Oyster-I范式,提出Oyster-II框架,采用强化学习结合零强化学习范式,在多基准测试中安全维度表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03333 2026-07-07 cs.DC cs.AI cs.LG 新提交 73%

SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

SPORK:自我推测性分叉以加速智能体大语言模型推理

Huajun Bai, Weiwei Lv, Huichuan Zheng, Youyou Lu, Jiwu Shu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM智能体推理中串行循环耗时问题,提出SPORK方法,利用模型自身预测提前调度推测工具调用,通过成本模型等组件优化,大幅提升推理效率且不影响任务准确性。

Comments 16 pages, 15 figures. Code: https://github.com/baihuajun24/spork

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07233 2026-07-07 cs.AI 70%

From "Thinking" to "Justifying": Aligning High-Stakes Explainability with Professional Communication Standards

从‘思考’到‘证明’:将高风险可解释性与专业沟通标准对齐

Chen Qian, Yimeng Wang, Yu Chen, Lingfei Wu, Andreas Stathopoulos

机构 * William & Mary(威廉玛丽学院) Anytime AI

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出‘结果->证明’方法,通过结构化可解释性框架SEF提升系统输出的可验证性与可靠性,在三个领域四个任务中验证了该方法的有效性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 24628-24637

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 67%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03953 2026-07-07 cs.CL cs.AI 新提交 62%

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models

为人工智能智能体提供自然语言工具的显著有效性:一项在14个模型上验证自然语言工具性能的复制研究

Alexander Somma, Isabelle Plante, Fred Premji

机构 * Sage.is AI-UI(Sage.is人工智能用户界面)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究独立复制并扩展了自然语言工具(NLT)框架,在14个模型和8560次试验中评估NLT,验证其效果,发现其能提升工具调用准确率、减少关键错误、降低令牌使用量,还证实模型能力对NLT优势有调节作用。

Comments 28 pages, 6 figures, replication study, replication of arXiv:2510.14453 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02944 2026-07-07 cs.LG cs.AI 新提交 62%

A Precedent-Guided Co-Scientist for Side-Effect-Aware Drug Redesign

一种用于副作用感知药物重新设计的先例引导协同科学家

Yujin Kim, Charmgil Hong

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PRECEDE用于副作用感知药物重新设计,将重新设计视为基于证据的推理,由LLM编排,定位为人监督的科学工作流,可审核、证伪且受先前药理学限制。

Comments Accepted at the ICML 2026 Workshop on AI for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12262 2026-07-07 cs.CL cs.LG 版本更新 62%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21545 2026-07-07 cs.LG cs.AI 62%

Evidence for Limited Metacognition in LLMs

对大语言模型有限元认知能力的证据

Christopher Ackerman

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。

Comments 26 pages, 25 figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17484 2026-07-07 cs.CL cs.LG 版本更新 62%

Learning When to Attend: Conditional Memory Access for Long-Context LLMs

学习何时关注:为长上下文LLM的条件记忆访问

Sakshi Choudhary, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez, Matthew Trager, Wei Xia, Stefano Soatto

机构 * Department of Electrical and Computer Engineering, Purdue University, USA(电子工程系,普渡大学,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出L2A方法,通过条件性长程记忆访问提升长上下文LLM性能,使Qwen 2.5和Qwen 3模型的有效上下文长度从32K扩展到128K,同时提升训练效率并减少内存消耗。

Comments 26 pages, 11 Tables, 18 Figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-07-07 cs.AI cs.NE 新提交 57%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments A First draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04469 2026-07-07 cs.CL 新提交 57%

Don't Commit Alone: Joint Token Commitment in Diffusion Large Language Models

不要单独提交:扩散大语言模型中的联合令牌提交

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究扩散大语言模型中多令牌提交问题,提出CoCommit方法,通过标记门控协调步骤延迟提交,重新应用骨干网络最后n层使标记位置协调,近似联合模式解码,提高推理和精确答案任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 57%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03350 2026-07-07 cs.CR cs.AI cs.SE 新提交 57%

LLM-Enhanced Hierarchical Heterogeneous Graph Representation Learning for Malicious Python Package Detection

用于恶意Python包检测的基于大语言模型增强的分层异构图表示学习

Hang Gao, Xiaoyu Chen, Baoquan Cui, Zhen Tang, Peng Qiao, Fengge Wu, Jian Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出用于恶意Python包检测的LLM增强分层异构图表示学习框架,构建分层异构代码图,利用LLMs推理功能语义角色,开发分层异构图神经网络并结合功能级归因机制,实验表明该框架性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02551 2026-07-07 cs.CV cs.AI 新提交 57%

DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences

DELTAVID:利用跨视频差异增强细粒度时空感知

Yankai Yang, Yancheng Long, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Kuaishou Technology(快手科技)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对视频多模态大语言模型缺乏精确局部时空感知问题,提出DELTAVID框架,将跨视频找差异转化为可训练感知信号,还引入相关数据集,提升了跨视频差异理解性能并能迁移到通用视频理解基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 57%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08269 2026-07-07 cs.NE cs.AI 版本更新 57%

A Systematic Survey on Large Language Models for Evolutionary Optimization: From Modeling to Solving

关于用于进化优化的大语言模型的系统综述:从建模到求解

Yisong Zhang, Ran Cheng, Guoxing Yi, Kay Chen Tan

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04816 2026-07-07 cs.RO 新提交 50%

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 其他推理 :reasoning(abstract)

AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03766 2026-07-07 cs.SE 新提交 50%

Semantic-aware and Self-improving Program Reduction via Agentic Large Language Models

通过智能大语言模型实现语义感知和自我改进的程序简化

Xintong Zhou, Hongxu Xu, Chunhao Liao, Puzhuo Liu, Yongqiang Tian, Chengnian Sun

专题命中 其他推理 :reasoning(abstract)

AI总结 研究将程序简化作为由智能大语言模型驱动的自主推理任务,方法是让模型分析语义、提出假设并迭代改进,还能提炼经验,PROJ框架实现该方法,实验表明其优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02571 2026-07-07 cs.CV 新提交 50%

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))

专题命中 其他推理 :reasoning(abstract)

AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20659 2026-07-07 cs.RO 版本更新 50%

StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models

StageCraft: 通过执行意识缓解VLA模型中干扰和障碍故障

Kartikay Milind Pangaonkar, Prabin Rath, Omkar Patil, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 StageCraft通过利用大规模视觉语言模型进行推理,改进预训练VLA策略性能,通过操控环境初始状态避免执行故障,实现在三个真实任务领域中性能提升40%。

Comments Accepted to IEEE International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏