arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-24 至 2026-07-24 共收录 108 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 28 篇

2607.20868 2026-07-24 cs.CV 新提交 50%

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

ViSTR-Bench:多模态大语言模型能否从动态场景中的连续视觉线索进行推理?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhongguancun Academy(中关村科学城) School of Engineering, Westlake University(西湖大学工学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究聚焦多模态大语言模型在动态场景中从连续视觉线索推理的能力,提出ViSTR-Bench评估套件,基于相关原则建立四维评估,含15个子任务和1340个问答对,经评估发现当前模型在复杂时空推理上有瓶颈,远不及人类。

Comments 37 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19372 2026-07-24 eess.IV q-bio.QM 版本更新 50%

endoExplain: A reproducible protocol for auditing score-localisation discordance in colonoscopy image classifiers

超越人工智能辅助结肠镜检查中的置信度:一种用于内镜人工智能审查的空间、时间和质量感知审计框架

Roberto Alcaraz Machado, Ana Lucía Rodríguez Blanco

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对AI辅助结肠镜检查中仅置信度不能全面评估预测的问题,提出EndoExplain审计框架,整合多种要素。通过实验展示了分类器和分割器的性能,还验证了归因方法等,该框架能分离多种信号,为临床审查提供支持,是回顾性研究原型。

Comments 18 pages, 5 figures, 5 tables. Substantially revised version with a new title and scope; added calibration analysis, paired multi-CAM evaluation, random-deletion controls, architecture and seed robustness analyses, and frozen external spatial transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02006 2026-07-24 cs.SE 版本更新 50%

An Agentic Approach Towards Replication Package Quality Evaluation

面向复制包质量评估的智能体方法

Maximilian Alexander Amougou Mbida, Florian Angermeir

专题命中 推理评测 :planning(abstract)

AI总结 提出一种多智能体方法,将开放科学指南转化为机器可验证标准,自动检查复制包质量并生成改进报告,初步评估显示高一致性和正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 50%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 14 篇

2602.13904 2026-07-24 cs.AI 版本更新 90%

Diagnosing Pathological Chain-of-Thought in Reasoning Models

诊断推理模型中的病理链式思维

Manqing Liu, David Williams-King, Ida Caspary, Linh Le, Hannes Whittingham, Puria Radmard, Cameron Tice, Edward James Young

机构 * Department of Epidemiology, CAUSALab, Harvard University, Boston, USA(流行病学系、CAUSALab、哈佛大学) Imperial College London, London, UK(伦敦帝国学院) McGill University, Montreal, Canada(麦吉尔大学) Geodesic Research, Cambridge, UK(Geodesic研究)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种评估链式思维推理模型中病态的实用工具,通过定义具体度量标准和训练特定模型生物来识别和区分三种不同的病态现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21433 2026-07-24 cs.CL cs.AI cs.LG 新提交 89%

Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models

思维链模型中令牌预算饱和与推理不收敛的机制早期检测

Renuka Oladri, Niveda Jawahar, Abdirisak Mohamed

机构 * University of Maryland(马里兰大学) SAP Labs, LLC(思爱普实验室有限责任公司)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究思维链模型的双峰收敛模式,通过在特定令牌位置的隐藏状态激活上训练线性探针,发现收敛命运可在生成结束前于中间表征中部分编码,为早期退出推理和自适应计算分配开辟道路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20440 2026-07-24 cs.CL cs.AI 新提交 81%

Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility

先回答再编辑:用于保留效用的反蒸馏的推理骨架编辑

Fan Li, Mengting Pan, Sijia Xu, Xiaoyang Wang, Chen Chen, Wenjie Zhang

机构 * School of Computer Science and Engineering, UNSW Sydney(新南威尔士大学计算机科学与工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对专有大语言模型易受知识蒸馏影响的问题,提出骨架引导推理编辑框架SGRE,通过先回答再编辑的方式,借鉴认知负荷理论对推理痕迹进行修改,在降低蒸馏效果的同时保持推理准确性和痕迹自然度。

Comments 21 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20500 2026-07-24 cs.AI 新提交 79%

FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts

FlowEdit:针对涉及冲突的不适定问题的大语言模型推理流的信息论控制

Sizhe Tang, Guangyu Jiang, Yu Li, Rongqian Chen, Ioannis G. Kevrekidis, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对开放世界中因条件冲突等导致的不适定问题,提出FlowEdit框架利用信息论原理控制大语言模型推理流,能生成多样替代响应,实验证明其优于专有模型,提升了准确率和响应信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21558 2026-07-24 cs.AI 新提交 74%

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

超越谄媚:大语言模型道德推理中的结构化抵抗与顺从

Baihui Wang, Bernard Koch

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21291 2026-07-24 cs.CL cs.LG 新提交 62%

Adaptive Depth Sparse Framework: Similarity-Driven Resource Allocation for Pre-Trained LLMs

自适应深度稀疏框架:基于相似性驱动的预训练语言模型资源分配

Yidu Wu, Xiang Wang, Kejie Zhao, Zhangchi Wang, Qinghai Guo, Xiaoying Tang

机构 * Southern University of Science and Technology(南方科技大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究针对预训练语言模型推理成本高的问题,提出自适应深度稀疏框架AdaDSF,基于层输入输出隐藏状态余弦相似性分配令牌保留率,用轻量级路由器选择信息令牌,在多任务中大幅降推理FLOPs且精度退化小。

Comments Accepted by ICIC 2026. 12 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20557 2026-07-24 cs.LG cs.AI 新提交 62%

Monkey King Bang: A Unified Scientific Multimodal Foundation Model

孙悟空爆炸:一个统一的科学多模态基础模型

Hesen Chen, Xinyu Su, Xiaomeng Yang, Yuetan Lin, Zixiong Yang, Junyi An, Fenglei Cao, Yifeng Jiao, Yunqi Zhang, Yuan Cheng, Zhiyu Tan, Hao Li, Libo Wu, Yuan Qi

机构 * Shanghai Academy of AI for Science(上海人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对科学多领域推理需求,引入统一科学多模态模型MKB,围绕共享Transformer主干及定制组件构建,涵盖多科学分支。通过两阶段训练,在多方面实验表现出色,证明该范式可行,为跨领域科学多模态探索提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20449 2026-07-24 cs.CL cs.AI 新提交 62%

The Storyteller in the Model: Narrative Pattern Inheritance, Escalation Dynamics, and Alignment Governance in LLMs

模型中的讲述者:大语言模型中的叙事模式继承、升级动态和对齐治理

Adam Rigby, Raz Saremi, Azadeh Sohrabinejad, Mehdi Rahimi

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 探讨大语言模型训练中是否吸收人类写作叙事模式并致输出漂移,通过文献综述和跨论文分析发现三个关键模式,包括复制训练数据模式、出现潜在特征及微调带来意外变化,指出叙事漂移是未监测的升级途径,需专门监测工具。

Comments 2 figures, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09504 2026-07-24 cs.CR cs.AI cs.LG 版本更新 62%

AI Security Policy Should Assess Systems, Not Only Models

位置:AI安全政策应针对系统,而非模型

Michael A. Riegler, Inga Strümke

机构 * AI Safety Department(人工智能安全部门) SimulaMet and OsloMet(SimulaMet和奥斯陆计量)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出swarm-attack框架,展示通过协调轻量级LLM代理发现系统漏洞和绕过安全机制的可能性,证明在低成本硬件上可实现零成本安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13792 2026-07-24 cs.AI cs.CL 版本更新 62%

StackingNet: Collective Inference Across Independent AI Foundation Models

StackingNet:跨独立AI基础模型的集体推理

Siyang Li, Chenhao Liu, Dongrui Wu, Zhigang Zeng, Lieyun Ding

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09731 2026-07-24 cs.LG 版本更新 57%

Tight Sample Complexity of Transformers

Transformer的紧样本复杂度

Chenxiao Yang, Nathan Srebro, Zhiyuan Li

机构 * Toyota Technological Institute at Chicago(丰田技术研究所芝加哥分校)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.LG

AI总结 本文刻画了深度L、总参数W的Transformer的VC维,并建立了思维链学习的样本复杂度上下界,揭示了参数与序列长度对学习所需样本量的影响。

Comments in COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01885 2026-07-24 cs.CL 版本更新 57%

Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents

代理记忆:为大语言模型代理学习统一的长期和短期记忆管理

Yi Yu, Liuyi Yao, Yuexiang Xie, Qingquan Tan, Jiaqi Feng, Yaliang Li, Libing Wu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Agentic Memory框架,统一管理大语言模型的长期和短期记忆,通过分步GRPO和三阶段强化学习提升记忆效率与任务表现。

Comments ACL'26 SAC Highlight. The code is available at https://github.com/y1y5/AgeMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 50%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 其他推理 :reasoning(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21333 2026-07-24 cs.IR 新提交 50%

SHIFT: Self-reconstruction Harnesses Implicit Fine-grained Thinking for Retrieval

SHIFT:自我重建利用隐式细粒度思维进行检索

Yuxiao Luo, Da Li, Mingjie Zhang, Zhentao He, Shikun Zhang, Wei Ye

专题命中 其他推理 :reasoning(abstract)

AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏