arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 21 篇

2604.14888 2026-08-06 cs.CL cs.AI cs.CV cs.LG 版本更新 90%

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

推理动态与监控模态依赖性的局限性

Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott

机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。

Comments Accepted for publication in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 85%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05547 2026-08-06 cs.CL cs.AI cs.LG 版本更新 82%

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

多任务GRPO:跨任务的可靠大语言模型推理

Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong Wang, Haitham Bou Ammar, Aurelien Lucchi, Ilija Bogunovic

机构 * UCL Department of EEE(伦敦大学学院电子工程系) UCL Centre for AI(伦敦大学学院人工智能中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UNIST Graduate School of AI(延世大学人工智能研究生院) University of Edinburgh(爱丁堡大学) University of Basel(巴塞尔大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MT-GRPO算法,通过动态调整任务权重和比例保持采样器,提升多任务场景下大语言模型的可靠推理性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04160 2026-08-06 cs.CL cs.LG 新提交 81%

Mind the Cap: Output-Budget Regimes Change the Measured Multilingual Reasoning Gap

注意输出上限:输出预算机制会改变测得的多语言推理差距

Ankit Goyal, Jaideep Ray

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究发现多语言推理差距受输出token预算机制影响,通过固定Qwen模型的预算峰值等实验,提出应将输出上限作为独立变量,报告不同预算机制下的准确率。

Comments 15 pages, 2 figures, 11 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 81%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04646 2026-08-06 cs.CL 新提交 79%

Evaluating Theory of Mind in Reasoning Models: Robustness over Reasoning

评估推理模型中的心理理论:推理的鲁棒性

Ian B. de Haan, Peter van der Putten, Max van Duijn

机构 * Leiden University(莱顿大学) LIACS(莱顿高级计算机科学研究所)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究考察经强化学习训练的推理LLMs在ToM任务中的表现,发现其对提示与任务扰动的鲁棒性提升,支持鲁棒性解释而非ToM特有的新能力。

Comments Accepted for 29th International Conference on Discovery Science, October 5-9, 2026, Mainz, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04011 2026-08-06 cs.CY cs.AI 新提交 79%

Towards a New Grammar of Reasoning for Artificial Legal Intelligence and the Mecelle as Its Semantic Protocol

迈向人工智能法律智能的新推理语法:以《梅塞莱法典》作为其语义协议

Ali Goksu, F. Gozde Kardes, Mustafa Yaylali

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对传统法律实践的认知与方法论危机,提出以《梅塞莱法典》语义协议为核心的本体动态框架,指出法律推理不可简化为数据处理,需结合神经符号系统等技术解决法律挑战,为AI时代法律推理提供新范式。

Comments 123 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05451 2026-08-06 cs.LG cs.CL 版本更新 76%

RingSQL: Schema-Independent Synthetic Data Generation for Text-to-SQL Reinforcement Learning

RingSQL: 通过不依赖模式的模板生成合成数据以用于文本到SQL推理模型

Marko Sterbentz, Kevin Cushing, Cameron Barrie, Kristian J. Hammond

专题命中 其他推理 :reasoning(title);分类 cs.CL、cs.LG

AI总结 RingSQL通过结合不依赖模式的模板和大语言模型生成,提升文本到SQL模型的准确性和多样性

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 71%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 其他推理 :reasoning(title)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04980 2026-08-06 cs.CL cs.AI cs.LG 新提交 67%

Protoreasoning in Tiny Transformers

微型Transformer中的原型推理

Eduardo Valle, Fergal Reid

机构 * Fin AI Research(Fin AI研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04289 2026-08-06 cs.AI cs.CL 新提交 62%

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

SafeCommit:验证基于记忆的智能体何时可以安全行动

Mayur Akewar, Ravi Ranjan

机构 * Florida International University(佛罗里达国际大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对长程智能体过早承诺的问题,提出SafeCommit风险控制层,通过构建合理潜在世界、共形动作证书等实现安全行动决策,还展示了安全-效用权衡。

Comments 14 pages, 6 tables, and 1 figure, target NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 57%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04368 2026-08-06 cs.LG 新提交 57%

EvtGraph: Event-Adaptive Compression for Sparse Temporal Graph Learning in Multimodal Time Series

EvtGraph:面向多模态时间序列稀疏时序图学习的事件自适应压缩方法

Ziqian Wang, Tingxiong Xiao, Yuxiao Cheng, Jinli Suo

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究针对多模态时序数据均匀离散化效率低的问题,提出EvtGraph框架,通过事件自适应压缩等技术实现预算约束下的高效图学习,在多模态临床等基准上性能优于基线且效率显著提升。

Comments 9 page, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04255 2026-08-06 cs.CR cs.LG 新提交 57%

PriDyG: Privacy-preserving Dynamic Graph Inference with LLM-GNN Collaboration

PriDyG:结合大语言模型与图神经网络的隐私保护动态图推理

Yuyang Xia, Ruixuan Liu, Li Xiong

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 PriDyG是结合GNN结构学习与LLM语义推理的隐私保护动态图推理框架,可在边级差分隐私约束下,在节点分类等任务中降低累计隐私开销并保持良好效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02347 2026-08-06 cs.AI 版本更新 57%

Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

带分层记忆的Mamba:解决长序列建模中的表示瓶颈

Qinwen Wang, Jieping Luo, Aoxiang Qin, Ruoyu Zhao, Jianxiong Tang, Wei Zhang, Zhichao Lu, Luziwei Leng

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) BrainGalaxy

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出分层记忆Mamba(HMM),通过分层记忆机制解决Mamba类循环线性注意力模型的长序列表示瓶颈,在两项任务上提升性能且参数和训练开销增加极少。

Comments 19 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 57%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04843 2026-08-06 cs.IR 新提交 50%

MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off

MemoryCPT:用于成本-性能权衡的端到端智能体记忆框架

Songxin Lei, Kun Ouyang, Weilin Ruan, Yuqian Wu, Zhijiang Guo, Yushi Sun, Fugee Tsung

专题命中 其他推理 :reasoning(abstract)

AI总结 MemoryCPT是一种端到端可训练的智能体记忆框架,通过QAD和QAR阶段优化记忆处理,在LoCoMo和LongMemEval数据集上实现了更优的成本-性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 50%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 50%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04020 2026-08-06 cs.CY cs.GT 新提交 50%

Artificial Institutions: How Institutional Design Shapes LLM Simulations

人工制度:制度设计如何塑造大语言模型(LLM)模拟

Maxim Chupilkin

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究LLM智能体构建的人工社会,通过控制变量实验发现,五种市场制度的规则差异会显著改变市场结果,证明制度架构对人工社会模拟的重要影响。

Comments 19 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02323 2026-08-06 cs.SE 版本更新 50%

ECLAIR: A Causally-Grounded AI Framework for Scientific Discovery in Empirical Software Engineering

ECLAIR:一种用于实证软件工程科学发现的因果基础AI框架

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Denys Poshyvanyk

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出因果基础AI框架ECLAIR,将LLMs整合到软件工程科学过程各阶段,通过案例研究揭示提示设计对LLMs代码生成准确率的影响,为AI辅助软件工程实证研究提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏