arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 133 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 21 篇

2608.04175 2026-08-06 cs.CV 新提交 71%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 其他推理 :reasoning(title)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04980 2026-08-06 cs.CL cs.AI cs.LG 新提交 67%

Protoreasoning in Tiny Transformers

微型Transformer中的原型推理

Eduardo Valle, Fergal Reid

机构 * Fin AI Research(Fin AI研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04289 2026-08-06 cs.AI cs.CL 新提交 62%

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act

SafeCommit:验证基于记忆的智能体何时可以安全行动

Mayur Akewar, Ravi Ranjan

机构 * Florida International University(佛罗里达国际大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对长程智能体过早承诺的问题,提出SafeCommit风险控制层,通过构建合理潜在世界、共形动作证书等实现安全行动决策,还展示了安全-效用权衡。

Comments 14 pages, 6 tables, and 1 figure, target NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 57%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04368 2026-08-06 cs.LG 新提交 57%

EvtGraph: Event-Adaptive Compression for Sparse Temporal Graph Learning in Multimodal Time Series

EvtGraph:面向多模态时间序列稀疏时序图学习的事件自适应压缩方法

Ziqian Wang, Tingxiong Xiao, Yuxiao Cheng, Jinli Suo

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究针对多模态时序数据均匀离散化效率低的问题,提出EvtGraph框架,通过事件自适应压缩等技术实现预算约束下的高效图学习,在多模态临床等基准上性能优于基线且效率显著提升。

Comments 9 page, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04255 2026-08-06 cs.CR cs.LG 新提交 57%

PriDyG: Privacy-preserving Dynamic Graph Inference with LLM-GNN Collaboration

PriDyG:结合大语言模型与图神经网络的隐私保护动态图推理

Yuyang Xia, Ruixuan Liu, Li Xiong

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 PriDyG是结合GNN结构学习与LLM语义推理的隐私保护动态图推理框架,可在边级差分隐私约束下,在节点分类等任务中降低累计隐私开销并保持良好效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02347 2026-08-06 cs.AI 版本更新 57%

Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

带分层记忆的Mamba:解决长序列建模中的表示瓶颈

Qinwen Wang, Jieping Luo, Aoxiang Qin, Ruoyu Zhao, Jianxiong Tang, Wei Zhang, Zhichao Lu, Luziwei Leng

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hainan Bielefeld University of Applied Sciences(海南比勒费尔德应用科学大学) BrainGalaxy

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出分层记忆Mamba(HMM),通过分层记忆机制解决Mamba类循环线性注意力模型的长序列表示瓶颈,在两项任务上提升性能且参数和训练开销增加极少。

Comments 19 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28750 2026-08-06 cs.SE cs.AI 版本更新 57%

DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing

DragonCrawl:一种用于可扩展移动端到端测试的生成式意图框架

Sowjanya Puligadda, Mengdie Zhang, Ali Zamani, Dhruva Dixith Kurra, Eric Chen, Juan Marcano

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DragonCrawl是基于GPT-4o多模态的移动端到端测试框架,通过验证用户流程阻止问题提交,缩短测试入门时间,节省大量维护工作量,实现规模化持续质量保证。

Comments 12 pages, 6 figures, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04843 2026-08-06 cs.IR 新提交 50%

MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off

MemoryCPT:用于成本-性能权衡的端到端智能体记忆框架

Songxin Lei, Kun Ouyang, Weilin Ruan, Yuqian Wu, Zhijiang Guo, Yushi Sun, Fugee Tsung

专题命中 其他推理 :reasoning(abstract)

AI总结 MemoryCPT是一种端到端可训练的智能体记忆框架,通过QAD和QAR阶段优化记忆处理,在LoCoMo和LongMemEval数据集上实现了更优的成本-性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 50%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 50%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04020 2026-08-06 cs.CY cs.GT 新提交 50%

Artificial Institutions: How Institutional Design Shapes LLM Simulations

人工制度:制度设计如何塑造大语言模型(LLM)模拟

Maxim Chupilkin

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究LLM智能体构建的人工社会,通过控制变量实验发现,五种市场制度的规则差异会显著改变市场结果,证明制度架构对人工社会模拟的重要影响。

Comments 19 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02323 2026-08-06 cs.SE 版本更新 50%

ECLAIR: A Causally-Grounded AI Framework for Scientific Discovery in Empirical Software Engineering

ECLAIR:一种用于实证软件工程科学发现的因果基础AI框架

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Denys Poshyvanyk

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出因果基础AI框架ECLAIR,将LLMs整合到软件工程科学过程各阶段,通过案例研究揭示提示设计对LLMs代码生成准确率的影响,为AI辅助软件工程实证研究提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏