arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-30 至 2026-07-30 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 7 篇

2604.03701 2026-07-30 cs.CV 版本更新 82%

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

VidNum-1.4K:一个全面的视频基于数值推理基准

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07515 2026-07-30 eess.SY cs.SY 版本更新 78%

Domain-Aware Machine Learning for Accelerating MILP-Based Motion Planning with Temporal Logic and Chance Constraints

神经符号加速基于MILP的运动规划与时间逻辑和随机约束

Junyang Cai, Weimin Huang, Brendan Long, Matthew Cleaveland, Jyotirmoy V. Deshmukh, Lars Lindemann, Bistra Dilkina

专题命中 逻辑推理 :planning(title,abstract)

AI总结 本文提出利用神经符号方法加速MILP运动规划,通过机器学习指导求解器的符号搜索,提升处理时间逻辑、随机约束等复杂规划问题的效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26903 2026-07-30 cs.AI cs.RO 新提交 70%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 逻辑推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26602 2026-07-30 cs.NI cs.LG 新提交 57%

Harnessing Large Language Models for Intelligent Resource Allocation in the Internet of Everything

利用大语言模型实现万物互联环境下的智能资源分配

Haijun Zhang, Zhuojun Duan, Zijun Wu, Xu Ma, Yuzheng Ren

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对万物互联的动态资源调度挑战,提出大语言模型驱动的资源分配方案,构建多维调度决策模型并引入反馈模块,仿真显示其在收敛速度等指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 57%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交 57%

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18651 2026-07-30 cs.CR 版本更新 50%

TGCM: Topic-Guided Consistency Modeling for One-Step Disentanglement of Interleaved APT Technique Sequences

TGCM: 主题引导的生成式解缠交错APT技术序列

Guo-Wei Wong, Ming-Chuan Yang, Shou-De Lin, Wang-Chien Lee, Meng Chang Chen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出TGCM框架,利用一致性模型和MITRE ATT&CK主题先验,从交错的多源APT技术序列中直接解缠出单源攻击链,在合成和真实数据集上优于15种基线方法。

Comments 14 pages, Due to arXiv's abstract length limit, the web version of the abstract has been shortened while preserving the paper's original scope, claims, and results. The implementation and experimental artifacts are publicly available at https://irish-kw.github.io/TGCM_Website/

详情

展开后加载摘要…

URL PDF HTML 收藏