arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 17 篇

2608.00583 2026-08-04 cs.CR cs.AI cs.CL cs.LG 新提交 88%

A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense

虚假的平均值:思维链监控在其作为唯一防御的地方失效

Shikhar Shiromani, Leo Richter

专题命中 逻辑推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出思维链监控在作为唯一防御时会失效,攻击者通过重写智能体推理可大幅降低监控捕获率,攻击可跨模型迁移,仅轨迹防御难恢复,需外部信息辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01078 2026-08-04 cs.CL cs.AI 新提交 84%

Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization

关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao

机构 * Intel Labs China(英特尔中国实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。

Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 80%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01534 2026-08-04 cs.CV 新提交 78%

Recursive Vision Language Models for General Symbolic Reasoning

用于通用符号推理的递归视觉语言模型

Omid Nejati Manzari, Guillaume Lajoie, Hassan Rivaz

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11385 2026-08-04 cs.CV 版本更新 75%

DeceptionX: From Multimodal Evidence to Explainable Deception Detection

DeceptionX: 基于多模态大语言模型的可解释欺骗检测

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Yelin Wang, Hui Ma, Zitong Yu

机构 * Great Bay University(大湾区大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00878 2026-08-04 cs.IT math.IT 新提交 71%

Goal-Oriented Logic-based Semantic Communication for Neuro-Symbolic Reasoning with Applications onto Autonomous Driving

面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理

Ahmet Faruk Saz, Duo Xu, Faramarz Fekri

专题命中 逻辑推理 :reasoning(title)

AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10880 2026-08-04 cs.CV 版本更新 71%

Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation

图表规范:用于促进VLM在图表到代码生成中推理的结构表示

Minggui He, Mingchen Dai, Jian Zhang, Yilun Liu, Shimin Tao, Pufan Zeng, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University(早稻田大学) University of Science and Technology of China(中国科学技术大学) NanKai University(南开大学)

专题命中 逻辑推理 :reasoning(title)

AI总结 本文提出图表规范,通过结构化中间表示提升VLM在图表到代码生成中的结构保真度,实验显示其在数据效率和性能上优于现有方法。

Comments Accepted by Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01763 2026-08-04 cs.CR cs.AI cs.LO cs.SE 新提交 57%

EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径

Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne, Paulo Shakarian, Dana Warmsley, Nigel Stepp, Evelyn Kim

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01528 2026-08-04 cs.LG 新提交 57%

Gram-Space: Structure-Preserving Codebook Compression for Memory-Efficient Neuro-Symbolic AI

Gram-Space:面向内存高效神经符号AI的结构保持码本压缩

Weilun Wang, Wantong Li

机构 * University of California Riverside(加州大学河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Gram-Space压缩框架,通过格拉姆-施密特正交化保留VSA所需点积结构,可降低神经符号AI模型GPU内存使用与推理延迟,提升硬件利用率。

Comments International Conference on Neuro-symbolic Systems (NeuS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 57%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 57%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01132 2026-08-04 cs.CL 版本更新 57%

Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation

不要只看封面判断一本书:测试LLMs在逻辑混淆下的鲁棒性

Abhilekh Borah, Shubhra Ghosh, Kedar Joshi, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Manipal University Jaipur(马纳普大学贾普尔分校) Indian Institute of Technology, Patna(印度理工学院帕坦分校) Indian Institute of Science Education and Research, Kolkata(印度科学教育与研究学院科钦分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出Logifus框架和LogiQAte基准,测试LLMs在逻辑混淆下的鲁棒性,发现混淆显著降低模型性能,揭示当前LLMs缺乏深度理解。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-04 cs.AR 新提交 50%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00678 2026-08-04 cs.CV 新提交 50%

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

打破水平先验:从长尾方向偏差到抗翻滚单目深度估计

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该研究针对单目深度估计中受水平先验(长尾方向偏差)导致的相机翻滚鲁棒性差问题,提出训练时监督策略ID-Constraint,经多基准数据集实验验证了方法的有效性。

Comments The code is publicly available on GitHub: https://github.com/KaihuaTang/Horizontal-Prior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00629 2026-08-04 cs.GR 新提交 50%

ParticleGen: A Multi-Agent System for Particle Effects Generation

ParticleGen:用于粒子效果生成的多智能体系统

Junhao Zhuge, Junyi Yang, Yuqing Wang, Kangzhan Wang, Sipeng Yang, Xiaogang Jin

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究提出多智能体框架ParticleGen,可从自然语言描述合成结构化可编辑粒子系统,经Unreal Engine 5的Niagara系统多场景验证,能降低创作门槛、提升迭代效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00490 2026-08-04 cs.CV 新提交 50%

Image-Space Rule Discovery

图像空间中的规则发现

Misora Sugiyama, Toya Oyama, Hirokatsu Kataoka

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology (AIST)(独立行政法人产业技术综合研究所) University of Oxford(牛津大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究提出WISRD基准测试图像编辑模型的图像空间规则发现能力,发现Nano Banana Pro表现最优,当前模型可部分依赖图像内指令,且该模型在4×4数独等任务上有一定性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00886 2026-08-04 cs.SE econ.GN math.OC q-fin.EC 新提交 50%

Joint Optimization of Human Headcount and Stochastic AI Resource Capacity

人力资源配置与随机AI资源容量的联合优化

Marco Montes de Oca

专题命中 逻辑推理 :planning(abstract)

AI总结 本文针对生成式AI工具带来的成本压力,构建联合分配模型优化人力资源与AI令牌容量,得出相关最优解及替代关系反转的实证检验条件。

Comments 16 pages, 4 figures. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏