arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-07 至 2026-07-07 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 17 篇

2607.04854 2026-07-07 cs.AI 新提交 83%

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

CARL:用于大语言模型规划的约束感知强化学习

Qiuyi Qi, Jinjian Zhang, Mutian Bao, Tian Liang, Guocong Li, Dongnan Liu, Wei Zhou, Jie Liu, Ming Kong, Linjian Mo, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型生成违反任务约束计划的问题,提出约束感知强化学习框架CARL,通过比较不同输入下模型输出分布引入奖励,提升模型约束意识,实验证明其优于基线和现有模型。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03325 2026-07-07 cs.CL cs.AI cs.IR 新提交 81%

From Judgments to Issues: Structured Extraction of Legal Reasoning with Citation-Hallucination Control

从判决到问题:具有引用幻觉控制的法律推理结构化提取

Giovanni Piccioli, Alessia Fidelangeli, Piera Santin, Pierpaolo Vivo

机构 * Quantitative and Digital Law Laboratory(量化与数字法律实验室) CIRSFID - Alma AI, Faculty of Law University of Bologna(CIRSFID - 阿尔玛AI,博洛尼亚大学法学院) Robert Schuman Centre European University Institute(罗伯特·施曼中心欧洲大学研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出自动化流程,将意大利税务法庭判决分解为法律问题,基于IRAC框架和法律三段论提取结构化XML表示,用通用模型并结合幻觉检测过滤器处理大量判决,经专家验证,为下游应用提供起点。

Comments 33 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04096 2026-07-07 cs.AI 新提交 79%

Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming

预思考:神经符号原始编程的可验证推理

Vishvesh Bhat, Jay Vaghasiya, Emmanuel Anaya Gonzalez

机构 * CoreThink AI UC San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究改进智能体工作流推理能力问题,提出神经符号推理系统Forethought,将推理视为可验证程序,由符号和神经原语库构建,经特定语言组合,提升了基础模型准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14095 2026-07-07 cs.AI cs.CR 版本更新 77%

NEST: Nascent Encoded Steganographic Thoughts

NEST:新生编码隐写思想

Artem Karpov

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02802 2026-07-07 cs.CL cs.AI 新提交 73%

Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes

被叙事诱惑:评估半开放文本沙盒中的规则遵守情况

Weiying Chen, Junlong Shen, Zhanyuan Guo, Xiaoou Zhou

机构 * University of Alberta(阿尔伯塔大学) Qilu University of Technology(齐鲁工业大学) N-Dice Association(N-Dice协会)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究在半开放文本游戏环境中,当用户意图与系统规则冲突时大语言模型的规则遵守问题。基于桌面角色扮演游戏机制构建多智能体对抗基准CoC-Seduce,用前沿模型生成样本,对20个目标裁决器进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03963 2026-07-07 cs.SE 新提交 71%

Neuro-Symbolic Reasoning for Vulnerability Detection

用于漏洞检测的神经符号推理

Yanjie Zhao, Hongjie Chen, Li Lu, Zhou Yang, Xiao Cheng, Haoyu Wang

专题命中 逻辑推理 :reasoning(title)

AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03561 2026-07-07 cs.AI cs.CC cs.CR cs.LG 新提交 62%

How to Avoid Debate: Scalable AI Safety via Doubly-Efficient Interactive Proofs

如何避免辩论:通过双高效交互式证明实现可扩展的人工智能安全

Liyan Chen, Yael Tauman Kalai, Zoe Xi

机构 * MIT(麻省理工学院)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究如何避免人工智能模型间的辩论来实现安全验证,提出单证明者交互式证明,给出双高效单证明者交互式证明及论证,用于神谕辅助计算,表明无辩论时交互式验证也可行。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01685 2026-07-07 cs.CL cs.AI cs.MA 62%

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

用真理欺骗:通过生成蒙太奇进行开放式通道多智能体合谋以操纵信念

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了通过公开通道分发真实证据片段,利用多智能体合谋操纵信念的新威胁,提出了生成蒙太奇框架,展示了在14种LLM家族中74.4%的攻击成功率,并揭示了更强的推理能力反而增加了易受攻击的风险。

Comments Accepted to the ACL 2026 Main Conference (Oral Presentation)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 5979-5996, San Diego, California, United States, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05168 2026-07-07 cs.AI cs.LO 新提交 57%

The Changing Role of Symbolic Methods in Artificial Intelligence

符号方法在人工智能中不断演变的角色

Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出压缩原理与建模-推理权衡,指出显式符号推理是简化现实模型的计算产物,未来符号方法将成为高能力AI与人类间的交互接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05123 2026-07-07 cs.AI cs.CV 新提交 57%

ASSEMCAD: Production-Ready CAD Assembly Generation from Natural Language

ASSEMCAD:从自然语言生成可用于生产的CAD装配体

Yurui Dong, Shu Zou, Siqi Li, Nianchen Deng, Hongbin Zhou, Xuemeng Yang, Pinlong Cai, Licheng Wen, Xinyu Cai, Botian Shi

机构 * Computer-aided design (CAD) briere2012comparing models(计算机辅助设计(CAD)模型)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究如何从自然语言生成可用于生产的CAD装配体,提出公理基础框架AssemCAD,通过构建公理装配规范、引入特定CAD装配库等方法,提升装配体生成质量,扩展文本到CAD设计。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03847 2026-07-07 cs.LG 新提交 57%

NeSy-CSA: A Neuro-Symbolic Framework for Open-Ended Critical Scenario Attribution

NeSy-CSA:一种用于开放式关键场景归因的神经符号框架

Qitong Chu, Xunjie He, Chen Deng, Huaxin Pei, Yufeng Yue

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 研究如何理解场景测试中关键场景的成因,提出神经符号框架NeSy-CSA,通过选择相关因素缩小归因空间,经证据图使推理可追溯,结合符号与神经推理,提升关键场景归因有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 57%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02907 2026-07-07 cs.CV cs.CL 新提交 57%

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

ProLaViT:在结构化潜在空间中学习渐进式潜在视觉思维

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

机构 * Basic Algorithm Center, PCG, Tencent(腾讯PCG基础算法中心) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多模态大语言模型在复杂视觉推理任务中的不足,ProLaViT框架利用内生自蒸馏机制等,设计两种推理范式及损失函数,使其能在潜在空间进行结构化视觉推导,实验证明效果优于基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03661 2026-07-07 cs.CV 新提交 50%

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

使用多模态大语言模型从几何标签到室内建筑组件的语义理解

Shuju Jing, Chao Yin

机构 * School of Qilu Transportation, Shandong University(山东大学齐鲁交通学院) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省地理研究所)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对室内建筑组件,提出以点云为中心的多模态大语言模型Building-MLLM,通过特定机制解决语义集中问题,开发引擎编译数据集,实验表明其在多任务上表现优异,提升室内组件语言理解。

Comments 46 pages, 13 figures, accepted by Automation in Construction journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03601 2026-07-07 cs.AR 新提交 50%

ArchEval: Measuring AI Agents as Computer Architects

ArchEval:将人工智能代理作为计算机架构师进行评估

Chenyu Wang, Zishen Wan, Jeffrey Ma, Shvetank Prakash, Zhenting Qi, Haebin Do, Andy Cheng, Arya Tschand, Jiahe Shi, Yilun Du, Vijay Janapa Reddi

专题命中 逻辑推理 :verifier(abstract)

AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11770 2026-07-07 cs.SE 50%

Enhancing Program Repair with Specification Guidance and Intermediate Behavioral Signals

通过规范引导和中间行为信号增强程序修复

Minh Le-Anh, Cuong Chi Le, Tien N. Nguyen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 SpecTune通过整合中间行为推理提升程序修复,利用执行检查点分解修复任务,生成局部后置条件以识别程序行为偏差,结合规范验证信号和判别信号提高修复精度和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08387 2026-07-07 cs.CV 版本更新 50%

AULLM++: Structured-Token-Conditioned Large Language Models for Micro-Expression Action Unit Detection

AULLM++:用于微表情动作单元检测的结构化令牌条件大语言模型

Zhishu Liu, Kaishen Yuan, Bo Zhao, Hui Ma, Zitong Yu

机构 * Great Bay University(广东东莞大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对微表情动作单元检测,以往方法有局限。本文提出AULLM++框架,利用大语言模型,将视觉特征注入文本提示,分证据构建、结构建模和基于推理预测三阶段,融合多粒度证据等,提升性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏