arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3027 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3027 篇

2607.11308 2026-07-14 cs.SE cs.CR 新提交 50%

FlowArk: Boosting Agentic Data-flow Analysis for Android Apps via Context-Aware Knowledge Reuse

FlowArk:通过上下文感知知识重用提升安卓应用的智能数据流分析

Yiming Zhang, Jiangrong Wu, Yuhong Nan

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究安卓应用数据流分析中批量任务重复分析成本高的问题,提出FlowArk系统,通过提炼、打包和注入知识条目降低成本,实验表明其在保持分析质量的同时,能降低API成本并增加任务完成量。

Comments 12 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10340 2026-07-14 cs.AR 新提交 50%

When Fuzzing Meets Understanding: LLM-Driven Semantic Test Generation for RTL Verification

当模糊测试与理解相遇:用于RTL验证的大语言模型驱动的语义测试生成

Kun Wang, Cangyuan Li, Kaiyan Chang, Siyang Cai, Yinhe Han, Ying Wang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对硬件验证难题,提出ChipFuzzer框架,利用大语言模型语义推理能力。采用双阶段工作流程,覆盖引导阶段结合控制流分析提升覆盖率,错误引导阶段借助历史数据提高错误发现率,实验显示其显著提升验证效果。

Comments 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10011 2026-07-14 cs.CY 新提交 50%

Religion and Artificial Intelligence as Distributed Meaning Systems: A Naturalistic Conceptual Model

宗教与人工智能作为分布式意义系统:一种自然主义概念模型

Dhushy Thillaivasan, Samar Shailendra, Sohag Sarkar

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该文将宗教与人工智能视为结构相似的分布式意义系统,源于相同底层认知架构。通过概念模型展示意义的产生等过程,宗教与当代AI系统有类似功能,此模型解释相关机制并阐明AI成意义权威的条件,提供统一框架理解二者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09176 2026-07-13 cs.CR 新提交 50%

SherAgent: Scaling Attack Investigation in the Wild via LLM-Empowered Iterative Query-Filter Backtracking

SherAgent:通过大语言模型赋能的迭代查询-过滤回溯在野外扩展攻击调查

Zhenyuan Li, Zhengkai Wang, Ling Jiang, Xiangmin Shen, Ruixiao Lin, Sen Nie, Shi Wu, Shouling Ji

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对野外攻击调查中依赖爆炸和因果链碎片化问题。提出SherAgent系统,基于大语言模型,采用迭代“查询-过滤”回溯范式处理非结构化数据,克服相关问题。相比传统方法,提高调查成功率,且运行高效,减轻专家分析负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08809 2026-07-13 cs.CR cs.NI 新提交 50%

Privacy-Preserving Intent Fulfilment and Assurance for 6G RAN

6G无线接入网的隐私保护意图实现与保证

Joss Armstrong

专题命中 逻辑推理 :verifier(abstract)

AI总结 研究6G无线接入网隐私保护意图实现与保证问题,提出一种架构,协调器依意图类别分配资源且仅用O1接口计数器验证,定义隐私属性并证明其成立,映射到相关框架确定运行点,实验表明意图类别粒度变化对分配和保证有相应影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08529 2026-07-10 cs.IR 新提交 50%

Log-Insight: Automating Microservice Incident Diagnosis via Neuro-Symbolic Log Analysis

Log-Insight:通过神经符号日志分析实现微服务事件诊断自动化

Carlos Garcia-Hernandez, Aymane Abdali, Guangyu Wu, Mingxue Wang, Fei Shen, Zhaoyu Pang, Yanbin Zhang

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对大规模微服务系统生产事件诊断难题,提出Log-Insight系统,通过自动化SRE手动分类工作流程,经符号阶段处理后为LLM提供证据合成假设报告,六阶段管道减少大量原始事件,评估显示该系统能高效准确诊断根本原因,还报告了相关故障模式等内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03661 2026-07-07 cs.CV 新提交 50%

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

使用多模态大语言模型从几何标签到室内建筑组件的语义理解

Shuju Jing, Chao Yin

机构 * School of Qilu Transportation, Shandong University(山东大学齐鲁交通学院) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省地理研究所)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对室内建筑组件,提出以点云为中心的多模态大语言模型Building-MLLM,通过特定机制解决语义集中问题,开发引擎编译数据集,实验表明其在多任务上表现优异,提升室内组件语言理解。

Comments 46 pages, 13 figures, accepted by Automation in Construction journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03601 2026-07-07 cs.AR 新提交 50%

ArchEval: Measuring AI Agents as Computer Architects

ArchEval:将人工智能代理作为计算机架构师进行评估

Chenyu Wang, Zishen Wan, Jeffrey Ma, Shvetank Prakash, Zhenting Qi, Haebin Do, Andy Cheng, Arya Tschand, Jiahe Shi, Yilun Du, Vijay Janapa Reddi

专题命中 逻辑推理 :verifier(abstract)

AI总结 介绍用于评估大语言模型代理在计算机架构设计与优化方面的ArchEval基准和平台,含20个挑战及8个模拟器,通过不同设置运行,报告性能并记录轨迹,揭示当前代理的优缺点及后续所需能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11770 2026-07-07 cs.SE 50%

Enhancing Program Repair with Specification Guidance and Intermediate Behavioral Signals

通过规范引导和中间行为信号增强程序修复

Minh Le-Anh, Cuong Chi Le, Tien N. Nguyen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 SpecTune通过整合中间行为推理提升程序修复,利用执行检查点分解修复任务,生成局部后置条件以识别程序行为偏差,结合规范验证信号和判别信号提高修复精度和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08387 2026-07-07 cs.CV 版本更新 50%

AULLM++: Structured-Token-Conditioned Large Language Models for Micro-Expression Action Unit Detection

AULLM++:用于微表情动作单元检测的结构化令牌条件大语言模型

Zhishu Liu, Kaishen Yuan, Bo Zhao, Hui Ma, Zitong Yu

机构 * Great Bay University(广东东莞大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对微表情动作单元检测,以往方法有局限。本文提出AULLM++框架,利用大语言模型,将视觉特征注入文本提示,分证据构建、结构建模和基于推理预测三阶段,融合多粒度证据等,提升性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01742 2026-07-03 cs.CR cs.SE 新提交 50%

Knowledge Over Parameters: Evolving Smart Contract Vulnerability Detection

知识超越参数:演化智能合约漏洞检测

Yuqiang Sun, Han Liu, Ying Li, Yiran Zhang, Zong Cao, Ziyun Guo, Yang Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出EvoVuln框架,将漏洞检测转化为程序性知识演化问题,通过运行时反转控制架构和两阶段演化流水线,仅用少量标注样本自动合成并优化检测逻辑,在五种真实漏洞类型上实现71%宏平均F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01641 2026-07-03 cs.SE 新提交 50%

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

当智能体不停止:揭示LLM智能体中的无限循环

Xinyi Hou, Shenao Wang, Yanjie Zhao, Haoyu Wang

专题命中 逻辑推理 :planning(abstract)

AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31866 2026-07-01 cs.LO cs.MA 新提交 50%

Inquisitive Action Logic

探究性行动逻辑

Ivano Ciardelli

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出探究性行动逻辑InqAL,一种用于推理行动的多主体模态逻辑,通过问题模态分析主体对结果的确定作用,并证明其完备性和可判定性。

Comments In Proceedings AiML 2026, arXiv:2606.29444

Journal ref EPTCS 447, 2026, pp. 222-241

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31339 2026-07-01 cs.RO 新提交 50%

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

验证门控的智能工业多机器人系统任务状态治理

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01173 2026-06-30 cs.CV 50%

EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment

EEmo-Logic:面向全面图像诱发情感评估的统一数据集与多阶段框架

Lancheng Gao, Ziheng Jia, Zixuan Xing, Wei Sun, Huiyu Duan, Guangtao Zhai, Xiongkuo Min

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出最大图像诱发情感理解数据集EEmoDB和统一多模态大语言模型EEmo-Logic,通过指令微调和任务定制GRPO实现细粒度情感问答与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26545 2026-06-26 cs.SE 新提交 50%

ConcoLixir: Reactive LLM Discovery Oracles for Python Concolic Testing

ConcoLixir:用于Python符号执行的响应式LLM发现预言

Dong Chen, Chih-Duo Hong, Fang Yu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25388 2026-06-25 cs.DB 新提交 50%

TabClean: Reusable LLM-Synthesized Programs for Tabular Data Cleaning

TabClean: 用于表格数据清洗的可复用LLM合成程序

Yibo Wang, Riteng Zhang, Yinghao He, Yongye Su, Bharat Bhargava, Chunwei Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04560 2026-06-24 cs.RO 版本更新 50%

From Local Corrections to Generalized Skills: Improving Neuro-Symbolic Policies with MEMO

从局部修正到通用技能:利用MEMO改进神经符号策略

Benjamin A. Christie, Yinlong Dai, Mohammad Bararjanianbahnamiri, Simon Stepputtis, Dylan P. Losey

机构 * Collab Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, USA.(机械工程系,弗吉尼亚理工学院,黑斯堡,美国) TEA Lab(TEA实验室)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对机器人神经符号策略中技能不足的问题,提出MEMO框架,通过收集、聚类和改写多用户自然语言修正,构建检索增强的技能手册,动态扩展技能库,实现新任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21276 2026-06-23 cs.CY 新提交 50%

CEDAR-42001: From ISO/IEC 42001 Conformity to Architecture-Aware, Audit-Visible Assurance Posture for AI Cyber-Physical Systems

CEDAR-42001: 从ISO/IEC 42001符合性到面向架构、可审计可见的AI信息物理系统保障态势

Priyanka Prakash Surve, Asaf Shabtai, Yuval Elovici

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出CEDAR-42001方法,将ISO/IEC 42001审计证据转化为架构感知的保障态势,通过分层归因、成熟度评估和行动推荐,揭示符合性审计的局限性,并在自动驾驶案例中验证。

Comments 19 Pages, 3 figures, 4 tables. Code and data are available in the accompanying artifact repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 50%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 逻辑推理 :planning(abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20607 2026-06-23 cs.HC 新提交 50%

LLM4CAD-Editor: An Intent-Aware Large Language Model Framework for Multi-Level Computer-Aided Design Editing

LLM4CAD-Editor:一种面向多层级计算机辅助设计编辑的意图感知大语言模型框架

Yuewan Sun, Zhenghui Sha

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出LLM4CAD-Editor框架,通过结构化领域特定语言LLM4CAD-DSL实现自然语言驱动的CAD编辑,支持功能、操作和参数三级编辑,在参数级编辑上达到96.3%解析准确率和0.935 IoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 50%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07574 2026-06-18 cs.CV 版本更新 50%

Beyond the Linear Separability Ceiling: Aligning Representations in VLMs

超越线性可分上限:对齐视觉-语言模型中的表征

Enrico Vompa, Tanel Tammet, Mohit Vaishnav

机构 * Applied Artificial Intelligence Group(应用人工智能小组) Tallinn University of Technology(塔林技术大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出线性可分上限(LSC)诊断框架,发现VLM存在对齐差距,并通过对比目标重塑视觉流形,使模型在抽象组合推理任务上显著超越LSC。

Comments Accepted TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17223 2026-06-17 cs.CR 新提交 50%

Safety, Security, and Cognitive Risks in Neuro-Symbolic AI

神经符号AI中的安全性、安全性和认知风险

Manoj Parmar

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。

Comments 28 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15982 2026-06-16 cs.CV 新提交 50%

Mind the Gap: Diagnosing Constraint Discovery Failures in Text-in-Image Editing

注意差距:诊断图像内文本编辑中的约束发现失败

Rui Gui

专题命中 逻辑推理 :reasoning(abstract)

AI总结 通过图像内文本编辑的受控诊断,研究多模态模型在发现未明确指定的视觉依赖约束时的失败,发现模型仅能自行发现46%的约束,而明确提供时可达94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15417 2026-06-16 cs.CV 新提交 50%

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

从帧到时间图:基于视觉语言模型的上下文第一人称动作识别

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer

机构 * University of Alicante(阿利坎特大学) ETH Zürich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15255 2026-06-16 cs.RO 新提交 50%

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

OSDAG: 面向高效多机器人协作的在线调度

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) Hanyang University(汉阳大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14810 2026-06-16 cs.LO cs.MA 新提交 50%

Obligation-Producing Actions

产生义务的动作

Kalonji Kalala, Iluju Kiringa, Tet Yeap

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出情境演算中处理产生义务动作的框架问题的解决方案,通过简化可达关系并扩展Reiter的基本动作理论,实现了义务的直觉性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19802 2026-06-16 cs.CR cs.IR 版本更新 50%

KnowML: Improving Generalization of ML-NIDS with Attack Knowledge Graphs

KnowML: 利用攻击知识图提升ML-NIDS的泛化能力

Xin Fan Guo, Xinran Zheng, Albert Merono Penuela, Lorenzo Cavallaro, Sergio Maffeis, Fabio Pierazzi

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出KnowML框架,通过LLM构建攻击知识图并编码到特征空间,解决异常检测NIDS因特征空间缺陷导致的泛化问题,在仅用良性流量训练时实现高达99%检测率且误报率≤0.0137%。

Comments Accepted at EuroS&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏