arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3024 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3024 篇

2604.06015 2026-04-08 cs.AI 57%

How LLMs Follow Instructions: Skillful Coordination, Not a Universal Mechanism

大语言模型如何遵循指令:技能协调,而非通用机制

Elisabetta Rocchetti, Alfio Ferrara

机构 * Department of Computer Science, Università degli Studi di Milano(米兰大学计算机科学系)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 研究通过九种不同任务分析发现,大语言模型遵循指令并非依赖通用机制,而是通过协调多种语言能力实现,且存在任务间转移弱、依赖稀疏等特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 57%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04527 2026-04-07 cs.SE cs.AI cs.PL 57%

ENCRUST: Encapsulated Substitution and Agentic Refinement on a Live Scaffold for Safe C-to-Rust Translation

ENCRUST:在活体支架上进行封装替换和代理细化以实现安全的C到Rust翻译

Hohyun Sim, Hyeonjoong Cho, Ali Shokri, Zhoulai Fu, Binoy Ravindran

机构 * Korea University(高丽大学) University of Houston(休斯顿大学) State University of New York Korea(纽约州立大学韩国分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ENCRUST通过封装替换和代理细化方法,解决C到Rust翻译中的类型不匹配和不安全构造问题,通过ABI保持封装模式和整体代码库验证,实现安全且可编译的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 57%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03759 2026-04-07 cs.RO cs.AI 57%

Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation

基于先验知识:视觉-语言引导的神经符号模仿学习用于数据高效的现实机器人操作

Pierrick Lorang, Johannes Huemer, Timothy Duggan, Kai Goebel, Patrik Zips, Matthias Scheutz

机构 * Tufts University(塔夫茨大学) Austrian Institute of Technology GmbH (AIT)(奥地利技术研究所(AIT))

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种可扩展的神经符号框架,通过少量未标注的示范数据自动构建符号规划领域和高效控制策略,无需手动领域工程,提升现实机器人操作的效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03616 2026-04-07 cs.CL 57%

The Format Tax

格式税

Ivan Yee Lee, Loris D'Antoni, Taylor Berg-Kirkpatrick

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文发现要求大语言模型以JSON等结构化形式输出会显著降低推理和写作性能,提出分离推理与格式生成的方法可恢复大部分损失的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02734 2026-04-06 cs.AI 57%

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

对齐进展与可行性:一种神经符号双记忆框架用于长周期LLM智能体

Bin Wen, Ruoxuan Zhang, Yang Chen, Hongxia Xie, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出神经符号双记忆框架,通过分离语义进展指导与逻辑可行性验证,解决长周期任务中进展漂移与可行性违反问题,实验显示在ALFWorld、WebShop和TextCraft上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12643 2026-04-06 cs.AI 57%

Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution

通过大语言模型学习放松:通过双向共进化解决约束优化问题

Beidan Liu, Zhengqiu Zhu, Chen Gao, Tianle Pu, Yong Zhao, Wei Qi, Quanjun Yin

机构 * State Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoCO方法,结合运筹学约束放松原理与LLM推理,通过双向共进化机制提升复杂约束优化问题的求解能力,实验验证其在硬问题中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02238 2026-04-03 cs.CY cs.AI stat.AP 57%

Generative AI Spotlights the Human Core of Data Science: Implications for Education

生成AI揭示数据科学的人类核心:对教育的影响

Nathan Taback

机构 * University of Toronto(多伦多大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 生成AI揭示数据科学中不可还原的人类核心,教育应强化人类推理能力,通过迭代提示-输出-提示循环提升学生贡献能力,评估应侧重推理与判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01738 2026-04-03 cs.AI 57%

AeroTherm-GPT: A Verification-Centered LLM Framework for Thermal Protection System Engineering Workflows

AeroTherm-GPT:一种面向热防护系统工程工作流的验证中心LLM框架

Chuhan Qiao, Jinglai Zheng, Jie Huang, Buyue Zhao, Fan Li, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University(北京交通大学土木工程学院) Beijing Research Institute of Telemetry(北京遥测技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AeroTherm-GPT,一种专为热防护系统设计的LLM代理,通过约束闭环生成框架解决超音速热防护系统设计中生成可执行仿真工具时的约束冲突问题,实现高效率的根因修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01520 2026-04-03 cs.AI 57%

LLM Agents as Social Scientists: A Human-AI Collaborative Platform for Social Science Automation

LLM代理作为社会科学家:一种人机协作的社会科学自动化平台

Lei Wang, Yuanzi Li, Jinchao Wu, Heyang Gao, Xiaohe Bo, Xu Chen, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Key Laboratory of Big Data Management and Analysis Methods(大数据管理与分析方法北京市重点实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出S-Researcher平台,通过LLM代理实现社会科学研究的高效化与规模化,结合自动编程、分布式架构和反馈驱动微调,构建人机协作的研究闭环,验证了三种推理模式在社会科学中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00778 2026-04-02 cs.CL 57%

From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks

从早期编码到晚期抑制:解释LLM在字符计数任务上的表现

Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi

机构 * IIIT Hyderabad(印度国际信息技术学院海德拉巴分校) Goethe University, Frankfurt am Main, Germany(德国法兰克福歌德大学) University of Sheffield, UK(英国谢菲尔德大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过字符计数任务揭示LLM内部计算中的结构干扰问题,发现模型在早期层正确编码信息,但后期层通过负电路抑制了正确输出,导致符号推理失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27076 2026-03-31 cs.AI 57%

When Verification Hurts: Asymmetric Effects of Multi-Agent Feedback in Logic Proof Tutoring

当验证带来伤害:多智能体反馈在逻辑证明辅导中的不对称效应

Tahreem Yasir, Sutapa Dey Tithi, Benyamin Tabarsi, Dmitri Droujkov, Sam Gilson Yasitha Rajapaksha, Xiaoyi Tian, Arun Ramesh, DongKuan, Xu, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了逻辑证明辅导中多智能体反馈的分层影响,提出一个基于知识图谱的基准测试,揭示了验证在反馈可靠性不同时对学习效果的不对称影响,并指出复杂度天花板限制了模型性能。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08492 2026-03-31 cs.AI 57%

Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance

自主问题解决者:迈向零接触代码维护

Aliaksei Kaliutau

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于数据转换图的新型方法,通过数据状态节点和函数边的拓扑结构,解决传统代码属性图的控制流逻辑缺陷,实现数据完整性导航与控制流逻辑的统一,提升代码修复效率。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00316 2026-03-30 cs.LG 57%

Large Language Models Can Perform Automatic Modulation Classification via Discretized Self-supervised Candidate Retrieval

大语言模型可通过离散自监督候选检索实现自动调制分类

Mohammad Rostami, Atik Faysal, Reihaneh Gh. Roshan, Huaxia Wang, Nikhil Muralidhar, Yu-Dong Yao

机构 * Rowan University(罗文大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DiSC-AMC框架,通过特征离散化与自监督嵌入检索,使大语言模型在无线调制分类中实现高效准确的分类,优于传统监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13874 2026-03-27 cs.SE cs.LG 57%

Chain-Oriented Objective Logic with Neural Network Feedback Control and Cascade Filtering for Dynamic Multi-DSL Regulation

基于神经网络反馈控制与级联过滤的链式目标逻辑用于动态多DSL调节

Jipeng Han

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种将离散规则逻辑与轻量级神经网络反馈控制结合的神经符号搜索架构,通过级联过滤隔离神经误预测并动态补偿静态启发式偏差,确保大规模离散状态空间中的搜索稳定性和效率。

Comments 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06819 2026-03-26 cs.RO cs.AI 57%

Dynamic Neural Potential Field: Online Trajectory Optimization in the Presence of Moving Obstacles

动态神经势场:在移动障碍物存在下的在线轨迹优化

Aleksei Staroverov, Muhammad Alhaddad, Aditya Narendra, Konstantin Mironov, Aleksandr Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) National University of Science and Technology MISIS(科学与技术国立大学MISIS) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究 institutes) Ufa University of Science and Technology(乌fa科学与技术大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出动态神经势场模型,结合传统优化与Transformer预测器,实现高效安全的轨迹优化,在动态环境中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07315 2026-03-25 cs.MA cs.AI cs.AR 57%

VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

VLM-CAD:面向模拟电路尺寸设计的VLM优化协作代理设计流程

Guanyuan Pan, Shuai Wang, Yugui Lin, Tiansheng Zhou, Pietro Liò, Zhenxin Zhao, Yaqi Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) SCBC, Guangdong University of Foreign Studies(广东外语外贸大学) University of Cambridge(剑桥大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VLM-CAD流程,通过神经符号结构解析模块和ExTuRBO方法提升多模态推理的鲁棒性和可解释性,实验表明其在模拟电路设计中具有高准确性和低功耗。

Comments submitted to the 34th ACM International Conference on Multimedia (ACMMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01082 2026-03-24 cs.AI 57%

EvoOpt-LLM: Evolving industrial optimization models with large language models

EvoOpt-LLM:利用大语言模型演化工业优化模型

Yiliu He, Tianle Li, Binghao Ji, Zhiyuan Liu, Di Huang

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出EvoOpt-LLM框架,通过大语言模型实现工业优化建模的全流程自动化,包括自动建模、动态业务约束注入和端到端变量剪枝,提升求解效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20017 2026-03-23 cs.CL cs.DB cs.IR 57%

RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering

RouterKGQA: 专用-通用模型路由用于约束感知的知识图谱问答

Bo Yuan, Hexuan Deng, Xuebo Liu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 RouterKGQA提出专用-通用模型协作框架,通过专用模型生成推理路径,通用模型在必要时进行知识图谱引导修复,提升性能并降低成本,实验显示在多个基准上F1和Hits@1均优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19584 2026-03-23 cs.AI cs.SY eess.SY 57%

PowerLens: Taming LLM Agents for Safe and Personalized Mobile Power Management

PowerLens:利用大语言模型安全且个性化地管理移动设备电源

Xingyu Feng, Chang Sun, Yuzhu Wang, Zhangbing Zhou, Chengwen Luo, Zhuangzhuang Chen, Xiaomin Ouyang, Huanqi Yang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Shenzhen University(深圳大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 PowerLens通过利用大语言模型的常识推理,实现安全且个性化的移动电源管理。系统通过用户活动与系统参数之间的语义桥梁,生成适应个人偏好的零样本策略,通过隐式反馈学习用户偏好,无需显式配置,3-5天内收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19267 2026-03-23 cs.CL cs.IR 57%

Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication

审查审查者:图增强的大语言模型用于电商争议裁决

Yuchen Du, Ashley Li, Zixi Huang

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。

Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17969 2026-03-19 cs.RO cs.AI 57%

Specification-Aware Distribution Shaping for Robotics Foundation Models

面向规范的机器人基础模型分布塑形

Sadık Bera Yüksel, Derya Aksaray

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种面向规范的机器人基础模型分布优化框架,通过在预训练模型执行中强制满足信号时序逻辑约束,提升机器人在复杂任务中的安全性和合规性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17170 2026-03-19 cs.CR cs.AI cs.PL 57%

PAuth - Precise Task-Scoped Authorization For Agents

PAuth - 精确任务范围授权 for 代理

Reshabh K Sharma, Linxi Jiang, Zhiqiang Lin, Shuo Chen

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16448 2026-03-19 cs.AI 57%

TRUST-SQL: Tool-Integrated Multi-Turn Reinforcement Learning for Text-to-SQL over Unknown Schemas

TRUST-SQL:基于工具的多轮强化学习用于未知模式下的文本到SQL

Ai Jian, Xiaoyun Zhang, Wanrou Du, Jingqing Ruan, Jiangbo Pei, Weipeng Zhang, Ke Zeng, Xunliang Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TRUST-SQL,通过工具集成的多轮强化学习解决文本到SQL在未知模式下的问题,通过结构化四阶段协议和Dual-Track GRPO策略提升性能,实验表明在多个基准上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16434 2026-03-18 cs.AI q-fin.TR 57%

From Natural Language to Executable Option Strategies via Large Language Models

从自然语言到可执行期权策略的大型语言模型

Haochen Luo, Zhengzhao Lai, Junjie Xu, Yifan Li, Tang Pok Hin, Yuan Zhang, Chen Liu

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shanghai University of Finance and Economics(上海财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Option Query Language,通过语法规则将期权市场抽象为高层 primitives,使LLM能作为语义解析器生成可执行期权策略,并通过新数据集验证其优于直接生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12487 2026-03-16 cs.LG 57%

Modal Logical Neural Networks for Financial AI

模态逻辑神经网络用于金融AI

Antonin Sulc

机构 * Lawrence Berkeley National Lab(伯克利国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出模态逻辑神经网络,结合模态语义与神经网络,解决金融AI中深度学习与符号逻辑的矛盾,通过监管护栏、市场压力测试等应用提升合规性与鲁棒性。

Comments 4 pages, 1 figure, Accepted at ICLR 2026 FinAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11798 2026-03-13 cs.AI 57%

DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering

DocSage:一个多文档多实体问答的信息结构代理

Teng Lin, Yizhang Zhu, Zhengxuan Zhang, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 DocSage通过动态模式发现、结构化信息提取和模式感知推理,解决多文档多实体问答中的跨文档证据链构建和实体关系推断问题,实现超过27%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03668 2026-03-13 cs.LO cs.AI 57%

Can LLM Aid in Solving Constraints with Inductive Definitions?

大语言模型能否帮助解决带有归纳定义的约束?

Weizhi Feng, Shidong Shen, Jiaxiang Liu, Taolue Chen, Fu Song, Zhilin Wu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种神经符号方法,利用大语言模型生成辅助引理,提升求解涉及归纳定义的约束的能力,实验表明其在证明任务上的有效性。

Comments Accepted by the 27th Symposium on Formal Methods (FM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22824 2026-03-13 cs.CL 57%

Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning

Critique-Coder: 通过批判强化学习增强Coder模型

Chi Ruan, Dongfu Jiang, Yubo Wang, Wenhu Chen

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 Critique-Coder通过批判强化学习提升Coder模型性能,优于传统强化学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏