arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3024 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3024 篇

2606.14463 2026-06-15 cs.LG 新提交 57%

EM-NeSy: Expectation Maximization for Neurosymbolic Learning

EM-NeSy:神经符号学习的期望最大化

Annegret Seibt, Luc De Raedt, Giuseppe Marra

机构 * Department of Computer Science(计算机科学系) KU Leuven(根特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出EM-NeSy框架,将概率神经符号学习视为期望最大化算法实例,通过概率推理计算符号后验,仅通过神经组件进行梯度更新,实现可扩展且高效的近似推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14145 2026-06-15 cs.CL 新提交 57%

Personal Care Utility: Health as Everyday Infrastructure

个人护理公用设施:健康作为日常基础设施

Mahyar Abbasian, Elahe Khatibi, Saba A. Farahani, Nitish Nagesh, Arshia Ilaty, Hooman Sajjadi, Amir Rahmani, Ramesh Jain

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出个人护理公用设施(PCU)分层事件驱动架构,将健康视为日常基础设施,通过Personicle组织连续信号,分离临床决策与语言表达,以2型糖尿病为例验证其生成实时干预和知识引导的能力。

Comments 12 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10813 2026-06-15 cs.CR cs.CL 版本更新 57%

RedAct: Redacting Agent Capability Traces for Procedural Skill Protection

RedAct: 为程序技能保护而编辑智能体能力痕迹

Shuwen Xu, Zhitao He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL

AI总结 提出RedAct框架,通过定位保护关键信息、重写痕迹并嵌入行为水印,将技能转移率降至无技能基线以下,同时保留审计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02274 2026-06-12 q-bio.QM cs.AI 版本更新 57%

Contextual Invertible World Models: A Neuro-Symbolic Agentic Framework for Colorectal Cancer Drug Response

上下文可逆世界模型:用于结直肠癌药物反应的神经符号智能框架

Christopher Baker, Tianyu Ren, Karen Rafferty, Hui Wang

机构 * School of Electronics, Electrical Engineering and Computer Science(电子工程与计算机科学学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出上下文可逆世界模型(CIWM),结合机器学习模拟器与大语言模型推理层,通过逆推理进行CRISPR扰动,揭示KRAS突变在5-氟尿嘧啶耐药中的主导作用及PIK3CA修复的意外效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12387 2026-06-11 cs.DB cs.AI 新提交 57%

TAHOE: Text-to-SQL with Automated Hint Optimization from Experience

TAHOE: 基于经验的自动提示优化文本到SQL系统

Zhiyi Chen, Jie Song, Peng Li

机构 * ByteDance Inc.(字节跳动公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 提出TAHOE系统,通过错误驱动的提示学习管道将调试痕迹转化为结构化提示库,结合策略层建模用户意图,在Spider 2.0-Snow上无需更新参数即可显著提升Text-to-SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05608 2026-06-11 cs.SE cs.AI 版本更新 57%

Agentic Software: How AI Agents Are Restructuring the Software Paradigm

软件工程的终结:AI代理如何根本性地重构软件范式

Zhenfeng Cao

机构 * Lingxi Intelligent Investment (Shenzhen) Development Co., Ltd.(灵犀智能投资(深圳)发展有限公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过第一性原理分析,论证了以LLM为推理引擎的AI代理系统正在根本性地重构软件范式,从传统软件(代码承载决策逻辑)转向代理系统(代码作为临时工具),并提出了代理工程作为新兴学科。

Comments 15 pages, 2 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14764 2026-06-11 cs.AI cs.HC cs.LO 版本更新 57%

An XAI View on Explainable ASP: Methods, Systems, and Perspectives

可解释ASP的XAI视角:方法、系统与展望

Thomas Eiter, Tobias Geibinger, Zeynep G. Saribatur

机构 * Institute of Logic and Computation, TU Wien, Austria(逻辑与计算研究所,维也纳技术大学,奥地利)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文从XAI视角综述回答集编程(ASP)的解释方法,分类解释类型并评估现有理论与工具的覆盖范围,指出研究空白与未来方向。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14463 2026-06-10 cs.CL 版本更新 57%

An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs

一个工业级保险大语言模型,实现可验证的领域掌握与幻觉控制,无能力权衡

Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin

机构 * Ant Group(蚂蚁集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出INS-S1保险专用大语言模型,通过可验证数据合成系统和渐进式SFT-RL课程框架,在领域任务上达到SOTA,同时保持通用能力并实现0.6%的低幻觉率。

Comments 21 pages, 12 figures, 17 tables

Journal ref ICLR 2026 Workshop Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09366 2026-06-09 cs.CL eess.AS 新提交 57%

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs

文本就是一切?文本作为语音大语言模型的通用信息瓶颈

Ming-Hao Hsu, Yuxuan Hu, Shujie Liu, Jinyu Li, Yan Lu, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Convex Gate(C-Gate)桥接语音与LLM,通过凸包约束将语音表示限制在LLM输入嵌入流形内,在ASR和情感识别上取得联合最优性能,并揭示几何结构而非离散性是关键设计因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18050 2026-06-09 cs.AI cs.LO 版本更新 57%

The Topological Dual of a Dataset: A Logic-to-Topology Encoding for AlphaGeometry-Style Data

数据集的拓扑对偶:一种逻辑到拓扑的编码用于AlphaGeometry风格的数据

Anthony Bordg

机构 * Huawei Lagrange Center(华为拉格朗日中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种逻辑到拓扑的编码方法,用于揭示模型潜在空间的结构不变性,通过逻辑观察的对偶性,为神经符号AI提供解释路径。

Comments Company decision as a precautionary measure while a third-party dispute is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22793 2026-06-09 cs.AI 版本更新 57%

Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI

信号不是状态:面向文化意识课堂AI的神经符号安全机制

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究者)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NSCR框架,通过神经符号方法处理课堂多模态信号,区分可观测证据与文化负载解读,减少文化偏见对课堂AI的负面影响。

Comments Accepted at the Workshop on Stereotypes Across Cultures in Language Technologies @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05804 2026-06-05 cs.CL 57%

Can LLMs Be Constrained to the Past? Improving Knowledge Cutoff through Recall-Based Prompting

LLMs 能否被约束到过去?通过基于回忆的提示改进知识截止

Michiro Asai, Ailiang Lin, Yu Kishimoto, Takao Obi, Satoshi Kosugi, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出两种基于回忆的提示策略(Self-Recall 和 Question-Recall)来改进大语言模型在知识截止约束下的表现,在反事实问题上尤其有效,并构建了多截止历史事件基准(MHEB)进行鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05201 2026-06-05 cs.LG 57%

State commitment learning: training language models to distinguish computation from memory

状态承诺学习:训练语言模型区分计算与记忆

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出状态承诺学习目标及反事实擦除强化学习(CERL)方法,通过训练模型区分应保留的持久状态与可丢弃的临时计算,减少推理对隐藏思维的依赖,在数学、长链逻辑、科学问答和多轮工具使用任务中保持准确率的同时降低依赖。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04325 2026-06-04 cs.CL 57%

Parameter-Efficient Fine-Tuning with Learnable Rank

可学习秩的参数高效微调

Arpit Garg, Simon Lucey, Hemanth Saratchandran

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出LR-LoRA方法,通过训练过程中学习适配器秩而非固定秩,在语言理解和常识推理基准上达到最先进性能。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29928 2026-06-04 cs.HC cs.AI 57%

Label Over Logic? How Source Cues Bias Human Fallacy Judgments More Than LLMs

标签胜过逻辑?源标签如何比LLMs更严重地偏差人类的谬误判断

Mahjabin Nahar, Nafis Irtiza Tripto, Aiping Xiong, Ting-Hao 'Kenneth' Huang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 通过在线实验和LLM对比,发现人类在评估逻辑谬误时显著受到内容源标签(如人类、AI等)的影响,而LLM评估相对稳定,表明源标签偏差主要是人类的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03956 2026-06-04 cs.MA cs.CL 57%

Solving Zebra Puzzles Using Constraint-Guided Multi-Agent Systems

使用约束引导的多智能体系统解决斑马谜题

Shmuel Berman, Kathleen McKeown, Baishakhi Ray

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学)

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 提出一种多智能体系统ZPS,结合大语言模型与定理证明器,通过分解问题、生成SMT代码和智能体间反馈,显著提升复杂逻辑谜题的解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01665 2026-06-02 cs.LG 57%

Quantifying the Energy Floor: Direct Measurement and Replay Buffer Bias in SAC-Based HVAC Control on sbsim

量化能量下限:基于sbsim的SAC HVAC控制中的直接测量与回放缓冲区偏差

Bo Li, Chen Zhang

机构 * Shanghai Jiao Tong University College of Smart Energy(上海交通大学智能能源学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.LG

AI总结 通过最小动作实验直接测量SAC HVAC控制中的能量下限,发现回放缓冲区初始化是次优性的主要来源,消除后可将成本降至接近下限。

Comments 5 pages, 3 figures, 2 tables. Presented at AI-DEEDS 2026 Workshop, ACM Sustainability Week, Banff, Canada (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00756 2026-06-02 cs.AI 57%

CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems

CoMIC:云边系统中长周期LLM代理的协作记忆与洞察循环

Yannan Wang, Longli Yang, Zhen Liu, Abhishek Kumar, Carsten Maple

机构 * Beijing Jiaotong University(北京交通大学) The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 提出无需参数更新的云边框架CoMIC,通过集中式反思与分布式执行设计,利用语义子目标标识实现跨代理经验聚合,提升弱边缘代理在长周期任务中的进展率和动作基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00750 2026-06-02 cs.CL 57%

I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications

I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性

Dasen Dai, Biao Wu, Meng Fang, Shuoqi Li, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS University of Liverpool(利物浦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00518 2026-06-02 cs.AI 57%

Acting with AI: An Interaction-Based Framework for Agentic Tort Liability

与AI行动:基于交互的代理侵权责任框架

Yiheng Yao

机构 * Yiheng Yao(姚艺恒)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文基于Bratman规划理论和普通法人类协同行动原则,提出一种交互分类框架(自主漂移、纯工具使用、协作规划)来分配AI代理系统的侵权责任,并引入“合理代理”标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29977 2026-06-02 cs.CV cs.LG 57%

EVL-ECG: Efficient ECG Interpretation With Multi-Aspect Heterogeneous Knowledge Distillation

EVL-ECG:面向多视角异构知识蒸馏的高效心电图解读

Dang Nguyen Hong, Nhi Ngoc-Yen Nguyen, Huy-Hieu Pham

机构 * University of Notre Dame(诺丁汉大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 提出EVL-ECG框架,通过多头交叉注意力对齐、最优传输视觉特征匹配和几何结构关系匹配三种创新方法,实现跨架构知识蒸馏,在资源受限环境下高效解读心电图。

Comments 7Accepted at the SD4H Workshop at ICML 2026. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22999 2026-06-02 cs.CL 57%

PaperVoyager : Building Interactive Web with Visual Language Models

PaperVoyager:利用视觉语言模型构建交互式网页

Dasen Dai, Biao Wu, Meng Fang, Wenhao Wang

机构 * Vast Intelligence Lab(vast 智能实验室) UTS(UTS大学) University of Liverpool(利物浦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出PaperVoyager框架,将研究论文自动转化为可执行的交互式网页系统,通过显式建模机制和交互逻辑,显著提升生成系统的质量。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI 57%

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31143 2026-06-01 cs.HC cs.AI 57%

Extending the UXR Point of View Pyramid: A Generative AI-Augmented Methodology for Human-Centred AI Systems

扩展UXR观点金字塔:一种面向人本AI系统的生成式AI增强方法论

Festus Fatai Adedoyin, Huseyin Dogan, Melike Akca, Abiodun Adedeji

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对英国债务管理中的AI金融系统,通过扩展UXR观点金字塔,提出一种结合生成式AI的增强方法论,包括AI增强观点金字塔、结构化提示架构和AI驱动的Playbook卡片系统,以提升可解释性、公平性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29910 2026-05-29 cs.SE cs.AI 57%

Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents

Agora: 面向生产级共识协议中自主漏洞检测的LLM智能体

Xiang Liu, Sa Song, Zhaowei Zhang, Huiying Lan, Jason Zeng, Ming Wu, Michael Heinrich, Yong Sun, Ceyao Zhang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Information and Telecommunication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与电信工程学院) Peking University(北京大学) G Labs(0G实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Agora,一个领域感知的多智能体框架,通过假设驱动测试和LLM协作,在Raft、EPaxos、HotStuff、BullShark四个共识实现中发现15个未知协议级逻辑漏洞,而现有LLM方法未能检测到任何此类漏洞。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15180 2026-05-29 cs.AI 57%

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data

PuzzleClone: 一种基于DSL的可验证数据合成框架

Kai Xiong, Yanwei Huang, Rongjunchen Zhang, Kun Chen, Haipang Wu, Yingcai Wu

机构 * HiThink Research(HiThink研究院) HKUST(香港科技大学) Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出PuzzleClone框架,通过DSL驱动的方法合成大规模、高可靠、多样化的可验证数学逻辑数据集,并构建PC-83K基准,实验表明后训练能显著提升LLM在逻辑与数学任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29394 2026-05-29 cs.AI 57%

EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular Dynamics

EvoMD-LLM:学习反应分子动力学中物种进化的语言

Zhichen Tang, Zhengzheng Dang, Yulin Chen, Jixin Wu, Haiwen Li, Yanming Wang

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出EvoMD-LLM框架,将反应分子动力学轨迹离散化为符号时间序列,通过时间脚手架机制使自回归大语言模型学习物种组成演化,在多项时间预测任务上优于基线模型,并能生成可解释性预测。

Comments 17 pages, ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06431 2026-05-29 cs.AI 57%

LsrIF: Enhancing Logic-Structured Instruction Following of Large Language Models

LsrIF: 增强大语言模型的逻辑结构化指令遵循能力

Qingyu Ren, Qianyu He, Jingwen Chang, Geng Zhang, Jiajie Zhu, Xingzhou Chen, Zhuofei Shi, Jiaqing Liang, Yanghua Xiao, Han Xia, Zeye Sun, Fei Yu

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学数据科学重点实验室,计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出LsrIF框架,通过构建并行、顺序、条件和嵌套结构的原子约束数据,并采用结构感知的奖励聚合方法,提升大语言模型在逻辑结构化指令遵循任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28465 2026-05-28 cs.CL 57%

Beyond One Path: Evaluating and Enhancing Divergent Thinking in Interactive LLM Agents

超越单一路径:评估与增强交互式LLM代理的发散性思维

Jihyeong Park, Ingeol Baek, Jeonghyun Park, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出交互式基准MUTATE和策略ReDNA,用于评估和增强LLM代理在路径和动作层面的发散性思维,解决现有框架中即时收敛压力导致的动作固定问题。

Comments 28 pages, 16 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27311 2026-05-27 cs.CL cs.CV 57%

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

Chartographer: 用于评估视觉语言模型的反事实图表生成

Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) Layer 6 AI

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 提出 Chartographer 框架,通过将图表逆向工程为可执行代码并生成反事实变体,揭示视觉语言模型在图表问答中的视觉推理缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏