arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 216 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 48 篇

2603.13774 2026-03-17 cs.DB 67%

AgenticScholar: Agentic Data Management with Pipeline Orchestration for Scholarly Corpora

AgenticScholar: 基于管道编排的代理数据管理用于学术语料

Hai Lan, Tingting Wang, Zhifeng Bao, Guoliang Li, Daomin Ji, Ge Lee, Feng Luo, Zi Huang, Hailang Qiu, Gang Hua

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出AgenticScholar系统,整合结构化知识表示层、LLM中心混合查询规划层和统一执行层,实现多模态学术数据的端到端推理,有效提升学术数据管理的效率和可解释性。

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15594 2026-03-17 cs.AI cs.CL 62%

OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data

OpenSeeker:通过完全开源训练数据民主化前沿搜索代理

Yuwen Du, Rui Ye, Shuo Tang, Xinyu Zhu, Yijun Lu, Yuzhu Cai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OpenSeeker通过两项技术创新实现前沿性能,利用开源数据提升搜索代理能力,实验表明其在多个基准测试中表现优异,超越现有开源和工业竞争对手。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14643 2026-03-17 cs.AI cs.CL 62%

Argumentation for Explainable and Globally Contestable Decision Support with LLMs

基于大语言模型的可解释且全球可争议的决策支持论证

Adam Dejl, Matthew Williams, Francesca Toni

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ArgEval框架,通过结构化评估通用决策选项,实现可解释且可全球争议的决策支持,应用于胶质瘤治疗推荐,产生符合临床实践的解释性指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20074 2026-03-17 cs.AI cs.CL 62%

Reason2Decide: Rationale-Driven Multi-Task Learning

Reason2Decide: 基于理由的多任务学习

H M Quamran Hasan, Housam Khalifa Bashier, Jiayi Dai, Mi-Young Kim, Randy Goebel

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Reason2Decide框架,通过两阶段训练解决自理据问题,提升预测准确性和解释一致性,在医疗数据集上优于基线模型,且模型规模更小。

Comments Uploaded the camera-version of the paper accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05197 2026-03-17 cs.AI cs.CL cs.CV 62%

QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering

QA-Dragon:面向知识密集型视觉问答的查询感知动态RAG系统

Zhuohang Jiang, Pangjing Wu, Xu Yuan, Wenqi Fan, Qing Li

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 QA-Dragon通过引入领域路由器和搜索路由器,实现多模态、多轮和多跳推理,提升复杂视觉问答任务的推理性能,实验显示其在单源、多源和多轮任务中均优于基线模型。

Comments The source code for our system is released in https://github.com/jzzzzh/QA-Dragon

Journal ref 2025 KDD Cup Workshop for Multimodal Retrieval Augmented Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15566 2026-03-17 cs.SE cs.AI cs.SY eess.SY 57%

Lore: Repurposing Git Commit Messages as a Structured Knowledge Protocol for AI Coding Agents

Lore:将Git提交信息重新利用为AI编码代理的结构化知识协议

Ivan Stetsenko

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Lore协议,通过Git trailers重构提交信息,生成包含约束、拒绝替代方案、代理指令和验证元数据的自包含决策记录,以解决AI编码代理在代码生产与消费中机构知识流失的问题。

Comments 8 pages, 1 figure, 1 table. Preprint available at https://doi.org/10.5281/zenodo.19051840

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01842 2026-03-17 cs.LG 57%

Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models

Prism:通过分层搜索和自验证实现离散扩散语言模型的高效测试时扩展

Jinbin Bai, Yixuan Li, Yuchen Zhu, Yi Xin, Qingyu Shi, Aosong Feng, Xiaohong Liu, Molei Tao, Jianru Xue, Xiangtai Li, Ming-Hsuan Yang

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Prism框架,通过分层轨迹搜索、局部分支和自验证反馈,提升离散扩散语言模型的测试时扩展效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14229 2026-03-17 cs.AI cs.SE 57%

Agentic DAG-Orchestrated Planner Framework for Multi-Modal, Multi-Hop Question Answering in Hybrid Data Lakes

基于代理的DAG编排规划框架:用于混合数据湖中多模态、多跳问答系统

Kirushikesh D B, Manish Kesarwani, Nishtha Madaan, Sameep Mehta, Aldrin Dennis, Siddarth Ajay, Rakesh B R, Renu Rajagopal, Sudheesh Kairali

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出A.DOT规划框架,通过编译自然语言查询为DAG执行计划,实现多模态多跳问答,提升准确性和效率,并生成可追溯的证据链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00222 2026-03-17 cs.CR cs.AI 57%

Empowering Future Cybersecurity Leaders: Advancing Students through FINDS Education for Digital Forensic Excellence

赋能未来网络安全领袖:通过FINDS教育提升学生数字取证能力

Yashas Hariprasad, Subhash Gurappa, Sundararaj S. Iyengar, Jerry F. Miller, Pronab Mohanty, Naveen Kumar Chaudhary

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MCBSG模型,通过整合AI驱动的取证编程、统计推断等技能,提升网络安全教育的系统性和可衡量性,验证其在提高技术能力和研究准备度方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02569 2026-03-17 cs.CR cs.AI 57%

DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems

DECEIVE-AFC:针对具有搜索功能的基于大语言模型的事实核查系统的对抗性声明攻击

Haoran Ou, Kangjie Chen, Gelei Deng, Hangcheng Liu, Jie Zhang, Tianwei Zhang, Kwok-Yan Lam

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DECEIVE-AFC框架,通过新型声明级攻击策略和对抗性声明有效性评估原则,研究对抗性声明攻击对基于大语言模型的事实核查系统的影响,实验表明攻击显著降低验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22955 2026-03-17 cs.CL 57%

Diversity or Precision? A Deep Dive into Next Token Prediction

多样性还是精度?对下个token预测的深入探讨

Haoyuan Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Keyao Wang, Weile Chen, Zihao Zheng, Bei Yu

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过重新审视交叉熵损失,提出一种结合在线强化学习原则的预训练目标,平衡多样性与精度,优化语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11301 2026-03-17 cs.AI 57%

EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment

EcoAlign:一种经济理性框架,用于高效LVLM对齐

Ruoxi Cheng, Haoxuan Ma, Teng Ma, Hongyi Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01111 2026-03-17 cs.LG 57%

TsLLM: Augmenting LLMs for General Time Series Understanding and Prediction

TsLLM:增强大语言模型以实现通用时间序列理解和预测

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 TsLLM通过引入基于补丁的编码器-解码器架构,增强了大语言模型对时间序列数据的理解与预测能力,能够整合时间序列分析与自然语言处理,展现强大的零样本和少样本学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23189 2026-03-17 cs.AI 57%

AutoEP: LLMs-Driven Automation of Hyperparameter Evolution for Metaheuristic Algorithms

AutoEP:基于LLM的元启发式算法超参数进化自动化

Zhenxing Xu, Yizhe Zhang, Weidong Bao, Hao Wang, Ming Chen, Haoran Ye, Wenzheng Jiang, Hui Yan, Ji Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AutoEP通过LLM实现元启发式算法超参数自动优化,利用探索性景观分析模块和多LLM推理链提供实时反馈和自适应策略,优于现有方法,使开源模型性能接近GPT-4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02289 2026-03-17 cs.RO cs.LG cs.MA 57%

Federated Multi-Agent Mapping for Planetary Exploration

联邦多智能体制图用于行星探索

Tiberiu-Ioan Szatmari, Abhishek Cauligi

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种联邦多智能体制图方法,通过隐式神经制图生成高效适应性表示,减少数据传输达93.8%,并利用元初始化加速地图收敛,实现火星地形和冰川数据集的高路径规划F1分数。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13640 2026-03-17 cs.LG cs.SE 57%

SemRep: Generative Code Representation Learning with Code Transformations

SemRep:基于代码变换的生成式代码表示学习

Weichen Li, Jiamin Song, Bogdan Alexandru Stoica, Arav Dhoot, Gabriel Ryan, Shengyu Fu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Columbia University(哥伦比亚大学) Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 SemRep通过生成式代码表示学习提升代码变换效果,利用语义保持变换作为中间表示,实现更准确的语义推理和更高效的代码优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13307 2026-03-17 cs.IR cs.LG 57%

Suppressing Domain-Specific Hallucination in Construction LLMs: A Knowledge Graph Foundation for GraphRAG and QLoRA on River and Sediment Control Technical Standards

抑制构造LLM中的领域特定幻觉:图RAG和QLoRA在河流和泥沙控制技术标准上的知识图谱基础

Takato Yasuno

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文通过知识图谱和QLoRA技术,解决基于日本河流和泥沙控制技术标准的问答问题,发现领域特定微调在质量和效率上优于GraphRAG。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11820 2026-03-17 cs.DB cs.AI 57%

OMNIA: Closing the Loop by Leveraging LLMs for Knowledge Graph Completion

OMNIA:通过利用LLMs进行知识图谱补全闭合循环

Frédéric Ieng, Soror Sahri, Mourad Ouzzani, Massinissa Hammaz, Salima Benbernou, Hanieh Khorashadizadeh, Sven Groppe, Farah Benamara

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OMNIA提出一种两阶段方法,结合结构和语义推理补全知识图谱,通过聚类生成候选三元组并利用轻量嵌入过滤和LLM验证,提升F1分数,减少搜索空间和验证成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14908 2026-03-17 cs.RO cs.CV 50%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 规划推理 :planning(abstract)

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14018 2026-03-17 eess.SY cs.SY 50%

LLM-Guided Safe Reinforcement Learning for Energy System Topology Reconfiguration

基于大型语言模型的安全强化学习用于能源系统拓扑重构

Zongyan Zhang, Chao Shen, Xu Wan, Jie Song, Mingyang Sun

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出结合大型语言模型与安全软演员-评论家算法的拓扑控制框架,通过重构电压和热限为平滑安全成本信号,提升电网拓扑重构的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14011 2026-03-17 cs.CR 50%

Sovereign-OS: A Charter-Governed Operating System for Autonomous AI Agents with Verifiable Fiscal Discipline

Sovereign-OS:一种以宪章治理为核心的自主AI代理操作系统,具有可验证的财政纪律

Aojie Yuan, Haiyue Zhang, Ziyi Wang, Yue Zhao

专题命中 规划推理 :planning(abstract)

AI总结 Sovereign-OS通过宪章定义使命范围和财政限制,结合CEO、CFO、Worker和Auditor角色,实现对AI代理行为的宪法控制,有效阻止财政违规并确保审计完整性。

Comments 4 pages, 2 figures, 2 tables, demo paper. Code: https://github.com/Justin0504/Sovereign-OS Demo: https://youtu.be/vOarAI_epb4

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14822 2026-03-17 cs.IR 50%

A Survey of Model Architectures in Information Retrieval

信息检索中模型架构的综述

Zhichao Xu, Fengran Mo, Zhiqi Huang, Crystina Zhang, Puxuan Yu, Bei Wang, Jimmy Lin, Vivek Srikumar

专题命中 规划推理 :reasoning(abstract)

AI总结 本文综述了信息检索中模型架构的发展,重点探讨了特征提取的骨干模型和端到端的相关性估计系统,分析了传统术语检索模型向神经网络方法的转变,以及Transformer架构和大语言模型的影响。

Comments TMLR camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.01256 2026-03-17 cs.CC cs.RO 50%

Walking through Doors is Hard, even without Staircases: Universality and PSPACE-hardness of Planar Door Gadgets

通过门是困难的,即使没有楼梯:平面门装置的普遍性和PSPACE难性

MIT Gadgets Group, Jeffrey Bosboom, Erik D. Demaine, Jenny Diomidova, Dylan Hendrickson, Hayashi Layers, Jayson Lynch

专题命中 规划推理 :planning(abstract)

AI总结 研究证明在平面系统中通过门装置的可达性问题PSPACE难,且门装置可模拟其他运动规划装置,简化了以往游戏的复杂性证明。

Comments 36 pages, 35 figures. All cases are now proved PSPACE-complete. New universality proofs. Earlier version published at FUN 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13870 2026-03-17 math.OC 50%

When to Screen, When to Bypass: LLM-Judges in Resource-Scarce AI-Human Workflow

何时筛查,何时绕过:LLM-判断在资源稀缺的AI-人类工作流中

Ruihan Lin, Jiheng Zhang

专题命中 规划推理 :planning(abstract)

AI总结 研究探讨在资源有限的AI-人类工作流中,何时通过LLM-判断筛选输出,何时直接绕过判断直接提交人类审核,提出基于队列网络模型的优化策略,分析不同瓶颈资源下的最优分配方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13807 2026-03-17 cs.GT 50%

Decision Aggregation under Quantal Response

在量回应下做出决策聚合

Zhihuan Huang, Yichong Xia, Yuqing Kong

专题命中 规划推理 :reasoning(abstract)

AI总结 研究在个体理性低于阈值时,多数投票是最佳稳健聚合器,且此类群体能超越完全理性主体,通过决策随机性编码弱但信息性信号。

Comments 47 pages, 8 figures. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13743 2026-03-17 cs.CY 50%

Six Interventions for the Responsible and Ethical Implementation of Medical AI Agents

为医疗AI代理的负责任和伦理实施提出的六种干预措施

Tom Bisson, Henriette Voelker, Sanddhya Jayabalan, A John Iafrate, Jakob N Kather, Jochen K Lennerz

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出六种干预措施,旨在通过伦理设计框架确保医疗AI代理在自主系统中维持医疗伦理核心原则。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13630 2026-03-17 cs.NI 50%

SAIL: Unsupervised Spatial-Angular Interpretable Feature Learning for RF Map Synthesis

SAIL:无监督空间-角度可解释特征学习用于射频地图合成

Sopan Sarkar, Marwan Krunz

专题命中 规划推理 :planning(abstract)

AI总结 SAIL通过生成对抗网络学习可解释的潜在变量,实现无监督射频地图合成,提升合成效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 18 篇

2603.09957 2026-03-17 cs.AI cs.CL cs.LG 82%

Think Before You Lie: How Reasoning Leads to Honesty

在谎言之前思考:推理如何导致诚实

Ann Yuan, Asma Ghandeharioun, Carter Blum, Alicia Machado, Jessica Hoffmann, Daphne Ippolito, Martin Wattenberg, Lucas Dixon, Katja Filippova

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过道德权衡数据集探讨推理对诚实的影响,发现推理能提升诚实度,而非单纯依赖推理内容,且代表空间的几何特性是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14811 2026-03-17 cs.RO cs.CV 82%

Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning

从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理

Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu, Zilu Zhang, Haoming Song, Kaixin Xu, Yuchen Fan, Dongzhan Zhou, Xiaohong Liu, Ruimao Zhang, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12071 2026-03-17 cs.CV cs.AI 79%

LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments

LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理

Zhaoyang Jiang, Zhizhong Fu, David McAllister, Yunsoo Kim, Honghan Wu

专题命中 视觉空间推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏