arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 456 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 456 篇

2607.19194 2026-07-23 cs.RO cs.CV 版本更新 92%

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

基于结构化场景知识和可验证推理-行动一致性的自动驾驶认知双过程规划

Zhongyao Yang, Haoyu Li, Yu Yan, Zhuangxuan Yu, Jiangfeng Nan, Jinrui Nan

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) National Engineering Research Center of Electric Vehicles, Beijing Institute of Technology(北京理工大学电动车辆国家工程研究中心) School of Mechanical Engineering, Southeast University(东南大学机械工程学院)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract)

AI总结 研究自动驾驶高级规划问题,提出认知双过程规划框架,用S-CoT模式表示场景知识,通过自动数据引擎、视觉仲裁器及验证器实现自适应推理和规则验证,提升规划准确性、逻辑一致性并降低延迟,明确性能下降条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01437 2026-07-24 cs.AI 版本更新 91%

Post-Hoc Reasoning in Chain of Thought: Decoding and Steering Pre-Committed Answers

在生成链式推理前解码答案:来自预CoT探测器和激活引导的证据

Kyle Cox, Darius Kianersi, Adrià Garriga-Alonso

专题命中 规划推理 :CoT(title_cn,summary_cn);reasoning(title,abstract);分类 cs.AI

AI总结 研究发现,模型在生成链式推理前已确定答案,通过激活引导实验揭示了预CoT过程中的因果关系及潜在错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26807 2026-07-30 cs.IR cs.AI cs.CL 版本更新 90%

GroupRAG: Cognitively Inspired Group-Aware Retrieval and Reasoning via Knowledge-Driven Problem Structuring

GroupRAG: 基于知识驱动的问题结构化进行的认知启发式组感知检索与推理

Xinyi Duan, Yuanrong Tang, Jiangtao Gong

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 GroupRAG通过知识驱动的关键点分组,实现组感知的检索与推理,提升语言模型在现实场景中的表现,实验表明其优于RAG和CoT基线方法。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 89%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23248 2026-06-11 cs.AI cs.NI 版本更新 89%

Resource-Aware LLM Reasoning for Mobile Edge General Intelligence

面向移动边缘通用智能的资源感知LLM推理

Mingyi Luo, Ruichen Zhang, Xiangwang Hou, Jun Du, Chunxiao Jiang, Yong Ren, Shiwen Mao

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院,清华大学,深圳) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing 和数据科学学院,新加坡) Department of Electronic Engineering, Tsinghua University, Beijing(清华大学电子工程系,北京) State Key Laboratory of Space Network and Communications, Tsinghua University, Beijing(空间网络与通信国家重点实验室,清华大学,北京) Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing(北京信息科学与技术国家研究中心,清华大学,北京) Department of Electrical and Computer Engineering, Auburn University, Auburn, USA(阿伯丁大学电气与计算机工程系,阿伯丁,美国)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.AI

AI总结 提出联合优化框架,通过自适应CoT提示和分布式MoE架构协同优化推理深度、专家激活和传输功率,在资源受限的移动边缘环境中实现LLM高效推理,推理质量与资源效率平衡,额外推理时间小于1秒时准确率和延迟满足率均达90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21543 2026-06-24 cs.RO 版本更新 88%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 规划推理 :planning(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08983 2026-07-07 cs.RO cs.AI 版本更新 88%

Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning

理性逆推理:通过规划推断意图进行少样本模仿

Ben Zandonati, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 研究人类能从少量示范学习新操作任务,而现代机器人模仿学习需大量示范且适应性差的差距。提出理性逆推理,将少样本模仿视为对潜在解释程序的推理,通过视觉语言模型和分层规划器迭代优化候选集,在少样本设置中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03538 2026-08-11 cs.LG 版本更新 87%

Online Learnability of Chain-of-Thought Verifiers: Soundness and Completeness Trade-offs

链式思维验证器的在线可学习性:正确性与完备性的权衡

Maria-Florina Balcan, Avrim Blum, Kiriaki Fragkia, Zhiyuan Li, Dravyansh Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Northwestern University(西北大学)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);planning(abstract);verifier(abstract)

AI总结 本文提出一种在线学习框架,用于学习链式思维验证器,通过检查解决方案的正确性,解决生成器与验证器之间的反馈循环导致的分布偏移问题,并引入新的Littlestone维度扩展以优化验证器的学习。

Comments The abstract has been abridged due to arXiv length constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14098 2026-08-13 cs.CV 版本更新 87%

ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization

ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位

Youqi Wang, Shen Chen, Haowei Wang, Rongxuan Peng, Taiping Yao, Shunquan Tan, Changsheng Chen, Bin Li, Shouhong Ding

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 版本更新 87%

In-the-Flow Agentic System Optimization for Effective Planning and Tool Use

用于有效规划和工具使用的流内智能体系统优化

Zhuofeng Li, Haoxiang Zhang, Seungju Han, Sheng Liu, Jianwen Xie, Yu Zhang, Yejin Choi, James Zou, Pan Lu

机构 * Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) UC San Diego(圣地亚哥大学) Lambda Website(Lambda网站)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。

Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13378 2026-07-07 cs.AI cs.CL cs.IR cs.LG q-bio.QM 版本更新 87%

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05933 2026-07-14 eess.AS 版本更新 86%

Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech

语音世界模型:基于显式推理的语音因果状态-动作规划

Xuanru Zhou, Jiachen Lian, Henry Hong, Xinyi Yang, Gopala Anumanchipalli

专题命中 规划推理 :reasoning(title,abstract);planning(title)

AI总结 研究旨在改进语音语言模型推理弱的问题,采用模块化视角和世界模型观点,将语音理解分解为四个模块通过因果图通信,建立认知状态搜索空间,实现显式推理,让语音理解更透明可控。

Comments Accepted to 2026 ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03651 2026-07-20 cs.LG math.OC 版本更新 85%

LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs

基于文本业务输入的大语言模型引导的交通枢纽容量规划

Xiaoyue Liu, Zheng Dong

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 研究提出用大语言模型代理依自然语言业务描述迭代提出枢纽容量决策的框架,核心机制是思维链推理协议,经反馈回路验证决策,在实际货运网络中表现优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21842 2026-07-15 cs.AI 版本更新 85%

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents

深度旅行:用于自主旅行规划智能体的端到端智能强化学习框架

Yansong Ning, Rui Liu, Jun Wang, Kai Chen, Wei Li, Jun Fang, Kan Zheng, Naiqiang Tan, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究针对旅行规划智能体灵活性和自主性不足问题,提出深度旅行框架,通过构建旅行沙盒、开发分层奖励建模系统及回复增强强化学习方法,使训练后的智能体在行程生成准确率和性能上表现出色。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00618 2026-06-24 cs.AI 版本更新 85%

Efficient Test-time Inference for Generative Planning Models with OCL Search

生成式规划模型的高效测试时推理

Robert Gieselmann, Mihai Samson, Federico Pecora, Jeremy L. Wyatt

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出一种改进的开放-封闭列表搜索算法,结合生成模型和启发式模型,在测试时高效推理,提升生成式规划模型的解质量和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11575 2026-06-11 cs.AI 版本更新 85%

A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models

时间序列中基于大语言模型的推理与智能体系统综述

Ching Chang, Yidan Shi, Defu Cao, Wei Yang, Jeehyun Hwang, Haixin Wang, Jiacheng Pang, Wei Wang, Yan Liu, Wen-Chih Peng, Tien-Fu Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文定义时间序列推理问题,按推理拓扑分为直接、线性链和分支结构三类,结合传统分析、解释、因果推断和生成等目标,综述方法、系统、数据集和评估实践,并指导拓扑选择与部署权衡。

Comments Accepted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17082 2026-08-04 cs.AI cs.CL cs.LG 版本更新 85%

OTAP: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories

Otap:用于评估智能体轨迹中规划与执行的结构感知最优传输

Babak Barazandeh, Subhabrata Majumdar, George Michailidis

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究智能体轨迹评估问题,将其重新定义为执行图与有效解决方案图的距离,通过不平衡融合Gromov-Wasserstein传输问题实例化得到\otap{}分数,该分数可区分有效与无效轨迹,对保持依赖的重新排序不变且对冗余步骤有界敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14512 2026-07-22 cs.AI cs.CL cs.LG 版本更新 85%

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划

Yanqiao Zhu, Jingru Gan, Xiaoqi Sun, Fang Sun, Yidan Shi, Md Mofijul Islam, Chao Shang, Wenhao Gao, Connor W. Coley, Yizhou Sun, Wei Wang

机构 * UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院) Amazon(亚马逊公司) UPenn(宾夕法尼亚大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。

Comments To appear at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30552 2026-07-02 cs.RO cs.CV 版本更新 85%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03924 2026-08-13 cs.CL cs.AI 版本更新 84%

Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation

不确定性作为规划信号:面向目标导向对话的多轮决策

Xinyi Ling, Ye Liu, Reza Averly, Xia Ning

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14574 2026-08-11 cs.CL cs.AI 版本更新 84%

SIMMER: Benchmarking Latent Failures in LLM Executable Planning with a World Model

SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障

Xiaoxin Lu, Ranran Haoran Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 84%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23071 2026-07-21 cs.CL cs.AI 版本更新 84%

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成

Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) McGill University, Montréal, Quebéc, Canada(麦吉尔大学) Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09224 2026-07-15 cs.SE cs.AI cs.CL 版本更新 84%

Git-Assistant: Planning-Based Support for Updating Git Repositories

Git辅助工具:基于规划的Git仓库更新支持

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JPMorganChase(人工智能研究,摩根大通)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对git工具对开发者有挑战的问题,提出结合大语言模型与自动规划的Git-Assistant,经合成和随机git环境评估,证明该方法能提升仓库管理可靠性、减少错误,展现混合人工智能方法在开发者辅助上的潜力。

Comments Pending permissions from the private company

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06205 2026-07-14 cs.CL cs.AI 版本更新 84%

Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation

Tool-MCoT:用于内容安全审核的工具增强多模态链式思维

Shutong Zhang, Dylan Zhou, Yinxiao Liu, Yang Yang, Huiwen Luo, Wenfei Zou

机构 * Stanford University(斯坦福大学) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11682 2026-06-16 cs.AI cs.LG 版本更新 84%

MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition

MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理

Tim Cofala, Christian Kalfar, Jingge Xiao, Johanna Schrader, Michelle Tang, Wolfgang Nejdl

机构 * L3S Research Center(L3S研究中心)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14084 2026-06-11 cs.SE cs.AI cs.CL 版本更新 84%

CRANE: Constrained Reasoning Injection for Code Agents via Nullspace Editing

CRANE:通过空域编辑实现代码代理的约束推理注入

Mingzhi Zhu, Michele Merler, Raju Pavuluri, Stacy Patterson

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CRANE通过空域编辑技术,结合推理和工具使用能力,提升代码代理性能,在多个基准测试中取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12666 2026-06-09 cs.LG cs.AI 版本更新 84%

RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction

RetroReasoner:一种用于战略 retrosynthesis 预测的推理 LLM

Hanbum Ko, Chanhui Lee, Ye Rin Kim, Rodrigo Hormazabal, Sehui Han, Sungbin Lim, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Statistics, Korea University(韩国大学统计系) Materials Intelligence Lab, LG AI Research(LG人工智能研究实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 RetroReasoner 通过监督微调和强化学习,捕捉化学家基于断键策略的推理过程,提升 retrosynthesis 预测的准确性和多样性。

Comments 35 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03635 2026-06-08 cs.AI cs.CL 版本更新 84%

Finding the Minimal Parameter Budget for Implicit Reasoning: A Data Complexity Driven Scaling Law for Language Models

寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律

Xinyi Wang, Shawn Tan, Shenbo Xu, Mingyu Jin, William Yang Wang, Rameswar Panda, Yikang Shen

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Tokyo(东京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17045 2026-08-14 cs.CL 版本更新 83%

Large Language Models Persuade Without Planning Theory of Mind

大语言模型无需规划即可说服理论之心理论

Jared Moore, Rasmus Overmark, Ned Cooper, Beba Cibralic, Nick Haber, Cameron R. Jones

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏