arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-27 至 2026-03-27 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 9 篇

2509.23768 2026-03-27 cs.AI cs.CL 84%

From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning

从何到为何:一个用于基于证据的化学反应条件推理的多智能体系统

Cheng Yang, Jiaxuan Lu, Haiyuan Wan, Junchi Yu, Feiwei Qin

机构 * Hangzhou Dianzi University(杭州电子科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemMAS多智能体系统,通过机制 grounding、多通道回忆、约束感知辩论和理由聚合,提升化学反应条件推荐的可解释性,实验表明其在准确率和可解释性上优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12104 2026-03-27 cs.CR cs.AI 70%

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

DRIFT: 基于注入隔离的动态规则防御以保障LLM代理安全

Hao Li, Xiaogeng Liu, Hung-Chun Chiu, Dianqi Li, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DRIFT通过动态安全策略和注入隔离技术,有效防御LLM代理中的提示注入攻击,验证了其在多个基准测试中的高安全性和高实用性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23953 2026-03-27 cs.CV cs.ET 67%

VOLMO: Versatile and Open Large Models for Ophthalmology

VOLMO:面向眼科学的多功能和开放型大模型

Zhenyue Qin, Younjoon Chung, Elijah Lee, Wanyue Feng, Xuguang Ai, Serina Applebaum, Minjie Zou, Yang Liu, Pan Xiao, Mac Singer, Amisha Dave, Aidan Gilson, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih-Chung Tham, Ron Adelman, Luciano V. Del Priore, Qingyu Chen

机构 * Department of Biomedical Informatics & Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系) Ray and Stephanie Lane Computational Biology Department, Carnegie Mellon University(卡内基梅隆大学雷和斯蒂芬妮·兰德计算生物学系) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨洛林医学院) Department of Radiology, Washington University in Saint Louis(圣路易斯华盛顿大学放射科) National Eye Institute, National Institutes of Health(国家卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 VOLMO提出了一种通用框架,用于开发专门的眼科多模态大语言模型,通过预训练、微调和临床推理三个阶段,提升了眼科疾病筛查和诊断的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20894 2026-03-27 cs.AI cs.LG 62%

Working Paper: Active Causal Structure Learning with Latent Variables: Towards Learning to Detour in Autonomous Robots

工作稿:带有潜在变量的主动因果结构学习:迈向自主机器人中的绕道学习

Pablo de los Riscos, Fernando J. Corbacho

机构 * Computer Engineering Department, Universidad Autónoma de Madrid(马德里自治大学计算机工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过带有潜在变量的主动因果结构学习(ACSLWL)使自主机器人能主动构建因果模型,以应对环境变化,通过学习绕道行为提升效率。

Comments 44 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24617 2026-03-27 cs.DS cs.LG math.OC 57%

Multi-LLM Query Optimization

多LLM查询优化

Arlen Dean, Zijin Zhang, Stefanus Jasin, Yuqing Liu

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文研究如何在异构模型间优化查询分配,通过建立鲁棒的离线查询规划问题,结合联合界限分解与Chernoff型集中界,提出闭式表达式并设计近似方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25121 2026-03-27 cs.RO 50%

CTS-PLL: A Robust and Anytime Framework for Collaborative Task Sequencing and Multi-Agent Path Finding

CTS-PLL:一种用于协作任务序列和多智能体路径寻找的鲁棒且随时可用的框架

Junkai Jiang, Yitao Xu, Ruochen Li, Shaobing Xu, Jianqiang Wang

专题命中 规划推理 :planning(abstract)

AI总结 本文提出CTS-PLL框架,通过锁定机制和LNS优化提升多智能体路径规划的鲁棒性和求解质量,在稀疏和密集环境中均表现出色。

Comments 8 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22120 2026-03-27 cs.CV 50%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24973 2026-03-27 cs.MA 50%

Belief-Driven Multi-Agent Collaboration via Approximate Perfect Bayesian Equilibrium for Social Simulation

基于近似完美贝叶斯均衡的信念驱动多智能体协作:用于社会模拟

Weiwei Fang, Lin Li, Kaize Shi, Yu Yang, Jianwei Zhang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出BEACOF框架,通过动态博弈模型解决多智能体协作中的信念与能力估计循环依赖问题,验证其在对抗、开放和混合场景中的有效性,提升社会模拟的可靠性。

Comments accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02943 2026-03-27 cs.SE 50%

Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation

幻觉到共识:多智能体LLM用于端到端JUnit测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Kui Liu

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出CANDOR框架,通过多智能体协作生成Java单元测试,利用共识策略减少幻觉并提升Oracle准确性,实验表明其在代码覆盖率和突变得分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏