arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 25 篇

2604.07944 2026-04-10 cs.RO cs.AI cs.SY eess.SY 85%

On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning

语言模型在自动驾驶运动规划中的在线策略蒸馏

Amirhossein Afsharrad, Amirhesam Abedsoltan, Ahmadreza Moradipari, Sanjay Lall

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究如何将大模型的运动规划知识迁移到小模型,提出在线通用知识蒸馏方法,在nuScenes基准测试中表现优于强化学习基线,模型规模缩小5倍仍保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01062 2026-04-10 cs.CL cs.AI cs.LG 85%

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

SealQA: 提升搜索增强语言模型在事实性问题中的推理能力

Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 规划推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SealQA是一个新的挑战性基准,用于评估搜索增强语言模型在事实性问题上的能力,揭示当前模型在处理冲突、噪声或无用搜索结果时的局限性。

Comments Camera Ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07048 2026-04-10 cs.CL cs.AI 84%

Search-R3: Unifying Reasoning and Embedding in Large Language Models

Search-R3:在大型语言模型中统一推理与嵌入

Yuntao Gui, James Cheng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Search-R3通过统一推理与嵌入生成过程,提升大型语言模型在检索任务中的性能,采用监督学习、强化学习和专用环境机制实现有效嵌入生成。

Comments CHANGELOG: (1) Completed training of Search-R3-Large; (2) Corrected error formulation; (3) Added a `Discussion` section to the appendix. We appreciation to the anonymous reviewers

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17209 2026-04-10 cs.RO cs.AI 83%

LiloDriver: A Lifelong Learning Framework for Closed-loop Motion Planning in Long-tail Autonomous Driving Scenarios

LiloDriver:一种面向长尾自动驾驶场景闭环运动规划的终身学习框架

Huaiyuan Yao, Pengfei Li, Bu Jin, Yupeng Zheng, An Liu, Lisen Mu, Qing Su, Qian Zhang, Yilun Chen, Peng Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Horizon Robotics(地平线机器人)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 LiloDriver通过结合大语言模型与记忆增强的规划生成系统,实现了在长尾自动驾驶场景中闭环运动规划的持续适应,优于传统规则和学习方法。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV 82%

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 81%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07687 2026-04-10 cs.LG cs.AI 81%

Joint Task Offloading, Inference Optimization and UAV Trajectory Planning for Generative AI Empowered Intelligent Transportation Digital Twin

生成式人工智能赋能的智能交通数字孪生中的联合任务卸载、推断优化与无人机轨迹规划

Xiaohuan Li, Junchuan Fan, Bingqi Zhang, Rong Yu, Xumin Huang, Qian Chen

机构 * Guangxi University Key Laboratory of Intelligent Networking and Scenario System (School of Information and Communication, Guilin University of Electronic Technology)(广西大学智能组网与场景系统重点实验室(桂林电子科技大学信息与通信学院)) Research Institute of Highway Ministry of Transport(交通运输部公路科学研究院) School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Architecture and Transportation Engineering, Guilin University of Electronic Technology(桂林电子科技大学建筑与交通工程学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种联合优化方法,通过无人机任务卸载、推断优化和轨迹规划提升生成式人工智能赋能的智能交通数字孪生的精度与延迟平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06925 2026-04-10 cs.MM 78%

LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment

LungCURE:多模态真实世界临床推理基准测试用于精准肺癌诊断与治疗

Fangyu Hao, Jiayu Yang, Yifan Zhu, Zijun Yu, Qicen Wu, Wang Yunlong, Jiawei Li, Yulin Liu, Xu Zeng, Guanting Chen, Shihao Li, Zhonghong Ou, Meina Song, Mengyang Sun, Haoran Luo, Yu Shi, Yingyi Wang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出LungCURE基准测试,通过1000个真实世界病例评估多模态模型在肺癌TNM分期、治疗推荐和临床决策支持中的性能,并引入LCAgent框架提升模型在复杂医疗场景中的推理能力。

Comments 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01804 2026-04-10 cs.CL cs.AI cs.LG 75%

$\texttt{SEM-CTRL}$: Semantically Controlled Decoding

SEM-CTRL:语义控制解码

Mohammad Albinhassan, Pranava Madhyastha, Alessandra Russo

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SEM-CTRL,通过集成基于答案集语法的约束,使LLM在不微调的情况下保证输出的语法和语义正确性,实验显示其在多种任务中优于现有模型。

Comments Published in Transactions on Machine Learning Research (TMLR), 03/2026

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08033 2026-04-10 cs.AI cs.MA cs.NI 70%

IoT-Brain: Grounding LLMs for Semantic-Spatial Sensor Scheduling

IoT-Brain:为语义-空间传感器调度 grounding LLMs

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin, Jinke Song

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出IoT-Brain系统,通过引入空间轨迹图(STG)解决LLM在语义-空间传感器调度中的表示、推理和优化缺陷,提升任务成功率37.6%并显著降低资源消耗。

Comments To appear in ACM MobiCom 2026; 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08296 2026-04-10 cs.AI 70%

Towards a Science of Scaling Agent Systems

迈向代理系统的科学:扩展性研究

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究院) Massachusetts Institute of Technology(麻省理工学院) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文通过260种配置评估六种代理基准,探讨代理系统在扩展维度上的性能变化规律,揭示协调、模型能力与任务结构之间的关系,发现协作成功取决于协调与任务结构的匹配程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07767 2026-04-10 cs.DC 67%

Administrative Decentralization in Edge-Cloud Multi-Agent for Mobile Automation

边缘-云多智能体中的行政去中心化

Senyao Li, Zhigang Zuo, Haozhao Wang, Junyu Chen, Zhanbo Jin, Ruixuan LI

专题命中 规划推理 :planning(abstract);self-correction(abstract)

AI总结 本文提出AdecPilot,通过将行政去中心化原则应用于边缘-云多智能体框架,实现边缘代理的重新定义,提升任务成功率并降低云资源消耗与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07430 2026-04-10 cs.CV 67%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15219 2026-04-10 cs.HC 67%

Multi-Agent Home Energy Management Assistant

多代理家庭能源管理助手

Wooyoung Jung

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出HEMA,首个开源多代理系统,通过多轮对话保持上下文,支持多样化的家庭能源管理任务,结合大语言模型与领域专用工具,提供能源分析、教育支持和智能设备控制。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08124 2026-04-10 cs.AI 57%

Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search

超越随机探索:训练数据为何对代理搜索有价值

Chuzhan Hao, Wenfeng Feng, Guochao Jiang, Guofeng Quan, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里云)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Hierarchical Experience框架,通过对比分析和多级聚类机制将原始推理轨迹转化为层次经验知识,提升搜索代理的性能和训练稳定性,实现更高效的策略驱动搜索。

Comments 15 pages, ACL2026 Findings Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07681 2026-04-10 cs.AI 57%

Multi-Agent Orchestration for High-Throughput Materials Screening on a Leadership-Class System

面向领导级系统的高通量材料筛选多智能体协调

Thang Duc Pham, Harikrishna Tummalapalli, Fakhrul Hasan Bhuiyan, Álvaro Vázquez Mayagoitia, Christine Simpson, Riccardo Balin, Venkatram Vishwanath, Murat Keçeli

机构 * Computational Science (CPS) Division, Argonne National Laboratory(阿贡国家实验室计算科学(CPS)部) Argonne Leadership Computing Facility (ALCF), Argonne National Laboratory(阿贡国家实验室阿贡领导力计算设施(ALCF))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种可扩展的多智能体框架,用于在领导级系统上高效执行高通量筛选任务,通过中央规划代理动态分配任务并利用并行执行代理,降低开销并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07667 2026-04-10 cs.AI cs.MA cs.SI 57%

From Debate to Decision: Conformal Social Choice for Safe Multi-Agent Deliberation

从辩论到决策:用于安全多智能体辩论的符合社会选择

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Aijing Gao, Guang Yang, Ziyuan Li, Qucy Wei Qiu, Fangwei Han, Hengzhi Qiu, Yajing Huang, Bing Zhu, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Conformal Social Choice方法,通过后处理层将辩论输出转化为校准的行动与升级决策,确保正确答案的概率覆盖,提升多智能体辩论的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07424 2026-04-10 cs.AI cs.CY cs.MA 57%

An Analysis of Artificial Intelligence Adoption in NIH-Funded Research

NIH资助研究中人工智能采纳的分析

Navapat Nananukul, Mayank Kejriwal

机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文分析了NIH资助研究中AI的采纳情况,提出了一种人机协同的方法来大规模分类和总结研究描述,发现AI在NIH portfolio中占比15.9%,存在研究到应用的差距,且健康不平等研究严重不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06747 2026-04-10 cs.AI 57%

TurboAgent: An LLM-Driven Autonomous Multi-Agent Framework for Turbomachinery Aerodynamic Design

TurboAgent:一种基于大语言模型的自主多智能体框架用于涡轮机械气动设计

Juan Du, Yueteng Wu, Pan Zhao, Yuze Liu, Min Zhang, Xiaobin Xu, Xinglong Zhang

机构 * Digital Twin Research Center, Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所数字孪生研究中心) National Key Laboratory of Science and Technology on Advanced Light-duty Gas-Turbine, Chinese Academy of Sciences(中国科学院先进轻型燃气轮机科学与技术国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出TurboAgent框架,通过大语言模型实现涡轮机械气动设计的端到端自主设计,结合生成设计、性能预测、多目标优化和物理验证,实现数据驱动的协作流程,提升设计效率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07809 2026-04-10 cs.CR cs.AI 57%

Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents

对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击

Renhua Ding, Xiao Yang, Zhengwei Fang, Jun Luo, Kun He, Jun Zhu

机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08031 2026-04-10 cs.RO cs.CV 50%

Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

基于LLM的多规划器调度的开放式指令实现用于自动驾驶车辆

Jiawei Liu, Xun Gong, Fen Fang, Muli Yang, Bohao Qu, Yunfeng Hu, Hong Chen, Xulei Yang, Qing Guo

机构 * Jilin University(吉林大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Tongji University(同济大学) NKIARI Nankai University(南开大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种基于大语言模型的指令实现框架,通过实时反馈调度多个基于模型预测控制的运动规划器,提高任务完成率并降低LLM查询成本,同时确保安全性和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07479 2026-04-10 math.OC cs.GT cs.SY econ.TH eess.SY 50%

Linearly Solvable Continuous-Time General-Sum Stochastic Differential Games

可线性求解的连续时间一般和随机微分博弈

Monika Tomar, Takashi Tanaka

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一类可线性求解的连续时间有限参与者随机一般和微分博弈,通过精确的线性PDE系统求解。利用交叉对数似然比构建分布规划博弈,解决多智能体空间冲突问题,通过广义多元Cole-Hopf变换将非线性HJB方程转化为线性偏微分方程,实现高效的反馈纳什均衡策略计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07375 2026-04-10 cs.CY cs.HC 50%

Assessing the Feasibility of a Video-Based Conversational Chatbot Survey for Measuring Perceived Cycling Safety: A Pilot Study in New York City

评估基于视频的对话式聊天机器人调查在测量感知骑行安全性的可行性:纽约市试点研究

Feiyang Ren, Zhaoxi Zhang, Tamir Mendel, Takahiro Yabe

专题命中 规划推理 :planning(abstract)

AI总结 本文提出利用大语言模型结合视频调查和对话式AI聊天机器人,评估骑行安全感知的可行性,并通过纽约市九个街区的试点调查验证方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07146 2026-04-10 cs.CV 50%

Learning to Search: A Decision-Based Agent for Knowledge-Based Visual Question Answering

学习搜索:一种基于决策的知识增强视觉问答代理

Zhuohong Chen, Zhenxian Wu, Yunyao Yu, Hangrui Xu, Zirui Liao, Zhifang Liu, Xiangwen Deng, Pen Jiao, Haoqian Wang

机构 * Tsinghua University(清华大学) University of Arizona(亚利桑那大学) Hefei University of Technology(合肥工业大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25044 2026-04-10 cs.RO 50%

ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making

ThermoAct:面向机器人感知与决策的热感知视觉-语言-动作模型

Young-Chae Son, Dae-Kwan Ko, Yoon-Ji Choi, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种融合热信息的视觉-语言-动作框架,通过高阶规划器解析自然语言指令并分解为子任务,提升机器人复杂操作的执行效率与安全性。

Comments 2026 RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏