arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-03 至 2026-08-03 共收录 167 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 55 篇

2602.07339 2026-08-03 cs.AI cs.LG cs.RO 版本更新 76%

RAPiD: Reward-Guided Consistency Distillation of Diffusion Planners for Real-Time Autonomous Driving

RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) TCS Research, India(印度TCS研究)

专题命中 规划决策 :planning(title);分类 cs.AI、cs.LG

AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 74%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14917 2026-08-03 cs.CL cs.HC cs.LG 73%

Self-reflecting Large Language Models: A Hegelian Dialectical Approach

Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

机构 * Microsoft Applied Sciences Group (ASG)(微软应用科学组) Department of Philosophy, Lehman College, City University of New York(哲学系,莱曼学院,新 York 城市大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新 71%

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划决策 :planning(title)

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29078 2026-08-03 cs.LG 新提交 70%

DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation

DASH-OPD:面向在线策略蒸馏的带滞后性的差异感知切换算法

Yuchen Xia, Qianguo Sun, Chao Song, Junlong Wu, Yiyan Qi, Yunjian Xu

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) Emdoor Research Institute(亿道研究院)

专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文针对在线策略蒸馏中执行器切换的问题,提出带滞后性的差异感知切换算法 DASH-OPD,经 ALFWorld 验证,其性能优于所有基线,训练与部署效率更优,相关代码等后续将发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29031 2026-08-03 cs.RO cs.AI 新提交 70%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28630 2026-08-03 cs.CY cs.AI 新提交 70%

Scaffolding Critical Engagement with GenAI: Transforming Ethnic Minority Preparatory Students' Collaborative Discourse in Prompt Engineering Tasks

为生成式AI(GenAI)搭建批判性参与支架:在提示工程任务中转变少数民族预科生的协作话语

Deliang Wang, Cunling Bian

专题命中 规划决策 :planning(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究针对中国78名少数民族预科生,通过整合人在回路工作流等的GenAI课程,帮助学生转变对GenAI的依赖,提升提示自我效能,培养其人机协作的批判性认知能动性。

Comments Accepted as a full paper by the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28694 2026-08-03 cs.HC cs.GR 新提交 67%

Guided Exploration of Iterative Schedule Modifications: A Design Study on Railway Traction Unit Scheduling

迭代调度修改的引导式探索:铁路牵引单元调度的设计研究

Andreas Zajic, Vera Hechtl, Cornelia Geischläger, Maximilian Kunovjanek-Bachler, Thomas Hulka, Anna-Lena Penk, Belma Turan, Nadine Schwab, Maximilian Viehauser, Helwig Hauser, Krešimir Matković

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 该研究针对铁路牵引单元调度中交汇序列空间指数增长的问题,提出结合可视化、仿真与三级引导的交互式探索方法,可大幅减少调度修改的识别与评估时间精力。

Comments Accepted for IEEE VIS 2026, will be published in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29617 2026-08-03 cs.LG cs.AI stat.ML 新提交 62%

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

基于值函数的模仿学习中,何时在线交互是有帮助的?表示权衡研究

Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对基于值函数的模仿学习,提出交互式在线算法OVI,发现专家交互可降低学习者的表示要求,且OVI在多数场景下性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25875 2026-08-03 cs.LG cs.AI 版本更新 62%

A2TTA: Anchored-and-Agile Test-Time Adaptation for Evolving Traffic Sensor Networks

A2TTA:用于不断发展的交通传感器网络的锚定与敏捷测试时自适应

Du Yin, Xiachong Lin, Yue Tan, Jinliang Deng, Estrid He, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) Beihang University(北京航空航天大学) RMIT University(皇家墨尔本理工大学)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对交通传感器网络动态变化致传统预测模型性能下降问题,提出A2TTA框架,将拓扑诱导误差转化为输出校准问题,区分时间自适应,联合应对拓扑演变和多尺度时间偏移,实验证明该框架能有效提升预测性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 62%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29182 2026-08-03 eess.IV cs.LG 新提交 57%

Few-shot Deep Learning for Phase-Amplitude Aberration Correction in Transcranial Focused Ultrasound

用于经颅聚焦超声中相位-振幅像差校正的少样本深度学习

Minju Seol, Minjee Seo, Seonaeng Cho, Kyungho Yoon

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究针对经颅聚焦超声像差校正的实时需求,提出少样本深度代理框架,通过预训练加少量微调实现快速适配,校正精度高且速度较传统方法提升显著。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29246 2026-08-03 cs.AI 新提交 57%

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化

Ruiming Liang, Yi Zhong, Yizhen Yuan, Yinan Zheng, Tianyi Tan, Tianyue Wang, Haiyun Guo, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)

专题命中 规划决策 :tool-use(abstract);分类 cs.AI

AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28889 2026-08-03 cs.HC cs.AI 新提交 57%

Human-LLM Collaborative Inductive Coding for Conceptualizing K-12 Educator AI Use

面向K-12教育工作者AI使用的人机协同归纳编码方法

Alex Liu, Min Sun, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出多阶段人机协同编码流程,将LLM作为标注工具辅助K-12教育工作者交互语料库编码,保留人类概念权威,构建含72个条目的分层编码本,为定性研究提供可审计模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28826 2026-08-03 cs.LG 新提交 57%

Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体

Konur Tholl, François Rivest, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Royal Military College of Canada(加拿大皇家军事学院) Defence Research and Development Canada(加拿大国防研究与发展部) Polytechnique Montreal(蒙特利尔理工学院)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23532 2026-08-03 cs.CR cs.AI cs.LO cs.RO 版本更新 57%

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障

Nikolaos Kekatos, Panagiotis Katsaros, Alexios Lekidis, Theodoros Nestoridis, Tom Nianios

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28276 2026-08-03 cs.LG 版本更新 57%

Commit to the Bit: Reactive Reinforcement Learning Done Right

Commit to the Bit: Reactive Reinforcement Learning Done Right

Onno Eberhard, Claire Vernade, Michael Muehlebach

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) University of Technology Nuremberg(纽伦堡技术大学)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 针对确定性观测的有限环境,提出Committed Q-learning算法,在弱于$q_\star$-可实现性的rewire-鲁棒性假设下,证明其几乎必然收敛到最优反应策略。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21846 2026-08-03 cs.AI cs.HC 版本更新 57%

Shaping Scientific Explanations to Expert Perspectives with Persona-Conditioned Reinforcement Learning

基于知识图谱的自适应科学解释的代理人设

Susana Nunes, Tiago Guerreiro, Catia Pesquita

机构 * LASIGE, Faculdade de Ciências da Universidade de Lisboa, Portugal(里斯本大学科学学院LASIGE,葡萄牙)

专题命中 规划决策 :agentic(abstract);分类 cs.AI

AI总结 本文提出一种基于强化学习的科学解释生成方法,通过代理人设引导解释代理器适应专家认知策略,提升解释的适应性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 57%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29596 2026-08-03 cs.RO cs.CV 新提交 50%

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型

Li Lin, Wujun Xu, Weiwei Meng, Kaiwen Xia, Kang Hao Cheong, Shuai Wang

专题命中 规划决策 :planning(abstract)

AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29594 2026-08-03 eess.SY cs.SY 新提交 50%

Profit-Driven Pricing and SLA-Aware Reserve Sizing for Multi-Tenant Satellite O-RAN Services

面向多租户卫星O-RAN服务的利润驱动定价与SLA感知预留容量规划

Manobendu Sarker, Gunes Karabulut Kurt, Wael Jaafar

专题命中 规划决策 :planning(abstract)

AI总结 针对多租户卫星O-RAN服务的资源分配问题,本文提出联合定价与预留容量规划的交替优化方案,实现近最优利润、高效运行及可靠SLA满足,提升资源利用率。

Comments Accepted in GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29567 2026-08-03 cs.RO 新提交 50%

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

TransGraspNet:透明实验器皿的物理与几何一致性操纵

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou

机构 * Peking University(北京大学) School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

专题命中 规划决策 :planning(abstract)

AI总结 TransGraspNet是实现透明实验器皿物理与几何一致性操纵的框架,通过三个耦合原则解决跨阶段不一致问题,在真实机器人平台上实现了高抓取成功率与零液体泼洒的可靠操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29513 2026-08-03 cs.RO 新提交 50%

Homotopy-Aware Corridor Generation without Predefined Reference Paths

无预定义参考路径的同伦感知走廊生成

Haoze Dong, Minghan Li, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 规划决策 :planning(abstract)

AI总结 该研究提出一种无预定义参考路径的自适应多尺度凸集图框架,用于生成同伦感知安全走廊,经数值与硬件实验验证,其图构造高效、轨迹性能稳定,同伦感知轨迹更短且能应对未知障碍物。

Comments 8 pages, 8 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29113 2026-08-03 cs.HC 新提交 50%

Designing a digital word-learning intervention with neurodiverse children: Experiences and ideas from children with developmental language disorder

面向神经多样性儿童的数字词汇学习干预方案设计:发育性语言障碍儿童的经验与思路

Rafiah Ansari, Rina R. Wehbe, Lizbeth Olivia Escobedo

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对发育性语言障碍儿童,采用定制化参与式设计方法,设计词汇学习干预方案,明确了多模态等关键设计要求,为相关干预开发提供了宝贵见解。

Comments 56 pages, 7 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29010 2026-08-03 cs.IR 新提交 50%

EvoReason: Self-Evolving Reasoning Primitive-Guided On-Policy Distillation for Latent Reasoning in Generative Recommendation

EvoReason:用于生成式推荐中潜在推理的自演化推理原语引导在线策略蒸馏

Zhuang Zhuang, Zhipeng Wei, Rongfeng Guo, Shijie Li, Peng Zhao, Jie Chen, Fei Pan

专题命中 规划决策 :agentic(abstract)

AI总结 针对生成式推荐中潜在推理的原始CoT监督效果不佳问题,提出自演化框架EvoReason,通过推理原语引导的在线策略蒸馏实现显式推理监督与学生潜在推理空间的自适应对齐,提升推理迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29005 2026-08-03 cs.NI cs.CR 新提交 50%

Mind the Gap: Policy vs Reality in Post-Quantum TLS Deployment

注意差距:后量子TLS部署中的政策与现实

Nimesha Wickramasinghe, Frank Li, Sanjay Jha, Arash Shaghaghi

专题命中 规划决策 :planning(abstract)

AI总结 本研究通过纵向测量20亿次TLS握手,发现后量子TLS部署在政策差异下呈配置趋同,由托管提供商推动,且无显著延迟增加,为后量子TLS过渡提供实证参考。

Comments Accepted to ACM Internet Measurement Conference (IMC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28995 2026-08-03 cs.RO 新提交 50%

Receding-Horizon Next-Best-View Planner for Autonomous Leaf Surface Reconstruction

面向自主叶片表面重建的滚动时域次最佳视点规划器

Arif Ahmed, Sajal K. Das, Parikshit Maini

机构 * University of Nevada, Reno(内华达大学雷诺分校) Missouri University of Science and Technology(密苏里科技大学)

专题命中 规划决策 :planning(abstract)

AI总结 本研究针对自主叶片表面重建的规划预算与计算资源限制,提出滚动时域次最佳视点规划器,通过基于质心的信息增益函数优化视点效用,在草莓数据集上使重建精度较基线最高提升10%。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28914 2026-08-03 cs.CE 新提交 50%

Bayesian Posterior Sampling for Synthetic Shape Generation of Heart Valves

用于心脏瓣膜合成形状生成的贝叶斯后验采样方法

Vijay Dubey, Sumedh Seetharam, Nikos Manthatis, Collin E. Haese, L. River Spencer, Jakob Christoph Voran, Marnie Goldmann, Felix Kreidel, Issam Moussa, Alison Pouch, Manuel K. Rausch, Jan Fuhg

专题命中 规划决策 :planning(abstract)

AI总结 本文针对基于PCA的心脏瓣膜统计形状模型存在的缺陷,提出贝叶斯后验采样框架,该框架在低数据 regime 下表现优于PCA方法,可高效生成生理合理的瓣膜形状,适用于各类瓣膜的下游应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29476 2026-08-03 q-bio.NC math.PR 新提交 50%

Resource depletion accelerates rate learning but not composition learning in patch foraging

资源耗竭加速斑块觅食中的速率学习,但不加速组成学习

Zachary P. Kilpatrick, Ahmed El Hady

专题命中 规划决策 :agent(abstract)

AI总结 该研究针对动物斑块觅食的分层推理问题,建立规范性贝叶斯模型,发现资源耗竭加速斑块内速率学习但不影响跨斑块组成学习,明确了最大化奖励与寻求信息策略的分歧及相关规则切换条件。

Comments 35 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10167 2026-08-03 cs.CV 版本更新 50%

FlexPath: Adapting Learned Connectivity Guidance to Path Preferences

FlexPath: 基于图像规划的学习语义路径先验

Taehyoung Kim, Tim Schoenbrod, David Eckel, Henri Meeß

机构 * Fraunhofer IVI(弗劳恩霍夫研究所) Technische Hochschule Ingolstadt(因戈尔施塔特技术大学)

专题命中 规划决策 :planning(abstract)

AI总结 提出FlexPath两阶段框架,将可行性先验与偏好解耦,通过可微路径形状目标实现任务自适应,在最短路径规划中搜索代价降低14.3%,并支持零样本泛化与多目标适配。

详情

展开后加载摘要…

URL PDF HTML 收藏