arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-24 至 2026-07-24 共收录 64 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 19 篇

2607.21438 2026-07-24 cs.CV 新提交 57%

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

DAPM:从任意高度、俯仰、横滚和视场角进行无人机单目深度估计

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 研究针对无人机单目深度估计在多样视角和大尺度深度分布下的难题,提出DAPM模型,通过建立视角定量表示,引入IGD和PQB模块,在UAPD数据集上实验,该模型在深度和相机姿态估计方面达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21043 2026-07-24 cs.RO 新提交 57%

A Real-Time Generalized Nash Equilibrium Framework for Interaction-Aware Autonomous Driving in Mixed Traffic

用于混合交通中交互感知自动驾驶的实时广义纳什均衡框架

Nouhed Naidja, Mohamed-Cherif Rahal, Steve Pechberti, Stéphane Font, Guillaume Sandou, Marc Revilloud

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对自动驾驶在混合交通环境中的挑战,提出将驾驶交互建模为广义纳什均衡问题的决策框架,基于粒子群优化提出实时求解器,经实验验证能处理关键场景,求解器操作可行且收敛快。

Journal ref The 12th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026), Jul 2026, Bari (Italy), Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12997 2026-07-24 cs.AI cs.CL 版本更新 57%

WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance

WebCoach:具有跨会话记忆引导的自我进化网络代理

Genglin Liu, Shijie Geng, Sha Li, Hejie Cui, Sarah Zhang, Xin Liu, Tianyi Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon(亚马逊)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00934 2026-07-24 cs.LO cs.RO 版本更新 57%

pacSTL: PAC-Bounded Signal Temporal Logic from Data-Driven Reachability Analysis

pacSTL: 基于数据驱动可达性分析的PAC有界信号时序逻辑

Hanna Krasowski, Elizabeth Dietrich, Emir Cem Gezer, Roger Skjetne, Asgeir Johan Sørensen, Murat Arcak

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出pacSTL框架,结合PAC有界可达集预测与区间STL,通过优化问题计算原子鲁棒性上下界并传播,实现规范级别的PAC有界鲁棒性评估,用于不确定动态系统的验证与监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21284 2026-07-24 cs.CL 新提交 50%

news-crawler-LM: A Small Long-Context Model For High-Quality News Crawling

新闻爬虫语言模型:一种用于高质量新闻爬虫的小型长上下文模型

Pascal Stolzenburg, Jonas Golde, Max Dallabetta, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 具身导航 :navigation(abstract)

AI总结 研究旨在解决新闻页面结构化内容提取难题,提出基于眼底新闻爬虫库微调的小型长上下文语言模型news-crawler-LM,能将HTML转换为文本和JSON,在HTML到Markdown和JSON提取任务中性能出色,且向研究社区发布了所有模型和工件。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17781 2026-07-24 math.DS math.OC stat.CO 版本更新 50%

Geometry-Consistent Bayesian Filtering under Structural Model Uncertainty: A Geometric Projection Particle Filter

模型不确定性下的几何投影粒子滤波

Surya Ratna Prakash D, Soumyendu Raha

专题命中 具身导航 :navigation(abstract)

AI总结 研究针对自主GNC系统中模型不确定性下的非线性状态估计问题,提出几何投影粒子滤波器,通过将动力学投影到测量一致子空间减少不匹配,在月球下降导航场景中评估,有效减少粒子退化,提高估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 7 篇

2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 87%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20988 2026-07-24 cs.CV cs.AI 新提交 81%

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。

Comments 20 pages with 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20441 2026-07-24 cs.CL cs.LG 新提交 74%

Belief Propagation in LLM World Models: Measuring Strategic Information Bias with Prediction Markets

大语言模型世界模型中的信念传播:用预测市场测量战略信息偏差

Mykola Khandoga, Yevhen Kostiuk, Anton Polishko, Yurii Filipchuk, Kostiantyn Kozlov, Dmytro Zamriy, Artur Kiulian

机构 * Future Principle(未来原理) Aarhus University(奥胡斯大学)

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 研究大语言模型结合预测市场测量信息偏差,通过消融特定文本偏差贡献,应用于乌克兰相关预测市场发现英语新闻背景致偏差,主要源于文本,补充乌军事分析源可减偏差,此偏差在多架构中会持续并影响下游决策。

Comments Accepted at UNLP 2026. 12 pages, 8 figures, 11 tables. Dataset available at https://huggingface.co/datasets/OpenBabylon/unlp-ukraine-forecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26856 2026-07-24 q-bio.NC cs.AI cs.RO 版本更新 62%

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology

感觉调节网络:可停性作为对象导向现象学的架构基础

G. Nagarjuna, Durgaprasad Karnam

机构 * Indian Institute of Science Education and Research (IISER) Pune(印度科学教育与研究学院(IISER)浦那) Centre for Educational Technology (CET), Indian Institute of Technology Bombay(教育技术中心(CET),印度理工学院孟买)

专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 本文提出感觉调节网络(SMN)作为具身认知的架构,通过对手动力学和可停性机制,将对象导向现象学(胡塞尔意义)的意向性建立在身体组织的结构特征上,从而调和认知主义与4E认知的争论。

Comments 51 pages, main body 39 pages + References 6 pages, Appendices 6 pages, Tables 3, and Figures 16

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21594 2026-07-24 cs.CV 新提交 57%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 57%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21107 2026-07-24 hep-th 新提交 50%

One-point holographic correlator in the expanding universe

膨胀宇宙中的单点全息关联器

Souvik Paul, Gopinath Guin, Sunandan Gangopadhyay

专题命中 具身推理 :world model(abstract)

AI总结 研究膨胀宇宙中大量算符的随时间变化的热单点函数,采用Randall-Sundrum II膜世界模型结合p膜气体,运用测地线公式计算,通过以色列交界条件得膜位置,分析了不同物质主导宇宙中热单点函数的早晚行为。

Comments 34 Pages Latex, 8 Figures, Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2603.04910 2026-07-24 cs.RO cs.AI cs.LG 版本更新 76%

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆

Yuheng Lei, Zhixuan Liang, Hongyuan Zhang, Ping Luo

机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 5 篇

2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 85%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :robotics(title);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21113 2026-07-24 cs.RO 新提交 79%

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) Second Hospital of Dalian Medical University(大连医科大学附属第二医院) The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06954 2026-07-24 cs.RO cs.SY eess.SY 版本更新 70%

Is Your Safe Controller Actually Safe? A Critical Review of CBF Tautologies and Hidden Assumptions

你的安全控制器真的安全吗?CBF永真式和隐藏假设的批判性审查

Taekyung Kim

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文批判性地审查了CBF在机器人安全中的应用,揭示了安全控制器理论与实际实现之间的差距,并提供了构建实际安全论证的实用指南。

Comments Technical Report. Interactive web demo: https://cbf.taekyung.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20220 2026-07-24 cs.RO cs.AI 版本更新 62%

What Matters for Simulation to Online Reinforcement Learning on Real Robots

在真实机器人上在线强化学习中什么至关重要

Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

机构 * ETH Zurich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究探讨了在真实机器人上实现稳定在线强化学习的关键设计选择,发现某些默认设置可能有害,而稳健的设计选择能提高学习稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20834 2026-07-24 cs.LG 新提交 57%

Offline RL with Hierarchical Action Chunking

基于分层动作分块的离线强化学习

Ahad Jawaid

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。

Comments RLC/RLJ 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2607.21137 2026-07-24 cs.CV cs.LG 新提交 81%

Safety-oriented sidewalk and road segmentation for smartphone-based assistive navigation

面向智能手机辅助导航的安全导向型人行道和道路分割

Hakan Calim, Anamaria Dumitrescu, Adarsh Bhandary Panambur, Huzaifa Asif, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-University Erlangen-Nuremberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学模式识别实验室)

专题命中 人机交互与遥操作 :navigation(title,abstract);分类 cs.CV、cs.LG

AI总结 研究针对智能手机辅助导航中区分人行道与不安全区域的需求,提出安全导向语义分割框架,引入数据集并评估多种分割架构,通过多指标评估模型,结果显示应综合评估辅助人行道感知,有助于选择平衡多方面因素的模型。

Comments 17 pages, 4 figures, 3 tables. Submitted to Assistive Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 12 篇

2607.21582 2026-07-24 cs.RO cs.CV 新提交 85%

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

战略扩展:通过偏差感知评估和数据收集学习机器人操作中的组合泛化

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) NVIDIA(英伟达)

专题命中 机器人数据与评测 :manipulation(title);robotic(title);分类 cs.RO、cs.CV

AI总结 研究机器人操作中组合泛化问题,通过引入诊断框架量化指令因素偏差,提出偏差感知数据收集策略,能定位预训练策略捷径问题,实现更高效可泛化的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 84%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19178 2026-07-24 cs.RO cs.AI 版本更新 73%

Vision-Language-Policy Model for Dynamic Robot Task Planning

用于动态机器人任务规划的视觉-语言-策略模型

Jin Wang, Kim Tien Ly, Jacques Cloete, Jin Jin, Nikos Tsagarakis, Ioannis Havoutis

机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 67%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21488 2026-07-24 cs.LG cs.AI cs.MA cs.RO 新提交 67%

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

无信号交叉口自动驾驶车辆的紧凑潜在协调

Gil Lifshits, Igal Bilik, Gilad Katz

机构 * Ben-Gurion University of the Negev(内盖夫本古里安大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对无信号交叉口自动驾驶车辆协调难题提出MAPS分层DRL架构,主智能体生成编码全局策略的原型计划,工作智能体结合局部观测执行控制。实验表明MAPS能实现无碰撞导航、减少行驶时间,且原型计划泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 62%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20493 2026-07-24 cs.AI cs.LG 新提交 62%

Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Series Forecasting Models

基于注意力的经验回放框架用于不可知时间序列预测模型的持续学习

Quentin Besnard, Nicolas Ragot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络依赖固定数据集无法适应动态环境的问题,提出基于注意力机制引导经验回放策略的持续时间序列预测框架,能动态适应新环境保留知识,减轻遗忘,在多数据集上评估显示可提高预测性能、降低成本和数据需求。

Journal ref CAp & RFIAP, Jul 2026, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 62%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21571 2026-07-24 cs.RO 新提交 57%

Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering

超越情节性评估:序列式具身问答中的内存架构瓶颈

Zikui Cai, Kaushal Janga, Tan Dat Dao, Seungjae Lee, Shivin Dass, Mingyo Seo, Kaiyu Yue, Mintong Kang, Nandhu Pillai, Monte Hoover, Aadi Palnitkar, Ruchit Rawal, Ruijie Zheng, Bo Li, Yuke Zhu, Roberto Martín-Martín, Tom Goldstein, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究序列式具身问答中不同内存架构表现,发现仅保留现有记忆不足,短视情节数据训练的智能体有时间不匹配问题。强调结构化、基于空间记忆的必要性,实验表明其能打破准确性-效率权衡,对真实机器人连续智能操作至关重要。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21309 2026-07-24 cs.RO 新提交 57%

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar

用于基于平面激光雷达的人体姿态估计的分解时空卷积

Simone Arreghini, Mirko Nava, Nicholas Carlotti, Antonio Paolillo, Alessandro Giusti

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(瑞士意大利语区大学提契诺大学人工智能达勒莫利研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 针对服务机器人仅配备平面激光雷达和普通处理器的情况,提出基于时空块的轻量级网络,用于全向人体检测和相对2D姿态估计,通过跨模态自监督训练,优于基线模型,适用于计算受限的服务机器人空间感知。

详情

展开后加载摘要…

URL PDF HTML 收藏