arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-24 至 2026-07-24 共收录 35 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 9 篇

2607.21588 2026-07-24 cs.RO 新提交 83%

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

机构 * Axis Robotics(轴机器人公司) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德州农工大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。

Comments Project Website: https://axisaiorg.github.io/AXIS-V1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21017 2026-07-24 cs.RO 新提交 83%

TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

TableVerse:一个用于可泛化操作的具有真实世界基础布局的大规模桌面数据集

Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun

机构 * ByteDance(字节跳动)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对可泛化机器人操作策略受数据限制的问题,提出TableVerse全自动Real2Sim管道,能将无脚本互联网媒体处理成高保真桌面环境,还集成轨迹生成框架,构建了TableVerse-100K数据集,为相关研究提供数据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20912 2026-07-24 cs.RO 新提交 80%

URF: A Unified Robot Control-Policy Framework for Stable Contact Aware Manipulation

URF:用于稳定接触感知操纵的统一机器人控制策略框架

Jiyou Shin, Youngjin Seo, Jaeseog Won, Sungwon Seo, Hyunjun Kim, Seokmin Yoon, Tuan Luong, Hyungpil Moon

机构 * Faculty of Mechanical Engineering, Sungkyunkwan University(成均馆大学机械工程学院) Faculty of Intelligent Robotics, Sungkyunkwan University(成均馆大学智能机器人学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 研究针对基于学习的操纵策略中动作预测与执行分离在刚性接触时的问题,提出URF统一框架,结合多模态观察预测虚拟目标等,利用接触力构建标签监督控制器模式预测,在相关任务中提升成功率并减少失败模式。

Comments 8 pages, 5 figures, 2 tables. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20683 2026-07-24 cs.RO 新提交 79%

FELT: Generating Tactile Signals from Vision for Visuo-Tactile Manipulation

FELT:从视觉生成触觉信号用于视觉触觉操纵

Zinan Li, Yiyang Ling, Yuming Gu, Binghao Huang, Chenhao Liang, Sharfin Islam, Hisham Bedri, John Chirikjian, Yunzhu Li, Stefanos Nikolaidis, Daniel Seita

机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院) Columbia University(哥伦比亚大学) Starpilot(星航)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 研究针对触觉数据稀缺问题,提出FELT框架,利用视觉编码器和查询解码器从RGB观测合成触觉图像,通过单独分支解码左右传感器面板,实验表明该方法能提升策略成功率,潜在特征训练和部署无需真实触觉传感器。

Comments 26 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20670 2026-07-24 cs.CV 新提交 70%

ODeform: Learning Continuous 4D Motion for Shape Deformation with Neural ODEs

ODeform:使用神经常微分方程学习形状变形的连续4D运动

Yordanka Velikova, Mahdi Saleh, Liming Kuang, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 ODeform将神经常微分方程扩展用于3D可变形物体连续4D动力学,把3D点云和物理条件转换到潜在空间,通过求解常微分方程对变形建模为连续流,在未见物理参数配置上评估,提升运动预测精度,能转移到新形状真实物体,可有效插值和外推动力学。

Comments Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21518 2026-07-24 cs.AI 新提交 57%

Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation

相同危险目标,相反建议:直接暴露与多智能体调解

Linjun Li

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究通过测试发现,语言模型直接面对危险目标和经智能体转换传递指令时表现不同,存在行为反向转变及组合安全漏洞,高性能模型可用于特定自动化工作流程的用户端组件,却未明确其内部机制。

Comments 21 pages; welcome comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21036 2026-07-24 cs.CV 新提交 57%

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。

Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21513 2026-07-24 cs.HC cs.IR 新提交 50%

Transparent by Design, Usable in Practice? A Formative Usability Study of a Conversational Product Advisor

设计透明,实践可用?对话式产品顾问的形成性可用性研究

Kevin Schott, Dagmar Kern, Daniel Hienert

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究对话式产品顾问的可用性,通过对含受限自然语言生成等功能的笔记本搜索聊天机器人进行研究,发现设计透明不保证理解,排名解释有严重问题,参与者虽看重省力但希望有更多直接操作控件,贡献了可用性问题及设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21507 2026-07-24 cond-mat.supr-con cond-mat.mes-hall cond-mat.mtrl-sci 新提交 50%

Supercurrent effect in a charge density wave intertwined superconductor

电荷密度波交织超导体中的超流效应

Zhen Zhu, Wei Cheng, Dang Liu, Pengyu Hu, Yi Yang, Qiaoyan Yu, Shasha Xue, Ruijun Xi, Xingsen Chen, Jice Sun, Dandan Guan, Yaoyi Li, Shiyong Wang, Canhua Liu, Zhuan Xu, Xin Liu, Hao Zheng, Jinfeng Jia

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究电荷密度波交织超导体中超流效应,利用扫描隧道光谱成像揭示超导NbSe2中CDW调制的场驱动对称性破缺,通过模型计算表明各向异性源于E-k色散重建,可按需调整CDW调制及可视化分布,突出动量空间工程控相新机制。

Comments Main text: 20 pages, 4 figures; Supplementary Information: 27 pages, 17 figures

Journal ref Nature Communications 17, 7009 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 7 篇

2607.20743 2026-07-24 cs.RO cs.AI cs.LG 新提交 82%

Self-Supervised Bio-Inspired Robotic Trajectory Planning with Obstacle Avoidance

具有避障功能的自监督生物启发式机器人轨迹规划

Miroslav Krupa, Miroslav Cibula, Kristína Malinovská

机构 * Faculty of Mathematics, Physics and Informatics, Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学数学、物理与信息学院)

专题命中 具身导航 :robotic(title);robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究机器人轨迹规划问题,提出基于自监督学习框架,利用正反模型作监督机制,在含障碍物环境下规划轨迹,实验证明方法可行,针对规划器问题提出并评估了额外训练机制和缓解策略。

Comments 12 pages, 3 figures. To be published in 2026 International Conference on Artificial Neural Networks (ICANN) proceedings. This research was supported by the Slovak Research and Development Agency, project APVV-21-0105

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 79%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20926 2026-07-24 cs.AI 新提交 79%

SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration

SciExplore:评估从科学导航到信息整合的自主智能体

Yinhao Tang, Youqing Fang, Yanan Sun, Wenran Liu, Weiming Zhang, Bin Liu, Kuikun Liu, Wenwei Zhang, Kai Chen

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型和智能体科学信息检索与推理能力的基准SciExplore,包含四类任务,在其上评估多个先进模型和智能体,发现随着任务复杂度增加性能差距大,凸显当前模型在实际科学信息检索场景中的局限。

Comments 25 pages, 13 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20772 2026-07-24 cs.RO 新提交 79%

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination

使用解耦规划和轨迹协调的社会一致多机器人导航

Matthew M. Sato, Kincho H. Law

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究多机器人在人类环境中的导航,通过解耦规划与轨迹协调,改进A*规划器嵌入社会规范构建社会图,转化轨迹协调为凸规划,实现可预测、符合社会规范的路径规划,简化多机器人协调。

Comments Submitted to Civil Engineering Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21438 2026-07-24 cs.CV 新提交 57%

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

DAPM:从任意高度、俯仰、横滚和视场角进行无人机单目深度估计

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 研究针对无人机单目深度估计在多样视角和大尺度深度分布下的难题,提出DAPM模型,通过建立视角定量表示,引入IGD和PQB模块,在UAPD数据集上实验,该模型在深度和相机姿态估计方面达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21043 2026-07-24 cs.RO 新提交 57%

A Real-Time Generalized Nash Equilibrium Framework for Interaction-Aware Autonomous Driving in Mixed Traffic

用于混合交通中交互感知自动驾驶的实时广义纳什均衡框架

Nouhed Naidja, Mohamed-Cherif Rahal, Steve Pechberti, Stéphane Font, Guillaume Sandou, Marc Revilloud

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对自动驾驶在混合交通环境中的挑战,提出将驾驶交互建模为广义纳什均衡问题的决策框架,基于粒子群优化提出实时求解器,经实验验证能处理关键场景,求解器操作可行且收敛快。

Journal ref The 12th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026), Jul 2026, Bari (Italy), Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21284 2026-07-24 cs.CL 新提交 50%

news-crawler-LM: A Small Long-Context Model For High-Quality News Crawling

新闻爬虫语言模型:一种用于高质量新闻爬虫的小型长上下文模型

Pascal Stolzenburg, Jonas Golde, Max Dallabetta, Alan Akbik

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 具身导航 :navigation(abstract)

AI总结 研究旨在解决新闻页面结构化内容提取难题,提出基于眼底新闻爬虫库微调的小型长上下文语言模型news-crawler-LM,能将HTML转换为文本和JSON,在HTML到Markdown和JSON提取任务中性能出色,且向研究社区发布了所有模型和工件。

Comments KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 5 篇

2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 87%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20988 2026-07-24 cs.CV cs.AI 新提交 81%

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

HyWorldVLA:一种用于自动驾驶的具有混合世界建模的视觉-语言-动作模型

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

机构 * Automotive New Technology Research Institute, BYD Company Limited(比亚迪汽车新技术研究院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 研究针对自动驾驶中视觉-语言-动作模型的不足,提出HyWorldVLA框架,统一像素级监督与潜在表征学习。预训练阶段预测视频潜在并重建帧,微调阶段预测潜在特征生成轨迹,实验表明其性能优于基线,还建立了世界模型噪声鲁棒性评估新基准。

Comments 20 pages with 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20441 2026-07-24 cs.CL cs.LG 新提交 74%

Belief Propagation in LLM World Models: Measuring Strategic Information Bias with Prediction Markets

大语言模型世界模型中的信念传播:用预测市场测量战略信息偏差

Mykola Khandoga, Yevhen Kostiuk, Anton Polishko, Yurii Filipchuk, Kostiantyn Kozlov, Dmytro Zamriy, Artur Kiulian

机构 * Future Principle(未来原理) Aarhus University(奥胡斯大学)

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 研究大语言模型结合预测市场测量信息偏差,通过消融特定文本偏差贡献,应用于乌克兰相关预测市场发现英语新闻背景致偏差,主要源于文本,补充乌军事分析源可减偏差,此偏差在多架构中会持续并影响下游决策。

Comments Accepted at UNLP 2026. 12 pages, 8 figures, 11 tables. Dataset available at https://huggingface.co/datasets/OpenBabylon/unlp-ukraine-forecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21594 2026-07-24 cs.CV 新提交 57%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21107 2026-07-24 hep-th 新提交 50%

One-point holographic correlator in the expanding universe

膨胀宇宙中的单点全息关联器

Souvik Paul, Gopinath Guin, Sunandan Gangopadhyay

专题命中 具身推理 :world model(abstract)

AI总结 研究膨胀宇宙中大量算符的随时间变化的热单点函数,采用Randall-Sundrum II膜世界模型结合p膜气体,运用测地线公式计算,通过以色列交界条件得膜位置,分析了不同物质主导宇宙中热单点函数的早晚行为。

Comments 34 Pages Latex, 8 Figures, Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2607.21113 2026-07-24 cs.RO 新提交 79%

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) Second Hospital of Dalian Medical University(大连医科大学附属第二医院) The University of Tokyo(东京大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20834 2026-07-24 cs.LG 新提交 57%

Offline RL with Hierarchical Action Chunking

基于分层动作分块的离线强化学习

Ahad Jawaid

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。

Comments RLC/RLJ 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2607.21137 2026-07-24 cs.CV cs.LG 新提交 81%

Safety-oriented sidewalk and road segmentation for smartphone-based assistive navigation

面向智能手机辅助导航的安全导向型人行道和道路分割

Hakan Calim, Anamaria Dumitrescu, Adarsh Bhandary Panambur, Huzaifa Asif, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-University Erlangen-Nuremberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学模式识别实验室)

专题命中 人机交互与遥操作 :navigation(title,abstract);分类 cs.CV、cs.LG

AI总结 研究针对智能手机辅助导航中区分人行道与不安全区域的需求,提出安全导向语义分割框架,引入数据集并评估多种分割架构,通过多指标评估模型,结果显示应综合评估辅助人行道感知,有助于选择平衡多方面因素的模型。

Comments 17 pages, 4 figures, 3 tables. Submitted to Assistive Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 9 篇

2607.21582 2026-07-24 cs.RO cs.CV 新提交 85%

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

战略扩展:通过偏差感知评估和数据收集学习机器人操作中的组合泛化

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) NVIDIA(英伟达)

专题命中 机器人数据与评测 :manipulation(title);robotic(title);分类 cs.RO、cs.CV

AI总结 研究机器人操作中组合泛化问题,通过引入诊断框架量化指令因素偏差,提出偏差感知数据收集策略,能定位预训练策略捷径问题,实现更高效可泛化的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 84%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 67%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21488 2026-07-24 cs.LG cs.AI cs.MA cs.RO 新提交 67%

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

无信号交叉口自动驾驶车辆的紧凑潜在协调

Gil Lifshits, Igal Bilik, Gilad Katz

机构 * Ben-Gurion University of the Negev(内盖夫本古里安大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对无信号交叉口自动驾驶车辆协调难题提出MAPS分层DRL架构,主智能体生成编码全局策略的原型计划,工作智能体结合局部观测执行控制。实验表明MAPS能实现无碰撞导航、减少行驶时间,且原型计划泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 62%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20493 2026-07-24 cs.AI cs.LG 新提交 62%

Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Series Forecasting Models

基于注意力的经验回放框架用于不可知时间序列预测模型的持续学习

Quentin Besnard, Nicolas Ragot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络依赖固定数据集无法适应动态环境的问题,提出基于注意力机制引导经验回放策略的持续时间序列预测框架,能动态适应新环境保留知识,减轻遗忘,在多数据集上评估显示可提高预测性能、降低成本和数据需求。

Journal ref CAp & RFIAP, Jul 2026, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏