arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-07 至 2026-07-07 共收录 223 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 45 篇

2512.22867 2026-07-07 cs.CV cs.RO 版本更新 81%

MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集

Zhuonan Liu, Xinyu Zhang, Zishuo Wang, Runji Cai, Tomohito Kawabata, Qianyi Li, Xuance Peng, Tianze Yu, Zhen Xiong, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新 79%

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03144 2026-07-07 econ.GN q-fin.EC 新提交 78%

DSGE as a Structured World Model:Benchmarking Counterfactual Generalization in Economic Worlds

作为结构化世界模型的动态随机一般均衡模型:经济世界中反事实泛化的基准测试

Wenli Xu

专题命中 机器人数据与评测 :world model(title,abstract)

AI总结 研究现代世界模型在反事实状态下的弱点,提出动态随机一般均衡(DSGE)模型是结构化世界模型,介绍DSGE-Gym基准,发现学习的世界模型在路径外崩溃,用DSGE生成的数据训练可减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14625 2026-07-07 cs.IT math.IT 版本更新 78%

Digital Twin Synchronization Over Mobile Embodied AI Network With Agentic Intelligence

基于移动具身AI网络的数字孪生同步

Zhouxiang Zhao, Jiaxiang Wang, Yahao Ding, Yinchao Yang, Zhaohui Yang, Mohammad Shikh-Bahaei, Julie A. McCann, Zhaoyang Zhang, Kaibin Huang

专题命中 机器人数据与评测 :embodied AI(title,abstract)

AI总结 本文提出基于移动具身AI网络的数字孪生同步框架,通过五阶段闭环工作流和分层优化算法,实现高保真同步并降低偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13660 2026-07-07 cs.RO cs.CV 版本更新 76%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.CV

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交 70%

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09458 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 70%

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

SilvaScenes:自然森林冠层下图像中的树木检测与物种分类

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defosse, Frédéric Moore, Philippe Nolet, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval(北方机器人实验室,拉瓦尔大学) Département des sciences du bois et de la forêt, Université Laval(林业与木材科学系,拉瓦尔大学) Institut des Sciences de la Forêt tempérée, Université du Québec en Outaouais(温带森林科学研究所,魁北克outsouais大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对深度学习发展下森林自动化需求,提出SilvaScenes数据集,用于自然森林冠层下图像的树种实例分割,评估显示树干分割可行,物种分割有挑战,还指出关键问题及图像分辨率的作用。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03553 2026-07-07 cs.CV cs.RO 新提交 66%

iVISION-2DCD: A Long-Term Change Detection Dataset for Large-Scale Outdoor Construction Monitoring

iVISION-2DCD:用于大规模户外建筑监测的长期变化检测数据集

Dayou Mao, Yuchen Lin, Ashkan Ebadi, John Zelek, Alexander Wong, Yuhao Chen

机构 * National Research Council Canada(加拿大国家研究委员会) Vision and Image Processing Research Group, Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系视觉与图像处理研究小组)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO、cs.CV

AI总结 研究从检测建筑工地变化监测施工进度,针对跨视角变化检测算法缺开源基准数据集问题,用LiDAR点云生成iVISION-2DCD数据集,提出合成数据生成等方法,为相关领域带来新挑战。

Comments 11 pages, 7 figures, 1 table. Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026). Project page: https://danielmao2019.github.io/iVISION-2DCD-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 62%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04616 2026-07-07 cs.RO cs.AI 新提交 62%

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing

SILO:用于多阶段电缆布线的回路内仿真的仿真到现实转移

Stone Tao, Jie Xu, Hesam Rabeti, Yashraj Narang, Yijie Guo, Iretiayo Akinola

机构 * NVIDIA Corporation(英伟达公司) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对电缆等物体复杂变形导致的线性可变形操纵难题,提出基于GPU并行仿真的强化学习框架及新部署策略,实现多阶段电缆布线的仿真到现实转移,提升成功率并减少周期时间。

Comments Website: https://silo-cable-routing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02866 2026-07-07 cs.CV cs.RO 新提交 62%

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras

E-TraMamba:一种用于事件相机的高效长期3D特征跟踪的新范式

Juwei Shen, Yujie Wu, Changwen Chen

机构 * Department of Computing, FCMS(计算系(FCMS)) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对现有3D跟踪器在处理稀疏、噪声事件流时的问题,提出E-TraMamba框架,采用线性状态空间模型和多尺度线索融合等方法,构建数据集,实验表明其性能达最优,适用于多种视觉任务。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 62%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02646 2026-07-07 cs.RO cs.CV 新提交 62%

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

EVA-Client:用于真实机器人上具身策略的统一数据收集、推理和部署框架

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

机构 * CoLab, Beihang University(协同实验室,北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 介绍EVA-Client框架,它位于策略服务器和物理硬件之间,统一策略迭代循环的真实机器人阶段。贡献包括组件解耦架构、可检查执行及每次评估兼具数据收集功能,还整合多种实时推理策略。

Comments https://colalab.net/projects/eva-client

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20742 2026-07-07 cs.RO cs.AI 新提交 62%

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring in Open-Traffic Conditions

无需封闭车道的交通感知无人机路面监测数字孪生框架

Yamil Uchani, Grace Luna, Edwin Salcedo, Mauricio Figueroa

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出基于Unity的数字孪生框架,集成YOLOv8n检测与分类器,实现交通感知无人机路面监测,无需封闭车道,实验评估三种遮挡恢复策略,最高覆盖率达97.95%。

Comments Accepted for publication in the proceedings of the 6th Annual IEEE International Conference on Digital Twins and Parallel Intelligence (DTPI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10840 2026-07-07 cs.LG cs.AI q-bio.QM 版本更新 62%

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Ali, Chengkun Yang, Alasdair Edward Gent, Victor Moas, Rishikesan Kamaleswaran

机构 * Duke University(杜克大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。

Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 62%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16923 2026-07-07 cs.CR cs.AI cs.LG 版本更新 62%

UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks

UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距

Mansi Phute, Matthew Hull, Haoran Wang, Alec Helbling, ShengYun Peng, Willian Lunardi, Martin Andreoni, Wenke Lee, Duen Horng Chau

机构 * Georgia Institute of Technology(佐治亚理工学院) Technology Innovation Institute(技术创新研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 62%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08983 2026-07-07 cs.RO cs.AI 版本更新 62%

Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning

理性逆推理:通过规划推断意图进行少样本模仿

Ben Zandonati, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究人类能从少量示范学习新操作任务,而现代机器人模仿学习需大量示范且适应性差的差距。提出理性逆推理,将少样本模仿视为对潜在解释程序的推理,通过视觉语言模型和分层规划器迭代优化候选集,在少样本设置中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03411 2026-07-07 eess.SP cs.AI 新提交 57%

The S-ICDF Dataset: Sionna-Simulated Dynamic Interference Characterization and Direction Finding

S-ICDF数据集:基于Sionna仿真的动态干扰表征与测向数据集

Christian Wielenberg, Lucas Heublein, Jonathan Ott, Alexander Mattick, Nisha L. Raichur, Jonas Pirkl, Lukas Schelenz, Tobias Feigl, George Yammine, Christopher Mutschler, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫整合电路研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 针对干扰监测数据集稀缺问题,基于Sionna生成含102种干扰配置的大规模S-ICDF数据集,用经典测向方法与现代ML方法完成基准测试,支撑无线干扰相关算法研发。

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02537 2026-07-07 eess.SP cs.LG stat.ML 新提交 57%

Physics-Informed Domain-Invariant Feature Learning with Autoencoder-Driven Gaussian Clustering for Robust Non-line-of-Sight Scenarios

面向稳健非视距场景的基于自编码器驱动高斯聚类的物理信息域不变特征学习方法

Nisha L. Raichur, Lucas Heublein, Dominik Seuß, Frank Deinzer, Felix Ott

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所IIS)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对非视距下射频干扰波达角估计性能下降问题,提出融合物理约束的混合学习框架,结合自编码器高斯聚类提取域不变特征,提升低样本下跨场景AoA估计精度。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 57%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05201 2026-07-07 cs.LG 新提交 57%

FlatManifold: Robust Continual Learning under Severe Label Noise and Domain Shifts via Intrinsic Manifold Flattening

FlatManifold:基于内在流形扁平化的强标签噪声与域偏移场景下鲁棒持续学习方法

Rai Hisada, Kanji Tanaka

机构 * Department of Mechanical Engineering, Faculty of Engineering, University of Fukui(日本福井大学工学部机械工学科)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 针对非平稳流环境下强未校准标签噪声与非线性域偏移共存的挑战,提出FlatManifold框架,通过流形扁平化实现鲁棒持续学习,大幅优于基线方法。

Comments 5 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 57%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04330 2026-07-07 cs.CV 新提交 57%

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

道路施工区域检测与地理定位的框架和多模态数据集

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

机构 * Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences(应用科学英戈尔施塔特技术大学创新移动研究所) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(弗劳恩霍夫交通与基础设施系统研究所IVI) Technical University of Munich(慕尼黑工业大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 针对自动驾驶中高清地图缺乏道路施工区域等半静态信息的问题,提出包含模拟和真实数据的多模态数据集及检测与地理定位管道,经实验验证该方法在检测及坐标转换上效果良好。

Comments Accepted to IEEE IV25. The RZDG dataset and code can be found at: https://github.com/chrisyan/RZDG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04310 2026-07-07 cs.RO 新提交 57%

GPU-Accelerated Polygonal Signed Distance Functions for Real-Time Collision Avoidance

用于实时碰撞避免的GPU加速多边形符号距离函数

Taekwon Ga, Jongeun Choi

机构 * School of Mechanical Engineering, Yonsei University(延世大学机械工程学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 研究在密集障碍物环境中实时碰撞避免问题,提出多边形符号距离函数(PSDF),通过张量化几何管道实现GPU加速,嵌入模型预测控制,设计分离CPU/GPU计算,实验证明其有效性。

Comments 13 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交 57%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 57%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏