arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-02 至 2026-03-02 共收录 11 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 11 篇

2602.23953 2026-03-02 cs.CV 79%

GDA-YOLO11: Amodal Instance Segmentation for Occlusion-Robust Robotic Fruit Harvesting

GDA-YOLO11: 一种用于抗遮挡的机器人果实采摘的无遮挡实例分割

Caner Beldek, Emre Sariyildiz, Son Lam Phung, Gursel Alici

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 GDA-YOLO11通过改进的无遮挡分割模型提升机器人果实采摘的遮挡鲁棒性,实现更高的采摘成功率和更准确的分割性能。

Comments 9 pages, journal pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO 70%

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 62%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24143 2026-03-02 cs.RO 57%

Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking

稳健的技能,脆弱的接地:通过多对象拾取诊断视觉语言动作策略中的受限泛化

David Emukpere, Romain Deffayet, Jean-Michel Renders

机构 * Naver Labs Europe(纳维尔实验室欧洲)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 通过多对象拾取实验发现,视觉语言动作策略在复杂环境下执行基本操作比遵循指令更可靠,表明技能获取与指令遵循脱节,需改进基准测试以更准确诊断泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23969 2026-03-02 cs.MM cs.CV 57%

MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation

MSVBench: 向多镜头视频生成的人机水平评估迈进

Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 MSVBench通过引入分层脚本和参考图像,提出混合评估框架,验证了视频生成模型的连贯性和吸引力,并展示了其在多镜头视频生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23677 2026-03-02 cs.CV 57%

Vision-Language Semantic Grounding for Multi-Domain Crop-Weed Segmentation

面向多领域作物杂草分割的视觉-语言语义定位

Nazia Hossain, Xintong Jiang, Yu Tian, Philippe Seguin, O. Grant Clark, Shangpeng Sun

机构 * Department of Bioresource Engineering, McGill University(生物资源工程系,麦吉尔大学) Department of Plant Science, McGill University(植物科学系,麦吉尔大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 VL-WS通过视觉-语言对齐实现多领域作物杂草细粒度分割,提升泛化能力和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23607 2026-03-02 cs.RO cs.SY eess.SY 57%

MicroPush: A Simulator and Benchmark for Contact-Rich Cell Pushing and Assembly with a Magnetic Rolling Microrobot

MicroPush:一种用于接触密集细胞推动和组装的模拟器和基准测试平台,配备磁性滚动微机器人

Yanda Yang, Sambeeta Das

机构 * Department of Mechanical Engineering, University of Delaware(机械工程系,德雷克塞尔大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 MicroPush提供了一个开源的模拟器和基准测试平台,用于评估磁性滚动微机器人在接触密集任务中的自主操作能力,包括细胞推动和多目标组装。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14135 2026-03-02 cs.AI cs.CR cs.CY 57%

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

ForesightSafety Bench: 面向安全人工智能的前沿风险评估与治理框架

Haibo Tong, Feifei Zhao, Linghao Feng, Ruoyu Wu, Ruolin Chen, Lu Jia, Zhou Zhao, Jindong Li, Tenglong Li, Erliang Lin, Shuai Yang, Enmeng Lu, Yinqian Sun, Qian Zhang, Zizhe Ruan, Jinyu Fan, Zeyang Yue, Ping Wu, Huangrui Li, Chengyi Sun, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 本文提出ForesightSafety Bench框架,通过94个细化风险维度系统评估前沿AI安全风险,揭示多领域安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09626 2026-03-02 cs.CV 57%

ECAM: A Contrastive Learning Approach to Avoid Environmental Collision in Trajectory Forecasting

ECAM: 一种用于轨迹预测中避免环境碰撞的对比学习方法

Giacomo Rosin, Muhammad Rameez Ur Rahman, Sebastiano Vascon

机构 * Department of Environmental Sciences, Informatics and Statistics, Ca' Foscari University of Venice, Italy(环境科学、信息学与统计学系,威尼斯卡福斯卡里大学,意大利)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 ECAM通过对比学习方法提升轨迹预测中对环境碰撞的避免能力,有效降低碰撞率。

Comments IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23478 2026-03-02 cs.RO cs.SY eess.SY 57%

Refining Almost-Safe Value Functions on the Fly

实时精调近似安全价值函数

Sander Tonkens, Sosuke Kojima, Chenhao Liu, Judy Masri, Sylvia Herbert

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出refineCBF和HJ-Patch方法,通过实时在线适应提升机器人系统的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23387 2026-03-02 cs.SD cs.AI cs.CL eess.AS 57%

Hello-Chat: Towards Realistic Social Audio Interactions

Hello-Chat: 向真实社交音频交互迈进

Yueran Hou, Peilei Jia, Zihan Sun, Qihang Lu, Wenbing Yang, Yingming Gao, Ya Li, Jun Gao

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏