arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2505.16187 2026-03-10 cs.RO cs.AI 62%

EasyInsert: A Data-Efficient and Generalizable Insertion Policy

EasyInsert: 一种数据高效且具有通用性的插入策略

Guanghe Li, Junming Zhao, Shengjie Wang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 EasyInsert通过delta-pose回归问题实现高效数据收集,提升机器人在杂乱环境中的插入任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16053 2026-03-10 cs.RO cs.AI 62%

Compose by Focus: Scene Graph-based Atomic Skills

通过聚焦:基于场景图的原子技能

Han Qi, Changhe Chen, Heng Yang

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于场景图的原子技能学习框架,结合图神经网络与扩散式模仿学习,并与视觉-语言模型结合,提升机器人在复杂任务中的稳健性和组合泛化能力。

Comments Acceptance to ICRA 2026. Website: https://computationalrobotics.seas.harvard.edu/SkillComposition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06704 2026-03-10 cs.CV cs.LG 62%

On the Generalization Capacities of MLLMs for Spatial Intelligence

关于多模态大语言模型在空间智能中的泛化能力

Gongjie Zhang, Wenhao Li, Quanhao Qian, Jiuniu Wang, Deli Zhao, Shijian Lu, Ran Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) HuPan Lab(虎朋实验室) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Camera-Aware MLLM框架,通过注入相机内参、数据增强和蒸馏几何先验,提升多模态大语言模型在空间任务中的泛化能力与鲁棒性。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02808 2026-03-10 cs.RO cs.AI cs.SY eess.SY 62%

Improving the Resilience of Quadrotors in Underground Environments by Combining Learning-based and Safety Controllers

通过结合学习型控制器和安全控制器提高地下环境中四旋翼的鲁棒性

Isaac Ronald Ward, Mark Paral, Kristopher Riordan, Mykel J. Kochenderfer

机构 * Stanford Intelligent Systems Laboratory, Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本研究通过结合学习型和安全控制器,提高四旋翼在地下环境中的鲁棒性,实现任务完成与碰撞避免的平衡。

Comments Accepted and awarded best paper at the 11th International Conference on Control, Decision and Information Technologies (CoDIT 2025 - https://codit2025.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06512 2026-03-09 cs.RO cs.CV 62%

SG-DOR: Learning Scene Graphs with Direction-Conditioned Occlusion Reasoning for Pepper Plants

SG-DOR:基于方向条件遮挡推理的学习场景图用于Pepper植物

Rohit Menon, Niklas Mueller-Goldingen, Sicong Pan, Gokul Krishna Chenchani, Maren Bennewitz

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 SG-DOR通过方向条件遮挡推理,提升密集作物中果实遮挡预测与连接推断的准确性,为机器人采摘提供结构化关系信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06061 2026-03-09 cs.CV cs.RO 62%

Transforming Omnidirectional RGB-LiDAR data into 3D Gaussian Splatting

将全方位RGB-LiDAR数据转换为3D高斯散点

Semin Bae, Hansol Lim, Jongseong Brad Choi

机构 * Department of Computer Science, State University of New York(计算机科学系,纽约州立大学) Department of Mechanical Engineering, State University of New York(机械工程系,纽约州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种将全方位RGB-LiDAR数据转换为3D高斯散点的重用管道,解决数据处理中的非线性失真和计算开销问题,提升复杂场景的渲染保真度。

Comments This work has been submitted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10704 2026-03-09 cs.CV cs.RO 62%

(MGS)$^2$-Net: Unifying Micro-Geometric Scale and Macro-Geometric Structure for Cross-View Geo-Localization

(MGS)$^2$-Net:融合微几何尺度与宏几何结构的跨视角地理定位

Minglei Li, Mengfan He, Chunyu Li, Chao Chen, Xingyu Shao, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University, Beijing 100084, China(精密仪器系,清华大学,北京100084,中国)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 (MGS)$^2$-Net通过融合微几何尺度与宏几何结构,解决跨视角地理定位中的几何错位问题,实现高精度和鲁棒性的定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03657 2026-03-05 cs.CV cs.AI 62%

InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

InEdit-Bench:智能图像编辑模型中间逻辑路径的基准测试

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao

机构 * State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, Chinese Academy of Sciences(光学场操控科学与技术国家重点实验室,光学电子研究所,中国科学院) National Laboratory on Adaptive Optics(自适应光学国家实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 InEdit-Bench通过评估图像编辑模型在中间逻辑路径推理中的表现,揭示了现有模型在动态推理和多步骤演变建模方面的不足,推动更智能的多模态生成模型发展。

Comments CVPR findings. Project page: https://github.com/SZStrong1/InEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03390 2026-03-05 cs.RO cs.AI 62%

Multi-Agent-Based Simulation of Archaeological Mobility in Uneven Landscapes

基于多智能体的考古移动性在不规则地形中的模拟

Chairi Kiourt, Vassilis Evangelidis, Dimitris Grigoropoulos

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种多智能体建模框架,用于模拟不规则地形中的考古移动性,通过强化学习实现高效动态适应,展示了地形感知追捕和运输分析的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 62%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00206 2026-03-03 cs.CV cs.AI 62%

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT基准:一个生成和判别模型的程序化视觉推理基准

Daniel Nobrega Medeiros

机构 * Independent Researcher(独立研究者)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00108 2026-03-03 cs.RO cs.AI 62%

SurgFusion-Net: Diversified Adaptive Multimodal Fusion Network for Surgical Skill Assessment

SurgFusion-Net:用于外科技能评估的多样化自适应多模态融合网络

Runlong He, Freweini M. Tesfai, Matthew W. E. Boal, Nazir Sirajudeen, Dimitrios Anastasiou, Jialang Xu, Mobarak I. Hoque, Philip J. Edwards, John D. Kelly, Ashwin Sridhar, Abdolrahim Kadkhodamohammadi, Dhivya Chandrasekaran, Matthew J. Clarkson, Danail Stoyanov, Nader Francis, Evangelos B. Mazomenos

机构 * UCL Hawkes Institute and the Department of Medical Physics & Biomedical Engineering, UCL(UCL哈维斯研究所及UCL医学物理与生物医学工程系) UCL Hawkes Institute and the Department of Computer Science, UCL(UCL哈维斯研究所及UCL计算机科学系) UCL Hawkes Institute and the Division of Informatics, Imaging & Data Sciences, The University of Manchester(UCL哈维斯研究所及信息学、成像与数据科学系,曼彻斯特大学) UCL Hospitals NHS Foundation Trust(UCL医院 NHS基金会信托) Griffin Institute, Northwick Park and St Mark’s Hospital(格里芬研究所,北wick公园及圣马可医院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 SurgFusion-Net通过引入DRA策略和两个新的临床数据集,提升了多模态外科技能评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 62%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI 62%

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00288 2026-02-26 cs.CV cs.AI 62%

TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs

TimeBlind: 一种用于视频大语言模型的时空组合性基准

Baiqi Li, Kangyi Zhao, Ce Zhang, Chancharik Mitra, Jean de Dieu Nyandwi, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 TimeBlind通过细粒度时空理解基准揭示视频大语言模型对时间动态理解的不足,展示其在实例准确率上的显著劣势,强调对静态视觉捷径的依赖。

Comments For code and data, see https://baiqi-li.github.io/timeblind_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15427 2026-02-26 cs.RO cs.CV 62%

Lang2Lift: A Language-Guided Autonomous Forklift System for Outdoor Industrial Pallet Handling

Lang2Lift: 一种基于语言引导的户外工业叉车自主系统

Huy Hoang Nguyen, Johannes Huemer, Markus Murschitz, Tobias Glueck, Minh Nhat Vu, Andreas Kugi

机构 * AIT Austrian Institute of Technology GmbH(奥地利技术研究所) Automation & Control Institute(自动化与控制研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 Lang2Lift通过语言引导的视觉感知和闭环控制,实现户外环境下的自主叉车托盘拾取,提升工业自动化效率。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 62%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20709 2026-02-25 cs.CV cs.AI 62%

Onboard-Targeted Segmentation of Straylight in Space Camera Sensors

空间相机传感器中 straylight 的 onboard 目标分割

Riccardo Gallon, Fabian Schiemenz, Alessandra Menicucci, Eberhard Gill

机构 * Department of Space Systems Engineering, Faculty of Aerospace Engineering(航天系统工程系,航空航天工程学院) Airbus Defence and Space GmbH(Airbus防务与空间有限公司)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出了一种基于 AI 的方法,用于在航天器资源受限硬件上实现空间相机中 straylight 的语义分割,并通过自定义指标评估其系统性能。

Comments Submitted to Aerospace Science and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20636 2026-02-25 cs.CV cs.AI 62%

SurgAtt-Tracker: Online Surgical Attention Tracking via Temporal Proposal Reranking and Motion-Aware Refinement

SurgAtt-Tracker: 通过时间提案重排和运动感知细化实现在线手术注意力跟踪

Rulin Zhou, Guankun Wang, An Wang, Yujie Ma, Lixin Ouyang, Bolin Cui, Junyan Li, Chaowei Zhu, Mingyang Li, Ming Chen, Xiaopin Zhong, Peng Lu, Jiankun Wang, Xianming Liu, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学电子工程系) Division of Gastrointestinal Surgery, Shenzhen People's Hospital, China(深圳人民医院胃肠外科) College of Mechatronics and Control Engineering, Shenzhen University, China(深圳大学机电与控制工程学院) Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, China(香港大学机械工程系) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 SurgAtt-Tracker通过时间提案重排和运动感知细化实现手术注意力跟踪,提供帧级视野指导以支持机器人规划和自动摄像头控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19348 2026-02-24 cs.CV cs.AI 62%

MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose

MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态

Sirine Bhouri, Lan Wei, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 62%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04891 2026-02-24 cs.CL cs.AI cs.LG 62%

SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests

SocialHarmBench: 揭示 LLM 对有害社会请求的脆弱性

Punya Syon Pandey, Hai Son Le, Devansh Bhardwaj, Rada Mihalcea, Zhijing Jin

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 SocialHarmBench 通过 585 个提示揭示 LLM 在政治敏感场景中的脆弱性,揭示了模型在有害请求中的高风险表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18813 2026-02-24 cs.RO cs.LG 62%

Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model

Habilis-β:一种快速运动且持续运行的设备端视觉-语言-动作模型

Tommoro Robotics, :, Jesoon Kang, Taegeon Park, Jisu An, Soo Min Kimm, Jaejoon Kim, Jinu Pahk, Byungju Kim, Junseok Lee, Namheon Baek, Sungwan Ha, Hojun Baek, Eduardo Ayerve Cruz, Wontae Kim, Junghyeon Choi, Yousuk Lee, Joonmo Han, Sunghyun Cho, Sunghyun Kwon, Soyoung Lee, Jun Ki Lee, Seung-Joon Yi, Byoung-Tak Zhang, Theo Taeyeong Kim

机构 * Tommoro Robotics(Tommoro机器人公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 Habilis-β是一种快速运动且持续运行的设备端视觉-语言-动作模型,通过整合预训练和后训练方法,实现了在连续运行协议下的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18585 2026-02-24 cs.CV cs.AI 62%

BloomNet: Exploring Single vs. Multiple Object Annotation for Flower Recognition Using YOLO Variants

BloomNet:探索单 vs 多对象标注用于花卉识别的YOLO变体

Safwat Nusrat, Prithwiraj Bhattacharjee

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Leading University(领先大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 BloomNet研究通过比较单 vs 多对象标注策略,利用YOLO变体提升花卉识别精度,验证了SGD优化器在不同场景下的有效性。

Comments Accepted for publication in 7th International Conference on Trends in Computational and Cognitive Engineering (TCCE-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20174 2026-02-24 cs.CV cs.AI 62%

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi

机构 * University of Electronic Science and Technology of China(电子科技大学) Drexel University(德雷塞尔大学) Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17573 2026-02-20 cs.RO cs.CV 62%

FR-GESTURE: An RGBD Dataset For Gesture-based Human-Robot Interaction In First Responder Operations

FR-GESTURE: 一种用于第一响应者操作中基于手势的人机交互的RGBD数据集

Konstantinos Foteinos, Georgios Angelidis, Aggelos Psiris, Vasileios Argyriou, Panagiotis Sarigiannidis, Georgios Th. Papadopoulos

机构 * Harokopio University of Athens(雅典哈罗基波大学) Kingston University(金史密斯大学) University of Western Macedonia(西马其顿大学) Athena Research Center(雅典研究中心)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 FR-GESTURE数据集通过12个优化手势命令,为第一响应者操作中的无人地面车辆控制提供首个专门训练的RGBD数据集,并公开用于促进相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15873 2026-02-19 cs.RO cs.AI 62%

Test-Time Adaptation for Tactile-Vision-Language Models

测试时适应用于触觉-视觉-语言模型

Chuyang Ye, Haoxian Jing, Qinting Jiang, Yixi Lin, Qiang Li, Xing Tang, Jingyan Jiang

机构 * Shenzhen Technology University(深圳技术大学) New York University(纽约大学) Shenzhen University(深圳大学) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15397 2026-02-18 cs.RO cs.AI 62%

ActionCodec: What Makes for Good Action Tokenizers

ActionCodec:什么使好的动作分词器成为可能

Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出ActionCodec,通过信息论原则提升动作分词性能,实现无需机器人预训练的VLA模型新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15061 2026-02-18 cs.RO cs.AI 62%

Safe-SDL:Establishing Safety Boundaries and Control Mechanisms for AI-Driven Self-Driving Laboratories

Safe-SDL:建立AI驱动自主实验室的安全边界与控制机制

Zihan Zhang, Haohui Que, Junhan Chang, Xin Zhang, Hao Wei, Tong Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) AI for Science Institute, Beijing(北京人工智能科学研究院) Peking University(北京大学) DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) National Key Laboratory of Advanced Micro and Nano Manufacture Technology, School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学国家先进微纳米制造技术重点实验室,集成电路学院,上海200240,中国)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 Safe-SDL通过建立安全边界和控制机制,解决AI驱动自主实验室中的语法到安全间隙问题,确保实验系统的安全性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12763 2026-02-17 cs.CV cs.LG 62%

A Survey on Human Interaction Motion Generation

人类交互运动生成的综述

Kewei Sui, Anindita Ghosh, Inwoo Hwang, Bing Zhou, Jian Wang, Chuan Guo

机构 * Snap Inc. Saarland Informatics Campus, DFKI, MPI Informatics(萨尔兰州信息学校区、DFKI、MPI信息学) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文综述了人类交互运动生成领域的研究,系统回顾了现有方法、数据集及评估指标,并探讨了未来研究方向。

Comments The repository listing relevant papers is accessible at: https://github.com/soraproducer/Awesome-Human-Interaction-Motion-Generation

Journal ref International Journal of Computer Vision, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏