arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2605.06815 2026-05-11 cs.AI cs.CV 62%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07322 2026-05-08 cs.RO cs.AI 62%

Action-to-Action Flow Matching

动作到动作流匹配

Jindou Jia, Gen Li, Xiangyu Chen, Tuo An, Yuxuan Hu, Jingliang Li, Xinying Guo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出A2A方法,通过利用前一动作的本体感知信息进行初始化,避免了随机噪声采样带来的高延迟问题,提升了动作生成的效率和鲁棒性。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10248 2026-05-08 cs.CV cs.AI 62%

RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection

RobustSora:用于鲁棒AI生成视频检测的去水印基准

Zhuo Wang, Xiliang Liu, Ligang Sun

机构 * College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出RobustSora基准,通过6500个手动验证的视频评估AI生成视频检测的鲁棒性,发现水印操控影响检测准确率,强调水印意识在训练中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07264 2026-05-05 cs.RO cs.AI cs.SE 62%

aerial-autonomy-stack -- a Faster-than-real-time, Autopilot-agnostic, ROS2 Framework to Simulate and Deploy Perception-based Drones

空域自主栈 -- 一个优于实时的、与自动驾驶无关的ROS2框架,用于模拟和部署基于感知的无人机

Jacopo Panerati, Sina Sajjadi, Sina Soleymanpour, Varunkumar Mehta, Iraj Mantegh

机构 * National Research Council Canada(加拿大国家研究理事会)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出空域自主栈,一个基于ROS2的开源框架,支持快速模拟和部署基于感知的无人机系统,通过统一接口支持PX4和ArduPilot,实现20倍于实时的仿真速度,缩短开发测试周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 62%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24906 2026-04-29 cs.RO cs.LG cs.SY eess.SY 62%

An analysis of sensor selection for fruit picking with suction-based grippers

基于吸盘夹具的水果采摘传感器选择分析

Eva Krueger, Marcus Rosette, Joseph R. Davidson

机构 * Collaborative Robotics and Intelligent Systems (CoRIS) Institute(协作机器人与智能系统研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种多模态传感系统,用于评估不同采摘阶段传感器的效用,通过实验证明随机森林和多层感知器在检测成功采摘和即将失败事件中的高准确率。

Comments IROS Conference Format, 6 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22117 2026-04-29 cs.LG cs.AI cs.CL 62%

PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

PermaFrost-Attack: stealth pretraining seeding (spS) 用于在LLM训练期间种植逻辑地雷

Harsh Kumar, Rahul Maity, Tanmay Joshi, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Manipal University Jaipur(Manipal大学斋普尔) NIT, Karnataka(Karnataka理工学院) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa印度普拉吉亚实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM训练中通过隐蔽预训练播种(SPS)植入逻辑地雷的威胁模型,通过几何诊断方法揭示了潜藏的中毒行为,展示了SPS对基础模型的安全性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09981 2026-04-29 cs.CV cs.RO 62%

ReSim: Reliable World Simulation for Autonomous Driving

ReSim:面向自动驾驶的可靠世界模拟

Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, Li Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) OpenDriveLab at Shanghai AI Lab(上海人工智能实验室OpenDrive实验室) NVIDIA Research(NVIDIA研究) Xiaomi EV(小米电动车) Shanghai Jiao Tong University(上海交通大学) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) HKUST(香港科技大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ReSim模型,通过整合真实数据与模拟数据提升自动驾驶场景模拟的可靠性与可控性,提升规划和策略选择性能。

Comments NeurIPS 2025 Spotlight. Project page: https://opendrivelab.com/ReSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24706 2026-04-28 eess.SY cs.LG cs.RO cs.SY 62%

Exploiting Differential Flatness for Efficient Learning-based Model Predictive Control of Constrained Multi-Input Control Affine Systems

利用微分平坦性实现受限多输入控制仿射系统的高效基于学习的模型预测控制

Tobias A. Farger, Adam W. Hall, Angela P. Schoellig

机构 * Learning Systems and Robotics Lab at the Technical University of Munich(慕尼黑技术大学学习系统与机器人实验室) Learning Systems and Robotics Lab at the University of Toronto Institute for Aerospace Studies (UTIAS) and the Vector Institute for Artificial Intelligence(多伦多航空航天研究所(UTIAS)和向量人工智能研究所的学习系统与机器人实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出利用微分平坦性改进基于学习的模型预测控制,通过系统扩展和块对角成本公式,有效控制多输入非线性仿射系统,并保证概率Lyapunov减小。

Comments Accepted for publication in 2026 European Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21421 2026-04-28 cs.RO cs.AI 62%

HyReach: Vision-Guided Hybrid Manipulator Reaching in Unseen Cluttered Environments

HyReach:基于视觉的混合机械臂在未见的杂乱环境中实现稳健的开放世界物体抓取

Shivani Kamtikar, Kendall Koe, Justin Wasserman, Samhita Marri, Benjamin Walt, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Skild AI

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种实时混合刚柔连续机械臂系统,通过视觉感知与3D场景重建结合形状感知运动规划,实现鲁棒的开放世界物体抓取,实验表明在杂乱环境中误差低于2厘米。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23604 2026-04-28 cs.CV cs.RO 62%

Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation

学习识别分布外对象以进行3D激光雷达异常分割

Simone Mosco, Daniel Fusaro, Alberto Pretto

机构 * University of Padova(帕多瓦大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种高效方法,直接在特征空间中操作,通过建模内类特征分布来约束异常样本,同时引入混合真实-合成数据集以解决3D激光雷达异常分割中的领域差距问题。

Comments This paper has been accepted at the 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07371 2026-04-28 cs.RO cs.AI 62%

ESPADA: Execution Speedup via Semantics Aware Demonstration Data Downsampling for Imitation Learning

ESPADA:通过语义感知演示数据下采样提升执行速度的模仿学习

Byung-ju Kim, Jinu Pahk, Chungwoo Lee, Jaejoon Kim, Jangha Lee, Theo Taeyeong Kim, Kyuhwan Shim, Jun Ki Lee, Byoung-Tak Zhang

机构 * Tommoro Robotics(Tommoro机器人公司) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 ESPADA通过语义和空间感知框架,利用VLM-LLM管道对演示进行分段,仅在非关键部分进行激进下采样,保持关键阶段的精度,无需额外数据或架构修改,实现约2倍的执行速度提升。

Comments project page: https://project-espada.github.io/espada/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13713 2026-04-28 cs.RO cs.CV 62%

SLAM&Render: A Benchmark for the Intersection Between Neural Rendering, Gaussian Splatting and SLAM

SLAM&Render: 一个用于神经渲染、高斯点绘和SLAM交叉领域的基准数据集

Samuel Cerezo, Gaetano Meli, Tomás Berriel Martins, Kirill Safronov, Javier Civera

机构 * Technology \& Innovation Center KUKA Deutschland GmbH Augsburg, Germany

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SLAM&Render数据集,用于评估神经渲染和SLAM在多模态、多视角和光照条件下的交叉方法,包含40个序列的RGB-D图像、IMU数据和机器人运动数据,验证了该数据集在新兴研究领域的相关性。

Comments 9 pages, 8 figures, 7 tables. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22879 2026-04-28 cs.MA cs.AI cs.CR cs.LG 62%

Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems

超越单体对齐:防止多智能体系统中的上下文碎片化违规

Jie Wu, Ming Gong

机构 * Atlassian(Atlassian公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Distributed Sentinel架构,通过Semantic Taint Token协议解决多智能体系统中因上下文碎片化导致的政策违规问题,实验证明其在跨域政策验证中的高效性与可靠性。

Comments 34 pages, 3 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22868 2026-04-28 cs.CV cs.AI 62%

Probing Visual Planning in Image Editing Models

探测图像编辑模型中的视觉规划

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出EAR框架,通过抽象谜题和生成数据集AMAZE,评估图像编辑模型的视觉规划能力,发现模型在零样本设置下表现不佳,但微调后能有效泛化。

Comments Accepted to ES-Reasoning Workshop @ ICLR 2026. Our code is available at https://github.com/spatigen/amaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22499 2026-04-27 cs.LG cs.RO 62%

Decoding High-Dimensional Finger Motion from EMG Using Riemannian Features and RNNs

通过Riemannian特征和RNNs解码高维手指运动

Martin Colot, Cédric Simar, Guy Cheron, Ana Maria Cebolla Alvarez, Gianluca Bontempi

机构 * Neuromove, ULB Neuroscience Institute, ULB, Brussels, Belgium(Neuromove,ULB神经科学研究所,ULB,布鲁塞尔,比利时) WEL Research Institute, Wavre, Belgium(WEL研究机构,瓦尔特,比利时)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出TRR模型,利用多带Riemannian协方差特征序列解码手指运动,实现高维手指运动的连续EMG到运动学回归,提升了跨受试者和内受试者评估的精度。

Comments 13 pages, 10 figures, 3 tables, links to a GitHub, a dataset on Zenodo, and two videos on YouTube

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08016 2026-04-24 cs.RO cs.AI cs.MA 62%

AVOID-JACK: Avoidance of Jackknifing for Swarms of Long Heavy Articulated Vehicles

AVOID-JACK: 避免长重型关节车辆群的翻车

Adrian Schönnagel, Michael Dubé, Christoph Steup, Felix Keppler, Sanaz Mostaghim

机构 * Chair for Computational Intelligence, Otto-von-Guericke-University(计算智能系,奥托·冯·格里克大学) Fraunhofer Institute for Transportation and Infrastructure Systems IVI(交通与基础设施系统研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于反应的分布式 swarm 智能策略,用于避免长重型关节车辆的翻车和相互碰撞,通过模拟实验验证了其有效性。

Comments 6+1 pages, 9 figures, accepted for publication in IEEE MRS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 62%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23786 2026-04-21 cs.CV cs.RO 62%

Bridging the Ex-Vivo to In-Vivo Gap: Synthetic Priors for Monocular Depth Estimation in Specular Surgical Environments

弥合体外到体内差距:用于镜面外科环境单目深度估计的合成先验

Ankan Aich, Emma D. Ryan, Kris Moe, Isaac Schmale, Li-Xing Man, Yangming Lee

机构 * RoCAL, Rochester Institute of Technology(罗切斯特理工学院RoCAL实验室) Department of Otolaryngology Head and Neck Surgery, University of Rochester Medical Center(罗切斯特大学医学中心耳鼻喉科与头颈外科部门) University of Washington, Department of Otolaryngology–Head and Neck Surgery(华盛顿大学耳鼻喉科与头颈外科部门)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出合成先验用于改善外科环境中单目深度估计,通过DV-LORA适应深度anything v2架构,在SCARED数据集上达到新状态,同时引入ROCAL-T 90数据集验证模型在真实临床场景中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19685 2026-04-21 cs.CV cs.AI 62%

Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline

生成篡改面部图像的归因报告:一个数据集和基线

Jingchun Lian, Lingyu Liu, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * Xi’an Jiaotong University(西安交通大学) Hefei University of Technology(合肥工业大学) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出多模态篡改追踪数据集和 ForgeryTalker 框架,通过联合定位篡改区域和生成自然语言解释,提升面部伪造检测的语义理解能力。

Comments Accepted to ACL 2026 (Main Conference). This version includes camera-ready revisions and updated experimental results

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08336 2026-04-21 cs.LG cs.RO 62%

RAYEN: Imposition of Hard Convex Constraints on Neural Networks

RAYEN:在神经网络中施加硬凸约束

Jesus Tordesillas, Victor Klemm, Jonathan P. How, Marco Hutter

机构 * Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究 institute,ICAI 工程学院,Comillas 大学) Aerospace Controls Laboratory, Massachusetts Institute of Technology(航空航天控制实验室,麻省理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 RAYEN通过高效方法在神经网络输出或潜在变量中施加硬凸约束,保证训练和测试时的约束满足,支持多种约束类型,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17231 2026-04-21 cs.CV cs.RO 62%

Fringe Projection Based Vision Pipeline for Autonomous Hard Drive Disassembly

基于条纹投影的自主硬盘拆解视觉流水线

Badrinath Balasubramaniam, Vignesh Suresh, Benjamin Metcalf, Beiwen Li

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Alcon Research Laboratories(阿康研究实验室) School of Environmental, Civil, Agricultural and Mechanical Engineering, University of Georgia(佐治亚大学环境、土木、农业和机械工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于条纹投影的视觉流水线,通过3D传感和实例分割网络实现硬盘拆解的精准定位与识别,提升拆解效率与鲁棒性。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16582 2026-04-21 cs.CV cs.AI 62%

Camo-M3FD: A New Benchmark Dataset for Cross-Spectral Camouflaged Pedestrian Detection

Camo-M3FD:一种新的跨光谱伪装行人检测基准数据集

Henry O. Velesaca, Andrea Mero, Guillermo A. Castillo, Angel D. Sappa

机构 * ESPOL Polytechnic University(ESPOL理工大学) Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Software Engineering Department, Research Center for Information and Communication Technologies (CITIC-UGR), University of Granada(格拉纳达大学软件工程系,信息与通信技术研究中心(CITIC-UGR)) Università della Svizzera Italiana(瑞士意大利大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Camo-M3FD数据集,用于跨光谱伪装行人检测,通过高精度图像对和标准化评估框架提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16486 2026-04-21 cs.CV cs.LG 62%

Aletheia: Physics-Conditioned Localized Artifact Attention (PhyLAA-X) for End-to-End Generalizable and Robust Deepfake Video Detection

Aletheia: 基于物理条件的局部化瑕疵注意力(PhyLAA-X)用于端到端通用且鲁棒的深度伪造视频检测

Devendra Ghori

机构 * Aletheia Project(Aletheia项目)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PhyLAA-X,通过引入物理衍生特征体积提升深度伪造检测的鲁棒性,在多个数据集上均取得显著性能提升。

Comments Code: https://github.com/devghori1264/Aletheia (MIT license). Dataset notes: see Data and Code Availability section

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 62%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16022 2026-04-20 cs.AI cs.LG cs.MA 62%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24058 2026-04-20 eess.SP cs.AI cs.LG 62%

PULSE: Privileged Knowledge Transfer from Rich to Deployable Sensors for Embodied Multi-Sensory Learning

PULSE:从丰富到可部署传感器的特权知识转移以实现具身多感官学习

Zihan Zhao, Kaushik Pendiyala, Masood Mortazavi, Ning Yan

机构 * University of California San Diego(加州大学圣迭戈分校) University of California Davis(加州大学戴维斯分校) IC Lab, Futurewei Technologies Inc.(未来科技公司IC实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 PULSE框架通过从信息丰富的教师传感器向更廉价的部署传感器转移知识,解决具身智能系统中传感器不对称问题,实现多感官学习。

Comments v2: Accepted at the CVPR 2026 Workshop on Sense of Space. 8 pages main content + references + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 62%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07717 2026-04-16 cs.RO cs.CV 62%

RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph

RoboTAG: 通过拓扑对齐图实现端到端的机器人配置估计

Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RoboTAG,通过结合3D和2D分支,利用拓扑对齐图缓解对标签的依赖,提升机器人姿态估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12905 2026-04-15 cs.RO cs.LG 62%

Frequency-aware Decomposition Learning for Sensorless Wrench Forecasting on a Vibration-rich Hydraulic Manipulator

面向频率的分解学习用于振动丰富的液压机械臂无传感器力预测

Hyeonbeen Lee, Min-Jae Jung, Tae-Kyeong Yeu, Jong-Boo Han, Daegil Park, Jin-Gyun Kim

机构 * Department of Mechanical Engineering, Kyung Hee University(Kyung Hee 大学机械工程系) Korea Research Institute of Ships and Ocean Engineering(韩国船舶海洋研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出频率感知分解网络(FDN)用于预测振动丰富的力,通过自适应增强输入频谱和频率带先验,提升高频力预测性能,实验表明FDN在高频段优于基线方法,在低频段表现稳健,且迁移学习进一步提升性能。

Comments 11 pages, 6 figures, submitted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏