arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8666 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8666 篇

2604.12803 2026-04-15 cs.CV cs.LG 62%

Generative Anonymization in Event Streams

事件流中的生成匿名化

Adam T. Müller, Mihai Kocsis, Nicolaj C. Stache

机构 * Heilbronn University of Applied Sciences(海德堡应用科学大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文提出首个事件流生成匿名化框架,通过桥接异步事件与标准空间生成模型,实现隐私保护与数据效用的平衡。

Comments Accepted to the 1st Workshop on Low-Level Vision Frontiers (LoViF) at IEEE/CVF CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 62%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 62%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05342 2026-04-14 cs.CV cs.LG 62%

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17925 2026-04-14 cs.RO cs.CV 62%

Switch-JustDance: Benchmarking Whole Body Motion Tracking Controllers Using a Commercial Console Game

Switch-JustDance: 使用商业游戏机评估完整身体运动跟踪控制器的基准测试

Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Sehoon Ha, Tianyu Li

机构 * Georgia Tech(佐治亚理工学院) HKU(香港大学) ETH Zurich(苏黎世联邦理工学院) SCUT(华南理工大学) THU(清华大学) MIT(麻省理工学院) PNDbotics

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Switch-JustDance基准测试平台,利用Nintendo Switch上的Just Dance游戏评估机器人完整身体控制能力,验证其可靠性并对比三种先进控制器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08509 2026-04-10 cs.CV cs.RO 62%

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07728 2026-04-10 cs.CV cs.GR cs.RO 62%

GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting

GEAR: 基于高斯点划法的几何-运动交替优化用于关节物体建模

Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室,中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 GEAR通过交替优化几何与运动,提升关节物体重建的精度和泛化能力,尤其在复杂多关节物体上表现优异。

Comments Accepted to CVPRF2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 62%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07799 2026-04-10 cs.CV cs.RO 62%

Horticultural Temporal Fruit Monitoring via 3D Instance Segmentation and Re-Identification using Colored Point Clouds

通过彩色点云进行3D实例分割与重识别的园艺时间水果监测

Daniel Fusaro, Federico Magistri, Jens Behley, Alberto Pretto, Cyrill Stachniss

机构 * University of Padua(帕多瓦大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用彩色点云进行3D水果实例分割与重识别的方法,通过学习模型和注意力匹配网络实现动态果园中水果的准确监测。

Journal ref Computers and Electronics in Agriculture, Volume 247, Pages 111723, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05681 2026-04-08 cs.AI cs.CL cs.GT cs.LG cs.MA 62%

LUDOBENCH: Evaluating LLM Behavioural Decision-Making Through Spot-Based Board Game Scenarios in Ludo

LUDOBENCH:通过基于点的棋盘游戏场景评估LLM的行为决策

Ojas Jain, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比拉理工学院皮拉尼校区计算机科学与信息系统系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 LudoBench通过12种不同决策类别中的480个手工设计点场景,评估LLM在Ludo棋盘游戏中的战略推理能力,发现模型在行为上呈现不同特征,揭示了提示敏感性作为关键漏洞。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA 62%

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04843 2026-04-07 cs.CV cs.AI 62%

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成

Yude Zou, Junji Gong, Xing Gao, Zixuan Li, Tianxing Chen, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03328 2026-04-07 cs.CV cs.RO 62%

Review and Evaluation of Point-Cloud based Leaf Surface Reconstruction Methods for Agricultural Applications

点云基叶面重建方法在农业应用中的综述与评估

Arif Ahmed, Parikshit Maini

机构 * University of Nevada, Reno(内华达大学里诺分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文综述并评估了九种叶面重建方法,通过三个公开数据集分析不同方法在精度、平滑度、噪声鲁棒性和计算成本方面的权衡,为农业机器人提供选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12510 2026-04-07 cs.RO cs.AI cs.CL 62%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03666 2026-04-07 cs.CV cs.AI 62%

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

ToG-Bench:面向任务的时空接地在第一人称视频中

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ToG-Bench,首个面向任务的时空视频接地基准,通过任务导向的接地、显式-隐式双接地和一对一多接地特性,评估多对象和显式-隐式对象接地性能,揭示任务导向时空视频接地的挑战与性能差距。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02639 2026-04-06 cs.CV cs.AI 62%

Cross-Vehicle 3D Geometric Consistency for Self-Supervised Surround Depth Estimation on Articulated Vehicles

跨车辆3D几何一致性用于机械臂车辆上的自监督周围深度估计

Weimin Liu, Jiyuan Qiu, Wenjun Wang, Joshua H. Meng

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Remote Sensing and Earth Observation Laboratory, University of Copenhagen(哥本哈根大学遥感与地球观测实验室) California PATH, University of California, Berkeley(加州大学伯克利分校加州PATH)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出ArticuSurDepth框架,通过跨视图和跨车辆几何一致性提升机械臂车辆周围深度估计的结构一致性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00842 2026-04-02 cs.AI cs.LG cs.MA 62%

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

主动代理研究环境:模拟活跃用户以评估主动助手

Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Apple, USA(苹果公司(美国)) University of Washington(华盛顿大学) Independent Researcher, USA(独立研究员(美国))

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Pare框架,通过状态机模拟用户交互,构建并评估主动代理,同时引入Pare-Bench基准测试143种不同任务,测试上下文感知、目标推理和多应用协调能力。

Comments 34 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00804 2026-04-02 cs.RO cs.CV 62%

Compact Keyframe-Optimized Multi-Agent Gaussian Splatting SLAM

紧凑化关键帧优化多智能体高斯点云SLAM

Monica M. Q. Li, Pierre-Yves Lajoie, Jialiang Liu, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院) University of Wisconsin(威斯康星大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种改进的多智能体RGB-D高斯点云SLAM框架,通过压缩步骤和中央闭环计算减少通信负载,提升地图保真度,实验证明数据传输量减少85-95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00350 2026-04-02 cs.RO cs.AI 62%

Go Big or Go Home: Simulating Mobbing Behavior with Braitenbergian Robots

要么大举进攻,要么全盘退出:基于布拉提恩格机器人模拟群体排斥行为

Elaheh Sanoubari

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文通过Webots平台模拟布拉提恩格机器人在面对光源时的群体排斥行为,探讨了叫声范围和机器人数量对群体攻击成功率的影响。

Comments This work was completed in 2019 as a final project for a graduate course at the University of Waterloo, titled: ECE 750 - Artificial Life: Embodied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00766 2026-04-02 cs.CV cs.AI 62%

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17760 2026-04-02 cs.LG cs.AI 62%

But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors

但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案

Leon Eshuijs, Archie Chaudhury, Alan McBeth, Ethan Nguyen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent(独立)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00168 2026-04-02 cs.RO cs.AI 62%

Neural-Assisted in-Motion Self-Heading Alignment

神经辅助动态自航向对齐

Zeev Yampolsky, Felipe O. Silva, Adriano Frutuoso, Itzik Klein

机构 * The Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa(海法大学查尼海洋科学学院哈特海洋技术系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出神经辅助框架提升海洋自主平台初始航向估计精度与速度,实验显示精度提升53%并缩短对齐时间67%。

Comments 12 Pages, 10 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG 62%

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 62%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27533 2026-03-31 cs.CV cs.AI 62%

Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation

Demo-Pose: 深度-单目模态融合用于物体姿态估计

Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim

机构 * Samsung Electronics Suwon, Republic of Korea(三星电子水原,韩国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Demo-Pose,通过新颖的多模态融合策略融合单目语义特征与基于深度的图卷积表示,提升物体姿态估计的几何推理能力,在REAL275数据集上优于现有方法。

Comments Accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27441 2026-03-31 cs.CV cs.AI 62%

Evaluating Large and Lightweight Vision Models for Irregular Component Segmentation in E-Waste Disassembly

评估大型和轻量级视觉模型在电子废弃物拆解中不规则组件分割的应用

Xinyao Zhang, Chang Liu, Xiao Liang, Minghui Zheng, Sara Behdad

机构 * Florida State University(佛罗里达州立大学) Texas A&M University(德克萨斯农工大学) University of Florida(佛罗里达大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文通过比较SAM2和YOLOv8模型,评估了模型架构和规模对分割性能的影响,发现YOLOv8在精度和边界精度上优于SAM2,但SAM2在表示多样物体结构上更灵活。

Comments Accepted at ASME MSEC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 62%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17817 2026-03-31 cs.CV cs.RO 62%

Learning Underwater Active Perception in Simulation

在模拟中学习水下主动感知

Alexandre Cardaillac, Donald G. Dansereau

机构 * Australian Centre For Robotics(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering(航空航天、机械与机电工程学院) University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种高效方法,通过多层感知机预测图像质量,以在不同水况下获取高质量资产图像,提升了视觉覆盖和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14375 2026-03-30 cs.CV cs.AI 62%

The Pulse of Motion: Measuring Physical Frame Rate from Visual Dynamics

运动的脉搏:从视觉动态测量物理帧率

Xiangbo Gao, Mingyang Wu, Siyuan Yang, Jiongze Yu, Pardis Taghavi, Fangzhou Lin, Zhengzhong Tu

机构 * Texas A\&M University

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Visual Chronometer,通过视觉动态直接恢复物理帧率,解决视频生成中因训练数据帧率不一致导致的物理运动速度模糊问题,提升生成视频的自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23973 2026-03-26 cs.CV cs.GR cs.RO 62%

SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents

SLAT-Phys:从结构化3D潜在特征快速预测材料属性场

Rocktim Jyoti Das, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 SLAT-Phys通过单张RGB图像直接预测3D资产的空间变化材料属性场,利用预训练的3D资产生成模型的结构化潜在特征,结合轻量级神经解码器,高效估计杨氏模量、密度和泊松比,实现比传统方法更快的材料属性预测。

Comments 8 page, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏