arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 241 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 241 篇

2607.07281 2026-07-20 cs.RO nlin.AO physics.app-ph 版本更新 57%

Programmable Synchronization Graphs for Adaptive and Fault-Tolerant Modular Miniature Robots

用于自适应和容错模块化微型机器人的可编程同步图

Okan Kulekcioglu, Arqam Bin Ahmad, Ines Garcia, Filipe Serra Alves, Onur Ozcan, M. Selim Hanay

机构 * Department of Mechanical Engineering, Bilkent University(巴尔坎大学机械工程系) International Iberian Nanotechnology Laboratory (INL)(国际伊比拉纳米技术实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 研究模块化微型机器人协调难题,提出可编程同步图框架,通过图耦合编码运动协调,实现同步、相位调整、容错及适应,还能减轻耦合负担,降低相位误差,确立其为紧凑控制层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26614 2026-07-20 cs.HC cs.AI cs.GR 版本更新 57%

HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization

HiLSVA:用于科学可视化的人机协同智能系统设计与评估

Kuangshi Ai, Patrick Phuoc Do, Chaoli Wang

机构 * Department of Computer Science and Engineering, University of Notre Dame(Notre Dame 大学计算机科学与工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出HiLSVA,一种人机协同智能系统,通过计划优先的多智能体架构、显式人类监督和逐步溯源,支持混合主动的科学可视化工作流,增强而非替代人类分析推理。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11593 2026-07-20 cs.CV 版本更新 57%

WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing

WeEdit:一个数据集、基准和基于字形引导的文本中心图像编辑框架

Hui Zhang, Juntao Liu, Zongkai Liu, Liqiang Niu, Fandong Meng, Zuxuan Wu, Yu-Gang Jiang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 WeEdit通过构建大规模数据集和定制训练策略,提升文本中心图像编辑的精度与多样性,优于现有开源模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22402 2026-07-20 cs.CL cs.FL cs.LG 版本更新 57%

Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization

双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化

Kanishk Awadhiya

机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。

Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21109 2026-07-20 cs.RO 版本更新 57%

Robust and Efficient MuJoCo-based Model Predictive Control via Web of Affine Spaces Derivatives

基于仿射空间网络导数的鲁棒高效MuJoCo模型预测控制

Chen Liang, Daniel Rakita

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对MJPC中有限差分导数计算瓶颈,引入仿射空间网络(WASP)导数替代,实现高效稳定的导数计算,在多种机器人任务中实现高达2倍加速,并优于随机采样规划器。

Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15412 2026-07-20 cs.RO cs.SY eess.SY 版本更新 57%

Sym2Real: Symbolic Dynamics with Residual Learning for Data-Efficient Adaptive Control

Sym2Real:用于数据高效自适应控制的基于残差学习的符号动力学

Easop Lee, Samuel A. Moore, Boyuan Chen

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 Sym2Real框架解决符号回归在实际控制中因对噪声敏感而受限的问题,先从低保真模拟学习,再用少量真实数据残差自适应弥合模拟到现实差距,仅约10条轨迹就实现对四旋翼和赛车的鲁棒控制及模拟到现实转移。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19063 2026-07-16 cs.RO cs.GR 版本更新 57%

Fire as a Service: Augmenting Robot Simulators with Thermally and Visually Accurate Fire Dynamics

火灾作为服务:通过热力学和视觉准确的火灾动力学增强机器人仿真器

Anton R. Wagner, Madhan Balaji Rao, Helge Wrede, Sören Pirk, Xuesu Xiao

机构 * Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出Fire as a Service框架,通过高保真火灾模拟提升机器人仿真器的热力学和视觉准确性,支持生成真实火灾环境下的训练数据和热危害评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19593 2026-07-16 cs.AI cs.MA 版本更新 57%

A Survey on Hypergame Theory: Modelling Misaligned Perceptions and Nested Beliefs for Multi-Agent Systems

关于超博弈理论的综述:为多智能体系统建模错位感知与嵌套信念

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文综述了超博弈理论在多智能体系统中的应用,分析了其建模错位感知与嵌套信念的能力及现有研究中的趋势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02741 2026-07-16 cs.RO 版本更新 57%

PokeNet: Learning Kinematic Models of Articulated Objects from Human Observations

PokeNet: 从人类观察中学习机械结构模型

Anmol Gupta, Weiwei Gu, Omkar Patil, Jun Ki Lee, Nakul Gopalan

机构 * School of Computation and AI, ASU, Tempe(计算与人工智能学院,亚利桑那州立大学) AI Institute, Seoul National University, Seoul, South Korea(首尔国立大学人工智能研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 PokeNet通过单个人类示范学习机械结构模型,无需先验知识,提升关节轴和状态估计精度达27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17183 2026-07-15 cs.CV cs.CY 版本更新 57%

Benchmarking Nighttime Traffic Sign Recognition with Illumination-Adaptive Detection and Semantic Attribute Reasoning

在低光照条件下学习:用于交通标志识别的数据集和算法

Aditya Mishra, Akshay Agarwal, Haroon Lone

机构 * IISER Bhopal(印度比哈尔州国际研究学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出INTSD数据集和LENS-Net算法,解决夜间交通标志识别中的低光照和干扰问题,通过大规模数据和先进模型验证了夜间识别的挑战与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05241 2026-07-14 cs.RO 版本更新 57%

GelNeuro: A Sensing-Computing Integrated Neuromorphic Tactile System for Texture Recognition

GelNeuro:面向纹理识别的感算融合神经形态触觉系统

Luoyang Bian, Xinpan Meng, Zhenghua Ma, Houcheng Li, Long Cheng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对现有神经形态触觉系统依赖主机预处理的问题,提出GelNeuro感算融合系统,搭配硬件感知权重钳位策略,实现低功耗高准确率的端侧纹理识别。

Comments The authors withdraw this preprint as the work requires substantial revision and additional validation. The current version is not suitable for public dissemination, and further development of the research is needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-07-14 cs.AI 版本更新 57%

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28022 2026-07-14 cs.CV 版本更新 57%

Are DeepFakes Realistic Enough? Exploring Semantic Mismatch as a Novel Challenge

深度伪造是否足够逼真?探索语义不匹配作为新的挑战

Sharayu Nilesh Deshmukh, Kailash A. Hambarde, Joana C. Costa, Hugo Proença, Tiago Roxo

机构 * Instituto de Telecomunicações, Universidade da Beira Interior(电信研究所,贝拉内里大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出新的评估框架,通过引入语义不匹配类别,评估现有模型在面对语义不一致的深度伪造数据时的鲁棒性,并提出语义强化策略提升检测性能。

Comments Added missing FGI results in semantic reinforcement eval (Table 9), showing an architecture-dependent effect. Abstract, contributions, and conclusion revised accordingly. Clarified RARV-SMM/semantic mismatch definition. Corrected SOTA comparison claim (Sec. 4.7). Added code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15041 2026-07-14 cs.LG cs.SE 版本更新 57%

HyperNet-Adaptation for Diffusion-Based Test Case Generation

基于扩散的测试用例生成的超网络自适应

Oliver Weißl, Vincenzo Riccio, Severin Kacianka, Andrea Stocco

机构 * Technical University of Munich(慕尼黑技术大学) University of Udine(乌迪内大学) fortiss

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 针对深度学习系统可靠性评估问题,提出HyNeA生成式测试方法,通过超网络实现无数据集可控性,采用独特训练策略,能以较低计算成本有针对性地生成现实故障用例,提高可控性和测试多样性,还可推广到无故障标签数据领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新 57%

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03834 2026-07-09 cs.RO 版本更新 57%

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems

让动力学流动:稳定的流匹配动力系统

Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz del Solar, Noémie Jaquier

机构 * Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Advanced Mining Technology Center (AMTC) and Department of Electrical Engineering, Universidad de Chile(先进采矿技术中心(AMTC)和电气工程系,智利大学) Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能中心,德国Renningen) Italian Institute of Artificial Intelligence (AI4I), Turin, Italy(意大利人工智能研究所(AI4I),意大利都灵)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出稳定流匹配动力系统(SFMDS)框架,通过流匹配参数化动力系统并施加李雅普诺夫稳定性约束,实现稳定、可扩展、多模态的机器人运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19887 2026-07-09 cs.DC cs.MA cs.RO cs.SY eess.SY 版本更新 57%

DAG-Based QoS-Aware Dynamic Task Placement for Networked Multi-Stage Control Pipelines

基于DAG的QoS感知动态任务放置用于网络化多阶段控制流水线

Thien Tran, Jonathan Kua, Thuong Hoang, Minh Tran, Yuemin Ding, Jiong Jin

机构 * Deakin University, Australia(德坎大学,澳大利亚) RMIT University, Vietnam(皇家墨尔本理工大学,越南) University of Navarra, Spain(纳瓦拉大学,西班牙) Swinburne University of Technology, Australia(斯威本科技大学,澳大利亚)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种基于DAG的QoS感知动态任务放置框架,用于网络化机器人中的感知-感知-规划-控制流水线,通过动态任务放置优化计算、通信延迟和任务放置集,解决传统静态边缘卸载和单阶段模型的不足。

Comments 5 pages, 1 figure, 1 table, 1 algorithm, accepted paper on the 24th IEEE International Conference on Industrial Informatics (INDIN), 26-29 July, 2026, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13817 2026-07-09 cs.LG cs.NI 版本更新 57%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27422 2026-07-07 cs.CV 版本更新 57%

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

野外稀疏视角3D高斯点云生成

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) GenGenAI Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦斯州立大学)

专题命中 机器人数据与评测 :robotic(abstract_cn);分类 cs.CV

AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。

Comments 16 pages, 16 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19822 2026-07-07 cs.CV 版本更新 57%

HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks

HUGE-Bench: 面向高级无人机视觉-语言-动作任务的基准测试

Jingyu Guo, Ziye Chen, Ziwen Li, Zhengqing Gao, Jiaxin Huang, Hanlue Zhang, Fengming Huang, Yu Yao, Tongliang Liu, Mingming Gong

机构 * The University of Melbourne(墨尔本大学) Melsy Tech(Melsy科技) MBZUAI Navlyn The University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出HUGE-Bench基准,通过4个数字孪生场景和8个高级任务,评估无人机在简洁语言指令下执行安全、过程导向的复杂轨迹能力,并引入过程导向和碰撞感知指标,揭示现有VLA模型在高级语义完成和安全执行上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14891 2026-07-07 cs.CV 版本更新 57%

GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects

高斯艺术:关节物体几何与运动的统一建模

Licheng Shen, Saining Zhang, Honghan Li, Peilin Yang, Zihao Huang, Zongzheng Zhang, Hao Zhao

机构 * BAAI(百度人工智能研究院) AIR, THU(清华大学人工智能研究院) NTU(国立台湾大学) BIT(北京理工大学) HUST(华中科技大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 研究关节物体重建,此前方法解耦几何与运动,本文用关节3D高斯联合建模,提升运动分解鲁棒性,支持多达20个部件的物体,还提出新基准测试,实验表明该方法在多任务中精度更优。

Comments 3DV 2026 Project Page: https://sainingzhang.github.io/project/gaussianart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01189 2026-07-03 cs.RO cs.SY eess.SY 版本更新 57%

SPOT: Spatio-Temporal Obstacle-free Trajectory Planning for UAVs in Unknown Dynamic Environments

SPOT:未知动态环境中无人机的时空无碰撞轨迹规划

Astik Srivastava, Thomas J Chackenkulam, Bitla Bhanu Teja, Antony Thomas, Madhava Krishna

机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) IIT-BHU, India(IIT-BHU,印度)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出一种基于4维时空规划器、视觉安全飞行走廊生成和轨迹优化的无地图反应式运动规划方法,实现无人机在未知动态环境中的避障,并通过备份规划模块应对死锁。

Comments Accepted for publication at ICRA 2026. Code available at (https://astik-2002.github.io/ICRA-2026-SPOT/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新 57%

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25949 2026-07-01 cs.RO 版本更新 57%

FalconApp: Rapid iPhone Deployment of End-to-End Perception via Automatically Labeled Synthetic Data

FalconApp:通过自动标注的合成数据实现端到端感知的快速iPhone部署

Yan Miao, Will Shen, Sayan Mitra

机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 FalconApp通过自动标注的合成数据实现端到端感知的快速iPhone部署,利用手机拍摄的刚体对象生成感知模块,实现遮挡检测和6自由度姿态估计,实验显示其在模拟和现实评估中姿态精度优于PnP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16424 2026-07-01 cs.RO cs.NA cs.SY eess.SY math.NA 版本更新 57%

Early-Terminable Energy-Safe Iterative Coupling for Parallel Simulation of Partitioned Port-Hamiltonian Systems

用于分区端口-哈密顿系统并行仿真的早期可终止节能迭代耦合

Qi Wei, Jianfeng Tao, Hongyu Nie, Wangtao Tan

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对并行仿真中分区耦合可能注入虚假能量的问题,提出基于Douglas-Rachford分裂的早期可终止节能耦合接口,利用Fejér单调性提供算法耗散,保证离散无源性并收敛到整体离散化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06205 2026-06-29 cs.RO 版本更新 57%

KISS-IMU: Self-supervised Inertial Odometry with Motion-balanced Learning and Uncertainty-aware Inference

KISS-IMU:基于运动平衡学习与不确定性感知推理的自监督惯性里程计

Jiwon Choi, Hogyun Kim, Geonmo Yang, Juhui Lee, Younggun Cho

机构 * Electrical and Computer Engineering, Inha University(信息电子工程学院,印斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出KISS-IMU自监督框架,通过运动平衡训练和不确定性加权推理消除对真值依赖,仅用LiDAR作为轻量监督信号,实现鲁棒惯性里程计。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 57%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19274 2026-06-26 cs.RO 版本更新 57%

GO: The Great Outdoors Multimodal Dataset

GO: 大户外多模态数据集

Peng Jiang, Kasi Viswanath, Akhil Nagariya, George Chustz, Maggie Wigness, Philip Osteen, Timothy Overbye, Christian Ellis, Long Quang, Jia Huang, Srikanth Saripalli

机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。

Comments 7 pages, 7 figures, accepted at IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03723 2026-06-25 cs.CV 版本更新 57%

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion:相机运动与物体动态的联合控制以实现一致的视频生成

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 SymphoMotion通过联合控制相机运动和物体动态,提高视频生成的一致性和表达性,其核心方法结合了相机轨迹控制与物体动态控制机制,并引入了RealCOD-25K数据集进行大规模训练和评估,显著提升了视觉保真度和物体运动准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19964 2026-06-25 cs.CV 版本更新 57%

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

2K Retrofit: 熵引导的高效稀疏细化用于高分辨率3D几何预测

Tianbao Zhang, Zhenyu Liang, Zhenbo Song, Nana Wang, Xiaomei Zhang, Xudong Cai, Zheng Zhu, Kejian Wu, Gang Wang, Zhaoxin Fan

机构 * BUAA(北京航空航天大学) SJTU(上海交通大学) GigaAI XREAL NUST(南京理工大学) RUC(清华大学) NUDT(国防科技大学) UCAS(中国科学技术大学) BIBMS(北京工业大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出2K Retrofit框架,通过快速粗预测和基于熵的稀疏细化,在不修改基础模型的情况下实现高效2K分辨率几何预测,达到SOTA精度和速度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏