arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 476 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 476 篇

2607.21856 2026-07-27 cs.LG cs.AI cs.CL 新提交 62%

LeAct: Learning to Reason from Expert Actions

LeAct:从专家行动中学习推理

Ziran Yang, Chengshuai Shi, Raj Ghugare, Benjamin Eysenbach, Karthik Narasimhan, Chi Jin

机构 * Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。

Comments 27 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 62%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20493 2026-07-24 cs.AI cs.LG 新提交 62%

Attention-based Experience Replay Framework for Continual Learning of Agnostic Time Series Forecasting Models

基于注意力的经验回放框架用于不可知时间序列预测模型的持续学习

Quentin Besnard, Nicolas Ragot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络依赖固定数据集无法适应动态环境的问题,提出基于注意力机制引导经验回放策略的持续时间序列预测框架,能动态适应新环境保留知识,减轻遗忘,在多数据集上评估显示可提高预测性能、降低成本和数据需求。

Journal ref CAp & RFIAP, Jul 2026, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19865 2026-07-23 cs.AI cs.CL cs.LG 新提交 62%

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

DocOps:复杂文档操作中自主智能体的可验证基准

Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin, Shuaiqiang Wang, Dawei Yin, Xianpei Han, Le Sun

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18230 2026-07-21 cs.CV cs.AI 新提交 62%

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。

Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 62%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15935 2026-07-20 cs.RO cs.LG 新提交 62%

Learning Reach-Avoid Task with Reinforcement Learning: Vectorized Simulation and Benchmark

基于强化学习的到达-回避任务学习:矢量化仿真与基准测试

Jonas Weihing, Shahram Eivazi

机构 * Tübingen university(图宾根大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究深度强化学习在机器人手臂到达-回避任务中的应用,利用MuJoCo MJX物理引擎和Brax库构建基准,展示多种任务设置,取得最优结果,发现此前深度强化学习在现实场景中性能不佳,强调解决该任务仍需更多研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15620 2026-07-20 cs.RO cs.AI 新提交 62%

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots

AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测

Priyanka V. Setty, Arvind Ramanathan, Ian Foster, Rick Stevens

机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI

AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15163 2026-07-17 cs.RO cs.AI 新提交 62%

Scaling Behavior Foundation Model for Humanoid Robots

人形机器人的缩放行为基础模型

Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong, Jiahe Chen, Feiyu Jia, Xiao Chen, Zirui Wang, Furui Xu, Ming Zhou, Kailin Li, Weinan Zhang, He Wang, Li Yi, Dahua Lin, Jiangmiao Pang, Jingbo Wang

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 研究人形机器人行为基础模型的缩放问题,通过协调运动跟踪学习范式、策略展开数量与参考运动多样性的协同、人形Transformer模型架构这三个核心组件,显著提升控制保真度和任务泛化能力,降低测试集误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 62%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14728 2026-07-17 cs.CV cs.RO 新提交 62%

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

VQ-Touch:一种跨传感器和场景的数据高效触觉生成框架

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在解决现有触觉生成方法依赖特定传感器数据集且泛化能力不足的问题。提出VQ-Touch框架,含DM-VQGAN提取特征及离散扩散解码器支持多模态生成,经少样本混合训练增强泛化能力,实验显示其在多任务中超越现有方法。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14439 2026-07-17 cs.LG cs.RO 新提交 62%

Active Real-World Factor-Based Evaluation for Generalist Robot Policies

基于因子的通用机器人策略的主动真实世界评估

Andrew Liao, Hanchen Cui, Karthik Desingh, Aryan Deshwal

机构 * University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 研究通用机器人策略评估难题,提出主动评估框架,将策略评估当作顺序实验设计问题,通过拟合概率替代模型、自适应选评估配置,高效表征策略行为并识别易失败区域,相比随机测试节省大量试验次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 62%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13234 2026-07-16 cs.CV cs.AI 新提交 62%

Continuously Evolving Deepfake Detection: An Architecture and Public-Benchmark Evaluation of a Dynamic Detection System

持续演进的深度伪造检测:动态检测系统的架构与公开基准评估

Ken Jon Miyachi, Dylan Uys

机构 * BitMind(比特思维)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对深度伪造检测器在现实与学术基准表现差异的问题,提出通过Bittensor SN34训练的BitMind Forensics,在多数据集评估中表现优异,能持续演进提升检测能力,且评估工具公开可独立验证。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09785 2026-07-14 cs.CV cs.AI 新提交 62%

Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models

终身表示:视觉模型持续自监督学习综述

Sergi Masip, Alicja Dobrzeniecka, Jonathan Swinnen, Joachim Collin, Bartłomiej Twardowski, Szymon Łukasik, Tinne Tuytelaars

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 综述视觉领域持续自监督学习(CSSL),分析现有评估协议问题,探讨自监督目标抗灾难性遗忘原因,基于遗忘缓解策略对方法分类,识别如可扩展性等挑战,提出推进CSSL需转向大规模持续预训练范式。

Comments This work has been accepted for publication in IEEE EAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09503 2026-07-13 cs.CV cs.AI 新提交 62%

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

VGGT 对重叠的理解:探索共可见性的几何基础模型

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 研究三维重建和机器人定位中共可见性问题,通过探索 VGGT 模型,发现其隐式编码共可见性及层间特性,引入 Co-VGGT 方法,该方法冻结 VGGT 并训练轻量级头,在基准测试中表现出色,提升了共可见性分类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09078 2026-07-13 cs.CV cs.RO 新提交 62%

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method

面向野外无人机的主动目标检测:大规模数据集、基准和方法

Tianpeng Liu, Xinhua Jiang, Li Liu, Qinmu Shen, Siwei Tang, Zhen Liu, Yongxiang Liu

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 针对无人机主动目标检测缺乏高质量数据集和基准的问题,提出ATRNet-LUDO数据集并建立评估基准。利用联合嵌入预测架构构建世界模型,提出AOD-JEPA,经实验验证其有效性和优越性,推动无人机-地面主动目标检测领域研究。

Comments 18 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07962 2026-07-10 cs.CV cs.AI 新提交 62%

Beyond Thermal Imaging: Inferring Thermophysical Properties from Time-Resolved Thermal Observations

超越热成像:从时间分辨热观测中推断热物理性质

Chenghao Xu, Malcolm Mielle, Olga Fink

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院) Schindler Holding AG(迅达控股公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 研究从热观测推断热物理性质的问题,提出ThermoField框架,通过可微热传递模拟统一热场景重建和热物理参数估计,能在复杂3D场景中联合重建几何、估计热扩散率并预测热演变,为相关研究提供统一方法。

Comments 31 pages, In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06306 2026-07-08 cs.SE cs.AI cs.CV 新提交 62%

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

UI2App:可执行Web应用程序生成中视觉交互推理的基准测试

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24234 2026-07-08 cs.CV cs.RO 新提交 62%

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection

从开阔水域到封闭舱室:ProteusVPR用于海洋感知与舱室检查中的跨场景视觉位置识别

Zexi Chen, Zitai Huang, Qiwen Gu, Zhiqi Li, Shengli Dong, Chenlei Wang, Junqiao Zhao, Hongdong Wang, Bing Han

机构 * Shanghai Jiaotong University(上海交通大学) COSCO SHIPPING Advanced Technology Institute(中远海运先进技术研究院) Shanghai Ship and Shipping Research Institute Co.LTD(上海船舶运输科学研究所) Tongji University(同济大学) Dalian Maritime University(大连海事大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出ProteusVPR两阶段检索-细化框架,通过几何-视觉估计网络融合时序帧与几何描述符,在跨场景海洋环境下将平均定位误差降低60%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 62%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04616 2026-07-07 cs.RO cs.AI 新提交 62%

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing

SILO:用于多阶段电缆布线的回路内仿真的仿真到现实转移

Stone Tao, Jie Xu, Hesam Rabeti, Yashraj Narang, Yijie Guo, Iretiayo Akinola

机构 * NVIDIA Corporation(英伟达公司) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对电缆等物体复杂变形导致的线性可变形操纵难题,提出基于GPU并行仿真的强化学习框架及新部署策略,实现多阶段电缆布线的仿真到现实转移,提升成功率并减少周期时间。

Comments Website: https://silo-cable-routing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02866 2026-07-07 cs.CV cs.RO 新提交 62%

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras

E-TraMamba:一种用于事件相机的高效长期3D特征跟踪的新范式

Juwei Shen, Yujie Wu, Changwen Chen

机构 * Department of Computing, FCMS(计算系(FCMS)) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对现有3D跟踪器在处理稀疏、噪声事件流时的问题,提出E-TraMamba框架,采用线性状态空间模型和多尺度线索融合等方法,构建数据集,实验表明其性能达最优,适用于多种视觉任务。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 62%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02646 2026-07-07 cs.RO cs.CV 新提交 62%

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

EVA-Client:用于真实机器人上具身策略的统一数据收集、推理和部署框架

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

机构 * CoLab, Beihang University(协同实验室,北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 介绍EVA-Client框架,它位于策略服务器和物理硬件之间,统一策略迭代循环的真实机器人阶段。贡献包括组件解耦架构、可检查执行及每次评估兼具数据收集功能,还整合多种实时推理策略。

Comments https://colalab.net/projects/eva-client

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20742 2026-07-07 cs.RO cs.AI 新提交 62%

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring in Open-Traffic Conditions

无需封闭车道的交通感知无人机路面监测数字孪生框架

Yamil Uchani, Grace Luna, Edwin Salcedo, Mauricio Figueroa

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出基于Unity的数字孪生框架,集成YOLOv8n检测与分类器,实现交通感知无人机路面监测,无需封闭车道,实验评估三种遮挡恢复策略,最高覆盖率达97.95%。

Comments Accepted for publication in the proceedings of the 6th Annual IEEE International Conference on Digital Twins and Parallel Intelligence (DTPI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02426 2026-07-03 cs.LG cs.AI 新提交 62%

QFedAgent: Quantum-Enhanced Personalized Federated Learning for Multi-Agent Activity Recognition

QFedAgent: 量子增强的个性化联邦学习用于多智能体活动识别

Quoc Bao Phan, Tuy Tan Nguyen

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) FAMU-FSU College of Engineering, Florida State University(佛罗里达州立大学工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出QFedAgent混合量子-经典个性化联邦学习框架,通过变分量子电路融合模块减少参数开销,在非独立同分布多模态数据上实现97.7%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01915 2026-07-03 cs.CV cs.RO 新提交 62%

Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots

用于水下机器人施工环境监测的鲁棒图像处理技术

Seunghee Yun, Geonmo Yang, Juhui Lee, Changbeom Park, Jeahyung Choi, Younggun Cho

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出一种针对水下机器人施工环境监测的鲁棒图像处理框架,通过分阶段建模前向散射和海洋雪退化,使用合成数据重训练联合ID网络,并应用轻量级后处理,在真实水下数据集上提升视觉质量和UIQM分数。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00716 2026-07-02 cs.CV cs.AI 新提交 62%

Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach

部分骨架可见性用于动作识别:一种受限视野方法

Yingjie Dai, Tianyang Xu, Yanglin Deng, Xiao-Jun Wu, Josef Kittler

机构 * Jiangnan University(江南大学) University of Surrey(萨里大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 针对现实场景中视野受限导致骨架关节大量缺失的问题,提出PartialVisGraph超图框架,通过可学习虚拟超边和单头样本自适应Transformer,结合可见性先验实现鲁棒的动作识别,在NTU RGB+D 60/120上显著提升部分可见性下的准确率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 62%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏