arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-14 至 2026-04-14 共收录 29 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 29 篇

2604.11174 2026-04-14 cs.RO cs.AI 86%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 机器人数据与评测 :embodied agent(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10951 2026-04-14 cs.RO 85%

Fast-SegSim: Real-Time Open-Vocabulary Segmentation for Robotics in Simulation

Fast-SegSim: 仿真中机器人快速开放词汇分割

Xuan Yu, Yuxuan Xie, Shichao Zhai, Shuhao Ye, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出Fast-SegSim,基于2D高斯散射构建端到端框架,实现高保真且3D一致的开放词汇分割重建。通过优化渲染管线和Top-K硬选择策略,提升渲染速度至40FPS以上,用于仿真平台传感器输入和下游感知任务的多视图地面真实标签生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22153 2026-04-14 cs.CV cs.AI 81%

Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation

超越瓷砖匹配:连接不一致的航空和卫星视图以实现仅视觉UAV导航

Kejia Liu, Haoyang Zhou, Ruoyu Xu, Peicheng Wang, Mingli Song, Haofei Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出Bearing-UAV方法,通过联合预测UAV绝对位置和航向实现跨视图导航,提升在复杂环境下的定位精度和鲁棒性。

Comments Accepted as a conference paper by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11349 2026-04-14 cs.RO 79%

Learning Racket-Ball Bounce Dynamics Across Diverse Rubbers for Robotic Table Tennis

在多样橡胶下学习球拍-球碰撞动力学

Thomas Gossard

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出统一框架,通过10种不同橡胶类型的球拍配置,研究球拍-球碰撞动力学,利用高帧率多相机系统收集数据,建立基于冲击模型的参数估计方法,提升预测精度和不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11386 2026-04-14 cs.RO cs.CV 73%

ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation

ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成

Yiran Qin, Jiahua Ma, Li Kang, Wenzhan Li, Yihang Jiao, Xin Wen, Xiufeng Song, Heng Zhou, Jiwen Yu, Zhenfei Yin, Xihui Liu, Philip Torr, Yilun Du, Ruimao Zhang

机构 * CUHK-Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) USTC(中国科学技术大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。

Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11135 2026-04-14 cs.RO cs.LG 73%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05057 2026-04-14 cs.RO cs.CV 73%

StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

StaMo:从紧凑状态表示中无监督学习通用机器人运动

Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) HKUST(香港科技大学) Ant Group(蚂蚁集团)

专题命中 机器人数据与评测 :world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11793 2026-04-14 cs.RO 70%

Disentangled Point Diffusion for Precise Object Placement

解耦点扩散用于精确物体放置

Lyuxing He, Eric Cai, Shobhit Aggarwal, Jianjun Wang, David Held

机构 * Carnegie Mellon University(卡内基梅隆大学) ABB Inc.(ABB公司)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出TAX-DPD框架,通过解耦点扩散模型实现高精度物体放置,提升多模态覆盖与几何变化适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07209 2026-04-14 cs.CV 70%

INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling

INSPATIO-WORLD:通过时空自回归建模实现实时4D世界模拟器

InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao, Hongjia Zhai, Jialin Liu, Jing Guo, Nan Wang, Siji Pan, Weihong Pan, Weijian Xie, Xianbin Liu, Xiaojun Xiang, Xiaoyu Zhang, Xinyu Chen, Yifu Wang, Yipeng Chen, Zhenzhou Fan, Zhewen Le, Zhichao Ye, Ziqiang Zhao

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出INSPATIO-WORLD框架,通过时空自回归模型实现从单帧视频恢复和生成高保真动态交互场景,解决空间一致性和实时交互难题,实现在WorldScore-Dynamic基准中领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10125 2026-04-14 cs.CV 70%

PhyMix: Towards Physically Consistent Single-Image 3D Indoor Scene Generation with Implicit--Explicit Optimization

PhyMix:迈向物理一致的单图像3D室内场景生成的隐式-显式优化

Dongli Wu, Jingyu Hu, Ka-Hei Hui, Xiaobao Wei, Chengwen Luo, Jianqiang Li, Zhengzhe Liu

机构 * Lingnan University(岭南大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本文提出PhyMix,通过隐式-显式优化框架,结合物理评估器提升生成场景的物理一致性,实现视觉真实且物理合理的3D室内场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 67%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO 62%

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 62%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05342 2026-04-14 cs.CV cs.LG 62%

Delta Rectified Flow Sampling for Text-to-Image Editing

Delta Rectified Flow Sampling 用于文本到图像编辑

Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard University(哈佛大学人工智能与机器人实验室) Computer Science Department, Harvard University(哈佛大学计算机科学系) Multimodal Intelligence and Perception Lab, DGIST(大邱庆北科学技术院多模态智能与感知实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Delta Rectified Flow Sampling (DRFS),一种无需反向传播的路径感知编辑框架,通过建模源与目标速度场的差异以减少过平滑伪影,并引入时间依赖的位移项提升目标分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17925 2026-04-14 cs.RO cs.CV 62%

Switch-JustDance: Benchmarking Whole Body Motion Tracking Controllers Using a Commercial Console Game

Switch-JustDance: 使用商业游戏机评估完整身体运动跟踪控制器的基准测试

Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Sehoon Ha, Tianyu Li

机构 * Georgia Tech(佐治亚理工学院) HKU(香港大学) ETH Zurich(苏黎世联邦理工学院) SCUT(华南理工大学) THU(清华大学) MIT(麻省理工学院) PNDbotics

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Switch-JustDance基准测试平台,利用Nintendo Switch上的Just Dance游戏评估机器人完整身体控制能力,验证其可靠性并对比三种先进控制器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17596 2026-04-14 cs.CV cs.AI cs.LG cs.RO 61%

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

PRIX:从原始像素学习计划以实现端到端自动驾驶

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) SCANIA(斯堪尼亚)

专题命中 机器人数据与评测 :分类 cs.RO、cs.AI、cs.CV;robotics(comments)

AI总结 PRIX通过使用仅需摄像头数据的端到端驾驶架构,无需BEV表示和LiDAR,直接从原始像素预测安全轨迹,实现了高效且实用的自动驾驶解决方案。

Comments Accepted for Robotics and Automation Letters (RA-L) and will be presented at iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10241 2026-04-14 cs.RO 61%

A Coordinate-Invariant Local Representation of Motion and Force Trajectories for Identification and Generalization Across Coordinate Systems

一种坐标不变的局部运动和力轨迹表示法用于跨坐标系统的识别与泛化

Arno Verduyn, Erwin Aertbeliën, Maxim Vochten, Joris De Schutter

机构 * KU Leuven(鲁汶大学) Flanders Make(弗兰德斯制造) Royal Military Academy(皇家军事学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出了一种坐标不变的轨迹表示法,用于在不同坐标系统中一致地识别和泛化运动和力轨迹,以提高鲁棒性和通用性。

Comments This preprint has been accepted for presentation at the 17th World Symposium on the Algorithmic Foundations of Robotics (WAFR 2026). The preprint corresponds to the version submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11038 2026-04-14 cs.CV 57%

EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates

EgoFun3D:基于第一人称视频建模交互三维物体的协调任务

Weikun Peng, Denys Iliash, Manolis Savva

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出EgoFun3D,通过函数模板建模交互三维物体,解决真实世界视频中交互物体建模难题,提出四阶段流程并展示其挑战性。

Comments Project website: https://3dlg-hcvc.github.io/EgoFun3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10780 2026-04-14 cs.CV 57%

LIDARLearn: A Unified Deep Learning Library for 3D Point Cloud Classification, Segmentation, and Self-Supervised Representation Learning

LIDARLearn: 一个用于3D点云分类、分割和自监督表示学习的统一深度学习库

Said Ohamouddou, Hanaa El Afia, Abdellatif El Afia, Raddouane Chiheb

机构 * ENSIAS, Mohammed V University, Rabat, Morocco(穆罕默德五世大学ENSIAS学院,拉巴特,摩洛哥)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出LIDARLearn,一个整合多种3D点云处理方法的统一深度学习库,支持分类、语义分割、部分分割和少样本学习,并提供标准化训练流程和严格多模型比较工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05510 2026-04-14 cs.CV 57%

Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality

在增强现实中评估视觉-语言模型在矛盾虚拟内容攻击下的基准测试

Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出ContrAR基准,评估视觉-语言模型在增强现实中的鲁棒性,通过312个真实AR视频验证,测试11种VLMs,发现现有模型在检测对抗性内容操纵方面仍有改进空间。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09056 2026-04-14 cs.CV 57%

ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors

ConceptPose:基于概念向量的无训练零样本物体姿态估计

Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 ConceptPose利用视觉语言模型生成开放词汇3D概念图,通过建立概念图间的3D-3D对应关系,实现无训练的零样本物体姿态估计,优于现有最佳基线62%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10058 2026-04-14 cs.RO cs.CG 57%

A Ray Intersection Algorithm for Fast Growth Distance Computation Between Convex Sets

用于凸集之间快速生长距离计算的射线相交算法

Akshay Thirugnanam, Koushil Sreenath

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种高效算法,通过迭代构造Minkowski差集的内外多面体近似,计算凸集之间的生长距离,该算法在运动规划和刚体模拟中具有广泛应用。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09996 2026-04-14 cs.CV 57%

A Comparative Study of Modern Object Detectors for Robust Apple Detection in Orchard Imagery

现代目标检测器在果园图像中稳健苹果检测的比较研究

Mohammed Asad, Ajai Kumar Gautam, Priyanshu Dhiman, Rishi Raj Prajapati

机构 * Affiliation omitted for double-blind review

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文比较了六个现代目标检测器在苹果检测中的性能,发现YOLO11n在严格定位性能上表现最佳,同时分析了不同检测器在阈值鲁棒性和下游任务需求上的差异。

Comments Accepted at ICICV 2026; 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-04-14 cs.MA cs.AI cs.CL 57%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09649 2026-04-14 cs.HC cs.AI eess.SP 57%

WearBCI Dataset: Understanding and Benchmarking Real-World Wearable Brain-Computer Interfaces Signals

WearBCI 数据集:理解和评估真实世界可穿戴脑机接口信号

Haoxian Liu, Hengle Jiang, Lanxuan Hong, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出WearBCI数据集,通过同步多模态记录和系统性评估,研究运动伪影对可穿戴BCI信号的影响,并探索跨模态信号增强和多维行为理解的新应用。

Comments Accepted by Sensys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09578 2026-04-14 cs.AI 57%

Explainable Planning for Hybrid Systems

混合系统的可解释规划

Mir Md Sajid Sarwar

机构 * School of Mathematical and Computational Sciences, Indian Association for the Cultivation of Science, Kolkata(印度科学培育协会数学与计算科学学院,加尔各答)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 研究针对混合系统中的可解释人工智能规划,探讨生成AI系统解释的方法,以应对自动化规划在复杂安全领域中的应用需求。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18976 2026-04-14 cs.CV cs.HC 57%

Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking

Ninja Codes: 由神经生成的隐匿式六自由度跟踪标记

Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato

机构 * Osaka University(大阪大学) Kyoto University(京都大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出Ninja Codes,一种由神经网络生成的隐匿式标记,能自然融入真实环境,通过编码网络将任意图像转换为标记,用于机器人和增强现实等领域的隐匿六自由度跟踪。

Comments CVPR 2026 Findings; Project page: https://sento.net/research/ninjacodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10763 2026-04-14 cs.IR cs.HC 50%

BDIViz in Action: Interactive Curation and Benchmarking for Schema Matching Methods

BDIViz在行动:交互式整理与基准测试用于模式匹配方法

Eden Wu, Christos Koutras, Cláudio T. Silva, Juliana Freire

专题命中 机器人数据与评测 :navigation(abstract)

AI总结 本文提出BDIViz系统,通过交互式可视化和LLM辅助验证,解决模式匹配方法评估中的基准多样性不足问题,支持人类在循环中的基准测试和迭代匹配器开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10522 2026-04-14 cs.CR 50%

SEED: A Large-Scale Benchmark for Provenance Tracing in Sequential Deepfake Facial Edits

SEED:一个大规模的面部深度伪造序列编辑溯源基准

Mengieong Hoi, Zhedong Zheng, Ping Liu, Wei Liu

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 SEED通过多步扩散编辑流程生成90000张图像,包含编辑顺序、文本指令等细粒度标注,用于研究序列溯源和伪造检测,揭示空间与频域特征在深度伪造分析中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏