arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 476 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 476 篇

2606.25430 2026-06-25 cs.CV 新提交 57%

PRISM: Feed-Forward Single-Image 3D Reconstruction via Geometric Warp-Residual Modeling

PRISM: 基于几何扭曲残差建模的前馈式单图像三维重建

Zhijie Zheng, Xinhao Xiang, Jiawei Zhang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PRISM前馈框架,将多视角潜在预测分解为无参数几何先验和可学习残差校正,无需扩散采样,推理时间仅36秒/场景,重建质量与扩散方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25427 2026-06-25 cs.CV 新提交 57%

Gastroendoscopy View Synthesis: A New Real Dataset and Evaluation

胃内镜视图合成:一个新的真实数据集与评估

Masaki Minai, Yusuke Monno, Masatoshi Okutomi, Sho Suzuki

机构 * Department of Systems and Control Engineering, School of Engineering, Institute of Science Tokyo(东京科学大学工学院系统与控制工程系) Department of Gastroenterology, International University of Health and Welfare Ichikawa Hospital(国际医疗福祉大学市川医院消化内科)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 为解决胃内镜新视角合成数据集不足的问题,提出首个真实胃镜数据集GastroNVS,并评估多种3DGS方法,为未来发展指明挑战。

Comments Accepted for EMBC 2026. Project page: http://www.ok.sc.e.titech.ac.jp/res/GastroNVS/GastroGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24191 2026-06-24 cs.RO 新提交 57%

The Evaluation Cost of Task Specialization in Evolutionary Multi-Robot Systems

进化多机器人系统中任务专业化的评估成本

Paolo Leopardi, Heiko Hamann, Jonas Kuckling, Tanja Katharina Kaiser

机构 * University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour(集体行为高级研究中心) Department of Computer and Information Science(计算机与信息科学系) University of Technology Nuremberg(纽伦堡工业大学) Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 研究在进化多机器人系统中,任务专业化与通用行为相比所需的评估预算成本,发现随着系统规模增大,更少的预算即可使专业化表现优于通用化。

Comments Accepted for publication at GECCO '26 Companion: Proceedings of the Genetic and Evolutionary Computation Conference Companion. Supplementary video: https://youtu.be/U5LNICts7Ek

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24124 2026-06-24 cs.AI 新提交 57%

VeryTrace: Verifying Reasoning Traces through Compilable Formalism and Structured Verification

VeryTrace: 通过可编译形式化与结构化验证验证推理轨迹

Ninghan Zhong, Ahmet Ege Tanriverdi, Kaan Kale, Sriram Vishwanath

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程学院) Department of Electrical and Computer Engineering, Bogazici University, Turkey(博亚奇大学电子与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 提出VeryTrace框架,将自然语言推理轨迹形式化为可编译的领域特定语言(DSL),结合确定性检查与LLM审计进行混合验证,实现步骤级错误定位与修复,在数学、机器人规划、亲属推理任务上提升准确率。

Comments Accepted at LM4Plan Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22597 2026-06-24 cs.CV 新提交 57%

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

MapReason-OSM:视觉语言模型能否从街道地图中做出可图验证的移动决策?

Srinivas Venkatanarayanan, Clement Pakkam Isaac

机构 * NVIDIA(英伟达) University of Central Florida(中佛罗里达大学) University of South Florida(南佛罗里达大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出MapReason-OSM基准,通过自渲染OpenStreetMap面板和隐藏街道图,评估VLM在路由、设施定位等任务中做出可图验证的移动决策的能力,发现模型在图形成本推理和跨缩放一致性上表现不佳。

Comments 9 pages, 7 figures. Submitted to ACM SIGSPATIAL 2026 (Industrial Track). Code and data: https://github.com/Vi-Sri/mapreason-osm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23634 2026-06-23 cs.CV 新提交 57%

Pose Anything Anywhere:Model-free Object Poses from Arbitrary References

Pose Anything Anywhere: 任意参考图像下的无模型物体姿态估计

Hongli Xu, Jiaqi Hu, Junwen Huang, Boyang Zhong, Peter KT Yu, Nassir Navab, Benjamin Busam, Slobodan Ilic

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Siemens AG(西门子股份公司) XYZ Robotics ROBOX

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出PANY,一种统一的无模型框架,通过多视图变换器学习视图一致几何和跨视图对齐,支持单/稀疏参考视图和RGB-D输入,在YCB-V和LM-O上分别提升姿态精度12%和20%以上。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22918 2026-06-23 cs.CV cs.GT 新提交 57%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22813 2026-06-23 cs.AI 新提交 57%

Active Inference as the Test-Time Scaling Law for Physical AI Agents

主动推理作为物理AI代理的测试时缩放定律

Omar Hashash, Christo Kurisummoottil Thomas, Walid Saad, Merouane Debbah, Karl Friston, Adeel Razi

机构 * Bradley Department of Electrical and Computer Engineering(布拉德利电气与计算机工程系) Institute for Advanced Computing(先进计算研究所) Virginia Tech(弗吉尼亚理工大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Worcester Polytechnic Institute(沃思堡理工学院) Khalifa University of Science and Technology(卡利法科学与技术大学) CentraleSupelec(中央超导研究所) University Paris Saclay(巴黎萨克雷大学) Queen Square Institute of Neurology(伦敦大学学院神经科学研究所) School of Psychological Sciences(心理学系) Monash University(莫纳什大学) CIFAR Global Scholars Program(CIFAR全球学者计划) Queen Square Institute of Neurology, University College London(伦敦大学学院神经科学研究所)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 提出基于主动推理第一性原理的测试时缩放定律,使物理AI代理通过世界模型推理在非平稳环境中泛化,并利用变分推理更新策略,在自动驾驶任务中提升36%以上推理效率。

Comments 53 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21438 2026-06-23 cs.RO 新提交 57%

Temporal logics and formal synthesis for robot planning and control

机器人规划与控制的时间逻辑与形式化综合

Jana Tumova, Joris Verhagen, Matti Vahs

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文介绍线性时间逻辑和信号时间逻辑作为机器人行为的规范语言,并讨论从离散图/游戏到采样运动规划、轨迹优化和控制证书的形式化综合方法,最后指出实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21108 2026-06-23 cs.CV 新提交 57%

SARIF: Segment Anything for Robust Image Forensics

SARIF: 用于鲁棒图像鉴别的 Segment Anything

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

机构 * Department of Electrical and Computer Engineering, Inha University(仁荷大学电气与计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出SARIF框架,利用Segment Anything Model的提示架构和泛化能力,通过反馈引导掩码解码器和双编码器设计提取伪造痕迹,实现自动伪造定位,在跨数据集和图像退化下表现鲁棒。

Comments Accepted to ECCV 2026. Equal contribution: Dong-Hyun Moon and Ju-Hyeon Nam. Corresponding author: Sang-Chul Lee. Code: https://github.com/Inha-CVAI/SARIF_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21082 2026-06-23 cs.CL cs.AI cs.CR 新提交 57%

Scalable Hierarchical Attention Transformers for Multi-Turn Jailbreak Detection in Long Conversations

可扩展的层次注意力Transformer用于长对话中的多轮越狱检测

Chenhui Hu, Muhammed Salih, Sudipto Guha, Subramanian Srinivasan

机构 * Zscaler, Inc.(Zscaler公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出一种层次化检测器,通过紧凑的轮次表示和轻量级对话模块捕捉跨轮推理,在14,038条对话上F1达0.9394,超越Claude Opus 4.7,误报率减半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21270 2026-06-23 physics.optics cs.CV 新提交 57%

Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering

基于3D高斯瞬态渲染的任意中继曲面几何非视距成像

Yi Wang, Ziyu Zhan, Yuran Wang, Hao Wang, Qiang Liu, Zuoqiang Shi, Lingyun Qiu, Xing Fu

机构 * Department of Precise Instrument, Tsinghua University(清华大学精密仪器系) Department of Electrical Engineering, City University of Hong Kong(香港城市大学电子工程系) Yau Mathematical Science Center, Tsinghua University(清华大学姚期智科学中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对非视距成像中中继曲面形状任意且采样稀疏的问题,提出一种无几何假设的LOS引导NLOS成像方法,利用3D高斯原语和可微分瞬态渲染实现端到端优化,在真实数据上达到最先进的重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19928 2026-06-19 cs.RO 新提交 57%

SWAP: Symmetric Equivariant World-Model for Agile Robot Parkour

SWAP: 用于敏捷机器人跑酷的对称等变世界模型

Kaixin Lan, Ze Wang, Hongyi Li, Lei Jiang, Chaojie Fu, Chengkai Su, Choi Lam Wong, Yongbin Jin, Hongtao Wang

机构 * Center for X-Mechanics, Zhejiang University(浙江大学交叉力学中心) ZJU-Hangzhou Global Scientific and Technology Innovation Center(浙江大学杭州国际科创中心) Mirrorme Technology Co., Ltd.(魔镜科技有限公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 提出SWAP框架,将对称等变性嵌入世界模型和演员-评论家网络,实现四足机器人跑酷记录突破(跨越2.13米间隙、攀爬1.63米平台),并展现出对未见镜像地形的几何泛化与零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16057 2026-06-19 cs.RO cs.SY eess.SP eess.SY 新提交 57%

A Smart-Scheduled Hybrid (SSH) EKF-FGO State Estimation

一种智能调度混合(SSH)EKF-FGO状态估计方法

Eric Levy, Soosan Beheshti

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文通过智能调度混合EKF-FGO框架,实验性地将优化调度作为独立设计变量,研究其在平衡估计精度与计算成本中的作用,并在平面SLAM仿真中验证了调度对预优化漂移、瞬态误差和运行时间的显著影响。

Comments This work has been accepted for presentation/publication at the 2026 IEEE Canadian Conference on Electrical and Computer Engineering (CCECE). The final published version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19122 2026-06-18 cs.RO 新提交 57%

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning

基于混合2D-3D学习的人行道机器人单目3D占用感知

Yukai Ma, Joe Lin, Liu Liu, Honglin He, Lulu Ricketts, Brad Squicciarini, Yong Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) Coco Robotics(Coco机器人) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出WalkOCC框架,通过混合射线行进单目3D占用感知,结合LiDAR-RGB配对数据与大规模无配对单目图像学习,提升人行道机器人导航的预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19089 2026-06-18 cs.RO 新提交 57%

ART-VS: Adaptive Resolution Tiling for Vision Transformer Visual Servoing

ART-VS:用于视觉Transformer伺服的自适应分辨率分块

Alessandro Scherl, Bernhard Neuberger, Simon Schwaiger, David Mulero-Pérez, Lucas Muster, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿尔瓦登特技术系,阿利坎特大学) Department of Industrial Engineering, UAS Technikum Vienna(工业工程系,维也纳技术学院) Automation and Control Institute, TU Wien(自动化与控制研究所,维也纳技术大学) Institute of Software Engineering and Artificial Intelligence, Graz University of Technology(软件工程与人工智能研究所,格拉茨技术大学) Institute for Integrative Nature Conservation Research, University of Natural Resources and Life Sciences Vienna(整合自然保护研究 institute,维也纳自然资源与生命科学大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出ART-VS方法,通过粗-精两阶段自适应调整特征粒度,在不需任务特定训练下提升视觉伺服鲁棒性和精度,显著降低定位误差并提高速度。

Comments Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19023 2026-06-18 cs.CR cs.LG 新提交 57%

Lifecycle-Aware Dynamic Analysis for Secure ML Model Execution

生命周期感知的动态分析用于安全ML模型执行

Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

机构 * Politecnico di Milano(米兰理工大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 提出Moat,一种动态生命周期感知方法,通过监控模型执行各阶段与宿主系统的结构化交互来检测恶意行为,在多个框架上实现零误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18943 2026-06-18 cs.CV 新提交 57%

Physics-IQ Verified

物理智力验证

Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, Carsten T. Lüth

机构 * Anates Labs(Anates实验室) Technical University of Munich(慕尼黑技术大学) University of Technology Nuremberg(纽伦堡技术大学) Tuebingen AI Center, University of Tuebingen(图宾根大学人工智能中心) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) Google DeepMind research(谷歌DeepMind研究)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出Physics-IQ Verified基准,通过改进提示和地面真实质量及引入样本级评分系统,提升视频生成模型对物理现实的理解评估,验证结果表明基准提升了57.6%的样本和34.8%的提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18867 2026-06-18 cs.LG cs.CY stat.ML 新提交 57%

Strategic Feature Selection

战略特征选择

Jivat Neet Kaur, Pratik Patil, Divya Shanmugam, Emma Pierson, Michael I. Jordan, Nika Haghtalab, Meena Jagadeesan, Ahmed Alaa, Serena Wang

机构 * University of California, Berkeley(加州大学伯克利分校) University of Texas, Austin(德克萨斯大学奥斯汀分校) Cornell Tech(康奈尔科技) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学) Inria, Paris(巴黎Inria)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 研究通过特征选择和岭正则化应对战略操纵的分类问题,发现仅基于可操纵性排除特征通常次优,提出联合优化特征集与正则化水平的算法,并在医疗支付基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18632 2026-06-18 cs.RO 新提交 57%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18310 2026-06-18 cs.CR cs.AI 新提交 57%

Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems

冲突感知检索器编辑:针对基于LLM的RAG系统的知识注入攻击

Xinru Liu, Xianglong Zhang, Di Cai, Zhumin Chen, Pengfei Hu, Xin Xin

机构 * Shandong University, China(山东大学,中国) Tsinghua University, China(清华大学,中国)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出冲突感知检索器编辑框架CAREATTACK,通过模型中心攻击将恶意知识注入RAG系统,利用图检测和参数编辑投影解决冲突,并轻量校准保持攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17978 2026-06-17 cs.AI 新提交 57%

MoCo-AIS: A Contrastive Learning Framework for Similarity Computation of Vessel Trajectories

MoCo-AIS: 一种用于船舶轨迹相似度计算的对比学习框架

Ruixin Song, Md Mahbub Alam, Zahra Sadeghi, Amilcar Soares, José F. Rodrigues-Jr, Gabriel Spadon

机构 * Dalhousie University(达尔豪斯大学) Linnaeus University(林奈大学) University of Sao Paulo(圣保罗大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 提出基于动量对比(MoCo)的统一对比学习框架MoCo-AIS,通过正负轨迹对学习嵌入,在真实AIS数据集上评估多种深度学习模型,显著提升轨迹相似度学习性能。

Comments Under review at SIGSPATIAL'26

Journal ref arXiv preprint arXiv:2606.17978, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17935 2026-06-17 cs.CV 新提交 57%

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization

MoonSplat: 基于Sim(3)全局优化的单目在线高斯泼溅

Guo Pu, Yixuan Han, Haofeng Li, Yao Zhang, Hui Zhou, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Beijing Hydrogen Intelligent Tech. Co., Ltd.(北京氢元智能科技有限公司)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 提出一种结合Sim(3)全局优化的在线体素化3DGS框架,通过颜色残差学习策略加速收敛,实现鲁棒的相机跟踪和全局闭环,在室内外数据集上达到SOTA性能。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17309 2026-06-17 cs.RO 新提交 57%

Abstention-Aware Personalized Object Rearrangement via Uncertainty-Guided LLM Assistance

基于不确定性引导的LLM辅助的弃权感知个性化物体重排

Sam Collin, Ali Ayub

机构 * Concordia University(康考迪亚大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出APOLLO框架,结合轻量级个性化嵌入模型与选择性大语言模型辅助,通过不确定性估计在模糊决策时调用LLM,实现高效、隐私保护的弃权感知物体重排。

Comments Accepted at the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17298 2026-06-17 cs.CV 新提交 57%

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生

Yiqing Shen, Hao Ding, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16767 2026-06-16 cs.CV 新提交 57%

Text-Vision Co-Instructed Image Editing

文本-视觉协同指导的图像编辑

Chenxi Xie, Yuhui Wu, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16101 2026-06-16 cs.MM cs.CV 新提交 57%

Effective and Low-cost Lane-based Map Localization for Vehicle-Centric Route Generation

基于车道的地图定位实现以车辆为中心的路线生成:一种有效且低成本的方法

Hong-Shiang Lin, Jung-Hsin Chen, Yu-Luen Tzeng, Wei-Hao Chen, Yi-Chen Lee, Li-Jhe Chen, Peng-Yuan Chen

机构 * National Taipei University(台北国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出OLRA框架,通过匹配导航路线与摄像头检测的车道线,以低成本地图定位生成驾驶员视角路线,提升定位精度和路线一致性,在nuScenes数据集上优于OpenPilot。

Comments 14 pages, 18 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15550 2026-06-16 cs.RO 新提交 57%

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation

机器人作为令牌:面向协调多机器人轨迹生成的统一扩散Transformer

Ruofei Bai, Jie Chen, Yuxin Cai, Jun Li, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 提出Roken框架,将每个机器人表示为离散令牌,通过扩散Transformer直接生成满足安全和连通性约束的多机器人轨迹,无需迭代后处理。

Comments 23 pages, 13 figures; \textbf{Project page:} \href{https://bairuofei.github.io/roken-project-page/}{\texttt{bairuofei.github.io/roken-project-page}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 57%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15255 2026-06-16 cs.RO 新提交 57%

OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration

OSDAG: 面向高效多机器人协作的在线调度

Thanh Nguyen Canh, Thang Tran Viet, Phuc Van Dinh, Xiem HoangVan, Nak Young Chong

机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) Hanyang University(汉阳大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。

详情

展开后加载摘要…

URL PDF HTML 收藏