CVGL: Causal Learning and Geometric Topology
CVGL:因果学习与几何拓扑
机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 本文提出CLGT框架,通过因果特征提取器和几何拓扑融合模块解决跨视角地理定位中的混淆因素和视角差异问题,实验显示其在复杂真实场景中表现优异。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
CVGL:因果学习与几何拓扑
机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 本文提出CLGT框架,通过因果特征提取器和几何拓扑融合模块解决跨视角地理定位中的混淆因素和视角差异问题,实验显示其在复杂真实场景中表现优异。
基于上下文的船舶轨迹自然语言描述
专题命中 具身导航 :navigation(abstract);分类 cs.AI
AI总结 本文提出一种上下文感知的轨迹抽象框架,将AIS数据转化为结构化、语义丰富的表示,支持通过LLM生成受控自然语言描述,提升海洋任务的推理能力。
InterDeepResearch:通过交互式深度研究实现人机协作的信息检索
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出InterDeepResearch系统,通过交互式深度研究框架提升人机协作信息检索效率,实验证明其在性能和用户研究支持方面具有竞争力。
SAW:通过可控且可扩展的视频生成实现手术动作世界模型
机构 * Johns Hopkins University(约翰霍普金斯大学) ; NVIDIA
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。
Comments The manuscript is under review
看得不见就忘记了吗?评估视频世界模型中的状态演变
机构 * California Institute of Technology(加州理工学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文设计STEVO-Bench基准测试,评估视频世界模型能否脱离观察独立演进,揭示其在自然状态演变中的局限性。
VGGT-World:将VGGT转变为一个自回归的几何世界模型
机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) ; Beijing Jiaotong University(北京交通大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文提出VGGT-World,通过自回归方法预测冻结几何基础模型特征的时空演变,提升深度预测性能并提高效率。
给我所见的安全性如何?面向图像控制自主系统的校准安全性预测
机构 * Trustworthy Engineered Autonomy (TEA) Lab(可信工程自主性实验室)
专题命中 具身推理 :world model(abstract);分类 cs.RO
AI总结 本文提出一种校准的安全性预测框架,用于端到端视觉控制系统,解决部分可观测性和分布偏移下的安全性预测问题,通过无监督域适应和世界模型提升预测鲁棒性。
Comments arXiv admin note: text overlap with arXiv:2308.12252
超越模仿:用于自适应扩散导航策略的强化学习微调
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; A*STAR, Singapore(A*STAR,新加坡) ; National University of Singapore, Singapore(新加坡国立大学)
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO
AI总结 本文提出一种针对扩散导航的强化学习微调框架,通过Group Relative Policy Optimization提升策略适应性,在Isaac Sim中提升成功率和SPL,减少碰撞,展示出更强的零样本迁移能力和安全泛化能力。
SegDAC:通过动态物体令牌实现强化学习中的视觉泛化
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 SegDAC通过动态物体令牌实现强化学习中的视觉泛化,利用文本引导的分割生成物体掩码,并通过变换器处理动态令牌以保持空间信息,提升了在不同视觉条件下的性能。
Comments 12 pages
HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能
专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。
FLUX:通过校正流和静态到动态学习加速跨身体生成导航策略
专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO
AI总结 FLUX是首个基于流的统一导航策略,通过线性化概率流提升推理效率,结合静态到动态课程学习,在六个导航任务中取得最佳性能,并实现无调优的仿真到现实迁移。
Comments Project Page at this [Website](https://zeying-gong.github.io/projects/flux/)
基于技能图表示的机器人装配自主集成与改进
机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO
AI总结 本文提出基于技能图表示的机器人装配系统自主集成与持续改进框架,通过语义级规划与执行接口实现系统配置、执行、评估与学习的统一,提升装配系统的适应性与可重用性。
MotionAnymesh:基于物理的运动模拟数字双胞胎生成
专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。
Comments 5 figures
ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。
SortScrews:一种用于实时螺钉分类的数据集和基线
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Project Neura ; UTMIST ; Amplimit
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。
面向月球轨道近距操作的逼真数据集和基于视觉的异常检测算法
机构 * Space and Terrestrial Autonomous Robotic Systems (STARS) Laboratory at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)空间与地面自主机器人系统实验室) ; Toronto Robotics and AI Laboratory (TRAIL) at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航空航天研究所(UTIAS)多伦多机器人与人工智能实验室) ; MDA Space Inc.(MDA航天公司)
专题命中 机器人数据与评测 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO
AI总结 本文提出MRAD算法,通过月球轨道合成数据集ALLO实现空间域异常检测,展现算法在像素和图像层面的高检测性能,推动空间操作中鲁棒的异常检测方法发展。
Comments In IEEE Robotics and Automation Letters (RA-L) and presented at the IEEE International Conference on Robotics and Automation (ICRA'26), 1-5 Jun. 2026, Vienna, Austria
Journal ref IEEE Robotics and Automation Letters (RA-L), Vol. 11, No. 3, pp. 2418 - 2415, Mar. 2026
通过衰减残差策略优化实现高效的现实世界自主赛车
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出α-RPO方法,通过逐步衰减基础策略生成独立神经策略,减少系统复杂度并提升驾驶性能,适用于现实世界机器人部署。
重新思考视觉语言模型用于图像伪造检测与定位
机构 * Hefei University of Technology Key Laboratory of Knowledge Engineering with Big Data, Ministry of Education(合肥工业大学大数据知识工程重点实验室,教育部)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG
AI总结 本文研究如何利用视觉语言模型提升图像伪造检测与定位性能,发现传统先验知识对检测效果有负面影响,提出IFDL-VLM新方法,通过位置掩码增强模型可解释性,并在多个基准上取得新最优结果。
Comments 8pages
FC-Track: 重叠感知的在线多目标跟踪后关联修正
机构 * Graduate School of Engineering, Chiba University(Chiba大学工学研究科)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV
AI总结 FC-Track通过重叠感知的后关联修正方法,有效减少在线多目标跟踪中的身份切换问题,无需全局优化或重识别,实现在复杂动态环境下的高可靠性跟踪。
IGASA: 集成几何感知和跳过注意力模块的增强点云配准
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV
AI总结 本文提出IGASA框架,通过层次金字塔架构和HCLA、IGAR模块提升点云配准的鲁棒性和精度,实验表明其在多个基准数据集上优于现有方法。
AoI-FusionNet:在稀疏测距条件下基于UWB-IMU的年龄感知紧密耦合融合
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO
AI总结 本文提出AoI-FusionNet,通过直接融合UWB测距与IMU数据实现三维轨迹估计,采用年龄信息衰减模块和自适应注意力机制提升定位精度,通过数据增强策略提升模型鲁棒性。
利用机器学习早期检测海洋柴油机灾难性故障
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI
AI总结 本文提出一种基于随机森林的机器学习方法,通过分析传感器读数与预期值的偏差导数,提前检测柴油机灾难性故障,从而避免严重损失和危险事件。
CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像
机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) ; Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。
AVFakeBench: 一种面向AV-LMMs的综合性音频视频伪造检测基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 本文提出AVFakeBench,首个涵盖人类和通用主体的音频视频伪造检测基准,包含12K问题,涵盖七类伪造类型和四级标注,评估11种AV-LMMs及两种检测方法,展示其在伪造检测中的潜力与局限。
Comments The experimental results in this paper have been further improved and updated; the baseline results do not match existing results, therefore the paper needs to be retracted
审稿人:基于参考的音频视觉深度伪造检测
机构 * Division of Artificial Intelligence & Software, Ewha Womans University(人工智能与软件系,世女子大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 本文提出Referee方法,通过建模单次示例中说话者特定特征的关联一致性,实现跨数据集和语言的音频视觉深度伪造检测,达到99.4%的AUC表现。
Comments In Progress
一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; Northwestern Polytechnical University(西北工业大学) ; University of Macau(澳门大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。
Comments Accepted to CVPR 2026 main track
生物启发的多智能体群体密度控制 via 领导-跟随可塑性
专题命中 其他机器人 :robotics(abstract)
AI总结 本文提出一种生物启发的领导-跟随可塑性方法,用于多智能体群体的空间自组织控制,通过非线性偏微分方程建模群体密度,提供紧凑描述并保证稳态解的存在与局部稳定性。
Journal ref Volume 188, Automatica, 2026