arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-31 至 2026-03-31 共收录 31 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 31 篇

2509.22578 2026-03-31 cs.RO 88%

EgoDemoGen: Egocentric Demonstration Generation for Viewpoint Generalization in Robotic Manipulation

EgoDemoGen:用于机器人操作中视角泛化的眼动演示生成

Yuan Xu, Jiabing Yang, Xiaofeng Wang, Yixiang Chen, Zheng Zhu, Bowen Fang, Guan Huang, Xinze Chen, Yun Ye, Qiang Zhang, Peiyan Li, Xiangnan Wu, Kai Wang, Bing Zhan, Shuo Lu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) GigaAI Tsinghua University(清华大学) X-Humanoid FiveAges

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出EgoDemoGen框架,通过EgoTrajTransfer和EgoViewTransfer生成新型眼动视角下的观察-动作演示,提升机器人操作在视角变化下的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28010 2026-03-31 cs.AI 83%

HeteroHub: An Applicable Data Management Framework for Heterogeneous Multi-Embodied Agent System

HeteroHub:一种适用于异构多具身代理系统的数据管理框架

Xujia Li, Xin Li, Junquan Huang, Beirong Cui, Zibin Wu, Lei Chen

机构 * HKUST(香港科技大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);embodied AI(abstract);分类 cs.AI

AI总结 本文提出HeteroHub框架,整合静态元数据、任务对齐训练语料和实时数据流,支持任务感知模型训练和闭环控制,实现复杂任务的协调执行。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26757 2026-03-31 cs.RO 83%

Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?

超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们

Boyang Cai, Qiwei Liang, Jiawei Li, Shihang Weng, Zhaoxin Zhang, Tao Lin, Xiangyu Chen, Wenjie Zhang, Jiaqi Mao, Weisheng Xu, Bin Yang, Jiaming Liang, Junhao Cai, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing Jiaotong University(北京交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26730 2026-03-31 cs.RO 83%

Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming

为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示

Sanjay Oruganti, Sergei Nirenburg, Marjorie McShane, Jesse English, Michael Roberts, Christian Arndt, Ramviyas Parasuraman, Luis Sentis

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(title);embodied AI(abstract);robotic(abstract);分类 cs.RO

AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27029 2026-03-31 cs.CV cs.LG 81%

YOLO Object Detectors for Robotics -- a Comparative Study

用于机器人视觉的YOLO目标检测器——一项比较研究

Patryk Niżeniec, Marcin Iwanowski, Marcin Gahbler

机构 * Nicolaus Copernicus University in Toruń(托伦尼古拉·哥白尼大学)

专题命中 机器人数据与评测 :robotics(title);robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文比较了不同YOLO版本在机器人工作空间目标检测中的适用性,通过自定义数据集和COCO2017数据集进行实验,评估了不同训练测试配置和模型的鲁棒性。

Journal ref PAR (Pomiary Automatyka Robotyka), R. 30, Nr 1/2026, 117-126

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV 80%

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10655 2026-03-31 cs.SE cs.RO 74%

Assessing Vision-Language Models for Perception in Autonomous Underwater Robotic Software

评估用于自主水下机器人软件中的视觉-语言模型感知能力

Muhammad Yousaf, Aitor Arrieta, Shaukat Ali, Paolo Arcaini, Shuai Wang

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆城市大学) Mondragon University(蒙德拉贡大学) National Institute of Informatics(国立信息学研究所) Det norske Veritas (DNV)(挪威船级社(DNV))

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 本文评估了视觉-语言模型在自主水下机器人软件中的感知性能,通过计算性能和不确定性来指导软件工程师选择合适的模型。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV 73%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28475 2026-03-31 cs.RO 70%

Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-Shot Real-World Deployment

Tac2Real: 可靠且用于在线强化学习和零样本现实部署的GPU视觉触觉模拟

Ningyu Yan, Shuai Wang, Xing Shen, Hui Wang, Hanqing Wang, Yang Xiang, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Algorithms of Machine Learning and Autonomous Driving Research Lab, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(机器学习与自动驾驶算法研究实验室,香港科技大学深圳-香港协同创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出Tac2Real框架,结合PNCG-IPC方法和多GPU并行架构,实现高效的在线强化学习训练,并通过TacAlign方法减少领域间隙,验证了在现实场景中高成功率的零样本迁移。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 70%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27923 2026-03-31 cs.CV 70%

ForestSim: A Synthetic Benchmark for Intelligent Vehicle Perception in Unstructured Forest Environments

ForestSim:智能车辆在无结构森林环境中的合成基准

Pragat Wagle, Zheng Chen, Lantao Liu

机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University(印第安纳大学卢迪信息学、计算与工程学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出ForestSim,一个高保真合成数据集,用于训练和评估智能车辆在森林环境中的语义分割模型,涵盖25种不同环境,支持自主导航。

Journal ref 2026 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27429 2026-03-31 cs.CV 70%

Mind the Shape Gap: A Benchmark and Baseline for Deformation-Aware 6D Pose Estimation of Agricultural Produce

注意形状差距:一种用于农业产品的变形感知6D姿态估计的基准和基线

Nikolas Chatzis, Angeliki Tsinouka, Katerina Papadimitriou, Niki Efthymiou, Marios Glytsos, George Retsinas, Paris Oikonomou, Gerasimos Potamianos, Petros Maragos, Panagiotis Paraskevas Filntisis

机构 * Robotics Institute, Athena Research Center(雅典娜研究中心机器人研究所) HERON - Hellenic Robotics Center of Excellence(HERON - 希腊机器人卓越中心) School of Electrical & Computer Engineering, NTUA(国立雅典理工大学电气与计算机工程学院) Music Technology, New York University(纽约大学音乐技术系) Department of Electrical & Computer Engineering, UTH(色萨利大学电气与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出PEAR基准和SEED框架,解决农业产品变形导致的6D姿态估计难题,展示现有方法性能下降,并证明显式形状建模对农业机器人可靠姿态估计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27344 2026-03-31 cs.CV 70%

TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR

TerraSeg: 任意LiDAR的自监督地面分割

Ted Lentsch, Santiago Montiel-Marín, Holger Caesar, Dariu M. Gavrila

机构 * Delft University of Technology(代尔夫特理工大学) University of Alcalá(阿尔卡拉大学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 TerraSeg通过自监督学习实现任意LiDAR的地面分割,利用大规模统一数据集OmniLiDAR提升泛化能力,无需人工标注即可在多个数据集上取得最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 70%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26685 2026-03-31 cs.RO cs.AI cs.CV cs.LG 70%

Contextual Graph Representations for Task-Driven 3D Perception and Planning

基于任务驱动的3D感知与规划的上下文图表示

Christopher Agia

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文研究了现有具身AI环境在机器人任务规划与3D场景图交集中的适用性,构建了评估现有经典规划器的基准,并探索图神经网络在规划领域关系结构不变性中的应用。

Comments University of Toronto Undergraduate Thesis, 2021. 85 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 67%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18532 2026-03-31 cs.RO cs.AI cs.LG 67%

Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds

在生成3D世界中扩展机器人视觉语言动作的强化学习

Andrew Choi, Xinjie Wang, Zhizhong Su, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 62%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27533 2026-03-31 cs.CV cs.AI 62%

Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation

Demo-Pose: 深度-单目模态融合用于物体姿态估计

Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim

机构 * Samsung Electronics Suwon, Republic of Korea(三星电子水原,韩国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Demo-Pose,通过新颖的多模态融合策略融合单目语义特征与基于深度的图卷积表示,提升物体姿态估计的几何推理能力,在REAL275数据集上优于现有方法。

Comments Accepted at ICASSP 2026, 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27441 2026-03-31 cs.CV cs.AI 62%

Evaluating Large and Lightweight Vision Models for Irregular Component Segmentation in E-Waste Disassembly

评估大型和轻量级视觉模型在电子废弃物拆解中不规则组件分割的应用

Xinyao Zhang, Chang Liu, Xiao Liang, Minghui Zheng, Sara Behdad

机构 * Florida State University(佛罗里达州立大学) Texas A&M University(德克萨斯农工大学) University of Florida(佛罗里达大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文通过比较SAM2和YOLOv8模型,评估了模型架构和规模对分割性能的影响,发现YOLOv8在精度和边界精度上优于SAM2,但SAM2在表示多样物体结构上更灵活。

Comments Accepted at ASME MSEC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 62%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17817 2026-03-31 cs.CV cs.RO 62%

Learning Underwater Active Perception in Simulation

在模拟中学习水下主动感知

Alexandre Cardaillac, Donald G. Dansereau

机构 * Australian Centre For Robotics(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering(航空航天、机械与机电工程学院) University of Sydney(悉尼大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种高效方法,通过多层感知机预测图像质量,以在不同水况下获取高质量资产图像,提升了视觉覆盖和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28429 2026-03-31 cs.AR cs.AI 57%

AceleradorSNN: A Neuromorphic Cognitive System Integrating Spiking Neural Networks and DynamicImage Signal Processing on FPGA

AceleradorSNN:一种集成脉冲神经网络和动态图像信号处理的类脑认知系统

Daniel Gutierrez, Ruben Martinez, Leyre Arnedo, Antonio Cuesta, Soukaina El Hamry

机构 * Intigia R\&D Department Alicante, Spain

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 为实现自主系统中的高速低延迟高效目标检测,提出AceleradorSNN系统,整合脉冲神经网络与动态图像信号处理,通过FPGA实现实时流式图像处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28224 2026-03-31 cs.CV 57%

Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal

Ghost-FWL: 一种大规模全波形激光雷达数据集用于鬼影检测与去除

Kazuma Ikeda, Ryosei Hara, Rokuto Nagata, Ozora Sako. Zihao Ding, Takahiro Kado, Ibuki Fujioka, Taro Beppu, Mariko Isogawa, Kentaro Yoshioka

机构 * Keio University(庆应义塾大学) Sony Semiconductor Solutions(索尼半导体解决方案)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出Ghost-FWL数据集,用于解决移动激光雷达中鬼影点的检测与去除问题,通过全波形激光雷达数据提升3D映射和定位精度,实验表明其在SLAM和目标检测任务中效果显著。

Comments Accepted to CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28092 2026-03-31 cs.LG 57%

InkDrop: Invisible Backdoor Attacks Against Dataset Condensation

InkDrop: 针对数据集压缩的不可见后门攻击

He Yang, Dongyi Lv, Song Ma, Wei Xi, Zhi Wang, Hanlin Gu, Yajie Wang

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文提出InkDrop,一种针对数据集压缩的隐蔽后门攻击方法,通过利用模型决策边界附近的不确定性,实现对压缩数据集的高效且隐蔽的恶意操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24257 2026-03-31 cs.CV 57%

Memory-Augmented Vision-Language Agents for Persistent and Semantically Consistent Object Captioning

具有记忆增强的视觉-语言代理用于持久且语义一致的对象描述

Tommaso Galliena, Stefano Rosa, Tommaso Apicella, Pietro Morerio, Alessio Del Bue, Lorenzo Natale

机构 * Italian Institute of Technology, Genoa, Italy(意大利理工学院,热那亚,意大利) University of Genoa, Genoa, Italy(热那亚大学,热那亚,意大利)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 本文提出一种统一的记忆增强视觉-语言代理,通过单一自回归框架同时处理数据关联、对象描述和探索策略,提升持久且语义一致的对象描述能力。

Comments 24 pages, 7 figures, 7 tables (including Supplementary Materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15109 2026-03-31 cs.SI cs.AI cs.CY cs.HC cs.MA 57%

An Agentic Operationalization of DISARM for FIMI Investigation on Social Media

针对FIMI调查的社会媒体的代理操作化DISARM

Kevin Tseng, Juan Carlos Toledano, Bart De Clerck, Yuliia Dukach, Phil Tinn

机构 * Center of Research Acquisition National Institute of Cyber Security Taipei City, Taiwan Department of Mathematics Royal Military Academy Brussels, Belgium Research Division OpenMinds Ltd. Kyiv, Ukraine Department of Sustainable Communication Technologies SINTEF Oslo, Norway (Corresponding Author)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的DISARM操作化框架,用于社会媒体上的FIMI调查。通过整合通用代理AI组件,实现对社交媒体数据中操纵性行为的识别和映射,提升分析效率和可解释性。

Comments This paper was originally presented at the International Conference on Military Communication and Information Systems (ICMCIS), organized by the Information Systems Technology (IST) Scientific and Technical Committee, IST-224-RSY---the ICMCIS, held in Bath, United Kingdom, 12-13 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20770 2026-03-31 cs.CV 57%

OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective

OccuFly:一种用于从空中视角进行语义场景补全的3D视觉基准

Markus Gross, Sai B. Matha, Aya Fahmy, Rui Song, Daniel Cremers, Henri Meess

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出OccuFly基准,通过无LiDAR相机数据生成框架,提供21类语义的20000+样本,评估视觉模型在空中场景中的局限性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO 57%

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏