arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-11 至 2026-03-11 共收录 75 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 16 篇

2603.09259 2026-03-11 cs.CV cs.RO 81%

Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos

从网络视频中隐式几何表示的视觉-语言导航

Mingfei Han, Haihong Hao, Liang Ma, Kamila Zhumakhanova, Ekaterina Radionova, Jingyi Zhang, Xiaojun Chang, Xiaodan Liang, Ivan Laptev

机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本研究提出基于网络视频的隐式几何表示方法,用于视觉-语言导航,通过提升数据利用率和鲁棒性,实现更广泛的应用。

Comments Extension of CVPR 2025 RoomTour3D with implicit geometric representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09113 2026-03-11 cs.RO cs.AI 81%

PM-Nav: Priori-Map Guided Embodied Navigation in Functional Buildings

PM-Nav:基于先验图的功能性建筑中具身导航

Jiang Gao, Xiangyu Dong, Haozhou Li, Haoran Zhao, Yaoming Zhou, Xiaoguang Ma

机构 * Faculty of Robot Science and Engineering at Northeastern University(东北大学机器人科学与工程学院) Foshan Graduate School of Innovation at Northeastern University(东北大学佛山创新研究生学院) School of Aeronautic Science and Engineering at Beihang University(北航航空科学与工程学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 PM-Nav通过构建先验图和多模型协作机制,提升了功能性建筑中的导航精度和效率。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09460 2026-03-11 cs.RO 79%

SEA-Nav: Efficient Policy Learning for Safe and Agile Quadruped Navigation in Cluttered Environments

SEA-Nav: 高效安全敏捷四足机器人在密集环境中导航的策略学习

Shiyi Chen, Mingye Yang, Haiyan Mao, Jiaqi Zhang, Haiyi Liu, Shuheng He, Debing Zhang, Zihao Qiu, Chun Zhang

机构 * Tsinghua University(清华大学) Imperial College London(伦敦帝国理工学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 SEA-Nav通过安全、高效和敏捷的强化学习框架,实现了在密集环境中四足机器人导航的高效训练,仅需分钟级训练时间。

Comments Project website: https://11chens.github.io/sea-nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09163 2026-03-11 cs.RO 79%

SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation

SPAN-Nav: 通用空间感知用于多功能视觉-语言导航

Jiahang Liu, Tianyu Xu, Jiawei Chen, Lu Yue, Jiazhao Zhang, Zhiyong Wang, Minghan Li, Qisheng Zhao, Anqi Li, Qi Su, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(北京人工智能研究院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 SPAN-Nav通过端到端模型和空间感知机制,在复杂环境中实现高效的视觉-语言导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09031 2026-03-11 cs.RO 79%

ImpedanceDiffusion: Diffusion-Based Global Path Planning for UAV Swarm Navigation with Generative Impedance Control

阻抗扩散:基于扩散的全局路径规划用于无人机群导航的生成阻抗控制

Faryal Batool, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Roohan Ahmed Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科夫科学与技术研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 ImpedanceDiffusion通过结合扩散模型和人工势场跟踪,实现无人机群在复杂环境中的可靠路径规划与自适应阻抗控制。

Comments This is paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08905 2026-03-11 cs.RO 79%

Proprioceptive Safe Active Navigation and Exploration for Planetary Environments

本体感知安全主动导航与探索用于行星环境

Matthew Y. Jiang, Feifei Qian, Shipeng Liu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 PSANE通过本体感知技术在未知变形环境中实现安全导航与探索,利用腿部与地形的交互信息提升地形可通行性评估与导航性能。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08837 2026-03-11 cs.HC 78%

NaviNote: Enabling In-situ Spatial Annotation Authoring to Support Exploration and Navigation for Blind and Low Vision People

NaviNote: 使现场空间标注创作成为支持盲人和低视力人群探索与导航的手段

Ruijia Chen, Yuheng Wu, Charlie Houseago, Filipe Gaspar, Filippo Aleotti, Dorian Gálvez-López, Oliver Johnston, Diego Mazala, Guillermo Garcia-Hernando, Maryam Bandukda, Gabriel Brostow, Jessica Van Brummelen

专题命中 具身导航 :navigation(title,abstract)

AI总结 NaviNote通过结合高精度视觉定位与代理架构,为盲人和低视力人群提供语音驱动的注释创作与导航支持,显著提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13338 2026-03-11 cs.RO cs.CV cs.LG 76%

CuriousBot: Interactive Mobile Exploration via Actionable 3D Relational Object Graph

CuriousBot: 通过可操作的3D关系物体图进行交互式移动探索

Yixuan Wang, Leonor Fermoselle, Tarik Kelestemur, Jiuguang Wang, Yunzhu Li

机构 * School of Engineering and Applied Science, Columbia University(工程与应用科学学院,哥伦比亚大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 具身导航 :robotics(abstract,comments);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 CuriousBot通过可操作的3D关系物体图实现交互式移动探索,优于仅依赖视觉-语言模型的方法。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L). Project Page: https://curiousbot.theaiinstitute.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10778 2026-03-11 cs.RO 70%

Asset-Centric Metric-Semantic Maps of Indoor Environments

以资产为中心的度量-语义地图:室内环境

Christopher D. Hsu, Pratik Chaudhari

机构 * Department of Electrical & Systems Engineering and General Robotics, Automation, Sensing and Perception (GRASP) Laboratory at the University of Pennsylvania(宾夕法尼亚大学电气与系统工程系及通用机器人、自动化、传感与感知(GRASP)实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出了一种以资产为中心的度量-语义地图方法,利用四足机器人和RGB-D数据构建室内环境的高精度表示,结合自然语言和网格信息,提升机器人场景理解和导航能力。

Comments 9 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09745 2026-03-11 cs.RO 57%

Caterpillar-Inspired Spring-Based Compressive Continuum Robot for Bristle-based Exploration

基于 caterpillar 的弹簧式压缩连续机器人用于 bristle 基探索

Zhixian Hu, Yu She, Juan Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(工业工程学院,普渡大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于 caterpillar 的弹簧式压缩连续机器人,用于受限空间探索,结合腱驱动和接触传感器实现高效表面感知与检查。

Comments Accepted by RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09147 2026-03-11 cs.RO 57%

Walking on Rough Terrain with Any Number of Legs

在粗糙地形上使用任意数量的腿行走

Zhuoyang Chen, Xinyuan Wang, Shai Revzen

机构 * University of Michigan(密歇根大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出了一种适用于多腿机器人在粗糙地形上行走的控制架构,结合了事件级联控制器与CPG控制器的特点,适用于多腿机器人。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09918 2026-03-11 eess.SY cs.SY 50%

Emergency Locator Transmitters in the Era of More Electric Aircraft: A Comprehensive Review of Energy, Integration and Safety Challenges

在更多电动飞机时代的紧急定位发射机:能量、集成与安全挑战的全面综述

Juana M. Martínez-Heredia, Adrián Portos, Marcel Štěpánek, Francisco Colodro

专题命中 具身导航 :navigation(abstract)

AI总结 本文综述了在更多电动飞机时代,紧急定位发射机在能量、集成和安全挑战方面的全面研究,探讨了其技术发展、关键里程碑及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24427 2026-03-11 cs.CL 50%

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

SynthWorlds: 用于语言模型中推理与知识分离的受控并行世界

Ken Gu, Advait Bhat, Mike A Merrill, Robert West, Xin Liu, Daniel McDuff, Tim Althoff

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) EPFL(苏黎世联邦理工学院) Google Research(谷歌研究)

专题命中 具身导航 :navigation(abstract)

AI总结 SynthWorlds通过构建两个结构相同的并行世界,分离语言模型的推理与知识能力,揭示了模型在仅依赖参数化知识和知识增强设置下的性能差异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 3 篇

2603.09951 2026-03-11 cs.LG cs.AI cs.SE 62%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09285 2026-03-11 cs.CV 57%

Learning Convex Decomposition via Feature Fields

通过特征场学习凸分解

Yuezhi Yang, Qixing Huang, Mikaela Angelina Uy, Nicholas Sharp

机构 * NVIDIA The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 本文提出通过特征场学习实现高质量的开放世界凸分解,解决了长期存在的凸分解问题,并实现了首个自监督学习的开放世界模型。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09656 2026-03-11 hep-th 50%

Kaluza-Klein mode mixing in braneworlds: constraints on scalar absorption and physical degrees of freedom

分支世界中的Kaluza-Klein模式混合:标量吸收和物理自由度的限制

Wen-Xuan Ma, Chun-E Fu

专题命中 具身推理 :world model(abstract)

AI总结 研究分支世界中Kaluza-Klein模式混合对标量吸收和物理自由度的影响,揭示混合对warp因子的限制及标量模式吸收机制的改变。

Comments 15 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 3 篇

2603.09542 2026-03-11 cs.RO 70%

NS-VLA: Towards Neuro-Symbolic Vision-Language-Action Models

NS-VLA:迈向神经符号视觉-语言-动作模型

Ziyue Zhu, Shangyang Wu, Shuai Zhao, Zhiqiu Zhao, Shengjie Li, Yi Wang, Fang Li, Haoran Luo

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 NS-VLA通过在线强化学习提出神经符号视觉-语言-动作模型,解决VLA在学习可重用原始构件、减少数据依赖和扩展探索能力方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01068 2026-03-11 cs.RO cs.LG 62%

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

制定你的策略!通过测试时的分布级组合改进扩散型或流型机器人策略

Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo

机构 * The University of Hong Kong(香港大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出无需训练的通用策略组合方法,通过测试时分布级组合提升机器人策略性能。

Comments Accepted to ICLR 2026. Project Page: https://sagecao1125.github.io/GPC-Site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09001 2026-03-11 astro-ph.IM 50%

Correcting Ionospheric Faraday Rotation for the VLA and MeerKAT

校正VLBA和MeerKAT的电离层法拉第旋转

Richard A. Perley, Bryan J. Butler, Eric W. Greisen, Benjamin V. Hugo, Evangelia Tremou, A. G. Willis

专题命中 机器人基础模型 :navigation(abstract)

AI总结 本文通过比较传统方法与ALBUS软件,校正VLBA和MeerKAT的电离层法拉第旋转测量误差,提高观测精度。

Comments Accepted for publication in ApJS

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 4 篇

2510.14830 2026-03-11 cs.RO cs.AI cs.LG 90%

RL-100: Performant Robotic Manipulation with Real-World Reinforcement Learning

RL-100:基于现实强化学习的高效机器人操作

Kun Lei, Huanyu Li, Dongjie Yu, Zhenyu Wei, Lingxiao Guo, Zhennan Jiang, Ziyu Wang, Shiyu Liang, Huazhe Xu

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);robot learning(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 RL-100通过结合扩散视觉-运动策略和截断PPO目标,实现了高效且鲁棒的现实机器人操作,展示了在多种任务中高达100%的成功率和良好的适应性。

Comments https://lei-kun.github.io/RL-100/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09237 2026-03-11 cs.RO 79%

MO-Playground: Massively Parallelized Multi-Objective Reinforcement Learning for Robotics

MO-Playground: 多目标强化学习的大规模并行化方法用于机器人学

Neil Janwani, Ellen Novoseller, Vernon J. Lawhern, Maegan Tucker

专题命中 模仿学习与强化学习 :robotics(title,abstract);分类 cs.RO

AI总结 MO-Playground通过GPU加速的多目标环境和MORLAX算法,实现大规模并行化多目标强化学习,显著提升复杂机器人任务中的帕累托最优策略学习效率。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12296 2026-03-11 cs.RO 79%

A robust and compliant robotic assembly control strategy for batch precision assembly task with uncertain fit types and fit amounts

一种鲁棒且顺应性的机器人批量精密装配控制策略用于具有不确定配合类型和配合量的精密装配任务

Bin Wang, Jiwen Zhang, Song Wang, Dan Wu

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于FVFC-MTRL框架的鲁棒且顺应性机器人装配控制策略,通过多任务强化学习和策略蒸馏方法提升精密装配任务的鲁棒性和成功率。

Journal ref IEEE Transactions on Automation Science and Engineering, vol. 23, pp. 5502-5515, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09331 2026-03-11 cs.LG 57%

Reward-Zero: Language Embedding Driven Implicit Reward Mechanisms for Reinforcement Learning

Reward-Zero: 语言嵌入驱动的隐式奖励机制用于强化学习

Heng Zhang, Haddy Alchaer, Arash Ajoudani, Yu She

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.LG

AI总结 Reward-Zero通过语言嵌入驱动的隐式奖励机制,提升强化学习的样本效率、泛化能力和可扩展性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2603.09226 2026-03-11 cs.RO 83%

TRIP-Bag: A Portable Teleoperation System for Plug-and-Play Robotic Arms and Leaders

TRIP-Bag:一种便携式遥控系统,用于即插即用的机械臂和领导者

Noboru Myers, Sankalp Yamsani, Obin Kwon, Joohyung Kim

机构 * KIMLAB (Kinetic Intelligent Machine LAB), University of Illinois Urbana-Champaign(KIM实验室(动能智能机器实验室),伊利诺伊大学厄巴纳-香槟分校)

专题命中 人机交互与遥操作 :robotic(title);robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 TRIP-Bag是一种便携式遥控系统,能够快速收集高保真操纵数据,适用于各种环境和非专家用户。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 16 篇

2505.20503 2026-03-11 cs.RO cs.AI cs.CL cs.CV cs.LG 86%

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

基于基础模型的具身AI在移动服务机器人中的应用:系统综述

Matthew Lisondra, Beno Benhabib, Goldie Nejat

专题命中 机器人数据与评测 :embodied AI(title,abstract);robotics(abstract,comments);分类 cs.RO、cs.AI、cs.CV

AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。

Comments v2: Expanded systematic review; resubmitted to Robotics

Journal ref Robotics 2026, 15(3), 55

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14932 2026-03-11 cs.RO cs.LG 84%

Robot Control Stack: A Lean Ecosystem for Robot Learning at Scale

机器人控制栈:一个用于大规模机器人学习的轻量生态系统

Tobias Jülg, Pierre Krack, Seongjin Bien, Yannik Blei, Khaled Gamal, Ken Nakahara, Johannes Hechtl, Roberto Calandra, Wolfram Burgard, Florian Walter

机构 * Department of Computer Science & Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系) Learning, Adaptive Systems and Robotics (LASR) Lab, Faculty of Computer Science, TU Dresden(德累斯顿技术大学计算机科学学院学习、适应系统与机器人实验室) Siemens Foundational Technologies, Siemens AG(西门子基础技术部,西门子股份公司) Chair for Robotics, Artificial Intelligence and Real-Time Systems, TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院机器人、人工智能与实时系统教授职位)

专题命中 机器人数据与评测 :robot learning(title,abstract);robotics(abstract);分类 cs.RO、cs.LG

AI总结 机器人控制栈(RCS)是一个为大规模机器人学习设计的轻量生态系统,通过模块化架构和统一接口,促进模拟到现实的迁移,并评估了多种策略在不同机器人上的性能。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09086 2026-03-11 cs.RO cs.AI cs.LG cs.MA cs.SY eess.SY 82%

Latent World Models for Automated Driving: A Unified Taxonomy, Evaluation Framework, and Open Challenges

潜在世界模型用于自动驾驶:一种统一的分类法、评估框架和开放挑战

Rongxiang Zeng, Yongqi Dong

机构 * RWTH Aachen University(亚琛工业大学) Delft University of Technology(代尔夫特理工大学)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出统一的潜在空间框架,整合自动驾驶世界模型的最新进展,探讨潜在表示的分类、评估方法及未来研究方向。

Comments 17 pages, 6 figures, under review by IEEE Transactions on Intelligent Transportation Systems (IEEE-T-ITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09218 2026-03-11 cs.RO cs.AI 81%

Embodied Human Simulation for Quantitative Design and Analysis of Interactive Robotics

具身人类仿真用于交互机器人定量设计与分析

Chenhui Zuo, Jinhao Xu, Michael Qian Vergnolle, Yanan Sui

机构 * School of Aerospace Engineering, Tsinghua University(清华大学航天航空学院)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于仿真的具身人类仿真框架,用于交互机器人设计中的定量分析与优化,通过生理学基础的运动行为生成和大规模设计空间探索,提升人机交互的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24235 2026-03-11 cs.RO cs.AI 81%

SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems

SafeGen-LLM: 提高机器人系统任务规划中的安全性泛化能力

Jialiang Fan, Weizhe Xu, Mengyu Liu, Oleg Sokolsky, Insup Lee, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 SafeGen-LLM通过两阶段框架提升机器人任务规划的安全性泛化能力,优于现有基线。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG 67%

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏