arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61134 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22067 篇

2509.11839 2026-03-20 cs.RO cs.CV 81%

TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning

TrajBooster:通过轨迹中心学习提升双足人形机器人的整体操作

Jiacheng Liu, Pengxiang Ding, Qihang Zhou, Yuxuan Wu, Da Huang, Zimian Peng, Wei Xiao, Weinan Zhang, Lixin Yang, Cewu Lu, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 TrajBooster通过利用轮式人形数据提升双足VLA性能,采用末端执行器轨迹作为通用接口,通过仿真重定向和预训练实现高效任务执行,减少对同构数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21732 2026-03-10 cs.RO cs.CV 81%

Automated Pest Counting in Water Traps through Active Robotic Stirring for Occlusion Handling

通过主动机器人搅拌处理遮挡的水坑害虫自动计数

Xumin Gao, Mark Stevens, Grzegorz Cielniak

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过主动机器人搅拌处理遮挡问题,实现水坑害虫的自动计数,优化了计数精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04466 2026-03-06 cs.RO cs.LG 81%

Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation

动作-观察-重写:多模态编码代理作为机器人操作的上下文政策学习者

Vaishak Kumar

机构 * General Bionix, Inc.(通用生物交叉公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 AOR框架通过生成可执行代码使机器人操作策略学习无需演示或奖励工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03279 2026-03-04 cs.RO cs.CV 81%

ULTRA: Unified Multimodal Control for Autonomous Humanoid Whole-Body Loco-Manipulation

ULTRA:统一的多模态控制用于自主人形全身体姿Manipulation

Xialin He, Sirui Xu, Xinyao Li, Runpei Dong, Liuyu Bian, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 ULTRA通过统一多模态控制框架,实现了基于感知和高层任务规范的自主人形全身体姿Manipulation,优于传统跟踪方法。

Comments Project Page: https://ultra-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00835 2026-03-03 cs.RO cs.LG 81%

CAIMAN: Causal Action Influence Detection for Sample-efficient Loco-manipulation

CAIMAN:用于样本高效移动-操作的因果动作影响检测

Yuanchen Yuan, Jin Cheng, Núria Armengol Urpí, Stelian Coros

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 CAIMAN通过因果动作影响作为内在动机目标,提升腿部机器人在稀疏奖励下的样本效率和移动-操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01465 2026-03-03 cs.RO cs.AI 81%

Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining

非马尔可夫长时间 horizon 机器人操作 via 关键帧链

Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science and Technology of China(电子科学与技术大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出Keyframe-Chaining VLA框架,通过提取和链接关键历史帧,解决长horizon机器人操作中的非马尔可夫依赖问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23348 2026-03-03 cs.RO cs.CV 81%

Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts

为拟合物体操纵的物理常识知识而引入分析概念

Jiude Wei, Yuxuan Li, Cewu Lu, Jianhua Sun

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16863 2026-02-25 cs.RO cs.AI 81%

SimToolReal: An Object-Centric Policy for Zero-Shot Dexterous Tool Manipulation

SimToolReal: 一种面向零样本灵巧工具操作的对象中心策略

Kushal Kedia, Tyler Ga Wei Lum, Jeannette Bohg, C. Karen Liu

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 SimToolReal提出了一种通用的模拟到现实强化学习策略,通过程序生成多种工具状物体并训练单一策略,实现无需特定任务或物体训练的零样本灵巧工具操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19219 2026-02-24 cs.CV cs.LG 81%

Controlled Face Manipulation and Synthesis for Data Augmentation

可控面部操纵与合成用于数据增强

Joris Kirchner, Amogh Gudi, Marian Bittner, Chirag Raman

机构 * Vicarious Perception Technologies (VicarVision)(维卡里斯感知技术(VicarVision)) Delft University of Technology(代尔夫特理工大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种在语义潜在空间中进行可控面部操纵的方法,通过减少语义特征交织和去除噪声属性,提升AU检测器的准确性和解耦预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05844 2026-02-13 cs.GR cs.AI cs.RO 81%

DexterCap: An Affordable and Automated System for Capturing Dexterous Hand-Object Manipulation

DexterCap: 一种经济实惠且自动化的手部物体操作捕捉系统

Yutong Liang, Shiyi Xu, Yulong Zhang, Bowen Zhan, He Zhang, Libin Liu

机构 * Peking University(北京大学) School of Computer Science, Peking University(北京大学计算机学院) Tencent Robotics X(腾讯机器人实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 DexterCap是一种低成本的自动化手部物体操作捕捉系统,通过字符编码标记和自动重建流程,实现稳健的跟踪和细粒度手部-物体交互数据集DexterHand的构建。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08986 2026-02-11 cs.RO cs.LG 81%

ChicGrasp: Imitation-Learning based Customized Dual-Jaw Gripper Control for Delicate, Irregular Bio-products Manipulation

ChicGrasp:基于模仿学习的定制化双爪夹具控制用于精细、不规则生物产品操作

Amirreza Davar, Zhengtong Xu, Siavash Mahmoudi, Pouya Sohrabipour, Chaitanya Pallerla, Yu She, Wan Shou, Philip Crandall, Dongyi Wang

机构 * University of Arkansas(阿肯色大学) Purdue University(普渡大学)

专题命中 机器人操作 :manipulation(title);robot learning(abstract);分类 cs.RO、cs.LG

AI总结 ChicGrasp通过模仿学习实现定制化双爪夹具控制,有效提升对精细、不规则生物产品的操作效率。

Comments Submitted for journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05342 2026-02-10 cs.RO cs.AI 81%

Information-Theoretic Graph Fusion with Vision-Language-Action Model for Policy Reasoning and Dual Robotic Control

信息论图融合:基于视觉-语言-动作模型的政策推理与双臂机器人控制

Shunlei Li, Longsen Gao, Jin Wang, Chang Che, Xi Xiao, Jiuwen Cao, Yingbai Hu, Hamid Reza Karimi

机构 * Electrical and Computer Engineering Department, University of New Mexico, Albuquerque, United States, 87106(电气与计算机工程系,新墨西哥大学,阿尔伯克基,美国,87106) Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford, United Kingdom, OX26NN(动态机器人系统组,牛津机器人研究所,牛津大学,英国,OX26NN) Mechanical and Aerospace Engineering Department, The George Washington University, DC, United States, 22202(机械与航空航天工程系,乔治华盛顿大学,华盛顿特区,美国,22202) Department of Computer Science, University of Alabama at Birmingham, Alabama, United States, 35294(计算机科学系,阿拉巴马大学伯明翰分校,阿拉巴马,美国,35294) The School of Computation, Information and Technology, Technical University of Munich, Germany, 85748(计算、信息与技术学院,慕尼黑技术大学,德国,85748) Department of Mechanical Engineering, Politecnico di Milano, Milan, Italy, 20156(机械工程系,米兰理工学院,米兰,意大利,20156)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 GF-VLA通过信息论图融合视觉-语言-动作模型,实现双臂机器人任务推理与执行,提升空间泛化与任务成功率。

Comments Journal accepted by Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06504 2026-02-09 cs.RO cs.CV 81%

MultiGraspNet: A Multitask 3D Vision Model for Multi-gripper Robotic Grasping

MultiGraspNet:一种多任务3D视觉模型用于多机械手抓取

Stephany Ortuno-Chanelo, Paolo Rabino, Enrico Civitelli, Tatiana Tommasi, Raffaello Camoriano

机构 * VANDAL Laboratory, Department of Control and Computer Engineering, Politecnico di Torino(沃纳达实验室,控制与计算机工程系,都灵理工大学) Comau S.p.A., Advanced Automation Solutions(Comau S.p.A.,先进自动化解决方案) Istituto Italiano di Tecnologia(意大利技术研究所)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 MultiGraspNet是一种多任务3D视觉模型,通过统一框架同时预测平行和真空机械手的抓取姿态,提升机器人在复杂环境中的抓取能力和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22153 2026-01-30 cs.RO cs.CV 81%

DynamicVLA: A Vision-Language-Action Model for Dynamic Object Manipulation

DynamicVLA: 一种用于动态物体操控的视觉-语言-动作模型

Haozhe Xie, Beichen Wen, Jiarui Zheng, Zhaoxi Chen, Fangzhou Hong, Haiwen Diao, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 DynamicVLA通过整合时间推理和闭环适应,提出了一种用于动态物体操控的视觉-语言-动作模型,提升了响应速度和泛化能力。

Comments Project Page: https://www.infinitescript.com/project/dynamic-vla/ GitHub: https://github.com/hzxie/DynamicVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10111 2026-01-22 cs.CV cs.AI cs.CR 81%

Training-Free In-Context Forensic Chain for Image Manipulation Detection and Localization

无需训练的上下文取证链用于图像篡改检测与定位

Rui Chen, Bin Liu, Changtao Miao, Xinghao Wang, Yi Li, Tao Gong, Qi Chu, Nenghai Yu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 ICFC提出一种无需训练的多模态大语言模型框架,用于图像篡改检测与定位,通过可解释的推理流程实现高效且准确的图像分析。

Comments This version was uploaded in error and contains misleading information found in an early draft. The manuscript requires extensive and long-term revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12925 2026-01-21 cs.RO cs.AI 81%

ForeDiffusion: Foresight-Conditioned Diffusion Policy via Future View Construction for Robot Manipulation

ForeDiffusion: 通过未来视图构建实现机器人操作的前瞻性条件扩散策略

Weize Xie, Yi Ding, Ying He, Leilei Wang, Binwen Bai, Zheyi Zhao, Chenyang Wang, F. Richard Yu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 ForeDiffusion通过引入未来视图表示,改进机器人操作中的扩散策略,实现更稳定的性能和更高的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11742 2026-01-13 cs.CV cs.AI 81%

Safe Vision-Language Models via Unsafe Weights Manipulation

通过不安全权重操作实现安全的视觉-语言模型

Moreno D'Incà, Elia Peruzzo, Xingqian Xu, Humphrey Shi, Nicu Sebe, Massimiliano Mancini

机构 * University of Trento(特伦托大学) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出UWM方法,通过不训练的方式提升视觉-语言模型在不安全查询上的安全性,同时在安全输入上表现更优。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06222 2026-01-13 cs.CV cs.AI 81%

SAPL: Semantic-Agnostic Prompt Learning in CLIP for Weakly Supervised Image Manipulation Localization

SAPL: CLIP中基于语义无关的提示学习用于弱监督图像篡改定位

Xinghao Wang, Changtao Miao, Dianmo Sheng, Tao Gong, Qi Chu, Nenghai Yu, Quanchen Zou, Deyue Zhang, Xiangzheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 SAPL通过语义无关的提示学习和边缘信息利用,提升CLIP在弱监督图像篡改定位中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02778 2026-01-12 cs.RO cs.AI 81%

Closing the Reality Gap: Zero-Shot Sim-to-Real Deployment for Dexterous Force-Based Grasping and Manipulation

弥合现实差距:用于灵巧力控抓取与操作的零样本仿真到现实部署

Zhe Zhao, Haoyu Dong, Zhengmao He, Yang Li, Xinyu Yi, Zhibin Li

机构 * ByteDance Seed(字节跳动种子)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于仿真到现实强化学习的框架,通过触觉和扭矩传感结合建模,实现灵巧手在真实硬件上的可控抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06240 2026-01-06 cs.RO cs.AI 81%

Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation

基于 affordance 的粗到细探索用于开放词汇移动操控中的基座放置

Tzu-Jung Lin, Jia-Fong Yeh, Hung-Ting Su, Chung-Yi Lin, Yi-Ting Chen, Winston H. Hsu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于 affordance 的粗到细探索方法,通过结合视觉语言模型的语义理解和几何可行性,提升开放词汇移动操控中基座放置的成功率。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 81%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV、cs.LG

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17085 2025-12-24 cs.RO cs.LG 81%

Deformable Cluster Manipulation via Whole-Arm Policy Learning

通过全身政策学习实现可变形簇 manipulation

Jayadeep Jacob, Wenzheng Zhang, Houston Warren, Paulo Borges, Tirthankar Bandyopadhyay, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Data61, CSIRO(CSIRO数据61研究所) Orica(奥里卡公司) NVIDIA Corporation(NVIDIA公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于全身政策学习的方法,通过整合3D点云和本体感觉触觉信息,实现对可变形簇的高效操纵,并在输电线路清除任务中展示了零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19684 2025-12-23 cs.CV cs.RO 81%

Zero-shot Reconstruction of In-Scene Object Manipulation from Video

从视频中进行零样本场景物体操作重建

Dixuan Lin, Tianyou Wang, Zhuoyang Pan, Yufu Wang, Lingjie Liu, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Oxford(牛津大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于数据驱动模型的零样本方法,用于从视频中重建场景中的物体操作,通过两阶段优化实现手-物体运动的准确重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18987 2025-12-23 cs.RO cs.CL cs.CV 81%

Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation

语义可感知的多模态检索:基于具身记忆的层次化移动操作

Ryosuke Korekata, Quanting Xie, Yonatan Bisk, Komei Sugiura

机构 * Keio University(keio大学) Keio AI Research Center(keio人工智能研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本研究提出Affordance RAG框架,通过构建具有可操作性的具身记忆,提升机器人在开放词汇移动操作中的检索性能和任务成功率。

Comments Accepted to IEEE RA-L, with presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16103 2025-12-19 cs.LG cs.AI 81%

AIMM: An AI-Driven Multimodal Framework for Detecting Social-Media-Influenced Stock Market Manipulation

AIMM:一种基于人工智能的多模态框架,用于检测受社交媒体影响的股市操纵

Sandeep Neela

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 AIMM通过融合社交媒体和市场数据,提出了一种人工智能驱动的多模态框架,用于检测社交媒体影响的股市操纵,并展示了其在GME事件中的早期预警能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00866 2025-12-15 cs.RO cs.AI 81%

3DSGrasp: 3D Shape-Completion for Robotic Grasp

3DSGrasp:用于机器人抓取的3D形状补全

Seyed S. Mohammadi, Nuno F. Duarte, Dimitris Dimou, Yiming Wang, Matteo Taiana, Pietro Morerio, Atabak Dehban, Plinio Moreno, Alexandre Bernardino, Alessio Del Bue, Jose Santos-Victor

机构 * Vislab, Institute for Systems and Robotics—Lisboa, Instituto Superior Técnico, Universidade de Lisboa, Portugal(葡萄牙里斯本系统与机器人研究所Vislab,理工学院里斯本高等技术大学,里斯本大学) Department of Marine, Electrical, Electronic and Telecommunications Engineering, University of Genoa, Italy(意大利热那亚大学海洋、电气、电子与电信工程系) Pattern Analysis & Computer Vision (PAVIS), Istituto Italiano di Tecnologia (IIT), Genoa, Italy(意大利热那亚理工学院模式分析与计算机视觉(PAVIS)) Deep Visual Learning (DVL), Fondazione Bruno Kessler, Trento, Italy(意大利特伦托布鲁诺·凯瑟基金会深度视觉学习(DVL))

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 3DSGrasp通过基于Transformer的编码器-解码器网络实现3D点云补全,提升机器人抓取的准确性和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19086 2025-12-12 cs.RO cs.AI cs.GR 81%

MaskedManipulator: Versatile Whole-Body Manipulation

MaskedManipulator: 通用全身体姿操控

Chen Tessler, Yifeng Jiang, Erwin Coumans, Zhengyi Luo, Gal Chechik, Xue Bin Peng

机构 * NVIDIA Israel(NVIDIA以色列分公司) NVIDIA USA(NVIDIA美国分公司) NVIDIA Canada(NVIDIA加拿大分公司) Simon Fraser University Canada(西蒙·弗雷泽大学加拿大分校) NVIDIA Simon Fraser University(西蒙·弗雷泽大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 MaskedManipulator通过生成控制策略实现通用全身体姿操控,提供直观用户控制和复杂交互行为。

Comments SIGGRAPH Asia 2025 (Project page: https://research.nvidia.com/labs/par/maskedmanipulator/ )

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08580 2025-12-11 cs.RO cs.AI 81%

Mind to Hand: Purposeful Robotic Control via Embodied Reasoning

Mind to Hand: 通过具身推理实现目的性机器人控制

Peijun Tang, Shangjin Xie, Binyan Sun, Baifu Huang, Kuncheng Luo, Haotian Yang, Weiqi Jin, Jianan Wang

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 Lumo-1通过具身推理实现目的性机器人控制,结合视觉语言动作模型提升机器人推理与动作协调能力。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 81%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO 81%

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

专题命中 机器人操作 :embodied agent(title);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏