arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-12 至 2026-08-12 共收录 83 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 87%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 机器人学习 :robot learning(title,abstract);manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10600 2026-08-12 cs.RO cs.CV cs.LG 新提交 67%

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

BooST:桥接语义与运动以实现高效的技能迁移

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

机构 * Seoul National University(首尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 BooST是桥接语义与运动的两阶段框架,通过跨模态VQ-VAE生成统一技能表示并蒸馏为轻量级策略,在仿真与真实机器人场景下实现了更优的少样本适配、跨领域技能迁移及鲁棒性。

Comments Project page: https://boost-robots.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 26 篇

2603.19201 2026-08-12 cs.RO 版本更新 91%

OmniVTA: Visuo-Tactile World Modeling for Contact-Rich Robotic Manipulation

OmniVTA: 用于接触密集机械操作的视觉-触觉世界建模

Yuhang Zheng, Songen Gu, Yupeng Zheng, Weize Li, Yujie Zang, Shuai Tian, Xiang Li, Ce Hao, Chen Gao, Si Liu, Haoran Li, Yilun Chen, Shuicheng Yan, Wenchao Ding

机构 * TARS Robotics(TARS机器人实验室) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) CASIA(中国科学院自动化研究所) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Beihang University(北京航空航天大学)

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title);分类 cs.RO

AI总结 本文提出OmniVTA框架,结合预测接触建模与高频触觉反馈,通过大规模视觉-触觉-动作数据集提升接触密集操作的性能与泛化能力。

Comments Project Page: https://mrsecant.github.io/OmniVTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 81%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10718 2026-08-12 cs.RO 新提交 79%

TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4

用于自主可变形操作的TCAM:WBCD 2026赛道4的RMC2冠军系统

Guangrui Shen, Zhili He, Shigang Wang, Yuanjun Sun, Qing Yu

机构 * TermiTech(特米科技)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究围绕TCAM框架构建自主可变形操作系统,在WBCD 2026赛道4挑战赛中以平均23秒/件的速度完成25件T恤操作,22件达标,获赛道冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10166 2026-08-12 cs.CR cs.AI 新提交 79%

MarkNull: Model-Agnostic Watermark Removal in AI-Generated Images via On-Manifold Latent Manipulation

MarkNull:通过流形上潜在空间操纵实现AI生成图像的模型无关水印去除

Jie Cao, Qi Li, Zelin Zhang, Xiaodong Wu, Lingshuang Liu, Xiangman Li, Jianbing Ni

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI

AI总结 本文提出MarkNull及变体MarkNull-A,通过流形上潜在空间操纵实现AI生成图像的模型无关水印去除,可降低水印比特准确率至近随机猜测水平,还能破解谷歌SynthID-Image系统,为防御提供攻击检测机制。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18795 2026-08-12 cs.SI 版本更新 78%

Opinion Polarization in LLM-Based Social Networks: Manipulation and Mitigation

基于LLM的社交网络中的意见极化:操纵与缓解

Ali Safarpoor Dehkordi, Mohammad Shirzadi, Ahad N. Zehmakan

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究在基于大语言模型模拟的社交网络中,对手如何通过有限预算操纵意见极化,并评估两种防御机制(反应性和主动性)的效果,发现两者均无法完全恢复基线极化状态。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19696 2026-08-12 cs.RO cs.AI cs.LG 版本更新 78%

Diffusion-Based Impedance Learning for Contact-Rich Manipulation Tasks

基于扩散的阻抗学习用于接触丰富的操作任务

Noah Geiger, Tamim Asfour, Neville Hogan, Johannes Lachner

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(人机动力学与机器人研究所,卡尔斯鲁厄技术大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑与认知科学系,麻省理工学院)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出基于扩散的阻抗学习框架,结合生成建模与能量一致的阻抗控制,实现接触丰富的操作任务中的高精度动态控制与任务泛化能力。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10232 2026-08-12 cs.RO cs.AI cs.LG 新提交 75%

FACT: Failure-Aware Causal Training for World-Action Models

FACT:面向世界-动作模型的故障感知因果训练方法

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 FACT是一种故障感知因果世界-动作模型,通过将错误动作转化为训练目标,在模拟与真实双臂操作任务中提升了世界-动作模型的性能,减少了成功偏差导致的未来幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10115 2026-08-12 cs.HC cs.SI 新提交 71%

Outer Limits: An Experimental Approach to Controlled Content Manipulation within the Reddit Interface

Outer Limits:Reddit界面内受控内容操纵的实验方法

Chenchen Mao, Hanjing Shi, Haiyan Jia, Daniel Unhuryan, Eric Baumer, Dominic DiFranzo

专题命中 机器人操作 :manipulation(title)

AI总结 本研究提出Outer Limits系统,可在旧版Reddit界面内开展受控内容实验,经219人研究验证其感知保真度达标,兼具内容控制、现有界面及隔离实验内容的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01880 2026-08-12 cs.RO 版本更新 70%

World Action Models in Real Time: An Empirical Study of Smooth Execution via Asynchronous Deployment

实时世界动作模型:通过异步部署实现平滑执行的实证研究

Motubrain Team

机构 * Motubrain Team(Motubrain团队)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文针对世界动作模型推理延迟导致机器人执行不连续的问题,通过10Hz双机械臂机器人对比6种异步部署策略,发现前缀条件生成可在任务性能、速度与平滑度间实现最佳平衡,为高延迟世界动作模型的实时部署提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09089 2026-08-12 cs.CV cs.AI 版本更新 62%

Field-Localized Forgery Detection for Digital Identity Documents

用于数字身份文档的字段局部伪造检测

Abhishek Kumar, Riya Tapwal, Carsten Maple, Mark Hooper

机构 * The Alan Turing Institute(艾伦·图灵研究所) IIT Mandi(曼迪理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出FLiD框架,通过局部化关键身份字段来检测伪造,实现高准确率和低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10997 2026-08-12 cs.RO 新提交 57%

Seeing above the waves: A modular sensing framework for data acquisition at sea

洞察海面之上:一种用于海上数据采集的模块化感知框架

Jonathan E. Schmidt, Julius Wirbel, P. Nicholas Hansen, Morgan Louédec, Christian L. H. Westerdahl, Dimitrios Dagdilelis, Roberto Galeazzi

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO

AI总结 针对海洋环境下水面船只自主性研发中的传感器数据采集难题,提出融合多模态传感器的模块化平台,依托ROS2框架实现长时数据采集与可复现性,为自主海洋导航提供标准化数据集基础。

Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10920 2026-08-12 cs.AI 新提交 57%

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

IO Factory:大规模模拟AI驱动的影响力行动

Lukasz Olejnik, Wenchao Dong, Jonas R. Kunst, Signe Riemer-Sørensen, Tobias Herb, Meeyoung Cha, Daniel Thilo Schroeder

机构 * King’s College London(伦敦国王学院) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) BI Norwegian Business School(挪威商学院) University of Oslo(奥斯陆大学) SINTEF Digital(SINTEF数字研究所) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 IO Factory是AI驱动的大规模影响力行动模拟框架,可在受控平台中关联多环节数据,在10万智能体配置下可执行行动并生成可检查证据,支持可重复研究与红队分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10870 2026-08-12 cs.CV 新提交 57%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10716 2026-08-12 cs.SD cs.AI cs.CL 新提交 57%

DuplexWorld: Can voice agents help you get through the day?

DuplexWorld:语音智能体能帮你度过一天吗?

Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli, Asif Shaik, Abhishek Mukherji, Dinesh Manocha

机构 * Centific Global Solutions Inc.(森蒂菲克全球解决方案公司) University of Maryland(马里兰大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 DuplexWorld针对现有语音智能体评估基准的不足,构建含六大领域的156个场景开展评估,发现现有最优语音智能体在多维度仍有较大改进空间,并分析了相关性能与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10405 2026-08-12 cs.SD cs.AI 新提交 57%

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

永不停止说话:针对端到端语音语言模型的拒绝服务攻击

Shuozhe Cheng, Kunlan Xiang, Mingxuan Li, Ji Zhang, Dongxiao Liu, Wenbo Jiang

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究针对端到端语音语言模型提出基于扰动的拒绝服务攻击,通过优化声学扰动抑制EOS生成以延长解码,在三类开源模型上验证了其攻击有效性及安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11025 2026-08-12 cs.CL 新提交 50%

Data Attribution of Emergent Misalignment with Persona Features

基于角色特征的涌现失配数据归因

Clemens Vetter, David Kaczér, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10645 2026-08-12 eess.SY cs.SY 新提交 50%

AIDC Microgrid Vulnerability Assessment Under Computing-Power Coordinated Attacks

算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估

Ze Yu, Hongwei Zhen, Chao Shen, Mingyang Sun

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10942 2026-08-12 quant-ph 新提交 50%

Enhanced two-photon blockade without cascade channel by Stark nonlinear coupling

利用斯塔克非线性耦合实现无级联通道的增强型双光子阻塞

Zu-Jian Ying, Hang-Hang Han

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出用斯塔克非线性耦合增强无级联通道的非常规双光子阻塞,将其窗口拓宽至整个强耦合区、阻塞程度加深两个数量级,为双光子阻塞操控提供实用方案。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10998 2026-08-12 physics.optics physics.acc-ph physics.comp-ph 新提交 50%

Non-resonant laser-driven narrowing of particle velocity distributions

非共振激光驱动的粒子速度分布窄化

Ashwini Vaishnav, Matthias Rupp, Olivier De Castro, Mikhail N. Shneider, Alexandros Gerakis

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文以中性铯原子为例,通过数值研究提出一种光学斯塔克减速的作用机制,可窄化粒子集合围绕平均速度的速度分布,相关发现对光学操控等领域有潜在意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10310 2026-08-12 cond-mat.mes-hall 新提交 50%

Nanoscale imaging of ferromagnetic vortex dynamics with scanning NV magnetometry

基于扫描NV磁力计的铁磁涡旋动力学的纳米级成像

Jeffrey Rable, Jyotirmay Dwivedi, Nitin Samarth, Paul Stevenson, Arun Bansil, Swastik Kar

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究利用扫描NV磁力计实现了约50 nm空间分辨率的铁磁涡旋静态场与微波场成像,揭示了无序对微波倏逝衰减的影响,其技术分辨率优于衍射极限技术,可用于磁子器件研发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22458 2026-08-12 cs.DL 版本更新 50%

Opening Pandora's box: Paper mills in conference proceedings

打开普罗米修斯之盒:会议论文中的论文工厂

Anna Abalkina, Marie Kunešová, Yagmur Ozturk, Solal Pirelli

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过分析社交媒体上的论文销售信息,发现会议论文中存在大量论文工厂,涉及合作异常、 affiliations 多样性、引用操纵等问题,揭示了科研生态系统的严重问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 50%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05835 2026-08-12 cs.CR 版本更新 50%

Devlore: Device Interrupt Protection for Confidential VMs

Devlore:用于保密虚拟机的设备中断保护

Andrin Bertschi, Supraja Sridhara, Mark Kuhne, Benedict Schlüter, Friederike Groschupp, Clément Thorens, Nicolas Dutly, Srdjan Capkun, Shweta Shinde

专题命中 机器人操作 :manipulation(abstract)

AI总结 Devlore通过委托但检查策略,隔离设备中断攻击,保护保密虚拟机的机密性与完整性,实验显示其在实际应用中具有可行性且开销极低。

Comments Two-column extended version of the paper published at RAID 2026. This version supersedes previous arXiv versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09529 2026-08-12 econ.TH 版本更新 50%

Optimal Rating Design under Moral Hazard

在道德风险下的最优评级设计

Maryam Saeedi, Ali Shourideh

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究在道德风险和战略操纵下最优评级设计,通过收益函数凹化确定最优评级策略,并探讨不同风险活动对评级策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14464 2026-08-12 econ.EM stat.ME 版本更新 50%

Donut Regression Discontinuity Designs

环形断点回归设计

Cladia Noack, Chistoph Rothe

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文在局部线性估计框架内对环形断点回归设计开展理论分析,推导了其点估计、推断与设定检验的新结果,明确了环形截断对估计量偏差方差的影响及对应推断方法,还通过实证应用验证了结论。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 18 篇

2608.08323 2026-08-12 cs.RO cs.SY eess.SY 版本更新 80%

MPPI Planning with Gaussian-Based Human Cost Function for Social Navigation

基于高斯人类代价函数的MPPI规划用于社交导航

Chinmay Mundane

机构 * VJTI(维杰拉吉·鲁勒学院(VJTI))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 该研究针对普通MPPI规划低估动态场景风险的问题,提出PGIF方法,结合高斯排斥场实现0%碰撞率,同时保持实时规划性能,适用于社交导航。

Comments Will appear in Springer's Proceedings in Advanced Robotics series

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11175 2026-08-12 cs.RO cs.SY eess.SY 新提交 79%

Risk-Aware Kinodynamic Motion Planning Under Uncertainty For Safe Navigation on Planetary Environments

行星环境安全导航下考虑不确定性的风险感知动力学运动规划

Sachin Sunil Kelkar, Tanmay Dokania, Yashwanth Kumar Nakka

机构 * Daniel Guggenheim School of Aerospace Engineering(丹尼尔·古根海姆航空航天工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身导航 :navigation(title);robotic(abstract);分类 cs.RO

AI总结 针对自主空间探索中环境交互与感知系统的不确定性导致的安全规划问题,提出结合AO-RRT采样规划与序列凸规划的风险感知动力学运动规划方法,可将轨迹风险降低约97%。

Comments 3 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏