arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-12 至 2026-08-12 共收录 44 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2608.11204 2026-08-12 cs.RO cs.AI cs.CV 新提交 87%

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Surgical WAM:面向数据高效型手术机器人学习的世界-动作模型

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

专题命中 机器人学习 :robot learning(title,abstract);manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Surgical WAM模型,通过无动作视频预训练结合带动作标注数据微调,在四项模拟手术操纵任务中将平均成功率从63.5%提至77.8%,为数据高效的手术机器人学习提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10600 2026-08-12 cs.RO cs.CV cs.LG 新提交 67%

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

BooST:桥接语义与运动以实现高效的技能迁移

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

机构 * Seoul National University(首尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 BooST是桥接语义与运动的两阶段框架,通过跨模态VQ-VAE生成统一技能表示并蒸馏为轻量级策略,在仿真与真实机器人场景下实现了更优的少样本适配、跨领域技能迁移及鲁棒性。

Comments Project page: https://boost-robots.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 16 篇

2608.10756 2026-08-12 cs.RO cs.CV 新提交 81%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10718 2026-08-12 cs.RO 新提交 79%

TCAM for Autonomous Deformable Manipulation: The RMC2 Champion System for WBCD 2026 Track 4

用于自主可变形操作的TCAM:WBCD 2026赛道4的RMC2冠军系统

Guangrui Shen, Zhili He, Shigang Wang, Yuanjun Sun, Qing Yu

机构 * TermiTech(特米科技)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究围绕TCAM框架构建自主可变形操作系统,在WBCD 2026赛道4挑战赛中以平均23秒/件的速度完成25件T恤操作,22件达标,获赛道冠军。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10166 2026-08-12 cs.CR cs.AI 新提交 79%

MarkNull: Model-Agnostic Watermark Removal in AI-Generated Images via On-Manifold Latent Manipulation

MarkNull:通过流形上潜在空间操纵实现AI生成图像的模型无关水印去除

Jie Cao, Qi Li, Zelin Zhang, Xiaodong Wu, Lingshuang Liu, Xiangman Li, Jianbing Ni

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI

AI总结 本文提出MarkNull及变体MarkNull-A,通过流形上潜在空间操纵实现AI生成图像的模型无关水印去除,可降低水印比特准确率至近随机猜测水平,还能破解谷歌SynthID-Image系统,为防御提供攻击检测机制。

Comments Accepted to the 35th USENIX Security Symposium (USENIX Security 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10232 2026-08-12 cs.RO cs.AI cs.LG 新提交 75%

FACT: Failure-Aware Causal Training for World-Action Models

FACT:面向世界-动作模型的故障感知因果训练方法

Quanquan Peng, Yutong Liang, Rui Yan, Nicklas Hansen, Xiaolong Wang

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 FACT是一种故障感知因果世界-动作模型,通过将错误动作转化为训练目标,在模拟与真实双臂操作任务中提升了世界-动作模型的性能,减少了成功偏差导致的未来幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10115 2026-08-12 cs.HC cs.SI 新提交 71%

Outer Limits: An Experimental Approach to Controlled Content Manipulation within the Reddit Interface

Outer Limits:Reddit界面内受控内容操纵的实验方法

Chenchen Mao, Hanjing Shi, Haiyan Jia, Daniel Unhuryan, Eric Baumer, Dominic DiFranzo

专题命中 机器人操作 :manipulation(title)

AI总结 本研究提出Outer Limits系统,可在旧版Reddit界面内开展受控内容实验,经219人研究验证其感知保真度达标,兼具内容控制、现有界面及隔离实验内容的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10997 2026-08-12 cs.RO 新提交 57%

Seeing above the waves: A modular sensing framework for data acquisition at sea

洞察海面之上:一种用于海上数据采集的模块化感知框架

Jonathan E. Schmidt, Julius Wirbel, P. Nicholas Hansen, Morgan Louédec, Christian L. H. Westerdahl, Dimitrios Dagdilelis, Roberto Galeazzi

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO

AI总结 针对海洋环境下水面船只自主性研发中的传感器数据采集难题,提出融合多模态传感器的模块化平台,依托ROS2框架实现长时数据采集与可复现性,为自主海洋导航提供标准化数据集基础。

Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10920 2026-08-12 cs.AI 新提交 57%

IO Factory: Simulating AI-Enabled Influence Campaigns at Scale

IO Factory:大规模模拟AI驱动的影响力行动

Lukasz Olejnik, Wenchao Dong, Jonas R. Kunst, Signe Riemer-Sørensen, Tobias Herb, Meeyoung Cha, Daniel Thilo Schroeder

机构 * King’s College London(伦敦国王学院) Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所) BI Norwegian Business School(挪威商学院) University of Oslo(奥斯陆大学) SINTEF Digital(SINTEF数字研究所) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 IO Factory是AI驱动的大规模影响力行动模拟框架,可在受控平台中关联多环节数据,在10万智能体配置下可执行行动并生成可检查证据,支持可重复研究与红队分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10870 2026-08-12 cs.CV 新提交 57%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10716 2026-08-12 cs.SD cs.AI cs.CL 新提交 57%

DuplexWorld: Can voice agents help you get through the day?

DuplexWorld:语音智能体能帮你度过一天吗?

Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli, Asif Shaik, Abhishek Mukherji, Dinesh Manocha

机构 * Centific Global Solutions Inc.(森蒂菲克全球解决方案公司) University of Maryland(马里兰大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 DuplexWorld针对现有语音智能体评估基准的不足,构建含六大领域的156个场景开展评估,发现现有最优语音智能体在多维度仍有较大改进空间,并分析了相关性能与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10405 2026-08-12 cs.SD cs.AI 新提交 57%

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

永不停止说话:针对端到端语音语言模型的拒绝服务攻击

Shuozhe Cheng, Kunlan Xiang, Mingxuan Li, Ji Zhang, Dongxiao Liu, Wenbo Jiang

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究针对端到端语音语言模型提出基于扰动的拒绝服务攻击,通过优化声学扰动抑制EOS生成以延长解码,在三类开源模型上验证了其攻击有效性及安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11025 2026-08-12 cs.CL 新提交 50%

Data Attribution of Emergent Misalignment with Persona Features

基于角色特征的涌现失配数据归因

Clemens Vetter, David Kaczér, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10645 2026-08-12 eess.SY cs.SY 新提交 50%

AIDC Microgrid Vulnerability Assessment Under Computing-Power Coordinated Attacks

算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估

Ze Yu, Hongwei Zhen, Chao Shen, Mingyang Sun

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10942 2026-08-12 quant-ph 新提交 50%

Enhanced two-photon blockade without cascade channel by Stark nonlinear coupling

利用斯塔克非线性耦合实现无级联通道的增强型双光子阻塞

Zu-Jian Ying, Hang-Hang Han

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出用斯塔克非线性耦合增强无级联通道的非常规双光子阻塞,将其窗口拓宽至整个强耦合区、阻塞程度加深两个数量级,为双光子阻塞操控提供实用方案。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10998 2026-08-12 physics.optics physics.acc-ph physics.comp-ph 新提交 50%

Non-resonant laser-driven narrowing of particle velocity distributions

非共振激光驱动的粒子速度分布窄化

Ashwini Vaishnav, Matthias Rupp, Olivier De Castro, Mikhail N. Shneider, Alexandros Gerakis

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文以中性铯原子为例,通过数值研究提出一种光学斯塔克减速的作用机制,可窄化粒子集合围绕平均速度的速度分布,相关发现对光学操控等领域有潜在意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10310 2026-08-12 cond-mat.mes-hall 新提交 50%

Nanoscale imaging of ferromagnetic vortex dynamics with scanning NV magnetometry

基于扫描NV磁力计的铁磁涡旋动力学的纳米级成像

Jeffrey Rable, Jyotirmay Dwivedi, Nitin Samarth, Paul Stevenson, Arun Bansil, Swastik Kar

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究利用扫描NV磁力计实现了约50 nm空间分辨率的铁磁涡旋静态场与微波场成像,揭示了无序对微波倏逝衰减的影响,其技术分辨率优于衍射极限技术,可用于磁子器件研发。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 9 篇

2608.11175 2026-08-12 cs.RO cs.SY eess.SY 新提交 79%

Risk-Aware Kinodynamic Motion Planning Under Uncertainty For Safe Navigation on Planetary Environments

行星环境安全导航下考虑不确定性的风险感知动力学运动规划

Sachin Sunil Kelkar, Tanmay Dokania, Yashwanth Kumar Nakka

机构 * Daniel Guggenheim School of Aerospace Engineering(丹尼尔·古根海姆航空航天工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身导航 :navigation(title);robotic(abstract);分类 cs.RO

AI总结 针对自主空间探索中环境交互与感知系统的不确定性导致的安全规划问题,提出结合AO-RRT采样规划与序列凸规划的风险感知动力学运动规划方法,可将轨迹风险降低约97%。

Comments 3 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10817 2026-08-12 cs.RO 新提交 79%

AECNav: Active Evidence Consolidation for Efficient Zero-Shot Open-Vocabulary Object Navigation

AECNav:用于高效零样本开放词汇对象导航的主动证据整合

Guanlin Liu, Shaobin Ling, Renyuan Liu, Zeying Gong, Junjie Hu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 AECNav是一种无需训练的零样本开放词汇对象导航方法,通过证据门控感知、证据整合与主动证据获取三个组件,在多个基准数据集上达到最新性能,且在物理机器人上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 79%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09944 2026-08-12 cs.HC cs.AI 新提交 79%

Navigation Alone Is Not Enough: Evaluating Explanatory Assistive UI Agents

仅导航是不够的:评估解释性辅助UI智能体

Santosh Patapati

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 该研究推出辅助UI智能体基准NeXUI,评估其导航、解释及用户控制能力,实验发现Gemini-3.5-Flash在该基准中表现不佳,为相关研发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 77%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 具身导航 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10791 2026-08-12 cs.RO 新提交 76%

Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation

双重应力:安全约束模型预测控制导航的运行时安全监测

Jamil Chahine, Wenqi Cai, John Abanes, Anthony Tzes

机构 * American University of Beirut (AUB)(贝鲁特美国大学) New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校) New York University(纽约大学)

专题命中 具身导航 :navigation(title);分类 cs.RO;robotics(comments)

AI总结 本文提出基于MPC约束优化的Karush-Kuhn-Tucker乘子的双重应力信号,将其与15个几何检测器对比,发现其漏检碰撞的补充预警能力显著,结合后可提升制动可行碰撞的预警占比。

Comments 6 pages, 4 figures, 2 tables, submitted to the 13th International Conference on Automation, Robotics and Applications (ICARA 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10023 2026-08-12 cs.RO cs.CV cs.SY eess.SY 新提交 62%

Protection Levels for Vision-Based Pose Estimation

基于视觉的位姿估计的保护水平

Olivia Beyer Bruvik, Romeo Valentin, Marc R. Schlichting, Don Walker, Mykel J. Kochenderfer

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本研究扩展了现有视觉位姿估计框架,推导了适用于航空场景的非线性PnP问题保护水平算法,分析了相关因素对其的影响并展示了权衡关系,为视觉导航的完整性认证提供支持。

Comments 11 pages, 5 figures. Accepted for publication at the 2026 AIAA DATC/IEEE 45th Digital Avionics Systems Conference (DASC). O. Beyer Bruvik and R. Valentin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10249 2026-08-12 cs.LG 新提交 57%

STCAD: Scalable Trajectory Clustering and Anomaly Detection on Terabyte-Scale AIS Data

STCAD:针对TB级AIS数据的可扩展轨迹聚类与异常检测

Bertram Hage, Alexander Schiøtz, Felix Thomsen, Christian Rand, Peder Heiselberg

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 该研究提出STCAD框架,通过自定义BERT模型与CURE层次聚类实现TB级AIS轨迹的无监督聚类,结合重构损失与聚类噪声分配检测异常,在国家级AIS数据集上验证了方法的有效性。

Comments Accepted at IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09975 2026-08-12 physics.ao-ph 新提交 50%

A black-box-model-enhanced interaction method for water-wave scattering by large group of arbitrary-shaped ice floes in Arctic route planning

北极航线规划中大量任意形状浮冰水波散射的黑箱模型增强交互方法

Chongwei Zhang, Hongli Yang, Peng Wu, Peng Lu, Dezhi Ning

专题命中 具身导航 :navigation(abstract)

AI总结 本研究提出WCD黑箱模型构建DTM,开发EI方法高效预测北极航线中大量任意形状浮冰的水波场,结合动态规划优化航线,可使船舶平均波幅降至入射波幅约一半,计算效率极高。

Comments 31 pages, 37 figures; submitted to Cold Regions Science and Technology on March 22, 2025; received first revision request on March 18, 2026; submitted first revision on April 7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 6 篇

2608.10386 2026-08-12 cs.LG cs.RO 新提交 81%

Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving

Dreamer-SAC:用于样本高效自动驾驶的潜世界模型离线策略学习

Jiazhuo Li, Linjiang Cao, Qi Liu, Xi Xiong

机构 * Tongji University(同济大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出Dreamer-SAC框架,结合循环状态空间世界模型与离线策略SAC算法,在自动驾驶场景中优于DreamerV3、SAC等基线,且所需真实环境交互更少。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10107 2026-08-12 cs.CV 新提交 79%

4D-WAM: 4D Consistent World Modeling for Autonomous Driving

4D-WAM:面向自动驾驶的4D一致世界建模

Jiacheng Fu, Yibo Yuan, Meng Tian, Yue Li, Jiangtong Zhu, Jianhua Han, Yueyi Zhang, Jianwu Fang, Jianru Xue, Hang Xu, Zhiwei Xiong

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出4D-WAM模型,通过几何基础模型的训练时监督与面向决策的时间步长采样策略,提升自动驾驶中世界-动作模型的4D场景一致性,在NAVSIM-v1、NAVSIM-v2基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10222 2026-08-12 eess.SP 新提交 78%

A JEPA-Based Field-Layer World Model for Bridging Channel Prediction and Estimation

一种基于JEPA的场层世界模型,用于衔接信道预测与估计

Yuzhi Yang, Brahim Mefgouda, Hang Zou, Lina Bariah, Anis Bara, Yuhuan Lu, Hao Zhang, MérouaneDebbah

专题命中 具身推理 :world model(title,abstract)

AI总结 该研究针对MIMO-OFDM无线系统中CSI预测鲁棒性差的问题,提出基于JEPA的场层世界模型,通过多尺度对齐策略实现跨频段重构,显著提升了波束成形增益。

Comments submitted to IEEE trans

详情

展开后加载摘要…

URL PDF HTML 收藏