arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 460 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 460 篇

2407.05886 2026-06-10 cs.RO 版本更新 70%

Rod models in continuum and soft robot control: a review

连续体和软体机器人控制中的杆模型:综述

Carlo Alessi, Camilla Agabiti, Daniele Caradonna, Cecilia Laschi, Federico Renda, Egidio Falotico

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) The BioRobotics Institute(生物机器人研究所) Department of Excellence in Robotics and AI(机器人与人工智能卓越部门)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文综述了杆模型在连续体和软体机器人建模与控制中的应用,涵盖数学基础、机器人建模及控制策略,并讨论了其优势、局限和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02274 2026-06-09 cs.RO 版本更新 70%

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Dexterity-BEV: 对齐3D世界与动作以实现通用机器人策略学习

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

机构 * DexForce Technology(德克斯技术公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出Dexterity-BEV框架,通过对齐顶点图和顶点谱的3D表示以及鸟瞰图对齐,解决2D基础模型在3D操作中的局限性,提升机器人策略的泛化能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20591 2026-06-09 cs.RO 版本更新 70%

LightTact: A Visual-Tactile Fingertip Sensor for Deformation-Independent Contact Sensing

LightTact: 一种用于变形无关接触感知的视觉-触觉指尖传感器

Changyi Lin, Boda Huo, Mingyang Yu, Emily Ruppel, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出LightTact传感器,通过环境光阻断光学配置实现变形无关的接触检测,在无宏观变形下(如液体、超软材料)实现高对比度接触分割,并解锁轻接触机器人操作。

Comments Project website: https://linchangyi1.github.io/LightTact

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07558 2026-08-11 cs.CV cs.LG cs.RO 版本更新 67%

Unsupervised Point Cloud Registration with Self-Distillation

基于自蒸馏的无监督点云配准

Christian Löwens, Thorben Funke, André Wagner, Alexandru Paul Condurache

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文针对点云配准依赖真实位姿标注的问题,提出自蒸馏无监督方法,在3DMatch基准上优于现有方法,且可泛化至汽车雷达场景。

Comments Oral at BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18066 2026-08-06 cs.RO cs.AI cs.LG q-bio.QM 版本更新 67%

Arnold: A multi-task, multi-embodiment muscle transformer policy

Arnold:一种多任务、多 embodiment 的肌肉 Transformer 策略

Boshi An, Alberto Silvio Chiappa, Merkourios Simos, Chengkun Li, Alexander Mathis

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究开发了基于 Transformer 的肌肉控制策略 Arnold,结合行为克隆与强化学习,实现多任务多 embodiment 控制,性能优于单任务策略,还揭示了肌肉协同作用的任务特异性等特性。

Comments B.A., A.S.C. and M.S. contributed equally. Code is available at https://github.com/amathislab/arnold

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16478 2026-08-04 cs.GR 版本更新 67%

Fast and Reliable Gradients for Deformables Across Frictional Contact Regimes

快速且可靠的变形体梯度在摩擦接触范围内

Ziqiu Zeng, Gang Yang, Zhenhao Huang, Bingyang Zhou, Yulin Li, Jason Pho, Siyuan Luo, Fan Shi

专题命中 机器人操作 :robotics(abstract);manipulation(abstract)

AI总结 本文提出了一种统一的全GPU加速可微模拟器,通过长期一致性、统一接触稳定性以及鲁棒材料识别方法,解决了摩擦接触问题中的梯度不稳定性问题,提升了物理系统识别和控制的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10946 2026-07-22 cs.RO cs.AI cs.LG 版本更新 67%

ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning

ImplicitRDP:一种具有结构快慢学习的端到端视觉-力扩散策略

Wendi Chen, Han Xue, Yi Wang, Fangyuan Zhou, Jun Lv, Yang Jin, Shirun Tang, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺姆矩阵有限公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究人类水平接触操作中视觉与力感测信号整合难题,提出ImplicitRDP策略,用结构快慢学习机制及虚拟目标表示正则化,经实验验证其在丰富接触任务中显著优于基线,有卓越反应性与成功率。

Comments Accepted to RA-L 2026. Project page: https://implicit-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22784 2026-07-13 cs.CV cs.AI cs.RO 版本更新 67%

Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching

基于监督跨模态特征匹配的单帧点像素配准

Yu Han, Zhiwei Huang, Yanting Zhang, Fangjun Ding, Shen Cai, Xiaoyu Tang, Yanchao Dong, Rui Fan

机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12120 2026-06-24 cs.RO cs.AI cs.CV 版本更新 67%

CRAFT: A Tendon-Driven Hand with Hybrid Hard-Soft Compliance

CRAFT: 一种具有混合硬-软柔顺性的腱驱动手

Leo Lin, Shivansh Patel, Jay Moon, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Irvine(uci)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出CRAFT手,一种腱驱动拟人手,通过关节软材料与连杆刚性结合实现混合柔顺性,在接触丰富操作中提升强度、耐久性和抓取能力,覆盖Feix分类全部33种抓取。

Comments In RSS 2026. Website: https://roboticsconference.org/program/papers/192/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12261 2026-06-11 cs.LG cs.AI cs.CV 版本更新 67%

The Latent Color Subspace: Emergent Order in High-Dimensional Chaos

潜在颜色子空间:高维混沌中的涌现秩序

Mateusz Pach, Jessica Bader, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文揭示了FLUX.1变分自编码器潜在空间中颜色表示的HSL结构,并提出一种无需训练的闭式潜在空间操作方法,实现对生成图像颜色的预测与显式控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06493 2026-06-10 cs.RO cs.AI cs.LG 版本更新 67%

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制

Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

机构 * California Institute of Technology(加州理工学院) The Institute for Human & Machine Cognition(人机认知研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。

Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-08-14 cs.RO cs.CV 版本更新 62%

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09089 2026-08-12 cs.CV cs.AI 版本更新 62%

Field-Localized Forgery Detection for Digital Identity Documents

用于数字身份文档的字段局部伪造检测

Abhishek Kumar, Riya Tapwal, Carsten Maple, Mark Hooper

机构 * The Alan Turing Institute(艾伦·图灵研究所) IIT Mandi(曼迪理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出FLiD框架,通过局部化关键身份字段来检测伪造,实现高准确率和低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18587 2026-08-11 cs.CV cs.AI 版本更新 62%

HyperFake: Hyperspectral Reconstruction and Attention-Guided Analysis for Advanced Deepfake Detection

HyperFake:用于高级深度伪造检测的高光谱重建与注意力引导分析

Pavan C Shekar, Pawan Soni, Vivek Kanhangad

机构 * Department of Electrical Engineering, Indian Institute of Technology Indore(印度理工学院印度尔分校电子工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 HyperFake是首个利用高光谱成像重建的深度伪造检测方法,通过改进的MST++架构、光谱注意力机制与EfficientNet分类器,从RGB视频重建31通道高光谱数据,实现了更准确且泛化性更强的深度伪造检测。

Comments 6 pages, 3 figures, 1 table. Preliminary results on FaceForensics++ dataset. First approach to use hyperspectral reconstruction for deepfake detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07163 2026-08-04 cs.RO cs.CV 版本更新 62%

Mamba Policy: Towards Efficient 3D Diffusion Policy with Hybrid Selective State Models

Mamba Policy:基于混合选择性状态模型的高效3D扩散策略

Jiahang Cao, Qiang Zhang, Jingkai Sun, Jiaxu Wang, Hao Cheng, Yulin Li, Jun Ma, Kun Wu, Zhiyuan Xu, Yecheng Shao, Wen Zhao, Gang Han, Yijie Guo, Renjing Xu

机构 * Microelectronics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)微电子领域) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴交叉领域 division) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Center for X-Mechanics, Zhejiang University(浙江大学X力学中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出Mamba Policy,以XMamba Block融合Mamba与注意力机制,参数量减超80%,在Adroit等数据集上性能优异且计算资源需求低,长 horizon 场景鲁棒性更强。

Comments Accepted to IROS 2025. Project Page: https://sagecao1125.github.io/mamba_policy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新 62%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新 62%

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02332 2026-08-03 q-bio.NC cs.AI cs.LG cs.NE 版本更新 62%

Information Processing by Neuron Populations in the Central Nervous System: A Theory of the Mathematical Structure of Data and Operations

中枢神经系统中神经元群体的信息处理:数据与操作的数学结构理论

Martin N. P. Nilsson

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出源自单个可塑性神经元机械模型的数学框架,以凸锥代数表征神经元群体活动,实现多种信息处理功能,凸显矩阵嵌入的作用,对认知神经科学与人工智能具潜在意义。

Comments 60 pages, 12 figures. Major revision. The neuron model is shown to perform online projected-gradient optimization for NNLS. New results connect neuron-local learning to conic projection and rejection through sparse, activity-selected mappings, strengthen the cone algebra with Moreau-based proofs, and characterize approximate invariance under sparse embeddings. Adds a sensorimotor application

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20722 2026-07-31 cs.CV cs.AI 版本更新 62%

DinoLizer: Separating VAE and Diffusion Artifacts in Generative Inpainting Localization

DinoLizer: 从最佳中学习以实现生成修复的定位

Minh Thong Doi, Vincent Itier, Jan Butora, Jérémie Boulanger, Patrick Bas

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 DinoLizer基于DINOv2改进生成修复中的篡改定位,通过滑动窗口和后处理提升鲁棒性,实现更高的IoU性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17901 2026-07-30 cs.RO cs.AI 版本更新 62%

Task and Skill Planning: Hierarchical Robot Planning with Black-Box Skills

超越任务与运动规划:基于通用技能的分层机器人规划

Benned Hedegaard, Yichen Wei, Ziyi Yang, Ahmed Jaafar, Stefanie Tellex, George Konidaris, Naman Shah

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于通用技能的分层机器人规划框架,通过可组合交互原语整合运动规划与闭合回路控制器,实现在复杂长期任务中的高效执行。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07210 2026-07-30 cs.CV cs.CR cs.LG 版本更新 62%

Breaking the Stealth-Potency Trade-off in Clean-Image Backdoors with Generative Trigger Optimization

利用生成式触发器优化打破干净图像后门的隐蔽性-有效性权衡

Binyan Xu, Fan Yang, Di Tang, Xilin Dai, Kehuan Zhang

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 该研究提出生成式干净图像后门框架GCB,利用条件InfoGAN优化触发器,仅需极小投毒示例即可实现攻击,CA下降不到1%,适配多类数据集、架构与任务,且能抵御多数后门防御。

Comments 19 pages, 22 figures, 15 tables. To appear in AAAI '26 (Oral). This paper extends the AAAI-2026 version by including the Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04401 2026-07-23 cs.RO cs.CV 版本更新 62%

Quantile Transfer for Reliable Operating Point Selection in Visual Place Recognition

视觉地点识别中可靠操作点选择的分位数迁移

Dhyey Manish Rajani, Michael Milford, Tobias Fischer

机构 * QUT Centre for Robotics(昆士兰理工大学机器人中心) School of Electrical Engineering and Robotics(电气工程与机器人学院) Queensland University of Technology(昆士兰理工大学)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出一种通过分位数归一化迁移阈值的方法,自动选择视觉地点识别系统的操作点,在100%精度下最大化召回率,无需手动调参。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 62%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25667 2026-07-17 cs.LG cs.AI cs.HC 版本更新 62%

EEG-based AI-BCI Wheelchair Advancement: Transformer-Based Learning with Motor Imagery for Brain Computer Interface

基于EEG的AI-BCI轮椅前进:用于脑机接口的混合深度学习与运动想象

Bipul Thapa, Biplov Paneru, Bishwash Paneru, Khem Narayan Poudyal

机构 * Department of Computer Science and Engineering, Kathmandu University(加德满都大学计算机科学与工程系) Department of Electronics and Communication Engineering, Nepal Engineering College, Pokhara University(博卡拉大学尼泊尔工程学院电子与通信工程系) Department of Applied Sciences and Chemical Engineering, Institute of Engineering, Pulchowk Campus, Tribhuvan University(特里布万大学工程学院普尔乔克校区应用科学与化学工程系)

专题命中 机器人操作 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合运动想象左右手运动机制的AI集成方法,利用EEG数据模拟轮椅导航,采用CNN-Transformer混合模型实现高准确率的EEG分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17340 2026-07-16 cs.RO cs.AI math.DS 版本更新 62%

Koopman-driven grip force prediction through EMG sensing

通过肌电传感实现Koopman驱动的抓握力预测

Tomislav Bazina, Ervin Kamenar, Maria Fonoberova, Igor Mezić

机构 * University of Rijeka(里耶卡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) AIMdyn, Inc.(AIMdyn公司)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文通过单个肌电传感器对中等缠绕抓握中的抓握力进行准确预测,利用Koopman算子理论和数据提升技术,实现快速且鲁棒的力估计与短期预测,wMAPE为5.5%。

Comments 11 pages, 8 figures, journal

Journal ref IEEE Transactions on Neural Systems and Rehabilitation Engineering, vol. 33, pp. 2192-2202, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27677 2026-07-14 cs.RO cs.CV 版本更新 62%

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

DIM-WAM:基于多样化历史事件记忆的世界-动作建模

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Jiabing Yang, Zhaowen Li, Yan Huang, Liang Wang, Peng Su

机构 * NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室) Yinwang Intelligent Technology(银旺智能科技) FiveAges(五龄科技)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出DIM-WAM,一种记忆增强的世界-动作模型,通过多尺度历史上下文、局部未来动态和全局任务进度解决长期遗忘问题,在RMBench和真实机器人任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20805 2026-07-10 cs.RO cs.CV 版本更新 62%

FunHOI: Annotation-Free 3D Hand-Object Interaction Generation via Functional Text Guidance

FunHOI:通过功能文本引导实现无注释的3D手-物体交互生成

Yongqi Tian, Xueyu Sun, Haoyuan He, jianlei Wang, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 研究针对手-物体交互中功能抓取语义捕捉难的问题,提出两阶段框架FGS-Net,通过文本引导3D模型生成器FGG和姿态优化策略FGR,无需额外3D注释数据即可实现精确高质量的3D手-物体交互生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 62%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 62%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26689 2026-07-03 cs.RO cs.AI 版本更新 62%

Regression Test Selection for Updated Capability Modules in Compositional ML Systems via Atomic-Quality Probes

原子探针治理在组合机器人策略中的技能更新

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software(软件学院) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Technology(计算机科学与技术学院) Heriot-Watt University(赫瑞-瓦特大学) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所) School of Future Science and Engineering(未来科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出原子质量探针和混合选择器,用于分析组合机器人策略中技能更新的治理问题,通过实验发现主导技能对成功率影响显著,并在不同任务中验证了方法的有效性。

Comments 8 pages main text + appendix; 3 figures, 12 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏