arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 928 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 928 篇

2607.28405 2026-07-31 cs.AI cs.LG 新提交 62%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28229 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 62%

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

EMBL AI Librarian:面向AI智能体的生命科学知识层

Luigi Sigillo, Matteo Silvestri, Francesco Tabaro, Rajat Bhatnagar, Syed Irtaza Mubashar, Matt Jeffryes, Daljit Nijjer, Vittorio Perera, Ola Spjuth, Julio Saez-Rodriguez, Melissa Harrison, Fabio Petroni

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22890 2026-07-28 cs.GR cs.CV cs.LG 新提交 62%

Meshless Domain Randomization via Explicit Parameter Perturbation of 3D Gaussian Splatting

通过显式参数扰动3D高斯喷溅实现无网格域随机化

Felipe Nunes Carbone de Carvalho, Joyce de Morais Souza, Alan de Aguiar, Charles Morphy D. Santos, João Paulo Gois

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 针对复杂有机物体提取和渲染纹理网格的挑战,提出基于3D高斯喷溅参数空间的无网格域随机化框架,用两个独立扰动管道合成随机训练数据集,为复杂几何形状生成强大数据集提供无网格替代方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22355 2026-07-27 cs.CV cs.AI 新提交 62%

SiPhy: Single-Image Physical Property Reasoning

SiPhy:单图像物理属性推理

Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

机构 * Michigan State University(密歇根州立大学)

专题命中 机器人操作 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 研究从单图像推断物理属性,核心方法是引入SiPhy框架,将视觉线索与材料知识对齐,通过采样、提取特征等操作及对比聚合器、重量感知细化来实现。在多个数据集上取得领先性能,还验证了其在真实交互数据集上作为数据标注引擎的潜力。

Comments Accepted to ECCV 2026 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21820 2026-07-27 cs.SD cs.AI cs.CR cs.LG 新提交 62%

Probing Speaker Identity Sensitivity in Audio Deepfake Detectors

探究音频深度伪造检测器中的说话者身份敏感性

Daniyal Kabir Dar, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究音频深度伪造检测器对说话者身份的敏感性问题,提出身份敏感性分数(ISS),该方法无需真实标签,通过计算检测器分数变化量化身份敏感程度,能有效预测错误分类,为基于说话者的故障分析提供实用诊断。

Comments Accepted at IEEE/IAPR International Joint Conference on Biometrics (IJCB) 2026. 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17757 2026-07-21 cs.RO cs.AI 新提交 62%

Seg2Grasp: A Robust Modular Suction Grasping in Bin Picking

Seg2Grasp:一种用于无序抓取的稳健模块化吸力抓取方法

Hye-Jung Yoon, Juno Kim, Yesol Park, Jun-Ki Lee, Byoung-Tak Zhang

机构 * Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) Artificial Intelligence Institute, Seoul National University(首尔国立大学人工智能研究所) Department of Computer Science, Seoul National University(首尔国立大学计算机科学系)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对非结构化环境中无序抓取难题,提出Seg2Grasp模块化方法,经分割、抓取、分类三步流程,利用多种技术确定吸力点与识别物体,实际实验证明该方法在成功率和适应性上优于现有方法,是工业自动无序抓取有力工具。

Comments 7 pages, 6 figures, 2 tables. Published in the 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2024)

Journal ref 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024, pp. 2921-2927

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 62%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14271 2026-07-17 cs.LG cs.AI 新提交 62%

Local Additive Feature Attribution: A Mathematical Taxonomy and Reporting Checklist

局部加法特征归因:一种数学分类法和报告清单

Rebecca Afriyie Sarpong, Daniel Commey

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究围绕五个规范选择组织多种局部加法特征归因方法,通过公理矩阵比较,将常见失败模式与假设关联,为使用局部加法归因的研究提出十项报告清单,强调归因结果依数学假设而定且假设应报告

Comments 35 pages, 7 figures, and 19 tables. Ancillary files include the axiom matrix, reporting checklist, related-survey scoring, and review-corpus summary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13475 2026-07-16 cs.RO cs.LG 新提交 62%

Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability

部分可观测性下自主手术组织牵开的可变形状态估计

Everest Yang, Skye Thompson, George D. Konidaris

机构 * Brown University(布朗大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 研究部分可观测下自主手术组织牵开的可变形状态估计问题,提出结合多层感知器与低维PCA潜在表示、用几何感知正则化训练的状态估计器,在二维模拟中评估,结果显示该估计器在多步牵开中性能良好,能支持有效可变形操作。

Comments Accepted to the ICRA 2026 RASEI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12861 2026-07-15 cs.RO cs.AI cs.SY eess.SY 新提交 62%

Unveiling Complex Collective Behaviors from Simple Rewards

从简单奖励中揭示复杂的集体行为

Yize Mi, Jianan Li, Liang Li, Shiyu Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) WINDY Lab, School of Engineering, Westlake University(西湖大学工程学院风语实验室) Shanghai AI Laboratory(上海人工智能实验室) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物系)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究多智能体强化学习中简单奖励与复杂集体行为的关系,提出两阶段EEC解释框架及智能体响应图,通过合作与竞争两个任务验证,揭示了MARL策略背后隐藏的几何结构。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10014 2026-07-14 cs.RO cs.LG cs.MA cs.SY eess.SY 新提交 62%

Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation

全球导航卫星系统(GNSS)退化情况下学习到的小型无人机分离策略的运行时安全过滤

Alex Zongo, Peng Wei

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 研究在GNSS退化时小型无人机分离策略的运行时安全过滤问题,对比动作过滤和观测过滤两种方法,发现动作过滤安全改进小,观测过滤能减少近90%的空中碰撞且更稳健,表明保留策略决策权限更优。

Comments Accepted for publication at the 2026 IEEE/AIAA Digital Avionics Systems Conference (DASC). 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 62%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26428 2026-07-10 cs.RO cs.AI 新提交 62%

Play2Perfect: What Matters in Dexterous Play Pretraining for Precise Assembly?

Play2Perfect:灵巧操作预训练对精密装配的关键因素

Tyler Ga Wei Lum, Kushal Kedia, C. Karen Liu, Jeannette Bohg

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出Play2Perfect框架,通过任务无关的玩耍预训练获取可复用的操作先验,再微调用于精密装配,在稀疏奖励和接触密集任务中实现33倍样本效率提升。

Comments 22 pages, 12 figures, 4 tables. Project page: https://play2perfect.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 62%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 62%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04184 2026-07-07 cs.AI cs.LG 新提交 62%

A Clustering-Based Framework for Identifying Suspicious Trading Patterns in Capital Market

一种基于聚类的资本市场可疑交易模式识别框架

Asif Zaman, Romona Magdalene Sarkar, Sabiha Khair Ohi, Iftekharul Mobin

机构 * Department of Computer Science & Engineering(计算机科学与工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对资本市场操纵股价问题,运用K-Means++聚类实现无监督欺诈检测工具,用2012至2024年约百万金融交易数据集,提出聚类流程识别欺诈交易并分类,给出各类型占比且模型表现获验证。

Comments Accepted for publication in IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN), 2026. This is the authors preprint version. The final version is available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03502 2026-07-07 cs.CL cs.AI cs.LG 新提交 62%

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

解读点之间的信息:解码跨填充令牌的隐藏计算

Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

机构 * Harvard University(哈佛大学) Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) Massachusetts Institute of Technology(麻省理工学院) Anthropic

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。

Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31699 2026-07-03 cs.CV cs.AI 新提交 62%

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

用稀疏自编码器实现扩散模型中的遗忘:只看不碰

Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

机构 * University of Turin(都灵大学) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎综合理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文利用稀疏自编码器作为语义检测器,通过检测并替换包含目标对象的图像区域,实现扩散模型中的对象擦除,避免了直接干预潜在空间导致的视觉伪影。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01212 2026-07-02 cs.RO cs.AI 新提交 62%

FurnitureVLA: Learning Long-Horizon Bimanual Furniture Assembly with Vision-Language-Action Model

FurnitureVLA: 使用视觉-语言-动作模型学习长时域双臂家具组装

Chenyang Ma, Yue Yang, Radu Corcodel, Siddarth Jain, Andrew Wu, Chiori Hori, Diego Romeres

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出FurnitureVLA,首个使用视觉-语言-动作模型进行真实尺寸双臂家具组装的系统,通过进度增强VLA和设计因素研究,将平均模拟成功率从48%提升至80%。

Comments Project Page: https://dannymcy.github.io/furniturevla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00174 2026-07-02 cs.CV cs.LG 新提交 62%

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

窃取补丁大小:对抗性操纵视觉-语言模型

Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出一种黑盒模型窃取攻击,通过任务级侧信道推断视觉语言模型的补丁大小和预处理流程,并利用泄露信息实现预处理感知的迁移攻击和模型定向对抗操纵。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28104 2026-06-29 cs.CV cs.LG 新提交 62%

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

跨视角多模态视觉评估框架用于中医康复训练

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) Institute for Regeneration and Repair, The University of Edinburgh(爱丁堡大学再生与修复研究所) Ningbo Hospital of Traditional Chinese Medicine(宁波市中医院) Department of Rehabilitation Medicine, The Gulou Hospital of Traditional Chinese Medicine(南京市鼓楼区中医院康复医学科)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出跨视角多模态视觉评估框架CME-AQA,融合视觉-姿态信息,利用第一人称和第三人称视频提升推理鲁棒性,在中医康复训练动作质量评估中取得优于基线10%的加权F1提升。

Comments Published in IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2026

Journal ref IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27581 2026-06-29 cs.RO cs.AI 新提交 62%

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

SceneBot: 接触提示的通用人形全身跟踪与环境交互

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

机构 * Stanford(斯坦福大学) Amazon FAR(亚马逊 FAR) CMU(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出SceneBot框架,通过接触标签和事后场景重建,统一处理自由空间运动、地形穿越和全身操作,实现复杂长时任务。

Comments 15 pages 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26793 2026-06-26 cs.CR cs.AI cs.LG 新提交 62%

MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG

Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) Fujitsu Limited, Japan(日本富士通有限公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。

Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22858 2026-06-23 cs.LG cs.AI 新提交 62%

The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks

无形之手:通过目标身份重新关联攻击操纵模型公平性和SHAP

Sannaan Khan, Muhammad U. S. Khan

机构 * National University of Sciences and Technology (NUST)(国立科技大学(NUST))

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出目标身份重新关联(TIRA)攻击,通过概率性微扰操纵模型输出,在不留痕迹的情况下扭曲公平性指标和SHAP解释。

Comments Accepted at NeurIPS Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21788 2026-06-23 cs.RO cs.CV 新提交 62%

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

基于旋转感知的点云嵌入用于视觉驱动的手中重定向

Yashom Dighe, Karthik Dantu

机构 * University at Buffalo(布法罗大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出旋转感知点云嵌入,通过校准欧氏潜在距离与SO(3)测地误差,使无模型强化学习策略无需显式姿态或稠密流即可从点云目标实现手中重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19728 2026-06-19 cs.RO cs.AI 新提交 62%

Bidirectional Tutoring for Developmental Motor Learning in Robots: Co-Developed Interaction Dynamics Support Stable Learning

机器人发展性运动学习的双向辅导:共同发展的交互动力学支持稳定学习

Rui Fukushima, Jun Tani

机构 * Okinawa Institute of Science and Technology Graduate University(冲绳科学技术大学院大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出双向辅导框架,通过人类或AI导师与机器人动态适应,利用自由能原理神经网络实现稳定序列学习,在物体操作任务中验证了行为一致性和泛化能力。

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 62%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18186 2026-06-17 cs.LG cs.AI 新提交 62%

Kolmogorov Regression for Robust Diffusion Policies

用于鲁棒扩散策略的Kolmogorov回归

Lekan Molu

机构 * Bala Cynwyd, PA 19004(巴拉辛威德, PA 19004)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出后向Kolmogorov方程将扩散策略提升至Cameron-Martin空间,用确定性边界值PDE问题替代随机分数匹配,通过精度加权损失和残差诊断实现收敛保证、轨迹规则化和无奖励故障检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17480 2026-06-17 cs.CV cs.RO 新提交 62%

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) CASIA(中国科学院自动化研究所) AI 2 Robotics

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14551 2026-06-17 cs.RO cs.AI 新提交 62%

TRACE: Trajectory-Routed Causal Memory for Delayed-Evidence Visuomotor Imitation

TRACE: 用于延迟证据视觉运动模仿的轨迹路由因果记忆

Zihao Li, Ranpeng Qiu, Yincong Chen, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) The University of Sydney(悉尼大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉运动模仿中早期线索消失导致观察歧义的问题,提出TRACE记忆框架,利用路径签名存储和检索任务相关证据,在长周期任务中提升分支选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏