arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-09 至 2026-07-09 共收录 8
2607.07608 2026-07-09 cs.RO cs.CV 新提交

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的双潜记忆

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。

Comments Project page: https://github.com/quhongyu/LaMem-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06699 2026-07-09 cs.RO 新提交

RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation

RoboSnap:用于可泛化机器人学习与评估的一次性真实到模拟场景生成

Shujie Zhang, Jingkun Yi, Weipeng Zhong, Zirui Zhou, Yangkun Zhu, Hanqing Wang, Xudong Xu, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 针对构建物理稳定且视觉逼真场景缓慢昂贵的问题,提出RoboSnap框架,通过分层设计将单张RGB图像转为模拟场景,实验证明其能实现轨迹重放等,还引入DROID-Sim数据集,凸显真实到模拟方法对机器人学习评估的价值。

Comments 24 pages, 16 figures, Project page: https://robosnap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交

Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成

Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) BlueImage, vivo(蓝城图像,维沃) Xian Jiaotong-Liverpool University(西交利物浦大学)

AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08843 2026-07-09 cs.AI cs.LG 版本更新

M$^3$: Reframing Training Measures for Discretized Physical Simulations

M$^3$:重新框架化离散物理模拟的训练度量

Yuan Mei, Xingyu Song, Xiaowen Song, Naoya Takeishi

机构 * The University of Tokyo(东京大学) Zhejiang University(浙江大学)

AI总结 M$^3$通过多尺度Morton度量框架平衡训练度量,提升连续物理域预测精度,减少误差达4.7倍,且在降采样下仍保持优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16446 2026-07-09 cs.CV 版本更新

Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline

统一去除雨滴和反射:一个新的基准和一个新流程

Xingyu Liu, Zewei He, Yu Chen, Chunyu Zhu, Zixuan Chen, Xing Luo, Zhe-Ming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空航天学院) Huanjiang Laboratory(浣江实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出统一去除雨滴和反射的任务,并构建了新的基准数据集,同时提出基于扩散的新型框架DiffUR³,有效去除两种退化,实验表明在基准和真实场景中表现优异。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06150 2026-07-09 cs.RO

Delta6: A Low-Cost, 6-DOF Force-Sensing Flexible End-Effector

Delta6: 一种低成本的六自由度力感知柔性末端执行器

Yue Feng, Weicheng Huang, Chen Qiu, Huixu Dong, I-Ming Chen

机构 * Nanyang Technological University(南洋理工大学) WinGs Robotics LLC Zhejiang University(浙江大学) Maider Medical Industry Equipment Company, Ltd.(迈德医疗工业设备有限公司)

AI总结 Delta6是一种低成本六自由度力感知柔性末端执行器,结合拮抗弹簧与磁编码器实现高精度力矩感知,具备简单组装和耐用性,通过参数分析模型可扩展性能,支持多种计算平台,验证其在复杂任务中的鲁棒性。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE/ASME Transactions on Mechatronics, pp. 1-12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02999 2026-07-09 cs.CR cs.AI 版本更新

NonTextual Target Attack

非文本目标攻击

Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)

AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19348 2026-07-09 cs.CV 版本更新

When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators

当蒸馏破坏运动控制时:恢复快速视频生成器的生成轨迹

Jintao Rong, Xin Xie, Xinyi Yu, Linlin Ou, Xinyu Zhang, Chunhua Shen, Dong Gong

机构 * Zhejiang University of Technology(浙江工业大学) University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼)) University of Auckland(奥克兰大学) Zhejiang University(浙江大学)

AI总结 研究免训练运动定制应用于蒸馏视频生成器的问题,提出MotionEcho框架,通过推理时用高质量扩散教师模型校正学生模型采样轨迹,实现准确运动控制,提升运动保真度和视觉质量,且保留蒸馏生成效率优势。

Comments Project page: https://euminds.github.io/motionecho/

详情

展开后加载摘要…

URL PDF HTML 收藏