arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-05-14 至 2026-05-14 共收录 13
2605.13452 2026-05-14 cs.RO cs.AI

CUBic: Coordinated Unified Bimanual Perception and Control Framework

CUBic:协调统一的双臂感知与控制框架

Xingyu Wang, Pengxiang Ding, Jingkai Xu, Donglin Wang, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算高级创新中心,人工智能学院,北京航空航天大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 本文提出CUBic框架,通过统一感知模型解决双臂协调问题,采用共享表示学习提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13428 2026-05-14 cs.RO

SID: Sliding into Distribution for Robust Few-Demonstration Manipulation

SID:滑入分布以实现鲁棒的少样本操控

Yicheng Ma, Wei Yu, Zhian Su, Xidan Zhang, Huixu Dong

机构 * Grasp Lab, Zhejiang University(浙江大学抓取实验室) Torch Kernel Co., Ltd.(火炬内核有限公司)

AI总结 SID通过学习对象中心运动场,使系统在少样本下鲁棒地滑向演示 manifold 和轻量执行策略的可靠区域,提升动态扰动下的操控性能。

Comments 20 pages, 14 figures. Project website: https://sliding-into-distribution.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22643 2026-05-14 cs.RO

An Overtaking Trajectory Planning Framework Based on Spatio-temporal Topology and Reachable Set Analysis Ensuring Time Efficiency

基于时空拓扑与可达集分析的超越轨迹规划框架:确保时间效率

Wule Mao, Zhouheng Li, Entao Sun, Lei Xie, Hongye Su

机构 * State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou, 310027, China(工业控制技术国家重点实验室,浙江大学,杭州,310027,中国) Shanghai STEP Electric Corporation, Shanghai, 201802, China(上海STEP电力有限公司,上海,201802,中国)

AI总结 本文提出SROP框架,通过时空拓扑搜索获取多样初始路径并结合可达集分析提升计算效率,实验显示轨迹平滑度提升66.8%且计算时间减少62.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13172 2026-05-14 cs.MA cs.AI

When Does Hierarchy Help? Benchmarking Agent Coordination in Event-Driven Industrial Scheduling

何时层级有助于?事件驱动工业调度中的代理协调基准测试

Ziqi Wang, Yuhao Yang, Zhiwei Ling, Wenzhuo Qian, Hailiang Zhao

机构 * Zhejiang University(浙江大学)

AI总结 本文通过DESBench基准测试,探讨不同协调范式在复杂环境中的表现,揭示层级结构对代理系统行为的影响及设计权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13105 2026-05-14 cs.RO

What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调

Yuanfang Peng, Jingjing Fu, Chuheng Zhang, Li Zhao, Jiang Bian, Mingyu Liu, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12952 2026-05-14 cs.CV

Debunking Grad-ECLIP: A Comprehensive Study on Its Incorrectness and Fundamental Principles for Model Interpretation

驳斥Grad-ECLIP:对其实错误性及模型解释基本原理的全面研究

Yongjin Cui, Xiaohui Fan

机构 * Zhejiang University(浙江大学)

AI总结 本文指出Grad-ECLIP并非新方法,其本质等同于注意力机制,并揭示其缺陷及模型解释应遵循的基本原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12899 2026-05-14 stat.ML cs.LG

Robust Sequential Experimental Design for A/B Testing

面向A/B测试的鲁棒序列实验设计

Qianglin Wen, Xiangkun Wu, Chengchun Shi, Ting Li, Niansheng Tang, Yingying Zhang, Hongtu Zhu

机构 * Yunnan Key Laboratory of Statistical Modeling and Data Analysis(云南统计建模与数据分析重点实验室) Yunnan University(云南大学) School of Mathematical Sciences(数学科学学院) Zhejiang University(浙江大学) Department of Statistics(统计系) London School of Economics and Political Science(伦敦政治经济学院) School of Statistics and Data Science(统计与数据科学学院) Shanghai University of Finance and Economics(上海财经大学) East China Normal University(华东师范大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出一种鲁棒序列实验设计框架,适用于模型不准确情况,结合上下文带宽和动态设置,理论证明了其对治疗效应估计的最坏均方误差界,并通过合成和现实数据验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12704 2026-05-14 cs.SC cs.AI cs.LG

FePySR: A Neural Feature Extraction Framework for Efficient and Scalable Symbolic Regression

FePySR:一种用于高效且可扩展的符号回归的神经特征提取框架

Zhiming Yu, Wangtao Lu, Xin Lai

机构 * School of Mathematical Sciences, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学数学科学学院,杭州,浙江,中国) Faculty of Medicine and Health Technology, Tampere University, Tampere, Finland(塔尔库大学医学与健康技术学院,塔尔库,芬兰)

AI总结 FePySR通过神经网络提取有效特征,优化符号回归搜索空间,提升方程恢复率和计算效率,适用于复杂科学领域。

Comments Data and Code Availability: https://github.com/laixn/FePySR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10906 2026-05-14 cs.LG cs.AI

DataMaster: Data-Centric Autonomous AI Research

DataMaster: 以数据为中心的自主AI研究

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 DataMaster通过自主数据工程优化数据侧,提升下游性能,无需改变学习算法。其包含数据树、共享数据池和全局记忆三大组件,有效解决开放搜索空间和延迟验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10819 2026-05-14 cs.RO cs.AI cs.CV

ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models

ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型

Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan

机构 * Zhejiang University(浙江大学) Amap, Alibaba Group(阿里集团阿地图) Nanjing University(南京大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Beijing University of Chemical Technology(北京化工大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) Tsinghua University(清华大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09025 2026-05-14 cs.CV cs.AI

Skill-Conditioned Visual Geolocation for Vision-Language Models

基于技能的视觉地理定位用于视觉-语言模型

Chenjie Yang, Yutian Jiang, Yutong Deng, Chenyu Wu

机构 * Southwest Jiaotong University(西南交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01908 2026-05-14 cs.CV

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏