arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 248
2608.10433 2026-08-14 cs.LG 版本更新

From Recoverability to Functional Use: Certifying Temporal Reports in Time-Series Forecasting

时间序列预测器是否使用了正确的历史信息:时间延迟的可恢复性、恢复及功能使用

Qipeng Qian, Yuntao Qian

机构 * Supcon Technology(中控技术) College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院)

AI总结 该研究针对时间序列模型,分析了延迟可恢复性、报告与功能使用的问题,发现多数模型存在延迟报告正确但实际未使用对应历史的情况,提出的路由方法可实现预测与报告的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09233 2026-08-14 cs.LG cs.CV 版本更新

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。

Comments project page: https://sleepy1231.github.io/DreOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03089 2026-08-14 cs.LG cs.AI 版本更新

Constitutional On-Policy Safe Distillation

宪法性在策略安全蒸馏

Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15489 2026-08-14 cs.NI cs.AI 版本更新

A Q-learning-based QoS-aware multipath routing protocol in IoMT-based wireless body area network

基于Q学习的面向服务质量的多路径路由协议

Mehdi Hosseinzadeh, Roohallah Alizadehsani, Amin Beheshti, Hamid Alinejad-Roknyd, Lu Chen, Mohammad Sadegh Yousefpoor, Efat Yousefpoor, Muneera Altayeb, Thantrira Porntaveetus, Sadia Din

机构 * School of Engineering and Technology, Duy Tan University(杜益坦大学工程与技术学院) Institute for Intelligent Systems Research and Innovation, Deakin University(德金大学智能系统研究与创新研究所) School of Computing, Macquarie University(麦考瑞大学计算机学院) UNSW BioMedical Machine Learning Lab (BML), School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学机器学习实验室(BML)) Visiting Scholar (Collaborative Projects), Center of Excellence in Precision Medicine and Digital Health, Chulalongkorn University(朱拉隆梭大学精准医学与数字健康中心) Department of Computer Science, Zhejiang University(浙江大学计算机科学系) Center of Research and Strategic Studies, Lebanese French University(黎巴嫩法语大学研究与战略研究所) Faculty of Engineering, Hourani Center for Applied Scientific Research, Al-Ahliyya Amman University(阿卡巴大学工程学院,Hourani应用科学研究中心) Center of Excellence in Precision Medicine and Digital Health, Chulalongkorn University(朱拉隆梭大学精准医学与数字健康中心) Department of Computer Engineering, Gachon University(加恩大学计算机工程系)

AI总结 本文提出QQMR协议,通过Q学习优化WBANs中的多路径路由决策,提升数据包交付率并降低延迟和能耗。

Comments Due to substantial changes in the contributions and responsibilities of the researchers involved in the project, the authorship of the manuscript requires revision to accurately reflect the current contributions. We therefore request withdrawal of the present version to appropriately resolve the authorship and contribution record

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-13 cs.AI cs.CV 版本更新

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11211 2026-08-13 cs.CV cs.AI 版本更新

A Simple Efficiency Incremental Learning Framework via Vision-Language Model with Nonlinear Multi-Adapters

通过非线性多适配器的视觉-语言模型实现简单的效率增量学习框架

Haihua Luo, Xuming Ran, Jiangrong Shen, Timo Hämäläinen, Zhonghua Chen, Qi Xu, Fengyu Cong

机构 * Faculty of Information Technology, University of Jyväskylä(信息科技学院,于韦斯屈耶大学) National University of Singapore(新加坡国立大学) Lab of Brain-Machine Intelligence, Zhejiang University(脑机智能实验室,浙江大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学)

AI总结 本文提出SimE框架,利用视觉-语言模型与适配器提升增量学习效率,发现适配器连接数与模型能力呈非线性关系,实验表明在TinyImageNet和CIFAR-100上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07826 2026-08-13 cs.CV 版本更新

OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Guided Video Editing

OpenVE-3M: 一种大规模高质量的指令引导视频编辑数据集

Haoyang He, Jie Wang, Jiangning Zhang, Zhucun Xue, Xingyuan Bu, Qiangpeng Yang, Shilei Wen, Lei Xie

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

AI总结 OpenVE-3M是一个大规模高质量的指令引导视频编辑数据集,包含多种编辑类型,通过精心设计的数据管道生成,并展示了高效的5B模型在基准测试中的卓越性能。

Comments Accepted by ECCV'26. Project page: https://lewandofskee.github.io/projects/OpenVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21106 2026-08-12 cs.AI 版本更新

AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction

AttriMem:用于智能体记忆学习的归因引导过程反馈

Qinfeng Li, Yuntai Bao, Xinyan Yu, Hongze Chen, Yanming Liu, Huifeng Zhu, Yier Jin, Jintao Chen, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

AI总结 研究针对LLM智能体有效构建记忆难的问题,提出AttriMem框架,通过用token级对最终答案贡献的局部奖励增强全局结果奖励,以学习记忆构建策略,实验表明该框架性能优于多种基线,具有泛化性且稳定了RL优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14498 2026-08-12 physics.chem-ph cs.AI 版本更新

A Fixed-Point Neural Operator for Size- and Functional-Transferable Hamiltonian Prediction

用于尺寸和功能可迁移哈密顿量预测的定点神经算子

Yunhong Lou, Xihang Yue, Xinran Wei, Tianqi Deng, Linchao Zhu

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 提出HamEvo神经算子,将自洽场迭代的收敛哈密顿量作为不动点学习,结合密度矩阵监督,在分子性质预测中达到化学精度,并实现尺寸迁移和加速。

Comments 30 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19748 2026-08-12 cs.AI cs.MA 版本更新

Memory-Augmented Reinforcement Learning Agent for CAD Generation

具有记忆增强的强化学习代理的CAD生成

Yin Xiaolong, Liu Yu, Shen Jiahang, Lu Xingyu, Ni Jingzhe, Fan Fengxiao, Sang Fan

机构 * Zhejiang University(浙江大学)

AI总结 本文提出了一种记忆增强的强化学习框架,用于生成CAD模型,通过引入强化学习进行检索和策略优化,有效避免了检索陷阱,提高了复杂CAD模型生成的成功率和几何一致性。

Comments We are withdrawing this manuscript because we have identified issues in the current analysis that require substantial revision. Until these issues are resolved, we do not consider the present version suitable for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15497 2026-08-12 cs.CV cs.GR 版本更新

AnyAct: Towards Human Reenactment of Character Motion From Video

AnyAct: 向视频中非人类角色动作的重新演绎迈进

Liuhan Chen, Lei Zhong, Jiawei Wang, Qing Shuai, Li Yuan, Leidong Fan, Qing Li, Kanglin Liu

机构 * Peking University(北京大学) Nankai University(南开大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文研究如何从单目视频中直接推导出人类动作的初始重新演绎,其目标是将非人类角色的动作重新诠释为可编辑的人类表演,以供后续动画创作使用。核心方法是利用稀疏局部关节运动线索在结构差异大的情况下保持本质动态,提出AnyAct模型以实现基于可转移稀疏局部2D关节运动的条件人类运动生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01687 2026-08-12 cs.AI 版本更新

CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification

CoEvoSkills: 通过共进化验证实现自进化代理技能

Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue, Liu, Xiaoxiao Li, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) University of British Columbia(不列颠哥伦比亚大学)

AI总结 本文提出CoEvoSkills框架,使代理能自主生成复杂技能包,通过共进化验证提供反馈,实现在SkillsBench上最高通过率和强泛化能力。

Comments COLM accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00818 2026-08-12 stat.ML cs.LG 版本更新

Generalized Linear Markov Decision Process

广义线性马尔可夫决策过程

Sinian Zhang, Kaicheng Zhang, Ziping Xu, Zongqi Xia, Jue Hou, Tianxi Cai, Doudou Zhou

机构 * Division of Biostatistics and Health Data Science, University of Minnesota, USA(明尼苏达大学生物统计与健康数据科学系) School of Mathematical Sciences, Zhejiang University, China(浙江大学数学科学学院) Department of Statistics, Harvard University, USA(哈佛大学统计系) Department of Biostatistics, Harvard T.H. Chan School of Public Health, USA(哈佛T.H. Chan公共卫生学院生物统计学系) Department of Statistics and Data Science, National University of Singapore, Singapore(新加坡国立大学统计与数据科学系)

AI总结 针对离线强化学习在纵向研究中面临的奖励与转移观测问题,提出GRASP-MDP框架,通过奖励-转移分离的贝尔曼分解,利用仅转移观测提升估计性能,在模拟和真实电子健康数据中验证了有效性。

Comments 111 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02508 2026-08-11 cs.LG cs.CL 版本更新

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 RoMeRL通过降阶效用状态解决自进化LLM智能体记忆的反馈分散与记忆-奖励陷阱问题,在ALFWorld等基准上显著提升任务性能、降低记忆规模与LLM调用

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04425 2026-08-11 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Xiaomi(小米) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。

Comments Technical report. 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04422 2026-08-11 cs.LG cs.AI 版本更新

Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

全栈FP4:通过量化投影、优化器和注意力进行稳定的语言模型预训练

Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sichuan University(四川大学) Beijing Zhongguancun Academy(北京中关村科学院) Zhejiang University(浙江大学) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑科学与类脑研究中心通用人工智能大模型北京市重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑机智能技术重点实验室)

AI总结 研究针对4位预训练中优化器状态等未充分探索的问题,提出全栈FP4框架。通过模块精度策略解决稳定性瓶颈,如用LoRA-SVD抑制量化噪声,设计优化器变换,采用混合精度方案,实现稳定高效的端到端预训练。

Comments Fix experiment bugs and some statement, update current developed hardware efficiency result on 5090

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07230 2026-08-11 cs.CV 版本更新

PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing

PhyEdit: 通过物理基础图像编辑实现真实世界物体操作

Ruihang Xu, Dewei Zhou, Xiaolong Shen, Fan Ma, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室人工智能研究所ReLER实验室)

AI总结 PhyEdit通过结合显式几何模拟与2D-3D监督,提升图像编辑中物理准确性和操作一致性,引入RealManip-10K数据集和ManipEval基准测试,优于现有方法。

Comments Code: https://github.com/nenhang/PhyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06343 2026-08-11 cs.CV 版本更新

Uncertainty-Aware 4D Gaussian Splatting for Monocular Occluded Human Rendering

考虑不确定性的4D高斯点散布用于单目遮挡人体渲染

Weiquan Wang, Feifei Shao, Lin Li, Zhen Wang, Fengda Zhang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出U-4DGS框架,通过概率变形网络和联合光栅化流程,在异方差观测噪声下实现最大后验估计,解决单目视频中遮挡导致的高保真动态人体渲染问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19180 2026-08-11 cs.CV cs.AI 版本更新

SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing

SNR-Edit: 基于结构的噪声校正用于无反向的流式编辑

Lifan Jiang, Boxi Wu, Yuhang Pei, Tianrun Wu, Yongyuan Chen, Yan Zhao, Shiyu Yu, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) UniTTEC Co. Ltd.(UniTTEC有限公司) Research center, Ningbo Meidong Container Terminal Co.,Ltd.(宁波梅东集装箱码头有限公司研究中心)

AI总结 SNR-Edit通过自适应噪声控制实现无反向的流式编辑,提升潜在轨迹的结构保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08811 2026-08-11 cs.LG cs.CE eess.SP 版本更新

Analogical Learning for Cross-Scenario Generalization: Framework and Application to Intelligent Localization

用于跨场景泛化的类比学习:框架及在智能定位中的应用

Zirui Chen, Hongning Ruan, Zhaoyang Zhang, Ziqing Xing, Ridong Li, Zhaohui Yang, Mérouane Debbah

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院) Zhejiang University(浙江大学) Zhejiang Provincial Key Laboratory of Multi-modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室)

AI总结 提出类比学习框架,结合参考系与相对性概念构建Mateformer架构,应用于智能无线定位,在多场景数据集上实现波长级定位精度,提升跨场景泛化能力。

Comments Code is available at https://github.com/ziruichen-research/ALLoc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10055 2026-08-10 cs.RO 版本更新

STRONG-VLA: Decoupled Robustness Learning for Vision-Language-Action Models under Multimodal Perturbations

STRONG-VLA: 多模态扰动下视觉-语言-动作模型的解耦鲁棒性学习

Yuhan Xie, Yuping Yan, Yunqi Zhao, Handing Wang, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xidian University(西安电子科技大学)

AI总结 本文提出STRONG-VLA框架,通过解耦鲁棒性学习与任务对齐优化,提升多模态扰动下的视觉-语言-动作模型鲁棒性与任务执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01295 2026-08-10 cs.CV 版本更新

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

UniREditBench: 一个基于推理的图像编辑统一基准

Feng Han, Yibin Wang, Chenglin Li, Zheming Liang, Dianyi Wang, Yang Jiao, Zhipeng Wei, Chao Gong, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。

Comments Project page: https://maplebb.github.io/UniREditBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07136 2026-08-10 cs.CV 版本更新

MotionStrata: Hierarchical Motion Latents for Compact Video Autoencoding

MotionStrata:用于紧凑视频自编码的分层运动隐变量

Wenzhang Sun, Huaize Liu, Chunfeng Wang, Biao Gong, Hao Li, Changqing Zou

机构 * University of Chinese Academy of Sciences(中国科学院大学) Li Auto Zhejiang Lab(浙江实验室) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏