arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-14 至 2026-07-14 共收录 16
2607.11836 2026-07-14 cs.CV 新提交

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11739 2026-07-14 cs.RO 新提交

AutoPath: Learning Transferable Goal-Conditioned Stochastic Path Prior for Safe Navigation Without Human Demonstrations

AutoPath:学习可转移的目标条件随机路径先验以实现无人类示范的安全导航

Ziyang Zhang, Boyang Zhou, Zesong Yang, Haocheng Peng, Zeming Gai, Xiao Liang, Yujun Shen, Danping Zou, Ruizhen Hu, Hujun Bao, Zhaopeng Cui

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Shenzhen University(深圳大学)

AI总结 研究在复杂环境下的安全导航问题,提出学习可转移目标条件随机路径先验的方法,引入规范状态表示和结构化先验学习框架,实验证明该方法成功率高、效率有竞争力且可跨平台转移。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11487 2026-07-14 cs.CL cs.AI cs.CV cs.HC cs.MM 新提交

LightMem-Ego: Your AI Memory for Everyday Life

LightMem-Ego:适用于日常生活的人工智能记忆

Yijun Chen, Boyi Xiao, Yixian Zhao, Haoting Xia, Buqiang Xu, Jizhan Fang, Yanya Li, Yaqi Zheng, Xuehai Wang, Zirui Xue, Liuxin Zhang, Hui Li, Ningyu Zhang

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Central China Normal University(华中师范大学) Lenovo Group Limited(联想集团有限公司)

AI总结 针对移动和可穿戴设备上个人AI助手回答过去经历查询难的问题,提出LightMem-Ego轻量级流多模态记忆系统,能捕获、对齐并组织视觉和音频流成分层记忆,基于多模态证据生成答案,可部署在多种设备上提供多种支持。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11339 2026-07-14 cs.CV 新提交

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11184 2026-07-14 cs.RO 新提交

GeoGS-SLAM: Online Monocular Reconstruction Using Gaussian Splatting with Geometric Priors

GeoGS-SLAM:使用带几何先验的高斯点云的在线单目重建

Ruilan Gao, Letian Jin, Yu Zhang

机构 * State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University(工业控制技术国家重点实验室,浙江大学控制科学与工程学院) Key Laboratory of Collaborative Sensing and Autonomous Unmanned Systems of Zhejiang Province(浙江省协同感知与自主无人系统重点实验室)

AI总结 研究提出GeoGS-SLAM在线单目密集重建系统,结合3DGS地图表示与几何先验。利用前馈模型预测先验,通过采样扩展地图,粗到细优化姿态和地图,纳入回环检测与姿态图优化,实验表明其在质量、精度和实时性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10970 2026-07-14 cs.LG 新提交

Enhanced Byzantine-Robust Federated Learning Via Truncated-Quadratic Loss for Heterogeneous Data

通过截断二次损失实现增强的拜占庭鲁棒联邦学习以处理异构数据

Zhi-Yong Wang, Hao Nan Sheng, Werner Stefan, Hing Cheung So, Linqi Song, Weitao Xu

机构 * Ocean College, Zhejiang University(浙江大学海洋学院) City University of Hong Kong(香港城市大学) Aalto University(阿尔托大学)

AI总结 针对联邦学习中恶意攻击和数据异构性问题,提出利用截断二次损失的新鲁棒聚合规则,减轻现有方法偏差,在非凸损失函数和异构数据下实现最优阶拜占庭鲁棒学习,实验证明该聚合器鲁棒性优于其他技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10690 2026-07-14 cs.CV 新提交

Incremental Online Scene Reconstruction by 3D Gaussian Triangulation

基于3D高斯三角剖分的增量式在线场景重建

Yanjin Zhu, Shaofan Liu, Jianke Zhu

机构 * Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 研究增量式在线场景重建问题,提出通过直接对密集几何高斯表示三角剖分来重建和更新显式网格的方法,还给出直接网格化算法及相关约束,实验证明该方法性能优于传统高斯方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10677 2026-07-14 cs.LG cs.CL 新提交

From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers

从自注意力到连接拉普拉斯算子:Transformer的统一算子视角

Binbin Lin, Wei Chen, Yalun Li, Wenxiao Wang, Jieping Ye, Xiaofei He

机构 * Zhejiang University(浙江大学) Alibaba Cloud(阿里云)

AI总结 研究从算子视角理解自注意力,将令牌序列视为向量场,证明单头和多头注意力的性质及相关条件,通过实验发现不同规模和结构的训练Transformer呈现与理论一致的几何结构,提供连接自注意力与几何算子的形式及分析工具。

Comments 29 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10299 2026-07-14 cs.LG 新提交

Empowering Long-form Omni-modal Understanding with Robust Audio Perception

通过强大的音频感知增强长格式全模态理解

Kaiying Yan, Luoyi Sun, Xiao Zhou, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学 上海人工智能研究院) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 为解决全模态理解不足问题,提出AVDC数据集及AVDC-QA-CoT数据集,利用现成模型标注视频,采用两阶段训练范式,在多下游任务实验中取得显著性能提升,推动全模态感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10244 2026-07-14 cs.LG 新提交

DSSMs: State Space Models with Explicit Memory via Delay Differential Equations

DSSMs:通过延迟微分方程实现的具有显式记忆的状态空间模型

Yixiao Qian, Song Chen, Jiaxu Liu, Shengze Cai, Chao Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Mathematics, National University of Singapore(新加坡国立大学数学系) School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院)

AI总结 研究针对状态空间模型压缩历史信息能力有限的问题,提出延迟状态空间模型DSSMs,通过显式延迟状态反馈增强离散SSM循环,推导传递函数在频域计算内核,解决相关工具难题,在延迟检索任务上有显著改进,性能优于S4D。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09773 2026-07-14 cs.AI cs.CL cs.LG 新提交

EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

EvoCUA-1.5:用于多轮计算机使用智能体的在线强化学习

Mianqiu Huang, Taofeng Xue, Chong Peng, Jinrui Ding, Sicheng Fan, Jiale Hong, Yufei Gao, Xiaocheng Zhang, Linsen Guo, Xin Yang, Dengchang Zhao, Yuchen Xie, Peng Pei, Xunliang Xie, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 研究多轮计算机使用智能体的在线强化学习问题,提出EvoCUA-1.5,通过STEPO、DTAC等方法应对多轮交互挑战,经实验验证其提高了训练稳定性和下游性能,为在线强化学习提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09711 2026-07-14 cs.LG cs.SE 新提交

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

EvoClawBench:智能体能否从自身运行中学习可复用技能?

Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Hithink Research(同花顺研究院)

AI总结 研究智能体能否从自身运行学可复用技能,引入EvoClawBench基准测试,涵盖多任务多子问题并支持多运行时。实验对比不同方式,发现直接基线性能依赖运行时,自我创作技能效果各异,表明学习可复用技能有选择性且成本敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09709 2026-07-14 cs.AI cs.SE 新提交

The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation

验证器即课程:用于跨家族游戏生成的执行门控自蒸馏

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对游戏生成中代码生成器的优化,提出执行门控自蒸馏方法,通过严格启动过滤器提升跨家族泛化能力,在GameCraft-Bench上实验表明该方法显著提高干净生成率和覆盖率,验证器对模型学习有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏