arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2509.10247 2026-06-04 cs.RO cs.AI

DiffAero: A GPU-Accelerated Differentiable Simulation Framework for Efficient Quadrotor Policy Learning

DiffAero: 一种用于高效四旋翼策略学习的GPU加速可微分仿真框架

Xinhong Zhang, Runqing Wang, Yunfan Ren, Jian Sun, Hao Fang, Jie Chen, Gang Wang

机构 * State Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(自主智能无人系统国家重点实验室,北京理工大学) Zhongguancun Academy(中关村academy) Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 提出DiffAero,一种轻量级、GPU加速且完全可微的仿真框架,通过并行化物理与渲染实现高效四旋翼控制策略学习,并在消费级硬件上数小时内训练出鲁棒策略。

Comments 8 pages, 11 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08036 2026-06-04 cs.LG cs.AI

Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning

合作多智能体强化学习中潜在最优联合动作识别

Chang Huang, Shatong Zhu, Junqiao Zhao, Hongtu Zhou, Di Zhang, Hai Zhang, Chen Ye, Ziqiao Wang, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Stanford University(斯坦福大学) MOE Key Lab of Embedded System and Service Computing, Tongji University, Shanghai, China(同济大学嵌入式系统与服务计算教育部重点实验室,上海,中国) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 针对值函数分解中单调性约束限制表达能力的问题,提出潜在最优联合动作加权方法,通过迭代加权训练保证最优策略恢复,在多个任务上超越现有方法。

Comments ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.00846 2026-06-04 cs.LG cs.CV cs.SY eess.SY stat.ML

Towards Understanding Regularization in Batch Normalization

向批量归一化中的正则化理解迈进

Ping Luo, Xinjiang Wang, Wenqi Shao, Zhanglin Peng

机构 * The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院) The University of Hong Kong(香港大学)

AI总结 本文通过理论分析探讨了批量归一化在神经网络训练中的收敛性和泛化能力,揭示了批量归一化作为隐式正则化的作用,并通过实验验证了其在卷积神经网络中的正则化特性。

Comments International Conference on Learning Representations (ICLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.06128 2026-06-04 math.NA cs.CV cs.NA

Fast and Accurate Tensor Completion with Total Variation Regularized Tensor Trains

快速且准确的张量补全与总变分正则化张量列车

Ching-Yun Ko, Kim Batselier, Wenjian Yu, Ngai Wong

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子工程系) Delft Center for Systems and Control, Delft University of Technology(代尔夫特理工大学系统与控制中心)

AI总结 本文提出了一种基于张量列车的新型张量补全方法,通过总变分和Tikhonov正则化提升了补全速度和可扩展性,尤其在已知数据极少时表现优异。

Comments 13 pages. Source code and supplemental materials are available via: https://github.com/IRENEKO/TTC Updates 11/13: included more comparisons and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.06114 2026-06-04 cs.LG cs.CV cs.NA math.NA stat.ML

A Support Tensor Train Machine

支持张量列车机

Cong Chen, Kim Batselier, Ching-Yun Ko, Ngai Wong

机构 * The Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系)

AI总结 本文提出支持张量列车机,通过将传统支持张量机中的秩一张量替换为张量列车,提升模型表达能力,实验验证其优于SVM和STM。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03461 2026-06-03 cs.AI

What Makes Interaction Trajectories Effective for Training Terminal Agents?

什么使得交互轨迹对训练终端代理有效?

Sidi Yang, Chaofan Tao, Jierun Chen, Tiezheng Yu, Ruoyu Wang, Yuxin Jiang, Yiming Du, Wendong Xu, Jing Xiong, Taiqiang Wu, Lifeng Shang, Xiaohui Li, Ngai Wong, Haoli Bai

机构 * The University of Hong Kong(香港大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

AI总结 本文通过Terminal-Lego流水线研究交互轨迹的教学效能,发现低分代理(DeepSeek-V3.2)的轨迹比高分代理(Claude Opus 4.6)更能提升学生泛化能力,归因于环境接地监督(EGS),并展示了极佳的数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03435 2026-06-03 cs.AI

CP-Agent: Context-Aware Multimodal Reasoning for Cellular Morphological Profiling under Chemical Perturbations

CP-Agent: 化学扰动下细胞形态学轮廓的上下文感知多模态推理

Yuxin Zhang, Yiyao Li, Ping Shu Ho, Simon See, Zhenqin Wu, Kevin Tsia

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Biomedical Engineering, The University of Hong Kong(香港大学生物医学工程学院) Nvidia AI Technology Center(NVIDIA人工智能技术中心) Advanced Biomedical Instrumentation Centre(先进生物医学仪器中心)

AI总结 提出CP-Agent,一种基于上下文感知对齐模块CP-CLIP的多模态大语言模型,用于生成药物扰动下细胞形态变化的可解释机制性解释,实现高精度处理与机制区分(最大F1分数0.896),并整合工具使用与推理生成结构化报告以加速药物发现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03327 2026-06-03 cs.DB cs.CL

CAPER: Clause-Aligned Process Supervision for Text-to-SQL

CAPER: 面向Text-to-SQL的子句对齐过程监督

Lujie Ban, Jiasheng Shi, Jinyang Li, Xiaolin Han, Tsz Nam Chan, Chenhao Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) Northwestern Polytechnical University(西北工业大学) Shenzhen University(深圳大学)

AI总结 提出CAPER方法,通过反事实干预SQL抽象语法树自动推导子句级监督,训练轻量级Clause-PRM模型CAPER-9B,用于策略优化和候选验证,在BIRD和Spider数据集上提升了执行准确率和故障定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03127 2026-06-03 cs.RO

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

TTT-VLA:面向视觉-语言-动作模型的测试时潜在提示优化

Wenbo Zhang, Jianxiong Li, Shuai Yang, Sijin Chen, Jiajun Liu, Lingqiao Liu, Xiao Ma

机构 * ByteDance Seed(字节跳动种子) The University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) CSIRO Data61

AI总结 提出TTT-VLA框架,通过测试时优化潜在提示来适应分布偏移,无需修改策略本身,在SimperEnv上提升单/多实体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03103 2026-06-03 cs.AI

DeskCraft: Benchmarking Desktop Agents on Professional Workflows and Human-in-the-Loop Collaboration

DeskCraft: 桌面代理在专业工作流与人在环协作中的基准测试

Wenkai Wang, Tao Xiong, Jingchen Ni, Yunpeng Bao, Xiyun Li, Tianqi Liu, Hongcan Guo, Zilong Huang, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Tencent(腾讯) The University of Hong Kong(香港大学)

AI总结 提出DeskCraft基准,针对专业创意软件中的长周期工作流和主动人机协作,通过多级难度分类和交互协议评估18种代理,发现GPT-5.4在标准任务上达31.6%,交互任务上达27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02779 2026-06-03 cs.LG

Optimal Rates for Generalization of Gradient Descent for Deep ReLU Classification

深度ReLU分类中梯度下降泛化的最优速率

Yuanfan Li, Yunwen Lei, Zheng-Chu Guo, Yiming Ying

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Department of Mathematics, The University of Hong Kong(香港大学数学系) School of mathematics and statistics, University of Sydney(悉尼大学数学与统计学学院)

AI总结 针对深度ReLU网络,通过权衡优化与泛化误差,在NTK可分离假设下证明了梯度下降的泛化误差率为~O(L^6/(nγ^2)),与SVM最优率仅差深度相关因子,关键技术是控制参考模型附近的激活模式以得到更紧的Rademacher复杂度界。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01879 2026-06-02 cs.CL

CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs

CultureForest:理解与评估大语言模型中的文化规范推理

Yangfan Ye, Xiaocheng Feng, Jialong Tang, Xiayu Cao, Zihan Zhang, Xiachong Feng, Baosong Yang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Harvard University(哈佛大学)

AI总结 为弥补现有研究仅将文化智能视为知识获取问题而忽视实际场景应用的不足,提出CultureForest基准,通过基于原子规范的推理任务评估模型,发现顶级模型在开放式生成中性能大幅下降,并揭示推理能力瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01048 2026-06-02 cs.CV

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

解耦残差去噪扩散模型用于统一且数据高效的图像到图像翻译

Ziyue Lin, Jiahe Hou, Hongyu Xia, Xinrui Xie, Feifei Wang, Yuyin Zhou, Wei Wang, Jiawei Liu, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 提出解耦残差去噪扩散模型(DRDD),通过将扩散过程解耦为随机噪声扩散和确定性残差扩散两个独立阶段,实现统一且数据高效的图像到图像翻译。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00746 2026-06-02 cs.CV cs.LG

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

将并行序列模型扩展到基础规模的视觉编码器

Yitong Jiang, Hongjun Wang, Collin McCarthy, Hanrong Ye, David Wehr, Xinhao Li, Qi Dou, Tianfan Xue, Ka Chun Cheung, Simon See, Wonmin Byeon, Ke Chen, Kai Han, Jinwei Gu, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 提出C-GSPN,一种基于2D空间传播的基础规模视觉编码器,通过快速CUDA内核、压缩潜在空间传播块和两阶段交叉算子蒸馏,在减少参数的同时提升性能并实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00605 2026-06-02 cs.LG stat.ML

Looped Transformers with Layer Normalization Provably Learn the Power Method

带有层归一化的循环Transformer可证明地学习幂方法

Lyumin Wu, Chenyang Zhang, Yuan Cao

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

AI总结 本文通过主成分预测任务,证明带有层归一化的循环线性Transformer在梯度下降训练下会收敛到实现幂方法的解,揭示了层归一化带来的算法隐式偏差。

Comments 70 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00113 2026-06-02 cs.RO

World Models for Robotic Manipulation: A Survey

机器人操作的世界模型:综述

Fangyuan Wang, Ziyuan Wang, Guorui Pei, Mengshi Zhang, Canxi Liang, Jun Hu, Zhongxuan Li, Jinsong Wu, Ning Han, Zeqing Zhang, Jiaming Qi, Hongmin Wu, Shiyao Zhang, Pai Zheng, Jia Pan, David Navarro-Alarcon, Sichao Liu, Peng Zhou

机构 * Department of Mechanical Engineering, The Hong Kong Polytechnic University(香港理工大学机械工程系) Department of Mechanical Engineering and Automation, Harbin Institute of Technology(哈尔滨工业大学机械工程与自动化系) School of Advanced Engineering, Great Bay University(大湾大学先进工程学院) College of Robotics Science and Engineering, Taiyuan University of Technology(太原科技大学机器人科学与工程学院) School of Data Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)数据科学学院) Department of Mechatronic Engineering, Guangdong Polytechnic Normal University(广东 polytechnic 正常大学机电工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Mechanical and Electrical Engineering, Northeast Forestry University(东北林业大学机械与电气工程学院) Greater Bay Area National Center of Technology Innovation(粤港澳大湾区国家技术创新中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

AI总结 本文通过三个问题(预测什么未来表示、预测如何与动作连接、何时在机器人学习流程中使用预测)系统综述了机器人操作中的世界模型,将其定义为动作条件预测系统,并分类为五种表示族,提出了功能分类法,总结了基础设施角色、数据集和评估协议,揭示了从任务特定动力学预测器向预测基础设施的演变及开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13548 2026-06-02 cs.RO cs.AI

AttenA+: Rectifying Action Inequality in Robotic Foundation Models

AttenA+: 纠正机器人基础模型中的动作不平等性

Daojie Peng, Fulong Ma, Jiahang Cao, Qiang Zhang, Xupeng Xie, Jian Guo, Ping Luo, Andrew F. Luo, Boyu Zhou, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) IDEA Research(IDEA研究院) SUSTech(南方科技大学) X-Humaniod

AI总结 针对机器人基础模型忽视动作物理重要性的问题,提出AttenA+框架,通过速度驱动的动作注意力重加权训练目标,提升复杂长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13511 2026-06-02 cs.CL cs.AI

Many-Shot CoT-ICL: Making In-Context Learning Truly Learn

Many-Shot CoT-ICL: 使上下文学习真正学习

Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung

机构 * The University of Hong Kong(香港大学)

AI总结 研究多示例思维链上下文学习在推理任务中的特性,提出曲线演示选择方法,在数学任务上提升5.42个百分点。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24727 2026-06-02 cs.AI cs.CL cs.CY cs.IT math.IT

Fundamental Limitation in Explaining AI

解释AI的根本限制

Atsushi Suzuki, Jing Wang

机构 * Department of Mathematics Faculty of Science(科学学院数学系) The University of Hong Kong Hong Kong SAR(香港大学香港特别行政区) School of Computing and Mathematical Sciences Faculty of Engineering and Science(工程与科学学院计算与数学科学系) University of Greenwich United Kingdom(格林威治大学英国)

AI总结 本文通过数学证明了一个解释AI的基本四难困境,指出AI及其解释无法同时满足环境复杂性、AI性能优良、解释可解释性和解释完全忠实性四个条件,从而表明AI治理应基于解释忠实性总是不完整的假设。

Comments minor modifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12369 2026-06-02 cs.RO

GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization

GuidedVLA: 通过即插即用的动作注意力特化指定任务相关因素

Xiaosong Jia, Bowen Yang, Zuhao Ge, Xian Nie, Yuchen Zhou, Cunxin Fan, Yufeng Li, Yilin Chai, Chao Jing, Zijian Liang, Qingwen Bu, Haidong Cao, Chao Wu, Qifeng Li, Zhenjie Yang, Chenhe Zhang, Hongyang Li, Zuxuan Wu, Junchi Yan, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学) OpenDriveLab, The University of Hong Kong(OpenDrive实验室,香港大学)

AI总结 提出GuidedVLA框架,通过为动作解码器中的注意力头分配人工定义的辅助信号(如物体定位、空间几何、时序技能逻辑),显式引导模型关注任务相关因素,提升VLA模型在域内和域外场景的成功率。

Comments Accepted to RSS 2026. Project page: https://guidedvla.github.io/project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09292 2026-06-02 cs.RO cs.CV

See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation

看、规划、回退:面向鲁棒机器人操作的进度感知视觉-语言-动作模型

Tingjun Dai, Mingfei Han, Tingwen Du, Zhiheng Liu, Zihao Zhang, Zhihui Li, Salman Khan, Jun Yu, Xiaojun Chang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) University of Technology Sydney(新南威尔士大学) Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(人工智能与计算机视觉系,Mohamed Bin Zayed人工智能大学) The University of Hong Kong(香港大学) Institute of AI for Industry, Chinese Academy of Sciences(产业人工智能研究所,中国科学院) School of Intelligent Science and Engineering, Harbin Institute of Technology (Shenzhen)(智能科学与工程学院,哈尔滨工业大学(深圳))

AI总结 提出进度感知的视觉-语言-动作框架SPR,通过动态将语言指令映射为空间子目标序列,并利用闭环进度监控实现错误恢复,在LIBERO基准上提升5%性能,在LIBERO-Plus上展现最先进的鲁棒性。

Comments Suggested to CVPR Findings. https://tingjundai.github.io/SPRVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18046 2026-06-02 cs.RO cs.AI cs.ET cs.SY eess.SP eess.SY

HuMam: Humanoid Motion Control via End-to-End Deep Reinforcement Learning with Mamba

HuMam: 基于Mamba的端到端深度强化学习人形机器人运动控制

Yinuo Wang, Yuanyang Qi, Jinzhao Zhou, Pengxiang Meng, Xiaowen Tao

机构 * College of Graduate and Professional Studies, Trine University(特灵大学研究生与专业研究学院) Department of Civil Engineering, University of Hong Kong(香港大学土木工程系) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼大学工程与信息技术学院) National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与生物仿生国家重点实验室) School of Computer Science and Statistics, Trinity College Dublin(都柏林信任学院计算机科学与统计学系)

AI总结 提出HuMam框架,使用单层Mamba编码器融合状态与步态目标,通过PPO优化实现人形机器人稳定高效的端到端运动控制。

Comments 12 pages

Journal ref 2026 IEEE International Conference on Cybernetics and Intelligent Systems (CIS) and IEEE International Conference on Robotics, Automation and Mechatronics (RAM) (CIS-RAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00415 2026-06-02 cs.AI cs.LG

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models

PolarMem: 一种无需训练的可验证视觉语言模型极化隐式图记忆

Zhisheng Chen, Tingyu Wu, Zijie Zhou, Zhengwei Xie, Jinhan Li, Ziyan Weng, Liang Lin, Jingwei Song, Zikai Xiao, Yingwei Zhang

机构 * ICT, CAS(中国科学院信息科技研究院) UCAS(中国科学院大学) CUPB(中国政法大学) USTC(中国科学技术大学) CityU-DG(城市大学-数据科学) HKU(香港大学) ZJU(浙江大学)

AI总结 提出PolarMem,一种无需训练的极化隐式图记忆框架,通过语义一致性验证和自适应分布划分将视觉语言模型感知信号转化为HAS、NOT_HAS和Uncertain记忆状态,并采用词典逻辑感知检索协议优先保证逻辑一致性,从而提升检索密集型任务性能并减少矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09953 2026-06-02 cs.RO cs.AI

DAG-Plan: Generating Directed Acyclic Dependency Graphs for Dual-Arm Cooperative Planning

DAG-Plan:生成有向无环依赖图用于双臂协作规划

Zeyu Gao, Yao Mu, Jinye Qu, Mengkang Hu, Shijia Peng, Chengkai Hou, Lingyue Guo, Ping Luo, Shanghang Zhang, Yanfeng Lu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机科学学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室,OpenGVLab)

AI总结 提出DAG-Plan框架,首次使用有向无环图作为双臂协调的核心表示,通过一次LLM解析生成结构化DAG,实现自适应并行执行,在双臂厨房基准测试中成功率提升48%,执行效率提升84.1%。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19444 2026-06-02 cs.LG math.OC stat.ML

Towards Simple and Provable Parameter-Free Adaptive Gradient Methods

迈向简单且可证明的无参数自适应梯度方法

Yuanzhe Tao, Yifeng Liu, Huizhuo Yuan, Xun Zhou, Yuan Cao, Quanquan Gu

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) School of Computing and Data Science, the University of Hong Kong(香港大学计算科学与数据科学学院) Bytedance Inc(字节跳动公司)

AI总结 提出 AdaGrad++ 和 Adam++ 两种简单无参数自适应梯度方法,在无需预设学习率的情况下实现与 AdaGrad 和 Adam 相当的收敛保证。

Comments 45 pages, 19 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31336 2026-06-01 cs.CV

DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory

DecMem:基于解耦记忆的分钟级一致世界生成

Zhenhao Yang, Xiaoshi Wu, Zhengyao Lv, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Kun Gai, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 提出解耦记忆架构DecMem,通过稀疏全局记忆和锚定局部记忆解决长程视频生成中的时空一致性问题,实现分钟级可控长视频生成。

Comments Project page is available at https://jeffreyyzh.github.io/DecMem-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31314 2026-06-01 cs.RO

AR Forcing: Towards Long-Horizon Robot Navigation World Model

AR Forcing: 迈向长时域机器人导航世界模型

Yifei Yang, Zehua Fan, Huan Li, Aoqi Wang, Lida Huang, Haibao Yu, Haiyan Liu, Xuanyao Mao, Jason Bao, Liang Xu, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Shanghai Jiao Tong University(上海交通大学) School of Safety Science, Tsinghua University(清华大学安全科学学院) The University of Hong Kong(香港大学) Lenovo, Beijing, China(北京联想公司)

AI总结 提出AR Forcing自回归训练策略,通过将扩散损失集成到自回归训练循环中,解决训练与推理分布偏移问题,提升长时域导航中图像一致性和轨迹预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31210 2026-06-01 cs.RO cs.AI

Simulation of collision avoidance behavior in crowd movement by data-driven approach

基于数据驱动方法的群体运动碰撞规避行为模拟

Xuanwen Liang, Eric Wai Ming Lee

机构 * Department of Architecture and Civil Engineering(建筑与土木工程系) University of Hong Kong(香港大学)

AI总结 针对数据驱动人群模拟中碰撞率高的问题,提出一种结合碰撞惩罚的生成对抗网络(CPGAN),通过侧向加速度碰撞损失函数和Voronoi特征提取方法,有效降低双向流中的对向碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31096 2026-06-01 cs.CV

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Independent Researcher(独立研究者) University of Science and Technology of China(中国科学技术大学)

AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏