arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2605.19120 2026-05-20 cs.RO

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17804 2026-05-20 cs.LG eess.SP

GenTS: A Comprehensive Benchmark Library for Generative Time Series Models

GenTS:生成时间序列模型的综合基准库

Chenxi Wang, Xiaorong Wang, Peiyang Li, Yi Wang

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学)

AI总结 本文提出GenTS,一个用于系统评估生成时间序列模型的综合且可扩展的基准库,通过统一的数据预处理流程、多样化的模型集合和全景评估指标,为生成模型提供了更灵活的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19892 2026-05-20 cs.GR cs.AI

An Efficient Multilevel Preconditioned Nonlinear Conjugate Gradient Method for Incremental Potential Contact

一种高效的多级预条件非线性共轭梯度法用于增量势接触

Yu Zhang, Xing Shen, Kemeng Huang, Wei Chen, Yin Yang, Taku Komura, Tiantian Liu, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Hong Kong(香港大学) Zhejiang University(浙江大学) University of Utah(犹他大学) Independent Researcher(独立研究者)

AI总结 本文提出了一种名为MAS-PNCG的方法,通过引入稀疏输入Woodbury更新算法,实现了多级预条件在非线性优化中的应用,从而在接触问题中提高了收敛速度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13111 2026-05-20 cs.CV cs.GR

Motion-2-To-3: Leveraging 2D Motion Data for 3D Motion Generations

Motion-2-To-3: 利用2D运动数据进行3D运动生成

Ruoxi Guo, Huaijin Pi, Zehong Shen, Qing Shuai, Zechen Hu, Zhumei Wang, Yajiao Dong, Ruizhen Hu, Taku Komura, Sida Peng, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Deep Glint The University of Hong Kong(香港大学) Shenzhen University(深圳大学)

AI总结 本文提出了一种利用2D视频中提取的运动数据来改进基于文本的3D运动生成的方法,通过解耦局部关节运动和全局运动,有效学习局部运动先验,从而提升生成的3D人体运动的真实性和多样性。

Comments Project page: https://zju3dv.github.io/Motion-2-to-3/

Journal ref 2025 IEEE/CVF International Conference on Computer Vision (ICCV), Honolulu, HI, USA, 2025, pp. 14305-14316

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18822 2026-05-20 cs.LG cs.AI

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

Hybrid-LoRA: 桥接全微调与低秩适应以实现训练后优化

Chengqian Zhang, Wei Zhu, Kyumin Lee

机构 * Worcester Polytechnic Institute(沃斯特理工学院) University of Hong Kong(香港大学)

AI总结 本文提出Hybrid-LoRA框架,通过选择性地对部分模块进行全微调,其余模块使用LoRA进行适应,从而在训练后优化中实现高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18722 2026-05-19 cs.RO

Dexora: Open-source VLA for High-DoF Bimanual Dexterity

Dexora: 开源的高自由度双臂灵巧性VLA系统

Zongzheng Zhang, Jingrui Pang, Zhuo Yang, Kun Li, Minwen Liao, Saining Zhang, Guoxuan Chi, Jinbang Guo, Huan-ang Gao, Modi Shi, Dongyun Ge, Yao Mu, Jiayuan Gu, Rui Chen, Hao Dong, Huazhe Xu, Li Yi, Yixin Zhu, Hang Zhao, Pengwei Wang, Shanghang Zhang, Guocai Yao, Jianyu Chen, Hongyang Li, Hao Zhao

机构 * Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海科技大学) Peking University(北京大学)

AI总结 本文提出Dexora,首个开源的VLA系统,旨在双臂双手高自由度操作,通过混合遥控管道分离粗臂运动和精细手指运动,结合物理平台和数字孪生,构建大规模训练数据集,并提出数据质量感知训练方法,实验证明其在基础和灵巧任务上的优越性能。

Comments Accpeted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18611 2026-05-19 cs.RO

Unified Walking, Running, and Recovery for Humanoids via State-Dependent Adversarial Motion Priors

通过状态依赖对抗运动先验实现人形机器人的统一行走、跑步和恢复

Yidan Lu, Yichao Zhong, Liu Zhao, Wanyue Li, Peng Lu

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一的强化学习框架,使单个策略能够在Unitree G1人形机器人上实现行走、跑步和跌倒恢复,且无需在部署时显式切换模式。该框架通过将传统全局参考分布替换为状态依赖的门控机制,将每个训练过渡路由到两个判别器中:一个专用的恢复判别器和一个基于速度的运动判别器,共同覆盖行走和跑步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18390 2026-05-19 cs.CV

Vision Foundation Models as Generalist Tokenizers for Image Generation

视见过滤模型作为图像生成的通用标记器

Anlin Zheng, Qi Han, Xin Wen, Chuofan Ma, Lanxi Gong, Gang Yu, Xiangyu Zhang, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) StepFun

AI总结 本文提出了一种基于冻结视见过滤模型(VFM)的通用图像标记器VFMTok,通过区域自适应量化框架和语义重建目标,提升了图像生成的质量和效率,同时在离散和连续潜在空间中实现了高保真度的类别条件合成。

Comments 4 figures and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18334 2026-05-19 cs.CV cs.GR

3D Skew Gaussian Splatting with Any Camera Trajectory Visualization Engine

具有任意相机轨迹可视化引擎的3D斜高斯散射

Beizhen Zhao, Yifan Zhou, Gaochao Song, Ziran Yin, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 本文提出3D斜高斯散射(3DSGS),通过引入斜高斯分布来提升3D高斯散射的结构保真度和紧凑性,以解决对称高斯分布在捕捉形状和颜色不连续性方面的不足,从而提高可视化效果和空间数据探索的准确性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18257 2026-05-19 cs.CV cs.AI cs.CL

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

CodeBind: 一种用于多模态对齐的解耦表示学习框架

Zeyu Chen, Jie Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(视觉人工智能实验室,香港大学)

AI总结 CodeBind通过统一的组合代码本设计优化多模态表示空间,解决了传统方法在跨模态信息差异和数据稀缺导致的对齐空间不足问题,实现了多模态分类和检索任务中的最佳性能。

Comments ACL 2026 Findings; Project page: https://visual-ai.github.io/codebind

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17971 2026-05-19 cs.CR cs.AI

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

Babel: 通过混淆分布优化采样实现安全机制的 jailbreak 安全性

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) Southeast University(东南大学) University of Hong Kong(香港大学)

AI总结 本文研究了大语言模型安全机制中的内在漏洞,提出了一种高效的黑盒攻击框架Babel,通过系统性的混淆采样和反馈驱动的分布优化,实现了高成功率的jailbreak攻击,展示了在LLM安全研究中的稳健方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17912 2026-05-19 cs.RO cs.CV

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17444 2026-05-19 cs.SE cs.AI cs.CL

MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair

MemRepair:用于代理级漏洞修复的分层内存

Simiao Liu, Li Zhang, Fang Liu, Xiaoli Lian, Yang Liu, Yinghao Zhu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11854 2026-05-19 cs.CL

Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models

自蒸馏轨迹感知玻尔兹曼建模:弥合扩散语言模型训练-推理差异

Kecheng Chen, Ziru Liu, Xijia Tao, Hui Liu, Yibing Liu, Xinyu Fu, Shi Wu, Suiyun Zhang, Dandan Tu, Lingpeng Kong, Rui Liu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究) The University of Hong Kong(香港大学)

AI总结 本文研究了如何利用自蒸馏轨迹进行真正的知识获取,而非仅加速推理。提出TABOM框架,通过玻尔兹曼建模对推理解屏蔽偏好建模,从而在新领域中提升扩散语言模型的表现并缓解灾难性遗忘。

Comments Project website: https://tonyckc.github.io/TABOM-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24763 2026-05-19 cs.CV

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

Tuna-2:像素嵌入在多模态理解和生成中优于视觉编码器

Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, Yuren Cong

机构 * Meta AI The University of Hong Kong(香港大学) University of Waterloo(滑铁卢大学)

AI总结 本文提出Tuna-2,一种基于像素嵌入的统一多模态模型,通过直接使用像素嵌入进行多模态理解和生成,展示了统一像素空间建模在高质量图像生成中可以与潜在空间方法竞争,并证明了预训练视觉编码器在多模态建模中并非必要。

Comments Project page: https://tuna-ai.org/tuna-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17281 2026-05-19 cs.SE cs.AI

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench: LLM Agents能否保持观察契约?

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) University of Hong Kong(香港大学)

AI总结 本文提出ContractBench基准测试,用于评估LLM代理在保持观察契约(如时间有效性及字节完整性)方面的能力,发现现有模型在该任务上仍存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17279 2026-05-19 cs.SE cs.AI

Rover: Context-aware Conflict Resolution with LLM

Rover: 基于上下文的冲突解决系统

Qingyu Zhang, Junzhe Li, Jiayi Lin, Changhua Luo, Chenxiong Qian

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

AI总结 本文提出Rover,一种结合程序分析和大语言模型的冲突解决系统,通过多层代码属性图获取上下文感知提示,提升代码合并的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16981 2026-05-19 cs.CV

Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction

重新思考长序列递归3D重建中的状态更新门

Kejun Ren, Lei Jin, Tianxin Huang, Lianming Xu, Li Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院)

AI总结 本文针对长序列递归3D重建中状态更新门的结构瓶颈问题,提出一个基于帧级的门控机制,通过闭式解推导出无需参数、训练和额外前向传递的标量帧级门,从而在多个基准测试中显著提升了精度并保持了常量内存使用。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16807 2026-05-19 cs.CV

DecoRec: Decomposed 3D Scene Reconstruction from Single-View Images via Object-Level Diffusion

DecoRec: 通过物体级扩散进行单视图图像的分解3D场景重建

Yuhan Ping, Yuan Liu, Xiaoxiao Long, Peng Wang, Junhui Hou, Jianyi Zheng, Jia Pan, Xin Li, Cheng Lin

机构 * Department of Computer Science, the University of Hong Kong(香港大学计算机科学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Faculty of Humanities and Arts, Macau University of Science and Technology(澳门科学理工学院人文艺术学院) Department of Computer Science and Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science and Engineering, Macau University of Science and Technology(澳门科学理工学院计算机科学与工程系)

AI总结 本文提出DecoRec系统,通过物体级扩散方法实现单视图图像的分解3D场景重建,解决了现有方法在场景重建中出现的精度问题,并通过可微渲染和扩散引导细化技术提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19199 2026-05-19 cs.RO cs.CV

FASTER: Rethinking Real-Time Flow VLAs

FASTER:重新思考实时流视频语言动作

Yuxiang Lu, Zhe Liu, Xianzhe Fan, Zhenya Yang, Jinghua Hou, Junyi Li, Kaixin Ding, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人)

AI总结 本文提出FASTER方法,通过引入时间感知调度策略,显著降低实时流视频语言动作系统的反应延迟,提升动态任务中的轨迹生成效率与质量。

Comments Project page: https://innovator-zero.github.io/FASTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12633 2026-05-19 cs.RO

Real-to-Sim for Highly Cluttered Environments via Physics-Consistent Inter-Object Reasoning

通过物理一致的物体间推理实现高密度环境下的现实到仿真

Tianyi Xiang, Jiahang Cao, Sikai Guo, Guoyang Zhao, Andrew F. Luo, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) Institute of Data Science, The University of Hong Kong(香港大学数据科学学院)

AI总结 本文提出一种物理约束的现实到仿真管道,通过接触图建模空间依赖性,提升高密度环境中的物体姿态和物理属性的精确性,实现高物理保真度的仿真场景。

Comments Project page: https://physics-constrained-real2sim.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22678 2026-05-19 cs.LG

Full-Graph vs. Mini-Batch Training: Comprehensive Analysis from a Batch Size and Fan-Out Size Perspective

全图与小批量训练:从批量大小和Fan-Out大小视角的综合分析

Mengfan Liu, Da Zheng, Junwei Su, Chuan Wu

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团)

AI总结 本文从批量大小和Fan-Out大小角度系统比较了全图与小批量GNN训练方法,通过实证和理论分析揭示了批量大小和Fan-Out大小对模型收敛和泛化的影响,为超参数调优提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16275 2026-05-19 cs.CY cs.AI cs.CL cs.MM

AI Slop or AI-enhancement? Student perceptions of AI-generated media for an English for Academic Purposes course

AI 产出物还是AI增强?英语学术用途课程中学生对AI生成媒体的看法

David James Woo, Deliang Wang, Kai Guo

机构 * Everwrite Limited(Everwrite有限公司) Faculty of Education, The University of Hong Kong(香港大学教育学院) Faculty of Education, The Chinese University of Hong Kong(香港中文大学教育学院)

AI总结 研究探讨了AI生成内容在EAP课程中的教学效果,通过混合方法分析发现学生偏好视觉化内容,视频与学业表现正相关,但高认知负荷与成绩负相关,表明需合理设计内容以提升学习效果。

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01683 2026-05-19 cs.CL cs.AI

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

手术式后训练:用于知识保留的近端策略蒸馏

Wenye Lin, Kai Han

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出SPOT框架,通过近端策略蒸馏在后训练中保留知识,提升推理性能,实验表明其在少量数据下显著提升模型准确率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28111 2026-05-18 cs.RO

GSDrive: Reinforcing Driving Policies by Multi-mode Future Trajectory Probing with 3D Gaussian Splatting Environment

GSDrive: 通过多模式未来轨迹探查与3D高斯点散布环境强化驾驶策略

Ziang Guo, Chen Min, Xuefeng Zhang, Yixiao Zhou, Shuo Wang, Sifa Zheng, Dzmitry Tsetserukou, Zufeng Zhang

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(斯克尔科维科学与技术研究院智能空间机器人实验室) Research Center for Intelligent Computing Systems, SKLP, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所智能计算系统研究中心,SKLP) Department of Electrical and Electronic Engineering, The University of Hong Kong, China(香港大学电子与电气工程系) SuZhou Automotive Research Institute, Tsinghua University(清华大学苏州汽车研究院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

AI总结 GSDrive通过多模式轨迹探查和3D高斯点散布环境,结合模仿学习与强化学习,提升端到端自动驾驶的训练效果与鲁棒性。

Comments 2nd version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15661 2026-05-18 cs.CV cs.AI

VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation

VAGS:图像编辑与生成的速率自适应引导尺度

Yan Luo, Ahmadou Aidara, Jingyi Lu, Jeremy Moebel, Kai Han, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) School of Computing and Data Science(计算与数据科学学院) The University of Hong Kong(香港大学) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

AI总结 VAGS通过自适应引导尺度提升图像编辑和生成的结构保真度和生成质量,无需微调或额外计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09869 2026-05-18 cs.RO cs.CV

ConsistNav: Closing the Action Consistency Gap in Zero-Shot Object Navigation with Semantic Executive Control

ConsistNav:通过语义执行控制关闭零样本物体导航中的动作一致性差距

Haosen Wang, Zhenyang Li, Yinqiang Zhang, Zongqi He, Lutao Jiang, Kai Li, Yizhou Zhao, Liaoyuan Fan, Wenjian Hou, Tingbang Liang, Yibin Wen, Defeng Gu

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) City University of Hong Kong(香港城市大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ConsistNav框架,通过语义执行控制模块解决零样本物体导航中动作一致性问题,提升导航精度与鲁棒性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏