arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2796
2604.01337 2026-04-03 cs.LG cs.CV

SECURE: Stable Early Collision Understanding via Robust Embeddings in Autonomous Driving

SECURE: 通过在自动驾驶中鲁棒嵌入实现稳定的早期碰撞理解

Wenjing Wang, Wenxuan Wang, Songning Lai

机构 * Xiamen University Malaysia(厦门大学马来西亚分校) Xinjiang University(新疆大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出SECURE框架,通过定义和强制模型鲁棒性提升自动驾驶中碰撞预测的稳定性与鲁棒性,在DAD和CCD数据集上取得新突破。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01226 2026-04-03 cs.CV cs.SE

DOne: Decoupling Structure and Rendering for High-Fidelity Design-to-Code Generation

DOne:解耦结构与渲染以实现高保真设计到代码生成

Xinhao Huang, Jinke Yu, Wenhao Xu, Zeyi Wen, Ying Zhou, Junzhuo Liu, Junhao Ji, Zulong Chen

机构 * HKUST (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) University of Electronic Science(电子科技大学) Zhejiang Lab(之江实验室)

AI总结 DOne通过解耦结构理解与元素渲染,提升设计到代码生成的高保真度,通过布局分割模块、混合元素检索器和模式引导生成范式,克服了现有方法在结构与细节协调上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00986 2026-04-03 cs.CR cs.AI cs.CL cs.LG

Do Phone-Use Agents Respect Your Privacy?

手机使用代理是否尊重您的隐私?

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu Li, Chenxin Li, Jingyuan Hu, Shunian Chen, Tongxu Luo, Jiaxi Bi, Zeyu Qin, Shaobo Wang, Xin Lai, Pengyuan Lyu, Junyi Li, Can Xu, Chengquan Zhang, Han Hu, Ming Yan, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) Shanghai Jiao Tong University(上海交通大学) Hunyuan Team, Tencent(腾讯混元团队)

AI总结 研究手机使用代理在完成良性移动任务时是否尊重隐私,通过MyPhoneBench框架评估隐私行为,发现任务成功率、隐私合规完成和后续会话偏好使用是不同能力,无单一模型主导。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26546 2026-04-03 cs.CV

AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing

AutoWeather4D:通过G-Buffer双步编辑实现自动驾驶视频天气转换

Tianyu Liu, Weitao Xiong, Kunming Luo, Manyuan Zhang, Peng Li, Yuan Liu, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiamen University(厦门大学) Meituan-M17, Hong Kong(美团-M17,香港)

AI总结 本文提出AutoWeather4D框架,通过G-Buffer双步编辑分离几何与光照,实现高质量天气合成,提供细粒度物理控制,适用于自动驾驶数据生成。

Comments Project Page: https://lty2226262.github.io/autoweather4d/ | Github: https://github.com/lty2226262/AutoWeather4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24239 2026-04-03 cs.PL cs.AI cs.LG

DVM: A Bytecode Virtual Machine Approach for Dynamic Tensor Computation

DVM: 一种用于动态张量计算的字节码虚拟机方法

Jingzhi Fang, Xiong Gao, Renwei Zhang, Zichun Ye, Lei Chen, Jie Zhao, Chengnuo Huang, Hui Xu, Xuefeng Jin

机构 * Huawei(华为) HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) Hunan University(湖南大学)

AI总结 本文提出DVM,通过字节码虚拟机实现实时编译,提升动态张量计算的效率和编译速度,相比其他框架在效率和编译时间上有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17954 2026-04-03 cs.AI cs.CL

ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Scheduling

ExpertFlow:通过预测专家缓存和令牌调度实现高效的混合专家推理

Xin He, Shunkang Zhang, Kaijie Tang, Shaohuai Shi, Yuxin Wang, Zihao Zeng, Zhenheng Tang, Xiaowen Chu, Haiyan Yin, Ivor W. Tsang, Yew Soon Ong

机构 * CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局CFAR) The Hong Kong University of Science and Technology, Hong Kong(香港科技大学) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, Hong Kong(香港浸会大学) Nanyang Technological University, Singapore(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))

AI总结 本文提出ExpertFlow,通过预测专家缓存和令牌调度实现高效的混合专家推理,减少GPU内存使用达93.72%,提升推理吞吐量达10倍。

Comments Accepted in DAC'26, Mixture-of-Experts, Inference, Offloading

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00969 2026-04-02 cs.CV

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30008 2026-04-02 cs.CV

Conditional Polarization Guidance for Camouflaged Object Detection

基于条件极化引导的伪装物体检测

QIfan Zhang, Hao Wang, Xiangrong Qin, Ruijie Li

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出CPGNet框架,通过条件极化引导机制优化RGB特征学习,结合轻量极化交互模块和极化边缘引导频率细化策略,提升伪装物体检测性能。

Comments 11 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19053 2026-04-02 cs.CV cs.RO

TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation

TeFlow:实现多帧监督以实现自监督前馈场景流估计

Qingwen Zhang, Chenhan Jiang, Xiaomeng Zhu, Yunqi Miao, Yushan Zhang, Olov Andersson, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Warwick(华威大学) Linköping University(林雪平大学) Scania(斯堪尼亚)

AI总结 TeFlow通过挖掘时间一致的监督信号,改进多帧监督以提升自监督前馈场景流估计的稳定性与性能,实现33%的性能提升。

Comments CVPR 2026; 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05144 2026-04-02 cs.AI

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型

Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速)

AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。

Comments 31 pages, Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09388 2026-04-02 cs.CV

Learning by Neighbor-Aware Semantics, Deciding by Open-form Flows: Towards Robust Zero-Shot Skeleton Action Recognition

通过邻域感知语义学习,通过开放形式流决策:面向鲁棒零样本骨架动作识别

Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) China University of Geoscience(中国地质大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Flora方法,通过灵活调整文本语义和开放形式分布感知流分类器,解决零样本骨架动作识别中的语义对齐和分类器鲁棒性问题,实验验证其有效性。

Comments Accepted by CVPR 2026 Findings; Project Code: https://github.com/cseeyangchen/Flora

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18314 2026-04-02 cs.AI

Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming

Genesis:为LLM网络代理红队测试演变攻击策略

Zheng Zhang, Jiarui He, Yuchen Cai, Deheng Ye, Peilin Zhao, Ruili Feng, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Nvidia(英伟达)

AI总结 本文提出Genesis框架,通过遗传算法与混合策略表示生成对抗注入,动态发现有效策略并持续优化,提升网络代理攻击效果。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19715 2026-04-02 cs.CL cs.AI cs.LG

Graceful Forgetting in Generative Language Models

生成语言模型中的优雅遗忘

Chunyang Jiang, Chi-min Chan, Yiyang Cai, Yulong Liu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Learning With Forgetting框架,通过Fisher信息矩阵评估并周期性删除无关知识,提升生成语言模型的微调性能。

Comments 8 pages, 6 figures. EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29828 2026-04-01 cs.AI cs.CL

Owl-AuraID 1.0: An Intelligent System for Autonomous Scientific Instrumentation and Scientific Data Analysis

Owl-AuraID 1.0:自主科学仪器与科学数据分析的智能系统

Han Deng, Anqi Zou, Hanling Zhang, Ben Fei, Chengyu Zhang, Haobo Wang, Xinru Guo, Zhenyu Li, Xuzhu Wang, Peng Yang, Fujian Zhang, Weiyu Guo, Xiaohong Shao, Zhaoyang Liu, Shixiang Tang, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong(香港中文大学) Dalian University of Technology(大连理工大学) Suzhou Laboratory(苏州实验室) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 Owl-AuraID 1.0通过GUI原生范式实现科学仪器自动化,整合类型1(仪器操作)和类型2(数据分析)技能,支持FTIR、NMR等多种分析模态,为自主实验室提供可扩展的基础框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29689 2026-04-01 cs.HC cs.AI

KEditVis: A Visual Analytics System for Knowledge Editing of Large Language Models

KEditVis:一种用于大型语言模型知识编辑的可视化分析系统

Zhenning Chen, Hanbei Zhan, Yanwei Huang, Xin Wu, Dazhen Deng, Di Weng, Yingcai Wu

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Hong Kong University of Science and Technology(香港科技大学) School of Software Engineering, South China University of Technology(华南理工大学软件学院) School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 本文提出KEditVis,通过交互式可视化帮助用户深入理解知识编辑,提升编辑效果并发现未来算法改进的洞察。

Comments Accepted by IEEE PacificVis 2026 (TVCG Journal Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29369 2026-04-01 cs.AR cs.LG

AP-DRL: A Synergistic Algorithm-Hardware Framework for Automatic Task Partitioning of Deep Reinforcement Learning on Versal ACAP

AP-DRL: 一种协同算法-硬件框架,用于深度强化学习自动任务划分

Enlai Li, Zhe Lin, Sharad Sinha, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Indian Institute of Technology Goa(印度理工学院果阿分校)

AI总结 AP-DRL通过智能硬件优化,利用Versal ACAP异构架构加速深度强化学习训练,解决算法与硬件协同优化问题,实现高达4.17倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29232 2026-04-01 cs.CL cs.AI cs.LG

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

长文档问答与结构化思维链及微调大语言模型

Zhuowen Liang, Xiaotian Lin, Zhengxuan Zhang, Yuyu Luo, Haixun Wang, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) EvenUp, USA(美国EvenUp公司)

AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。

Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28971 2026-04-01 eess.SY cs.LG cs.SY

A Pontryagin Method of Model-based Reinforcement Learning via Hamiltonian Actor-Critic

基于汉密尔顿量的模型驱动强化学习方法:通过汉密尔顿演员-评论家方法

Chengyang Gu, Yuxin Pan, Hui Xiong, Yize Chen

机构 * Information Hub, HKUST (Guangzhou)(香港科技大学(广州)信息枢纽) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

AI总结 本文提出汉密尔顿演员-评论家方法,通过直接优化汉密尔顿量避免价值函数学习,提升模型驱动强化学习的样本效率和鲁棒性。

Comments 18 pages, 4 figures, in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19722 2026-04-01 cs.LG cs.AI

FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clients

FedRG: 释放表示几何以在噪声客户端中进行联邦学习

Tian Wen, Zhiqin Yang, Yonggang Zhang, Xuefeng Jiang, Hao Peng, Yuwei Wang, Bo Han

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) TMLR Group, Hong Kong Baptist University(香港浸会大学TMLR组) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出FedRG方法,通过表示几何优先原则识别噪声标签,结合自监督学习和球面vMF混合模型,提升联邦学习在异构场景下的鲁棒性与性能。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23067 2026-04-01 cs.CL cs.AI

Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks

语义投票:一种无需自评的高效LLM在不可验证的开放性任务中的自我改进方法

Chunyang Jiang, Yonggang Zhang, Yiyang Cai, Chi-Min Chan, Yulong Liu, Mingming Chen, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出一种无需自评的语义投票方法,通过软匹配提升LLM在不可验证任务中的效率与性能,减少计算负担和自评偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06285 2026-04-01 cs.RO

DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration

DCReg: 用于高效退化LiDAR配准的解耦表征

Xiangcheng Hu, Xieyuanli Chen, Mingkai Jia, Jin Wu, Ping Tan, Steven L. Waslander

机构 * Hong Kong University of Science and Technology(香港科技大学) National University of Defense Technology(国防科技大学) University of Science and Technology Beijing(北京科技大学) University of Toronto(多伦多大学)

AI总结 本文提出DCReg方法,通过解耦配准问题中的退化因素,提高配准稳定性与精度,实验显示在多种环境中实现更高的定位精度和更快的计算速度。

Comments 27 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06537 2026-04-01 cs.CV cs.AI

ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images

ProFashion: 基于多参考图像的原型引导时尚视频生成

Xianghao Kong, Qiaosong Qi, Yuanbin Wang, Biaolong Chen, Aixi Zhang, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Taobao & Tmall Group(淘宝天猫集团)

AI总结 本文提出ProFashion框架,利用多参考图像提升视图一致性和时间一致性,通过姿态感知原型聚合器和流增强原型生成器改进时尚视频生成。

Comments CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10063 2026-03-31 cs.CL cs.AI

CLMN: Concept based Language Models via Neural Symbolic Reasoning

基于神经符号推理的概念语言模型:CLMN

Yibo Yang

机构 * College of Science, The Hong Kong University of Science and Technology(香港科技大学理学院)

AI总结 CLMN通过神经符号推理方法,在保持性能的同时提升NLP的可解释性,通过连续嵌入和模糊逻辑推理学习概念交互规则,提升医疗和金融等领域的文本处理效果。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28475 2026-03-31 cs.RO

Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-Shot Real-World Deployment

Tac2Real: 可靠且用于在线强化学习和零样本现实部署的GPU视觉触觉模拟

Ningyu Yan, Shuai Wang, Xing Shen, Hui Wang, Hanqing Wang, Yang Xiang, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Algorithms of Machine Learning and Autonomous Driving Research Lab, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(机器学习与自动驾驶算法研究实验室,香港科技大学深圳-香港协同创新研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Tac2Real框架,结合PNCG-IPC方法和多GPU并行架构,实现高效的在线强化学习训练,并通过TacAlign方法减少领域间隙,验证了在现实场景中高成功率的零样本迁移。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28010 2026-03-31 cs.AI

HeteroHub: An Applicable Data Management Framework for Heterogeneous Multi-Embodied Agent System

HeteroHub:一种适用于异构多具身代理系统的数据管理框架

Xujia Li, Xin Li, Junquan Huang, Beirong Cui, Zibin Wu, Lei Chen

机构 * HKUST(香港科技大学)

AI总结 本文提出HeteroHub框架,整合静态元数据、任务对齐训练语料和实时数据流,支持任务感知模型训练和闭环控制,实现复杂任务的协调执行。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏