arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-07-01 至 2026-07-01 共收录 21
2606.29805 2026-07-01 cs.CV 版本更新

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31981 2026-07-01 cs.CV cs.AI 新提交

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA: 超越蒙皮的学习通用3D人体动画

Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito

机构 * The Hong Kong University of Science and Technology(香港科技大学) Codec Avatars Lab, Meta(Meta编解码虚拟形象实验室)

AI总结 提出无LBS的通用神经动画模型LUNA,通过Transformer运动回归器将多种2D控制映射为3D高斯变形,结合混合监督实现零样本跨身份泛化。

Comments ECCV 2026, Project page: https://penghtyx.github.io/LUNA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31537 2026-07-01 cs.CV cs.MA 新提交

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31461 2026-07-01 cs.AI cs.CE 新提交

CSTrader: A Testbed for Language-Grounded Trading in a Community-Driven Virtual Asset Market

CSTrader: 社区驱动虚拟资产市场中基于语言的交易测试平台

Yao Shi, Kingfung Luo, Nan Tang, Yuyu Luo

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出CSTrader多智能体框架,通过集成异构信号、技术分析、流动性、事件和反转情绪等智能体,在CS2皮肤市场实现语言到交易的映射,在波动期取得7.58%累计收益并控制风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31435 2026-07-01 cs.AI cs.CL 新提交

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

机构 * HKUST(香港科技大学) NUS(新加坡国立大学)

AI总结 提出CDR-Bench基准,包含3462个高质量任务,评估LLM在组合式和顺序敏感设置下直接执行数据精炼配方的能力,发现当前LLM缺乏程序忠实性。

Comments 29 pages, 20 figures. Corresponding authors: Daoyuan Chen and Yi R. Fung

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31260 2026-07-01 cs.RO 新提交

Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning

先规划正确,再规划紧凑:面向高效具身推理的符号强化学习

Xiangli Shi, Xiaomeng Zhu, Ye Tian, Yuchun Guo, Ziyang Sun, Lujie Yin, Yuxuan Zhou, Yufei Huang

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯) University of London(伦敦大学)

AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。

Comments 18 pages, 10 figures, 14 tables; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31197 2026-07-01 cs.RO 新提交

Diffusion-based 4D Trajectory Prediction and Distributed Control for UAV Swarms

基于扩散的无人机集群四维轨迹预测与分布式控制

Tianshun Li, Hongliang Lu, Haoang Li, Xinhu Zheng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学) MoSense Technologies

AI总结 提出统一框架,结合粗到细轨迹预测与不确定性感知分布式非线性模型预测控制,通过维度解耦和扩散残差动力学模块降低计算复杂度并捕捉动态不确定性,在复杂环境下实现亚0.07米平均跟踪误差和34 FPS实时推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31085 2026-07-01 cs.AI 新提交

DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction

DDIAgents: 机制条件上下文流用于药物相互作用预测

Zhenqian Shen, Yu Liu, Xiaoyi Fu, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所) Division of Emerging Interdisciplinary Areas, Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域学部)

AI总结 提出DDIAgents多智能体框架,通过动态知识编排预测药物相互作用,减少无关信息并生成可解释推理,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30811 2026-07-01 cs.CV cs.MM cs.SD eess.AS 新提交

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

AVTok: 用于整体音视频生成的1D统一分词化

Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出AVTok统一分词器,采用双流Transformer架构和分层训练策略,将音视频对编码为紧凑的一维潜在表示,在音视频重建及下游生成任务中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30673 2026-07-01 cs.GR cs.CV 新提交

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

机构 * ZJU(浙江大学) Tencent(腾讯) THU(清华大学) CUHK(香港中文大学) HKUST(香港科技大学) HKU(香港大学)

AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24336 2026-07-01 cs.CV 新提交

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration

TIGER:驯服身份、几何和生成先验以实现高质量人脸视频恢复

Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出TIGER框架,融合身份、几何和生成先验,通过解耦3D参数空间和一步整流流,解决人脸视频恢复中的身份偏移、视角纠缠和感知真实性问题,实现高保真、时间一致且高效的恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09735 2026-07-01 cs.AR cs.AI cs.DC cs.OS 版本更新

KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving

KV-RM:为静态图LLM服务正则化KV缓存移动

Zhiqing Zhong, Zhijing Ye, Jian Zhang, Weijian Zheng, Bolun Sun, Xiaodong Yu

机构 * Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Argonne National Laboratory(阿贡国家实验室) Northwestern University(西北大学)

AI总结 本文提出KV-RM,通过正则化KV缓存移动提升静态图LLM服务的灵活性,减少内存占用并降低延迟峰值。

Comments Withdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24421 2026-07-01 cs.CV 版本更新

Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splatting

Proxy-GS:结构化3D高斯泼溅中训练与推理的统一遮挡先验

Yuanyuan Gao, Yuning Gong, Yifei Liu, Li Jingfeng, Dingwen Zhang, Yanci Zhang, Dan Xu, Xiao Sun, Zhihang Zhong

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Sichuan University(四川大学) Hong Kong University of Science and Technology(香港科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Proxy-GS,利用快速代理系统生成精确遮挡深度图,在训练中引导表面致密化、在推理中剔除冗余高斯体,实现2.5倍以上加速并提升渲染质量。

Comments Project page: https://visionary-laboratory.github.io/Proxy-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21291 2026-07-01 cs.CV 版本更新

Gaussian Belief Propagation Network for Depth Completion

高斯置信传播网络用于深度补全

Jie Tang, Pingping Xie, Jian Li, Ping Tan

机构 * National University of Defense Technology(国防科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出高斯置信传播网络(GBPN),融合深度学习与概率图模型,通过动态构建马尔可夫随机场并利用高斯置信传播推断,实现高稀疏度下的鲁棒深度补全。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01356 2026-07-01 cs.LG cs.AI cs.CY 版本更新

Perturbation Effects on Robustness and Individual Fairness

扰动对相似个体间准确性和公平性的影响

Xuran Li, Hao Xue, Peng Wu, Xingjun Ma, Zhen Zhang, Huaming Chen, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Key Laboratory of System Software, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所系统软件重点实验室) Fudan University(复旦大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) The University of Sydney(悉尼大学)

AI总结 提出鲁棒个体公平性(RIF)概念,并开发黑盒对抗框架RIFair,通过解耦扰动策略暴露模型在语义保持扰动下同时存在的鲁棒性和公平性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15443 2026-07-01 cs.RO cs.AI 版本更新

A Scalable Whole-body Motion Transfer via Implicit Kinodynamic Motion Retargeting

可扩展的全身运动迁移:基于隐式动力学运动重定向

Xingyu Chen, Hanyu Wu, Sikai Wu, Mingliang Zhou, Diyun Xiang, Haodong Zhang, Yangchen Zhou, Yukang Gao, Yi Gu, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Zhejiang University(浙江大学) Xiaomi Robotics Lab(小米机器人实验室)

AI总结 提出隐式动力学运动重定向(IKMR),利用骨架图卷积双自编码器将人体与机器人运动映射到共享拓扑潜空间,结合物理信息精炼实现高速、鲁棒的运动数据转换,解决噪声与计算瓶颈。

Comments RSS 2026 Workshop. Webpage: https://cybercal.github.io/webpage.ikmr

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10141 2026-07-01 cs.CV 版本更新

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman: 使用跨尺度多视图扩散和显式重网格化的逼真单图像三维人体重建

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Southeast University(东南大学) Tsinghua University(清华大学) VAST

AI总结 提出PSHuman框架,通过跨尺度多视图扩散和SMPL-X条件生成,解决单视图人体重建中的几何失真和自遮挡问题,实现高保真几何与纹理重建。

Comments CVPR2025, Project page: https://penghtyx.github.io/PSHuman

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00305 2026-07-01 stat.ME cs.LG math.ST stat.ML stat.TH 版本更新

Multiple Testing of Linear Forms for Noisy Matrix Completion

噪声矩阵补全中线性形式的多元检验

Wanteng Ma, Lilun Du, Dong Xia, Ming Yuan

机构 * University of Pennsylvania(宾夕法尼亚大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学) Columbia University(哥伦比亚大学)

AI总结 针对大规模推荐系统中噪声矩阵补全的多元线性形式检验问题,提出一种数据分割与对称聚合方法,通过构造具有锐利渐近性质的统计量控制错误发现率,在近最优样本量下实现有效FDR控制与统计功效。

详情

展开后加载摘要…

URL PDF HTML 收藏