arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2026-07-07 至 2026-07-07 共收录 16
2607.05354 2026-07-07 cs.CV 新提交

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04714 2026-07-07 cs.RO cs.AI 新提交

Geometry-Aware Motion Latents for Learning Robust Manipulation Policies

用于学习鲁棒操纵策略的几何感知运动潜变量

Yunchao Zhang, Yijia Weng, Ruizhe Liu, Ming Hu, Leonidas Guibas, Yanchao Yang

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 研究如何学习机器人操纵的运动潜变量,核心方法是通过预测点云在操纵过程中的演变来学习离散运动潜码,贡献是仅用单视图RGB-D输入达先进性能,验证几何预测是关键,且潜码有有效运动抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04234 2026-07-07 cs.RO cs.AI cs.CV 新提交

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

SoftVTBench:用于物理约束下可变形物体机器人操作的安全感知视觉触觉基准测试

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓景智能) Tsinghua University(清华大学) King’s College London(伦敦国王学院) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI(简单人工智能公司) Imperial College London(伦敦帝国学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 研究物理约束下可变形物体操作,提出SoftVTBench基准测试,通过有限元模拟可变形物体,定义任务套件,分别报告目标成功和安全成功,实现基线并实验,表明仅成功评估高估策略性能,触觉传感可提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03935 2026-07-07 cs.AI 新提交

Harness-Aware Self-Evolving: Co-Evolving Model Weights, Harness, and Task Solutions

harness感知自进化:共同进化模型权重、harness和任务解决方案

Haochen Luo, Yi Huang, Sichun Luo, Fengyuan Liu, Lei Li, Zefa Hu, Junlan Feng, Qi Liu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Jiutian Research, China Mobile(中国移动九天研究院)

AI总结 研究提出HASE框架,通过单模型在多轮动作空间生成任务解决方案或编辑harness组件。能使单模型匹配高性能模型文本分类性能,在alpha因子挖掘中超越基线,还能修复评估组件,在算法发现中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03926 2026-07-07 cs.DB cs.AI 新提交

TabQueryBench: A Query-Centric Benchmark for Synthetic Tabular Data

TabQueryBench:用于合成表格数据的以查询为中心的基准测试

Jialin Zhang, Fenghao Dong, Yajie Zhou, Vyas Sekar, Shinan Liu

机构 * University of Hong Kong(香港大学) Tongji University(同济大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 提出TabQueryBench以查询为中心的基准测试,用SQL查询评估合成数据保真度,将查询分类为模板并生成可执行SQL查询,实验展示了当前表格生成模型在查询保真度等方面的五种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03789 2026-07-07 cs.CV 新提交

G$^2$TAM: Geometry Grounded Track Anything Model

G$^2$TAM:几何基础的轨迹任意模型

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

机构 * HKU(香港大学) Shanghai AI Lab(上海人工智能实验室) BUAA(北京航空航天大学) SJTU(上海交通大学) UCLA(加州大学洛杉矶分校) ZJU(浙江大学)

AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。

Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03015 2026-07-07 cs.AI 新提交

Beyond Forecasting: The Belief-to-Trade Layer in Prediction-Market Agents

超越预测:预测市场代理中的信念到交易层

Yishu Wang, Yuxuan Wang, Jiaqi Deng, Hanyang Tang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 以预测未来事件为通用人工智能测试平台,提出Raven-Agent这一预测市场自主交易代理,在存档决策集的控制重放中表现出色。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02968 2026-07-07 cs.CV 新提交

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

唤醒扩散变换器:通过大规模激活调制激发更强的生成和理解能力

Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Monash University(莫纳什大学) The University of Hong Kong(香港大学) Zhongguancun Academy(中关村科学城创新中心) Chulalongkorn University(朱拉隆功大学) City University of Hong Kong(香港城市大学)

AI总结 研究扩散变换器中大规模激活(MAs)的结构和功能,发现其空间分布及与AdaLN残差缩放因子的关系。基于此提出EMA框架,通过MA驱动的细节引导和MA调制的表征提取,提升生成和理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02908 2026-07-07 cs.CV 新提交

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

全息字幕:迈向3D场景的文本等效物

Kun-Yu Lin, Chengke Bu, Zhenguo Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Frontier Robotics(前沿机器人)

AI总结 研究提出全息字幕任务,先将其定义为生成结构化文本描述,开发字幕引擎及大规模基准,在此基础上提出HoloScribe模型,还给出评估指标和测试集,该模型性能超现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16337 2026-07-07 cs.AI cs.HC cs.LG 新提交

Medical Heuristic Learning: An LLM-Driven Framework for Interpretable and Auditable Clinical Decision Rules

医学启发式学习:一个用于可解释和可审计临床决策规则的LLM驱动框架

Wei Xu, Ke Yang, Gang Luo, Keli Zheng, Lingyan Hu, Jing Wang, Kefeng Li

机构 * Centre for Artificial Intelligence Driven Drug Discovery, Macao Polytechnic University(人工智能驱动药物发现中心,澳门理工学院) Key Laboratory of Short-Range Radio Equipment Testing and Evaluation, Ministry of Industry and Information Technology Terahertz Science Application Center (TSAC), Beijing Institute of Technology(工业和信息化部短距离无线电设备测试与评估重点实验室,太赫兹科学应用中心(TSAC),北京理工大学) Department of Critical Care Medicine, Yantai Yuhuangding Hospital, Qingdao University(重症医学科,烟台友谊医院,青岛大学) Faculty of Education, The University of Hong Kong(教育学院,香港大学) College of Information Engineering, Dalian University(信息工程学院,大连大学)

AI总结 提出医学启发式学习(MHL),利用LLM驱动的工作流优化确定性可执行决策系统,生成可解释、可审计的Python决策规则,在医学数据集上达到与最先进方法相当的性能,并支持小样本和高度不平衡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31604 2026-07-07 cs.CV 版本更新

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏