arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2796
2603.08361 2026-03-10 cs.CV

$Δ$VLA: Prior-Guided Vision-Language-Action Models via World Knowledge Variation

$Δ$VLA:通过世界知识变化引导的视觉-语言-动作模型

Yijie Zhu, Jie He, Rui Shao, Kaishen Yuan, Tao Tan, Xiaochen Yuan, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Macao Polytechnic University(澳门理工学院)

AI总结 $Δ$VLA通过建模世界知识变化,结合先验引导和潜在空间学习,提升机器人动作生成的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08270 2026-03-10 cs.LG cs.AI

SCL-GNN: Towards Generalizable Graph Neural Networks via Spurious Correlation Learning

SCL-GNN:通过虚假相关性学习实现通用图神经网络

Yuxiang Zhang, Enyan Dai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 SCL-GNN通过学习并缓解虚假相关性提升图神经网络在不同分布下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21599 2026-03-10 cs.RO cs.CV

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

迭代闭环运动合成以提升人形机器人控制能力

Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出一种闭环自动运动数据生成和迭代框架,通过生成高质量运动数据并实现策略和数据难度迭代,提升人形机器人控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07896 2026-03-10 cs.CL

ACE: Attribution-Controlled Knowledge Editing for Multi-hop Factual Recall

ACE:基于多跳事实回忆的归因控制知识编辑

Jiayu Yang, Yuxuan Fan, Songning Lai, Shengen Wu, Jiaqi Tang, Chun Kang, Zhijiang Guo, Yutao Yue

机构 * HKUST(GZ) Deep Interdisciplinary Intelligence Lab(香港科技大学(广州)深 interdisciplinary 智能实验室) BUAA(北京航空航天大学) HKUST(GZ) Institute of Deep Perception Technology, JITRI Deep Interdisciplinary Intelligence Lab(香港科技大学(广州)深度感知技术研究所,JITRI 深 interdisciplinary 智能实验室)

AI总结 ACE通过神经元归因控制实现多跳事实回忆中的知识编辑,提升KE性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24758 2026-03-10 cs.CV

ExGS: Extreme 3D Gaussian Compression with Diffusion Priors

ExGS:基于扩散先验的极端3D高斯压缩

Jiaqi Chen, Xinhao Ji, Yuanyuan Gao, Hao Li, Yuning Gong, Yifei Liu, Dan Xu, Zhihang Zhong, Dingwen Zhang, Xiao Sun

机构 * Northwestern Polytechnical University(北western工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 ExGS通过结合UGC和GaussPainter,利用扩散先验实现高效且高质量的极端3DGS压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08118 2026-03-10 cs.LG

Model-based Offline RL via Robust Value-Aware Model Learning with Implicitly Differentiable Adaptive Weighting

基于鲁棒价值感知模型学习的模型驱动离线RL

Zhongjian Qiao, Jiafei Lyu, Boxiang Lyu, Yao Shu, Siyang Gao, Shuang Qiu

机构 * CityUHK(城大) Tencent(腾讯) UChicago(芝加哥大学) HKUST(GZ)(香港科技大学(广州))

AI总结 ROMI通过鲁棒价值感知模型学习和隐式可微适应加权方法,改进离线RL中的模型更新稳定性与泛化能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07758 2026-03-10 cs.CV

AR2-4FV: Anchored Referring and Re-identification for Long-Term Grounding in Fixed-View Videos

AR2-4FV: 为固定视角视频中的长期接地引用而设计的锚点引用与重识别

Teng Yan, Yihan Liu, Jiongxu Chen, Teng Wang, Jiaqi Li, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 AR2-4FV通过锚点库和重入先验提升固定视角视频中长期引用的准确率和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07700 2026-03-10 cs.CV cs.AI

TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

TDM-R1: 通过非可微奖励强化少步扩散模型

Yihong Luo, Tianyang Hu, Weijian Luo, Jing Tang

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 TDM-R1通过非可微奖励强化少步扩散模型,提升文本到图像生成性能

Comments https://luo-yihong.github.io/TDM-R1-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07699 2026-03-10 cs.RO

C$^2$-Explorer: Contiguity-Driven Task Allocation with Connectivity-Aware Task Representation for Decentralized Multi-UAV Exploration

C$^2$-Explorer: 基于连通性的任务分配与连接感知的任务表示用于分布式多无人机探索

Xinlu Yan, Mingjie Zhang, Yuhao Fang, Yanke Sun, Jun Ma, Youmin Gong, Boyu Zhou, Jie Mei

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen, Guangdong, China(哈尔滨工业大学深圳研究院) Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) Department of Mechanical and Energy Engineering, Southern University of Science and Technology, Shenzhen, Guangdong, China(南方科技大学机械与能源工程系)

AI总结 C$^2$-Explorer通过连接感知的任务表示和基于连续性的分配策略,提升多无人机探索效率,减少探索时间和路径长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07486 2026-03-10 cs.CV

Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection

多模态解耦与耦合网络用于抗干扰的3D目标检测

Rui Ding, Zhaonian Kuang, Yuzhe Ji, Meng Yang, Xinhu Zheng, Gang Hua

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Intelligent Transportation Thrust of the Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(系统枢纽智能交通方向,香港科技大学(广州)) Multimodal Experiences Research Lab, Dolby Laboratories(多模态体验研究实验室,Dolby实验室)

AI总结 本文提出多模态解耦与耦合网络,通过分离和重新耦合不同模态特征以提高在数据损坏下的3D目标检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01396 2026-03-10 cs.AI cs.CE q-bio.QM

HarmonyCell: Automating Single-Cell Perturbation Modeling under Semantic and Distribution Shifts

HarmonyCell: 在语义和分布偏移下自动化单细胞扰动建模

Wenxuan Huang, Mingyu Tsoi, Yanhao Huang, Xinjie Mao, Xue Xia, Hao Wu, Jiaqi Wei, Yuejin Yang, Lang Yu, Cheng Tan, Xiang Zhang, Zhangyang Gao, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Shanghai Innovation Institute(上海创新研究院) University of British Columbia(不列颠哥伦比亚大学)

AI总结 HarmonyCell通过语义统一和自适应搜索机制,在语义和分布偏移下实现单细胞扰动建模的自动化,有效执行率达95%并超越专家基线。

Comments 18 pages total (8 pages main text + appendix), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20627 2026-03-10 cs.CV cs.RO

Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection

面向数据高效的单目3D物体检测的物体-场景-相机分解与重组

Zhaonian Kuang, Rui Ding, Meng Yang, Xinhu Zheng, Gang Hua

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi'an Jiaotong University(西安交通大学) Intelligent Transportation Thrust of the Systems Hub(系统枢纽智能交通事业部) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Amazon Alexa AI(亚马逊Alexa AI)

AI总结 本文提出了一种在线分解与重组数据处理方案,通过生成多样化的物体-场景-相机组合数据,提升单目3D物体检测模型的性能。

Comments IJCV

Journal ref Int J Comput Vis 134, 155 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18882 2026-03-10 cs.CV

Light of Normals: Unified Feature Representation for Universal Photometric Stereo

法线之光:面向通用光度立体的统一特征表示

Houyuan Chen, Hong Li, Chongjie Ye, Zhaoxi Chen, Bohan Li, Shaocong Xu, Xianda Guo, Xuhui Liu, Yikai Wang, Baochang Zhang, Satoshi Ikehata, Boxin Shi, Anyi Rao, Hao Zhao

机构 * BUAA(北京航空航天大学) HKUST(香港科技大学) BAAI(北京人工智能研究院) FNii, CUHKSZ(FNii,CUHKSZ) NTU(国立台湾大学) WHU(武汉大学) BNU(北京师范大学) NII(日本国立信息与通信技术研究所) PKU(北京大学) AIR, THU(AIR,清华大学)

AI总结 本文提出LINO UniPS,通过Light Register Tokens和交错注意力块实现光照与法线信息解耦,并结合小波双分支架构和法线梯度损失恢复高频细节,提升通用光度立体的性能。

Comments Home: https://houyuanchen111.github.io/lino.github.io Github: https://github.com/houyuanchen111/LINO_UniPS HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23932 2026-03-10 cs.CL

SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving

SwingArena: 用于长上下文GitHub问题解决的竞争性编程竞技场

Wendong Xu, Jing Xiong, Chenyang Zhao, Qiujiang Chen, Haoran Wang, Hui Shen, Zhongwei Wan, Jianbo Dai, Taiqiang Wu, He Xiao, Chaofan Tao, Z. Morley Mao, Ying Sheng, Zhijiang Guo, Hongxia Yang, Bei Yu, Lingpeng Kong, Quanquan Gu, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of California Los Angeles(加州大学洛杉矶分校) Tsinghua University(清华大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) The Ohio State University(俄亥俄州立大学) University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LMSYS Org(LMSYS组织)

AI总结 SwingArena是一个用于评估LLM在真实CI驱动软件开发环境中性能的竞争性编程竞技场,通过模拟软件迭代过程,结合检索增强型代码生成模块,实现对长上下文问题的高效处理。

Comments The paper has been accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02628 2026-03-10 eess.IV cs.CV

DeepSparse: A Foundation Model for Sparse-View CBCT Reconstruction

DeepSparse: 一种用于稀疏视图CBCT重建的基础模型

Yiqun Lin, Jixiang Chen, Hualiang Wang, Jiewen Yang, Jiarong Guo, Yi Zhang, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, the Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Cyber Science and Engineering, Sichuan University(网络科学与工程学院,四川大学)

AI总结 DeepSparse是一种用于稀疏视图CBCT重建的基础模型,通过DiCE网络和HyViP框架提升重建质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15163 2026-03-10 cs.LG stat.ML

The Exploration of Error Bounds in Classification with Noisy Labels

在噪声标签下分类中误差界限的探索

Haixia Liu, Boxiao Li, Can Yang, Yang Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) School of Mathematics and Statistics(数学与统计学学院) Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学)

AI总结 本文研究了噪声标签下深度学习分类中的误差界限,通过分解统计误差和近似误差,提出理论分析方法以提高分类性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07241 2026-03-10 cs.LG cs.IR

Rethinking Deep Research from the Perspective of Web Content Distribution Matching

从网页内容分布匹配视角重新思考深度研究

Zixuan Yu, Zhenheng Tang, Tongliang Liu, Chengqi Zhang, Xiaowen Chu, Bo Han

机构 * School of Computer science and engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) CSE, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) DSA Thrust, The Hong Kong University of Science and Technology (GuangZhou)(数据科学与技术 thrust,香港科学与技术大学(广州)) TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR 组,计算机科学系,香港 Baptist 大学)

AI总结 WeDas通过引入网页内容分布感知机制,改进深度搜索代理的查询-结果对齐能力,提升子目标完成和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07223 2026-03-10 cs.LG

Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training

解锁金融数据价值:关于蒸馏和难度感知训练的研究

Chuxue Cao, Honglin Lin, Zhanping Zhong, Xin Gao, Mengzhang Cai, Conghui He, Sirui Han, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出ODA-Fin-SFT-318k和ODA-Fin-RL-12k数据集,通过多阶段蒸馏和难度感知训练提升金融领域模型性能,实现高质量的链式思维监督和任务多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07165 2026-03-10 cs.RO

RoTri-Diff: A Spatial Robot-Object Triadic Interaction-Guided Diffusion Model for Bimanual Manipulation

RoTri-Diff: 一种基于空间机器人-物体三元交互引导的扩散模型用于双臂操作

Zixuan Chen, Nga Teng Chan, Yiwen Hou, Chenrui Tie, Zixuan Liu, Haonan Chen, Junting Chen, Jieqi Shi, Yang Gao, Jing Huo, Lin Shao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

AI总结 RoTri-Diff通过建模机器人-物体三元交互关系,提出了一种基于扩散的模仿学习框架,以提高双臂操作的稳定性和协调性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07144 2026-03-10 cs.CV

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

CanoVerse: 3D对象可扩展规范化的数据集用于生成和姿态

Li Jin, Yuchen Yang, Weikai Chen, Yujie Wang, Dehao Hao, Tanghui Jia, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Li Yuan, Long Quan, Xin Wang, Xueying Qin

机构 * SDU(1 南开大学) LIGHTSPEED(2 LIGHTSPEED) UNC Chapel Hill(3 匹兹堡大学柴尔德斯分校) HKUST(4 香港理工大学) PKU(5 北京大学)

AI总结 CanoVerse通过大规模规范3D数据集提升3D生成稳定性,实现跨模态检索与零样本点云方向估计

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06743 2026-03-10 cs.LG cs.AI

Stabilizing Reinforcement Learning for Diffusion Language Models

稳定扩散语言模型的强化学习

Jianyuan Zhong, Kaibo Wang, Ding Ding, Zijin Feng, Haoli Bai, Yang Xiang, Jiacheng Sun, Qiang Xu

机构 * Huawei Foundation Model Department(华为基础模型部门) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出StableDRL方法,针对扩散语言模型中的强化学习问题,通过无条件裁剪和自我归一化解决比率估计噪声导致的不稳定性,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00092 2026-03-09 cs.CV

Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark

Spatial4D-Bench: 一种多功能的4D空间智能基准

Pan Wang, Yang Liu, Guile Wu, Eduardo R. Corral-Soto, Chengjie Huang, Binbin Xu, Dongfeng Bai, Xu Yan, Yuan Ren, Xingxin Chen, Yizhe Wu, Tao Huang, Wenjun Wan, Xin Wu, Pei Zhou, Xuyang Dai, Kangbo Lv, Hongbo Zhang, Yosef Fried, Aixue Ye, Bailan Feng, Zhenyu Chen, Zhen Li, Yingcong Chen, Yiyi Liao, Bingbing Liu

机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) Yiyi Liao Zhejiang University(廖亿毅 浙江大学) Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)

AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05898 2026-03-09 cs.CV

InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

InnoAds-Composer: 电商海报生成中的高效条件组合

Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law

机构 * JD.com, Inc.(京东公司) Chongqing University of Posts and Telecommunications(重庆邮电大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学)

AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05355 2026-03-09 cs.RO

OmniDP: Beyond-FOV Large-Workspace Humanoid Manipulation with Omnidirectional 3D Perception

OmniDP: 在超广角大工作空间中实现人形机器人的全方位3D感知

Pei Qu, Zheng Li, Yufei Jia, Ziyun Liu, Liang Zhu, Haoang Li, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 OmniDP通过360度全景点云感知和时间感知注意力池化机制,实现人形机器人在大工作空间中的稳健操作,优于传统深度相机方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00543 2026-03-09 cs.CV

Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark

跨尺度 pansharpening 通过 ScaleFormer 和 PanScale 数据集

Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 本文提出 ScaleFormer 架构和 PanScale 数据集,通过跨尺度 pansharpening 方法提升多尺度场景下的图像融合质量与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23972 2026-03-09 cs.RO

Learning Robust Control Policies for Inverted Pose on Miniature Blimp Robots

学习微型气球机器人倒置姿态的鲁棒控制策略

Yuanlin Yang, Lin Hong, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

AI总结 本文提出了一种新型框架,通过仿真与现实映射层,实现微型气球机器人倒置姿态的鲁棒控制策略学习。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏