arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2507.02245 2026-03-23 cs.RO

CoInfra: A Large-Scale Cooperative Infrastructure Perception System and Dataset for Vehicle-Infrastructure Cooperation in Adverse Weather

CoInfra:一种大规模协作基础设施感知系统及数据集,用于恶劣天气下的车-基础设施协作

Minghao Ning, Yufeng Yang, Keqi Shu, Shucheng Huang, Jiaming Zhong, Maryam Salehi, Mahdi Rahmani, Jiaming Guo, Yukun Lu, Chen Sun, Aladdin Saleh, Ehsan Hashemi, Amir Khajepour

机构 * Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系) Department of Mechanical Engineering, University of New Brunswick(新不伦瑞克大学机械工程系) Department of Data and Systems Engineering, University of Hong Kong(香港大学数据与系统工程系) Technology Partnerships and Innovations, Rogers Communications, Canada Inc.(罗杰斯通讯公司技术创新部) Department of Mechanical Engineering, University of Alberta(阿尔伯塔大学机械工程系)

AI总结 本文提出CoInfra系统,通过14个路侧传感器节点和5G网络实现多节点协同感知,涵盖8个节点的环形城市交叉口在四种天气条件下的数据,验证基础设施感知在复杂交通场景中的安全提升作用。

Comments This paper has been submitted to the Transportation Research Part C: Emerging Technologies for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18010 2026-03-20 cs.CL cs.AI cs.CY

Agentic Framework for Political Biography Extraction

政治传记提取的代理框架

Yifei Zhu, Songpo Yang, Jiangnan Zhu, Junyan Jiang

机构 * Department of Politics and Public Administration, The University of Hong Kong(政治与公共行政系,香港大学) School of International Studies, Peking University(国际关系学院,北京大学) Department of Political Science, Columbia University(政治学系,哥伦比亚大学)

AI总结 本文提出一种两阶段的合成-编码框架,利用大语言模型自动化提取多维精英传记,提升政治科学研究的效率和准确性。

Comments 70 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18008 2026-03-20 cs.CL cs.AI cs.CY

TherapyGym: Evaluating and Aligning Clinical Fidelity and Safety in Therapy Chatbots

TherapyGym: 评估和对齐疗法聊天机器人中的临床忠实性与安全性

Fangrui Huang, Souhad Chbeir, Arpandeep Khatua, Sheng Wang, Sijun Tan, Kenan Ye, Lily Bailey, Merryn Daniel, Ryan Louie, Sanmi Koyejo, Ehsan Adeli

机构 * Department of Computer Science, Stanford University, Stanford, CA, USA(计算机科学系,斯坦福大学,斯坦福,加州,美国) Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学,斯坦福,加州,美国) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(生物医学数据科学系,斯坦福大学,斯坦福,加州,美国) University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加州,美国) The University of Hong Kong, Hong Kong(香港大学,香港)

AI总结 TherapyGym通过评估和提升疗法聊天机器人中的忠实性与安全性,结合CTRS评分和多标签标注方案,利用RL训练框架改进模型性能,提升临床应用的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02861 2026-03-20 cs.CV cs.AI cs.GR

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

LiteReality:从RGB-D扫描生成图形-ready的3D场景重建

Zhening Huang, Xiaoyang Wu, Fangcheng Zhong, Hengshuang Zhao, Matthias Nießner, Joan Lasenby

机构 * University of Cambridge(剑桥大学) The University of Hong Kong(香港大学) Technical University of Munich(慕尼黑技术大学)

AI总结 LiteReality通过结构化场景图解析扫描数据,生成紧凑且逼真的3D虚拟场景,支持图形管线所需的关键特性,适用于AR/VR、游戏、机器人和数字孪生等应用。

Comments Project Page: https://litereality.github.io; Video: https://www.youtube.com/watch?v=ecK9m3LXg2c&feature=youtu.be Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16426 2026-03-20 cs.CV

DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models

DynamicVis: 面向高效遥感基础模型的动态视觉感知

Keyan Chen, Chenyang Liu, Bowen Chen, Wenyuan Li, Zhengxia Zou, Shijian Lu, Zhenwei Shi

机构 * Beihang University(北航大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学)

AI总结 本文提出DynamicVis,针对遥感图像稀疏性设计,通过动态区域感知SSM和元嵌入MIL预训练,提升稀疏目标感知性能,尤其在小目标检测和变化检测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17354 2026-03-19 cs.LG cs.CL

Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-Sensitivity

超越异常值:一种无需数据的分层混合精度量化方法,由数值和结构双敏感性驱动

Hengyuan Zhang, Xinrong Chen, Zunhai Su, Xiao Liang, Jing Xiong, Wendong Xu, He Xiao, Chaofan Tao, Wei Zhang, Ruobing Xie, Lei Jiang, Hayden Kwok-Hay So, Ngai Wong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Tencent(腾讯)

AI总结 本文提出NSDS方法,通过数值和结构双敏感性驱动分层混合精度量化,无需校准数据,在不同模型和任务中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17051 2026-03-19 cs.CV

Astrolabe: Steering Forward-Process Reinforcement Learning for Distilled Autoregressive Video Models

Astrolabe:为蒸馏自回归视频模型设计的前向过程强化学习框架

Songchun Zhang, Zeyue Xue, Siming Fu, Jie Huang, Xianghao Kong, Y Ma, Haoyang Huang, Nan Duan, Anyi Rao

机构 * HKUST(香港科技大学) JD Explore Academy(JD探索学院) HKU(香港大学)

AI总结 Astrolabe通过前向过程强化学习方法提升蒸馏自回归视频模型的生成质量,采用滚动KV缓存实现流式训练,结合多奖励目标和不确定性感知正则化,有效解决对齐问题。

Comments 53 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16963 2026-03-19 q-bio.QM cs.CV

Topology-Guided Biomechanical Profiling: A White-Box Framework for Opportunistic Screening of Spinal Instability on Routine CT

拓扑引导的生物力学分析:一种白盒框架用于常规CT中脊柱不稳定性的机会性筛查

Zanting Ye, Xuanbin Wu, Guoqing Zhong, Shengyuan Liu, Jiashuai Liu, Ge Song, Zhisong Wang, Jing Hao, Xiaolong Niu, Yefeng Zheng, Yu Zhang, Lijun Lu

机构 * Southern Medical University(南方医科大学) The Affiliated Cancer Hospital of Zhengzhou University(郑州大学附属肿瘤医院) The Chinese University of Hong Kong(香港中文大学) Xi'an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学) Westlake University(西湖大学) Guangdong Provincial People's Hospital(广东省人民医院)

AI总结 本文提出一种白盒框架,通过拓扑引导的生物力学分析,解决常规CT中脊柱不稳定性的筛查问题,通过几何创新和可解释的AI方法提高诊断准确性。

Comments 11 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14441 2026-03-19 stat.ML cs.LG

AR-Flow VAE: A Structured Autoregressive Flow Prior Variational Autoencoder for Unsupervised Blind Source Separation

AR-Flow VAE:一种结构化自回归流先验变分自编码器用于无监督盲源分离

Yuan-Hao Wei, Fu-Hao Deng, Lin-Yong Cui, Yan-Jie Sun

机构 * Hong Kong Polytechnic University(香港理工大学) Wuhan University of Technology(武汉理工大学) The University of Hong Kong(香港大学)

AI总结 本文提出AR-Flow VAE,通过自回归流先验提升潜变量建模灵活性,有效捕捉复杂非高斯行为和结构依赖,验证了其在盲源分离中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09792 2026-03-19 cs.LG cs.AI

Exploiting Adaptive Channel Pruning for Communication-Efficient Split Learning

利用自适应通道剪枝实现高效的分裂学习通信

Jialei Tan, Zheng Lin, Xiangming Cai, Ruoxi Zhu, Zihan Fang, Pingping Chen, Wei Ni

机构 * School of Physics and Information Engineering, Fuzhou University(福州市物理与信息工程学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) School of Electrical Engineering and Telecommunications, University of New South Wales Sydney(新南威尔士大学悉尼分校电子与电信工程学院) Hong Kong JC STEM Lab of Smart City and the Department of Computer Science, City University of Hong Kong(香港智慧城市JC STEM实验室及城市大学计算机科学系) Data61, CSIRO, Marsfield, NSW 2122, Australia, and the School of Computing Science and Engineering, and the University of New South Wales, Kennington, NSW 2052, Australia(Data61, CSIRO, 澳大利亚马尔斯菲尔德, 新南威尔士州2122, 和计算科学与工程学院, 新南威尔士大学肯宁顿, 新南威尔士州2052, 澳大利亚)

AI总结 本文提出自适应通道剪枝辅助分裂学习方案,通过设计标签感知通道重要性评分模块和自适应通道剪枝模块,压缩中间特征表示以减少通信开销,实验表明其在测试准确率和训练轮次上均优于基准方案。

Comments 6 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16866 2026-03-18 cs.RO cs.AI cs.GR cs.LG cs.SE

ManiTwin: Scaling Data-Generation-Ready Digital Object Dataset to 100K

ManiTwin:将数据生成-ready的数字对象数据集扩展到10万

Kaixuan Wang, Tianxing Chen, Jiawei Liu, Honghao Su, Shaolong Zhu, Minxuan Wang, Zixuan Li, Yue Chen, Huan-ang Gao, Yusen Qin, Jiawei Wang, Qixuan Zhang, Lan Xu, Jingyi Yu, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Xspark AI Deemos Tech Shanghai Jiao Tong University(上海交通大学) ShanghaiTech University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) D-Robotics Peking University(北京大学) Tsinghua University(清华大学) Shenzhen University(深圳大学)

AI总结 本文提出ManiTwin,一种高效生成数据生成-ready数字对象双胞胎的自动化流程,构建了包含10万高质量标注3D资产的ManiTwin-100K数据集,为大规模仿真数据合成和策略学习提供基础。

Comments Website: https://manitwin.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16844 2026-03-18 cs.CV

M^3: Dense Matching Meets Multi-View Foundation Models for Monocular Gaussian Splatting SLAM

M^3:密集匹配与多视角基础模型结合的单目高斯点云SLAM

Kerui Ren, Guanghao Li, Changjian Jiang, Yingxiang Xu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang, Mulin Yu, Bo Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出M^3,结合多视角基础模型与单目高斯点云SLAM,通过引入匹配头提升密集对应关系,增强跟踪稳定性,在多种基准上取得优异的位姿估计和场景重建性能。

Comments Project page: https://city-super.github.io/M3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16671 2026-03-18 cs.CV

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16161 2026-03-18 cs.AI

SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation

SQL-ASTRA: 缓解代理SQL中的稀疏反馈 via 列集匹配和轨迹聚合

Long Li, Zhijian Zhou, Jiangxuan Long, Peiyang Liu, Weidi Xu, Zhe Wang, Shirui Pan, Chao Qu

机构 * Griffith University(格里菲斯大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Peking University(北京大学) InFly Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

AI总结 本文提出SQL-ASTRA框架,通过列集匹配和轨迹聚合解决代理SQL中的稀疏反馈问题,引入轨迹奖励和列集匹配奖励,提升多轮任务的奖励分配效率与稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16112 2026-03-18 cs.CL cs.AI cs.CE

ASDA: Automated Skill Distillation and Adaptation for Financial Reasoning

ASDA:自动化技能蒸馏与适应用于金融推理

Tik Yu Yim, Wenting Tan, Sum Yee Chan, Tak-Wah Lam, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学)

AI总结 ASDA通过迭代误差纠正学习生成结构化技能 artifact,无需修改模型权重,在金融推理任务中实现显著提升,优于无训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15975 2026-03-18 cs.CV

UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors

UMO:统一上下文学习解锁运动基础模型先验

Xiaoyan Cong, Zekun Li, Zhiyang Dou, Hongyu Li, Omid Taheri, Chuan Guo, Abhay Mittal, Sizhe An, Taku Komura, Wojciech Matusik, Michael J. Black, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta Reality Lab(Meta现实实验室) Max-Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Hong Kong(香港大学)

AI总结 UMO通过统一框架解锁运动基础模型先验,支持多种跨模态和上下文生成任务,提升文本到运动合成性能。

Comments Project Page: https://oliver-cong02.github.io/UMO.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07714 2026-03-18 cs.CR cs.AI cs.SE

LLAMAFUZZ: Large Language Model Enhanced Greybox Fuzzing

LLAMAFUZZ:大语言模型增强的灰盒模糊测试

Hongxiang Zhang, Yuyang Rong, Yifeng He, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Hong Kong(香港大学)

AI总结 本文提出LLAMAFUZZ,利用大语言模型生成有效输入,提升灰盒模糊测试对结构化数据的处理能力,实验表明其在发现漏洞方面表现优异。

Comments The 7th ACM/IEEE International Conference on Automation of Software Test (AST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15712 2026-03-18 cond-mat.mtrl-sci cs.AI

LLM-Driven Discovery of High-Entropy Catalysts via Retrieval-Augmented Generation

通过检索增强生成发现高效熵催化剂

AI Scientists, Xinyi Lin, Danqing Yin, Ying Guo

机构 * School of Biomedical Sciences, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学生物医学科学学院,利卡申医学学院)

AI总结 本文展示如何利用大语言模型加速催化剂发现,通过检索增强生成框架生成250多个候选催化剂,其中82%具有热力学稳定性,同时满足多目标约束,最佳催化剂在性能和成本上均有显著提升。

Journal ref Open Conference of AI Agents for Science 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15281 2026-03-17 cs.RO

GNIO: Gated Neural Inertial Odometry

GNIO: 基于门控的神经惯性里程计

Dapeng Feng, Yizhen Yin, Zhiqiang Chen, Yuhua Qi, Hongbo Chen

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学)

AI总结 本文提出GNIO,一种基于学习的框架,通过显式建模运动有效性和上下文,减少惯性导航中的漂移。采用可学习的Motion Bank和门控预测头,提升在复杂运动转换中的表现。

Comments Submitted to IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14989 2026-03-17 cs.CV

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14848 2026-03-17 cs.CV

Personalized Federated Learning with Residual Fisher Information for Medical Image Segmentation

具有残差信息鱼尔矩阵的个性化联邦学习用于医学图像分割

Meilu Zhu, Yuxing Li, Zhiwei Wang, Edmund Y. Lam

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong, China(电子与电气工程系,香港大学,香港,中国)

AI总结 本文提出pFL-ResFIM框架,通过残差信息鱼尔矩阵量化模型参数对领域差异的敏感性,实现客户端自适应个性化,在公共数据集上验证了其有效性。

Comments accepted by ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13405 2026-03-17 cs.CV eess.IV

Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion

锚点强制:用于交互式流视频扩散的锚点记忆与三区域RoPE

Yang Yang, Tianyi Zhang, Wei Huang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo BlueImage Lab(vivo蓝影实验室) University of Hong Kong(香港大学)

AI总结 本文提出锚点强制框架,通过锚点引导重置缓存和三区域RoPE解决交互式流视频生成中的质量退化和运动动态减弱问题,提升感知质量和运动指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01050 2026-03-17 cs.CV cs.AI cs.GR

EgoGrasp: World-Space Hand-Object Interaction Estimation from Egocentric Videos

EgoGrasp:从第一人称视频中估计世界空间手-物体交互

Hongming Fu, Wenjia Wang, Xiaozhen Qiao, Rolandos Alexandros Potamias, Taku Komura, Shuo Yang, Zheng Liu, Bo Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 EgoGrasp提出了一种从动态第一人称视频中重建世界空间手-物体交互的方法,支持开放词汇物体,通过多阶段框架实现鲁棒的3D重建与姿态估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12759 2026-03-16 cs.CV

SAP: Segment Any 4K Panorama

SAP: 4K全景任意分割

Lutao Jiang, Zidong Cao, Weikai Chen, Xu Zheng, Yuanhuiyi Lyu, Zhenyang Li, Zeyu HU, Yingda Yin, Keyang Luo, Runze Zhang, Kai Yan, Shengju Qian, Haidi Fan, Yifan Peng, Xin Wang, Hui Xiong, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

AI总结 本文提出SAP模型,通过将全景分割转化为固定轨迹视角视频分割,实现4K高分辨率全景实例分割,合成183440张4K全景图像并提升零样本mIoU性能。

Comments Project Page: https://lutao2021.github.io/SAP_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏