arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-04-03 至 2026-04-03 共收录 11
2604.02289 2026-04-03 cs.CV cs.AI

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00388 2026-04-03 cs.LG

Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode

扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式

Zeyuan He, Yupeng Chen, Lang Lin, Yihan Wang, Shenxu Chang, Eric Sommerlade, Philip Torr, Junchi Yu, Adel Bibi, Jialin Yu

机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软)

AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13024 2026-04-03 cs.LG math.OC

Fragility-aware Classification for Understanding Risk and Improving Generalization

面向脆弱性的分类:理解风险与提升泛化能力

Chen Yang, Zheng Cui, Daniel Zhuoyu Long, Jin Qi, Ruohan Zhan

机构 * School of Management, Zhejiang University(浙江大学管理学院) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(香港中文大学系统工程与工程管理系) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系) Department of Marketing and Analytics, University College London(伦敦大学学院市场营销与分析系)

AI总结 本文提出Fragility Index作为新型性能指标,从风险规避角度评估分类器,通过鲁棒满足框架确保在分布不确定性下的鲁棒性,并开发可训练框架以直接优化FI,实验证明其能揭示误差尾部风险并提升决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01681 2026-04-03 cs.RO cs.AI

Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning

通过代理快慢规划弥合大模型推理与实时控制

Jiayi Chen, Shuai Wang, Guangxu Zhu, Chengzhong Xu

机构 * Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong (Shenzhen)(深圳市大数据研究院,香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(澳门大学智慧城市物联网国家重点实验室)

AI总结 本文提出一种分层框架,通过感知-决策-轨迹-控制的分离,提升自动驾驶系统在扰动下的鲁棒性,减少侧向偏移和完成时间。

Comments 8 pages, 12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01569 2026-04-03 cs.CV cs.MM

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00986 2026-04-03 cs.CR cs.AI cs.CL cs.LG

Do Phone-Use Agents Respect Your Privacy?

手机使用代理是否尊重您的隐私?

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu Li, Chenxin Li, Jingyuan Hu, Shunian Chen, Tongxu Luo, Jiaxi Bi, Zeyu Qin, Shaobo Wang, Xin Lai, Pengyuan Lyu, Junyi Li, Can Xu, Chengquan Zhang, Han Hu, Ming Yan, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) Shanghai Jiao Tong University(上海交通大学) Hunyuan Team, Tencent(腾讯混元团队)

AI总结 研究手机使用代理在完成良性移动任务时是否尊重隐私,通过MyPhoneBench框架评估隐私行为,发现任务成功率、隐私合规完成和后续会话偏好使用是不同能力,无单一模型主导。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12372 2026-04-03 cs.AI cs.CL cs.LG

Efficient Reasoning with Balanced Thinking

高效平衡思考推理

Yulin Li, Tengyao Tu, Li Ding, Junjie Wang, Huiling Zhen, Yixin Chen, Yong Li, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zhongguancun Academy(中关村学院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReBalance框架,通过平衡思考提升推理效率,减少冗余并提高准确性,适用于多种推理任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23205 2026-04-03 cs.CV

EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents

EmbodMocap: 野外4D人体-场景重建用于具身智能体

Wenjia Wang, Liang Pan, Huaijin Pi, Yuke Lou, Xuqian Ren, Yifan Wu, Zhouyingcheng Liao, Lei Yang, Rishabh Dabral, Christian Theobalt, Taku Komura

机构 * The University of Hong Kong(香港大学) Tampere University(坦佩雷大学) The Chinese University of Hong Kong(香港中文大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出EmbodMocap,利用两部移动iPhone实现低成本、便携式的人体-场景重建,通过联合校准双RGB-D序列,在无静态相机和标记的情况下实现日常环境中的度量尺度和场景一致的重建,提升具身智能研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16515 2026-04-03 cs.CV

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10779 2026-04-03 cs.LG cs.AI

Unified Optimization of Source Weights and Transfer Quantities in Multi-Source Transfer Learning: An Asymptotic Framework

多源迁移学习中源权重和转移量的统一优化:一种渐近框架

Qingyue Zhang, Chang Chu, Haohao Fu, Tianren Peng, Yanru Wu, Guanbo Huang, Yang Li, Shao-Lun Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

AI总结 本文提出UOWQ框架,通过渐近分析将多源迁移学习建模为参数估计问题,理论证明了合理调整权重时使用全部源样本最优,并通过实验验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏