arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The University of Hong Kong(香港大学)

2026-03-05 至 2026-03-05 共收录 6
2603.04128 2026-03-05 cs.CV cs.AI cs.MM

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作

Dongnuan Cai, Henghui Du, Chang Zhou, Xi Chen, Dan Guo, Hongyuan Zhang, Xuelong Li, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) Hefei University of Technology(合肥工业大学) The University of Hong Kong(香港大学)

AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03978 2026-03-05 cs.RO cs.GR

Map-Agnostic And Interactive Safety-Critical Scenario Generation via Multi-Objective Tree Search

基于多目标树搜索的无地图交互式安全关键场景生成

Wenyun Li, Zejian Deng, Chen Sun

机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系)

AI总结 本文提出一种基于多目标树搜索的无地图交互式安全关键场景生成方法,通过统一评估函数平衡探索与风险,生成真实且多样化的碰撞事件以提升自动驾驶系统的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24702 2026-03-05 cs.CL cs.AI

Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents

代理数据协议:统一多样化、高效的LLM代理微调数据集

Yueqi Song, Ketan Ramaneti, Zaid Sheikh, Ziru Chen, Boyu Gou, Tianbao Xie, Yiheng Xu, Danyang Zhang, Apurva Gandhi, Fan Yang, Joseph Liu, Tianyue Ou, Zhihao Yuan, Frank Xu, Shuyan Zhou, Xingyao Wang, Xiang Yue, Tao Yu, Huan Sun, Yu Su, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) University of Hong Kong(香港大学) Duke University(杜克大学) Fujitsu Research(富士通研究) All Hands AI(全手AI)

AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03401 2026-03-05 stat.ML cs.LG stat.ME

Beyond Cross-Validation: Adaptive Parameter Selection for Kernel-Based Gradient Descents

超越交叉验证:基于核梯度下降的自适应参数选择

Xiaotong Liu, Yunwen Lei, Xiangyu Chang, Shao-Bo Lin

机构 * Center for Intelligent Decision-Making and Machine Learning, School of Management, Xi’an Jiaotong University, Xi’an, China(智能决策与机器学习中心,管理学院,西安交通大学,西安,中国) Department of Mathematics, The University of Hong Kong, Hongkong, China(数学系,香港大学,香港,中国)

AI总结 本文提出了一种基于核梯度下降的自适应参数选择策略,通过经验有效维度量化迭代增量,理论证明其在不同核函数和误差度量下达到最优泛化误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏