arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2603.05312 2026-03-06 cs.RO

UltraDexGrasp: Learning Universal Dexterous Grasping for Bimanual Robots with Synthetic Data

UltraDexGrasp: 为双臂机器人学习通用灵巧抓取

Sizhe Yang, Yiman Xie, Zhixuan Liang, Yang Tian, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 UltraDexGrasp通过合成数据训练出高效抓取策略,实现双臂机器人在多种物体上的高成功率抓取。

Comments Published at International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05017 2026-03-06 cs.RO

Direct Contact-Tolerant Motion Planning With Vision Language Models

直接接触容忍的运动规划与视觉语言模型

He Li, Jian Sun, Chengyang Li, Guoliang Li, Qiyu Ruan, Shuai Wang, Chengzhong Xu

机构 * State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(物联网智能城市国家重点实验室,澳门大学) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

AI总结 本文提出直接接触容忍运动规划方法,利用视觉语言模型实现接触感知导航,提升机器人在拥挤环境中的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00405 2026-03-06 cs.CV cs.AI cs.RO

EgoTraj-Bench: Towards Robust Trajectory Prediction Under Ego-view Noisy Observations

EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进

Jiayi Liu, Jiaming Zhou, Ke Ye, Kun-Yu Lin, Allan Wang, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)

AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04128 2026-03-05 cs.CV cs.AI cs.MM

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作

Dongnuan Cai, Henghui Du, Chang Zhou, Xi Chen, Dan Guo, Hongyuan Zhang, Xuelong Li, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) Hefei University of Technology(合肥工业大学) The University of Hong Kong(香港大学)

AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03978 2026-03-05 cs.RO cs.GR

Map-Agnostic And Interactive Safety-Critical Scenario Generation via Multi-Objective Tree Search

基于多目标树搜索的无地图交互式安全关键场景生成

Wenyun Li, Zejian Deng, Chen Sun

机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系)

AI总结 本文提出一种基于多目标树搜索的无地图交互式安全关键场景生成方法,通过统一评估函数平衡探索与风险,生成真实且多样化的碰撞事件以提升自动驾驶系统的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24702 2026-03-05 cs.CL cs.AI

Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents

代理数据协议:统一多样化、高效的LLM代理微调数据集

Yueqi Song, Ketan Ramaneti, Zaid Sheikh, Ziru Chen, Boyu Gou, Tianbao Xie, Yiheng Xu, Danyang Zhang, Apurva Gandhi, Fan Yang, Joseph Liu, Tianyue Ou, Zhihao Yuan, Frank Xu, Shuyan Zhou, Xingyao Wang, Xiang Yue, Tao Yu, Huan Sun, Yu Su, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) The Ohio State University(俄亥俄州立大学) University of Hong Kong(香港大学) Duke University(杜克大学) Fujitsu Research(富士通研究) All Hands AI(全手AI)

AI总结 本文提出代理数据协议(ADP),通过统一多样化代理训练数据集,提升LLM代理微调效果,实现20%的性能提升并在多个基准上达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05091 2026-03-05 cs.CV

Factuality Matters: When Image Generation and Editing Meet Structured Visuals

事实性至关重要:当图像生成与编辑遇见结构化视觉

Le Zhuo, Songhao Han, Yuandong Pu, Boxiang Qiu, Sayak Paul, Yue Liao, Yihao Liu, Jie Shao, Xi Chen, Si Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Beihang University(北京航空航天大学) Krea AI(Krea人工智能) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) Hugging Face National University of Singapore(新加坡国立大学) ByteDance(字节跳动) The University of Hong Kong(香港大学)

AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。

Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03401 2026-03-05 stat.ML cs.LG stat.ME

Beyond Cross-Validation: Adaptive Parameter Selection for Kernel-Based Gradient Descents

超越交叉验证:基于核梯度下降的自适应参数选择

Xiaotong Liu, Yunwen Lei, Xiangyu Chang, Shao-Bo Lin

机构 * Center for Intelligent Decision-Making and Machine Learning, School of Management, Xi’an Jiaotong University, Xi’an, China(智能决策与机器学习中心,管理学院,西安交通大学,西安,中国) Department of Mathematics, The University of Hong Kong, Hongkong, China(数学系,香港大学,香港,中国)

AI总结 本文提出了一种基于核梯度下降的自适应参数选择策略,通过经验有效维度量化迭代增量,理论证明其在不同核函数和误差度量下达到最优泛化误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03146 2026-03-04 cs.IT cs.AI cs.LG cs.NI math.IT

Channel-Adaptive Edge AI: Maximizing Inference Throughput by Adapting Computational Complexity to Channel States

通道自适应边缘AI:通过适应通道状态来最大化推理吞吐量

Jierui Zhang, Jianhao Huang, Kaibin Huang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(电子与电气工程系,香港大学)

AI总结 本文提出了一种自适应AI算法,通过动态调整计算复杂度和信道状态以优化边缘推理性能。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02802 2026-03-04 cs.CV

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

NOVA:无配对视频编辑的稀疏控制与密集合成

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si

机构 * Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) WeChat, Tencent(微信、腾讯) The University of Hong Kong(香港大学)

AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02772 2026-03-04 cs.RO

Agentic Self-Evolutionary Replanning for Embodied Navigation

代理自进化重规划用于具身导航

Guoliang Li, Ruihua Han, Chengyang Li, He Li, Shuai Wang, Wenchao Ding, Hong Zhang, Chengzhong Xu

机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) SIAT, Chinese Academy of Sciences(中国科学院上海技术物理研究所) Department of Computer Science, University of Hong Kong(香港大学计算机科学系) Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) Department of EEE, Southern University of Science and Technology(南方科技大学电子工程系)

AI总结 SERP通过自进化动作模型和图链式思考重规划,提升具身导航在复杂环境中的鲁棒性和效率。

Comments 8 pages, 10 figures, 4 tables, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01012 2026-03-04 cs.SE cs.AI

FastCode: Fast and Cost-Efficient Code Understanding and Reasoning

FastCode: 快速且成本有效的代码理解和推理

Zhonghang Li, Zongwei Li, Yuxuan Chen, Han Shi, Jiawei Li, Jierun Chen, Haoli Bai, Chao Huang

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 FastCode通过结构化勘探机制提升代码推理效率,减少计算成本,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24236 2026-03-04 cs.RO cs.CV

PROFusion: Robust and Accurate Dense Reconstruction via Camera Pose Regression and Optimization

PROFusion:通过相机姿态回归和优化实现鲁棒且准确的密集重建

Siyan Dong, Zijun Wang, Lulu Cai, Yi Ma, Yanchao Yang

机构 * The University of Hong Kong(香港大学)

AI总结 PROFusion通过结合学习初始化与优化细化,实现鲁棒且准确的密集重建,适用于不稳定运动场景。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02256 2026-03-04 cs.CV

CamDirector: Towards Long-Term Coherent Video Trajectory Editing

CamDirector: 向长期一致的视频轨迹编辑迈进

Zhihao Shi, Kejia Yin, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu

机构 * McMaster University(麦克 master 大学) University of Toronto(多伦多大学) The University of Hong Kong(香港大学) McGill University(麦吉尔大学) Concordia University(Concordia 大学) MBZUAI

AI总结 CamDirector通过混合变形方案和历史引导的自回归扩散模型,实现长期一致的视频轨迹编辑,并提出新的VTE基准iPhone-PTZ。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01724 2026-03-03 cs.AI

GMP: A Benchmark for Content Moderation under Co-occurring Violations and Dynamic Rules

GMP:在同时发生违规和动态规则下的内容审查基准

Houde Dong, Yifei She, Kai Ye, Liangcai Su, Chenxiong Qian, Jie Hao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The University of Hong Kong(香港大学)

AI总结 GMP提出一个基准,用于评估AI在同时发生违规和动态规则下的内容审查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01637 2026-03-03 cs.CV

DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

DriveCombo:自主驾驶中组合交通规则推理的基准测试

Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu

机构 * Autolab, Westlake University(西lake大学自动化实验室) Li Auto Inc(Li Auto公司) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 DriveCombo提出了一种基于文本和视觉的基准,用于评估自动驾驶中复杂交通规则的推理能力,通过五级认知阶梯和Rule2Scene代理提升模型在多规则冲突场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01450 2026-03-03 cs.CV

Deepfake Forensics Adapter: A Dual-Stream Network for Generalizable Deepfake Detection

深度伪造取证适配器:一种通用深度伪造检测的双流网络

Jianfeng Liao, Yichen Wei, Raymond Chan Ching Bon, Shulan Wang, Kam-Pui Chow, Kwok-Yan Lam

机构 * Shenzhen Technology University(深圳技术大学) Singapore Institute of Technology(新加坡理工学院) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出深度伪造取证适配器,通过双流网络结合CLIP模型实现高效通用深度伪造检测。

Comments Accepted at ICDF2C 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01101 2026-03-03 cs.SD cs.AI

SyncTrack: Rhythmic Stability and Synchronization in Multi-Track Music Generation

SyncTrack: 多轨音乐生成中的节奏稳定性与同步

Hongrui Wang, Fan Zhang, Zhiyuan Yu, Ziya Zhou, Xi Chen, Can Yang, Yang Wang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科学与技术大学数学系) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科学与技术大学跨学科研究学院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科学与技术大学神经系统紊乱国家重点实验室) The University of Hong Kong(香港大学)

AI总结 SyncTrack通过同步多轨波形音乐生成模型提升多轨音乐的节奏一致性和同步性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13305 2026-03-03 cs.CV

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架

Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Yafei Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Sichuan University(四川大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02477 2026-03-03 cs.CV cs.GR

Topology-Preserved Auto-regressive Mesh Generation in the Manner of Weaving Silk

保持拓扑结构的自回归网格生成:如编织丝绸般的方法

Gaochao Song, Zibo Zhao, Haohan Weng, Jingbo Zeng, Rongfei Jia, Shenghua Gao

机构 * University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯 Hunyuan 3D) Math Magic

AI总结 本文提出了一种保持拓扑结构的自回归网格生成方法,通过顶点分层和排序实现规范拓扑框架,提升网格生成的几何完整性和压缩效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03537 2026-03-03 cs.RO

Automated Action Generation based on Action Field for Robotic Garment Smoothing and Alignment

基于动作场的机器人服装平铺与对齐的自动化动作生成

Hu Cheng, Fuyuki Tokuda, Kazuhiro Kosuge

机构 * JC STEM Lab of Robotics for Soft Materials(机器人软材料实验室) Department of Electrical and Electronic Engineering(电气电子工程系) Faculty of Engineering(工程学院) The University of Hong Kong(香港大学)

AI总结 本文提出基于动作场的机器人服装平铺与对齐方法,通过神经网络生成动作向量并预测操作评分图,实现更高效的服装处理。

Comments Accepted by IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04490 2026-03-03 cs.CL q-bio.GN

Large Language Models in Bioinformatics: A Survey

大语言模型在生物信息学中的应用:综述

Zhenyu Wang, Zikang Wang, Jiyue Jiang, Pengan Chen, Xiangyu Shi, Yu Li

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University Third Hospital(北京大学第三医院) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

AI总结 本文综述了大语言模型在生物信息学中的应用,涵盖基因组序列建模、RNA结构预测等核心方法,并探讨了数据稀缺和跨组学整合等挑战及未来发展方向。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18041 2026-03-03 cs.CV cs.RO

Openfly: A comprehensive platform for aerial vision-language navigation

Openfly:面向空中视觉-语言导航的综合性平台

Yunpeng Gao, Chenhui Li, Zhongrui You, Junli Liu, Zhen Li, Pengan Chen, Qizhi Chen, Zhonghan Tang, Liansheng Wang, Penghui Yang, Yiwen Tang, Yuhang Tang, Shuai Liang, Songyi Zhu, Ziqin Xiong, Yifei Su, Xinyi Ye, Jianan Li, Yan Ding, Dong Wang, Xuelong Li, Zhigang Wang, Bin Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China University of Science and Technology(东华大学) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) TeleAI

AI总结 OpenFly平台通过整合多种渲染引擎和自动化工具链,构建大规模空中VLN数据集,并提出关键帧感知的VLN模型,提升户外空中视觉-语言导航的研究与应用。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00462 2026-03-03 cs.CV cs.AI

OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation

OPGAgent: 一种用于可审计牙科全景X光解读的智能体

Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge

机构 * AIM for Health Lab Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学) Monash University(莫纳什大学) Curae Health Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) National University of Singapore(新加坡国立大学) Southeast University(东南大学)

AI总结 OPGAgent是一种用于可审计牙科全景X光解读的智能体系统,通过多工具协调和共识机制,在结构化报告和VQA评估中优于现有牙科VLMs和医疗智能体框架。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23607 2026-03-03 cs.CV

Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

Concerto:联合2D-3D自监督学习产生空间表示

Yujia Zhang, Xiaoyang Wu, Yixing Lao, Chengyao Wang, Zhuotao Tian, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 Concerto通过联合2D-3D自监督学习,产生更连贯的信息空间表示,优于现有SOTA模型并在多个基准上取得新成就。

Comments NeurIPS 2025, produced by Pointcept, project page: https://pointcept.github.io/Concerto

Journal ref Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏