arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2392
2605.10769 2026-05-12 cs.CV cs.AI

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Southwest Jiaotong University(西南交通大学)

AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。

Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10529 2026-05-12 cs.AI cs.LG

PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs

PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) School of Computing and Information Systems(计算与信息系) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) School of Computing Technologies(计算技术学院) Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Department of Systems Engineering and Engineering Management(系统工程与工程管理系) The Chinese University of Hong Kong(香港中文大学) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出PrimeKG-CL基准,基于九个权威生物医学数据库构建,包含时间快照、任务和多模态特征,评估六种持续学习策略在不同解码器上的性能,发现解码器选择和策略交互显著,仅DistMult能区分持久与过时知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10445 2026-05-12 cs.CV

Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning

Uni-Synergy:通过协作强化学习实现个性化推理的理解与生成弥合

Zijun Shen, Sihan Yang, Ruichuan An, Ziyu Guo, Hao Liang, Ming Lu, Renrui Zhang, Wentao Zhang

机构 * Peking University(北京大学) Nanjing University(南京大学) CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出Sync-R1框架,通过协作强化学习统一优化个性化理解和生成,结合Sync-GRPO和DGS方法提升双任务协同效率,实验证明其在跨任务推理和鲁棒个性化方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10218 2026-05-12 cs.CL

Relative Score Policy Optimization for Diffusion Language Models

相对分数策略优化用于扩散语言模型

Zichao Yu, Shengze Xu, Bingqing Jiang, Wenyi Zhang, Difan Zou

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10204 2026-05-12 cs.CV

3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects

3DReflecNet:一个大规模数据集,用于反射、透明和低纹理物体的3D重建

Zhicheng Liang, Haoyi Yu, Boyan Li, Dayou Zhang, Zijian Cao, Tianyi Gong, Junhua Liu, Shuguang Cui, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学) University of Southern California(南加州大学)

AI总结 本文提出3DReflecNet数据集,包含超过700万张多视角图像,用于评估和推动针对反射、透明和低纹理物体的3D视觉方法,揭示现有方法在复杂材料下的局限性。

Comments This paper has been accepted by CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10199 2026-05-12 cs.CL eess.AS

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

LLMs在说话时应该如何倾听?对全双工语音对话中用户流路由的探讨

Hui Lu, Xueyuan Chen, Huimeng Wang, Shuhai Peng, Shiyin Kang, Xixin Wu, Zhiyong Wu

机构 * The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

AI总结 研究探讨了全双工语音对话中用户流路由对LLM的影响,通过对比通道融合与交叉注意力路由策略,发现通道融合在语义接地和问答性能上更优,但易受上下文干扰;交叉注意力路由更稳健,但问答表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10168 2026-05-12 cs.CL cs.IR

ASTRA-QA: A Benchmark for Abstract Question Answering over Documents

ASTRA-QA:基于文档的抽象问答基准

Shu Wang, Shansong Zhou, Xinyang Wang, Shiwei Wang, Hulong Wu, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Data Science Group(数据科学组)

AI总结 ASTRA-QA是首个针对文档抽象问答的基准,包含869个学术论文和新闻文档问题实例,涵盖五种抽象问题类型和三种检索范围,通过显式标注评估答案覆盖关键点和避免不支持内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10114 2026-05-12 cs.CL

SkillRAE: Agent Skill-Based Context Compilation for Retrieval-Augmented Execution

SkillRAE: 基于技能的上下文编译用于检索增强执行

Xiangcheng Meng, Shu Wang, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SkillRAE提出一种两阶段检索增强执行方法,通过构建多级技能图和救援感知紧凑编译,提升技能证据组织效率,实验证明在SkillsBench上比SOTA方法提升11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05775 2026-05-12 cs.CV cs.AI

The autoPET3 Challenge: Automated Lesion Segmentation in Whole-Body PET/CT $\unicode{x2013}$ Multitracer Multicenter Generalization

autoPET3挑战:全身体 PET/CT 中病变分割的自动化分割——多示踪多中心泛化

Jakob Dexl, Katharina Jeblick, Andreas Mittermeier, Balthasar Schachtner, Anna Theresa Stüber, Johanna Topalis, Maximilian Rokuss, Fabian Isensee, Klaus H. Maier-Hein, Hamza Kalisch, Jens Kleesiek, Constantin M. Seibold, Hussain Alasmawi, Lap Yan Lennon Chan, Yixuan Yuan, Alexander Jaus, Rainer Stiefelhagen, Pauline Ornela Megne Choudja, Konstantin Nikolaou, Christian La Fougère, Sergios Gatidis, Matthias P. Fabritius, Maurice Heimer, Gizem Abaci, Lalith Kumar Shiyam Sundar, Rudolf A. Werner, Jens Ricke, Clemens C. Cyran, Thomas Küstner, Michael Ingrisch

机构 * Department of Radiology, LMU University Hospital, LMU Munich(莱比锡大学医院放射科,莱比锡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University Hospital Tübingen, Department of Radiology(图宾根大学医院放射科) Department of Radiology, Stanford University(斯坦福大学放射科) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) Pattern Analysis and Learning Group, Department of Radiation Oncology, Heidelberg University Hospital(海德堡大学医院放射肿瘤学部模式分析与学习组) Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) Institute for AI in Medicine (IKIM), University Hospital Essen (AöR)(医学人工智能研究所(IKIM),埃森大学医院(AöR)) Department of Nuclear Medicine, University Hospital Essen (AöR)(核医学部,埃森大学医院(AöR)) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) HIDSS4Health - Helmholtz Information and Data Science School for Health(HIDSS4Health - 海德堡信息与数据科学健康学校) Department of Nuclear Medicine, LMU University Hospital, LMU Munich(莱比锡大学医院核医学部,莱比锡大学) Comprehensive Pneumology Center (CPC-M), Member of the German Center for Lung Research (DZL)(综合肺科中心(CPC-M),德国肺癌研究中心(DZL)成员) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI - 卡诺德·祖斯可靠性人工智能卓越学校) Cluster of Excellence iFIT (EXC 2180) "Image Guided and Functionally Instructed Tumor Therapies", University of Tübingen(卓越中心iFIT(EXC 2180)"图像引导和功能指导肿瘤治疗",图宾根大学)

AI总结 autoPET3挑战评估了全身体PET/CT中病变分割的自动化方法,通过多示踪多中心泛化设置测试,提出了一种基于nnU-Net的3D网络,改进了分割性能。

Comments Preprint submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10606 2026-05-12 cs.CV

ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models

ViSurf:面向大视觉-语言模型的视觉监督与强化微调

Yuqi Liu, Liangyu Chen, Jiazhen Liu, Mingkang Zhu, Zhisheng Zhong, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) Renmin University of China(中国人民大学) The Hong Kong University of Science(香港科学大学)

AI总结 本文提出ViSurf,一种融合监督微调与强化学习的单阶段方法,通过整合外部监督与内部强化提升大视觉-语言模型性能,实验表明其在多个基准上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21000 2026-05-12 cs.LG math.OC

Feature Augmentation of GNNs for ILPs: Local Uniqueness Suffices

图神经网络在整数线性规划中的特征增强:局部唯一性足够

Qingyu Han, Qian Li, Linxin Yang, Qian Chen, Qingjiang Shi, Ruoyu Sun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(深圳大学理工学院,香港中文大学(深圳)) Shenzhen International Center for Industrial and Applied Mathematics, Shenzhen Research Institute of Big Data, China(深圳国际工业与应用数学中心,深圳大数据研究院) School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳)) School of Software Engineering, Tongji University, Shanghai, China(软件工程学院,同济大学)

AI总结 本文提出局部UID方案和ColorGNN/ColorUID,通过局部唯一性提升GNN在ILP中的表达能力与泛化性能,实验显示在ILP基准上取得显著优势。

Comments 19 pages, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23511 2026-05-12 eess.AS cs.AI cs.CL cs.SD

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

MECAT:一个多专家构建的细粒度音频理解任务基准

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Xunying Liu, Junbo Zhang, Jian Luan

机构 * The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

AI总结 本文提出MECAT基准,通过集成专家模型分析与推理模型,提供细粒度音频描述和开放问题对,结合新指标DATE评估模型性能,评估现有音频模型的能力与局限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09944 2026-05-12 cs.RO

Explicit Stair Geometry Conditioning for Robust Humanoid Locomotion

显式楼梯几何条件化以实现稳健的人形机器人运动

Jianguo Zhang, Wentai Xu, Shusheng Ye, Yuxiang He, Weimin Qi, Qinbo Sun, Ning Ding, Liguang Zhou

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出显式楼梯几何条件化框架,通过提取步高、步深和当前偏航角等可解释参数,改进人形机器人爬楼梯的稳健性,实验证实其在不同楼梯高度下的泛化能力。

Comments 8 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09932 2026-05-12 cs.CL

FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

FocuSFT:基于稀释意识的长上下文微调的双层优化

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 FocuSFT通过双层优化框架解决长上下文微调中注意力稀释问题,提升模型在长上下文下的准确性和表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09810 2026-05-12 q-bio.BM cs.LG

TD3B: Transition-Directed Discrete Diffusion for Allosteric Binder Generation

TD3B:过渡引导的离散扩散用于别构结合物生成

Hanqun Cao, Aastha Pal, Sophia Tang, Yinuo Zhang, Jingjie Zhang, Pheng Ann Heng, Pranam Chatterjee

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Centre for Computational Biology, Duke-NUS Medical School(杜克-新加坡国立大学医学学校计算生物学中心)

AI总结 TD3B通过方向性状态转换控制目标,设计具有指定激动剂或拮抗剂行为的结合物,结合方向Oracle、软结合亲和门和预训练离散扩散模型的微调,实现与结合亲和力解耦的靶向生成。

Comments Published as a Spotlight at ICML 2026 (Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09649 2026-05-12 cs.LG

Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction

让每个token计数:通过KV缓存淘汰提升长上下文性能

Ngoc Bui, Hieu Trung Nguyen, Arman Cohan, Rex Ying

机构 * Department of Computer Science Yale University(耶鲁大学计算机科学系) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出一种基于全局保留的KV缓存淘汰方法,通过学习每个token的未来效用,减少缓存内存占用并提升长上下文推理性能。

Comments A learnable KV eviction method for large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09603 2026-05-12 cs.CL

Edit-Based Refinement for Parallel Masked Diffusion Language Models

基于编辑的平行掩码扩散语言模型精炼

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Junting Pan, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ME-DLM框架,通过轻量级后编辑步骤提升平行生成质量与鲁棒性,基于LLaDA实现HumanEval和GSM8K性能提升。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09362 2026-05-12 cs.GR cs.CV

FrameTwin: Curve-Anchored Gaussian Alignment from Sparse Views for Adaptive Wireframe 3D Printing

FrameTwin: 基于稀疏视角的曲线锚定高斯对齐用于自适应线框3D打印

Wenting Wang, Zhuo Huang, Kun Qian, Neelotpal Dutta, Yuhu Guo, Yingjun Tian, Yeung Yam, Charlie C. L. Wang

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Centre of Perceptual and Interactive Intelligence, Hong Kong(香港感知与交互智能中心) University of Manchester(曼彻斯特大学) Department of Mechanical and Aerospace Engineering, The University of Manchester, United Kingdom(曼彻斯特大学机械与航空航天工程系)

AI总结 FrameTwin通过曲线锚定高斯对齐方法,利用稀疏视角图像实现自适应线框3D打印的闭环控制,通过高斯核与参数曲线的结合,生成几何感知的紧凑编码,提升线框结构的拓扑捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09279 2026-05-12 cs.GR cs.CV cs.MM cs.NI eess.IV

CAGS: Color-Adaptive Volumetric Video Streaming with Dynamic 3D Gaussian Splatting

CAGS:基于动态3D高斯点云的色彩自适应体视频流媒体

Daheng Yin, Yili Jin, Jianxin Shi, Isaac Ding, Miao Zhang, Fangxin Wang, Zhaowu Huang, Cong Zhang, Jiangchuan Liu, Fang Dong

机构 * Simon Fraser University(西蒙弗雷泽大学) Jiangxing Intelligence Inc.(江行智能有限公司) McGill University(麦吉尔大学) Nankai University(南开大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fuzhou University(福州大学) Southeast University(东南大学)

AI总结 本文提出CAGS系统,通过向量量化建立LOD并利用低分辨率参考图像校正颜色失真,提升体视频流媒体在带宽波动下的PSNR性能和渲染效率。

Comments SIGGRAPH 2026 Conference Paper. Code is available at https://github.com/yindaheng98/ColorAdaptiveGaussianSplatting

Journal ref ACM SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07357 2026-05-12 cs.AI

GraphReAct: Reasoning and Acting for Multi-step Graph Inference

GraphReAct:多步图推断中的推理与行动

Xingtong Yu, Zhongwei Kuai, Chang Zhou, Xuanting Xie, Renhe Jiang, Xikun Zhang, Hong Cheng, Xinming Zhang, Yuan Fang

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) The University of Tokyo(东京大学) RMIT University(皇家墨尔本理工大学) Singapore Management University(新加坡管理学院)

AI总结 GraphReAct通过结合推理与行动,提升图数据的多步推断能力,通过拓扑和语义检索及上下文精炼实现信息逐步扩展与压缩,实验表明其优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14125 2026-05-12 cs.CV cs.AI cs.RO

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

HiVLA:一种以视觉为基础的分层具身操作系统

Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu, Zanxin Chen, Chunpu Xu, Haotian Liang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。

Comments Project Page: https://tianshuoy.github.io/HiVLA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13131 2026-05-12 cs.AI

MineEvolve: Self-Evolution with Accumulated Knowledge for Long-Horizon Embodied Minecraft Agents

MineEvolve: 基于积累知识的长周期具身Minecraft智能体自进化

Zhengwei Xie, Zhisheng Chen, Ziyan Weng, Jinhan Li, Chenglong Li, Zikai Xiao, Jingwei Song, Jinhao Jing, Vireo Zhang, Kun Wang

机构 * USTC(中国科学技术大学) NTU(国立台湾大学) CityU-DG(城市大学-数据科学) THU(清华大学) ZJU(浙江大学) HKU(香港大学) CUHK-SZ(香港大学-深圳)

AI总结 本文提出MineEvolve框架,通过将执行反馈转化为可操作的行为知识,提升长周期具身智能体在Minecraft中的表现,实验表明其在高依赖任务组中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00166 2026-05-12 cs.CV cs.AI

Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?

探索AI服从性:为何生成纯色图像比CyberPunk更困难

Hongyu Li, Kuan Liu, Yuan Chen, Juntao Hu, Huimin Lu, Guanjie Chen, Xue Liu, Guangming Lu, Hong Huang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(城市大学) Chinese University of Hong Kong(香港中文大学) McGill University(麦吉尔大学)

AI总结 研究探讨生成纯色图像的困难源于模型在复杂场景生成中的系统性失败,提出AI服从性框架和Violin基准测试,揭示闭源模型在确定性精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11906 2026-05-12 cs.CV cs.RO

SegSTRONG-C: Segmenting Surgical Tools Robustly On Non-adversarial Generated Corruptions -- An EndoVis'24 Challenge

SegSTRONG-C: 在非对抗性生成扰动下稳健分割手术工具 -- 一个EndoVis'24挑战

Hao Ding, Yuqian Zhang, Tuxun Lu, Ruixing Liang, Hongchao Shu, Lalithkumar Seenivasan, Yonghao Long, Qi Dou, Cong Gao, Yicheng Leng, Seok Bong Yoo, Eung-Joo Lee, Negin Ghamsarian, Klaus Schoeffmann, Raphael Sznitman, Zijian Wu, Yuxin Chen, Septimiu E. Salcudean, Samra Irshad, Shadi Albarqouni, Seong Tae Kim, Yueyi Sun, An Wang, Long Bai, Hongliang Ren, Ihsan Ullah, Ho-Gun Ha, Attaullah Khan, Hyunki Lee, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Sita Tailor, Ricardo Sanchez-Matilla, Imanol Luengo, Tianhao Fu, Jun Ma, Bo Wang, Marcos Fernández-Rodríguez, Estevao Lima, João L. Vilaça, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Intuitive Surgical Inc.(Intuitive Surgical公司) University of Arizona(亚利桑那大学) Chonnam National University(全州大学) University of British Columbia(不列颠哥伦比亚大学) Kyung Hee University(庆熙大学) University H(大学H)

AI总结 SegSTRONG-C挑战旨在研究模型在非对抗性扰动下的退化问题,通过生成清洁与扰动样本,评估工具分割算法的鲁棒性,并揭示提升鲁棒性的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08905 2026-05-12 cs.AI

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Forge:面向NP难优化问题的质量感知强化学习

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Independent(独立)

AI总结 本文提出OPT-BENCH框架,通过质量感知强化学习提升大语言模型在NP难优化问题上的表现,实验表明其在多个任务上均优于现有模型,且任务多样性对泛化能力影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-05-12 cs.CV

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08666 2026-05-12 cs.LG

The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits

无评论强化学习中的取消假设:从结果奖励到令牌信用

Tianhao Cheng, Zeyu Huang, Zihan Qiu, Yu Cheng, Edoardo Ponti, Yinghui Xu, Ivan Titov, Zenglin Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Edinburgh(爱丁堡大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Qwen Team, Alibaba Group(阿里集团Qwen团队) University of Amsterdam(阿姆斯特丹大学)

AI总结 本文从令牌层面研究无评论强化学习,揭示令牌翻转现象,并提出取消假设,解释令牌层面信用分配机制,通过实验验证该假设并提出改进训练的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06356 2026-05-12 cs.CV

SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation

SwiftI2V: 通过条件分段生成实现高效的高分辨率图像到视频生成

YaoYang Liu, Yuechen Zhang, Wenbo Li, Yufei Zhao, Rui Liu, Long Chen

机构 * HKUST(香港科技大学) CUHK(香港大学) Joy Future Academy(京东探索研究院) HKU(香港大学) HUAWEI Research(华为研究)

AI总结 本文提出SwiftI2V框架,通过分段生成和双向上下文交互,在2K分辨率下实现高效图像到视频生成,相比端到端模型减少GPU时间202倍。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23693 2026-05-12 cs.RO

Decentralized Heterogeneous Multi-Robot Collaborative Exploration for Indoor and Outdoor 3D Environments

去中心化异构多机器人协作探索室内和室外3D环境

Yuxiang Li, Kun Chen, Jiancheng Wang, Shihao Fang, Haoyao Chen, Yunhui Liu

机构 * College of Artificial Intelligence, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)人工智能学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

AI总结 本文提出去中心化协作框架,通过改进的监督体素分割和遗传算法优化,实现异构多机器人在复杂3D环境中的高效探索与通信节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22003 2026-05-12 cs.RO

VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models

VP-VLA:作为视觉语言动作模型接口的视觉提示

Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Bei Yu, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港大学) SmartMore(SmartMore公司)

AI总结 VP-VLA通过结构化视觉提示接口解耦高层推理与低层执行,提升空间精度和鲁棒性,实验证明优于现有端到端基线。

Comments Project page: https://visualprompt-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏