arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2603.21716 2026-03-24 cs.LG cs.AI cs.CV

When Exploration Comes for Free with Mixture-Greedy: Do we need UCB in Diversity-Aware Multi-Armed Bandits?

当探索免费时的混合贪婪:我们是否需要在多样性意识的多臂老虎机中使用UCB?

Bahar Dibaei Nia, Farzan Farnia

机构 * Department of Computer Science and Engineering, Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

AI总结 在生成模型选择中,混合贪婪策略无需UCB探索奖励即可实现更快收敛和更高样本效率,挑战了传统多臂老虎机中UCB的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21700 2026-03-24 cs.CV

PPGL-Swarm: Integrated Multimodal Risk Stratification and Hereditary Syndrome Detection in Pheochromocytoma and Paraganglioma

PPGL-Swarm:集成多模态风险分层与遗传综合征检测的pheochromocytoma和paraganglioma诊断系统

Zelin Liu, Xiangfu Yu, Jie Huang, Ge Wang, Yizhe Yuan, Zhenyu Yi, Jing Xie, Haotian Jiang, Lichi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Ruijin Hospital(瑞金医院) ShanghaiTech University(上海科技大学)

AI总结 本文提出PPGL-Swarm系统,通过多模态证据整合实现全面诊断报告,包括自动化GAPP评分、基因风险警报及可追溯的推理路径,解决传统诊断方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21530 2026-03-24 cs.SE cs.AI

LLM-Based Test Case Generation in DBMS through Monte Carlo Tree Search

通过蒙特卡洛树搜索的基于大语言模型的数据库管理系统测试用例生成

Yujia Chen, Yingli Zhou, Fangyuan Zhang, Cuiyun Gao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Hong Kong Research Center(华为香港研究中心)

AI总结 本文提出MIST框架,通过蒙特卡洛树搜索生成不同数据库管理系统方言的语法正确且语义多样的测试用例,提升代码覆盖率。

Comments Accepted to ICSE 2026 Industry Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14783 2026-03-24 cs.CL cs.CY

Human or LLM as Standardized Patients? A Comparative Study for Medical Education

人类或大语言模型作为标准化患者?医学教育中的比较研究

Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Lei Zhou, Qianqian Xie, Benyou Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Freedom AI

AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。

Comments 24 pages, 13 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20066 2026-03-24 cs.CV

PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondence

PAUL:基于不确定性的分区与增强以实现在噪声对应下的鲁棒跨视图地理定位

Zheng Li, Xueyi Zhang, Yanming Guo, Yuxiang Xie, Ding Zhaoyun, Siqi Cai, Haizhou Li, Mingrui Lao

机构 * National University of Defense Technology(国防科技大学) Shenzhen Loop Area Institute(深圳河套学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

AI总结 本文提出PAUL框架,通过不确定性感知的共增强和证据共训练,解决跨视图地理定位中的噪声对应问题,提升鲁棒性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20669 2026-03-24 cs.RO cs.CV

ToFormer: Towards Large-scale Scenario Depth Completion for Lightweight ToF Camera

ToFormer:面向大规模场景深度补全的轻量级ToF相机

Juncheng Chen, Tiancheng Lai, Xingpeng Wang, Bingxin Liao, Baozhe Zhang, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber Systems and Control, Zhejiang University, Hangzhou, China(浙江大学工业控制技术状态重点实验室,系统与控制研究所,杭州,中国) Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院,湖州,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 本文提出全栈框架,通过多传感器平台收集大规模真实世界ToF样本,构建首个LASER-ToF数据集,并设计传感器感知深度补全网络,结合3D-2D联合传播池和多模态交叉协方差注意力模块,提升非均匀ToF深度稀疏性下的建模效果和3D-2D融合效率,实现轻量级部署和大规模场景映射。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07496 2026-03-24 cs.CR cs.AI

From Thinker to Society: Security in Hierarchical Autonomy Evolution of AI Agents

从思考者到社会:AI智能体分层自主性演化的安全问题

Xiaolei Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Tianyu Du, Heqing Huang, Hao Peng, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Independent Researcher(独立研究者) Zhejiang Normal University(浙江师范大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

AI总结 研究探讨了AI智能体分层自主性演化中的安全挑战,提出三级安全框架并分析现有防御措施的不足,旨在指导可信AI智能体系统的多层防御架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21247 2026-03-24 cs.CV

Subject Information Extraction for Novelty Detection with Domain Shifts

面向域偏移的新型别检测主题信息提取

Yangyang Qu, Dazhi Fu, Jicong Fan

机构 * School of Data Science The Chinese University of Hong Kong, Shenzhen, China(数据科学学院 香港中文大学(深圳))

AI总结 本文提出一种方法,通过分离主题信息与背景变化,提升域偏移下的检测性能,实验表明模型在未见领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11026 2026-03-24 cs.LG cs.AI cs.CL

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06135 2026-03-24 cs.GT cs.IR cs.LG

No-Regret Bayesian Recommendation to Homogeneous Users

无遗憾的贝叶斯推荐给同质用户

Yiding Feng, Wei Tang, Haifeng Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学)

AI总结 研究在线贝叶斯推荐问题,设计无Stackelberg遗憾的推荐策略,实现双对数级遗憾依赖于回合数,并通过线性规划优化展示多项式依赖于状态数的推荐策略。

Comments Accepted by OR'26, conference version in EC'22

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20194 2026-03-23 cs.CV

MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints

MME-CoF-Pro:基于文本和视觉提示评估视频生成模型中的推理一致性

Yu Qi, Xinyi Xu, Ziyu Guo, Siyuan Ma, Renrui Zhang, Xinyan Chen, Ruichuan An, Ruofan Xing, Jiayi Zhang, Haojie Huang, Pheng-Ann Heng, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) ByteDance Seed(字节跳动种子) Peking University(北京大学) NVIDIA(英伟达)

AI总结 本文提出MME-CoF-Pro视频推理基准,评估视频模型的推理一致性,发现生成模型推理一致性弱,文本提示提升正确性但导致不一致,视觉提示在结构化任务中表现较好但难以处理细粒度感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19659 2026-03-23 cs.CV

CS-MUNet: A Channel-Spatial Dual-Stream Mamba Network for Multi-Organ Segmentation

CS-MUNet:一种用于多器官分割的通道-空间双流Mamba网络

Yuyang Zheng, Mingda Zhang, Jianglong Qin, Qi Mo, Jingdan Pan, Haozhe Hu, Hongyi Huang

机构 * School of Software Engineering(软件工程学院) The Chinese University of Hong Kong(香港中文大学) Yunnan Provincial Key Laboratory of Software Engineering(云南省软件工程重点实验室)

AI总结 本文提出CS-MUNet,通过边界感知状态Mamba模块和通道Mamba状态聚合模块,解决腹腔器官分割中跨通道解剖语义协作和边界感知特征融合的问题,实验表明其在多个指标上优于现有方法。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18389 2026-03-23 physics.chem-ph cs.AI

An SO(3)-equivariant reciprocal-space neural potential for long-range interactions

一种基于SO(3)等价性的反演空间神经势场用于长程相互作用

Lingfeng Zhang, Taoyong Cui, Dongzhan Zhou, Lei Bai, Sufei Zhang, Luca Rossi, Mao Su, Wanli Ouyang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出EquiEwald,一种结合Ewald方法与SO(3)等价框架的神经势场,能有效模拟长程电相互作用,保持物理一致性并提升精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19486 2026-03-23 cs.CV

Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage

探索解耦和可控的人像图像合成:从端到端到分阶段

Zhengwentai Sun, Chenghong Li, Hongjie Liao, Xihe Yang, Keru Zheng, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Future Network of Intelligence Institute, CUHK-Shenzhen(智能网络研究院,CUHK-深圳)

AI总结 本文提出一种解耦可控的人像合成任务,通过分阶段框架提升可控性和泛化能力,优于端到端模型,适用于真实场景。

Comments A new version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19290 2026-03-23 cs.NE cs.AI

Neural Dynamics Self-Attention for Spiking Transformers

脉冲神经网络自注意力机制用于脉冲变换器

Dehao Zhang, Fukai Guo, Shuai Wang, Jingya Wang, Jieyuan Zhang, Yimeng Shan, Malu Zhang, Yang Yang, Haizhou Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 本文提出LRF-Dyn机制,通过局部感受野和膜电位动态减少内存开销并提升性能,验证了其在视觉任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18048 2026-03-23 cs.AI cs.SD eess.AS

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19227 2026-03-20 cs.CV

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

通过扩散基离散运动分词器弥合语义与运动条件

Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。

Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19206 2026-03-20 cs.CV

RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing

RPiAE:一种基于表示的自编码器,同时增强图像生成和编辑

Yue Gong, Hongyu Li, Shanyuan Liu, Bo Cheng, Yuhang Ma, Liebucha Wu, Xiaoyu Wu, Manyuan Zhang, Dawei Leng, Yuhui Yin, Lijun Zhang

机构 * Beihang University(北航大学) AI Research(360人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出RPiAE,一种基于表示的自编码器,通过引入表示偏转正则化和变分桥梁,提升图像生成和编辑的性能,实验表明其在文本到图像生成和图像编辑中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19191 2026-03-20 cs.AI

OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards

OS-Themis:一种可扩展的通用GUI奖励批评框架

Zehao Li, Zhenyu Wu, Yibo Zhao, Bowen Yang, Jingjing Xie, Zhaoyang Liu, Zhoumianze Liu, Kaiming Jin, Jianze Liang, Zonglin Li, Feng Wu, Bowen Zhou, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) The Hong Kong University of Science and Technology(香港科学大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出OS-Themis框架,通过分解轨迹为可验证里程碑并采用审核机制,提升GUI奖励的可扩展性和准确性,实验表明其在AndroidWorld中提升了在线强化学习和轨迹验证的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18899 2026-03-20 cs.LG math.OC

Uniform a priori bounds and error analysis for the Adam stochastic gradient descent optimization method

Adam随机梯度下降优化方法的统一先验界和误差分析

Steffen Dereich, Thang Do, Arnulf Jentzen

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Department of Probability and Statistic, Institute of Mathematics, Vietnam Academy of Science and Technology(概率与统计系,数学研究所,越南科学与技术 academy) School of Data Science and School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院和人工智能学院,香港中文大学(深圳))

AI总结 本文首次为强凸随机优化问题建立Adam方法的统一先验界,提供无条件误差分析。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18764 2026-03-20 cs.CV

ProCal: Probability Calibration for Neighborhood-Guided Source-Free Domain Adaptation

ProCal:基于邻域的源无关领域适应的概率校准

Ying Zheng, Yiyi Zhang, Yi Wang, Lap-Pui Chau

机构 * The JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) Department of Electrical and Electronic Engineering(电气与电子工程系) The Hong Kong Polytechnic University(香港理工大学) Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学)

AI总结 ProCal通过双模型协作预测机制动态校准邻域预测,缓解局部噪声干扰并保留源模型判别信息,提升领域适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18655 2026-03-20 cs.CV cs.AI

Multiscale Switch for Semi-Supervised and Contrastive Learning in Medical Ultrasound Image Segmentation

多尺度开关用于医学超声图像分割中的半监督和对比学习

Jingguo Qu, Xinyang Han, Yao Pu, Man-Lik Chui, Simon Takadiyi Gunda, Ziman Chen, Jing Qin, Ann Dorothy King, Winnie Chiu-Wing Chu, Jing Cai, Michael Tin-Cheung Ying

机构 * Department of Health Technology and Informatics, The Hong Kong Polytechnic University(健康科技与信息学系,香港理工大学) Centre for Smart Health and School of Nursing, The Hong Kong Polytechnic University(智能健康中心及护理学院,香港理工大学) Department of Imaging and Interventional Radiology, The Chinese University of Hong Kong(影像与介入放射科,香港中文大学)

AI总结 本文提出Switch框架,通过多尺度开关和频域开关提升医学超声图像分割的半监督和对比学习效果,在低标注率下取得显著Dice系数提升。

Comments This is the author-submitted LaTeX version with original typesetting. The final published version (with IEEE production formatting and layout changes) is available at http://doi.org/10.1109/TNNLS.2026.3669814 under CC BY 4.0 license

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19529 2026-03-20 cs.RO

RhoMorph: Rhombus-shaped Deformable Modular Robots for Stable, Medium-Independent Reconfiguration Motion

RhoMorph:菱形变形模块化机器人用于稳定、介质无关的重新配置运动

Jie Gu, Yirui Sun, Zhihao Xia, Tin Lun Lam, Chunxu Tian, Dan Zhang

机构 * Institute of AI and Robotics, Academy for Engineering & Technology, Fudan University(人工智能与机器人研究院,工程与技术学院,复旦大学) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Institute of Artificial Intelligence and Robotics for Society(社会人工智能与机器人研究所) Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)

AI总结 本文提出RhoMorph,一种新型可变形平面晶格自重构机器人,通过菱形模块实现稳定、介质无关的重新配置运动,采用简单控制策略实现形态变换、对接和移动等功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏