arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2388
2602.02402 2026-07-21 cs.RO cs.AI cs.CV physics.app-ph 版本更新

SoMA: A Real-to-Sim Neural Simulator for Robotic Soft-body Manipulation

SoMA:一种用于机器人软体操作的实-仿真神经模拟器

Mu Huang, Hui Wang, Kerui Ren, Linning Xu, Yunsong Zhou, Mulin Yu, Bo Dai, Jiangmiao Pang

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Shanghai Jiao Tong University, China(上海交通大学) The Chinese University of Hong Kong, China(香港中文大学) The University of Hong Kong, China(香港大学)

AI总结 SoMA是一种用于机器人软体操作的实-仿真神经模拟器,通过统一的潜在神经空间实现可控、稳定的长周期操作和泛化能力。

Comments Project page: https://city-super.github.io/SoMA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27497 2026-07-21 cs.LG cs.AI 版本更新

InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames

InertialAR:基于惯性框架的自回归3D分子生成

Haorui Li, Weitao Du, Yuqiang Li, Hongyu Guo, Shengchao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Ottawa(渥太华大学)

AI总结 研究探索基于Transformer的自回归模型在3D分子生成上的应用。提出InertialAR,通过规范标记化、几何位置编码及分层自回归范式应对挑战,在无条件和可控生成任务中表现出色,多个指标达领先水平。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23071 2026-07-21 cs.CL cs.AI 版本更新

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成

Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) McGill University, Montréal, Quebéc, Canada(麦吉尔大学) Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)

AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00898 2026-07-20 cs.LG cs.RO 版本更新

Dichotomous Diffusion Policy Optimization

二元扩散策略优化

Ruiming Liang, Yinan Zheng, Kexin Zheng, Tianyi Tan, Jianxiong Li, Liyuan Mao, Zhihao Wang, Guang Chen, Hangjun Ye, Jingjing Liu, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Xiaomi EV(小米电动车)

AI总结 DIPOLE是一种新的RL算法,通过二元策略分解实现稳定可控的扩散策略优化,适用于复杂现实应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15198 2026-07-17 eess.AS cs.SD 新提交

SLT 2026 REAL-TSE Challenge: Real-world Target Speaker Extraction from Conversational Recordings

SLT 2026真实TSE挑战:从对话录音中提取真实世界目标说话人

Shuai Wang, Zihan Qian, Ke Zhang, Jiangyu Han, Zikai Liu, Xiaoyang Yu, Haoyu Li, Marc Delcroix, Kai Yu, Lei Xie, Ming Li, Haizhou Li

机构 * Nanjing University(南京大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Brno University of Technology(布拉格技术大学) Northwestern Polytechnical University(西北工业大学) NTT, Inc.(NTT公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 介绍SLT 2026的REAL-TSE挑战,从真实对话录音提取目标说话人,有在线和离线赛道,评估指标多样,描述了任务定义等多方面内容及经验教训。

Comments Overview paper of Real-TSE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15053 2026-07-17 cs.NI cs.AI 新提交

ANet Patu-1: The Value of Connection in the Agent Network

ANet Patu-1:智能体网络中连接的价值

Mu Yuan, Jinke Song, Zhaomeng Zhou, Lan Zhang

机构 * Agent Network Research(代理网络研究) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究人工智能智能体网络连接价值,通过建模推导最优协作协议属性,引入ANet Patu-1协议。结果表明,异构便宜模型集体价值能超同构强模型,且异构网络能自收敛重构连接价值规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14777 2026-07-17 cs.CL 新提交

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

SEED:用于智能体强化学习的自进化在线策略蒸馏

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 研究针对基于结果的强化学习中间决策指导有限的问题,提出SEED框架。它将在线策略轨迹转化为训练技能并提炼回策略模型,通过微调策略生成技能,重新评分动作转化蒸馏信号,联合优化提升性能与样本效率及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14614 2026-07-17 cs.LG cs.AI cs.CL 新提交

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

超越熵:通过对比策略优化实现正确性感知优势塑造

Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) South China University of Technology(华南理工大学) Nanyang Technological University(南洋理工大学)

AI总结 研究提出对比策略优化(CPO),利用参考引导与普通生成分布的令牌级对比分歧实现正确性感知优势塑造,解决零优势问题,在基准实验中显著优于基于熵的方法,平衡探索与利用达最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14530 2026-07-17 cs.LG cs.CL 新提交

xHC: Expanded Hyper-Connections

xHC:扩展超连接

Xiangdong Zhang, Xiaohan Qin, Sunan Zou, Tuo Dai, Xiaoming Shi, Huaijin Wu, Yebin Yang, Zhuo Xia, Shaofeng Zhang, Lin Yao, Yuliang Liu, Yu Cheng, Junchi Yan

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Dots Studio, Xiaohongshu Inc.(小红书公司点点工作室) University of Science and Technology of China(中国科学技术大学) School of CS, Peking University(北京大学计算机科学学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对超连接(HC)扩展残差流时的性能瓶颈,提出xHC方法,结合时间特征增强与稀疏残差流架构,实现超越N = 4的有效扩展,在MoE模型上有下游改进,还介绍xHC - Flash减少内存流量,让大N残差流扩展用于语言模型预训练更有效实用。

Comments Technical report. Project page: https://github.com/aHapBean/xHC

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14485 2026-07-17 cs.AI 新提交

Step-Level Preference Learning for Generative Agents in Social Simulations

社会模拟中生成式智能体的步骤级偏好学习

Wenchang Gao, Pingyue Sheng, Lanlan Qiu, Yunfei Ma, Jian Zhao, Baicheng Chen, Kangda Wang, Yuyang Tian, Shunqiang Mao, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Xiongan AI Institute(雄安人工智能研究院) Tsinghua University(清华大学) CUHK-Shenzhen(香港中文大学(深圳)) USTC(中国科学技术大学) Sun Yat-sen University(中山大学)

AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。

Comments WAICA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14373 2026-07-17 cs.LG q-fin.RM 新提交

A Noise-Robust Elicit-to-Optimize Framework for Distortion Riskmetrics via Inverse Reinforcement Learning

一种通过逆强化学习实现的用于失真风险度量的抗噪声引出到优化框架

Yang Liu, Yuhao Liu, Yunran Wei

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)理工学院) School of Mathematics and Statistics, Carleton University(卡尔顿大学数学与统计学院)

AI总结 该研究提出抗噪声引出到优化框架,集成逆强化学习与强化学习。引出方面用自适应贝叶斯IRL方法,优化方面开发无模型RL算法,通过扩展PPO算法优化风险目标,实证研究证明框架在复杂金融环境中的准确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14114 2026-07-17 cs.CL cs.AI 新提交

CoEvoT: Co-Evolving Chain-of-Thought Prompting for Graph-LLM Reasoning

CoEvoT:用于图语言模型推理的协同进化思维链提示

Haohua Niu, Xingtong Yu, Yang Liu, Junfeng Fang, Xuanting Xie, Jie Tan, Zhongjian Zhang, Hong Cheng, Yuan Fang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunieations(北京邮电大学) Singapore Management University(新加坡管理大学)

AI总结 研究分布转移下的图学习问题,提出CoEvoT框架,通过文本到图令牌重写与图到文本推理指导的闭环协同进化,实现逐步的、状态感知的证据细化,在八个数据集实验中性能优于现有基准模型。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16805 2026-07-17 cs.SD 版本更新

Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training

通过联合训练使分离优先的多流音频水印技术成为可能

Houmin Sun, Zi Hu, Linxi Li, Yechen Wang, Liwei Jin, Carsten Maple, Ming Li

机构 * Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(杜克昆山大学数字创新研究中心) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) OfSpectrum, Inc., Los Angeles, USA(OfSpectrum公司,美国洛杉矶)

AI总结 本文提出一种分离优先的多流水印框架,通过联合训练水印系统和分离器,提升分离后的水印恢复效果并保持感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22809 2026-07-17 cs.CV 版本更新

PhotoAgent: Exploratory Visual Aesthetic Planning with Large Vision Models

PhotoAgent: 带探索性视觉审美规划的代理照片编辑

Mingde Yao, Zhiyuan You, King-Man Tam, Menglu Wang, Tianfan Xue

机构 * MMLab, CUHK(CUHK媒体实验室) Shanghai AI Lab(上海AI实验室) USTC(中国科学技术大学) Institute of Science Tokyo(东京科学研究所) CPII under InnoHK(创新香港下的CPII)

AI总结 PhotoAgent通过探索性视觉审美规划实现自主照片编辑,无需用户逐步提示,提升图像质量和指令遵循度。

Comments ICML 2026 Oral. A fully automated, intelligent photo-editing agent that autonomously plans multi-step aesthetic enhancements, smartly chooses diverse editing tools, and enables everyday users to achieve professional-looking results without crafting complex prompts. Project page: https://mdyao.github.io/PhotoAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16864 2026-07-17 cs.CV 版本更新

RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing

RePlan:基于推理的复杂基于指令的图像编辑区域规划

Tianyuan Qu, Lei Ke, Xiaohang Zhan, Longxiang Tang, Yuqi Liu, Bohao Peng, Bei Yu, Dong Yu, Jiaya Jia

机构 * Tencent AI Lab(腾讯人工智能实验室) CUHK(香港中文大学) HKUST(香港科技大学)

AI总结 研究针对复杂指令图像编辑中现有模型在IV-复杂性下的不足,提出RePlan框架,结合视觉语言规划器与扩散编辑器,经强化学习提升性能,还推出IV-Edit基准,该框架在相关设置中优于强大基线,提高了区域精度和整体一致性。

Comments [ECCV2026] Precise multi-region control and planning for instruction-based image editing. Our project page: https://replan-iv-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13633 2026-07-16 cs.RO 新提交

Design and Control of the "QuadBoat": A Quadruped Surface Vehicle for Drowning Rescue

“四足船”的设计与控制:一种用于溺水救援的四足水面机器人

Lianxin Zhang, Yihan Huang, Huihuan Qian

机构 * Shenzhen Institute of Artificial Intelligence and Robotics for Society (AIRS)(深圳社会人工智能与机器人研究所) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 研究针对水面救援中快速捞出受害者的问题,提出QuadBoat四足水面机器人,通过逆运动学及级联控制实现精确追踪找回物体,经机动性、跟踪等实验验证其高敏捷性、精度及系统机动性,视觉实验进一步验证其救援有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13481 2026-07-16 cs.CV 新提交

GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors

GPOcc++:具有视觉几何先验的统一稀疏高斯占用预测

Changqing Zhou, Yueru Luo, Yulan Guo, Bing Wang, Jie Qin, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 研究针对3D场景理解中从视觉观察恢复完整体积表示的挑战,提出GPOcc++,它基于视觉几何先验,将其转换为占用感知的稀疏高斯表示,能在统一框架中处理多视图观察和时间序列,扩展到室外,实验证明其性能强、效率高且泛化能力好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13399 2026-07-16 cs.CL cs.LG 新提交

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

揭开在线策略蒸馏的神秘面纱:作用、问题及调控

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室)

AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13101 2026-07-16 cs.LG cs.AI 新提交

TSSM: Triaxial State Space Model for Global Station Weather Forecasting with Temporal-Variable-Historical Modeling

TSSM:用于全球台站天气预报的具有时间可变历史建模的三轴状态空间模型

Songru Yang, Zili Liu, Tao Han, Ben Fei, Fenghua Ling, Lei Bai, Chang Liu, Xiangyang Ji, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 研究针对全球台站天气预报中现有方法的局限,提出三轴状态空间模型TSSM,通过时间可变历史范式纳入历史数据,设计扫描捕捉多种特性,在多数据集上性能优异,尤其在长期和迭代预测及应对缺失观测方面优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23531 2026-07-16 cs.RO 版本更新

BiliVLA: Scene-Aware Vision-Language-Action Model with Reinforcement Learning for Autonomous Biliary Endoscopic Navigation

BiliVLA: 基于强化学习的场景感知视觉-语言-动作模型用于自主胆道内镜导航

Jinsong Lin, Chi Kit Ng, Zhiyong Xiong, Zikang Pan, Yihan Hu, Tabassum Tamima, Ziyi Hao, Eddie Cheung, Jiewen Lai, Huxin Gao, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院) University of Cambridge(剑桥大学) University of California, Davis(加州大学戴维斯分校)

AI总结 提出BiliVLA框架,将胆道内镜导航建模为指令条件化的视觉运动学习问题,结合场景感知监督和两阶段训练(SFT+GRPO),在ERCP子任务中实现91.96%的动作精度和84.85%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02317 2026-07-16 cs.LG cs.AI cs.CY

Defining and Evaluating Physical Safety for Large Language Models

定义和评估大语言模型的物理安全性

Yung-Chen Tang, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院)

AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24563 2026-07-16 cs.CV cs.CL 版本更新

NeMo: Needle in a Montage for Video-Language Understanding

NeMo:视频语言理解中的蒙太奇之针

Zi-Yuan Hu, Shuo Liang, Duo Zheng, Yanyang Li, Yeyao Tao, Shijia Huang, Wei Feng, Jia Qin, Jianguang Yu, Jing Huang, Meng Fang, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Phoenix TV(凤凰电视台) Stanford University(斯坦福大学) University of Liverpool(利物浦大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12896 2026-07-15 cs.CV 新提交

UniMedSeg: Unified In-Context Learning for Multi-Paradigm 2D/3D Medical Image Segmentation

UniMedSeg:用于多范式2D/3D医学图像分割的统一上下文学习

Yunzhou Li, Jiesi Hu, Yanwu Yang, Hanyang Peng, Chenfei Ye, Jianfeng Cao, Yixuan Yuan, Ting Ma

机构 * Harbin Institute of Technology at Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) University Hospital Tübingen(图宾根大学医院) German Center for Mental Health(德国心理健康中心) Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对医学图像分割基础模型存在的问题,提出以Transformer为中心的UniMedSeg框架,通过映射多种信息到共享序列空间联合学习异构医学监督,引入解耦分割注意力克服内存瓶颈,在多类分割任务中实现最优性能且无需特定任务微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12746 2026-07-15 cs.CV 新提交

Color Pass-Through via Camera-Display Coupling

通过相机-显示器耦合实现颜色直通

Ruikang Li, Molin Li, Jiarui Wu, Zhe Wei, Pengpeng Liu, Tianfan Xue

机构 * CUHK MMLab(香港中文大学多媒体实验室) Zhejiang University(浙江大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

AI总结 研究智能手机相机捕捉场景与屏幕显示颜色差异问题,提出颜色直通的端到端学习框架,将相机和显示器视为耦合系统,经实验验证该方法能提升原始场景感知颜色的再现效果。

Comments 35 pages, 20 figures, including supplementary material. Project page: https://lyricccco.github.io/color-pass-through/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12398 2026-07-15 cs.CV cs.RO 新提交

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction

全局观察,局部细化:用于稳健徒手三维超声重建的全局视觉引导和局部超声线索

Yameng Zhang, Zhongyu Chen, Dianye Huang, Xiangyu Chu, K. W. Samuel Au, Zhongliang Jiang

机构 * Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Multi-Scale Medical Robotics Center(多尺度医疗机器人中心) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

AI总结 研究针对徒手三维超声重建中探头姿态估计易累积误差问题,提出全局到局部姿态估计框架,利用双相机分支和B模式分支及跨模态融合模块,经多尺度姿态损失约束,在数据集和体内实验中有效降低轨迹漂移,提升重建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏