arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 324
2607.09727 2026-07-14 eess.SP cs.AI 新提交

The Universal Language of CSI:Unifying Wireless Sensing Across Devices and Environments

CSI的通用语言:统一跨设备和环境的无线传感

Jiayi Chen, Weiting Ou, Guangxu Zhu

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 研究旨在解决基于CSI的WiFi传感异构问题,提出基础模型框架,通过整理标准化数据集、引入模块化架构,将CSI视为有通用语法的语言,实现跨设备和环境统一无线传感,提升泛化能力,优于特定任务基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11849 2026-07-14 cs.CL 新提交

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

高级数学基准测试:用于高级数学证明生成与验证的基准测试套件

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai Jiao Tong University(上海交通大学) Great Bay University(大湾区大学)

AI总结 介绍用于评估高级数学推理能力的AdvancedMathBench基准测试套件,含ProverBench证明生成基准及自动验证管道,还有VerifierBench。实验显示前沿模型在证明生成与验证上表现不佳,该套件对模型提升高级数学证明能力有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11205 2026-07-14 cs.CV 新提交

Parallax Portrait Matting

视差人像抠图

Xin Cai, Jiawen Chen, Lars Jebe, Tianfan Xue, Zhoutong Zhang

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

AI总结 针对图像抠图难题,提出视差人像抠图方法,利用连拍摄影中相机小幅度运动产生的前景-背景视差,通过估计trimap和前景/背景运动构建对齐视图预测,能恢复更精细细节和准确前景颜色。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10522 2026-07-14 cs.CV cs.AI 新提交

Towards Autonomous and Auditable Medical Imaging Model Development

迈向自主且可审计的医学成像模型开发

Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Microsoft Research(微软研究院) Lehigh University(里海大学)

AI总结 研究针对医学成像模型开发困难的问题,提出AMID自主多代理框架。该框架含数据条件方法规划和验证引导两阶段优化,经20个医学成像任务验证,其性能优于通用MLE系统,能将特定任务模型开发转变为高效可审计的代理工作流程。

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10191 2026-07-14 cs.SD cs.AI 新提交

Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

通过深度特征锚定偏好优化打破流式目标说话人提取中的质量-可懂度权衡

Shuhai Peng, Jinjiang Liu, Hui Lu, Liyang Chen, Guiping Zhong, Jiakui Li, Shiyin Kang, Zhiyong Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) SenseTime(商汤科技)

AI总结 研究流式目标说话人提取中的质量-可懂度权衡问题,提出扩大Conformer卷积核及基于WavLM的DPO微调策略,实现了相对可懂度10.9%的提升,同时音频质量和说话人相似度也有改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10200 2026-07-14 cs.LG cs.NA math.NA stat.ML 新提交

The Differential Neural Tangent Kernel and Its Positivity

微分神经切线核及其正性

Bangti Jin, Longjun Wu

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对物理信息神经网络(PINN),提出微分神经切线核(DNTK)理论框架,通过NTK分析PINN,建立了无限宽度DNTK的正性,为训练PINN的梯度型算法分析奠定基础。

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09737 2026-07-14 physics.chem-ph cs.LG 新提交

Q-Score: A Quantum-Native Scoring Function for Molecular Docking

Q分数:一种用于分子对接的量子原生评分函数

Kangyu Zheng, Yidong Zhou, Ruihao Li, Zixin Ding, Zhiding Liang, Shaohua Li

机构 * Department of Computer Science(计算机科学系) The Chinese University of Hong Kong(香港中文大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Rutgers University(罗格斯大学) The University of Chicago(芝加哥大学)

AI总结 研究针对分子对接这一药物发现瓶颈,引入Q分数,通过图神经网络编码能量,利用数字化反绝热量子近似优化算法解决最大权重顶点团问题评分,在多个蛋白质靶点及大量分子上取得良好效果,验证了在噪声中等规模量子硬件上的可解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08804 2026-07-13 cs.GR cs.RO 新提交

Programming-by-Example for Batch-Editing Collision Meshes in 3D Software

3D软件中用于批量编辑碰撞网格的示例编程

Gengyang Xu, Dongwei Xiao, Hengcheng Zhu, Yiteng Peng, Wei Meng, Shuai Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对3D软件中碰撞网格编辑难题,提出神经符号程序合成方法,将任务转化为例程编程问题,通过MeshForge工具实现,在6 hundred个碰撞网格的24个任务中评估,成功合成多数任务,平均所需演示次数和合成时间较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08763 2026-07-10 cs.CV cs.AI 新提交

OpenCoF: Learning to Reason Through Video Generation

OpenCoF:通过视频生成学习推理

Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) CUHK IMIXR(香港中文大学IMIXR)

AI总结 研究针对视频生成中帧链推理缺乏多样监督和专门设计的问题,引入OpenCoF框架,含OpenCoF - 17K数据集和Wan - CoF模型。通过实验探索先进设计,发现视频推理需广泛时间监督和明确机制,还开源相关资源促进研究。

Comments Project Page: https://opencof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08539 2026-07-10 cs.DB cs.AI 新提交

DocMaster: A Hierarchical Structure-Aware System for Document Analysis

DocMaster:一种用于文档分析的分层结构感知系统

Ziqi Chen, Yingli Zhou, Fangyuan Zhang, Quanqing Xu, Chuanhui Yang, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对利用大语言模型分析复杂文档时现有系统丢弃分层结构致性能下降的问题,提出DocMaster系统,它能解析文档为分层树并构建语义索引,通过网页界面展示,可实现文档筛选与问答等功能。

Comments 4 pages, demo paper, under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08246 2026-07-10 cs.CV 新提交

SkelGen4D: Weakly-Supervised Skeleton-Based 4D Generation for Text-Driven Mesh Animation

SkelGen4D:用于文本驱动网格动画的弱监督基于骨架的4D生成

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Zhengzhe Liu, Dian Zhang, Haoran Xie, Bin Sheng, Jingyu Hu

机构 * School of Data Science, Lingnan University(岭南大学数据科学学院) Department of Computer Science and Engineering, Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Autodesk Research(Autodesk研究院) Institute of Computer Applications, Shanghai Jiao Tong University(上海交通大学计算机应用研究所)

AI总结 研究文本驱动的4D网格动画生成,提出弱监督前馈框架SkelGen4D,先从动画网格恢复伪骨架,再生成文本条件骨架运动序列并优化,在大规模基准测试中表现良好,能匹配或超越全监督基线,支持运动编辑且符合标准动画管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07388 2026-07-09 cs.CL cs.LG 新提交

TF-Engram: A Train-Free Engram with SSD-Backed Memory for Large Language Models

TF-Engram:一种用于大语言模型的基于固态硬盘支持内存的免训练印记

Yutang Ma, Kecheng Huang, Xikun Jiang, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology, Zhuhai(北京理工大学珠海学院)

AI总结 研究针对大语言模型知识扩展成本高问题,提出TF-Engram免训练印记系统,通过离线构建特定短语语义内存、跨层次存储及预测预取等方法,在Qwen3-0.6B上提升下游分数,证明可将其作为低开销组件集成到LLM推理中。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06871 2026-07-09 cs.CV 新提交

Geometric Collapse: When Vision Models Fail to Verify Physical Causality

几何崩溃:视觉模型何时无法验证物理因果关系

Wentao Zhang, Jinhu Qi, Weiqiang Jin, Yifei Zhang, Chan-Tong Lam, Irwin King

机构 * Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学) AgentecFusion Limited(AgentecFusion有限公司) School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

AI总结 研究视觉模型在验证物理因果关系时的问题,提出“Scrambled Edges”方法,通过特定控制分离无支撑边缘证据影响,实验表明该方法使预测偏差增大,几何崩溃全局传播,为改进模型物理合理性提供依据。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06781 2026-07-09 cs.LG 新提交

On Explicit Super-Expressive Approximation for Neural Networks

关于神经网络的显式超表达逼近

Feng-Lei Fan, Ze-Yu Li, Chen-Yu Wang, Jian-Jun Wang

机构 * City University of Hong Kong(香港城市大学) Chinese University of Hong Kong(香港中文大学) Guangxi Minzu University(广西民族大学)

AI总结 研究具有显式参数边界和基本激活函数的固定架构神经网络逼近问题,引入中国剩余定理,构建特定宽度和深度的网络,实现对不同类型函数的逼近,给出参数大小与逼近误差关系,是参数有界且架构无界范式对偶结果。

Comments 44 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06678 2026-07-09 cs.RO 新提交

NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation

NativeMEM:用于长期机器人操作的原生内存压缩

Ziye Wang, Modi Shi, Chaojun Ni, Jiazhi Yang, Mengdi Li, Zhizhong Su, Tianwei Lin, Hongyang Li

机构 * The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Horizon Robotics(地平线机器人)

AI总结 研究如何让预训练VLA模型高频更新时保留长期视觉历史且高效。提出NativeMEM策略,用原生内存压缩编码,通过开发分词器对齐内存令牌与策略,该方法在模拟和真实机器人实验中效果好,数据效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04434 2026-07-09 cs.RO cs.AI cs.CV cs.GR 新提交

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

RoboDojo:用于综合评估通用机器人操作策略的统一模拟与现实基准测试

Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Haoran Lu, Weijie Wan, Baijun Chen, Songling Liu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka

机构 * UC Berkeley(加州大学伯克利分校) THU(清华大学) PKU(北京大学) Stanford(斯坦福大学) MIT(麻省理工学院) UNC(北卡罗来纳大学) Princeton(普林斯顿大学) CMU(卡内基梅隆大学) NUS(新加坡国立大学) NTU(南洋理工大学) CUHK(香港中文大学) SJTU(上海交通大学) HKUST (GZ)(香港科技大学(广州)) ZJU(浙江大学) Yale(耶鲁大学)

AI总结 现有基准测试在系统评估通用机器人操作策略能力方面有限,本文引入RoboDojo统一基准测试,含模拟与现实任务,支持多维度评估及可扩展评估,还建立了公共排行榜与系统分析。

Comments Website: https://robodojo-benchmark.com/, Code: https://github.com/RoboDojo-Benchmark/RoboDojo, Leaderboard: https://robodojo-benchmark.com/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06559 2026-07-08 cs.RO 新提交

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

RynnWorld-4D:用于机器人操作的4D具身世界模型

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室)

AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05943 2026-07-08 cs.AI 新提交

SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation

SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能

Zhengbo Jiao, Yiming Cheng, Yilei Jiang, Kaituo Feng, Rui Huang, Tianyi Jiang, Juanxi Tian, Jiapeng li, Qunzhong Wang, Tailai Chen, Qianshan Wei, Chuan Xiao, Shanyu Rong, Yangfu Li, Yanhan Zhou, Yunpu Ma, Yifan Zhang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学多媒体实验室) THU(清华大学) HKU(香港大学) PKU(北京大学) NTU(南洋理工大学) CASIA(中国科学院自动化研究所) ECNU(华东师范大学) HIT(哈尔滨工业大学) LMU(慕尼黑大学)

AI总结 针对多模态搜索智能体多跳推理的挑战,提出SearchEyes,用类型化知识图谱构建模拟搜索世界,通过感知-知识链采样路径并保留元数据,采用跳锚策略优化,在六个基准测试中取得最优性能。

Comments Project page: https://github.com/Frostlinx/SearchEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05910 2026-07-08 cs.CV cs.AI cs.CL 新提交

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

PolicyShiftGuard:基准测试与改进策略自适应图像护栏

Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li

机构 * Fudan University(复旦大学) Tongji University(同济大学) Virtue AI(美德人工智能公司) The Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究策略自适应图像护栏问题,提出PolicyShiftGuard方法,结合随机策略SFT和边界对策略适应进行两阶段训练,在PolicyShiftBench基准测试中显著提升性能,消融实验验证关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05883 2026-07-08 cs.RO 新提交

DexTele: A Dual-Arm Dexterous Teleoperation System Based on Motion Retargeting and Adaptive Force Control

DexTele:一种基于运动重定向和自适应力控制的双臂灵巧遥操作系统

Yuanchuan Lai, Qing Gao, Ziyan Liang, Xianfeng Cheng, Junjie Hu, Zhaojie Ju

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) School of Computing, University of Portsmouth(计算学院,朴茨茅斯大学)

AI总结 研究针对双臂灵巧遥操作中运动重定向和抓取的挑战,提出DexTele系统,通过视觉运动重定向模块和自适应抓取模块,结合运动图编码器、视觉语言模型等技术,实现多平台精确运动重定向与柔顺抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05297 2026-07-07 cs.AI 新提交

MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution

MetaSkill-Evolve:基于双时间尺度元技能演化的大语言模型智能体递归自改进方法

Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) The Chinese University of Hong Kong(香港中文大学) MCML MemAgents Lab(MemAgents实验室)

AI总结 针对现有自改进智能体演化非递归的局限,提出双时间尺度框架,任务技能与元技能分层递归演化,在三类基准上显著提升测试精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04378 2026-07-07 cs.RO 新提交

SurgAM: Surgical Affordance Map Prediction with Multimodal Feature Fusion for Robot Autonomy

SurgAM:用于机器人自主的多模态特征融合手术能力地图预测

Lei Song, Yonghao Long, Mengya Xu, Jiayi Geng, Xiuyuan Chen, Qi Dou

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Department of Thoracic Surgery, Peking University People’s Hospital(北京大学人民医院胸外科) Thoracic Oncology Institute, Peking University People’s Hospital(北京大学人民医院胸部肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer, Chinese Academy of Medical Sciences(中国医学科学院早期非小细胞肺癌智能诊断与治疗研究组) Institute of Advanced Clinical Medicine, Peking University(北京大学先进临床医学院) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer, Peking University People’s Hospital(北京大学人民医院肺癌大数据创新应用北京市重点实验室)

AI总结 研究如何通过视觉数据识别手术可操作区域,提出自适应特征融合框架、分层提示学习机制和场景引导注意力解码器,建立新数据集验证,在真实模型上验证框架对下游自动化的适用性。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04344 2026-07-07 cs.CV cs.AI 新提交

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统

Hao Wei, Wenjin Qi, Dasen Dai, Minqing Zhang, Wu Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04270 2026-07-07 cs.IR cs.AI 新提交

LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation

LBR:减轻用于推荐的大语言模型中的长度偏差

Hongchen Li, Bohao Wang, Jingbang Chen, Weiqin Yang, Hang Pan, Bingde Hu, Can Wang, Jiawei Chen

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Bangsun Technology(Bangsun科技)

AI总结 研究大语言模型用于推荐时的长度偏差问题,提出LBR框架。通过长度感知注意力校准减轻输入偏差,引入有效信息长度归一化处理输出偏差,实验证明该框架能减轻偏差并提升推荐准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏