arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2388
2608.00415 2026-08-04 cs.CV cs.AI 新提交

Boosting Generalizable Depth Estimation in Endoscopy by Mixture of Lightweight Experts and Intrinsic Image Alignment

基于轻量级专家混合与本征图像对齐的内窥镜可泛化深度估计增强方法

Liangjing Shao, Beilei Cui, Yiming Huang, Changjing Liu, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出自监督框架EndoMINI,结合低秩专家混合与本征图像对齐,在多内窥镜数据集上实现了更优的可泛化深度估计性能。

Comments Accepted by MICCAI 2026 @ The Efficient Medical AI (EMA4MICCAI) Workshop (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01069 2026-08-04 cs.LG math.PR stat.ML 新提交

Characterizing Bias in Post-Bandit Inference under Index Algorithms

索引算法下后-bandit推理中的偏差表征

Lisu Wang, Yilun Chen, Jiaqi Lu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)经管学院)

AI总结 该研究针对UCB1等稳定索引算法,推导后-bandit推理中样本均值偏差和Z统计量的精确表达式,揭示了有效探索率这一偏差起源,发现索引函数选择存在遗憾-偏差权衡,采用新颖经验流体近似开展分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21918 2026-08-04 cs.RO 版本更新

Action-Conditioned World Model for Goal Plane Probe Guidance in Robotic Ultrasound

用于机器人超声中目标平面探头引导的动作条件世界模型

Siqi Fan, Mingcong Chen, Ran Liu, Zixuan Yang, Xiaoyu Fu, Xiaoqing Gao, Yunhui Liu, Hongbin Liu

机构 * Department of Mechanical and Automation Engineering, Chinese University of Hong Kong(香港中文大学机械与自动化工程学系) Department of Biomedical Engineering, City University of Hong Kong(香港城市大学生物医学工程学系) Centre for Artificial Intelligence and Robotics Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Surgical and Interventional Engineering, King’s College London(伦敦国王大学外科与介入工程学系) Department of Vascular Ultrasound, Xuanwu Hospital, the Capital Medical University(首都医科大学宣武医院血管超声科)

AI总结 研究针对机器人超声目标平面探头引导问题,提出基于模型的两阶段学习管道,包括潜在条件扩散世界模型和目标条件时间变换器,在自收集数据集及实际闭环实验中取得较好成果,证明学习到的超声动力学对训练目标导向机器人探头导航有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15553 2026-08-04 cs.LG cs.AI 版本更新

Distilling Drifting Transformers with Representation Autoencoders

用表示自编码器蒸馏漂移变换器

Jiawei Zhang, Mengfei Xia, Gen Li, Yuantao Gu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) CUHK(香港中文大学)

AI总结 提出Drift-RAE方法,通过漂移范式在表示自编码器潜空间中蒸馏预训练流模型,解决各向异性和大曲率问题,在ImageNet 256上仅用10k步达到1.77 FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30359 2026-08-04 cs.NE cs.DC cs.LG cs.PF cs.SE cs.SY eess.SY 版本更新

Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

Kernel Foundry:一种基于诊断的多专家进化内核优化器

Zixuan Huang, Da Chen, Kecheng Huang, Lihao Yin, Xing Li, Huiling Zhen, Mingxuan Yuan, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei Hong Kong(华为香港诺亚实验室)

AI总结 提出Kernel Foundry,一种结合专家引导初始化、多岛进化搜索和结构化诊断反馈的自动GPU内核优化框架,显著提升正确性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16949 2026-08-04 cs.LG cs.AI

Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning

突破探索瓶颈:面向通用大语言模型推理的Rubric引导强化学习

Yang Zhou, Sunzhu Li, Shunyu Liu, Wenkai Fang, Kongcheng Zhang, Jiale Zhao, Jingwen Yang, Yihe Zhou, Jianwei Lv, Tongya Zheng, Hengtong Lu, Wei Chen, Yan Xie, Mingli Song

机构 * Zhejiang University(浙江大学) Li Auto Inc.(力汽车公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Hangzhou City University(杭州市大学)

AI总结 本文提出Rubric-Scaffolded Reinforcement Learning,通过引入检查表式评分标准作为探索和利用的指导框架,突破通用大语言模型推理的探索瓶颈,提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10739 2026-08-04 cs.CL cs.AI 版本更新

Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving

长周期推理代理用于竞赛级数学问题求解

Yuzhe Gu, Songyang Gao, Zijian Wu, Lingkai Kong, Wenwei Zhang, Zhongrui Cai, Fan Zheng, Tianyou Ma, Junhao Shen, Haiteng Zhao, Duanyang Zhang, Huilun Zhang, Kuikun Liu, Chengqi Lyu, Yanhui Duan, Chiyu Chen, Ningsheng Ma, Jianfei Gao, Han Lyu, Dahua Lin, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab The Chinese University of Hong Kong(香港中文大学) ICMAT Spanish National Research Council(西班牙国家科研 council) The High School Affiliated to Renmin University of China(中国人民大学附属高中) Ren Hui Academy of Beijing(北京润辉学院)

AI总结 本文提出Intern-S1-MO,通过多轮分层推理和OREAL-H框架,突破IMO级数学问题的上下文限制,实现26/35分的优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21590 2026-08-04 cs.CV 版本更新

Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance

先恢复文本,后增强图像:基于字形结构引导的两阶段场景文本图像超分辨率

Minxing Luo, Linlong Fan, Wang Qiushi, Ge Wu, Yiyan Luo, Yuhang Yu, Jinwei Chen, Yaxing Wang, Qingnan Fan, Jian Yang

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) SDS, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)信息科学与技术学院)

AI总结 TIGER通过两阶段框架先恢复文本再增强图像,利用字形结构引导实现场景文本图像超分辨率的高保真度与可读性提升。

Comments Project Page: https://tony-lowe.github.io/TIGER_project_page/ GitHub Repo: https://github.com/OpenVeraTeam/TiGeSR Huggingface Dataset: https://huggingface.co/datasets/mxluocv/UZ-ST Huggingface Weights: https://huggingface.co/mxluocv/TiGeSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10726 2026-08-04 cs.CV 版本更新

WorldMirror: Universal 3D World Reconstruction with Any-Prior Prompting

WorldMirror:基于任意先验提示的通用三维世界重建

Yifan Liu, Zhiyuan Min, Zhenwei Wang, Junta Wu, Tengfei Wang, Yixuan Yuan, Yawei Luo, Chunchao Guo

机构 * Zhejiang University(浙江大学) Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan(腾讯混元)

AI总结 本研究提出WorldMirror这一统一前馈模型,可整合多种几何先验并生成多种三维表示,在多类三维几何任务的基准测试中达到最优性能且推理效率高。

Comments Accepted to ICML 2026. Code: https://github.com/Tencent-Hunyuan/HunyuanWorld-Mirror Project page: https://3d-models.hunyuan.tencent.com/world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29627 2026-08-03 cs.CV 新提交

FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control

FlexComposer:支持灵活轨迹控制的从图像到动态素材的统一视频合成框架

Songchun Zhang, Sitong Guo, Xianghao Kong, Pengwei Liu, Yuwei Guo, Lvmin Zhang, Anyi Rao

机构 * HKUST(香港科技大学) ZJU(浙江大学) CUHK(香港中文大学) Stanford University(斯坦福大学)

AI总结 FlexComposer是支持灵活轨迹控制的统一视频合成框架,通过三项关键设计实现静态图像与动态素材的无缝整合,在视觉质量等指标上优于现有SOTA方法。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29256 2026-08-03 cs.LG 新提交

UniPolymer: A Unified Framework for Property Prediction, Structure Recommendation, and Evaluation in Polyimide Design

UniPolymer:聚酰亚胺设计中用于属性预测、结构推荐与评估的统一框架

Junquan Hu, Zhihui Wang, Peng Xu, Xinru Guo, Xintong Li, Kun Lu, Ben Fei

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 UniPolymer是聚酰亚胺设计的统一框架,通过建立结构-属性映射、生成候选并评估排序,提升了属性预测与候选评估性能,减少了高成本实验的候选数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29209 2026-08-03 cs.LG cs.AI 新提交

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

SAF-OPD:面向策略内蒸馏的稳定优势融合

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Meituan(美团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 该研究提出SAF框架解决RLVR与OPD固定系数融合的熵崩溃问题,通过四阶段机制优化优势融合,在7个推理与代码生成基准上提升模型性能与训练稳定性。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29078 2026-08-03 cs.LG 新提交

DASH-OPD: Discrepancy-Aware Switching with Hysteresis for On-Policy Distillation

DASH-OPD:面向在线策略蒸馏的带滞后性的差异感知切换算法

Yuchen Xia, Qianguo Sun, Chao Song, Junlong Wu, Yiyan Qi, Yunjian Xu

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) Emdoor Research Institute(亿道研究院)

AI总结 本文针对在线策略蒸馏中执行器切换的问题,提出带滞后性的差异感知切换算法 DASH-OPD,经 ALFWorld 验证,其性能优于所有基线,训练与部署效率更优,相关代码等后续将发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29593 2026-08-03 cs.LG math.OC 新提交

Convergence and Regret of the Policy Gradient for Multi-Armed Bandits in Diffusion Environment

扩散环境中多臂老虎机的策略梯度算法:收敛性与悔憾分析

Yanwei Jia, Du Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 本文针对扩散环境中多臂老虎机的策略梯度算法,证明其收敛性并推导O(log T)阶悔憾上界,改进了现有分析且可推广至离散时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20075 2026-08-03 cs.SE cs.AI 版本更新

Agentic Harness for Real-World Compilers

面向现实世界的编译器助手

Yingwei Zheng, Cong Li, Shaohua Li, Yuqun Zhang, Zhendong Su

机构 * Southern University of Science and Technology(南方科技大学) ETH Zurich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出llvm-autofix,首个专为修复编译器bug设计的代理工具,通过专用工具和基准测试展示其在处理复杂编译器bug时的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18660 2026-08-03 cs.CV 版本更新

So-Fake: Benchmarking and Explaining Social Media Image Forgery Detection

So-Fake:社交媒体图像伪造检测的基准构建与可解释性研究

Zhenglin Huang, Xiangtai Li, Xi Yang, Bei Peng, Xiaowei Huang, Baoyuan Wu, Dacheng Tao, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Sheffield(谢菲尔德大学)

AI总结 该研究针对社交媒体图像伪造检测的数据集与基准缺口,构建了So-Fake-Set数据集与So-Fake-OOD分布外基准,提出采用强化学习的So-Fake-R1框架,其检测准确率与定位IoU均优于现有方法,为相关研究提供了新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28590 2026-07-31 cs.CV cs.CL 新提交

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。

Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28487 2026-07-31 cs.CV 新提交

AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans

AuricularWorld:用于CT扫描中耳部结构细粒度分割的分层动作引导世界建模

Jingwen Yang, Senmao Wang, Luoyao Kang, Runmeng Cui, Keying Zhang, Yunjia Bao, Haifan Gong, Lin Lin, Haiyue Jiang

机构 * Plastic Surgery Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院整形外科医院) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 该研究针对CT耳部细粒度分割难题,提出分层动作引导的AuricularWorld世界建模框架,通过迭代解剖学推理提升分割精度,使HD95降低超43%,验证了潜在世界模型推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28182 2026-07-31 cs.LG 新提交

Multi-channel Uplift Policy Learning

多渠道提升策略学习

Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Beihang University(北京航空航天大学) CUHK-shenzhen(香港中文大学(深圳))

AI总结 针对电商多渠道营销预算分配的预测后优化范式失效问题,提出快慢因果框架ReAlloc,经淘宝模拟与A/B测试验证可同时提升支付订单量和收入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25492 2026-07-31 cs.LG 版本更新

Quantum Speedups for Stochastic Optimization with Heavy-Tailed Noise

重尾噪声下随机优化的量子加速

Bin Luo, Chengchang Liu, Jonathan Allcock, Shengyu Zhang, John C. S. Lui

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Tencent Quantum Laboratory(腾讯量子实验室)

AI总结 研究重尾噪声下随机优化,提出量子均值估计器,基于此构建量子归一化和投影随机梯度下降方法,在低维情况下,相比经典方法,能以更少查询次数找到近似平稳点或\(\epsilon\)-最优解。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31413 2026-07-31 cs.AI cs.LG 版本更新

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

学会选择,而非重新学习:硬路由推理LoRA混合

Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

机构 * Halmstad University(哈尔姆斯塔德大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。

Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05113 2026-07-31 cs.MM cs.CR cs.LG 版本更新

CLIP-Guided Backdoor Defense through Entropy-Based Poisoned Dataset Separation

基于CLIP的后门防御:通过基于熵的中毒数据集分离

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

AI总结 该研究提出CLIP引导后门防御(CGD),用CLIP分离干净与中毒输入,重训练模型中和后门,在4个数据集11种攻击上ASR降至1%以下,CA降幅仅0.3%,适配性与鲁棒性优异。

Comments 15 pages, 9 figures, 15 tables. To appear in the Proceedings of the 32nd ACM International Conference on Multimedia (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26977 2026-07-30 cs.CL 新提交

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26860 2026-07-30 cs.LG 新提交

Amortized Moment Matching for Visual Generation

用于视觉生成的摊销矩匹配

Wenze Liu, Xintao Wang, Pengfei Wan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技影幻团队)

AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09472 2026-07-30 cs.RO cs.CV 版本更新

LLM-Grounded Dynamic Task Planning with Hierarchical Temporal Logic for Human-Aware Multi-Robot Handover

基于分层时序逻辑的LLM引导动态任务规划用于人感知多机器人协作

Shuyuan Hu, Tao Lin, Kai Ye, Tianwei Zhang

机构 * The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School)

AI总结 本文提出基于分层时序逻辑的神经符号框架,实现动态任务规划以提升多机器人协作的效率和鲁棒性。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25554 2026-07-29 cs.AI 新提交

Distilling Temporal Search and Reasoning: Evolving LLMs for Future Prediction via Harness-Assisted Efficient Data Synthesis

提炼时间搜索与推理:通过 harness 辅助的高效数据合成发展用于未来预测的大语言模型

Wanxu Cai, Zhengyu Chen, Huaisheng Zhu, Wei Wang, Jingang Wang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan LongCat Team(美团龙猫团队)

AI总结 研究未来事件预测难题,提出时间截断 harness 方法,通过强制时间截断减少时间泄漏与对拒绝采样等的依赖,构建相关语料库和度量标准,经蒸馏实验验证该方法能提升模型表现,将高质量数据转化为模型参数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏