arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1511
2605.30911 2026-06-01 cs.CV cs.AI

What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

什么使LVLMs更少产生幻觉?揭示影响幻觉鲁棒性的架构因素

Yusheng He, Jizhe Zhou, Xia Du, Zheng Lin, Jun Luo, Jiancheng Lv

机构 * School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(计算机科学学院,机器学习与产业智能工程研究中心,四川大学) School of Computer and Information Engineering, Xiamen University of Technology(计算机与信息工程学院,厦门理工大学) Department of Electrical and Computer Engineering, University of Hong Kong(电气与计算机工程系,香港大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

AI总结 本文通过将架构设计分解为语言基础、视觉表示和语义对齐三个维度,并引入CoSimUE基准,系统探索了架构因素对LVLMs幻觉鲁棒性的影响,发现模型参数扩展效果有限,而增强视觉编码器、语言基础和语义对齐能分别减少不同类型的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30409 2026-06-01 cs.CV cs.AI

SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer

SANA-Streaming: 基于混合扩散Transformer的实时流式视频编辑

Yuyang Zhao, Yicheng Pan, Qiyuan He, Jincheng Yu, Junsong Chen, Tian Ye, Haozhe Liu, Enze Xie, Song Han

机构 * NVIDIA MIT(麻省理工学院) THU(清华大学) NUS(新加坡国立大学) HKU(香港大学)

AI总结 提出系统-算法协同设计的SANA-Streaming框架,通过混合扩散Transformer架构、循环反向正则化训练策略和高效系统协同设计,在消费级GPU上实现高分辨率实时流式视频编辑,达到1280×704分辨率24 FPS的端到端性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20036 2026-06-01 cs.LG

D$^3$-Subsidy: Online and Sequential Driver Subsidy Decision-Making for Large-Scale Ride-Hailing Market

D$^3$-Subsidy:大规模网约车市场的在线和顺序司机补贴决策

Taijie Chen, Rui Su, Siyuan Feng, Laoming Zhang, Hongyang Zhang, Haijiao Wang, Zhaofeng Ma, Jintao Ke, Li Ma

机构 * University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 针对网约车市场动态环境,提出基于扩散的分层框架D$^3$-Subsidy,通过前缀条件扩散模型和拉格朗日对偶映射实现城市级补贴控制,在满足补贴率上限和低延迟约束下提升订单量和GMV。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15710 2026-06-01 cs.CV

UniMedVL: Unifying Medical Multimodal Understanding and Generation through Observation-Knowledge-Analysis

UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成

Junzhi Ning, Wei Li, Cheng Tang, Jiashi Lin, Chenglong Ma, Chaoyang Zhang, Jiyao Liu, Ying Chen, Shujian Gao, Yuandong Pu, Huihui Xu, Chenhui Gou, Ziyan Huang, Yi Xin, Qi Qin, Diping Song, Bin Fu, Guang Yang, Yuanfeng Ji, Tianbin Li, Yanzhou Su, Jin Ye, Shixiang Tang, Zhongying Deng, Lihao Liu, Ming Hu, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory Shanghai Innovation Institute Shanghai Jiao Tong University Shanghai Institute of Optics Fudan University University of Cambridge Monash University DAMO Academy, Alibaba Group Imperial College London The University of Hong Kong The Hong Kong University of Science Hupan Lab The Chinese University of Hong Kong

AI总结 提出首个统一医学模型UniMedVL,通过渐进式训练流水线融合多模态理解与生成能力,并在8种影像模态的5.6M实例数据集上验证其性能。

Comments This submission has been converted to the ICML template

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01926 2026-06-01 cs.CV cs.AI

Cross-Modal Attention Calibration for LVLM Hallucination Mitigation

跨模态注意力校准用于LVLM幻觉缓解

Jiaming Li, Jiacheng Zhang, Zequn Jie, Lin Ma, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) Meituan(美团) Inspur Database Technology(Inspur数据库技术) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

AI总结 提出一种无需训练的跨模态注意力校准方法,通过设计模态间解码和位置校准模块,缓解大型视觉语言模型中的幻觉问题。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30325 2026-05-29 cs.CV

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda: 通过蒸馏稀疏注意力实现可扩展的视频扩散

Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

机构 * ByteDance Inc.(字节跳动公司) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出Veda蒸馏稀疏注意力框架,通过统计感知的tile评分和头感知tile选择,在保持生成质量的同时实现视频扩散模型的高效加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30319 2026-05-29 stat.ML cs.AI cs.DS cs.LG math.ST stat.TH

Improved Guarantees for Heterogeneous Treatment-Effect Estimation via Matrix Completion

通过矩阵补全改进异质性处理效应估计的保证

Anay Mehrotra, Phuc Tran, Van H. Vu, Manolis Zampetakis

机构 * Stanford University(斯坦福大学) Vin University(文大学) The University of Hong Kong(香港大学) Yale University(耶鲁大学)

AI总结 针对面板数据中的异质性处理效应估计问题,提出一种基于矩阵补全的简单高效估计器,在低秩假设下实现行向$\ell_2$误差$ ilde{O}(\sqrt{1/n + n/m^2})$,并首次建立了低秩逼近的行向$\ell_2$扰动界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30227 2026-05-29 cs.MA cs.AI

Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization

统一基于LLM的多智能体提示优化中的时间与结构信用分配

Wenwu Li, Yuran Song, Mingze Zhao, Bo Jin, Wenhao Li

机构 * Tongji University(同济大学) The University of Hong Kong(香港大学)

AI总结 提出通过时间信用(状态空间瓶颈识别关键轮次)和结构信用(固定角色策略隔离智能体贡献)分解误差信号,并利用离散言语化块坐标下降算法迭代优化角色提示和聚合协议,降低查询复杂度并提升性能。

Comments 15 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29941 2026-05-29 cs.NI cs.LG

TraceCodec: A Compiler-Backed Neural Codec for Stateful Multi-Flow Network Traffic Traces

TraceCodec:一种基于编译器的有状态多流网络流量轨迹神经编解码器

Junhui Ding, Xinchen Zhang, Xiaohui Xie, Shinan Liu

机构 * Tsinghua University(清华大学) University of Hong Kong(香港大学)

AI总结 针对有状态多流网络流量轨迹的高保真生成问题,提出TraceCodec,通过将数据包解码为带时间戳的动作并学习连续潜在表示,再经确定性编译器还原为PCAP,实现精确的流量统计和TCP状态保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20752 2026-05-29 cs.RO

GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation

GaussianDream:用于机器人操作的前馈3D高斯世界模型

Zijian Zhang, Yuqing Jiang, Qian Cheng, Xiaofan Li, Si Liu, Ding Zhao, Ping Luo, Weitao Zhou, Haibao Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 提出GaussianDream,一种前馈3D高斯世界模型插件,通过可学习查询编码当前帧3D空间结构和短期未来演化,在训练时用静态重建和未来预测头监督,推理时仅保留查询条件化动作生成,在多个机器人操作基准上达到最先进性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05155 2026-05-29 cs.CV cs.AI

Aes3D: Aesthetic Assessment in 3D Gaussian Splatting

Aes3D: 3D高斯泼溅中的美学评估

Chuanzhi Xu, Boyu Wei, Haoxian Zhou, Xuanhua Yin, Zihan Deng, Haodong Chen, Qiang Qu, Weidong Cai

机构 * The University of Sydney(悉尼大学) The University of Hong Kong(香港大学)

AI总结 针对3D高斯泼溅场景缺乏美学评估的问题,提出首个系统框架Aes3D,包含专用数据集Aesthetic3D和轻量级模型Aes3DGSNet,直接预测场景级美学分数,无需渲染多视图图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29407 2026-05-29 cs.RO

Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation

相位条件化模仿学习与自主故障恢复用于鲁棒可变形物体操作

Dayuan Chen, Kai Tang, Yukuan Zhang, Kazuhiro Kosuge, Yasuhisa Hirata

机构 * Department of Robotics, Tohoku University(东大理学院机器人系) JC STEM Lab of Robotics for Soft Materials, the Department of Electrical and Computer Engineering, Faculty of Engineering, The University of Hong Kong(香港大学工程学院电气与计算机工程系软材料机器人实验室)

AI总结 提出一种相位条件化、力感知的闭环分层框架,通过FiLM调节的ACT编码器和多模态相位预测器实现自主故障恢复,显著提升可变形物体操作的成功率。

Comments Accepted to IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26412 2026-05-29 cs.CV cs.AI

LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation

LoCoT2V-Bench: 长文本与复杂文本到视频生成的基准测试

Xiangqing Zheng, Chengyue Wu, Kehai Chen, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) The University of Hong Kong(香港大学)

AI总结 针对长视频生成在复杂文本输入下的评估挑战,提出包含多场景提示与层次元数据的基准LoCoT2V-Bench,并设计多维度评估框架LoCoT2V-Eval,实验发现模型在细粒度文本-视频对齐和角色一致性方面存在显著不足。

Comments Accepted by ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05985 2026-05-29 cs.LG cs.RO

Dynamic Mixture of Progressive Parameter-Efficient Expert Library for Lifelong Robot Learning

动态渐进式参数高效专家库混合用于终身机器人学习

Yuheng Lei, Sitong Mao, Shunbo Zhou, Hongyuan Zhang, Xuelong Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Huawei Cloud Computing Technologies(华为云计算技术) Ola Dimensions HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心)

AI总结 针对终身学习中任务标识不可用和知识隔离问题,提出动态渐进式参数高效专家库混合(DMPEL),通过构建低秩专家库和轻量路由器实现灵活的前向迁移,并引入专家系数回放缓解遗忘,在LIBERO基准上以最少可训练参数和存储超越现有方法。

Comments Accepted to Transactions on Machine Learning Research (TMLR) at https://openreview.net/forum?id=MHVBrjS8cG . Code is available at https://github.com/HarryLui98/DMPEL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28517 2026-05-28 cs.LG cs.AI

Stochastic Gradient Descent with Momentum is Algorithmically Stable

带动量的随机梯度下降具有算法稳定性

Yunwen Lei, Zimeng Wang, Xiaoming Yuan

机构 * Department of Mathematics, The University of Hong Kong(香港大学数学系) Department of Mathematics and Mathematical Statistics, Umeå University(乌梅大学数学与统计学系)

AI总结 本文通过算法稳定性分析,证明了带动量的随机梯度下降(SGDM)在光滑凸问题上具有泛化保证,并建立了最优的过界总体风险界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28513 2026-05-28 cs.LG cs.AI

Learning Theory of the SVRG: Generalization and Convergence Analysis

SVRG的学习理论:泛化与收敛性分析

Yunwen Lei, Zimeng Wang, Xiaoming Yuan

机构 * Department of Mathematics, The University of Hong Kong(香港大学数学系) Department of Mathematics and Mathematical Statistics, Umeå University(乌梅大学数学与统计学系)

AI总结 本文通过算法稳定性分析,首次为非凸和强凸设置下的SVRG方法建立了非平凡的泛化界,揭示了优化与泛化之间的相互作用,并得到了最优的过量风险界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28306 2026-05-28 cs.CL cs.AI

Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models

面向混合专家模型中多语言下游任务的路由对齐微调

Guanzhi Deng, Kuan Wu, Haibo Wang, Shing Yin Wong, Sichun Luo, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 针对混合专家模型在多语言下游任务中的路由结构异构问题,提出RA-MoE三阶段框架,通过中间层语言通用对齐区识别任务相关专家,并引入路由对齐损失增强目标语言路由,实验表明该方法优于标准微调和强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14773 2026-05-28 cs.LG cs.AI

HO-SFL: Hybrid-Order Split Federated Learning with Backprop-Free Clients and Dimension-Free Aggregation

HO-SFL: 混合阶分割联邦学习,无反向传播客户端与维度无关聚合

Qiyuan Chen, Xian Wu, Yi Wang, Xianhao Chen

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong, Hong Kong SAR, China(电子与计算机工程系,香港大学,香港特别行政区,中国)

AI总结 提出HO-SFL框架,通过拉格朗日框架重构分割学习,服务器执行一阶更新而客户端进行零阶优化,实现无反向传播客户端、维度无关聚合,理论证明收敛速度与一阶方法相当,实验验证通信和内存成本显著降低。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10185 2026-05-28 cs.CL cs.AI cs.MA

Auditing medical multi-agent AI reveals risks of false consensus

审计医疗多智能体AI揭示虚假共识风险

Yinghao Zhu, Lei Gu, Zixiang Wang, Haoran Sang, Dehao Sui, Wen Tang, Lan Mi, Yasha Wang, Junyi Gao, Liang Yao, Tianfan Fu, Ewen Harrison, Lequan Yu, Liantao Ma

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院) Department of Nephrology, Peking University Third Hospital(北京大学第三医院肾内科) Key Laboratory of Carcinogenesis and Translational Research (Ministry of Education), Department of Lymphoma, Peking University Cancer Hospital & Institute(教育部癌症发生与转化研究重点实验室、北京大学肿瘤医院淋巴瘤科) Department of Automation, Tsinghua University(清华大学自动化系) Centre for Medical Informatics, The University of Edinburgh(爱丁堡大学医学信息学中心) Health Data Research UK(英国健康数据研究机构) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科贤医学院) State Key Laboratory for Novel Software Technology, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室、计算机科学学院)

AI总结 本研究提出MedAgentAudit框架,通过专家验证的审计流程诊断医疗多智能体系统中的协作失败模式,发现虚假共识、权威偏差等系统性风险。

Comments Code and Data: https://github.com/MedX-PKU/MedAgentAudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.15475 2026-05-28 cs.LG stat.ME

Causal Machine Learning: A Survey and Open Problems

因果机器学习:综述与开放问题

Jean Kaddour, Aengus Lynch, Qi Liu, Matt J. Kusner, Ricardo Silva

机构 * AI Centre, Department of Computer Science, UCL(人工智能中心,计算机科学系,伦敦大学学院) Department of Computer Science, University of Hong Kong(计算机科学系,香港大学) AI Centre, Department of Statistical Science, UCL(人工智能中心,统计科学系,伦敦大学学院)

AI总结 本文综述了因果机器学习(CausalML)的五个主要研究方向(因果监督学习、因果生成建模、因果解释、因果公平性和因果强化学习),系统比较了各方向的方法,指出了开放问题,并讨论了在计算机视觉、自然语言处理和图表征学习中的应用。

Comments v03. Work in progress. Feedback and comments are highly appreciated!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24636 2026-05-27 cs.AI cs.CL

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

GlobalDentBench:一个用于评估牙科领域大语言模型临床推理能力并包含专家校准的多国基准

Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen, Shuzhi Deng, Wenjing Yi, Chunfeng Luo, Hexian Zhang, Junying Chen, Tianrui Liu, Zhuhui Bai, Zixu Zhang, Pradeep Singh, Xiang Liu, Jianquan Li, Nhan L Tran, Falk Schwendicke, Zuolin Jin, Lijian Jin, Liangyi Chen, Wei-fa Yang, Benyou Wang, Junwen Wang, Shan Jiang

机构 * Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Department of Periodontology, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)牙周科) Beijing Institute of Collaborative Innovation(北京协同创新研究院) Department of Orthodontics, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)正畸科) Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)) College of Future Technology, Peking University(北京大学未来技术学院) Freedom AI New Cornerstone Science Laboratory, National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University, Beijing 100871, China(新基石科学实验室、国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究院、北京大学未来技术学院、生命科学中心,北京大学,北京100871,中国) IDG/McGovern Institute for Brain Research, Peking University, Beijing 100871, China(IDG/ McGovern脑科学研究院,北京大学,北京100871,中国) Division of Oral and Maxillofacial Surgery, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院口腔颌面外科系) Shenzhen Loop Area Institute(深圳河套学院) Department of Cancer Biology, Mayo Clinic Arizona, 5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA(梅奥诊所亚利桑那分部癌症生物学部门,5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA) Department of Conservative Dentistry, Periodontology and Digital Dentistry, LMU University Hospital, LMU Munich, Munich, Germany(慕尼黑大学医院保守牙科、牙周病学和数字牙科部门,慕尼黑,德国,慕尼黑大学) Division of Periodontology & Implant Dentistry, Faculty of Dentistry, The University of Hong Kong, Hong Kong, SAR, China(香港大学牙科学院牙周病学与种植牙科系,香港,中国)

AI总结 提出首个跨国牙科基准GlobalDentBench,包含14个专科、88个国家的8978道专家验证题目,评估三种推理层次,揭示当前大语言模型在牙科临床推理中性能随复杂度下降且存在高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26638 2026-05-27 cs.RO

HyperSim: A Holistic Sim-To-Real Framework For Robust Robotic Manipulation

HyperSim: 一种面向鲁棒机器人操作的整体仿真到现实框架

Junyi Dong, Haotian Luo, Ziwei Xu, Shengwei Bian, Heng Zhang, Sitong Mao, Jingyi Guo, Yang Xu, Wenhao Chen, Qiuyu Feng, Yao Mu, Ping Luo, Shunbo Zhou, Xiaodong Wu

机构 * CloudRobo Lab, Huawei Cloud Computing Technologies Co.,Ltd.(华为云计算技术有限公司云机器人实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 本文提出HyperSim框架,通过高保真环境合成、对抗轨迹生成和仿真-现实联合训练三大支柱,系统性地缩小仿真到现实的域差距,在400次真实世界任务执行中实现了ACT和π0分别达到80%和95%的仿真到现实成功率。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26612 2026-05-27 cs.CL

LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation

LATTE: 预测同伴锚定偏好轨迹以实现个性化LLM生成

Jinze Li, Xiaoyan Yang, Shuo Yang, Jinfeng Xu, Yue Shen, Jian Wang, Jinjie Gu, Edith Cheuk-Han Ngai

机构 * The University of Hong Kong(香港大学) Ant Healthcare, Ant Group(蚂蚁集团医疗科技部)

AI总结 提出LATTE框架,通过预测同伴锚定的相对偏好状态来个性化冻结的大语言模型,在Amazon Reviews 2023和MemoryCD上优于检索、摘要记忆和静态潜在轮廓等方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26596 2026-05-27 cs.AI

AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents

AGORA: 基于适配器接地观察-动作保留的LLM智能体无推理提示压缩

Haoran Zhang, Zhaohua Sun

机构 * AI Agent Technologies (Hong Kong) Limited(人工智能代理技术(香港)有限公司) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系)

AI总结 针对LLM智能体,提出AGORA无推理步骤级压缩器,通过结构提示解析器、格式关键内容保留和125M参数相关性评分器,在9个测试单元中8个保持≥75%的无压缩性能。

Comments 10 pages, 2 figures. Code and data: https://github.com/ranranrannervous/agoracompression

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02192 2026-05-27 cs.LG cs.DC

ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning

ECHO-2: 一种面向经济高效强化学习的大规模分布式推演框架

Jingwei Song, Meng Chen, Jie Xiao, Qingnan Ren, Jiaqi Huang, Yangshen Deng, Chris Tong, Wanyi Chen, Suli Wang, Zhisheng Chen, Ziqian Bi, Shuo Lu, Yiqun Duan, Xu Wang, Rymon Yu, Lynn Ai, Eric Yang, Tianyu Shi

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Gradient University of Edinburgh(爱丁堡大学) Soochow University(苏州大学) Technical University of Darmstadt(达姆施塔特技术大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 提出ECHO-2分布式强化学习框架,通过重叠推演生成、传播与训练,结合对等辅助流水线广播和成本感知异构工作节点激活,在保持奖励性能的同时显著提升成本效率。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09878 2026-05-27 cs.CV

MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation

MVISTA-4D: 用于机器人操作的一致性视图4D世界模型与测试时动作推理

Jiaxu Wang, Yicheng Jiang, Tianlun He, Jingkai Sun, Qiang Zhang, Junhao He, Jiahang Cao, Zesen Gan, Mingyuan Sun, Qiming Shao, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong, Hong Kong SAR(香港理工大学MMLab,香港中文大学,香港特别行政区) The Hong Kong University of Science(香港理工大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学)

AI总结 提出一种基于世界模型的4D场景生成方法,通过多视图RGBD预测和测试时动作优化,实现几何一致的4D动态预测与机器人操作。

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14702 2026-05-27 cs.AI cs.CV cs.RO

Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving

Drive-P2D:自动驾驶中视觉语言模型的渐进式感知到决策基准

Zecong Tang, Zixu Wang, Yifei Wang, Weitong Lian, Tianjian Gao, Haoran Li, Tengju Ru, Lingyi Meng, Zhejun Cui, Yichen Zhu, Qi Kang, Kaixuan Wang, Yu Zhang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 提出Drive-P2D基准,通过分离推理与答案的协议,在目标、场景和决策三个层级上评估视觉语言模型的感知到决策能力,并分析错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05729 2026-05-27 cs.CV

TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TAGRPO: 通过直接轨迹对齐提升图像到视频生成中的GRPO

Jin Wang, Jianxiang Lu, Guangzheng Xu, Comi Chen, Haoyu Yang, Linqing Wang, Peng Chen, Mingtao Chen, Zhichao Hu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文心)

AI总结 针对图像到视频生成中GRPO优化效果不佳的问题,提出基于对比学习的TAGRPO框架,通过中间潜变量对齐高奖励轨迹并远离低奖励轨迹,结合记忆库提升多样性,显著优于DanceGRPO。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17790 2026-05-27 cs.CV cs.CL

UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action

UltraCUA: 一种具有混合动作的计算机使用智能体基础模型

Yuhao Yang, Zhen Yang, Zi-Yi Dou, Anh Nguyen, Keen You, Omar Attia, Andrew Szot, Michael Feng, Ram Ramrakhya, Alexander Toshev, Chao Huang, Yinfei Yang, Zhe Gan

机构 * Apple(苹果公司) The University of Hong Kong(香港大学)

AI总结 提出UltraCUA基础模型,通过混合动作(融合原始GUI操作与高级工具执行)克服计算机使用智能体仅依赖原始GUI动作的局限性,采用自动化管道、合成数据引擎、混合动作轨迹收集和两阶段训练方法,在OSWorld和WindowsAgentArena上分别实现22%的相对性能提升和21.7%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01833 2026-05-27 cs.AI cs.CL

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

先规划后行动:面向LLM推理的高层规划引导强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang, Chaoda Song, Zhiqiang Gao, Shufei Zhang, Sumon Biswas

机构 * Case Western Reserve University, Cleveland, OH, USA(凯斯西储大学) Kean University, Union, NJ, USA(凯恩大学) The Ohio State University, Columbus, OH, USA(俄亥俄州立大学) Fudan University, Shanghai, China(复旦大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The University of Hong Kong, Hong Kong, China(香港大学) North Carolina State University, Raleigh, NC, USA(北卡罗来纳州立大学)

AI总结 提出PTA-GRPO两阶段框架,通过高层规划引导与强化学习联合优化,提升LLM在数学和自然科学推理任务中的准确性和泛化能力。

Comments 19 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏