arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The University of Hong Kong(香港大学)

2026-03-25 至 2026-03-25 共收录 9
2603.23190 2026-03-25 cs.CV

Gaze-Regularized VLMs for Ego-Centric Behavior Understanding

基于目光调节的视觉语言模型用于以自身为中心的行为理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆凯特基金会数据科学研究所,香港大学)

AI总结 本文提出一种基于目光调节的视觉语言模型框架,通过整合目光信息提升以自身为中心的行为理解能力,实验结果显示在语义得分上提升了近13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23007 2026-03-25 cs.CR cs.AI

AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Screenshots-based Mobile GUI Agents

AgentRAE: 通过基于通知的视觉后门实现远程动作执行以对抗基于截图的移动GUI代理

Yutao Luo, Haotian Zhu, Shuchao Pang, Zhigang Lu, Tian Dong, Yongbin Zhou, Minhui Xue

机构 * Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) Western Sydney University(西澳大学) University of Hong Kong(香港大学) CSIRO’s Data61(澳大利亚CSIRO Data61)

AI总结 针对基于截图的移动GUI代理,提出AgentRAE通过自然视觉触发器诱导远程动作执行,采用两阶段管道提升代理对细微图标差异的敏感度,并通过后训练关联触发器与特定动作,实现高攻击成功率和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22877 2026-03-25 cs.AI

Continuous Optimization for Satisfiability Modulo Theories on Linear Real Arithmetic

基于线性实数算术的可满足性模理论的连续优化

Yunuo Cen, Daniel Ebler, Xuanyao Fong

机构 * Department of Electrical and Computer Engineering, National University of Singapore, Singapore(电子与计算机工程系,新加坡国立大学) School of Computing and Data Science, The University of Hong Kong, Hong Kong, China(计算与数据科学学院,香港大学)

AI总结 本文提出FourierSMT框架,通过扩展Walsh-Fourier展开到混合布尔-实数域,利用梯度方法解决高阶约束的满足问题,实现高效并行计算,提升大规模SMT求解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22801 2026-03-25 cs.LG

Transformers Trained via Gradient Descent Can Provably Learn a Class of Teacher Models

通过梯度下降训练的Transformer可以证明性地学习某一类教师模型

Chenyang Zhang, Qingyue Zhao, Quanquan Gu, Yuan Cao

机构 * The University of Hong Kong(香港大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文研究了通过Transformer学习各类教师模型的理论基础,证明单层Transformer能恢复教师模型的所有参数块并达到最优损失,同时展示其在分布外数据上的泛化能力。

Comments 64 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21356 2026-03-25 cs.CV cs.AI

Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding

gaze-VLM:通过注意力正则化连接 gaze 与 VLMs 以实现 egocentric 理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆斯克特基金会数据科学研究所,香港大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学)

AI总结 本文提出 gaze-regularized 框架,通过注意力正则化提升 VLMs 在细粒度未来事件预测和当前活动理解任务中的性能,实验表明在预测精度和鲁棒性上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05318 2026-03-25 cs.AI

BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation for Large Language Models via Lens of Dynamic Interactions

BIRD-INTERACT:通过动态交互视角重新审视大型语言模型的文本到SQL评估

Nan Huo, Xiaohan Xu, Jinyang Li, Per Jacobsson, Shipei Lin, Bowen Qin, Binyuan Hui, Xiaolong Li, Ge Qu, Shuzheng Si, Linheng Han, Edward Alexander, Xintong Zhu, Rui Qin, Ruihan Yu, Yiyao Jin, Feige Zhou, Weihao Zhong, Yun Chen, Hongyu Liu, Chenhao Ma, Fatma Ozcan, Yannis Papakonstantinou, Reynold Cheng

机构 * The University of Hong Kong(香港大学) Google Cloud(谷歌云) The BIRD Team(BIRD团队)

AI总结 本文提出BIRD-INTERACT基准,通过动态交互环境和双重评估设置,解决多轮对话中模糊查询和执行错误等问题,验证有效交互对复杂SQL任务的重要性。

Comments ICLR 2026 Oral. Dataset and code available at https://bird-interact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏