arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-14 至 2026-05-14 共收录 18
2605.13831 2026-05-14 cs.CV

Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context

通过超越128K上下文的泛化有效训练长上下文视觉-语言模型

Zhaowei Wang, Lishu Luo, Haodong Duan, Weiwei Liu, Sijin Wu, Ji Luo, Shen Yan, Shuai Peng, Sihang Yuan, Chaoyi Huang, Yi Lin, Yangqiu Song

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)

AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13821 2026-05-14 cs.AI cs.LG

Harnessing Agentic Evolution

利用代理进化

Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 本文提出AEvo框架,通过统一接口整合程序和代理进化,提升长周期搜索性能,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13775 2026-05-14 cs.RO cs.CV

RoboEvolve: Co-Evolving Planner-Simulator for Robotic Manipulation with Limited Data

RoboEvolve:用于有限数据的机器人操作共进化规划-模拟器

Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 RoboEvolve通过共进化循环提升机器人操作性能,利用无标签种子图像实现高效数据生成,显著提升规划和模拟效果,同时表现出极高的数据效率和持续学习能力。

Comments On-going work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13757 2026-05-14 cs.RO

FrameSkip: Learning from Fewer but More Informative Frames in VLA Training

FrameSkip: 从更信息丰富的较少帧中学习以在VLA训练中提升性能

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Changti Wu, Hang Yuan, Haishan Liu, Bailing Wang, Cong Huang, Kai Chen

机构 * Harbin Institute of Technology(哈尔滨理工大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北航) DeepCybo

AI总结 本文提出FrameSkip框架,通过选择高重要性帧来优化VLA训练,提升成功率与保留率的平衡,实现在三个基准测试中达到76.15%的成功率。

Comments GitHub: https://github.com/ZGC-EmbodyAI/FrameSkip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13328 2026-05-14 cs.RO cs.AI cs.CL cs.CV

What Limits Vision-and-Language Navigation ?

什么是限制视觉-语言导航的因素?

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Zecui Zeng, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

AI总结 本文提出StereoNav框架,通过引入目标-位置先验和立体视觉,提升真实环境导航一致性,实验显示其在RGB性能和参数效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13321 2026-05-14 cs.RO

HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation

HCSG:以人类为中心的语义-几何推理用于视觉-语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Jin Wu, Huashuo Lei, Yunfan Lou, Lujia Wang, Hesheng Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 HCSG提出了一种以人类为中心的框架,通过结合几何预测和语义解释,提升动态环境中视觉-语言导航的安全性和社交智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13158 2026-05-14 cs.CV

Unifying Physically-Informed Weather Priors in A Single Model for Image Restoration Across Multiple Adverse Weather Conditions

统一物理信息天气先验在单个模型中用于多不良天气条件下的图像恢复

Jiaqi Xu, Xiaowei Hu, Lei Zhu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学(深圳)计算机科学与工程系) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) ROAS Thrust, the Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China and The Hong Kong University of Science and Technology, Department of Electronic and Computer Engineering, Hong Kong SAR, China(香港科学与技术大学(广州)ROAS方向及电子与计算机工程系,香港特别行政区)

AI总结 本文提出统一模型,考虑不同天气条件下的可见粒子和雾状散射效应,通过天气先验信息提升图像恢复性能,实验验证其优越性。

Comments Accepted by TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13156 2026-05-14 cs.CV

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

视觉语言模型中物体幻觉的双路径电路

Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

机构 * UIUC(伊利诺伊大学香槟分校) UMich(密歇根大学) Stanford(斯坦福大学) HKUST(香港科技大学) PKU(北京大学) NUS(新加坡国立大学) Marquette(马quette大学) Southampton(南安普顿大学)

AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13105 2026-05-14 cs.RO

What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调

Yuanfang Peng, Jingjing Fu, Chuheng Zhang, Li Zhao, Jiang Bian, Mingyu Liu, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12975 2026-05-14 cs.AI

Retrieval is Cheap, Show Me the Code: Executable Multi-Hop Reasoning for Retrieval-Augmented Generation

检索成本低廉,展示代码:可执行多跳推理的检索增强生成

Jiashuo Sun, Jimeng Shi, Yixuan Xie, Saizhuo Wang, Jash Rajesh Parekh, Pengcheng Jiang, Zhiyi Shi, Jiajun Fan, Qinglong Zheng, Peiran Li, Shaowen Wang, Ge Liu, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) Texas A&M University(德克萨斯农工大学)

AI总结 本文提出PyRAG框架,将多跳检索增强生成转化为程序合成与执行,通过可执行Python代码实现可调试的推理过程,提升多跳问答性能。

Comments 32 pages, 20 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12944 2026-05-14 cs.LG cs.CL

From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

从实例选择到固定池数据配方搜索用于监督微调

Haodong Wu, Jiahao Zhang, Lijie Hu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院)

AI总结 本文提出固定池数据配方搜索方法,通过结合过滤、混合和去重操作,高效生成高质量监督微调数据集,实验显示其优于全数据训练和随机搜索等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12714 2026-05-14 cs.LG cs.CL

Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs

逐层表示动态:跨嵌入器和基础大语言模型的实证研究

Jingzhou Jiang, Yi Yang, Kar Yan Tam

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出LRD框架,通过三种逐层测量家族分析语言模型的层间表示动态,揭示架构和任务层面差异,并应用于模型选择和层间剪枝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12703 2026-05-14 cs.CV cs.AI

MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

MMCL-Bench:多模态上下文学习从视觉规则、程序和证据

Yifan Chen, Fei Yin, Qingyan Bai, Zicheng Lin, Yujiu Yang

机构 * University of Cambridge(剑桥大学) HKUST(香港科技大学) Tsinghua University(清华大学)

AI总结 MMCL-Bench提出一个多模态上下文学习基准,要求模型从视觉或混合模态教学上下文中学习规则、程序和经验模式,并应用于新实例。评估发现当前系统在多模态上下文学习上仍不稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12671 2026-05-14 cs.CL

All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs

所有电路都通向罗马:重新思考用于大语言模型的电路和sheaf发现中的功能性各向异性

Xi Chen, Mingyu Jin, Jingcheng Niu, Yutong Yin, Jinman Zhao, Bangwei Guo, Dimitris N. Metaxas, Zhaoran Wang, Yutao Yue, Gerald Penn

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Toronto(多伦多大学)

AI总结 本文挑战了电路和sheaf发现中关于函数局部化的假设,展示单个任务可由多个结构不同的电路或sheaf支持,并提出Overlap-Aware Sheaf Repulsion方法以发现高表现低重叠的机制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09025 2026-05-14 cs.CV cs.AI

Skill-Conditioned Visual Geolocation for Vision-Language Models

基于技能的视觉地理定位用于视觉-语言模型

Chenjie Yang, Yutian Jiang, Yutong Deng, Chenyu Wu

机构 * Southwest Jiaotong University(西南交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06475 2026-05-14 cs.LG

Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning

迈向通用性推理:面向LLM推理的群体因果反事实策略优化

Jingyao Wang, Peizheng Guo, Wenwen Qiang, Jiahuan Zhou, Huijie Guo, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出群体因果反事实策略优化方法,通过反事实奖励提升LLM推理的通用性,强调推理过程的鲁棒性和有效性,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12574 2026-05-14 cs.CV cs.AI

DistractMIA: Black-Box Membership Inference on Vision-Language Models via Semantic Distraction

DistractMIA: 通过语义干扰在视觉语言模型上进行黑盒成员推断

Hongyi Tang, Zhihao Zhu, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 针对部署的视觉语言模型成员推断难题,提出DistractMIA框架,通过语义干扰技术在仅观察生成文本响应的情况下,有效区分成员与非成员样本,优于现有基线方法。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏