arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2796
2603.25357 2026-03-27 cs.CV

InstanceAnimator: Multi-Instance Sketch Video Colorization

Yinhan Zhang, Yue Ma, Bingyuan Wang, Kunyu Feng, Yeying Jin, Qifeng Chen, Anyi Rao, Zeyu Wang

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) NUS(新加坡国立大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25196 2026-03-27 cs.CL cs.AI

A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations

一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力

Andong Tan, Shuyu Dai, Jinglu Wang, Fengtao Zhou, Yan Lu, Xi Wang, Yingcong Chen, Can Yang, Shujie Liu, Hao Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25131 2026-03-27 cs.CV

Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation

去噪与对齐:迈向无源无监督领域适应的鲁棒全景语义分割

Yaowen Chang, Zhen Cao, Xu Zheng, Xiaoxin Mi, Zhen Dong

机构 * Wuhan University(武汉大学) HKUST (Guangzhou)(香港科技大学(广州)) Wuhan University of Technology(武汉理工大学)

AI总结 本文提出DAPASS框架,通过全景置信度引导去噪和上下文分辨率对抗模块,解决无源领域适应中因几何失真和数据缺失导致的伪标签不准确问题,提升户外和室内场景的语义分割性能。

Comments Accepted to CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23997 2026-03-27 cs.CV

HGGT: Robust and Flexible 3D Hand Mesh Reconstruction from Uncalibrated Images

HGGT:从未校准图像中鲁棒且灵活的3D手形重建

Yumeng Liu, Xiao-Xiao Long, Marc Habermann, Xuanze Yang, Cheng Lin, Yuan Liu, Yuexin Ma, Wenping Wang, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Max-Planck-Institut für Informatik(马克斯·普朗克信息学研究所) Macau University of Science and Technology(澳门科技大学) Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出HGGT方法,通过将手形重建视为视觉-几何基础任务,首次联合推断3D手形和相机姿态,实现了从未校准视角的鲁棒性和灵活性,优于现有方法并在真实场景中表现优异。

Comments project page: https://lym29.github.io/HGGT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22883 2026-03-27 cs.CV

Group Editing: Edit Multiple Images in One Go

组级编辑:一次操作编辑多张图像

Yue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu, Qifeng Chen

机构 * HKUST(香港科技大学) THU(清华大学) SJTU(上海交通大学) University of Technology Sydney(悉尼科技大学)

AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。

Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05042 2026-03-27 cs.CV cs.RO

CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection

CoIn3D:重新审视配置不变的多摄像头3D目标检测

Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) Amazon Alexa AI(亚马逊Alexa人工智能)

AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24974 2026-03-27 math.OC cs.LG stat.ML

The Value of Information in Resource-Constrained Pricing

信息价值在资源受限定价中的作用

Ruicheng Ao, Jiashuo Jiang, David Simchi-Levi

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所) Department of Civil and Environmental Engineering and Operations Research Center, MIT(麻省理工学院土木与环境工程系及运筹学研究中心) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

AI总结 本文研究了在资源受限条件下,预测不确定性如何影响动态定价决策,通过线性需求、随机噪声和有限容量,证明了预测误差阈值对 regret 的影响,并展示了代理模型在降低方差中的作用。

Comments Extended version of the NeurIPS 2025 paper (arXiv:2501.14155). This version adds phase transition, surrogate-assisted variance reduction under model misspecification, and numerical experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24876 2026-03-27 cs.CV

OptiSAR-Net++: A Large-Scale Benchmark and Transformer-Free Framework for Cross-Domain Remote Sensing Visual Grounding

OptiSAR-Net++:跨领域遥感视觉定位的大型基准和无Transformer框架

Xiaoyu Tang, Jun Dong, Jintao Cheng, Rui Fan

机构 * South China Normal University(华南师范大学) Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Shanghai Research Institute for Intelligent Autonomous Systems(上海自主智能无人系统科学中心) State Key Laboratory of Intelligent Autonomous Systems(智能自主系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)

AI总结 本文提出OptiSAR-Net++,通过构建首个跨领域遥感视觉定位基准数据集,解决跨领域特征建模、计算效率和细粒度语义区分问题,提升定位精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24278 2026-03-27 cs.CV

TopoMesh: High-Fidelity Mesh Autoencoding via Topological Unification

TopoMesh: 通过拓扑统一实现高保真的网格自编码

Guan Luo, Xiu Li, Rui Chen, Xuanyu Yi, Jing Lin, Chia-Hao Chen, Jiahang Liu, Song-Hai Zhang, Jianfeng Zhang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) HKUST(香港科技大学)

AI总结 TopoMesh通过拓扑统一框架解决网格生成中的拓扑不匹配问题,利用稀疏体素VAE实现高保真重建,提升几何细节和锐利特征的保留能力。

Comments Accepted to CVPR 2026. Project page: https://logan0601.github.io/projects/topomesh/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01939 2026-03-27 cs.RO cs.AI

Towards Exploratory and Focused Manipulation with Bimanual Active Perception: A New Problem, Benchmark and Strategy

迈向探索性与聚焦性操控的双臂主动感知:一个新的问题、基准和策略

Yuxin He, Ruihao Zhang, Tianao Shen, Cheng Liu, Qiang Nie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出探索性与聚焦性操控(EFM)问题,建立EFM-10基准并提出双臂主动感知策略,通过主动视觉和力觉感知提升复杂操控任务的完成能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10028 2026-03-27 cs.CV cs.RO

3D Dynamics-Aware Manipulation: Endowing Manipulation Policies with 3D Foresight

3D动态感知操控:赋予操控策略三维前瞻性

Yuxin He, Ruihao Zhang, Xianzu Wu, Zhiyuan Zhang, Cheng Ding, Qiang Nie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) JAKA Robotics Co., Ltd.(JAKA机器人有限公司)

AI总结 本文提出一种融合3D世界建模与策略学习的框架,通过引入三个自监督任务提升操控策略的3D前瞻性,实验表明在仿真和现实环境中显著提升操控性能。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24430 2026-03-26 cs.SD

Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation

迭代以区分:增强零样本语音合成评估的判别性和可靠性

Shengfan Shen, Di Wu, Xingchen Song, Dinghao Zhou, Liumeng Xue, Meng Meng, Jian Luan, Shuai Wang

机构 * Nanjing University(南京大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出I2D框架,通过递归合成语音提升零样本TTS评估的判别性和可靠性,实验显示其能提高系统级SRCC至0.464。

Comments submitted to Interspeech 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24393 2026-03-26 cs.RO

3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models

3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Haishan Liu, Changti Wu, Hang Yuan, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团自动化研究院) ZGCI(中钢集团信息研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22171 2026-03-26 cs.CR cs.AI

Enhancing Jailbreak Attacks on LLMs via Persona Prompts

通过人格提示增强大语言模型的劫持攻击

Zheng Zhang, Peilin Zhao, Deheng Ye, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。

Comments Workshop on LLM Persona Modeling at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24045 2026-03-26 cs.CV

LGEST: Dynamic Spatial-Spectral Expert Routing for Hyperspectral Image Classification

LGEST: 动态空间-光谱专家路由用于超分辨率图像分类

Jiawen Wen, Suixuan Qiu, Zihang Luo, Xiaofei Yang, Haotian Shi

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学信息中心(广州)) Faculty of Geographical Science, Beijing Normal University(北京师范大学地理学部) School of Electronic and Communication Engineering, Guangzhou University(广州大学电子与通信工程学院)

AI总结 本文提出LGEST框架,通过DSAE生成判别性嵌入,结合CIEM-FPN动态融合多尺度特征,利用LGES专家系统提升超分辨率图像分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24014 2026-03-26 cs.AI

Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing

基于语言的多智能体规划用于个性化和公平的参与式城市传感

Xusen Guo, Mingxing Peng, Hongliang Lu, Hai Yang, Jun Ma, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出MAPUS框架,通过语言协商实现个性化和公平的参与式城市传感,提升参与度和可持续性。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23822 2026-03-26 cs.CR cs.CL cs.LG

How Vulnerable Are Edge LLMs?

边缘大语言模型有多脆弱?

Ao Ding, Hongzong Li, Zi Liang, Zhanpeng Shi, Shuxin Zhuang, Shiqin Tang, Rong Feng, Ping Lu

机构 * China University of Geoscience Beijing(中国地质大学(北京)) Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Polytechnic University(香港理工大学) Jilin University(吉林大学) City University of Hong Kong(香港城市大学) Chinese Academy of Sciences(中国科学院) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 研究探讨了在边缘设备上部署的量化大语言模型在查询基础上的知识提取风险,提出CLIQ框架提升语义覆盖并减少冗余,实验显示其在BERTScore、BLEU和ROUGE指标上优于原始查询,揭示了量化无法有效防护查询提取的潜在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21917 2026-03-26 cs.CV

Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration

扫描簇,而非像素:一种以簇为中心的高效超高清图像修复范式

Chen Wu, Ling Wang, Zhuoran Zheng, Yuning Cui, Zhixiong Yang, Xiangyu Chen, Yue Zhang, Weidong Jiang, Jingyuan Xia

机构 * National University of Defense Technology(国防科技大学) HKUST(GZ)(香港理工大学) Qilu University of Technology(青岛科技大学) Technical University of Munich(慕尼黑技术大学) TeleAI, China Telecom(TeleAI,中国电信) Beihang University(北航)

AI总结 本文提出C$^2$SSM,通过簇串行扫描替代像素串行扫描,实现超高清图像修复的高效处理,显著降低计算成本并取得新成果。

Comments Aceepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01540 2026-03-26 cs.CV

FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention

FlashVGGT: 高效且可扩展的视觉几何变换器与压缩描述符注意力

Zipeng Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出FlashVGGT,通过压缩描述符注意力机制解决传统自注意力的可扩展性问题,实现高效多视角图像三维重建,实验表明其在精度和效率上优于VGGT。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01718 2026-03-26 cs.RO cs.CV

Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process

统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型

Jiayi Chen, Wenxuan Song, Pengxiang Ding, Ziyang Zhou, Han Zhao, Feilong Tang, Donglin Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Westlake University(西交大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10223 2026-03-26 cs.CL cs.AI cs.LG

You only need 4 extra tokens: Synergistic Test-time Adaptation for LLMs

你只需要4个额外的标记:用于LLM的协同测试时间适应

Yijie Xu, Huizai Yao, Zhiyu Guo, Pengteng Li, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出SyTTA框架,通过输入侧困惑度和输出侧预测熵的协同作用,实现无需标注数据的LLM测试时间适应,显著提升农业问答任务的性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22460 2026-03-26 cs.AI

GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation

GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换

Shichao Weng, Zhiqiang Wang, Yuhua Zhou, Rui Lu, Ting Liu, Zhiyang Teng, Xiaozhang Liu, Hanmeng Liu

机构 * Fudan University(复旦大学) IFLYTEK CO.LTD(若lytek有限公司) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Defense Technology(国防科技大学) Hainan University(海南大学)

AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23152 2026-03-25 cs.RO

PHANTOM Hand

PHANTOM手

Teng Yan, Jiongxu Chen, Qixiang Hua, Yue Yu, Zihang Wang, Yaohua Liu, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 PHANTOM手通过结合精确分析形状与鲁棒合规抓取,实现自由运动规划的亚度精度和连续可预测力输出,提升欠驱动手的负载与灵活性。

Comments 8 pages. Submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23122 2026-03-25 cs.CV

PiCo: Active Manifold Canonicalization for Robust Robotic Visual Anomaly Detection

PiCo:主动流形规范化的稳健机器人视觉异常检测

Teng Yan, Binkai Liu, Shuai Liu, Yue Yu, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 PiCo通过主动流形规范化解决机器人视觉异常检测在多姿态和不稳定环境下的鲁棒性问题,采用分阶段机制提升几何不确定性和噪声消除能力,实验显示其在静态和闭环场景中均取得显著性能提升。

Comments 16 pages. Submitted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23034 2026-03-25 cs.CV

Traffic Sign Recognition in Autonomous Driving: Dataset, Benchmark, and Field Experiment

自动驾驶中的交通标志识别:数据集、基准测试与实地实验

Guoyang Zhao, Weiqing Qi, Kai Zhang, Chenguang Zhang, Zeying Gong, Zhihai Bi, Kai Chen, Benshan Ma, Ming Liu, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lingnan University(岭大) Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出TS-1M数据集及诊断基准,通过跨区域识别、稀有类别识别等挑战性任务,评估现代交通标志识别模型的性能,揭示语义对齐对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-03-25 cs.CV

VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Haozhe Wang, Weibin Li, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏