arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 96 篇

2603.25562 2026-04-28 cs.LG cs.AI cs.CL 75%

Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes

重新审视在线策略蒸馏:经验性失败模式及简单修复

Yuqian Fu, Haohuan Huang, Kaiwen Jiang, Jiacai Liu, Zhuo Jiang, Yuanheng Zhu, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中科院自动化所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) Fudan University(复旦大学) Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在线策略蒸馏的失败模式,提出改进方法提升训练稳定性,实验显示改进方法在多个任务中提升性能19.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05970 2026-04-28 cs.CV cs.AI cs.CL 73%

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样

Xudong Xie, Hao Yan, Liang Yin, Yang Liu, Jing Ding, Minghui Liao, Yuliang Liu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。

Comments Accepted by International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23150 2026-04-28 cs.LG cs.AI cs.AR 73%

Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns

通过专家激活模式扩展多节点专家混合推理

Abhimanyu Bambhaniya, Geonhwa Jeong, Jason Park, Jiecao Yu, Jaewon Lee, Pengchao Wang, Changkyu Kim, Chunqiang Tang, Tushar Krishna

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多节点MoE推理中的专家负载不均和路由效率问题,提出基于工作负载的微批次分组和专家放置策略,减少节点间通信开销,提升解码延迟和加速器利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22800 2026-04-28 cs.IR cs.AI cs.CL q-bio.QM 73%

RCSB PDB AI Help Desk: retrieval-augmented generation for protein structure deposition support

RCSB PDB AI Help Desk:基于检索增强生成的蛋白质结构沉积支持

Vivek Reddy Chithari, Jasmine Y. Young, Irina Persikova, Yuhe Liang, Gregg V. Crichlow, Justin W. Flatt, Sutapa Ghosh, Brian P. Hudson, Ezra Peisach, Monica Sekharan, Chenghua Shao, Stephen K. Burley

机构 * RCSB Protein Data Bank, Rutgers, The State University of New Jersey(RCSB蛋白质数据银行,新泽西州立大学拉特格斯分校) RCSB Protein Data Bank, San Diego Supercomputer Center, University of California San Diego(RCSB蛋白质数据银行,圣地亚哥超级计算机中心,加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于检索增强生成的AI帮助台系统,用于支持蛋白质结构沉积的验证与生物整理,通过RAG技术提升帮助台效率,实现全天候的存款人支持。

Comments 13 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22758 2026-04-28 cs.IR cs.AI cs.CL 73%

RedParrot: Accelerating NL-to-DSL for Business Analytics via Query Semantic Caching

RedParrot:通过查询语义缓存加速业务分析中的自然语言到DSL转换

Tong Wang, Yongqin Xu, Jianfeng Zhang, Lingxi Cui, Wenqing Wei, Suzhou Chen, Huan Li, Ke Chen, Lidan Shou

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RedParrot通过语义缓存加速自然语言到领域特定语言的转换,提升业务分析效率与准确性,实验显示在六个真实企业数据集上平均提速3.6倍,准确率提升8.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24348 2026-04-28 cs.CL 70%

OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents

OS-SPEAR:一个用于操作系统代理安全、性能、效率和鲁棒性分析的工具包

Zheng Wu, Yi Hua, Zhaoyuan Huang, Chenhao Xue, Yijie Lu, Pengzhou Cheng, Zongru Wu, Lingzhong Dong, Gongshen Liu, Xinghao Jiang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OS-SPEAR通过四个维度系统分析操作系统代理,解决现有评估方法在安全、效率和多模态鲁棒性方面的不足,揭示代理在效率与安全之间的权衡及不同模态的鲁棒性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23905 2026-04-28 cs.CR cs.AI 70%

SMSI: System Model Security Inference: Automated Threat Modeling for Cyber-Physical Systems

SMSI:系统模型安全推断:面向网络物理系统的自动威胁建模

RoÝah Radaideh, Ali Khreis

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(奥多亚大学电气工程与计算机科学学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SMSI框架,通过SysML模型生成优先级安全控制列表,采用神经符号混合方法实现CVE到MITRE ATT&CK的映射,并在医疗物联网网关上验证了其有效性。

Comments 9 pages, 8 figures, 7 tables. University of Ottawa for ELG5271/CSI5388

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05318 2026-04-28 cs.CV cs.AI 70%

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

mKG-RAG:利用多模态知识图谱在检索增强生成中进行知识密集型视觉问答

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出mKG-RAG框架,通过整合多模态知识图谱提升检索增强生成在知识密集型视觉问答中的性能,采用双阶段检索策略和图提取方法构建高质量知识图谱,实验表明优于现有方法。

Comments In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR'26), July 20-24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04118 2026-04-28 cs.LG stat.ML 70%

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

引导推测推断用于大型语言模型的高效测试时间对齐

Jonathan Geuter, Youssef Mroueh, David Alvarez-Melis

机构 * Harvard SEAS(哈佛大学SEAS学院) Kempner Institute(Kempner研究所) IBM Research(IBM研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。

Comments 41 pages, 11 figures. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 70%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22834 2026-04-28 cs.CV cs.LG 70%

WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training

为微控制器的WebSerial视觉训练:一种浏览器基于的设备端CNN训练配套工具

Jeremy Ellis

机构 * High School Robotics Educator(高中机器人教育者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出webmcu-vision-web,一种浏览器应用,用于在Seeed Studio XIAO ESP32-S3 Sense上端到端训练和部署TinyML视觉模型,提供本地机器学习流程,无需软件安装,支持实时激活可视化,实现快速训练部署。

Comments 29 pages, 16 figures, 5 tables. Paper 2 of the webmcu-ai series. All source code and supplemental results available at: https://github.com/webmcu-ai/webmcu-vision-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26380 2026-04-28 cs.CL 70%

Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers

切换注意力:面向动态和细粒度的混合变换器

Yusheng Zhao, Hourun Li, Bohan Wu, Yichun Yin, Lifeng Shang, Jingyang Yuan, Meng Zhang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, PKU-Anker LLM Lab, Peking University(计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出Switch Attention,一种动态路由全注意力与滑动窗口注意力的混合变换器,通过自适应正则化和持续预训练提升长上下文语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26158 2026-04-28 cs.CV cs.AI 70%

Towards Continual Expansion of Data Coverage: Automatic Text-guided Edge-case Synthesis

迈向数据覆盖的持续扩展:自动文本引导的边缘案例合成

Kyeongryeol Go

机构 * Superb AI Seoul, South Korea(首尔超凡AI研究所,韩国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自动文本引导的边缘案例合成方法,通过预训练语言模型生成多样化提示,提升模型鲁棒性,优于传统增强方法。

Comments Accepted in CVPR 2026 Workshop on How Do Vision Models Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09577 2026-04-28 cs.LG 70%

FlashNorm: Fast Normalization for Transformers

FlashNorm: 用于Transformer的快速规范化

Nils Graef, Filip Makraduli, Andrew Wasielewski, Matthew Clapp

机构 * OpenMachine

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FlashNorm通过消除归一化权重和并行执行RMS规范化,提升Transformer模型的计算效率,减少延迟并简化实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22604 2026-04-28 cs.HC 67%

Vibe coding for clinicians: democratising bespoke software development for digital health innovation

为临床医生的Vibe编码:民主化定制软件开发以推动数字健康创新

Ariel Yuhan Ong, Iain Livingstone, Caroline Kilduff, Mertcan Sevgi, David A Merle, Eden Ruffell, Pearse A Keane, Fares Antaki

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文探讨了Vibe编码如何帮助临床医生通过自然语言提示大型语言模型,实现快速原型设计数字健康解决方案,弥合临床洞察与技术执行间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22700 2026-04-28 cs.CR 67%

Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights

无形之手:一种无需梯度、数据和权重的灰盒位翻转攻击用于操控大语言模型

Abeer Matar A. Almalky, Ziyan Wang, Mohaiminul Al Nahian, Li Yang, Adnan Siraj Rakin

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出一种新的灰盒位翻转攻击框架,无需梯度、数据或权重信息,通过模型架构估计权重脆弱性,有效降低内存开销并提升任务扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24212 2026-04-28 cs.SE 67%

Empowering Autonomous Debugging Agents with Efficient Dynamic Analysis

通过高效动态分析赋能自主调试代理

Jiahong Xiang, Xiaoyang Xu, Xiaopan Chu, Hongliang Tian, Yuqun Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出Agent-centric Debugging Interface,通过函数级交互和Frame Lifetime Trace提升自主调试代理效率,在SWE-bench验证集上实现63.8%的任务解决率,成本仅为1.28美元/任务。

Comments Accepted to the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO 67%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23425 2026-04-28 cs.CR 67%

When the Agent Is the Adversary: Architectural Requirements for Agentic AI Containment After the April 2026 Frontier Model Escape

当代理成为对手:2026年4月前沿模型逃脱后代理AI约束的架构要求

Richard Joseph Mitchell

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文分析了四种现有约束方法的失效模式,提出五项架构要求,强调架构约束是应对代理AI安全威胁的唯一持久策略。

Comments 17 pages, 30 references, 5 tables. Derives five architectural requirements (R1-R5) for agentic AI containment from the April 2026 Mythos Preview incidents. Assesses AEGIS, Microsoft AGT, NVIDIA OpenShell, and other current systems; finds none satisfies all five requirements. Patent pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24492 2026-04-28 cs.CV cs.AI cs.ET cs.LG cs.NE 62%

Deployment-Aligned Low-Precision Neural Architecture Search for Spaceborne Edge AI

面向边缘AI的部署对齐低精度神经网络架构搜索

Parampuneet Kaur Thind, Vaibhav Katturu, Giacomo Zema, Roberto Del Prete

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) Φ \Phi -lab, ESA ESRIN(Φ实验室,欧洲航天局ESRIN) University of Pisa(比萨大学) Argotec Srl(Argotec公司)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种部署对齐的低精度神经网络架构搜索方法,通过在训练和评估中引入FP16数值约束,实现架构效率与数值鲁棒性的联合优化,提升边缘AI在资源受限环境下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22782 2026-04-28 cs.LG cs.AI 62%

Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing

随机KV路由:实现自适应深度-wise缓存共享

Anastasiia Filippova, David Grangier, Marco Cuturi, João Monteiro

机构 * Apple(苹果公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过随机跨层注意力机制实现高效的深度-wise缓存共享,减少内存占用并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22778 2026-04-28 cs.LG cs.AI 62%

The Spectral Lifecycle of Transformer Training: Transient Compression Waves, Persistent Spectral Gradients, and the Q/K--V Asymmetry

Transformer训练的谱生命周期:瞬态压缩波、持久谱梯度以及Q/K--V不对称性

Yi Liu

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文系统研究了Transformer预训练过程中权重矩阵奇异值谱,发现瞬态压缩波、持久谱梯度和Q/K--V不对称性现象,并提出了双时间尺度动态模型和缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00923 2026-04-28 cs.CV cs.AI 57%

Reclaiming Residual Knowledge: A Novel Paradigm to Low-Bit Quantization

Róisín Luo, Alexandru Drimbarean, James McDermott, Colm O'Riordan

机构 * Tobii Corporation(托比公司)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

Comments Accepted by The 35th British Machine Vision Conference (BMVC 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24086 2026-04-28 cs.RO cs.AI 57%

AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation

AsyncShield: 一种异步云边协同的边缘适配器用于异步云边VLA导航

Kai Yang, Zedong Chu, Yingnan Guo, Zhengbo Wang, Shichao Xie, Yanfen Shen, Xiaolong Wu, Xing Li, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团地图部门) Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出AsyncShield,通过确定性物理白盒空间映射替代传统黑盒时间序列预测,解决云边异步导航中时空对齐问题,提升导航鲁棒性和安全性。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18471 2026-04-28 cs.LG 57%

NI Sampling: Accelerating Discrete Diffusion Sampling by Token Order Optimization

基于令牌顺序优化的NI采样:通过令牌顺序优化加速离散扩散采样

Enshu Liu, Xuefei Ning, Yu Wang, Zinan Lin

机构 * Department of EE, Tsinghua University(清华大学电子工程系) Microsoft Research(微软研究院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出NI采样方法,通过优化令牌采样顺序显著提升离散扩散模型的采样效率,实验表明在保持准确性的同时,加速效果达14.3倍。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13799 2026-04-28 cs.CL 57%

BRIEF-Pro: Universal Context Compression with Short-to-Long Synthesis for Fast and Accurate Multi-Hop Reasoning

BRIEF-Pro:基于短到长合成的通用上下文压缩用于快速准确的多跳推理

Jia-Chen Gu, Junyi Zhang, Di Wu, Yuankai Li, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 BRIEF-Pro通过短到长合成实现通用上下文压缩,提升多跳推理的效率和准确性,适用于多种语言模型。

Comments Accepted by ACL 2026 Findings. Code and data: https://github.com/JasonForJoy/BRIEF

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09603 2026-04-28 cs.CL 57%

The Surprising Effectiveness of Membership Inference with Simple N-Gram Coverage

基于简单n-gram覆盖的成员推断的惊人效果

Skyler Hallinan, Jaehun Jung, Melanie Sclar, Ximing Lu, Abhilasha Ravichander, Sahana Ramnath, Yejin Choi, Sai Praneeth Karimireddy, Niloofar Mireshghallah, Xiang Ren

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出基于文本输出的成员推断攻击,通过n-gram重叠度评估模型生成文本与真实后缀的相似性,验证了其在黑盒模型上的有效性,并发现攻击成功率随计算预算增加而提升。

Comments CoLM 2025. v2: update citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23205 2026-04-28 cs.CR cs.AR cs.LG 57%

Tessera: Secure, Near-Line-Rate Weight Streaming for UMA Edge Accelerators

Tessera:用于UMA边缘加速器的安全近线率权重流

Animan Naskar

机构 * Indian Institute of Technology (IIT) Ropar(印度理工学院(IIT)罗帕尔)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 Tessera通过在UMA边缘加速器上实现缓存行粒度的权重解密,解决了传统防御方法在受限环境下的不足,实现了接近理论内存带宽上限的性能,同时有效抵御多种攻击。

Comments 17 pages, 2 figures, 4 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-04-28 cs.CV 50%

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23941 2026-04-28 cs.CV 50%

GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction

GoClick:轻量级元素接地模型用于自主GUI交互

Hongxin Li, Yuntao Chen, Zhaoxiang Zhang

机构 * 1 University of Chinese Academy of Sciences, Beijing, China. 2 New Laboratory of Pattern Recognition, State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China. 3 Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences, Hong Kong, China. Zhaoxiang Zhang

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出GoClick,一种轻量级GUI元素接地模型,通过改进架构和数据精炼流程,在保持高精度的同时降低参数规模,适用于资源受限设备的低延迟GUI交互任务。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏