arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-14 至 2026-04-14 共收录 143 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 45 篇

2510.17934 2026-04-14 cs.CL cs.AI 57%

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

AtlasKV:在20GB VRAM中通过十亿级知识图谱增强大语言模型

Haoyu Huang, Hong Ting Tsang, Jiaxin Bai, Xi Peng, Gong Zhang, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学) Theory Lab, Huawei(华为理论实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AtlasKV,一种通过十亿级知识图谱增强大语言模型的方法,利用子线性时间与内存复杂度实现高效知识整合,无需外部检索模块或长上下文先验。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11041 2026-04-14 cs.AI 57%

From Topology to Trajectory: LLM-Driven World Models For Supply Chain Resilience

从拓扑到轨迹:LLM驱动的世界模型用于供应链韧性

Jia Luo

机构 * Huazhong University and Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ReflectiChain框架,通过生成世界模型和回顾代理强化学习,提升供应链韧性,实验显示在极端场景下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11005 2026-04-14 cs.AI 57%

Diffusion-CAM: Faithful Visual Explanations for dMLLMs

扩散-CAM:面向dMLLMs的可信视觉解释

Haomin Zuo, Yidi Li, Luoxiao Yang, Xiaofeng Zhang

机构 * Department of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知系) Sun Yat-sen University(中山大学) Northwestern University(西北大学) Technion - Israel Institute of Technology(以色列理工学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Diffusion-CAM,一种专为扩散多模态大语言模型设计的可解释性方法,通过可微探针获取中间表示,捕捉潜在特征及其类别梯度,解决空间模糊和图像内部混淆问题,提升定位准确性和视觉保真度。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10672 2026-04-14 stat.ML cs.LG 57%

One-Step Score-Based Density Ratio Estimation

一步式基于分数的密度比率估计

Wei Chen, Qibin Zhao, John Paisley, Junmei Yang, Delu Zeng

机构 * School of Mathematics, South China University of Technology(华南理工大学数学学院) Tensor Learning Team, RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心张量学习团队) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出OS-DRE,一种结合直接和基于分数方法优势的框架,通过分解时间分数为空间和时间成分,利用解析径向基函数框架,实现高效密度比率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10589 2026-04-14 cs.AI 57%

Working Paper: Towards Schema-based Learning from a Category-Theoretic Perspective

工作论文:从范畴论视角迈向基于模式的学习

Pablo de los Riscos, Fernando J. Corbacho, Michael A. Arbib

机构 * Cognodata I+D & Universidad Autonoma de Madrid(Cognodata I+D 与马德里自治大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种分层范畴框架,用于基于模式的学习,通过四个相互关联的层次结构,构建了模式、实现、语义和智能体等层面,实现了模式语义、认知、具身化和架构抽象的弱分层n-范畴结构。

Comments 43 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10480 2026-04-14 cs.AI 57%

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs

追溯根源:一种多智能体框架,用于揭示训练后LLM的数据血缘

Yu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao, Honglin Lin, Zhanping Zhong, Zhuoshi Pan, Zheng Liu, Xiaoyang Wang, Conghui He, Dahua Lin, Feng Zhao, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出多智能体框架,用于揭示训练后LLM的数据血缘,识别数据集演化图谱中的结构模式与系统问题,构建血缘感知的多样化数据集。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03447 2026-04-14 cs.CV 57%

CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection

CoPS:用于零样本异常检测的条件提示合成

Qiyu Chen, Zhen Qu, Wei Luo, Haiming Yao, Yunkang Cao, Yuxin Jiang, Yinan Duan, Huiyuan Luo, Chengkan Lv, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASIVISION(中科视语) THU(清华大学) HNU(湖南大学) HUST(华中科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoPS框架,通过动态提示合成提升零样本异常检测性能,利用视觉特征生成适应性状态模型,并在13个工业和医疗数据集上取得分类AUROC和分割AUROC的提升。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09920 2026-04-14 cs.CV 57%

Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection

你的VFM说话植物吗?面向物体检测的视觉基础模型的植物语法

Lars Lundqvist, Earl Ranario, Hamid Kamangir, Heesup Yun, Christine Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出系统提示优化框架,评估四个开放词汇检测器在合成和真实农田图像中对豆科植物花和豆荚的检测性能,发现提示结构对不同模型响应各异,通过模型特定的组合提示显著提升检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09855 2026-04-14 cs.AI cs.CL cs.GT econ.GN q-fin.EC 57%

Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards

通过可验证奖励的强化学习指导大语言模型进行谈判

Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Lei Lei, Yuheng Zhang, Yisong Yue, David Simchi-Levi

机构 * Purdue University(普渡大学) California Institute of Technology(加州理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨了通过可验证奖励的强化学习训练大语言模型进行谈判的有效性,揭示了四阶段战略演化,展示了训练后的模型在谈判中提取剩余价值的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09711 2026-04-14 cs.CV cs.CL 57%

Head-wise Modality Specialization within MLLMs for Robust Fake News Detection under Missing Modality

在多模态大语言模型中实现模态专精以在缺失模态下实现鲁棒的虚假新闻检测

Kai Qian, Weijie Shi, Jiaqi Wang, Mengze Li, Hao Chen, Yue Cui, Hanghui Guo, Ziyi Liu, Jia Zhu, Jiajie Xu

机构 * Soochow University(苏州大学) Hong Kong University of Science and Technology(香港科技大学) Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) The Hong Kong University of Science and Technology(香港科技大学) FiT, Tencent(腾讯FiT) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Education, Zhejiang Normal University(浙江师范大学教育学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出在多模态大语言模型中通过头级专精机制提升鲁棒性,以应对缺失模态下的虚假新闻检测,通过保留模态专精能力与利用稀疏单模注释提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09644 2026-04-14 cs.CY cs.AI 57%

Detecting Corporate AI-Washing via Cross-Modal Semantic Inconsistency Learning

通过跨模态语义不一致性学习检测企业AI洗钱

Zhanjie Wen, Jingqiao Guo

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港浸会大学理学院计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AWASH框架,通过跨模态主张-证据推理检测企业AI洗钱,利用AW-Bench基准测试,实现高准确率的AI能力识别。

Comments 28 pages, 6 figures, Journal Submission (Finance/Accounting & Computer Science Interdiscipline), 6 tables, 40 references, trimodal benchmark (88,412 firm-quarter observations) and end-to-end multimodal detection framework for corporate AI-washing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09571 2026-04-14 cs.HC cs.AI 57%

Tuning Qwen2.5-VL to Improve Its Web Interaction Skills

调优 Qwen2.5-VL 以提升其网页交互能力

Alexandra Yakovleva, Henrik Pärssinen, Harri Valpola, Juho Kannala, Alexander Ilin

机构 * Aalto University(阿尔托大学) University of Oulu(奥卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 本文通过调优 Qwen2.5-VL 模型,改进其在网页交互中的可靠性,解决元素定位不准确、指令敏感性和过度乐观偏差等问题,提升单次点击任务的成功率。

Comments Accepted to the Short Paper Track of ACM Web Conference 2026 (WWW 2026). The final version will appear in the ACM Digital Library

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14629 2026-04-14 cs.CV cs.CL 57%

VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites

VisText-Mosquito:一种统一的多模态数据集,用于蚊虫繁殖地的视觉检测、分割和文本解释

Md. Adnanul Islam, Md. Faiyaz Abdullah Sayeedi, Md. Asaduzzaman Shuvo, Shahanur Rahman Bappy, Md Asiful Islam, Swakkhar Shatabda

机构 * United International University, Bangladesh(孟加拉国联合国际大学) University of Arizona, USA(美国亚利桑那大学) BRAC University, Bangladesh(孟加拉国布拉卡大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VisText-Mosquito数据集,整合视觉和文本数据以支持自动化检测、分割和解释,通过YOLOv9s和YOLOv11n-Seg模型实现高精度检测与分割,并利用大视觉语言模型生成文本解释,强调预防胜于治疗的主题。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16091 2026-04-14 cs.CV 57%

Near OOD Detection for Vision-Language Prompt Learning with Contrastive Logit Score

面向视觉-语言提示学习的近分布外检测

Myong Chol Jung, Joanna Dipnall, Belinda Gabbe, He Zhao

机构 * Monash University(莫纳什大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出对比logit分数方法,用于提升预训练视觉-语言提示学习模型的近分布外检测性能,无需修改模型结构或重新训练,实验显示在AUROC上提升11.67%。

Comments Published at International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11570 2026-04-14 cs.HC cs.MM 50%

From Multimodal Signals to Adaptive XR Experiences for De-escalation Training

从多模态信号到自适应XR体验的降级训练

Birgit Nierula, Karam Tomotaki-Dawoud, Daniel Johannes Meyer, Iryna Ignatieva, Mina Mottahedin, Thomas Koch, Sebastian Bosse

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。

Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11514 2026-04-14 cs.SE cs.CL 50%

DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode

DuET:通过生成代码和伪代码的双执行进行测试输出预测

Hojae Han, Jaejin Kim, Seung-won Hwang, Yu Jin Kim, Moontae Lee

机构 * ETRI(韩国电子通信研究院) Seoul National University(首尔大学) SNU-LG AI Research Center(首尔大学-LG人工智能研究中心) LG AI Research(LG人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DuET框架,结合生成代码和伪代码执行,通过功能多数投票提升测试输出预测的准确性,实验表明其在LiveCodeBench上达到最优性能,Pass@1提升13.6个百分点。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04457 2026-04-14 cs.IR 50%

Retrieval Augmented Conversational Recommendation with Reinforcement Learning

基于强化学习的检索增强对话推荐

Zhenrui Yue, Honglei Zhuang, Zhen Qin, Zhankui He, Huimin Zeng, Julian McAuley, Dong Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出RAR框架,通过动态结合检索与生成提升推荐性能与事实性,构建大规模电影语料库并引入强化学习方法优化候选集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17853 2026-04-14 cs.DL 50%

CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation

CiteGuard: 通过检索增强验证实现LLM的忠实引文归因

Yee Man Choi, Xuehang Guo, Yi R. Fung, Qingyun Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出CiteGuard,通过检索增强验证提升LLM引文准确性,实现比基线模型高10个百分点的性能,达到68.1%的准确率,接近人类水平。

Comments Project Page: https://kathcym.github.io/CiteGuard_Page/. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09683 2026-04-14 cs.SE 50%

A Vision for Context-Aware CI Adoption Decisions

面向上下文的持续集成采纳决策展望

Osamah H. Alaini, Taher A. Ghaleb

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于AI的框架,通过评估项目特征推荐适合的CI服务,旨在实现基于上下文的CI采纳决策,避免冗余服务和迁移成本。

Comments Accepted at the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09550 2026-04-14 cs.IR cs.DB 50%

HyEm: Query-Adaptive Hyperbolic Retrieval for Biomedical Ontologies via Euclidean Vector Indexing

HyEm:通过欧几里得向量索引实现查询自适应的双曲检索用于生物医学本体

Ou Deng, Shoji Nishimura, Atsushi Ogihara, Qun Jin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 HyEm通过结合双曲本体嵌入与欧几里得ANN基础设施,解决生物医学本体中层次感知的检索问题,提升实体中心查询和混合意图查询性能,保持索引可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 8 篇

2604.10772 2026-04-14 cs.CV 79%

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 78%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 70%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17188 2026-04-14 cs.AI 70%

PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs

PosterGen:基于多智能体LLM的美观化论文到海报生成

Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You

机构 * Stony Brook University(石溪大学) New York University(纽约大学) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。

Comments Project Website: https://Y-Research-SBU.github.io/PosterGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 57%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11042 2026-04-14 cs.CV 57%

Improving Layout Representation Learning Across Inconsistently Annotated Datasets via Agentic Harmonization

通过代理和谐化提升跨不一致标注数据集的布局表示学习

Renyu Li, Vladimir Kirilenko, Yao You, Crag Wolfe

机构 * Unstructured Technologies

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出利用视觉-语言模型在异质数据源中协调类别语义和边界框粒度,提升文档布局检测的准确性与一致性。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 57%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2604.11757 2026-04-14 cs.RO cs.AI cs.CV 62%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 57%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏