arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-30 至 2026-06-30 共收录 132 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 41 篇

2606.29377 2026-06-30 cs.AI 57%

Diagnosing and Repairing Factual Errors in RAG under Budget Constraints

预算约束下RAG中事实性错误的诊断与修复

Soroush Hashemifar, Havva Alizadeh Noughabi, Fattane Zarrinkalam, Ali Dehghantanha

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出D2R-RAG框架,通过轻量级诊断和自适应修复,在预算约束下提升检索增强生成的事实性,实现准确性与效率的更好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28804 2026-06-30 cs.CV cs.RO 57%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28781 2026-06-30 cs.AI cs.MA 57%

HyphaeDB: A Living Knowledge Topology for Agent-First Memory

HyphaeDB: 面向智能体优先记忆的活知识拓扑

Krishna Halaharvi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出HyphaeDB,一种将HNSW图拓扑重新解释为多智能体通信结构的记忆基础设施,通过八卦协议和能量衰减实现知识传播,支持矛盾检测、模式结晶和共识形成等涌现行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28425 2026-06-30 cs.CR cs.AI 57%

Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems

工具使用使多智能体LLM系统中的隐写术无法检测

Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa, Christian Schroeder de Witt

机构 * Oxford University(牛津大学) Artificial Intelligence Security Institute (AISI)(人工智能安全研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究多智能体AI系统中通过工具使用(如代码执行、网络搜索)实现无法检测的隐写通信,发现智能体可自适应构建隐写系统,并提出协调度量评估无事先约定的隐写协调风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28358 2026-06-30 cs.IR cs.AI cs.CL 57%

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

LLM如何引用?检索增强生成中归因的机制解释

Ian van Dort, Maria Heuss

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 通过激活修补方法,发现LLM的引用机制并非单一组件,而是由注意力头和MLP层组成的分布式“归因集成”,调控这些组件可修复大部分错误引用。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Advances in Information Retrieval, ECIR 2026, Lecture Notes in Computer Science, vol. 16485, pp. 458-473, and is available online at https://doi.org/10.1007/978-3-032-21324-2_35

Journal ref Advances in Information Retrieval, ECIR 2026. Lecture Notes in Computer Science, vol. 16485, pp. 458-473. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 57%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29745 2026-06-30 cs.MA 50%

ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

ECHO:基于回合信度的认知自适应语言智能体学习

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29145 2026-06-30 econ.EM 50%

Why Do We Need Travel Behavior Theory in the Age of AI? Multiple Goal Pursuit as an Illustrative Theory

为什么在人工智能时代我们需要出行行为理论?以多目标追求为例

Jason Hawkins, Omid Armantalab

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文以目标追求理论为例,论证行为理论在出行行为研究中是预测的必要补充,通过活动调度、车辆拥有和位置选择三个应用展示其优势,并提供实施指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28526 2026-06-30 cs.CL cs.HC 50%

A French OSCE Dialogue Dataset and Controllable Virtual Patient System for Clinical Training

用于临床训练的法国OSCE对话数据集和可控虚拟患者系统

Doria Bonzi, Tom Bourgeade, Fabrice Lefèvre, Irina Illina

机构 * Lorraine Université, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化研究所、LORIA实验室) Avignon Université, LIA, UPR 4128(阿维尼昂大学、LIA、UPR 4128)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 为解决医学培训中标准化病人稀缺问题,构建法语OSCE对话数据集,并提出基于LLM的可控虚拟患者生成管道,通过检索增强和反思循环提升真实性与一致性,实验表明可控性模块改善患者保真度和学生评估一致性。

Comments 9 pages. Accepted at SIGDIAL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28348 2026-06-30 cs.NI 50%

Intent-Driven 6G Service Orchestration: Grounded Translation, Validation, and Decomposition

意图驱动的6G服务编排:基于目录的翻译、验证与分解

Jean Martins, Leonid Mokrushin, Marin Orlic, Amardeep Kumar A

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一个三阶段智能体工作流,通过语义服务目录、SHACL验证和约束满足分解,实现6G意图驱动编排,在930次基准测试中成功率达97%,并减少26%的对抗性幻觉。

Comments AI4NextG @ ICML'26 Workshop on AI and ML for Next-Generation Wireless Communications and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28691 2026-06-30 cs.RO 50%

DRIVE-Nav: Directional Reasoning, Inspection, and Verification for Efficient Open-Vocabulary Navigation

DRIVE-Nav: 方向推理、检查与验证以实现高效的开放词汇导航

Maoguo Gao, Zejun Zhu, Zhiming Sun, Zhengwei Ma, Longze Yuan, Zhongjing Ma, Zhigang Gao, Jinhui Zhang, Suli Zou

机构 * Beijing Institute of Technology(北京理工大学) DeepBlue College(深蓝学院) The National Key Laboratory of Autonomous Intelligent Unmanned Systems (KAIUS), School of Automation(自主智能无人系统全国重点实验室(KAIUS),自动化学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DRIVE-Nav通过方向化探索框架提升开放词汇导航效率,通过方向检查和验证减少冗余路径,实验显示在HM3D-OVON等数据集上性能优越。

Comments 8 pages, 4 figures. Project page: https://coolmaoguo.github.io/drive-nav-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 4 篇

2606.29213 2026-06-30 cs.CL cs.CV 86%

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

OCR-VLM能阅读天城文吗?一项压力测试基准与后纠正研究

Aditya Pratap Singh

专题命中 文档图表理解 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究通过合成退化条件和真实扫描图像,系统评估了10种OCR系统在天城文(印地语)上的表现,发现专用OCR-VLM在退化条件下最脆弱,真实扫描性能远低于合成文本,并提出了错误分类和后纠正方法。

Comments 9 pages, 5 figures. Benchmark and code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12957 2026-06-30 cs.CV 83%

HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding

HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速

Wenhui Liao, Hongliang Li, Pengyu Xie, Xinyu Cai, Yufan Shen, Yi Xin, Qi Qin, Shenglong Ye, Tianbin Li, Ming Hu, Junjun He, Yihao Liu, Wenhai Wang, Min Dou, Bin Fu, Botian Shi, Yu Qiao, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院) Nanjing University(南京大学)

专题命中 文档图表理解 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出HSD分层推测解码框架,通过轻量级管道起草器预测区域划分并生成粗稿,分阶段验证以保持全文连贯性,实验证明在文档解析任务中实现显著加速。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29905 2026-06-30 cs.CV 70%

StrucTab: A Structured Optimization Framework for Table Parsing

StrucTab: 一种用于表格解析的结构化优化框架

Gengluo Li, Shangpin Peng, Chengquan Zhang, Binghong Wu, Hao Feng, Weinong Wang, Pengyuan Lyu, Huawen Shen, Xingyu Wan, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出StrucTab框架,通过中间结构监督和奖励分解优化表格解析,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29808 2026-06-30 cs.HC cs.AI 57%

Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

使多模态大语言模型成为可靠的图表数据提取器:一个基准和训练框架

Yuchen He, Peizhi Ying, Liqi Cheng, Kuilin Peng, Yuan Tian, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Guangdong University of Technology(广东工业大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在图表数据提取中数值精度不足的问题,提出渐进式学习训练框架,显著提升7B参数模型的准确率,达到最优性能。

Comments Accepted at CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 14 篇

2606.28760 2026-06-30 cs.RO 89%

Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control

面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制

Runji Cai, Toshihiko Yamasaki, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)

AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30084 2026-06-30 cs.CV 85%

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

一次前向胜过两次:InnerZoom 实现准确高效的 GUI 定位

Chen Liu, Ling Chen, Hanzhang Zhou, Liangyu Chen, Chenglin Cai, Xin Yu, Steven Hoi, Yue Wang

机构 * Alibaba Group(阿里巴巴集团) Tongyi Lab(通义实验室) University of Technology Sydney(悉尼大学) Adelaide University(阿德莱德大学)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出 InnerZoom 框架,通过跨层证据桥接在单次前向传播中实现精确 GUI 元素定位,无需额外裁剪重跑,在六个基准上达到最优性能,同时降低延迟和计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06631 2026-06-30 cs.CV cs.AI 84%

Conformal Predictions for Human Action Recognition with Vision-Language Models

基于视觉-语言模型的人类动作识别中的置信域预测

Bary Tim, Fuchs Clément, Macq Benoît

机构 * ICTEAM, UCLouvain(鲁汶大学(法语区)ICTEAM研究所)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了如何利用置信域预测技术提升基于视觉-语言模型的人类动作识别系统可靠性,通过调整softmax温度参数减少候选类别数量,缓解长尾分布影响。

Comments 6 pages, 7 figures, Accepted to ICIP 2025 Workshops

Journal ref 2025 IEEE International Conference on Image Processing Workshops (ICIPW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 83%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12159 2026-06-30 cs.SE cs.AI 79%

EfficientUICoder: A Bidirectional Token Compression Framework for Efficient MLLM-Based UI Code Generation

EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架

Jingyu Xiao, Zhongyi Zhang, Yuxuan Wan, Yintong Huo, Yang Liu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理大学) Nanyang Technological University(南洋理工大学)

专题命中 GUI与屏幕智能体 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。

Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29445 2026-06-30 cs.CV cs.AI 79%

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

通过通用关键帧提取桥接VideoQA和视频引导的智能体任务

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。

Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22876 2026-06-30 cs.RO cs.AI 74%

Grounding Sim-to-Real Generalization in Robotic Manipulation: An Empirical Study with Vision-Language-Action Models

在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究

Ruixing Jin, Zicheng Zhu, Ruixiang Ouyang, Sheng Xu, Bo Yue, Zhizheng Wu, Guiliang Liu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.AI

AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00616 2026-06-30 cs.CV cs.AI 73%

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

暂停与思考:面向视频基础辅助动作建议的数据集与基准

Shivam Singh, Saptarshi Majumder, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。

Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 70%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13675 2026-06-30 cs.RO 67%

OLiVia-Nav: An Online Lifelong Vision Language Approach for Mobile Robot Social Navigation

OLiVia-Nav: 一种面向移动机器人社交导航的在线终身视觉语言方法

Siddarth Narasimhan, Aaron Hao Tan, Daniel Choi, Goldie Nejat

机构 * University of Toronto(多伦多大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)

AI总结 OLiVia-Nav通过融合视觉语言模型与在线终身学习框架,实现机器人社交导航中的社会规范适应与动态轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29705 2026-06-30 cs.AI cs.CL cs.CV 62%

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

GUICrafter: 利用海量无标注截图的弱监督GUI智能体

Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文脉)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28396 2026-06-30 cs.CV cs.LG 62%

RadarTwin: Scene-Specific mmWave Radar Simulation and Learning for Mobile Indoor Perception

RadarTwin:面向移动室内感知的场景特定毫米波雷达仿真与学习

Emily Bejerano, Federico Tondolo, Devang Gupta, Aaron Mano Cherian, Taeyoo Kim, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出RadarTwin框架,利用3D重建和视觉语言模型推断材料属性,通过物理射线追踪合成FMCW雷达数据,解决雷达数据稀缺问题,仿真训练模型在真实场景中识别物体准确率达95.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23559 2026-06-30 cs.CR cs.AI cs.CV 62%

CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training

针对原生GUI代理的CAPTCHA解决:自动化推理-行动数据生成与自我纠正训练

Yuxi Chen, Haoyu Zhai, Chenkai Wang, Rui Yang, Lingming Zhang, Gang Wang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReCAP,一种能解决现代交互式CAPTCHA挑战的原生GUI代理,通过自动化数据生成和自我纠正训练提升CAPTCHA解决能力,同时保持通用GUI任务性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29592 2026-06-30 cs.LG cond-mat.mtrl-sci physics.atom-ph physics.optics quant-ph 57%

STEMGym: Benchmarking Sequential Decision-Making under Dose Budgets in Autonomous Electron Microscopy

STEMGym: 自主电子显微镜中剂量预算下的序列决策基准测试

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Dept. of Electrical & Computer Eng.(电气与计算机工程系) Texas A&M Univ.(德克萨斯A&M大学) Dept. of Prosthetics & Orthotics(假肢与矫形学系) College of Science & Eng.(科学与工程学院) Ankara Univ.(安卡拉大学) Hamad Bin Khalifa Univ. and Texas A&M Univ. at Qatar(哈马德·本·卡西姆大学和德克萨斯A&M大学(卡塔尔))

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG

AI总结 通过15个物理模拟的STEM环境基准,发现感知管道(CNN分析师)是剂量效率的主要决定因素,而非导航策略,为自主电子显微镜的机器学习投入方向提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏