arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-12 至 2026-06-12 共收录 42 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2606.12671 2026-06-12 cs.CV 新提交 89%

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影

Xiaoxiao Sun, Ruotian Zhang, Junzhe Huang, James Burgess, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) The University of Queensland(昆士兰大学)

专题命中 视觉问答 :VLM(title_cn,summary_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。

Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12744 2026-06-12 cs.CV 新提交 57%

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

GRIP:面向大型多模态模型的反馈引导提示检索

Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang, Vikram Adve, Emre Kiciman, Ranveer Chandra

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Bonn(波恩大学) Microsoft(微软)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2606.13673 2026-06-12 cs.CV cs.AI 新提交 85%

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

SpatialClaw:重新思考智能体空间推理的动作接口

Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出SpatialClaw框架,以代码作为动作接口,通过状态化Python内核和感知几何原语,使VLM智能体逐步执行并灵活组合中间结果,在20个3D/4D空间推理基准上平均准确率59.9%,比现有方法高11.2个百分点。

Comments Project page: https://spatialclaw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12550 2026-06-12 cs.RO cs.AI 新提交 84%

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Foresight: 关于导航关键线索的迭代推理

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

机构 * UT Austin(德克萨斯大学奥斯汀分校) FieldAI

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08436 2026-06-12 cs.CV 新提交 83%

CACR:Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning

通过候选感知因果推理增强教学视频中的时间答案定位

Muge Qi, Rong Fu, Pengbin Feng, Xianda Li, Yu Cai, Yifu Guo, Shizhe Zhang, Simon James Fong, Lei Ma, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 提出候选感知因果推理框架,通过视觉-语言预训练候选选择和基于GRPO的时序逻辑推理,解决教学视频中复杂问题理解和长视频片段定位挑战,在六个基准上取得最优mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12830 2026-06-12 cs.CV cs.AI 新提交 82%

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

感知、交互、推理:构建工具增强的视觉智能体用于空间推理

Changye Li, Meng Lu, Yi Wu, Ligeng Zhu

机构 * Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) NVIDIA(英伟达)

专题命中 视觉推理 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PERIA智能体,通过视觉感知和交互工具增强VLM的空间推理能力,在13个基准上优于同类模型7.0%-14.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12847 2026-06-12 cs.CV 新提交 79%

Language-Guided Abstraction for Visual Reasoning

语言引导的视觉推理抽象

Xu-Jing Ye, Yuan-Gen Wang, Ruping Wang

机构 * School of Artificial Intelligence, Guangzhou University(广州大学人工智能学院) Traditional Chinese Medicine Hospital of Zengcheng District(广州市增城区中医医院)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

AI总结 提出L-VARC框架,通过语言引导的特权信息学习分支增强视觉推理,设计语义压缩模块和交叉注意力投影器,在ARC任务上以18M参数超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12419 2026-06-12 cs.CY cs.AI 新提交 70%

GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns

GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次

Sankalan Pal Chowdhury, Junling Wang, Donya Rooein, April Yi Wang, Mrinmaya Sachan

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) Bocconi University(博科尼大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07436 2026-06-12 cs.CV 新提交 70%

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

Skill-3D:面向智能体3D空间推理的场景感知技能进化

Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) University of Technology Sydney(技术悉尼大学) OPPO Research Institute(OPPO研究院)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12828 2026-06-12 cs.AI 新提交 57%

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号

Rasul Khanbayov, Hasan Kurban

机构 * College of Science and Engineering(科学与工程学院) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Doha, Qatar(卡塔尔多哈)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 15 篇

2606.12767 2026-06-12 cs.AI 新提交 79%

Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage

构建程序性推理评估数据集:平衡自然性、基础性和多跳覆盖

Sarah Elshabrawy, Rahul K. Dass, Ashok K. Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究基于任务-方法-知识(TMK)模型的问题生成策略对程序性和多跳推理数据集质量的影响,提出基础性验证框架,发现严格TMK生成策略在基础性和可用性上最优。

Comments 10 pages, 2 numbered figures. Workshop submission to HAIL @ AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13435 2026-06-12 cs.RO 新提交 78%

GIVE: Grounding Human Gestures in Vision-Language-Action Models

GIVE:在视觉-语言-动作模型中接地人类手势

Pengfei Liu, Gen Li, Junqiao Fan, Boyu Ma, Jindou Jia, Yang Xiao, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 针对VLA模型忽略手势导致意图理解不准的问题,提出GIVE方法,通过视觉和语义双路径增强手势理解,在真实HRI实验中目标识别准确率提升40%,任务成功率提升80%。

Comments Project page: https://luis-cloud-sg.github.io/GIVE-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09855 2026-06-12 cs.MM cs.CV cs.LG 新提交 76%

MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

MinhwaNet: 韩国民俗画中忠实但不足的对象定位

Joonhyung Bae

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV、cs.LG

AI总结 提出MinhwaNet,通过部分级检测器生成对象证据图,发现韩国民俗画中符号列表不足以预测画作类型,而符号布局更重要,揭示了忠实但不足的解离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12985 2026-06-12 cs.CV 新提交 74%

Objects Before Words: Object-First Inductive Biases for Grounding Language in Child-View Video

物体先于词汇:用于从儿童视角视频中语言接地学习的物体优先归纳偏置

Sathira Silva, Abrham Kahsay Gebreselasie, Muhammad Umer Sheikh, Kartik Kuckreja, Daniel Harari, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 针对婴儿视角视频中命名参照物出现时间和位置的双重歧义,提出BabyMind方法,通过物体优先的归纳偏置、掩码区域接口和原型空间多实例对比学习,在稀疏弱监督下提升语言接地性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12683 2026-06-12 cs.AI cs.CY cs.LG 新提交 62%

From AGI to ASI

从AGI到ASI

Tim Genewein, Matija Franklin, Alexander Lerchner, Laurent Orseau, Samuel Albanie, Adam Bales, Cole Wyeth, Stephanie Chan, Iason Gabriel, Joel Z. Leibo, Allan Dafoe, Marcus Hutter, Thore Graepel, Shane Legg

机构 * Google DeepMind(谷歌DeepMind) University of Waterloo(滑铁卢大学) Australian National University(澳大利亚国立大学) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 探讨从人类级通用人工智能到超级智能的转变路径,包括扩展、范式转变、递归改进和多智能体涌现,并分析摩擦与瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12425 2026-06-12 cs.CY cs.AI cs.ET cs.HC cs.LG 新提交 62%

An Explainable AI Assistant for Introductory Programming Education: Improving Feedback Reliability with Instructor-AI Collaboration

面向入门编程教育的可解释AI助手:通过教师-AI协作提高反馈可靠性

Muntasir Hoq, Griffin Pitts, Bradford Mott, Seung Lee, Jessica Vandenberg, Shuyin Jiao, Narges Norouzi, James Lester, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可解释AI驱动的课堂助手,通过分析学生代码、映射逻辑错误到教师识别的误解并提供教师撰写的反馈,提高入门编程课程中反馈的可靠性和可解释性。

Comments Full paper accepted to the 27th International Conference on AI in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13497 2026-06-12 cs.RO cs.CV 新提交 57%

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

SPARC:来自机器人演示的可靠空间标注

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出SPARC框架,利用机器人任务的时空结构生成可靠性评分,自动标注演示中的空间信息,减少噪声标签并保留更多有用样本,在物体定位基准上优于纯检测基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13348 2026-06-12 cs.CL cs.AI 新提交 57%

IVIE: A Neuro-symbolic Approach to Incremental and Validated Generation of Interactive Fiction Worlds

IVIE:一种用于增量且经过验证的交互式小说世界生成的神经符号方法

Micaela Vaucher, Santiago Silveira, Santiago Góngora, Luis Chiruzzo

机构 * Instituto de Computación, Facultad de Ingeniería, Universidad de la República(乌拉圭共和国大学工程学院计算机研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出IVIE神经符号方法,结合LLM的创造力与符号验证的连贯性,通过四阶段增量生成管道构建可玩的交互式小说世界,人类评估显示其生成沉浸式、主题连贯的世界,平衡了灵活性与叙事一致性。

Comments 10 pages, 3 figures. To appear in the Proceedings of the 16th International Conference on Computational Creativity (ICCC'26), June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13249 2026-06-12 cs.AI 新提交 57%

Multi-Field Hybrid Retrieval-Augmented Generation for Maritime Accident Root Cause Analysis

面向海事事故根因分析的多字段混合检索增强生成

Seongjin Kim, Sungil Kim

机构 * Department of Industrial Engineering, Ulsan National Institute of Science and Technology (UNIST)(蔚山国立科学技术院工业工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出多字段混合检索增强生成框架,利用结构化事故卡片和分层原因分类,通过字段感知的混合检索与融合排序,显著提升海事事故根因分析的检索和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12657 2026-06-12 cs.AI cs.DB cs.RO 新提交 57%

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

机构 * Emory University(埃默里大学) University of Florida(佛罗里达大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。

Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 50%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12719 2026-06-12 cs.HC 新提交 50%

A Multiplexing Design Space: Theory, Method, and Application

复用设计空间:理论、方法与应用

Yiwen Xing, Afrah Farea, Saiful Khan, Min Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种针对特定应用约束的复用设计空间探索方法,以机器学习工作流中多个二维标量场分析为例,通过三步设计流程和预设计步骤,识别出相对最优的默认复用设计及用户可控的微小变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 50%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12576 2026-06-12 cs.CL 新提交 50%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12661 2026-06-12 astro-ph.SR physics.plasm-ph physics.space-ph 新提交 50%

Finding Novel Precursors for Solar Wind Stream Interaction Regions with Interpretable Deep Learning

利用可解释深度学习发现太阳风流相互作用区的新前兆

Prateek Mayank, Yogesh, Enrico Camporeale, D. Chakrabarty, Lan K Jian, Gregory G. Howes, Thomas E. Berger

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出轻量级Transformer模型SIREN,基于11个太阳风参数逐时间步检测流相互作用区,通过自注意力机制和积分梯度归因揭示质子密度和磁场强度为主要前兆,并发现横向速度分量作为新特征。

Comments Manuscript Under Review. 22 pages with 8 figures, including appendix and references

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2606.13108 2026-06-12 cs.CV 新提交 81%

PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks

PP-OCRv6: 从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型

Yubo Zhang, Xueqing Wang, Manhui Lin, Yue Zhang, Penglongyi Deng, Ting Sun, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Changda Zhou, Hongen Liu, Suyin Liang, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)

专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出轻量级OCR系统PP-OCRv6,通过统一MetaFormer架构和结构化重参数化,在服务器到边缘设备上以少数量级参数超越十亿级VLM,中模型识别准确率83.2%,检测Hmean 86.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12898 2026-06-12 cs.CV cs.CL 新提交 77%

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

放大关键信息:面向视觉文本理解的注意力引导自适应渲染

Shenglai Zeng, Qirui Wang, Kai Guo, Xinnan Dai, Xianxuan Long, Hui Liu

机构 * Michigan State University(密歇根州立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型在视觉文本理解任务中存在的定位与利用脱节问题,提出无需训练、模型无关的注意力引导自适应渲染方法AGAR,通过放大关键文本跨度提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2606.13192 2026-06-12 cs.AI 新提交 81%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13515 2026-06-12 cs.CV cs.LG cs.RO 新提交 62%

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

MaskWAM:统一掩码提示与预测的世界-动作模型

Hanyang Yu, Haitao Lin, Jingbo Zhang, Wenyao Zhang, Chenghao Gu, Heng Li, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent Robotics X(腾讯机器人X实验室) Tsinghua University(清华大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2606.12040 2026-06-12 cs.AI cs.GR 新提交 57%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏