arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-06 至 2026-03-06 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2506.07915 2026-03-06 cs.AI cs.CL cs.SY eess.SY 79%

A Signal Contract for Online Language Grounding and Discovery in Decision-Making

在线语言 grounding 与决策制定中的语言发现信号契约

Dimitris Panagopoulos, Adolfo Perrusquia, Weisi Guo

机构 * Faculty of Engineering and Applied Science, Cranfield University(工程与应用科学学院,克兰菲尔德大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 LUCIFER 通过信号契约实现在线语言 grounding,提升决策安全性和信息收集效率,需结合两者才能达成最佳效果。

Comments 10 pages, 4 Figures, 4 Tables, submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 62%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 62%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04920 2026-03-06 cs.AI 57%

Knowledge-informed Bidding with Dual-process Control for Online Advertising

基于双重过程控制的知识引导竞价

Huixiang Luo, Longyu Gao, Yaqi Liu, Qianqian Chen, Pingchun Huang, Tianning Li

机构 * Alibaba Health(阿里巴巴健康)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 KBD通过结合人类专业知识和双重过程控制,提升在线广告竞价优化的适应性和全局一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04896 2026-03-06 cs.AI 57%

Authorize-on-Demand: Dynamic Authorization with Legality-Aware Intellectual Property Protection for VLMs

按需授权:面向大型语言模型的动态授权与合法性感知知识产权保护

Lianyu Wang, Meng Wang, Huazhu Fu, Daoqiang Zhang

机构 * The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, China(脑机智能技术重点实验室,教育部,中国) Centre for Innovation and Precision Eye Health, Yong Loo Lin School of Medicine, NUS, Singapore(创新与精准眼健康中心,尤洛林医学院,国立新加坡大学,新加坡) Department of Ophthalmology, Yong Loo Lin School of Medicine, NUS, Singapore(眼科部,尤洛林医学院,国立新加坡大学,新加坡) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科技研究局,新加坡)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 本文提出AoD-IP框架,通过动态授权和合法性感知机制,实现对视觉-语言模型的灵活知识产权保护,支持按需授权和自适应部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04746 2026-03-06 cs.AI cs.HC econ.GN q-fin.EC 57%

Visioning Human-Agentic AI Teaming: Continuity, Tension, and Future Research

展望人机协同AI:连续性、张力与未来研究

Bowen Lou, Tian Lu, T. S. Raghu, Yingjie Zhang

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Team SA理论作为人机协同AI转型的整合锚点,探讨在适应性自主下持续对齐的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04454 2026-03-06 cs.CL cs.AI 57%

Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam

通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍

Michael Majurski, Cynthia Matuszek

机构 * National Institute of Standards and Technology(国家标准与技术研究院) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04853 2026-03-06 physics.optics 50%

Stochastic inner workings of subdiffraction laser writing

亚衍射激光刻写中的随机机制

Julia M. Mikhailova, Aleksei M. Zheltikov

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究通过统计光学方法揭示了亚衍射激光刻写中确定性与随机性相互作用的物理机制,并探讨了其对量子光子系统可扩展性的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04705 2026-03-06 cs.RO cs.HC 50%

LEGS-POMDP: Language and Gesture-Guided Object Search in Partially Observable Environments

LEGS-POMDP:语言和手势引导的在部分可观测环境中的对象搜索

Ivy Xiao He, Stefanie Tellex, Jason Xinyu Liu

机构 * Brown University(布朗大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LEGS-POMDP通过整合语言、手势和视觉信息,在部分可观测环境中实现高效的开放世界对象搜索,显著提升了多模态感知和不确定性处理能力。

Comments 10 pages, 8 figures, accepted at ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04416 2026-03-06 cs.CL 50%

Optimizing What We Trust: Reliability-Guided QUBO Selection of Multi-Agent Weak Framing Signals for Arabic Sentiment Prediction

优化我们信任的内容:基于可靠性引导的多智能体弱标注信号QUBO选择用于阿拉伯语情感预测

Rabab Alkhalifa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于可靠性的弱监督框架,通过QUBO选择优化多智能体弱标注信号,提升阿拉伯语情感预测的可靠性与结构迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏