arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2606.12576 2026-06-12 cs.CL 新提交 50%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12661 2026-06-12 astro-ph.SR physics.plasm-ph physics.space-ph 新提交 50%

Finding Novel Precursors for Solar Wind Stream Interaction Regions with Interpretable Deep Learning

利用可解释深度学习发现太阳风流相互作用区的新前兆

Prateek Mayank, Yogesh, Enrico Camporeale, D. Chakrabarty, Lan K Jian, Gregory G. Howes, Thomas E. Berger

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出轻量级Transformer模型SIREN,基于11个太阳风参数逐时间步检测流相互作用区,通过自注意力机制和积分梯度归因揭示质子密度和磁场强度为主要前兆,并发现横向速度分量作为新特征。

Comments Manuscript Under Review. 22 pages with 8 figures, including appendix and references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 50%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11424 2026-06-11 cs.CL 新提交 50%

SOMA-SQL: Resolving Multi-Source Ambiguity in NL-to-SQL via Synthetic Log and Execution Probing

SOMA-SQL: 通过合成日志和执行探测解决NL-to-SQL中的多源歧义

Sai Ashish Somayajula, Marianne Menglin Liu, Chuan Lei, Fjona Parllaku, Daniel Garcia, Rongguang Wang, Syed Fahad Allam Shah, Ankan Bansal, Sujeeth Bharadwaj, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI(甲骨文人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SOMA-SQL框架,通过合成查询日志和歧义驱动探测自动解决自然语言到SQL中的多源歧义,在6个基准上平均执行准确率提升13.0%。

Comments 34 pages, 1 figure, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11531 2026-06-11 cs.CL cs.IT math.IT 新提交 50%

Measuring language complexity from hierarchical reuse of recurring patterns

从重复模式的层次复用测量语言复杂度

Junyi Zhou, Rui Liu, Pengyu Liu, Yu Liu

机构 * Department of Systems Science, Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院系统科学系) International Academic Center of Complex Systems, Beijing Normal University(北京师范大学国际复杂系统学术中心) Department of Chinese Language and Literature, Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院中国语言文学系) Center for Linguistic Sciences, Beijing Normal University(北京师范大学语言学科学中心) School of Systems Science, Beijing Normal University(北京师范大学系统科学学院) Department of Mathematics and Applied Mathematical Sciences, University of Rhode Island(罗德岛大学数学与应用数学科学系) Department of Cell and Molecular Biology, University of Rhode Island(罗德岛大学细胞与分子生物学系)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出基于算法信息论的梯径指数,通过层次复用重复子结构测量语言复杂度,在21个平行语料库中验证了等复杂度假说和权衡假说。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10880 2026-06-10 cs.SE 新提交 50%

Writing Better Software Explanations: A Guideline-Based Approach

编写更好的软件解释:一种基于指南的方法

Martin Obaidi, Jean-Carl Kremser, Hannah Deters, Jakob Droste, Marc Herrmann, Kurt Schneider

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种结合LLM生成与质量指南的软件解释编写工具,通过生成、检查、迭代修订流程提升效率和质量,实验表明工具支持的解释满意度显著高于纯人工编写。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10210 2026-06-10 cs.CY 新提交 50%

AnnotateThis: Analyzing a human-LLM system for annotating social media data with the concept of climate change mitigation pessimism

AnnotateThis:分析用于以气候变化缓解悲观主义概念标注社交媒体数据的人机协作系统

Zexuan Li, Derek Van Berkel, Ariel Hasell, Grant Schoenebeck, John Barry Ryan, Sabina Tomkins

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出人机协作系统AnnotateThis,通过交互式特征帮助用户改进LLM对复杂社会概念的标注质量,实验表明人工干预显著提升F1和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09782 2026-06-09 cs.HC 新提交 50%

Cohort-based Semantic Labeling: AI-Enabled Recovery of Visualization Semantics from Deployed SVGs

基于分组的语义标注:AI 驱动的从已部署 SVG 中恢复可视化语义

Jeongah Lee, Hima Varshini Surisetty, Durga Nirmaleswaran, Jahnavi Sharma, Srikiran Kavuri, Narges Mahyar, Ali Sarvghad

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 CSL 管道,通过分组分解和混合语义锚定,从 SVG 中自动恢复可视化语义,实现高精度标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09697 2026-06-09 cs.CL 新提交 50%

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

PsychoSafe:在大语言模型中引发基于心理学的拒绝

Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学) University of Hamburg(汉堡大学) University of Lübeck(吕贝克大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出PsychoSafe框架,将LLM的拒绝行为重构为基于证据干预策略的结构化支持性沟通,通过构建5个心理风险领域的8019个提示-响应对,对Qwen 3.5 27B进行提示和参数高效微调,在拒绝质量上比通用基线提升28.1%,同时保持非拒绝任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09632 2026-06-09 cs.CL 新提交 50%

Civil Court Simulation with Large Language Models

基于大型语言模型的民事法庭模拟

Yifan Chen, Haitao Li, Kaiyuan Zhang, Yueyue Wu, Qingyao Ai, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出多智能体民事法庭模拟框架,通过五阶段审判程序、记忆模块和法规检索实现可靠判决,在责任分配和多项裁决上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08632 2026-06-09 cs.ET cs.MM 新提交 50%

xSense Design Cards: Guiding the Design of Multisensory Experiences

xSense设计卡片:引导多感官体验设计

Ceylan Beşevli, Carlos Velasco, Marianna Obrist

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出xSense设计卡片,包含体验、感官、技术和探索四类卡片,以结构化方式支持多感官体验的设计、反思和评估。

Comments 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08157 2026-06-09 cs.CL 新提交 50%

Cross Paraphrastic Invariance Learning for Hallucination Detection

跨释义不变性学习用于幻觉检测

Shanshan Lin, Dongsheng Hong, Sibo Ju, Chao Chen, Sihong Xie, Xiangwen Liao

机构 * Fuzhou University(福州大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出CPIL框架,通过构建正负样本对进行两阶段对比学习,仅用1%标注数据即在11个任务上超越基线,高效检测LLM幻觉。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07948 2026-06-09 cs.MA cs.CY 新提交 50%

EduMirror: Modeling Educational Social Dynamics with Value-driven Multi-agent Simulation

EduMirror:基于价值驱动的多智能体模拟建模教育社会动态

Jingzhe Lin, Hengbin Yu, Yongdan Zeng, Fangwei Zhong

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出EduMirror多智能体模拟器,通过价值驱动代理和双轨测量协议,生成真实、理论一致的教育社会动态,支持假设检验和反事实干预分析。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07818 2026-06-09 cs.CL cs.NE 新提交 50%

Representational Similarity and Model Behavior in Multi-Agent Interaction

多智能体交互中的表征相似性与模型行为

Yujin Potter, Seun Eisape, Shiyang Lai, Alexander Huth, James Evans, Been Kim, Jacob Eisenstein, Dawn Song, Alane Suhr

机构 * University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究LLM对间的表征相似性对合作与创新的影响,发现高相似性促进合作但降低新颖性,且早期层相似性关联最强。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07783 2026-06-09 cs.CL 新提交 50%

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

评估RAG在干净、误导和混合检索下的可靠性

Sevgi Yigit-Sert

机构 * Ankara University(安卡拉大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏