arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2568 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 764 篇

2606.17688 2026-06-17 cs.CL 新提交 50%

LLMs Infer Cultural Context but Fail to Apply It When Responding

LLMs 能推断文化背景但在回应时未能应用

Yisong Miao, Jian Zhu, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究大型语言模型在生成文化适应性回应时,能否根据用户文化背景使用本地计量单位。提出CAPRI数据集,实验发现模型能推断文化背景但常未能应用,除非明确提示。

Comments 9 pages, 7 figures, 2 tables (24 pages, 12 figures, 8 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18009 2026-06-17 physics.soc-ph nlin.AO physics.hist-ph physics.pop-ph 新提交 50%

Making Sense of Symbols: Yin and Yang in Zurich

解读符号:苏黎世的阴阳

Frank Schweitzer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过苏黎世纬度上的白天时长模型,将阴阳符号与昼夜和季节现象关联,并揭示其几何中的黄金比例与公历的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16009 2026-06-17 cs.CL cs.HC 新提交 50%

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

弥合可用性差距:口译研究对机器口译设计的启示

Claudio Fantinuoli

机构 * University of Mainz(美因茨大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文定义机器口译为语音翻译的子领域,指出其存在“准确性幻觉”,并借鉴口译研究提出未来设计的三个优先方向:能动性、共同基础与体验,以弥合可用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16523 2026-06-16 cs.CL 新提交 50%

SkillWiki: A Living Knowledge Infrastructure for Agent Skills

SkillWiki: 一个用于智能体技能的活知识基础设施

Dingcheng Huang, Yuda Ding, Bingshuo Liu, Qingbin Liu, Xi Chen, Jiang Bian, Hongliang Sun, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15509 2026-06-16 cs.HC cs.CY 新提交 50%

What do you mean by human-AI collaboration: Prerequisite functions and the affordances needed to achieve it

你说的人机协作是什么意思:实现协作所需的前提功能和可供性

Mutlu Cukurova

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文基于学习科学对协作的严格定义,提出人机协作需满足对称关系、共享目标等条件,并通过五级诊断分类法指出当前人机交互多为咨询而非协作,最后推导出实现协作所需的功能。

Comments 22 pages,1 table, Submitted for Review to the Handbook of AI and the Future of Education (R. Wegerif, I. Casebourne, A. Zhou & I. J. Ness, Eds.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14146 2026-06-15 cs.NE 新提交 50%

A Programmer's Guide to Cascaded Adaptive Combiners: Online Learning by Biologically Accurate Models of Multilayer Neuron Networks

级联自适应组合器程序员指南:基于多层神经元网络的生物精确模型在线学习

Martin Nilsson, Denis Kleyko

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种更符合生物计算机制的机械性神经网络模型,通过级联自适应组合器实现多层网络的高效在线学习,替代反向传播,在图像分类任务中取得竞争性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14054 2026-06-15 cs.HC 新提交 50%

Visible Adoption, Untracked Contribution: GitHub Evidence of the Accountability Gap Across Three Cohorts of an HCI Prototyping Course

可见的采用,未追踪的贡献:来自GitHub的证据揭示HCI原型设计课程三个队列间的问责差距

Maria Teresa Parreira, Pranav Prabhat Sinha, Hauke Sandhaus, Wendy Ju

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过分析203个GitHub仓库和23,065次提交,研究三个队列(2022、2023、2025年)中GenAI采用情况,发现工具披露率从0%升至66%,但贡献归属仍属少数,揭示问责缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06794 2026-06-15 cs.CL cs.IR 新提交 50%

TA-RAG: Tone-Aware Retrieval-Augmented Generation for Peer-Support Health Communication

TA-RAG: 面向同伴支持健康沟通的语气感知检索增强生成

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出TA-RAG框架,通过轻量级提示在RAG管道中嵌入语气控制(无污名化、可读性调整、受众适应、同理心改写),无需微调模型,提升敏感健康沟通质量。

Comments 5 pages, 5 figures, CIKM 2026 submission manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 50%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12719 2026-06-12 cs.HC 新提交 50%

A Multiplexing Design Space: Theory, Method, and Application

复用设计空间:理论、方法与应用

Yiwen Xing, Afrah Farea, Saiful Khan, Min Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种针对特定应用约束的复用设计空间探索方法,以机器学习工作流中多个二维标量场分析为例,通过三步设计流程和预设计步骤,识别出相对最优的默认复用设计及用户可控的微小变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 50%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12576 2026-06-12 cs.CL 新提交 50%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12661 2026-06-12 astro-ph.SR physics.plasm-ph physics.space-ph 新提交 50%

Finding Novel Precursors for Solar Wind Stream Interaction Regions with Interpretable Deep Learning

利用可解释深度学习发现太阳风流相互作用区的新前兆

Prateek Mayank, Yogesh, Enrico Camporeale, D. Chakrabarty, Lan K Jian, Gregory G. Howes, Thomas E. Berger

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出轻量级Transformer模型SIREN,基于11个太阳风参数逐时间步检测流相互作用区,通过自注意力机制和积分梯度归因揭示质子密度和磁场强度为主要前兆,并发现横向速度分量作为新特征。

Comments Manuscript Under Review. 22 pages with 8 figures, including appendix and references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 50%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11424 2026-06-11 cs.CL 新提交 50%

SOMA-SQL: Resolving Multi-Source Ambiguity in NL-to-SQL via Synthetic Log and Execution Probing

SOMA-SQL: 通过合成日志和执行探测解决NL-to-SQL中的多源歧义

Sai Ashish Somayajula, Marianne Menglin Liu, Chuan Lei, Fjona Parllaku, Daniel Garcia, Rongguang Wang, Syed Fahad Allam Shah, Ankan Bansal, Sujeeth Bharadwaj, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI(甲骨文人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SOMA-SQL框架,通过合成查询日志和歧义驱动探测自动解决自然语言到SQL中的多源歧义,在6个基准上平均执行准确率提升13.0%。

Comments 34 pages, 1 figure, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11531 2026-06-11 cs.CL cs.IT math.IT 新提交 50%

Measuring language complexity from hierarchical reuse of recurring patterns

从重复模式的层次复用测量语言复杂度

Junyi Zhou, Rui Liu, Pengyu Liu, Yu Liu

机构 * Department of Systems Science, Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院系统科学系) International Academic Center of Complex Systems, Beijing Normal University(北京师范大学国际复杂系统学术中心) Department of Chinese Language and Literature, Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院中国语言文学系) Center for Linguistic Sciences, Beijing Normal University(北京师范大学语言学科学中心) School of Systems Science, Beijing Normal University(北京师范大学系统科学学院) Department of Mathematics and Applied Mathematical Sciences, University of Rhode Island(罗德岛大学数学与应用数学科学系) Department of Cell and Molecular Biology, University of Rhode Island(罗德岛大学细胞与分子生物学系)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出基于算法信息论的梯径指数,通过层次复用重复子结构测量语言复杂度,在21个平行语料库中验证了等复杂度假说和权衡假说。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10880 2026-06-10 cs.SE 新提交 50%

Writing Better Software Explanations: A Guideline-Based Approach

编写更好的软件解释:一种基于指南的方法

Martin Obaidi, Jean-Carl Kremser, Hannah Deters, Jakob Droste, Marc Herrmann, Kurt Schneider

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种结合LLM生成与质量指南的软件解释编写工具,通过生成、检查、迭代修订流程提升效率和质量,实验表明工具支持的解释满意度显著高于纯人工编写。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10598 2026-06-10 cs.SE 新提交 50%

Exploring and Complementing End Users' Requirements in IoT enabled System

探索与补充物联网系统中终端用户的需求

Haotian Li, Xiaohong Chen, Zhi Jin, Shuyuan Xiao, Chenxu Wang, Haoxiang Yan, Xiaoyi Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对终端用户通过触发动作编程创建物联网规则时表达碎片化的问题,提出一种基于意图的需求补全方法,利用双向需求可追溯树和多智能体框架,结合大语言模型推理与结构化可追溯性,实现功能完整且内在安全的规则补全,将规则补全率提升43%,逻辑冲突减少21%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10210 2026-06-10 cs.CY 新提交 50%

AnnotateThis: Analyzing a human-LLM system for annotating social media data with the concept of climate change mitigation pessimism

AnnotateThis:分析用于以气候变化缓解悲观主义概念标注社交媒体数据的人机协作系统

Zexuan Li, Derek Van Berkel, Ariel Hasell, Grant Schoenebeck, John Barry Ryan, Sabina Tomkins

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出人机协作系统AnnotateThis,通过交互式特征帮助用户改进LLM对复杂社会概念的标注质量,实验表明人工干预显著提升F1和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09782 2026-06-09 cs.HC 新提交 50%

Cohort-based Semantic Labeling: AI-Enabled Recovery of Visualization Semantics from Deployed SVGs

基于分组的语义标注:AI 驱动的从已部署 SVG 中恢复可视化语义

Jeongah Lee, Hima Varshini Surisetty, Durga Nirmaleswaran, Jahnavi Sharma, Srikiran Kavuri, Narges Mahyar, Ali Sarvghad

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 CSL 管道,通过分组分解和混合语义锚定,从 SVG 中自动恢复可视化语义,实现高精度标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09697 2026-06-09 cs.CL 新提交 50%

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

PsychoSafe:在大语言模型中引发基于心理学的拒绝

Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学) University of Hamburg(汉堡大学) University of Lübeck(吕贝克大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出PsychoSafe框架,将LLM的拒绝行为重构为基于证据干预策略的结构化支持性沟通,通过构建5个心理风险领域的8019个提示-响应对,对Qwen 3.5 27B进行提示和参数高效微调,在拒绝质量上比通用基线提升28.1%,同时保持非拒绝任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09632 2026-06-09 cs.CL 新提交 50%

Civil Court Simulation with Large Language Models

基于大型语言模型的民事法庭模拟

Yifan Chen, Haitao Li, Kaiyuan Zhang, Yueyue Wu, Qingyao Ai, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出多智能体民事法庭模拟框架,通过五阶段审判程序、记忆模块和法规检索实现可靠判决,在责任分配和多项裁决上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08632 2026-06-09 cs.ET cs.MM 新提交 50%

xSense Design Cards: Guiding the Design of Multisensory Experiences

xSense设计卡片:引导多感官体验设计

Ceylan Beşevli, Carlos Velasco, Marianna Obrist

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出xSense设计卡片,包含体验、感官、技术和探索四类卡片,以结构化方式支持多感官体验的设计、反思和评估。

Comments 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08157 2026-06-09 cs.CL 新提交 50%

Cross Paraphrastic Invariance Learning for Hallucination Detection

跨释义不变性学习用于幻觉检测

Shanshan Lin, Dongsheng Hong, Sibo Ju, Chao Chen, Sihong Xie, Xiangwen Liao

机构 * Fuzhou University(福州大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出CPIL框架,通过构建正负样本对进行两阶段对比学习,仅用1%标注数据即在11个任务上超越基线,高效检测LLM幻觉。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07948 2026-06-09 cs.MA cs.CY 新提交 50%

EduMirror: Modeling Educational Social Dynamics with Value-driven Multi-agent Simulation

EduMirror:基于价值驱动的多智能体模拟建模教育社会动态

Jingzhe Lin, Hengbin Yu, Yongdan Zeng, Fangwei Zhong

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出EduMirror多智能体模拟器,通过价值驱动代理和双轨测量协议,生成真实、理论一致的教育社会动态,支持假设检验和反事实干预分析。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07818 2026-06-09 cs.CL cs.NE 新提交 50%

Representational Similarity and Model Behavior in Multi-Agent Interaction

多智能体交互中的表征相似性与模型行为

Yujin Potter, Seun Eisape, Shiyang Lai, Alexander Huth, James Evans, Been Kim, Jacob Eisenstein, Dawn Song, Alane Suhr

机构 * University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究LLM对间的表征相似性对合作与创新的影响,发现高相似性促进合作但降低新颖性,且早期层相似性关联最强。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07783 2026-06-09 cs.CL 新提交 50%

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

评估RAG在干净、误导和混合检索下的可靠性

Sevgi Yigit-Sert

机构 * Ankara University(安卡拉大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 85 篇

2608.16484 2026-08-18 cs.CV 新提交 91%

Remote-Sensing City Layout Extraction with MLLM

基于多模态大语言模型(MLLM)的遥感城市布局提取

Zigan Zhou, Kai Li, Yupeng Deng

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute(空天信息创新研究院)

专题命中 文档图表理解 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。

Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10838 2026-08-12 cs.CV 新提交 91%

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms

PolyLayout:超越矩形房间的分层VLM引导布局生成

Yutong Jiang, Zahra Atashgahi, Carlos Soto Garcia Delgado, Ruben Brokkelkamp, Davide Zanutto, Efşan Sökmen, Shahin Shahkarami

机构 * IKEA Retail (Ingka Group)(宜家零售(英卡集团))

专题命中 文档图表理解 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 PolyLayout提出混合分层VLM引导框架,分三阶段生成非矩形房间布局,在生产数据和不规则拓扑上表现出高感知合理性、低延迟,填补了学术与实际应用的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏