arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2606.25533 2026-06-25 cs.CR cs.CL 新提交 50%

Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

检索增强生成中的安全与隐私:构建可信系统的架构、威胁、防御与未来方向

Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering(电子与电气工程系) Birla Institute of Technology and Science, Pilani, Pilani Campus(比拉理工学院和科学学院,比拉校区) Department of Computer Engineering, KIIT University(计算机工程系,KIIT大学) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory(量子云计算与分布式系统(qCLOUDS)实验室) Department of Computing and Information Systems(计算与信息系统系) The University of Melbourne(墨尔本大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文综述了检索增强生成系统在集中式、设备端、联邦和混合范式下的隐私与安全挑战,提出了涵盖检索、上下文构建和生成阶段的统一威胁分类,并分析了攻击类别及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25610 2026-06-25 astro-ph.IM astro-ph.GA 新提交 50%

The Galaxy's Guide to the Tokenizer: A Benchmark for Scientific Foundation Models

银河系分词器指南:科学基础模型的基准测试

Sogol Sanjaripour, Michael J. Smith, Manuel Pérez-Carrasco, Juan Rafael Martínez-Galarza, Bahram Mobasher, Gabriela Canalizo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究在统一transformer框架下比较四种分词策略对天文图像重建和物理属性预测的影响,发现重建与表征质量解耦,无单一方法全面最优。

Comments Accepted as a spotlight talk at the Conference on Physics and AI (PAI) 2026, Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19157 2026-06-25 eess.AS cs.CL 新提交 50%

IndicContextEval: A Benchmark for Evaluating Context Utilisation in Audio Large Language Models Across 8 Indic Languages

IndicContextEval:评估8种印度语言音频大语言模型上下文利用能力的基准

Sakshi Joshi, Dhruv Subhash Rathi, Sanskar Singh, Eldho Ittan George, R J Hari, Kaushal Bhogale, Mitesh M. Khapra

机构 * AI4Bharat, Indian Institute of Technology Madras, India(AI4Bharat,印度理工学院马德拉斯分校) Sarvam AI, India(Sarvam AI,印度)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出IndicContextEval基准,包含8种印度语言555位说话人的56小时自然语音,通过7级提示框架评估音频大语言模型是否真正利用上下文而非依赖参数化知识。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13814 2026-06-25 cs.IR 新提交 50%

TASR: Training-Free Adaptive Stopping for Iterative Retrieval

TASR:无需训练的迭代检索自适应停止规则

Adrian Kieback, Uyiosa Philip Amadasun, Aman Chadha, Aaron Elkins

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出TASR,一种无需训练的迭代检索停止规则,通过重复答案检测和逻辑回归边际阈值减少冗余检索,在多种配置下保持高F1值并降低调用次数。

Comments 20 pages, 5 figures. Accepted at Agent4IR Workshop, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07826 2026-06-25 quant-ph math-ph math.MP 新提交 50%

The classical boundaries of the EPR argument and quantum ontology

EPR论证与量子本体论的经典边界

Vincenzo Chilla

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过希尔伯特空间经典力学将经典性归结为布尔性逻辑约束,指出EPR论证揭示的是其前提的经典边界而非量子不完备性,并基于观察环境与观察对象的结构二分提出一种语境依赖的量子本体论。

Comments 41 pages, corrected one mathematical equation, minor corrections and changes in the text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24610 2026-06-24 cs.CL 新提交 50%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24448 2026-06-24 cs.RO 新提交 50%

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

监督幸存信息:基于几何引导的合成机器人视频VLA适配

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23052 2026-06-23 eess.AS 新提交 50%

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

CAAD:对比音频感知蒸馏用于高效语音语言模型

Chun-Wei Chen, Tzu-Quan Lin, Ke-Han Lu, Wei-Ping Huang, Hung-Yi Lee

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出对比音频感知蒸馏(CAAD)框架,通过同步教师强制策略将教师模型的对比推理内化到学生模型权重中,在Dynamic-SUPERB上相对提升约8%,并减少语言偏倚。

Comments Accepted to interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22397 2026-06-23 cs.RO 新提交 50%

Do Rigid-Body Simulators Dream of Soft Robots? Learning Contact-Rich Manipulation for Tendon-Driven Continuum Robots

刚体模拟器会梦见软体机器人吗?学习肌腱驱动连续体机器人的接触丰富操作

Chengnan Shentu, Nicholas Baldassini, Tongjia Zheng, Priyanka Rao, Jessica Burgner-Kahrs

机构 * University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对肌腱驱动连续体机器人缺乏接触丰富操作模拟基础设施的问题,提出基于连续介质力学的离散化方法,将软体机器人原生集成到MuJoCo中,实现仿真到真实世界的零样本迁移。

Comments Project Page: https://continuumroboticslab.github.io/opencr-mujoco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 50%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21059 2026-06-23 cs.CR 新提交 50%

DEFENGRAPH: Knowledge Graph-Enhanced LLMs for Blue Team Cyber Defense

DEFENGRAPH:面向蓝队网络防御的知识图谱增强型大语言模型

Zhen Wang, Kristen Moore, Qin Wang, Guangsheng Yu, Minjune Kim, Diksha Goel, Gang Li, Ahmed Ibrahim, Ahmad Mohsin, Helge Janicke

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出DEFENGRAPH框架,通过双层静态-动态知识图谱与图路径检索、上下文过滤和重排序增强LLM的上下文推理,在红蓝对抗演习数据上显著提升防御决策的召回率和精确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20113 2026-06-23 cs.CL cs.IR 新提交 50%

When Does Streaming Tool Use Help? Characterizing Tool-Intent Stabilization in Streaming Retrieval-Augmented Generation

流式工具使用何时有帮助?表征流式检索增强生成中的工具意图稳定化

Elroy Galbraith

机构 * SMG Labs(SMG实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过测量工具意图稳定化(即推测查询收敛到答案的时间点),在CRAG基准上分析流式RAG的延迟隐藏效果,发现73.9%的查询可实现显著延迟隐藏,并识别早期与晚期稳定化的预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20369 2026-06-19 cs.CL 新提交 50%

CATCH-ME if you RAG: a dataset of Contextually Annotated multi-Turn Counterspeech against Hate and Misinformation Exchanges

CATCH-ME if you RAG:针对仇恨与虚假信息交流的上下文注释多轮对抗言论数据集

Helena Bonaldi, Genoveffa Martone, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Università Cattolica del Sacro Cuore(圣心天主教大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出首个大规模、专家策划的多语言对话数据集,覆盖仇恨与虚假信息重叠问题,包含事实核查锚定和跨度标注,支持RAG系统训练更可信的对抗言论模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19644 2026-06-19 cs.SE 新提交 50%

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究

Richard Sserunjogi, Daniel Ogenrwot, John Businge

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。

Comments 48 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19122 2026-06-18 cs.RO 新提交 50%

Monocular 3D Occupancy Perception for Robots on Sidewalks via Hybrid 2D-3D Learning

基于混合2D-3D学习的人行道机器人单目3D占用感知

Yukai Ma, Joe Lin, Liu Liu, Honglin He, Lulu Ricketts, Brad Squicciarini, Yong Liu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) Coco Robotics(Coco机器人) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出WalkOCC框架,通过混合射线行进单目3D占用感知,结合LiDAR-RGB配对数据与大规模无配对单目图像学习,提升人行道机器人导航的预测精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18103 2026-06-17 cs.CL cs.IR 新提交 50%

HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice

HistoRAG:通过批判性技术实践将历史方法论嵌入检索增强生成

Noah J. Kim-Baumann, Torsten Hiltmann

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对历史学等解释性学科,提出HistoRAG框架,通过分离检索与生成、时间窗口化、LLM作为评判者等架构干预,将历史编纂原则转化为RAG设计,解决标准RAG中的时间偏差、相关性评估等问题。

Comments 25 pages, 6 figures. Companion preprint to a Journal of Digital History notebook article (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17861 2026-06-17 cs.CL 新提交 50%

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

GameCraft-Bench:智能体能否在真实游戏引擎中端到端构建可玩游戏?

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Hunyuan Team, Tencent(腾讯混元团队) USTB(北京科技大学) DualverseAI SJTU(上海交通大学) NUS(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GameCraft-Bench基准,评估编码智能体在Godot引擎中端到端生成可玩游戏的能力,最强智能体仅达41.46%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17688 2026-06-17 cs.CL 新提交 50%

LLMs Infer Cultural Context but Fail to Apply It When Responding

LLMs 能推断文化背景但在回应时未能应用

Yisong Miao, Jian Zhu, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究大型语言模型在生成文化适应性回应时,能否根据用户文化背景使用本地计量单位。提出CAPRI数据集,实验发现模型能推断文化背景但常未能应用,除非明确提示。

Comments 9 pages, 7 figures, 2 tables (24 pages, 12 figures, 8 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18009 2026-06-17 physics.soc-ph nlin.AO physics.hist-ph physics.pop-ph 新提交 50%

Making Sense of Symbols: Yin and Yang in Zurich

解读符号:苏黎世的阴阳

Frank Schweitzer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过苏黎世纬度上的白天时长模型,将阴阳符号与昼夜和季节现象关联,并揭示其几何中的黄金比例与公历的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16009 2026-06-17 cs.CL cs.HC 新提交 50%

Bridging the Usability Gap: Lessons from Interpreting Studies for Machine Interpreting Design

弥合可用性差距:口译研究对机器口译设计的启示

Claudio Fantinuoli

机构 * University of Mainz(美因茨大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文定义机器口译为语音翻译的子领域,指出其存在“准确性幻觉”,并借鉴口译研究提出未来设计的三个优先方向:能动性、共同基础与体验,以弥合可用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16523 2026-06-16 cs.CL 新提交 50%

SkillWiki: A Living Knowledge Infrastructure for Agent Skills

SkillWiki: 一个用于智能体技能的活知识基础设施

Dingcheng Huang, Yuda Ding, Bingshuo Liu, Qingbin Liu, Xi Chen, Jiang Bian, Hongliang Sun, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15509 2026-06-16 cs.HC cs.CY 新提交 50%

What do you mean by human-AI collaboration: Prerequisite functions and the affordances needed to achieve it

你说的人机协作是什么意思:实现协作所需的前提功能和可供性

Mutlu Cukurova

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文基于学习科学对协作的严格定义,提出人机协作需满足对称关系、共享目标等条件,并通过五级诊断分类法指出当前人机交互多为咨询而非协作,最后推导出实现协作所需的功能。

Comments 22 pages,1 table, Submitted for Review to the Handbook of AI and the Future of Education (R. Wegerif, I. Casebourne, A. Zhou & I. J. Ness, Eds.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14146 2026-06-15 cs.NE 新提交 50%

A Programmer's Guide to Cascaded Adaptive Combiners: Online Learning by Biologically Accurate Models of Multilayer Neuron Networks

级联自适应组合器程序员指南:基于多层神经元网络的生物精确模型在线学习

Martin Nilsson, Denis Kleyko

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种更符合生物计算机制的机械性神经网络模型,通过级联自适应组合器实现多层网络的高效在线学习,替代反向传播,在图像分类任务中取得竞争性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14054 2026-06-15 cs.HC 新提交 50%

Visible Adoption, Untracked Contribution: GitHub Evidence of the Accountability Gap Across Three Cohorts of an HCI Prototyping Course

可见的采用,未追踪的贡献:来自GitHub的证据揭示HCI原型设计课程三个队列间的问责差距

Maria Teresa Parreira, Pranav Prabhat Sinha, Hauke Sandhaus, Wendy Ju

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过分析203个GitHub仓库和23,065次提交,研究三个队列(2022、2023、2025年)中GenAI采用情况,发现工具披露率从0%升至66%,但贡献归属仍属少数,揭示问责缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06794 2026-06-15 cs.CL cs.IR 新提交 50%

TA-RAG: Tone-Aware Retrieval-Augmented Generation for Peer-Support Health Communication

TA-RAG: 面向同伴支持健康沟通的语气感知检索增强生成

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出TA-RAG框架,通过轻量级提示在RAG管道中嵌入语气控制(无污名化、可读性调整、受众适应、同理心改写),无需微调模型,提升敏感健康沟通质量。

Comments 5 pages, 5 figures, CIKM 2026 submission manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 50%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12719 2026-06-12 cs.HC 新提交 50%

A Multiplexing Design Space: Theory, Method, and Application

复用设计空间:理论、方法与应用

Yiwen Xing, Afrah Farea, Saiful Khan, Min Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种针对特定应用约束的复用设计空间探索方法,以机器学习工作流中多个二维标量场分析为例,通过三步设计流程和预设计步骤,识别出相对最优的默认复用设计及用户可控的微小变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 50%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏