arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2608.01238 2026-08-04 cs.CL cs.MM 新提交 50%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01066 2026-08-04 cs.RO 新提交 50%

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

OC-VLA++:用于视点鲁棒机器人操作的单目几何引导跨视图一致性

Tianyi Zhang, Ziyang Gong, Zhenjie Yang, Zhe Qian, Haonan Duan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究针对相机覆盖有限时机器人操作的视点泛化问题,提出OC-VLA++模型,通过几何引导的配对视图监督和跨视图动作等变目标提升未见视点泛化能力,性能优于原模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00779 2026-08-04 cs.RO 新提交 50%

SIPTraj: Map-Free End-to-End Trajectory Prediction via Physics-Guided Scene Interaction

SIPTraj:无高精地图的物理引导场景交互端到端轨迹预测

Feifei Liu, Zejun Wei, Haozhe Wang, Yazhi Ye, Yuying Zhang, Jintao Cheng, Chi Man Vong, Xieyuanli Chen, Xiaoyu Tang

机构 * School of Data Science and Engineering, Xingzhi College, South China Normal University(华南师范大学行知学院数据科学与工程学院) Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学学院) School of Electronic Science and Engineering, South China Normal University(华南师范大学电子科学与工程学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SIPTraj是一种无高精地图的端到端轨迹预测框架,通过分层智能体-场景编码器和物理引导迭代解码器解决场景锚定与物理可行性问题,在两个数据集上性能优于现有方法,推理无需高精地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28915 2026-08-03 physics.soc-ph cs.SI math-ph math.MP 新提交 50%

An agent-based model of the formation and evolution of common ground

基于智能体的共同基础形成与演化模型

Mengbin Ye, Wooseok Jung, Tony J. Mathew, Lorenzo Zino, Yoshihisa Kashima

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。

Comments Submission for a journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28252 2026-07-31 stat.ME 新提交 50%

Improving Discrepancy Measures for Global Sensitivity Analysis

改进用于全局敏感性分析的差异度量方法

Samuele Lo Piano, Alessio Lachi, Razi Sheikholeslami, Arnald Puy, Pamphile Tupui Roy, Andrea Saltelli

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种调整后的替代差异度量方法,通过秩变换与摩尔邻域插补改进全局敏感性分析,经多基准测试,该方法在非光滑水文输出上实现完美秩一致性,且网格分辨率是性能变异性的核心驱动因素。

Comments 25 pages, 9 figures, 11 tables, two supplementary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27682 2026-07-31 cs.IR 新提交 50%

Restoring Collaborative Signals in Semantic-ID Generative Recommendation via Personalized Natural Language

通过个性化自然语言恢复语义-ID生成式推荐中的协同信号

Changjiang Han, Qingyang Li, Yaqiang Zang, Jikun Kang, Pinghua Gong, Xue Liu, Bowei He

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究针对基于LLM的生成式推荐模型中SID丢失协同信号导致准确率受限的问题,提出个性化自然语言引导的框架,通过添加分层协同线索恢复信号,提升推荐准确率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27212 2026-07-31 cs.HC cs.CL 新提交 50%

Digital Harf: A Clinically Integrated Multimodal AI System for Pervasive Arabic Speech and Language Therapy

Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, Sabri Boughorbel, Abdulrhman Aljouie, Bdour Alwuqaysi, Yahya Bokhari, Ayah Othman Sindi, Ehsan Hoque

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26409 2026-07-30 cs.NI 新提交 50%

Can We Trust AI in 6G? Verifiable and Auditable AI-Driven Trustworthy Wireless Networks

我们能信任6G中的AI吗?可验证且可审计的AI驱动可信无线网络

Genze Jiang, Yizhou Huang, Kezhi Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对6G中AI在无线网络应用的信任问题,提出基于3GPP规范的机械审计方法与原生审计网络架构,支持AI功能的部署前认证和运行时审计,为AI驱动的可信无线网络提供解决方案。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-07-30 cs.CL 新提交 50%

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25329 2026-07-29 cs.IR 新提交 50%

Grevo: A Unified Generative Recommendation Framework with Evolutionary Item Indexing

Grevo:一种具有进化项索引的统一生成式推荐框架

Huanjie Wang, Liwei Guan, Zekai Sun, Hongwei Zhang, Honghui Bao

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对生成式推荐中语义标识符固定及端到端方法问题,提出Grevo框架,将SID分配当作可进化变量,基于单一多任务推荐器统一相关任务,用进化项索引重分配标识符,实验证明其性能优于现有生成式推荐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24976 2026-07-29 quant-ph gr-qc hep-th 新提交 50%

Quantum reference frames beyond subsystems: a reconstruction and generalization of the perspective-neutral framework

超越子系统的量子参考系:视角中性框架的重构与推广

Stefan L. Ludescher, Manuel Mekonnen, Thomas D. Galley, Markus P. Mueller

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究将量子参考系概念推广到对应协变量子仪器的情况,开启多种物理应用,如标记框架、关系时钟等。重构并推广了视角中性方法,提供资源理论基础,澄清约束量子化,部分结果适用于其他框架,弥合相关研究差距。

Comments 36+6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23340 2026-07-28 cs.DB 新提交 50%

ABISS: Evaluating Text-to-SQL Systems Through Agent Interaction

ABISS:通过代理交互评估文本到SQL系统

Giovanni Sullutrone, Luca Sala, Sania Aftar, Georgia Koutrika, Sonia Bergamaschi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对文本到SQL系统在处理现实模糊问题的不足,提出统一分类法、多代理生成管道及动态模拟环境ABISS。通过实验揭示模型在子类别分类和澄清条件下SQL生成的瓶颈,提供真实类别虽有收益,但模糊问题执行率仍低,且发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23272 2026-07-28 cs.CR cs.SE 新提交 50%

From Signals to Behaviors: Evidence-Based Android Malware Detection

从信号到行为:基于证据的安卓恶意软件检测

Shiwen Song, Yiheng Xiong, Sen Chen, Xiaofei Xie

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究安卓恶意软件检测问题,提出Praxis方法,通过假设-确认-判断流程,从静态信号出发结合程序分析和上下文判断恶意行为。实验证明该方法检测性能优,能降低误报率并恢复细粒度行为,各阶段对性能均有贡献。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22606 2026-07-28 cs.CY 新提交 50%

Auditing Institutional Heterogeneity for Generative AI in Patient Education: A Large-Scale Study of 102 US Transplant Handbooks

审核患者教育中生成式人工智能的机构异质性:对102本美国移植手册的大规模研究

Yubo Li, Rema Padman, Ramayya Krishnan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对美国23个移植中心的102本手册及相关患者问题,用结构化输出大语言模型评判器审核。发现机构编辑风格超越器官类型界限,信息差距在特定主题突出,分歧主题聚类,且可由问题框架预测分歧,探讨了对移植护理中部署生成式人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22226 2026-07-27 cs.RO 新提交 50%

Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments

用于户外环境的基于几何目标定位的离线视觉语言导航

Ali Salmasi, Xianjia Yu, Tomi Westerlund

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对户外环境下的离线视觉语言导航,通过对17个可边缘部署的SLM与4个在线API进行基准测试,提出轻量级混合语义几何目标定位框架并集成到Edge-BehAV中,提升了性能,降低目标距离误差,实现无网络连接下的有效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22082 2026-07-27 cs.MA 新提交 50%

When Language Models Meet NeuroGraphs: Exploring Enhanced Agentic LLM Framework Towards Brain Network Analysis

当语言模型遇上神经图谱:探索用于脑网络分析的增强型智能语言模型框架

Jiaxing Li, Rui Dong, Muyao Tang, Youyong Kong

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对脑网络分析中现有方法解释性有限等问题,提出BrainAgent智能语言模型框架,将连接组分类设为迭代过程,经特定工具转换、知识检索等步骤生成结构化预测,实验证明其优于基线,为脑网络分析提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22020 2026-07-27 cs.RO 新提交 50%

Embodying Multi-Hand Manipulation Policies by Searching the Assignment and Null Spaces

通过搜索分配空间和零空间来体现多手操作策略

Yorai Shaoul, Jiaoyang Li, Maxim Likhachev

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究多臂机器人执行操作策略的问题,基于冲突搜索构建框架,通过搜索轨迹分配空间和零空间,统一处理分配与零空间运动,有效解决多手操作策略执行难题,实现多臂机器人协调操作。

Comments Published in SoCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21961 2026-07-27 cs.CL 新提交 50%

On Improving Faithfulness of Podcasts from Documents

论提高基于文档的播客忠实度

Soumya Dutta, Tejas Indulal Dhamecha, Pannaga Shivaswamy

机构 * Indian Institute of Science(印度科学研究所) Adobe Research(Adobe研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究基于文档的播客生成中的忠实度问题,构建数据集并用多个大语言模型生成记录,引入轮次级评判框架。发现先进模型也常生成无根据内容,提出catch - n - repair框架,实验证明该框架能提升播客生成的忠实度。

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21769 2026-07-27 cs.HC 新提交 50%

From Grasping to Speaking: Generative AI-Based Environment-Grounded VR Communication Training for Autistic Individuals

从抓握到说话:基于生成式人工智能的自闭症个体环境基础VR沟通训练

Ziming Li, Roshan L. Peiris

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探索基于生成式人工智能的VR沟通训练对自闭症个体的作用,通过9名受训者和7名教练参与的三种模式实验发现,C+O+G模式更受青睐,可用性和工作量相当,有助于沟通实践融入任务执行,还讨论了相关设计考量。

Comments 14 pages, ASSETS2026

Journal ref The 28th International ACM SIGACCESS Conference on Computers and Accessibility (ASSETS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21462 2026-07-24 cs.CY 新提交 50%

White Box Evidence Packages for Policy Audit Reports

政策审计报告的白盒证据包

Seunghyun Yoo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究在政策审计中评审者如何判断报告有无证据支持,引入可控评估框架,在多种证据条件下生成报告让评审员评估。结果显示内部证据影响报告引用推理方式,混合接口最有用,随机控制揭示风险,还将内部模型访问重构为证据设计问题。

Comments 16 pages, 5 figures. Presented at the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 50%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18557 2026-07-22 physics.geo-ph 新提交 50%

AGENTS4GEOS: agentic platform for open-source multi-physics simulation

AGENTS4GEOS:用于开源多物理场模拟的智能体平台

Adriano M. A. Côrtes, Roberto M. Velho, Fernando A. Rochinha, Alvaro L. G. A. Coutinho, Mauricio Araya-Polo, Hervé Gross

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。

Comments 14 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17538 2026-07-21 cs.AR cs.CL cs.DB cs.ET cs.IR 新提交 50%

D-NOVA: In-Storage Retrieval Accelerator via Dual-Bound 3D NAND-Optimized Similarity Search with Vector Adaptation

D-NOVA:通过具有向量适配的双边界3D NAND优化相似性搜索实现存储内检索加速器

Chang Eun Song, Sumukh Pinge, Tianqi Zhang, Sung Eun Kim, Tajana S. Rosing, Mingu Kang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对RAG密集向量检索性能瓶颈,提出软硬件协同设计的存储内检索加速器D-NOVA。通过深度嵌入搜索功能、采用新距离度量及引入适配器,实现高效检索,相比CPU和现有加速器有显著性能和能效提升,展现全存储向量搜索加速RAG的潜力。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026), Athens, Greece. Chang Eun Song and Sumukh Pinge are co-first authors and contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15948 2026-07-20 cs.SE 新提交 50%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15566 2026-07-20 cs.HC 新提交 50%

Physiological Prior-Driven Label Enhancement for Cross-Subject EEG Emotion Recognition

用于跨主体脑电情感识别的生理先验驱动标签增强

Hongyu Zhu, Lin Chen, Yuming Fu, Mounim A. El-Yacoubi, Mingsheng Shang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对跨主体脑电情感识别中标签噪声问题,提出PhyDA框架,通过生理噪声量化器和数据自适应标签细化器,统一神经生理先验与数据驱动的标签细化,实验证明该方法显著优于基线,具有可解释性和鲁棒性。

Comments Submitted; 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 50%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15535 2026-07-20 cond-mat.mtrl-sci 新提交 50%

Symbolic Predicate-Guided Language Agents for Inverse Design of Perovskite Oxides

用于钙钛矿氧化物逆设计的符号谓词引导语言智能体

Dong Hyeon Mok, Seoin Back, Victor Fung, Guoxiang Hu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究钙钛矿氧化物逆设计,引入 DSL 引导策略,将自然语言规则转化为符号谓词,开发 ORCHESTRA 框架。该策略能增强 LLM 智能体推理能力,无需大量特定任务数据集或额外训练,提升材料设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 50%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 视觉定位与Grounding :MLLM(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14026 2026-07-16 cs.CE 新提交 50%

From Forecasts to Auditable Reports: Evidence Contracts for LLM-Assisted Housing-Guarantee Risk Monitoring

从预测到可审计报告:大语言模型辅助住房担保风险监测的证据契约

Hyeongcheol Kim, Yoontae Hwang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究将住房担保风险预测转化为可审计报告的挑战,提出证据约束报告流程,利用韩国租房押金数据,结合预测模型与结构化证据、验证及分析师监督,提升高风险检测能力,经评估报告支持实际决策,证明该方法可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13059 2026-07-16 cs.RO 新提交 50%

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

GPUSimBench:迈向具身人工智能中可扩展且可靠的GPU加速模拟器

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

机构 * Shanghai AI Laboratory(上海人工智能实验室) MIRAI(未来人工智能研究所) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究具身人工智能中GPU加速模拟器问题,通过GPUSimBench工具,建立物理基础评估、基准测试并行可扩展性,揭示并量化GPU批处理执行的不确定性,确定模拟器堆栈随机经验模式,强调无界扩展对可重复性的影响。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏