arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-16 至 2026-04-16 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2604.11244 2026-04-16 cs.CV 90%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-04-16 cs.CV 83%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :visual language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments Project page: https://vision.cs.utexas.edu/projects/acpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14074 2026-04-16 cs.CV 79%

Training-Free Semantic Multi-Object Tracking with Vision-Language Models

无需训练的语义多目标跟踪与视觉-语言模型

Laurence Bonat, Francesco Tonini, Elisa Ricci, Lorenzo Vaquero

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

AI总结 本文提出TF-SMOT,一种无需训练的语义多目标跟踪方法,结合预训练组件生成时间一致的跟踪片段,并通过InternVideo2.5生成视频摘要和实例描述,同时通过语义检索提升交互识别性能。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 77%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV 70%

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13602 2026-04-16 cs.LG 70%

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges

大模型时代的奖励黑客:机制、涌现偏差、挑战

Xiaohua Wang, Muzhao Tian, Yuqi Zeng, Zisu Huang, Jiakang Yuan, Bowen Chen, Jingwen Xu, Mingbo Zhou, Wenhao Liu, Muling Wu, Zhengkang Guo, Qi Qian, Yifei Wang, Feiran Zhang, Ruicheng Yin, Shihan Dou, Changze Lv, Tao Chen, Kaitao Song, Xu Tan, Tao Gui, Xiaoqing Zheng, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学NLP小组)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。

Comments 42 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13292 2026-04-16 cs.CV 70%

See&Say: Vision Language Guided Safe Zone Detection for Autonomous Package Delivery Drones

See&Say:基于视觉语言的自主配送无人机安全区域检测

Mahyar Ghazanfari, Peng Wei

机构 * George Washington University(乔治·华盛顿大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出See&Say框架,结合几何安全提示与语义感知,利用视觉语言模型实现迭代优化,提升无人机配送中安全区域检测的可靠性与动态适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 70%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 62%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14069 2026-04-16 cs.CV 57%

Towards Unconstrained Human-Object Interaction

迈向无约束的人-物交互

Francesco Tonini, Alessandro Conti, Lorenzo Vaquero, Cigdem Beyan, Elisa Ricci

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Fondazione Bruno Kessler(布鲁诺·克塞勒基金会) Department of Computer Science, University of Verona(威尼斯大学计算机科学系)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过多模态大语言模型探索无约束人-物交互检测,提出无需预定义交互词汇的新任务,并展示MLLMs在该任务中的潜力。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14062 2026-04-16 cs.CV cs.MM 57%

OneHOI: Unifying Human-Object Interaction Generation and Editing

OneHOI:统一人类-物体交互生成与编辑

Jiun Tian Hoe, Weipeng Hu, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan

机构 * Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) Universiti Malaya(马来亚大学) VinUniversity(文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 OneHOI提出一种统一的扩散变换框架,整合人类-物体交互生成与编辑,通过共享的交互表示实现单条件去噪过程,支持多种控制模式,取得生成与编辑的最新成果。

Comments Accepted at CVPR2026. This paper moves toward unifying HOI generation and editing within a single model

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13715 2026-04-16 cs.SD cs.AI 57%

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

迈向细粒度时间感知:通过音频侧时间提示进行后训练的大音频-语言模型

Yanfeng Shi, Pengfei Cai, Jun Liu, Qing Gu, Nan Jiang, Lirong Dai, Ian McLoughlin, Yan Song

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China, Hefei, China(语音与语言信息处理国家级工程研究中心,中国科学技术大学,合肥,中国) ICT Cluster, Singapore Institute of Technology, Singapore(新加坡理工学院ICT集群,新加坡)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Audio-Side Time Prompt方法,结合强化学习改进大音频-语言模型的时间感知能力,在音频定位、事件检测等任务中取得显著提升。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13598 2026-04-16 cs.LG stat.ME 57%

Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning

通过证据感知奖励和自校正偏好学习增强放射科报告生成

Qin Zhou, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao, Zhe Wang

机构 * Department of Computer Science and Engineering, ECUST(电子科技大学计算机科学与工程系) Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, P. R. China(教育部能源化工过程智能制造重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出ESC-RL方法,结合证据感知对齐奖励和自校正偏好学习,提升放射科报告生成的临床准确性与持续改进能力,实验表明其在胸部X光数据集上表现优异。

Comments 13 pages,4 figures, ACL2026-main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13100 2026-04-16 cs.SE cs.AI 57%

Contract-Coding: Towards Repo-Level Generation via Structured Symbolic Paradigm

合同编码:通过结构化符号范式实现仓库级生成

Yi Lin, Lujin Zhao, Yijie Shi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出合同编码,通过结构化符号范式解决仓库级生成中意图与代码之间的模糊性问题,实现意图驱动的架构合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01738 2026-04-16 cs.CV 57%

Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models

简单即正义:视觉基础模型中通用可推广AIGI检测的出现

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Bin Li

机构 * Shenzhen University(深圳大学) Nanchang University(南昌大学) University of North Texas(北得克萨斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出通过简单线性分类器在现代视觉基础模型冻结特征上训练,实现超越专门检测器的AIGI检测性能,尤其在真实世界数据集上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13593 2026-04-16 cs.MM 50%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13045 2026-04-16 cs.DB 50%

Draft-Refine-Optimize: Self-Evolved Learning for Natural Language to MongoDB Query Generation

草稿-细化-优化:面向自然语言到MongoDB查询生成的自演化学习

Mingwei Ye, Jiaxi Zhuang, Mingjun Xu, Linfeng Zhang, Guolin Ke, Hengxing Cai

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出EvoMQL框架,通过迭代的草稿-细化-优化流程,结合执行反馈实现自然语言到MongoDB查询生成的自演化学习,提升了执行准确率。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏