arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-23 至 2026-04-23 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2508.08508 2026-04-23 cs.CV cs.CL 89%

Re:Verse -- Can Your VLM Read a Manga?

Re:Verse -- 能读懂漫画吗?

Aaditya Baranwal, Madhav Kataria, Naitik Agrawal, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)

专题命中 视觉定位与Grounding :VLM(title,summary_cn);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。

Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 86%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20361 2026-04-23 cs.CV 83%

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

基于感知增强的视觉-语言模型的物体指称引导的注视路径预测

Rong Quan, Yantao Lai, Dong Liang, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。

Comments ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04225 2026-04-23 cs.CV cs.AI cs.CL 82%

Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images

定位后检查:基于区域的推理提升AI生成图像的检测

Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LTE框架,通过定位可疑区域并重新检查以提升AI生成图像检测的准确性和鲁棒性,提供可理解的区域级解释。

Comments 18 pages, 11 figures (including supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20246 2026-04-23 cs.RO cs.AI 74%

Cortex 2.0: Grounding World Models in Real-World Industrial Deployment

Cortex 2.0:在真实工业部署中将世界模型接地

Adriana Aida, Walida Amer, Katarina Bankovic, Dhruv Behl, Fabian Busch, Annie Bhalla, Minh Duong, Florian Gienger, Rohan Godse, Denis Grachev, Ralf Gulde, Elisa Hagensieker, Junpeng Hu, Shivam Joshi, Tobias Knoblauch, Likith Kumar, Damien LaRocque, Keerthana Lokesh, Omar Moured, Khiem Nguyen, Christian Preyss, Ranjith Sriganesan, Vikram Singh, Carsten Sponner, Anh Tong, Dominik Tuscher, Marc Tuscher, Pavan Upputuri

机构 * Sereact GmbH(Sereact公司)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 Cortex 2.0通过在视觉潜在空间中生成候选未来轨迹并评分,实现了从反应式控制到计划与行动的转变,展示了在复杂工业环境中可靠的世界模型规划。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00979 2026-04-23 cs.CV cs.AI 73%

IVY-FAKE: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection

IVY-FAKE:图像和视频AIGC检测的统一可解释框架和基准

Changjiang Jiang, Wenhui Dong, Zhonghao Zhang, Fengchang Yu, Wei Peng, Xinbin Yuan, Yifei Bi, Ming Zhao, Zian Zhou, Chenyang Si, Caifeng Shan

机构 * Nanjing University+(南京大学+)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出IVY-FAKE,首个大规模多模态可解释AIGC检测基准,包含106000+丰富标注样本和5000个手动验证示例,通过GRPO强化学习模型实现可解释推理,提升多基准检测性能,显著优于现有方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19798 2026-04-23 cs.CY cs.CV econ.EM 70%

Diagnosing Urban Street Vitality via a Visual-Semantic and Spatiotemporal Framework for Street-Level Economics

通过视觉-语义和时空框架诊断城市街道活力

Xinxin Zhuo, Mengyuan Niu, Ruizhe Wang, Junyan Yang, Qiao Wang

机构 * School of Economics and Management, Southeast University(经济管理学院,东南大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) School of Architecture, Southeast University(建筑学院,东南大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出基于视觉-语义和时空框架的街道经济活力指数,结合时空数据和LBS信息,揭示街道活力的时空异质性及品牌层级影响。

Comments Submitted to ACM Transactions on Spatial Computing. This paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20368 2026-04-23 cs.CV cs.AI 62%

LaplacianFormer:Rethinking Linear Attention with Laplacian Kernel

LaplacianFormer:重新思考线性注意力与拉普拉斯核

Zhe Feng, Sen Lian, Changwei Wang, Muyang Zhang, Tianlong Tan, Rongtao Xu, Weiliang Meng, Xiaopeng Zhang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) China Electronics Data Corporation(中国电子数据公司) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院) The Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算能力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) Spatialtemporal AI(时空人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LaplacianFormer通过引入拉普拉斯核替代softmax,解决高分辨率视觉任务中注意力机制的二次复杂度问题,提升表达能力并优化计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 57%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19768 2026-04-23 cs.CL cs.AI 57%

Saying More Than They Know: A Framework for Quantifying Epistemic-Rhetorical Miscalibration in Large Language Models

言多必失:一种量化大语言模型中认知-修辞失配的框架

Asim D. Bakhshi

机构 * National University of Science and Technology(科学与技术国家大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种量化大语言模型认知与修辞失配的框架,通过设计三元认知-修辞标记分类法,发现LLM生成文本在修辞强度和认知基础之间存在系统性失配。

Comments 19 pages, 7 figures, Paper Under Review by the Elsevier Journal Assessing Writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18562 2026-04-23 cs.CV 57%

AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation

AnchorSeg: 语言引导的查询库用于推理分割

Rui Qian, Chuanhang Deng, Qiang Huang, Jian Xiong, Mingxuan Li, Yingbo Zhou, Wei Zhai, Jintao Chen, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AnchorSeg通过结构化语言引导查询库将推理分割建模为图像标记上的条件生成过程,通过显式分离空间定位与语义推理,实现67.7%的gIoU和68.1%的cIoU的SOTA结果。

Comments This work has been accepted to ACL 2026, please refer to https://github.com/rui-qian/AnchorSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 57%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20216 2026-04-23 cs.CL 50%

Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context

基于分位数标记和邻近上下文的文本到分布预测

Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Moyan Li, Mohsen Bayati, Bryan Wang, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出分位数标记回归,通过插入专用分位数标记并结合邻近实例,提升分布预测精度,实验显示在多个数据集上效果显著,MAPE更低且预测区间更窄。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20117 2026-04-23 cs.CL 50%

To Know is to Construct: Schema-Constrained Generation for Agent Memory

知即建构:基于模式约束的代理记忆生成

Lei Zheng, Weinan Song, Daili Li, Yanming Yang

机构 * UnionPay(中国银联)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20006 2026-04-23 cs.CL 50%

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

从回忆到遗忘:个性化代理长期记忆的基准测试

Md Nayem Uddin, Kumar Shubham, Eduardo Blanco, Chitta Baral, Gengyu Wang

机构 * Arizona State University(亚利桑那州立大学) Genies University of Arizona(亚利桑那大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Memora基准测试,评估个性化代理在长期对话中的记忆、推理和推荐能力,引入FAMA指标以衡量对过时记忆的依赖,发现LLM和记忆代理在处理长期记忆时存在显著不足。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏