arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-17 至 2026-03-17 共收录 137 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 39 篇

2603.15558 2026-03-17 cs.CV cs.RO 57%

Panoramic Affordance Prediction

全景 affordance 预测

Zixin Zhang, Chenfei Liao, Hongfei Zhang, Harold Haodong Chen, Kanghao Chen, Zichen Wen, Litao Guo, Bin Ren, Xu Zheng, Yinchuan Li, Xuming Hu, Nicu Sebe, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) MBZUAI(慕尼黑工业大学人工智能研究所) UniTrento(特伦特大学) Knowin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14992 2026-03-17 cs.AI cs.MM 57%

Exposing Cross-Modal Consistency for Fake News Detection in Short-Form Videos

揭示短视频中跨模态一致性以检测虚假新闻

Chong Tian, Yu Wang, Chenxu Yang, Junyi Guan, Zheng Lin, Yuhan Liu, Xiuying Chen, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽亚德人工智能大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.AI

AI总结 本文提出MAGIC3模型,通过多粒度跨模态一致性建模提升虚假新闻检测性能,实现高准确率与低成本的平衡。

Comments 16 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03718 2026-03-17 cs.CL cs.AI 57%

Grounded Misunderstandings in Asymmetric Dialogue: A Perspectivist Annotation Scheme for MapTask

对话中的基础误解:一种面向MapTask的视角主义标注方案

Nan Li, Albert Gatt, Massimo Poesio

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种视角主义标注方案,用于分析MapTask中对话参与者对参照表达的 grounded 解释差异,揭示理解如何演变并修复,评估LLM对视角依赖性 grounding 的建模能力。

Comments 14 pages, 5 figures, 6 tables; Camera-ready Version; Accepted by LREC 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14770 2026-03-17 cs.CV 57%

AnyPhoto: Multi-Person Identity Preserving Image Generation with ID Adaptive Modulation on Location Canvas

AnyPhoto: 多人身份保持图像生成与基于ID自适应调制的定位画布

Longhui Yuan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 AnyPhoto通过定位画布和身份自适应调制实现多人身份保持生成,提升可控性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22436 2026-03-17 cs.CV 57%

ABounD: Adversarial Boundary-Driven Few-Shot Learning for Multi-Class Anomaly Detection

ABounD:面向多类异常检测的对抗边界驱动少样本学习

Runzhi Deng, Yundi Hu, Xinshuang Zhang, Zhao Wang, Xixi Liu, Wang-Zhou Dai, Caifeng Shan, Fang Zhao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ABounD框架,通过语义概念锚定与几何边界优化,解决多类异常检测中特征空间塌陷和跨类干扰问题,实现高效准确的少样本学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13696 2026-03-17 cs.CL cs.LG 57%

Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models

无排斥性重复:儿童语言模型中指称机制的规模敏感性

Jon-Paul Cacioli

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究评估了文本模型中排斥性机制的规模敏感性,发现基于儿童对话训练的模型在指称抑制方面表现不敏感,且重复素有增强效应,挑战了传统排斥性假设。

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13393 2026-03-17 cs.CV 57%

Colony Grounded SAM2: Zero-shot detection and segmentation of bacterial colonies using foundation models

基于群体的SAM2:利用基础模型进行细菌群落的零样本检测和分割

Daan Korporaal, Patrick de Kruijf, Ralph H. G. M. Litjens, Bas H. M. van der Velden

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Colony Grounded SAM2,利用预训练的基础模型进行细菌群落的零样本检测和分割,无需进一步训练,实现了高精度的检测和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13317 2026-03-17 cs.LG cs.HC 57%

Evaluating Large Language Models for Gait Classification Using Text-Encoded Kinematic Waveforms

利用文本编码的运动学波形评估大语言模型用于步态分类

Carlo Dindorf, Jonas Dully, Rebecca Keilhauer, Michael Lorenz, Michael Fröhlich

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 研究评估了将连续步态运动学波形编码为文本数值序列时,通用大语言模型在步态分类中的性能,并与传统机器学习方法进行比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG 57%

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07605 2026-03-17 cs.CV 57%

LOSC: LiDAR Open-voc Segmentation Consolidator

LOSC:激光雷达开放词汇分割整合器

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工大学,埃菲尔大学,CNRS)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了基于图像的视觉-语言模型在驾驶场景中对激光雷达扫描进行开放词汇分割的应用,通过整合标签提升空间时间一致性与图像增强鲁棒性,提出LOSC方法在nuScenes和SemanticKITTI上优于现有最佳方法。

Comments 3DV 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14054 2026-03-17 cs.SE 50%

LegacyTranslate: LLM-based Multi-Agent Method for Legacy Code Translation

LegacyTranslate: 基于LLM的多智能体方法用于遗留代码翻译

Zahra Moti, Heydar Soudani, Jonck van der Kogel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LegacyTranslate多智能体框架,通过三个智能体提升遗留代码翻译质量,实验显示初始翻译智能体达到45.6%可编译输出,结合API grounding和refinement智能体进一步提升编译和测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13773 2026-03-17 cs.CL 50%

LiveWeb-IE: A Benchmark For Online Web Information Extraction

LiveWeb-IE:一个在线网页信息提取的基准测试

Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LiveWeb-IE基准测试,用于评估在线网页信息提取系统,通过活体网站和多阶段代理框架VGS,提升信息提取的准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13267 2026-03-17 cs.CY cs.HC cs.SE 50%

Gamification Preferences in Digital Education: The Role of Individual Differences

数字化教育中的游戏化偏好:个体差异的作用

Anna Katharina Ricker, Kai Marquardt, Lucia Happe

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨了学习者特征和任务情境如何影响游戏化元素的偏好,发现年龄是最重要的预测因素,学习活动类型显著影响游戏化元素的适用性。

Comments 32 pages, 4 Figures, Springer EAIT in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18946 2026-03-17 q-bio.NC 50%

Schema-based active inference supports rapid generalization of experience and frontal cortical coding of abstract structure

基于模式的主动推断支持经验的快速泛化和前额叶皮层对抽象结构的编码

Toon Van de Maele, Tim Verbelen, Dileep George, Giovanni Pezzulo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于模式的分层主动推断框架,通过模拟展示其在空间导航任务中实现快速模式泛化的能力,并揭示前额叶皮层中与模式相关的神经编码机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 9 篇

2603.13349 2026-03-17 cs.CV cs.AI 76%

MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval

MURE:基于视觉-语言模型的多分辨率编码框架用于视觉文档检索

Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China, China(中国科学技术大学) Hefei University of Technology, China(合肥工业大学)

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文提出MURE框架,通过多分辨率采样编码、跨粒度特征融合和语义感知聚类机制,提升视觉文档检索效率与效果,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 70%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13398 2026-03-17 cs.CV 70%

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

千帆OCR:一种统一的端到端模型用于文档智能

Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

机构 * Baidu Qianfan Team(百度千帆团队)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 千帆OCR是一种端到端视觉-语言模型,整合文档解析、布局分析和文档理解,支持图像到Markdown转换及多种提示驱动任务,通过Layout-as-Thought机制提升复杂布局的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13238 2026-03-17 cs.CV cs.CL 70%

KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR

KazakhOCR: 一种用于评估多模态模型在低资源库尔德语手写体OCR中的合成基准

Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran

机构 * Pittsford Sutherland High School(皮茨福德萨瑟兰高中) Edison Academy Magnet School(埃德ison学院磁性学校)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文构建了包含7219张图像的合成OCR数据集,用于评估多模态大语言模型在低资源库尔德语手写体OCR和语言识别中的性能,发现传统OCR在字符错误率上优于MLLMs。

Comments Accepted to AbjadNLP @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 62%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 62%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15509 2026-03-17 cs.AI cs.CV 62%

Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner

Chart-R1: 链式推理监督与强化学习用于高级图表推理器

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Yufeng Zhong, Lin Ma

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Chart-R1,通过链式推理监督和强化学习提升图表推理能力,通过程序化数据合成和两阶段训练策略,在图表领域取得显著性能提升。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15206 2026-03-17 cs.CL cs.CV 57%

Efficient Document Parsing via Parallel Token Prediction

通过并行标记预测实现高效的文档解析

Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li

机构 * Platform and Content Group, Tencent(腾讯平台与内容组) Renmin University of China(中国人民大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出并行标记预测方法,通过在输入序列中插入可学习标记并设计训练目标,使VLM在文档解析中实现并行解码,提升解析速度并减少模型幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 9 篇

2506.06251 2026-03-17 cs.SE cs.AI 83%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 GUI与屏幕智能体 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06999 2026-03-17 cs.CV 79%

TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models

TrajPred: 基于轨迹的联合嵌入预测用于视觉-语言模型中手术器械-组织交互识别

Jiajun Cheng, Xiaofan Yu, Subarna Tripathi, Sainan Liu, Shan Lin

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TrajPred框架,通过编码器械轨迹融入时间运动线索,并基于轨迹引入预测模块生成更精确的视觉语义嵌入,提升手术器械-组织交互识别的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 70%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14724 2026-03-17 cs.AI 70%

GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representation

GameUIAgent:一种基于大语言模型的自动化游戏UI设计框架,采用结构化中间表示

Wei Zeng, Fengwei An, Zhen Liu, Jian Zhao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出GameUIAgent框架,通过结构化中间表示将自然语言描述转化为Figma设计,结合神经符号管道实现迭代自校正,发现质量天花板效应和渲染评估保真原则。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 62%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 62%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏