arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-18 至 2026-08-18 共收录 45 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2512.04032 2026-08-18 cs.CL cs.AI cs.CV 版本更新 93%

jina-vlm: Small Multilingual Vision Language Model

Jina-VLM:小规模多语言视觉语言模型

Andreas Koukounas, Georgios Mastrapas, Florian Hönicke, Sedigheh Eslami, Guillaume Roncari, Han Xiao

机构 * Jina AI

专题命中 视觉问答 :VLM(title,title_cn);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Jina-VLM是一款24亿参数的多语言视觉语言模型,通过结合SigLIP2视觉编码器与Qwen3语言主干,实现了高效多语言视觉问答性能。

Comments 23 pages, 1-10 main content, 11-23 references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15041 2026-08-18 cs.AI cs.CL 版本更新 81%

mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA

mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Yuxuan Zhao, Zehua Xie, Jin Ma, Ying Shan, Weiming Hu

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-18 cs.CL cs.LG 版本更新 79%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 视觉问答 :grounding(title,abstract);分类 cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07370 2026-08-18 cs.CL 版本更新 78%

LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

LitTraceQA:面向科学问答的多阶段溯源与验证基准

Xuye Liu, Yimu Wang, Peng Shi, Bo Xue, Xiangrui Ke, Songcheng Cai, Kath Choi, Di Wu, Freda Shi, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Amazon(亚马逊公司) City University of Hong Kong(香港城市大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉问答 :grounding(title,abstract)

AI总结 该研究提出LitTraceQA基准,用于科学问答的多阶段溯源与验证,提供含多类型证据的问答数据,可评估系统的论文检索、证据溯源及答案准确性,助力生成可验证的科学问答结果。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20271 2026-08-18 cs.CV 版本更新 57%

A Versatile Foundation Model for AI-enabled Mammogram Interpretation

一种用于AI辅助乳腺X线摄影解读的通用基础模型

Fuxiang Huang, Jiayi Zhu, Yunfang Yu, Yu Xie, Yuan Guo, Qingcong Kong, Mingxiang Wu, Xinrui Jiang, Shu Yang, Jiabo Ma, Ziyi Liu, Zhe Xu, Zhixuan Chen, Yujie Tan, Zifan He, Luhui Mao, Xi Wang, Junlin Hou, Lei Zhang, Qiong Luo, Zhenhui Li, Herui Yao, Hao Chen

机构 * Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Guangdong-Hong Kong Joint Laboratory for RNA Medicine, Department of Medical Oncology, Breast Tumor Centre, Phase I Clinical Trial Centre(广东省恶性肿瘤表观遗传与基因调控重点实验室,粤港澳RNA医学联合实验室,医学肿瘤科,乳腺肿瘤中心,I期临床试验中心) Guangdong Provincial Key Laboratory of Cancer Pathogenesis and Precision Diagnosis and Treatment, AI Big Data Laboratory, Department of Medical Oncology(广东省肿瘤发生与精准诊断与治疗重点实验室,人工智能大数据实验室,医学肿瘤科) Chongqing Key Laboratory of Bio-perception(重庆生物感知重点实验室)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 研究针对乳腺X线分析基础模型的临床转化缺陷,推出VersaMammo模型,构建含70余万张图像的多机构数据集,经两阶段预训练后在92项临床任务基准中表现顶尖,推动乳腺癌筛查诊断进展。

Comments 69 pages, 12 figures, 52 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2603.06697 2026-08-18 cs.CV cs.AI 版本更新 88%

Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs

通过目光思考:将眼动作为视觉推理监督用于医学视觉语言模型

Yiwei Li, Yifan Zhou, Huaqin Zhao, Zihao Wu, Zhengliang Liu, Xiang Li, Quanzheng Li, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Computer Science and Engineering, University of Texas, Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(title);分类 cs.CV、cs.AI

AI总结 通过引入眼动标记,利用时间有序的注视轨迹引导医学VLM的视觉推理,提升放射学任务的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06461 2026-08-18 cs.CV cs.AI 版本更新 86%

Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning

通过对比注意力实现聚焦:增强视觉语言模型的视觉推理能力

Yuyao Ge, Shenghua Liu, Yiwei Wang, Lingrui Mei, Baolong Bi, Xuanshan Zhou, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究针对VLMs在复杂环境下性能下降的问题,提出无训练方法CARVE,通过像素级注意力对比提取任务相关视觉信号,在开源模型上实现最高75%的性能提升,为提升视觉推理提供了高效路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24575 2026-08-18 cs.CV cs.AI 版本更新 84%

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

VFIG:利用视觉-语言模型矢量化SVG中的复杂图形

Qijia He, Xunmei Liu, Hammaad Memon, Ziang Li, Zixian Ma, Jaemin Cho, Zhongzheng Ren, Daniel S Weld, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能 Allen 机构) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出VFIG,一种基于视觉-语言模型的矢量化方法,通过大规模数据集和分层训练策略,实现复杂图形到SVG的高保真转换,并在基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 77%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02148 2026-08-18 cs.IR cs.CL cs.CV 版本更新 70%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11399 2026-08-18 cs.CV cs.CL 版本更新 70%

Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models

层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu

机构 * National University of Singapore(新加坡国立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 62%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 14 篇

2509.21576 2026-08-18 cs.CL 版本更新 92%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(summary_cn,abstract);vision language model(title,abstract)

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新 84%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09761 2026-08-18 cs.LG cs.AI 版本更新 81%

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

在子符号强化学习环境中将LTL任务接地以实现零样本泛化

Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

机构 * Sapienza University of Rome(萨皮恩扎大学罗马分校) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出在子符号强化学习环境中通过联合训练多任务策略和符号接地器,实现LTL任务的零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11426 2026-08-18 cs.RO 版本更新 78%

Grounding Robot Generalization in Training Data via Retrieval-Augmented VLMs

通过检索增强的视觉语言模型实现机器人在训练数据中的泛化

Jensen Gao, Dorsa Sadigh, Sandy Huang, Dhruv Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)

AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-08-18 cs.CV 版本更新 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11427 2026-08-18 cs.CV 版本更新 70%

Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs

视觉输入中指代目标对象的多语言表达式理解

Francisco Nogueira, Alexandre Bernardino, Bruno Martins

机构 * Instituto Superior Técnico(技术高等学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对多语言指代表达式理解问题,构建了含10种语言的统一多语言数据集,提出基于多语言SigLIP2编码器的注意力锚定高效架构,验证了该模型在多语言视觉定位任务上的竞争力与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 67%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract)

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14391 2026-08-18 cs.CV cs.AI 版本更新 62%

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估

Shuo Liang, Yixing Ma, Pengfei Zhou, Zhenglin Wan, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao

专题命中 视觉定位与Grounding :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。

Comments 63 pages, 20 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09562 2026-08-18 cs.CV cs.AI 版本更新 62%

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

分割一切模型中的提示工程:方法、应用与新兴挑战

Yidong Jiang, Jiangtong Li, Daiwei Cheng

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09041 2026-08-18 cs.CY cs.AI cs.GR cs.HC cs.MM 版本更新 57%

Culturally-Aware AI for Cross-Boundary Community Learning: Undergraduate Innovation at the Intersection of Computation and Design

跨边界社区学习的文化感知AI:计算与设计交叉领域的本科生创新

Jiaojiao Zhao, Weisheng Zhang, Jiawen Cai, Haibin Gao, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学) Zhouzhuang Mystery of Life Museum(周庄生命之谜博物馆) Digital Innovation Research Center and Social Science Division(数字创新研究中心和社会科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一个协作框架,通过社区参与计算实现文化感知AI教育,促进社会工作和计算科学跨学科融合,应用于文化遗产保护与可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12381 2026-08-18 cs.CV 版本更新 57%

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

使用CLIP进行合成图像检测:理解和评估预测线索

Marco Willi, Melanie Mathys, Michael Graber

机构 * Institute for Data Science I4DS(数据科学研究所) University of Applied Sciences FHNW(应用科学大学) FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。

Comments 10 figures; 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12951 2026-08-18 cs.SD 版本更新 50%

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

VoxAudio:基于多奖励自回归流匹配的发声音频合成

Wenxiang Guo, Changhao Pan, Ziyue Jiang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24861 2026-08-18 cond-mat.stat-mech cs.IT 版本更新 50%

First-Order Recoverability Collapse in Self-Referential Information Decoders: The Operating Loop of an AI System as a Driven Nonequilibrium Steady State

自指信息解码器中的一阶可恢复性崩溃

Pieter van Rooyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自适应系统在持续非平衡驱动下耦合推理与不可逆动作的可恢复性,发现容量饱和导致可恢复性丧失和诊断发散,反馈使转变变为一阶,出现双稳态区域和滞后现象。

Comments 27 pages, 7 figures, 3 tables. v3: specification-map roadmap figure and classification-audit table; prior-identifications and literature bridges; fleet-limit N-scaling measurement; bootstrapped empirical spinodal; title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24312 2026-08-18 cs.CR 版本更新 50%

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

五个查询就足够了:基于蕴含的查询高效且无替代模型的RAG成员推断攻击

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MEntA攻击方法,利用自然语言蕴含在少量查询下高效推断RAG系统中的文档成员关系,无需替代模型,成本低且难以检测。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2605.23694 2026-08-18 cs.CL 版本更新 78%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 文档图表理解 :multimodal large language model(title,abstract)

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21333 2026-08-18 cs.CV 版本更新 57%

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力

Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

机构 * Kling Team(Kling团队) PKU(北京大学) THU(清华大学) CASIA(中国科学院自动化研究所) CUHKSZ(香港科技大学) NTU(国立台湾大学) NJU(南京大学) XJTU(吉林大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2506.02917 2026-08-18 cs.RO 版本更新 83%

Language-Guided Generation for Personalized Inspection Planning

语言引导的个性化巡检规划生成

Xingpeng Sun, Zherong Pan, Xifeng Gao, Kui Wu, Aniket Bera

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(电气工程系,怀特州立大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究提出一种无训练的VLM引导方法,针对已知场景高效生成符合文本指令的巡检轨迹,可应用于多领域,经多环境验证效果良好。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21862 2026-08-18 cs.RO cs.AI 版本更新 81%

EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control

EvoScene-VLA: 在动作解码器中进化场景信念用于分块机器人控制

Chushan Zhang, Ruihan Lu, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) The University of Queensland(昆士兰大学) Beijing Normal University(北京师范大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出EvoScene-VLA,通过在动作解码器中维护更新的场景状态,改进分块机器人控制中的多步控制预测,提升了场景信念的持续性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏