arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-28 至 2026-04-28 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2604.23691 2026-04-28 eess.SP 75%

Intention-Aware Semantic Agent Communications for AI Glasses

面向AI眼镜的意图感知语义代理通信

Peiwen Jiang, Fangyu Liu, Jiajia Guo, Chao-Kai Wen, Shi Jin, Jun Zhang

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本文提出一种意图感知的语义代理通信框架,通过用户意图引导数据传输,减少带宽消耗并保持任务性能,适用于AI眼镜的轻量级预处理场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL 57%

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22051 2026-04-28 cs.HC 50%

DataSway: Vivifying Metaphoric Visualization with Animation Clip Generation and Coordination

DataSway: 通过动画片段生成与协调使隐喻可视化生动化

Liwenhan Xie, Jiayi Zhou, Anyi Rao, Huamin Qu, Xinhuan Shu

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出DataSway系统,通过动画片段生成与协调技术,帮助用户创建基于SVG的隐喻可视化动画,提升数据抽象编码的理解与交互体验。

Comments Accepted to DIS'26: ACM Designing Interactive Systems. Website: https://shellywhen.github.io/projects/DataSway

详情

展开后加载摘要…

URL PDF HTML 收藏