arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1267 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2607.11895 2026-07-16 cs.CY cs.MA 版本更新 50%

AgentSociety 2: An Integrated Research Environment for Executable Social Science

AgentSociety 2:用于可执行社会科学的集成研究环境

Jinghua Piao, Jun Zhang, Haoyu Huang, Keming Zhang, Jing Yi Wang, Xinran Zhao, Songwei Li, Boyuan Sun, Jiayi Chang, Fengli Xu, Chunyan Wang, Fang Zhang, Ke Rong, Jun Su, Tianguang Meng, Yi Liu, Qingguo Meng, Yu Wang, Yong Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对社会科学研究对象的独特性及现有系统缺陷,AgentSociety 2集成研究环境结合大语言模型代理的两个角色,支持端到端工作流程,通过多领域研究展示其能力,为计算社会科学提供可控基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22194 2026-07-16 math.OC 版本更新 50%

Stability Analysis of an Integrated Multistage Stochastic Programming and Markov Decision Process Problem

一个集成多阶段随机规划与马尔可夫决策过程问题的稳定性分析

Zhiyao Yang, Zhiping Chen, Huifu Xu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究集成MSP-MDP框架下的动态决策过程,通过推导动态嵌套重构、函数性质及误差界来研究内、外生不确定性概率分布扰动下的稳定性,结果与现有不同,为相关模型提供新理论基础。

Comments 68pages, revised manuscript with corrections and clarifications to the model formulation, theoretical analysis, proofs, and examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18030 2026-07-15 cs.HC 版本更新 50%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新 50%

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14563 2026-07-13 cs.SE cs.CL 版本更新 50%

Remember Your Trace: Memory-Guided Long-Horizon Agentic Framework for Consistent and Hierarchical Repository-Level Code Documentation

记住你的踪迹:一种基于记忆的长周期代理框架,用于一致且分层的仓库级代码文档

Suyoung Bae, Jaehoon Lee, Changkyu Choi, YunSeok Choi, Jee-Hyong Lee

机构 * Sungkyunkwan University(成均馆大学) University of Oslo(奥斯陆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MemDocAgent通过依赖感知遍历引导和记忆引导代理交互,生成统一上下文的仓库级代码文档,实现高效且一致的文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05622 2026-07-10 cs.CL 版本更新 50%

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

AdaPlanBench: 在世界约束和用户约束下评估大语言模型智能体的自适应规划能力

Jiayu Liu, Cheng Qian, Zhenhailong Wang, Bingxuan Li, Jiateng Liu, Qing Zong, Heng Wang, Jeonghwan Kim, Yumeng Wang, Bingxiang He, Xiusi Chen, Yi R. Fung, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对现有基准未充分探索渐进揭示的双重约束下的自适应规划问题,提出动态交互基准AdaPlanBench,通过307个家务任务和可扩展的约束构建流程,评估LLM智能体在交互中根据反馈迭代调整计划的能力。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05894 2026-07-09 cs.CL 版本更新 50%

EMBER: Efficient Memory via Budgeted Evidence Retention for Long-Horizon Agents

EMBER: 通过预算化证据保留实现高效记忆的长时程智能体

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(NVIDIA研究)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对长时程智能体在固定预算下保留证据的问题,提出EMBER学习型保留策略,通过存储证据胶囊(含原文摘录、检索键和更新元数据)并利用查询后反馈训练,在LongMemEval-RR上显著提升F1、保留召回和读取召回。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08630 2026-07-09 cs.HC 版本更新 50%

Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval

Sycamore:用于评估基因组可视化检索的合成身份表征

Huyen N. Nguyen, Astrid van den Brandt, Nils Gehlenborg

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Sycamore通过三种条件探针设计评估基因组可视化检索系统,探讨合成身份在真实用户反馈中的表现及影响。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06363 2026-07-09 econ.TH cs.MA 版本更新 50%

The Replicator-Optimization Mechanism: A Scale-Relative Formalism for Persistence-Conditioned Dynamics with Application to Consent-Based Metaethics

复制者-优化机制:一种面向持久条件动力学的尺度相对形式化及其在基于同意的元伦理学中的应用

Murad Farzulla

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种尺度相对的形式化框架,统一复制者-突变动力学与价格选择-传输模型,通过摩擦、合法性和信念传递三个核心概念,从社会契约论独立推导出与生物学相同的结构,并建立描述性动力学与工具性规范性的桥梁,避免实然-应然谬误。

Comments 67 pages, 1 table, Lean 4 verification appendix (machine-checked). v2: substantially expanded from v1; adds formal-verification and identifiability sections and corrects references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31480 2026-07-08 cs.CL 版本更新 50%

Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task

语言模型可以组合性地解析指代,但这并非其天然优势:以个人关系任务为例

Bart Evelo, Meaghan Fowlie, Denis Paperno

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过个人关系任务,比较人类与大型语言模型在外延任务(确定指称对象)和内涵任务(结构化表示意义)上的表现,发现人类更擅长外延任务而LLM更擅长内涵任务,表明缺乏指称基础是LLM模拟人类语言理解的关键缺失。

Comments A pre-MIT Press publication version. Paper accepted to Transactions of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06121 2026-07-07 cs.RO 版本更新 50%

Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

Glance-Say:通过粘性注视实现多模态人机协作与意图识别

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Benjamin Kiefer, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16897 2026-07-07 physics.comp-ph cond-mat.mtrl-sci 版本更新 50%

Machine Learning Hamiltonians are Accurate Energy-Force Predictors

机器学习哈密顿量是精确的能量-力预测器

Seongsu Kim, Chanhui Lee, Yoonho Kim, Seongjun Yun, Honghui Kim, Nayoung Kim, Changyoung Park, Sehui Han, Sungbin Lim, Sungsoo Ahn

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究现有哈密顿量模型作为能量-力预测器表现不明的问题,通过直接从预测哈密顿量计算能量和力的基准测试填补空白,提出QHFlow2模型并展示其优势及与模型容量和数据的关系

Comments 2026 ICML poster accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新 50%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24380 2026-07-07 cs.SE 版本更新 50%

Agentic Services Computing

智能服务计算

Shuiguang Deng, Hailiang Zhao, Ziqi Wang, Wenzhuo Qian, Xiang Ao, Guanjie Cheng, Jianwei Yin, Albert Y. Zomaya, Schahram Dustdar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 探讨服务计算范式转变带来的新问题,基于现有研究基础,引入智能服务计算,扩展服务计算范畴,为未来服务生态系统奠定以服务为中心的基础,实现对自治代理的系统管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18368 2026-07-03 cs.RO 版本更新 50%

Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation

学习多任务机器人操作的语义原子技能

Yihang Zhu, Weiqing Wang, Shijie Wu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出AtomSkill框架,通过语义对比对齐和关键姿态想象,从演示中学习可重用原子技能,实现多任务机器人操作,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 50%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09803 2026-07-01 cs.SD 版本更新 50%

MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

MAGE:模态无关的音乐生成与编辑

Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu, Rajeev Nongpiur, Ishan Chatterjee, Mayur Jagdishbhai Patel, Pu Wang

机构 * Google(谷歌) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MAGE提出了一种模态无关框架,统一了多模态音乐生成与混合编辑,通过可控多模态FluxFormer和音频视觉 nexus 对齐机制,实现灵活且高效的音乐生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03371 2026-06-26 cs.CL 版本更新 50%

See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence

观察、推断、干预:面向目标导向社交智能的主动世界建模

Honghui Zhang, Chenmeinian Guo, Yichen Yu, Guanyu Liu, Yujia Zhang, Yongming Qin, Chongguo Song, Mengyue Yang, Lei Yu, Tianyu Shi

机构 * Mita Technology(Mita技术公司) University of Bristol(布里斯托大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。

Comments 16 pages, 3 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 50%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10703 2026-06-23 cs.CL cs.IR 版本更新 50%

LatentCRS: A Variational EM Framework for Bridging Semantics and Behavior in LLM-based Conversational Recommendation

LatentCRS:一种用于桥接基于LLM的对话推荐中语义与行为的变分EM框架

Guanrong Li, Kuo Tian, Jinnan Qi, Qinghan Fu, Zhen Wu, Rui Xia, Xinyu Dai

机构 * Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出LatentCRS框架,通过变分EM过程桥接LLM的语义空间与用户行为模式,解决对话推荐中语义理解与推荐精度不匹配的问题,实验表明其有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10416 2026-06-19 cs.RO 版本更新 50%

TASC: Task-Aware Shared Control for Relational Telemanipulation

TASC:面向关系遥操作的任务感知共享控制

Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(KU莱顿机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(KU莱顿电气工程系,语音与图像处理研究单位)

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出TASC框架,通过视觉构建开放词汇交互图推断任务级用户意图,并基于空间约束提供共享控制辅助,提升关系遥操作效率与泛化能力。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05925 2026-06-18 cs.RO 版本更新 50%

DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions

DexSynRefine:合成与精炼人-物交互运动以实现物理可行的灵巧机器人动作

Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

机构 * Korea Institute of Science and Technology(韩国科学技术院) KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出DexSynRefine框架,通过HOI-MMFP运动先验合成手-物轨迹,结合任务空间残差强化学习和接触动力学适应,将人-物交互数据转化为物理可行的灵巧操作,在五个任务上成功率提升50-70个百分点。

Comments Project page: https://dexsynrefine.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02854 2026-06-17 cs.PL cs.LO math.CT 版本更新 50%

Fixed-Point Scaffolding in the Clef Programming Language

Clef 编程语言中的不动点脚手架

Houston Haynes

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于不动点组合子的编译器中间表示方法,通过范畴论构造实现类型结构保持和正确性验证,并利用 MLIR 工具链支撑实际编译。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 50%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06234 2026-06-10 cs.RO cs.HC 版本更新 50%

RobotEQ: Transitioning from Passive Intelligence to Active Intelligence in Embodied AI

RobotEQ:从被动智能到主动智能的具身AI过渡

Kuofei Fang, Xinyi Che, Haomin Ouyang, Shufan Zhang, Xuehao Wang, Qi Liu, Liyi Liu, Chenqi Zhang, Wenxi Cai, Wenyu Dai, Jinyang Wu, Fan Zhang, Haoyu Chen, Bin He, Zheng Lian

机构 * State Key Laboratory of Autonomous Intelligent Unmanned Systems, Tongji University(自主智能无人系统国家重点实验室,同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出RobotEQ基准,评估模型在具身场景中理解并遵守社会规范的能力,实验表明现有模型在主动智能上仍有不足,利用RAG技术可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18765 2026-06-10 cs.RO 版本更新 50%

Goal-oriented Communication for Fast and Robust Robotic Fault Detection and Recovery

面向快速鲁棒机器人故障检测与恢复的目标导向通信

Shutong Chen, Adnan Aijaz, Yansha Deng

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Bristol Research and Innovation Laboratory, Toshiba Europe Ltd.(托bsd欧洲有限公司布里斯托尔研究与创新实验室)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 提出目标导向通信框架,通过联合设计通信-计算-控制回路,利用3D场景图检测故障,并微调小语言模型结合知识蒸馏生成恢复动作,实现故障检测与恢复时间降低82.6%,任务成功率提升76%。

Comments Submit to IEEE for potential publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20591 2026-06-09 cs.RO 版本更新 50%

LightTact: A Visual-Tactile Fingertip Sensor for Deformation-Independent Contact Sensing

LightTact: 一种用于变形无关接触感知的视觉-触觉指尖传感器

Changyi Lin, Boda Huo, Mingyang Yu, Emily Ruppel, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出LightTact传感器,通过环境光阻断光学配置实现变形无关的接触检测,在无宏观变形下(如液体、超软材料)实现高对比度接触分割,并解锁轻接触机器人操作。

Comments Project website: https://linchangyi1.github.io/LightTact

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-06-09 cs.DB cs.DS cs.IR 版本更新 50%

jXBW: A Compressed Index for Structure-Aware JSONL Retrieval in Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 45 篇

2608.00077 2026-08-05 cs.CV 版本更新 92%

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

超越准确率:针对OCR关键多模态大语言模型(MLLM)推理的视觉令牌剪枝空间溯源审计

Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

专题命中 文档图表理解 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对OCR关键MLLM推理的视觉令牌剪枝,提出结合空间溯源的审计方法,发现准确率无法反映的质量风险,揭示模型特定前沿并验证压缩与任务通用性的关系,为视觉令牌剪枝评估提供新范式。

Comments 21 pages, including supplementary material. Code and reproducibility artifacts: https://github.com/SouthWinter/spatial-provenance-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10880 2026-08-04 cs.CV 版本更新 89%

Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation

图表规范:用于促进VLM在图表到代码生成中推理的结构表示

Minggui He, Mingchen Dai, Jian Zhang, Yilun Liu, Shimin Tao, Pufan Zeng, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University(早稻田大学) University of Science and Technology of China(中国科学技术大学) NanKai University(南开大学)

专题命中 文档图表理解 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出图表规范,通过结构化中间表示提升VLM在图表到代码生成中的结构保真度,实验显示其在数据效率和性能上优于现有方法。

Comments Accepted by Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏