MDB-Link: Hierarchical Schema Linking for Multi-Database Text-to-SQL
MDB-Link:面向多数据库Text-to-SQL的分层模式链接方法
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文针对多数据库Text-to-SQL场景提出分层模式链接框架MDB-Link,结合LLM实现数据库定位与列选择,在多个数据集上性能及运行速度均优于基线方法,可高效支撑SQL生成。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
MDB-Link:面向多数据库Text-to-SQL的分层模式链接方法
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文针对多数据库Text-to-SQL场景提出分层模式链接框架MDB-Link,结合LLM实现数据库定位与列选择,在多个数据集上性能及运行速度均优于基线方法,可高效支撑SQL生成。
生物医学知识构建:软件工程视角
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文从软件工程视角,阐述生物医学知识图谱的核心地位与相关挑战,提出需借鉴Web工程的可组合可复现实践,为生物医学知识基础设施构建提供研究议程。
重新思考高等教育:从固定课程到学习图谱(Learnity Graphs)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文针对高等教育在AI时代的转型需求,提出以学习图谱为核心的终身学习框架,整合多类学习以拓展传统课程的培养维度。
Comments 10 pages, 5 figures
EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。
Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 文档图表理解 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
DocAtlas:将长文档理解视为可变状态交互
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究提出DocAtlas系统,将长文档理解视为可变状态交互,通过可变文档工具结合自改进检索等技术,在MMLongBench-Doc上用GPT-5.4达71.4%,还可提升紧凑型VLM智能体性能。
真实数据缩小光学化学结构识别中的合成到真实的差距
机构 * SES AI Corporation(SES AI公司)
专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.LG
AI总结 该研究针对光学化学结构识别中合成与真实数据的性能差距,通过微调不同视觉语言模型,发现标注真实训练数据可大幅提升性能,且模型与适配策略的选择需结合目标任务评估。
PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配
专题命中 文档图表理解 :vision-language model(title,abstract)
AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。
Comments Under Review
从诊断到修正:真实世界表格解析的基准测试与改进
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。
针对深度OCR系统的对抗攻击
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出首个针对生成式OCR视觉语言模型的纯黑盒对抗攻击,将其转化为零阶优化问题,在Deep-OCR上验证了攻击有效性并揭示解码器故障,还表明可控有目标改写更难实现。
DeltaPrompts: 逃离多模态蒸馏中的零delta陷阱
机构 * NVIDIA Research(NVIDIA研究院)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DeltaPrompts,通过量化教师与学生之间的答案分歧(Δ)来生成高分歧的推理问题,从而解决传统蒸馏中因零delta提示导致的学习信号不足问题,实验表明DeltaPrompts在多个场景下显著提升了模型性能。
SA-IQA: 重新定义空间美学的图像质量评估:多维奖励
机构 * Alibaba Group(阿里巴巴集团)
专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI
AI总结 SA-IQA通过多维奖励框架系统评估室内场景的美学质量,利用SA-BENCH基准提升AIGC生成流程和图像质量。
Comments Accepted to CVPRW 2026. Code: https://github.com/AlibabaResearch/SA-IQA
SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Ola Dimensions(奥拉维度公司)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);grounding(abstract);分类 cs.CV
AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。
无幻觉的GUI定位:基于无回归的布局感知匹配
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
AI总结 该研究提出无回归框架,通过解耦指令理解与布局感知定位,在ScreenSpot-Pro和Mind2Web数据集上显著提升GUI定位的准确率、成功率及元素选择率,抑制了坐标幻觉。
FitAQA:面向多模态大语言模型的健身动作质量评估基准
专题命中 GUI与屏幕智能体 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI
AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。
SAIN:面向移动机器人的、结合主动对话 grounding 的结构感知交互式导航
机构 * School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院) ; Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)
专题命中 GUI与屏幕智能体 :grounding(title,title_cn)
AI总结 本文提出SAIN零样本框架,将主动对话转化为持久导航状态,在VL-LN IIGN基准上提升了导航成功率与加权成功率,无需特定任务策略训练,验证了对话转状态机制的有效性。
Comments 8 pages, 4 figures, and 4 tables
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 GUI与屏幕智能体 :grounding(summary_cn,abstract_cn);MLLM(abstract_cn);分类 cs.CV
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
LookAgain:基于视觉反思的闭环GUI定位方法
专题命中 GUI与屏幕智能体 :grounding(title,abstract);分类 cs.CV
AI总结 本文针对现有GUI定位方法在小目标等场景性能骤降的问题,提出LookAgain闭环GUI定位器,通过预测后视觉反思的多轮过程结合SFT与GRPO训练,在相关基准上达到SOTA性能。
面向具身控制的动作与语言条件视频评估
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。
Comments 21 pages, 7 figures, Published in Sensors
Journal ref Sensors 26(16), 5046 (2026)
FronTalk: 以多模态反馈进行对话式代码生成的前端开发基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Duke University(杜克大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG
AI总结 提出FronTalk基准,通过多轮对话和多模态反馈(文本与视觉指令)评估前端代码生成,发现模型存在遗忘和视觉反馈理解困难,提出AceCoder方法有效减少遗忘并提升性能。
Comments CoLM 2026
NormAct:具身规划中隐藏社会规范遵守的基准
机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) ; China Academy of Information and Communications Technology(中国信息通信研究院) ; ShanghaiTech University(上海科技大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。
Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup
通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)
专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。
Journal ref Conference on Language Modeling (COLM) 2026
超越像素:探索面向基于大语言模型的智能体的DOM下采样
专题命中 GUI与屏幕智能体 :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出D2Snap算法对DOM下采样,解决原始DOM令牌占用过大的问题,经评估其在GPT-4o智能体上的成功率达73%,接近基于GUI快照的基线性能。
Comments 21 pages, LaTeX, print version; enhanced algorithm, settled on non-inferiority claim, added downsampling monotonicity and linearity results
UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Xiaomi(小米) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。
Comments Technical report. 27 pages, 7 figures, 7 tables
WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; EvoPhys AI(EvoPhys人工智能公司) ; Joy Future Academy, JD(京东探索研究院) ; The University of Sydney(悉尼大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。
Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/
重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角
机构 * Sichuan University(四川大学) ; Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :MLLM(abstract_cn);分类 cs.CV
AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。
融合UI结构与语义的面向特征的应用屏幕检索与聚类
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 该研究针对UI编程中代码与图形表示的抽象鸿沟,提出多模态神经符号嵌入技术FRAME,在三项基准测试中提升了屏幕检索与聚类的性能,可增强自动化UI设计与测试工具。
Comments 12 pages, 8 figures, 6 tables. Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Benevento, Italy
恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术
专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。
CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合
机构 * University of California, Irvine(加利福尼亚大学欧文分校)
专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI
AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。
用于抑制视觉语言模型幻觉的维纳表示滤波
机构 * Tel Aviv University(特拉维夫大学)
专题命中 幻觉与鲁棒性 :VLM(title);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。