arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-03 至 2026-06-03 共收录 82 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 17 篇

2606.02661 2026-06-03 eess.IV cs.AI cs.LG 62%

Learning to Refine: Spectral-Decoupled Iterative Refinement Framework for Precipitation Nowcasting

学习细化:用于降水临近预报的频谱解耦迭代细化框架

Yunlong Zhou, Chen Zhao, Danyang Peng, Fanfan Ji, Xiao-Tong Yuan

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出频谱解耦迭代细化框架(SDIR),通过双路径设计(SFG-Former和FR-Refiner)和物理一致功率谱密度损失,在确定性框架中实现降水临近预报的渐进频率解耦细化,消除模糊和幻觉,在空间精度和频谱保真度上超越现有方法。

Comments 21 pages, 10 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03453 2026-06-03 cs.CR cs.AI cs.MA 57%

FORGE: Multi-Agent Graduated Exploitation and Detection Engineering

FORGE:多智能体渐进式利用与检测工程

Farooq Shaikh

机构 * Dynatrace

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出多智能体系统FORGE,通过渐进式利用深度桥接漏洞利用生成、优先级排序和检测规则工程三个孤立领域,在603个CVE上实现67.8%的端到端L1+利用,并生成低误报的Sigma和Snort检测规则。

Comments 18 pages, 4 figures, 3 tables. Accepted at the AgentCy Workshop at the 21st International Conference on Availability, Reliability and Security (ARES 2026). Keywords: Vulnerability assessment, Multi-agent systems, Exploit generation, Detection engineering, Risk prioritization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02866 2026-06-03 cs.AI cs.CL cs.MA 57%

When Helping Hurts and How to Fix It: Multi-Agent Debate for Data Cleaning

当帮助有害时以及如何修复:多智能体辩论用于数据清洗

Chirag Parmar, Akshat Mehta, Henglin Wu, Jagadish Ramamurthy, Shweta Medhekar

机构 * Meta Platforms, Inc.(Meta公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究多智能体辩论在数据清洗中的效果,发现其会降低生成性能但提升错误检测,通过推导辩论收益条件并采用对抗性分离的辩论配置,首次在生成任务上显著超越单智能体。

Comments 27 pages, 4 figures, 12 tables. Includes appendix with full experimental results, prompt templates, and dataset statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02745 2026-06-03 cs.RO cs.LG 57%

SeeTraceAct: Visibility-Aware Latent Planning from Cross-Embodiment Demonstration Videos

SeeTraceAct: 跨具身演示视频中的可见性感知潜在规划

Jaehyeon Son, Junhyun Kim, Kyle Kam, Jeremiah Coholich, Seok Joon Kim, Jinhoo Kim, Chris Dongjoo Kim, Jaemin Cho, Dieter Fox, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院) Allen Institute for AI(Allen人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出SeeTraceAct框架,通过可见性感知的未来末端执行器轨迹预测增强空间定位,实现基于单次跨具身演示视频的机器人策略泛化,在模拟和真实场景中取得最优成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02584 2026-06-03 cs.CL cs.AI cs.IR 57%

IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation

IdiomX:习语理解、检索和解释的多语言基准

Ayman Ali Sharara

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出IdiomX,一个大规模多语言习语基准,通过可复现的多阶段流水线构建,涵盖190K+上下文示例和12K+习语,定义四项任务(检测、上下文-习语检索、阿拉伯语-英语习语检索、习语解释),实验表明上下文Transformer模型提升检测,混合检索重排序增强单语和跨语言检索,习语解释可建模为语义检索任务。

Comments 12 pages, 21 figures. Includes dataset and code. Resources available on HuggingFace, Kaggle, and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02581 2026-06-03 cs.IR cs.AI 57%

Cost-Aware Query Routing in RAG: Empirical Analysis of Retrieval Depth Tradeoffs

RAG中的成本感知查询路由:检索深度权衡的实证分析

Sanjay Mishra

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出CA-RAG框架,通过为每个查询选择最优的检索深度和生成配置组合,在保证答案质量的同时减少令牌成本和延迟。

Comments 13 pages , 18 figures , 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08767 2026-06-03 cs.AI 57%

From Holo Pockets to Electron Density: GPT-style Drug Design with Density

从全息口袋到电子密度:基于密度的GPT式药物设计

Jiahao Chen, Letian Gao, Yanhao Zhu, Wenbiao Zhou, Bing Su, Zhi John Lu, Bo Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出EDMolGPT,一种利用低分辨率电子密度作为物理条件进行从头药物设计的自回归框架,通过密度点云生成分子,减轻结构偏差并产生3D构象。

Comments Published as a conference paper in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15851 2026-06-03 cs.CV 57%

ResCLIP: Residual Attention for Training-free Dense Vision-language Inference

ResCLIP: 用于无训练密集视觉-语言推理的残差注意力

Yuhang Yang, Jinhong Deng, Wen Li, Lixin Duan

机构 * University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出残差交叉相关自注意力模块和语义反馈精炼模块,利用中间层交叉相关注意力重组空间信息,提升CLIP在密集预测任务中的性能。

Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference. 2025: 29968-29978

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03247 2026-06-03 cs.CL cs.IR 50%

Structures Facilitate Retrieve, Rerank, and Generate

结构促进检索、重排序和生成

Yeqin Zhang, Haomin Fu, Xujie Zhang, Cam-Tu Nguyen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出SF-Re2G方法,通过利用文档结构信息改进段落表示、构建结构增强的重排序器并融入子图上下文,以提升文档对话系统的检索、重排序和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03132 2026-06-03 cs.CL 50%

DMT-CBT: Longitudinal Therapeutic State Modeling for CBT Counseling

DMT-CBT:面向CBT咨询的纵向治疗状态建模

Chang Liu, Shuyi Zhang, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(信息科学与工程学院,兰州大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出DMT-CBT框架,通过跨会话结构化治疗状态、多模态行为基础与工具增强干预,解决现有方法将CBT咨询简化为局部回复生成的问题,实现纵向治疗状态动态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12574 2026-06-03 cs.IR 50%

Uncovering Competing Poisoning Attacks in Retrieval-Augmented Generation

揭示检索增强生成中的竞争性投毒攻击

Liuji Chen, Xiaofang Yang, Yuanzhuo Lu, Jinghao Zhang, Xin Sun, Qiang Liu, Shu Wu, Jing Dong, Liang Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对检索增强生成系统,研究多个攻击者同时投毒以争夺同一查询目标的问题,提出竞争有效性指标和PoisonArena框架。

Comments Accepted by KDD 2026. Project page: https://poison-arena.github.io/

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 6 篇

2606.02747 2026-06-03 cs.CV cs.AI 82%

Plan2Map: A Multimodal Benchmark for Document-Grounded Geospatial Boundary Reconstruction from Planning Records

Plan2Map: 基于规划记录的文档驱动地理空间边界重建的多模态基准

Fabian Degen, Oishi Deb, Jindong Gu, Junchi Yu, Samuele Marro, Philip Torr, Jialin Yu

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出Plan2Map基准和GeoPlanAgent系统,通过文档证据提取、定位、地图配准、边界分割等步骤,从英国规划记录中重建地理空间边界,显著优于直接VLM方法。

Comments Project page: https://odeb1.github.io/Plan2Map_Project_Page/. Fabian Degen and Oishi Deb Contributed Equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18160 2026-06-03 cs.CV cs.AI 81%

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former:在多模态大语言模型中维持视觉一致性

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Zhejiang University of Science and Technology(浙江理工大学)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20731 2026-06-03 cs.CV cs.AI stat.AP 73%

TASTE: A Designer-Annotated Multi-Dimensional Preference Dataset for AI-Generated Graphic Design

TASTE:一个由设计师标注的AI生成图形设计多维偏好数据集

Haonan Zhu, Elad Hirsch, Alexandria Minetti, Allison Nulty, Purvanshi Mehta

机构 * Lica World(Lica世界) Contra.Work Inc.(Contra.Work公司)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对现有偏好数据集仅提供单一整体评价的不足,本文构建了TASTE多维偏好数据集,由两组专业设计师对四个文本到图像模型的输出按九项标准排序,并提出了无准则信号验证框架和偏好模型基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02915 2026-06-03 cs.CV 70%

Any2Poster: Any-Source Poster Generation Across Modalities and Domains

Any2Poster: 跨模态和领域的任意源海报生成

Amogh Vinaykumar, Aiden Li, Suozhi Huang, Shilong Liu

机构 * Flower Mound High School(弗洛拉穆恩高中) University College London(伦敦大学学院) Princeton University(普林斯顿大学)

专题命中 文档图表理解 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Any2Poster Bench基准和Any2Poster Agent智能体,实现从多种输入模态和领域生成海报,并通过基于测验和视觉评估的方法验证信息保真度和视觉传达效果。

Comments Project Page: https://github.com/Any2Poster/Any2Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10888 2026-06-03 cs.CV 70%

PubTables-v2: A new large-scale dataset for full-page and multi-page table extraction

PubTables-v2: 一个新的用于全页和多页表格提取的大规模数据集

Brandon Smock, Valerie Faucon-Morin, Max Sokolov, Libin Liang, Tayyibah Khanam, Amrit Ramesh, Maury Courtland

机构 * Kensho Technologies(Kensho技术公司)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对全页和多页表格提取任务缺乏标注数据的问题,本文创建了大规模数据集PubTables-v2,并评估了当前前沿模型与小模型在不同上下文级别任务上的性能差异。

Comments 28 pages, separated POTATR to its own paper, added frontier model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03264 2026-06-03 cs.CV 57%

PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training

PaddleOCR-VL-1.6:通过欠优化区域精炼和渐进式后训练扩展文档解析前沿

Zelun Zhang, Hongen Liu, Suyin Liang, Yubo Zhang, Yiqing Xiang, Jiaxuan Liu, Ting Sun, Manhui Lin, Yue Zhang, Changda Zhou, Tingquan Gao, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV

AI总结 提出PaddleOCR-VL-1.6,通过区域感知数据优化框架识别并增强前代模型的薄弱区域,结合渐进式后训练策略,在OmniDocBench v1.6上达到96.33%的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2606.03509 2026-06-03 cs.CV 70%

EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation

EvoMemNav: 用于零样本具身导航的高效自进化细粒度记忆

Zuhao Ge, Xiaosong Jia, Chao Wu, Yuchen Zhou, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出EvoMemNav框架,通过构建视觉-语义记忆图并采用预算驱动的粗到细策略,结合反射驱动写回机制,实现零样本具身导航中高效、自进化的细粒度记忆,提升多实例区分和停止验证性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30915 2026-06-03 cs.CV 57%

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent

DiTTo: 可扩展的排序感知全能图像修复智能体

Seungho Choi, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) David S. Hippocampus Department of Computer Science Cranberry-Lemon University(Cranberry-Lemon 大学 计算机科学系 Hippocampus 教授)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 提出DiTTo框架,通过模拟器高效构建最优修复轨迹数据集,并采用排序感知对齐实现修复专家的即插即用扩展,在多退化图像修复中达到最优性能。

Comments Please visit our project page at https://cmlab-korea.github.io/DiTTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12430 2026-06-03 cs.MA cs.AI 57%

Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward

大型语言模型的智能体技能:架构、获取、安全与未来路径

Renjun Xu, Yang Yan

机构 * ReDiscovery Hangzhou China(杭州ReDiscovery研究院) Westlake University Hangzhou China(西交大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

AI总结 本文综述了大型语言模型智能体技能的研究,涵盖架构基础(如SKILL.md规范、渐进式上下文加载)、技能获取(强化学习、自主发现、组合合成)、大规模部署(计算机使用智能体栈、GUI接地)以及安全挑战(26.1%社区技能含漏洞),并提出技能信任与生命周期治理框架。

Comments Accepted by Agent Skills '26 Workshop at ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03682 2026-06-03 cs.RO 50%

GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation

GN0:迈向视觉语言导航中生成、评估与策略学习的统一范式

Xinhai Li, Xiaotao Zhang, Yuehao Huang, Jiankun Dong, Tianhang Wang, Sunyao Zhou, Yunzi Wu, Chengnuo Sun, Yunfei Ge, Qizhen Weng, Chi Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(人工智能研究院,中国电信) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tongji University(同济大学) Fudan University(复旦大学) Jiangsu University(江苏大学)

专题命中 GUI与屏幕智能体 :VLM(abstract_cn)

AI总结 提出GN0统一框架,通过自动生成大规模导航数据集GN-Matrix、基于3DGS的高保真仿真平台和BEV基准GN-Bench,结合RL驱动的导航基础模型BAE,在VLN任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2606.02947 2026-06-03 cs.LG cs.CV 81%

BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

BYORn:自举你的响应以防御大型视觉-语言模型的后门攻击

Ivan Sabolić, Marin Oršić, Josip Šarić, Sven Lončarić

机构 * University of Rijeka(里耶卡大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出BYORn框架,通过识别并替换语义不合理的后门目标响应,打破触发器与目标输出的关联,从而在保持干净任务性能的同时提升对后门攻击的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01624 2026-06-03 cs.CV cs.SE 70%

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

下一步测试什么:驾驶视觉语言模型中可解释的覆盖缺口发现

Abhishek Aich, Sparsh Garg, Vijay Kumar BG, Turgun Yusuf Kashgari, Manmohan Chandraker

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出 SliceScorer 和 SliceNav 方法,通过结合暴露先验和邻居失败先验的确定性评分规则,在驾驶视觉语言模型中有效发现高风险覆盖缺口,并支持可解释和可审计的验证流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03678 2026-06-03 cs.AI 57%

EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents

EvoDrive: 通过自我改进的LLM智能体实现安全关键自动驾驶的帕累托进化

Tong Nie, Yuewen Mei, Yihong Tang, Junlin He, Jie Deng, Jian Sun, Wei Ma

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 提出EvoDrive,首个基于LLM的自动化智能体进化框架,通过模拟器接地演员-评论家架构和帕累托存档,在安全关键场景生成中实现对抗性与真实性的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03556 2026-06-03 cs.RO 50%

Partially Observable Adversarial Patch Attacks on Vision-Language-Action Models in Robotics

部分可观测的对抗性补丁攻击在机器人视觉-语言-动作模型上的应用

Xiaofei Wang, Mingliang Han, Tianyu Hao, Yi Yang, Yun-Bo Zhao, Keke Tang

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) SmartMore Corporation(SmartMore公司) Cyberspace Institute of Advanced Technology, Guangzhou University(广西亚技术空间研究所,广州大学) th Medical Center of Chinese PLA General Hospital(中国人民解放军总医院第八医学中心) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 针对机器人VLA模型,提出部分可观测威胁模型下的两阶段攻击框架,利用注意力图定位关键区域并优化补丁以破坏语义接地和增加动作轨迹曲率,导致长期任务失败。

Comments Accepted by IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03179 2026-06-03 cs.CL 50%

HyperPatch: Sequential Knowledge Editing Under n-ary Structural Drift

HyperPatch: n元结构漂移下的顺序知识编辑

Yu-Kai Chan, Wen-Sheng Lien, Dong-Ting Yao, Bo-Kai Ruan, Kwan-Yeung Lin, Hong-Han Shuai, Meng-Fen Chiang

机构 * National Yang Ming Chiao Tung University

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 针对非平稳环境中n元事件顺序更新引发的结构漂移问题,提出HyperPatch框架,通过超图流形上的稳定性建模,实现参数保留的知识编辑,在MQuAKE-CF和MQuAKE-T基准上分别取得96.24%和21.06%的跳步准确率相对提升。

Comments Accepted to Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 22 篇

2606.03075 2026-06-03 cs.CV 87%

TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

TGV-KV:面向视觉语言模型的文本引导KV驱逐方法

Jizhihui Liu, Ruizi Han, Miao Zhang, Rui Shao, Xuebo Liu, Weili Guan, Yaowei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型中视觉信息冗余导致的KV缓存内存消耗问题,提出基于文本引导的KV驱逐方法TGV-KV,通过文本-视觉预算分配、文本加权排序和文本优先保留策略,在保持高精度的同时显著提升推理吞吐量。

Comments Accepted by ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 84%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16816 2026-06-03 cs.RO 83%

"I'm Not Mad, Just Focused'': Understanding Human Emotions in Human-Robot Collaboration

“我没生气,只是专注”:理解人机协作中的人类情绪

Seung Chan Hong, Dana Kulić, Leimin Tian

机构 * Faculty of Engineering, Monash University(莫纳什大学工程学院) CSIRO Robotics(CSIRO机器人实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract)

AI总结 提出基于视觉语言模型(VLM)的情绪识别系统,利用上下文理解改善人机协作中的情绪解读,实验表明其语义相似性和情感对齐优于基线CNN系统,且用户偏好情绪自适应机器人行为。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8260-8267, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05852 2026-06-03 cs.CV 83%

Interpretable Modeling of Driver Attention Shifts with a Vision-Language Model

基于视觉-语言模型的驾驶员注意力转移可解释建模

Kaiser Hamid, Khandakar Ashrafi Akbar, Peihang Li, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Towson University(托森大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过少量人工监督微调视觉-语言模型,生成可解释的驾驶员注意力转移描述,以补充传统注视热图,提升人因分析、监控和态势感知支持。

详情

展开后加载摘要…

URL PDF HTML 收藏