arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-15 至 2026-04-15 共收录 60 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2604.12237 2026-04-15 cs.LG cs.AI cs.CL 62%

MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization

MolMem:基于记忆的代理强化学习用于样本高效的分子优化

Ziqing Wang, Yibo Wen, Abhishek Pandy, Han Liu, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MolMem通过双记忆系统提升分子优化的样本效率,利用静态示例记忆和进化技能记忆,实现90%的成功率和52%的多属性任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12551 2026-04-15 cs.CV 57%

Cross-Attentive Multiview Fusion of Vision-Language Embeddings

多视图交叉注意力的视觉-语言嵌入融合

Tomas Berriel Martins, Martin R. Oswald, Javier Civera

机构 * University of Zaragoza, Spain(阿拉贡大学,西班牙) University of Amsterdam, Netherlands(阿姆斯特丹大学,荷兰)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种多视图Transformer架构,通过跨视图视觉-语言描述符进行注意力融合,提升3D语义和实例分类性能,同时利用多视图一致性作为自监督信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 57%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08410 2026-04-15 cs.CV cs.RO 57%

BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields

BLaDA: 在3DGS场域中实现语言到功能灵巧动作的桥梁

Fan Yang, Wenrui Chen, Guorun Yan, Ruize Liao, Wanjun Jia, Dongsheng Luo, Jiacheng Lin, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Key Laboratory of Advanced Manufacturing Technology of the Ministry of Education, Guizhou University(教育部贵州大学先进制造技术重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 BLaDA提出一个可解释的零样本框架,通过解析自然语言为结构化的六元组操作约束,结合三角功能点定位模块和3D关键点抓取矩阵转换执行模块,实现功能灵巧操作的高精度和高成功率。

Comments Code will be publicly available at https://github.com/PopeyePxx/BLaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12776 2026-04-15 cs.CL 50%

EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution

EvoSpark:内生交互代理社会的统一长周期叙述进化

Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoSpark通过内生交互代理社会框架,解决LLM多代理系统中长周期叙述演化的矛盾,通过分层叙述记忆和生成场景机制实现逻辑一致的持续叙事。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08196 2026-04-15 astro-ph.IM astro-ph.GA astro-ph.HE 50%

A Statistical-AI Framework for Detecting Transient Flares in SDSS Stripe 82 Quasar Light Curves

基于统计-人工智能框架的SDSS Stripe 82类星体光变曲线暂Transient耀斑检测

Atal Agrawal

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 本文提出FLARE框架,通过物理信息学习、异常评分和识别引擎检测暂Transient耀斑,利用EVT进行异常评分,并验证候选者。

Comments 22 pages, 20 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2604.12978 2026-04-15 cs.CL cs.CV 57%

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

GlotOCR Bench: OCR模型在超过少数Unicode脚本之外仍面临困难

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) MCML Sorbonne Université & CNRS, ISIR(索邦大学与CNRS,ISIR)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 GlotOCR Bench评估OCR在100+Unicode脚本上的泛化能力,发现大多数模型在少于十种脚本上表现良好,最强模型也难以泛化到三十种以上脚本,表明当前OCR系统依赖语言模型预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 6 篇

2602.11236 2026-04-15 cs.CV cs.CL cs.RO 70%

ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning

ABot-M0:基于动作流形学习的机器人操控VLA基础模型

Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Dekang Qi, Junjin Xiao, Haoyun Liu, Ronghan Chen, Yuzhi Chen, Dongjie Huo, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 ABot-M0通过统一预训练和动作流形学习,提升机器人操控的泛化能力与效率,构建了大规模数据集并支持模块化感知。

Comments Project website: https://amap-cvlab.github.io/ABot-Manipulation/ . Code: https://github.com/amap-cvlab/ABot-Manipulation . 22 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05295 2026-04-15 cs.AI cs.CV 62%

WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces

WebChain:一个大规模的人工标注的真实世界网页交互轨迹数据集

Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong

机构 * Fudan University(复旦大学) IMean AI WebAgentLab

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WebChain数据集,包含31,725条轨迹和318k步,通过视觉、结构和动作数据的三元对齐提供多模态监督,提出双中层训练方法,实现了WebChainBench等公开GUI基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24168 2026-04-15 cs.AI 57%

MGA: Memory-Driven GUI Agent for Observation-Centric Interaction

MGA:基于记忆的GUI代理用于以观察为中心的交互

Weihua Cheng, Junming Liu, Yifei Sun, Botian Shi, Yirong Chen, Ding Wang

机构 * Shanghai Tech University(上海科技大学) Tongji University(同济大学) East China University of Science and Technology(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 MGA通过解耦长周期轨迹和结构化状态记忆机制,减少认知负担和系统复杂度,实现高效的GUI自动化。

Comments Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10073 2026-04-15 cs.CR cs.CV 57%

SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents

SecureWebArena: 一个针对基于大视觉-语言模型的Web代理的综合安全评估基准

Zonghao Ying, Yangguang Shao, Jianle Gan, Gan Xu, Wenxin Zhang, Quanchen Zou, Junzheng Shi, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * SKLCCSE, Beihang University(北京航空航天大学安全实验室) Institute of Information Engineering, CAS(中国科学院信息工程研究所) China University of Petroleum (East China)(中国石油大学(华东)) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Science(中国科学院大学) AI Security Lab(360人工智能安全实验室) The University of Sydney(悉尼大学) Henan University of Science and Technology(河南理工大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SecureWebArena,首个针对基于大视觉-语言模型的Web代理安全性的综合评估基准,通过六个真实模拟的Web环境和2970条高质量轨迹,分析代理在内部推理、行为轨迹和任务结果三个维度上的安全风险。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12831 2026-04-15 cs.RO 50%

VULCAN: Vision-Language-Model Enhanced Multi-Agent Cooperative Navigation for Indoor Fire-Disaster Response

VULCAN:基于视觉-语言模型的多智能体协作导航用于室内火灾应急响应

Shengding Liu, Qiben Yan

机构 * Computer Science \& Engineering Michigan State University East Lansing, MI, USA

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出VULCAN框架,结合多模态感知与视觉语言模型,解决火灾环境下多智能体协作导航的挑战,通过模拟真实火灾场景评估现有方法的失效模式,强调鲁棒感知与危险意识规划的重要性。

Comments INFOCOM EIN Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 50%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2604.12115 2026-04-15 cs.CV 83%

HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models

HTDC: 通过犹豫触发的微分校准缓解大视觉-语言模型中的幻觉

Xinyun Liu

机构 * Sichuan University(四川大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出HTDC,一种无需训练的解码框架,通过检测层间犹豫信号,仅在易出错步骤激活校准,有效抑制幻觉并保持任务准确性。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10200 2026-04-15 cs.AI cs.CV 81%

Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts

Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见

Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所) Faculty of Education, East China Normal University(东华师范大学教育学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Edu-MMBias基准,通过三级维度审计视觉-语言模型中的社会偏见,揭示模型存在补偿性类偏见和深层健康与种族刻板印象,视觉输入可触发偏见回潮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12944 2026-04-15 cs.CV cs.AI 62%

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

扭曲或伪造?视频大语言模型中幻觉的调查

Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

机构 * Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系) Khoury College of Computer Science, Northeastern University(东北大学科赫里计算机科学学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文调查视频大语言模型中的幻觉问题,提出动态扭曲和内容伪造两大类,分析其成因并提出改进方向,如开发运动感知视觉编码器和整合反事实学习技术。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV 62%

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12700 2026-04-15 cs.AI 57%

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

MISID:一种多模态多轮对话数据集,用于战略欺骗游戏中复杂意图识别

Shufang Lin, Muyang Chen, Xiabing Zhou, Rongrong Zhang, Dayou Zhang, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MISID数据集,用于复杂战略欺骗游戏中多模态多轮对话的意图识别,通过系统评估发现现有多模态大语言模型在复杂场景中存在缺陷,并提出FRACTAM框架提升性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 12 篇

2604.12119 2026-04-15 cs.CV cs.LG 89%

Beyond Perception Errors: Semantic Fixation in Large Vision-Language Models

超越感知误差:大型视觉-语言模型中的语义固定

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究发现大型视觉-语言模型在面对提示指定的替代映射时,倾向于保留默认解释,通过VLM-Fix基准测试揭示了语义固定现象,且通过训练和激活调整可部分修复误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12767 2026-04-15 cs.CV cs.AI 86%

CLASP: Class-Adaptive Layer Fusion and Dual-Stage Pruning for Multimodal Large Language Models

CLASP:面向多模态大语言模型的类适应层融合与双阶段剪枝

Yunkai Dang, Yizhu Jiang, Yifan Jiang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence Science and Technology(人工智能科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 CLASP通过类适应层融合和双阶段剪枝,实现多模态大语言模型中视觉token的高效减少,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19820 2026-04-15 cs.CV cs.AI cs.CL cs.LG 86%

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception

CropVLM: 为细粒度视觉语言感知学习动态聚焦

Miguel Carvalho, Helder Dias, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CropVLM通过强化学习提升VLM在细粒度图像理解任务中的性能,无需人工标注或合成数据,有效增强模型对细节的捕捉能力。

Comments Accepted to the GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI 81%

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05546 2026-04-15 cs.CL 78%

Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects

大型视觉-语言模型高效推理:瓶颈、技术与前景

Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

AI总结 本文系统分析了大型视觉-语言模型推理中的效率瓶颈,提出基于推理生命周期的分类技术,探讨了信息密度、长上下文注意力管理和内存限制的平衡,并展望了未来四个前沿方向。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 77%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13021 2026-04-15 cs.CV cs.AI 76%

Representation geometry shapes task performance in vision-language modeling for CT enterography

表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用

Cristian Minoccheri, Emily Wittrup, Kayvan Najarian, Ryan Stidham

机构 * Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门) Department of Gastroenterology(消化内科部门) Department of Emergency Medicine(急诊医学部门) Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文研究了CT结肠镜视觉-语言迁移学习,发现均值池化在疾病分类中表现更优,而注意力池化在跨模态检索中更有效,同时指出单片组织对比度比空间覆盖范围更重要,为构建体积医学影像视觉-语言系统提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 75%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 57%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 57%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12012 2026-04-15 cs.CV 57%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12179 2026-04-15 cs.CL cs.IR 50%

AgenticAI-DialogGen: Topic-Guided Conversation Generation for Fine-Tuning and Evaluating Short- and Long-Term Memories of LLMs

AgenticAI-DialogGen:基于主题引导的对话生成用于微调和评估LLM的短期和长期记忆

Manoj Madushanka Perera, Adnan Mahmood, Kasun Eranda Wijethilake, Quan Z. Sheng

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出AgenticAI-DialogGen框架,通过生成基于角色和主题的对话来微调和评估LLM的短期和长期记忆,引入了TopicGuidedChat数据集以提升对话质量和模型性能。

Comments 13 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏