arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-15 至 2026-04-15 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2604.12424 2026-04-15 cs.CL cs.AI cs.CV 86%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12346 2026-04-15 cs.CV 85%

Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization

解锁 grounding dino 在视频中的潜力:针对小数据空间-时间定位的参数高效适应

Zanyi Wang, Fan Li, Dengyang Jiang, Liuzhuozheng Li, Yunhua Zhong, Guang Dai, Mengmeng Wang

机构 * SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室,国家电网公司) University of HongKong(香港大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出ST-GD框架,通过冻结基础模型并注入轻量适配器,有效解决小数据下的视频空间时间定位问题,在HC-STVG v1/v2基准和VidSTG数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12387 2026-04-15 q-bio.GN 80%

oxo-call: Documentation-grounded Skill Augmentation for Accurate Bioinformatics Command-line Generation with Large Language Models

oxo-call:基于文档的技能增强用于准确的生物信息学命令行生成与大型语言模型

Yun Peng, Yujun Sun, Jia Ding, Bin Yan, Zhangyu Wang, Chunyang Wang, Chenyang Shu, Jian-Guo Zhou, Shixiang Wang

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract)

AI总结 oxo-call通过文档优先 grounding 和精选技能增强策略,提升生物信息学命令行生成的准确性,提供150+内置技能和可扩展的流程引擎。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12357 2026-04-15 cs.AI cs.CV 79%

ReflectCAP: Detailed Image Captioning with Reflective Memory

ReflectCAP: 基于反思记忆的详细图像描述

Kyungmin Min, Minbeom Kim, Kang-il Lee, Seunghyun Yoon, Kyomin Jung

机构 * IPAI, Seoul National University(首尔国立大学IPAI) Dept. of ECE, Seoul National University(首尔国立大学电子与计算机工程系) Adobe Research(Adobe研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);InternVL(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 ReflectCAP通过反思笔记指导生成详细且准确的图像描述,平衡事实性和覆盖性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12508 2026-04-15 cs.CV 70%

From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception

从衰减到注意:用于细粒度视觉感知的变分信息流操控

Jilong Zhu, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院(ICT/CAS)) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院(ICT/CAS)) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出变分信息流框架,通过建模问题-答案对相关的视觉显著性作为潜在分布,解决多模态大语言模型在细粒度感知任务中的信息衰减问题,提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12440 2026-04-15 cs.CV cs.AI 62%

IAD-Unify: A Region-Grounded Unified Model for Industrial Anomaly Segmentation, Understanding, and Generation

IAD-Unify:一种基于区域的统一模型用于工业异常分割、理解和生成

Haoyu Zheng, Tianwei Lin, Wei Wang, Zhuonan Wang, Wenqiao Zhang, Jiaqi Zhu, Feifei Shao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IAD-Unify模型,通过双重编码框架实现工业异常的分割、理解和生成,构建了统一的评估平台,并展示了其在跨类别泛化上的强大性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12237 2026-04-15 cs.LG cs.AI cs.CL 62%

MolMem: Memory-Augmented Agentic Reinforcement Learning for Sample-Efficient Molecular Optimization

MolMem:基于记忆的代理强化学习用于样本高效的分子优化

Ziqing Wang, Yibo Wen, Abhishek Pandy, Han Liu, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MolMem通过双记忆系统提升分子优化的样本效率,利用静态示例记忆和进化技能记忆,实现90%的成功率和52%的多属性任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12551 2026-04-15 cs.CV 57%

Cross-Attentive Multiview Fusion of Vision-Language Embeddings

多视图交叉注意力的视觉-语言嵌入融合

Tomas Berriel Martins, Martin R. Oswald, Javier Civera

机构 * University of Zaragoza, Spain(阿拉贡大学,西班牙) University of Amsterdam, Netherlands(阿姆斯特丹大学,荷兰)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种多视图Transformer架构,通过跨视图视觉-语言描述符进行注意力融合,提升3D语义和实例分类性能,同时利用多视图一致性作为自监督信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11201 2026-04-15 cs.CL cs.AI 57%

CocoaBench: Evaluating Unified Digital Agents in the Wild

CocoaBench:评估真实世界的统一数字代理

CocoaBench Team, Shibo Hao, Zhining Zhang, Zhiqi Liang, Tianyang Liu, Yuheng Zha, Qiyue Gao, Jixuan Chen, Zilong Wang, Zhoujun Cheng, Haoxiang Zhang, Junli Wang, Hexi Jin, Boyuan Zheng, Kun Zhou, Yu Wang, Feng Yao, Licheng Liu, Yijiang Li, Zhifei Li, Zhengtao Han, Pracha Promthaw, Tommaso Cerruti, Xiaohan Fu, Ziqiao Ma, Jingbo Shang, Lianhui Qin, Julian McAuley, Eric P. Xing, Zhengzhong Liu, Rupesh Kumar Srivastava, Zhiting Hu

机构 * CocoaBench Team(CocoaBench 团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 CocoaBench评估统一数字代理在多样化场景中的表现,通过人类设计的长周期任务测试其视觉、搜索和编码能力的灵活组合,发现当前代理在推理、规划和视觉理解方面仍有较大提升空间。

Comments Project page: https://cocoabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08410 2026-04-15 cs.CV cs.RO 57%

BLaDA: Bridging Language to Functional Dexterous Actions within 3DGS Fields

BLaDA: 在3DGS场域中实现语言到功能灵巧动作的桥梁

Fan Yang, Wenrui Chen, Guorun Yan, Ruize Liao, Wanjun Jia, Dongsheng Luo, Jiacheng Lin, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Key Laboratory of Advanced Manufacturing Technology of the Ministry of Education, Guizhou University(教育部贵州大学先进制造技术重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 BLaDA提出一个可解释的零样本框架,通过解析自然语言为结构化的六元组操作约束,结合三角功能点定位模块和3D关键点抓取矩阵转换执行模块,实现功能灵巧操作的高精度和高成功率。

Comments Code will be publicly available at https://github.com/PopeyePxx/BLaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12776 2026-04-15 cs.CL 50%

EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution

EvoSpark:内生交互代理社会的统一长周期叙述进化

Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoSpark通过内生交互代理社会框架,解决LLM多代理系统中长周期叙述演化的矛盾,通过分层叙述记忆和生成场景机制实现逻辑一致的持续叙事。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08196 2026-04-15 astro-ph.IM astro-ph.GA astro-ph.HE 50%

A Statistical-AI Framework for Detecting Transient Flares in SDSS Stripe 82 Quasar Light Curves

基于统计-人工智能框架的SDSS Stripe 82类星体光变曲线暂Transient耀斑检测

Atal Agrawal

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 本文提出FLARE框架,通过物理信息学习、异常评分和识别引擎检测暂Transient耀斑,利用EVT进行异常评分,并验证候选者。

Comments 22 pages, 20 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏