arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-30 至 2026-03-30 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2603.26349 2026-03-30 stat.ML cs.AI cs.LG 79%

Generative Score Inference for Multimodal Data

多模态数据生成分数推断

Xinyu Tian, Xiaotong Shen

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出生成分数推断(GSI)框架,通过深度生成模型生成合成样本近似条件分数分布,提升多模态学习中的不确定性量化能力,在大语言模型幻觉检测和图像描述不确定性估计中取得最佳性能。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26015 2026-03-30 cs.CV cs.AI 62%

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

VLAgeBench: 大视觉-语言模型在零样本人类年龄估计中的基准测试

Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

机构 * Begum Rokeya University, Rangpur(贝古姆·罗基亚大学,朗布尔) American International University - Bangladesh(美国国际大学-孟加拉国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAgeBench,评估大视觉-语言模型在零样本人类年龄估计中的性能,展示通用LVLM在无微调情况下表现优异,揭示图像质量和人口子群体差异对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 57%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02898 2026-03-30 cs.CV 57%

One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework

一个补丁即可描述它们全部:一种统一的零样本描述框架

Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi

机构 * ISTI-CNR, Italy(意大利国家研究委员会信息科学与技术研究所) University of Pisa, Italy(比萨大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种统一的零样本描述框架,从图像中心转向补丁中心范式,使能描述任意区域而不需区域级监督。通过将单个补丁视为原子描述单元,实现对任意区域的描述,实验表明有意义的密集视觉特征对多区域描述任务至关重要。

Comments IEEE CVF Conference on Computer Vision and Pattern Recognition 2026. Project page with code, models and examples: https://paciosoft.com/Patch-ioner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02569 2026-03-30 cs.HC cs.RO 50%

Reframing Human-Robot Interaction Through Extended Reality: Unlocking Safer, Smarter, and More Empathic Interactions with Virtual Robots and Foundation Models

通过扩展现实重新定义人机交互:利用虚拟机器人和基础模型实现更安全、更智能和更具同理心的交互

Yuchong Zhang, Yong Ma, Danica Kragic

机构 * Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习部) Department of Clinical Medicine, University of Bergen(卑尔根大学临床医学系)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨通过扩展现实技术,利用基础模型驱动的虚拟机器人实现更安全、智能和具同理心的人机交互,同时讨论多模态大模型在认知和情感交互中的应用及潜在风险。

Comments This paper is under review

Journal ref Empathic Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏