arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-23 至 2026-07-23 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2607.19528 2026-07-23 cs.CV cs.AI 新提交 79%

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19547 2026-07-23 cs.CV eess.IV 新提交 57%

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合

Santiram Tiwari, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏