arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-05 至 2026-08-05 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 22 篇

2603.08199 2026-08-05 cs.CV cs.RO 版本更新 70%

Fusion-Poly: A Polyhedral Framework Based on Spatial-Temporal Fusion for 3D Multi-Object Tracking

Fusion-Poly: 一种基于时空融合的多边形框架用于3D多目标跟踪

Xian Wu, Yitao Wu, Xiaoyu Li, Zijia Li, Lijun Zhao, Lining Sun

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人与系统国家重点实验室,哈尔滨工业大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Fusion-Poly通过整合异步LiDAR和相机数据,提出一种时空融合框架,提升3D多目标跟踪的轨迹一致性与更新频率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03023 2026-08-05 cs.CV cs.AI 新提交 62%

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

用于遥感领域无需训练的开放词汇语义分割的独立DINOv3模型

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对遥感语义分割标注成本高的问题,提出无需训练的DinoSplat-OV框架,结合DINOv3的文本感知拉普拉斯传播与高斯溅射上采样模块,在多数据集上取得优于现有方法的性能,填补了DINO系列模型在该领域的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03580 2026-08-05 cs.CV 新提交 57%

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03370 2026-08-05 cs.CV 新提交 57%

DRPFNet: Dual-domain Residual Progressive Fusion Network for RGB-Thermal Object Detection

DRPFNet:用于RGB-热成像目标检测的双域残差渐进融合网络

Zian Wang, Changchun Li

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对现有RGB-T目标检测方法的跨尺度知识继承不足、噪声抑制弱及信息退化问题,提出DRPFNet,通过结构、特征、增强三级协同优化,在公开数据集上实现了兼具竞争力与高效性的检测性能。

Comments Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 57%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03344 2026-08-05 cond-mat.mtrl-sci physics.app-ph physics.ins-det 新提交 50%

Picometre-scale real-time drift correction in TEM and STEM by dynamic control of the specimen stage for atomic-resolution imaging

用于原子分辨率成像的透射电子显微镜(TEM)与扫描透射电子显微镜(STEM)中通过动态控制样品台实现皮米级实时漂移校正

Christophe Gatel, Julien Dupuy, Teresa Hungria, Martin J. Hytch

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究开发无需硬件修改的动态控制软件框架,通过控制样品台实现皮米级实时漂移校正,提升TEM、STEM成像质量,支持原子分辨率成像及各类实验应用。

Comments 27 pages, 9 figures. Submitted to Ultramicroscopy Christophe Gatel: Writing original draft, Software, Methodology, Investigation, Data treatment, Conceptualization, Resources, Funding acquisition. Julien Dupuis: Software, Conceptualization, Methodology. Teresa Hungria: STEM experiment, Review & editing. Martin Hytch: Review & editing, Data treatment, Resources, Funding acquisition

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 6 篇

2608.03132 2026-08-05 cs.HC 新提交 78%

Understanding Organizational Strategies Across Multimodal Artifacts in Immersive Computational Notebooks

沉浸式计算笔记本中跨多模态制品的组织策略理解

Sungwon In, Minju Baeck, Yalong Yang, Sang Ho Yoon, Woontack Woo, Mallesham Dasari

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究针对沉浸式计算笔记本(ICoN)中多模态制品的组织策略开展用户研究,发现参与者主要采用基于深度的布局,空间组织围绕基于单元的制品构建,弥补了该领域多模态组织策略研究的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05163 2026-08-05 physics.optics cond-mat.mes-hall quant-ph 78%

Topology and criticality in non-Hermitian multimodal optical resonators through engineered losses

Elizabeth Louis Pereira, Hongwei Li, Andrea Blanco-Redondo, Jose L. Lado

专题命中 其他多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20206 2026-08-05 cs.CV 版本更新 70%

Toward Visual Grounding: A Survey

视觉定位:一项综述

Linhui Xiao, Xiaoshan Yang, Xiangyuan Lan, Yaowei Wang, Changsheng Xu

专题命中 其他多模态 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本综述梳理视觉定位的发展与背景,总结近年进展与新挑战,定义规范研究设置,介绍相关数据集与应用,提出未来方向,是该领域最全面的综述,适合不同阶段研究者。

Comments Accepted by TPAMI 2025. We keep tracing related works at https://github.com/linhuixiao/Awesome-Visual-Grounding, article publication page: https://ieeexplore.ieee.org/abstract/document/11235566

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 3, pp. 2749-2771, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02955 2026-08-05 cs.HC cs.AI cs.CY eess.IV 新提交 57%

Chat Debugging: An Exploratory Study of Human-AI Collaboration to Debug Analog Circuits

聊天调试:人机协作调试模拟电路的探索性研究

John Hu, Andrew Ash

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究通过分析本科生与开源大型语言模型(LLMs)协作调试模拟电路的聊天记录,揭示了人机协作调试的模式、LLMs的优势与不足及学生的技能短板,为优化人机协作调试提供了依据。

Comments This is the accepted version of a paper to be presented at the 2026 IEEE Frontiers in Education Conference (FIE). The final version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02695 2026-08-05 cs.CR cs.LG cs.SE 新提交 50%

Stylometric Defenses Against Author Impersonation in Software Repositories

针对软件仓库中作者冒充的风格计量防御

Leonid Ravich, Michael Fire

专题命中 其他多模态 :cross-modal(abstract)

AI总结 本研究提出基于跨模态Transformer的补丁级风格计量防御,结合流式异常检测器,在真实供应链事件中高效检测软件仓库的作者冒充行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00240 2026-08-05 cs.HC 版本更新 50%

Electrotactile Improves Thermal Referral

电触觉增强热传导

Wen Li, Rong Ni, Bozhi Tian, Pedro Lopes

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出通过电触觉替代振动触觉改进热传导,提升冷感传达效率,减少触觉干扰,并增强VR中热场景的真实性,提供沉浸式多模态热体验设计指南。

Comments 12 Pages, 12 Figures

Journal ref ACM UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏