arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-24 至 2026-06-24 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 7 篇

2606.23717 2026-06-24 eess.IV 新提交 78%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 其他多模态 :multimodal(title);multi-modal(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24350 2026-06-24 cs.RO 新提交 78%

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots

SlipSense: 用于足式机器人在线滑移检测的多模态传感

Iris Szu-Yao Liu, Chien Chern Cheah, Meng Yee Michael Chuah

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Institute for Infocomm Research, Agency for Science Technology and Research(资讯通信研究院,科技研究局)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 提出SlipSense框架,通过定制轻量化传感器足和LSTM模型,实现四足机器人基于力的在线滑移检测,早期滑移检测精度达24.1mm,准确率85.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23771 2026-06-24 eess.SP cs.AI 新提交 57%

Integrated Sensing and Communications for Real-time Avatar Control in XR over 5G

面向5G上XR中实时化身控制的集成感知与通信

Nabeel Nisar Bhat, Javad Sameri, Rreze Halili, Rafael Berkvens, Maria Torres Vega, Jeroen Famaey

机构 * IDLab, University of Antwerp - imec(ID实验室,安特卫普大学 - imec) IDLab, Ghent University - imec(ID实验室,根特大学 - imec) Lighting Technology Lab, KU Leuven(照明技术实验室,鲁汶大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出结合5G毫米波ISAC与表面肌电信号的多模态感知架构,实现从身体到手指的多尺度手势识别,支持XR实时化身控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25322 2026-06-24 cs.CV 版本更新 57%

Quantifying mandibular positioning error and simulated temporomandibular joint-space changes in patient-specific occlusal splints

咬合定位夹板对颞下颌关节状况定量影响的评估

Agnieszka Anna Tomaka, Krzysztof Domino, Michał Tarnawski, Dariusz Pojda

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息研究所)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种利用咬合定位夹板分析颞下颌关节配置的计算方法,通过多模态数据建模夹板作为下颌的刚体变换,评估定位精度并模拟关节空间变化。

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24753 2026-06-24 physics.app-ph 新提交 50%

Material identification using laboratory X-ray beam tracking: quantitativeness and signal-to-noise ratio requirements

利用实验室X射线束追踪进行材料识别:定量性与信噪比要求

Sumera Rehman, Ashkan Ajeer, Connor Darling, Marco Endrizzi, Alessandro Olivo, Silvia Cipiccia

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出基于单色X射线束追踪(XBT)的多模态成像方法,通过同时获取吸收和相位信息实现材料区分,并研究信噪比对定量性和元素识别的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15460 2026-06-24 cs.HC cs.CY 新提交 50%

"ChatGPT, help me draft a breakup text": The Covert Triad and Articulation Labor in AI-Assisted Romantic Communication

“ChatGPT,帮我起草分手短信”:AI辅助浪漫沟通中的隐蔽三角与表达劳动

Skyler Wang, Isabella Luppi

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究AI作为人类浪漫沟通中介的现象,提出“隐蔽三角”和“表达劳动”概念,揭示AI介入导致真实性从语言作者转向情感所有权的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22309 2026-06-24 cs.HC cs.CY 50%

GPT-4o reads the mind in the eyes

GPT-4o解读他人眼神

James W. A. Strachan, Oriana Pansardi, Eugenio Scaliti, Marco Celotto, Krati Saxena, Chunzhi Yi, Fabio Manzi, Alessandro Rufo, Guido Manzi, Michael S. A. Graziano, Stefano Panzeri, Cristina Becchio

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究探讨GPT-4o在解读面部情绪与心理状态的能力,发现其在直立面孔上表现优于人类,但在倒置面孔上表现欠佳,且对白人面孔的解读更准确。

详情

展开后加载摘要…

URL PDF HTML 收藏