arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-29 至 2026-07-29 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2607.25021 2026-07-29 cs.AI cs.HC cs.MA cs.SE 新提交 79%

Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization

图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明

Ishrat Jahan Eliza, Md Dilshadur Rahman

专题命中 其他多模态 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。

Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25324 2026-07-29 cs.CV cs.AI 新提交 62%

Balanced Soft mixture-of-expert model for Glaucoma Detection

用于青光眼检测的平衡软专家混合模型

Sai Venkatesh Chilukoti, Krishna Rauniyar, Min Shi, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) School of Computing and Informatics(计算与信息学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对青光眼检测,提出含三个专家及负载平衡损失的平衡软专家混合模型,解决多模态学习问题,其性能通过AUC衡量,超越多种基线和模型,还可推广至其他疾病检测。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 62%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24806 2026-07-29 q-bio.NC cs.AI 新提交 57%

Decoding Error-Related Potentials under Multisensory Feedback with Varying Congruency

在具有不同一致性的多感官反馈下解码错误相关电位

Yixin Liu, Kang Yin, Hye-Bin Shin, Seong-Whan Lee

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究在多模态视觉、听觉和触觉反馈及可控感官一致性下的ErrP解码挑战,采用基于多分支EEGNet的架构及辅助监督学习策略,经迷宫观察任务实验,该方法在异质感官条件下分类性能一致且准确度提高,提升了ErrP解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25792 2026-07-29 cs.NI 新提交 50%

The Model in the Middle: Toward AI-Native Real-Time Communication

中间的模型:迈向人工智能原生实时通信

Ziqian Liu, Minghao Li, Yiming Qiu

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究迈向人工智能原生实时通信,提出将模型视为有状态计算中间盒的新观点,探索网络感知推理调度等三个跨阶段协调机会,构建Conflux验证,结果显示在网络退化时响应延迟等有改善,呼吁建立相关实时通信堆栈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25312 2026-07-29 cs.LG 新提交 50%

Guiding Posterior Exploration with Optimizer-Derived Geometry

用优化器派生几何引导后验探索

Moritz Schlager, Emanuel Sommer, Thomas Möllenhoff, David Rügamer

机构 * TUM(慕尼黑工业大学) LMU Munich(慕尼黑大学) RIKEN AIP(理化学研究所先进智能项目中心)

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究贝叶斯神经网络不确定性量化中高维多峰后验分布探索的计算成本问题,提出基于优化器派生几何的预处理采样策略,可减少采样预热阶段,提升性能与稳定性,且无额外计算成本,经多数据集和架构验证。

Comments Accepted for presentation at the OPTIMAL Workshop at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16123 2026-07-29 cs.RO 版本更新 50%

BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference

BayesContact:通过视觉触觉提议和基于模拟的推理进行不确定姿态估计

Aditya Kamireddypalli, Matias Mattamala, Joao Moura, Russell Buchanan, Sethu Vijayakumar, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系)

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对富含接触操作中姿态估计难题,提出BayesContact框架,通过融合视觉与触觉信息及基于模拟的推理来维护物体姿态信念,经模拟预测与真实观测对比更新信念,提升了姿态可观测性与插入成功率。

Comments Update funding sources

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00433 2026-07-29 cond-mat.mtrl-sci 版本更新 50%

In situ Gas-Cell Electron Microscopy Reveals Pressure-Selected Restructuring Pathways in AuRu Ammonia Catalysts

反应条件下的氨催化剂演变揭示于环境和多模式电子显微镜

Amy S. McKeown-Green, Parivash Moradifar, Zisheng Zhang, Cedric Lim, Andrew Barnum, Lin Yuan, Robert Sinclair, Frank Abild-Pedersen, Colin Ophus, Jennifer A. Dionne

专题命中 其他多模态 :multimodal(abstract)

AI总结 通过环境和多模式电子显微镜研究,揭示了AuRu催化剂在反应条件下的结构演变机制,揭示了氢驱动的纳米空洞形成及压力对重构的影响。

Comments First two authors contributed equally to this work. First two and final author are corresponding authors. This work was conducted at Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏