arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-30 至 2026-07-30 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2605.25379 2026-07-30 cs.CL 版本更新 57%

StateRAG: Typed State Contracts for Complex Retrieval-Augmented Generation

EfficientGraph-RAG:面向跨任务检索增强生成的结构化检索状态管理

Miaohe Niu, Pengxiang Li, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Tsinghua University, China(清华大学) Kunming University of Science and Technology, China(昆明理工大学) NiuTrans Research, Shenyang, China(沈阳NiuTrans研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CL

AI总结 提出EfficientGraph-RAG框架,通过显式定义检索状态(TAM、MARS、SMP三个机制)实现结构化状态管理,在多个基准上提升答案质量并降低大模型token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12035 2026-07-30 cs.CV 版本更新 57%

When Does Visual Token Pruning Improve Calibration? The Role of Evidence Coverage in MLLMs

视觉标记修剪能否提高校准?关于多模态大语言模型中置信度的实证研究

Kaizhen Tan, Yang Feng, Heqing Du, Hanzhe Hong, Siru Tao, Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文研究视觉标记修剪对模型校准的影响,通过POPE和ScienceQA-IMG数据集评估不同修剪策略下的ECE、Brier分数和AURC,发现修剪能提升校准而非仅牺牲效率,且基于显著性的修剪方法效果较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25175 2026-07-30 cs.MA 版本更新 50%

Agentic AI-enabled discovery across large-scale sleep physiology

基于智能体的人工智能助力大规模睡眠生理学研究

Rahul Thapa, Umaer Hanif, Robin Guillard, Andreas Brink-Kjaer, Adrien Specht, Matteo Saibene, Magnus Ruud Kjaer, Harrison G. Zhang, Federico Bianchi, Elisabeth Roxane M. Heremans, Eric C. Landsness, Emmanuel Mignot, James Zou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 4 篇

2606.16586 2026-07-30 cs.CV 版本更新 85%

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

LOCUS: 局部视觉线索搜索增强多模态大语言模型的细粒度感知

Zhou Tao, Fang Zhang, Zewen Ding, Shida Wang, Xiaokun Sun, YongXiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(summary_cn);分类 cs.CV

AI总结 提出LOCUS训练框架,通过可验证的局部线索搜索代理任务,使MLLM内化细粒度证据选择,提升定位敏感视觉理解而不改变推理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26909 2026-07-30 cs.CL 新提交 79%

Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

用于多模态少样本知识图谱补全的双路径大语言模型推理

Jinlan Liu, Zhiying Tu, Yongchao Xing, Yicheng Liu, Bolin Zhang, Dianbo Sui, Dianhui Chu, Hongliang Sun

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对多模态少样本知识图谱补全难题,提出双路径大语言模型推理框架DuPLeR,结合多模态LLM先验与事实支撑构建校准关系图,经实验验证其在数据稀缺场景下性能稳健。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27163 2026-07-30 cond-mat.mtrl-sci 新提交 50%

Materials Behavior as Mechanism Ensembles: A Probabilistic Framework for Emergent Behaviors

材料行为作为机制集合:一种涌现行为的概率框架

Brad L. Boyce, Mitchell A. Wood, Krishna Garikipati, Andreas E. Robertson, Jeffrey Larson, Ishan Srivastava, Bert Debusschere, Saaketh Desai, Prasad Iyer, Pieterjan Robbe, Mathew Cherukara, Todd Munson, Ming Du, Trupti Mohanty, David J. Gardner, Laurent Capolungo, Benjamin A. Jasperson, Jingye Tan, Rémi Dingreville

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出将材料行为视为机制集合的概率框架,以概率方式连接机制激活等与宏观可观测量,可应用于金属疲劳等系统,助力提前识别涌现行为的有利条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07851 2026-07-30 cs.SE 版本更新 50%

Uncovering Scientific Software Sustainability through Community Engagement and Software Quality Metrics

通过社区参与和软件质量指标揭示科学软件的可持续性

Sharif Ahmed, Addi Malviya Thakur, Gregory R. Watson, Nasir U. Eisty

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对科学开源软件长期维持的挑战,以GitHub上的十个知名Sci-OSS项目为对象,结合社区参与与软件质量指标,提出新颖可视化技术及相关分析方法,为相关人员提供了软件可持续性的关键见解。

Comments Accepted for publication in IEEE Computing in Science & Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏