arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-23 至 2026-07-23 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2512.16300 2026-07-23 cs.AI 版本更新 81%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19532 2026-07-23 cs.LG cs.AI 新提交 79%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19568 2026-07-23 eess.SY cs.SY 新提交 78%

From P&ID Drawings to Process Graphs: A Multimodal Language Model Approach

从管道和仪表图到过程图:一种多模态语言模型方法

Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19947 2026-07-23 cs.CV 新提交 74%

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program

ETPDesigner:用于交互式多模态电子剧院节目的多智能体编排

Mengtian Li, Xinru Guo, Xiaoru Lin, Xiao Rong, Zhifeng Xie, Chaofeng Chen

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) Institute for Math and AI, Wuhan School of Artificial Intelligence, Wuhan University(武汉大学数学与人工智能研究院武汉人工智能学院)

专题命中 多模态Agent :multimodal(title);分类 cs.CV

AI总结 研究针对电子剧院节目设计难题,提出ETPDesigner多智能体框架,能从戏剧脚本合成高质量ETP,通过全局风格锚定机制保证一致性,还实现交互功能,经ETP-Pro基准测试验证了方法在多方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20124 2026-07-23 cs.LG cs.MA 新提交 50%

Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference

基于共识推理的Tsetlin机集成中的自主协作学习

Yehuda Rudin, Osnat Keren, Michal Yemini, Alexander Fish

机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。

详情

展开后加载摘要…

URL PDF HTML 收藏