arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-20 至 2026-08-20 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 8 篇

2608.18573 2026-08-20 cs.CV 新提交 86%

PATE-Forensics: Perception-as-Tool for Explainable Deepfake Forensics with General-Purpose MLLMs

PATE-Forensics:以通用多模态大语言模型(MLLM)为工具的可解释深度伪造取证方法

Yaqi Li, Jielun Peng, Yabin Wang, Jincheng Liu, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态Agent :MLLM(title_cn,summary_cn);分类 cs.CV

AI总结 本研究提出PATE-Forensics,采用“感知即工具”范式,基于DINOv3构建取证感知工具,结合通用MLLM实现可解释深度伪造取证,在DDL-X Track 3数据集上取得0.89的最佳官方分数,较次席高出0.19分。

Comments 9 pages, 3 figures, 2 tables; DDL-X Track 3, IJCAI 2026 AI Safety Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交 79%

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18673 2026-08-20 cs.CV 新提交 79%

DynCur-Geo: Dynamic Curiosity Reward Shaping for Multimodal Active Geo-Localization

DynCur-Geo:面向多模态主动地理定位的动态好奇心奖励塑造

Yiming Sun, Yang Zhang, Pengfei Zhu

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DynCur-Geo动态好奇心框架,通过距离感知门与势能奖励塑造优化多模态主动地理定位,在多场景实验中较基线方法取得一致性能提升。

Comments 24 pages, 18 figures, 15 tables. The main paper is 7 pages, with supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21113 2026-08-20 cs.RO 版本更新 78%

Multimodal Adaptive Control for Safe Robotic Craniotomy Under Partial Observability

RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) Second Hospital of Dalian Medical University(大连医科大学附属第二医院) The University of Tokyo(东京大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17253 2026-08-20 cs.LG cs.AI cs.CV 版本更新 62%

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL

Co-RL:多智能体强化学习中多样群体涌现的无监督推理

Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li

机构 * University of Exeter(埃克塞特大学) ByteDance(字节跳动) Johns Hopkins University(约翰斯·霍普金斯大学) UC San Diego(加州大学圣迭戈分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。

Comments 30 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18602 2026-08-20 cs.CV 新提交 57%

Teach a Molmo2Fish: Towards interactive fish tracking with natural language guidance

Teach a Molmo2Fish:面向自然语言引导的交互式鱼类追踪

Kai Van Brunt (1), Justin Kay (1), Sara Beery (1) ((1) Massachusetts Institute of Technology)

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本研究针对声呐鱼类追踪数据集定制了多模态大语言模型工具Molmo2Fish,通过交互式预测修正工作流开展实验,发现其在鱼类追踪和轨迹修正上性能良好,但自然语言引导的融入仍需提升。

Comments 29 pages, 6 figures, to be published in Third Workshop on Computer Vision for Ecology at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18309 2026-08-20 cs.CV 新提交 57%

XRF-to-Optical Field-of-View Localization with Vision Language Models

基于视觉语言模型的X射线荧光(XRF)与光学显微镜视场(FOV)定位

Xiangyu Yin, Tatjana Paunesku, Letonia Copeland-Hardin, Martina Ralle, Zichao Wendy Di, Si Chen, Gayle E. Woloschak, Barry Lai, Mathew J. Cherukara, Stefan Vogt

机构 * Northwestern University(西北大学) University of Chicago(芝加哥大学) Oregon Health and Science University(俄勒冈健康与科学大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文针对跨模态显微图像的视场定位难题,提出结合视觉语言模型(VLM)的候选生成-验证工作流,在低对应度的相邻切片成像数据中实现了有效定位,为关联XRF与光学显微测量提供了支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18450 2026-08-20 cs.LG 新提交 50%

Adaptive Multi-Agent Feature Selection for Personalized Fall Risk Prevention

面向个性化跌倒风险预防的自适应多智能体特征选择

Chang Liu, Ladda Thiamwong, Yanjie Fu, Rui Xie

机构 * University of Central Florida(中佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对老年人跌倒风险识别的静态方法无法适配动态个性化风险因素,本文提出PAFIR框架,将自适应特征选择建模为强化学习问题,在PEER试验数据上验证其能更有效捕捉特征模式,实现动态个性化跌倒风险预防。

Comments 38 pages, 10 figures, 12 tables. Accepted at Machine Learning for Healthcare (MLHC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏