arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-20 至 2026-07-20 共收录 38 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2607.16165 2026-07-20 cs.CV cs.AI cs.CL cs.LG 新提交 75%

An Exam for Active Observers

主动观察者的测试

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态大语言模型是否具备主动观察能力,引入ActiveVision基准测试,发现前沿模型表现不佳,即便能编写视觉代码差距仍存,表明当前模型缺乏主动视觉观察,呼吁构建闭合感知 - 推理循环的架构和训练目标。

Comments 17 pages, 8 figures, 4 tables. Project page: https://activevision.dev

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15942 2026-07-20 cs.CV cs.LG 新提交 57%

More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe

以少胜多:一种简单方法构建的大规模遥感视觉语言模型

Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息与自动化研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对遥感视觉语言模型,质疑架构专业化必要性,提出通用模型经大规模跨数据和任务训练可获好性能。核心方法是用单一语言策略及多任务强化学习框架训练。主要贡献是在多基准测试中取得竞争力结果,证明数据规模更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 57%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2607.16107 2026-07-20 eess.AS cs.CV 新提交 86%

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

视听火烈鸟:用于长而复杂视频的开放视听智能

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

机构 * NVIDIA, USA(美国NVIDIA公司) University of Maryland, USA(美国马里兰大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、eess.AS

AI总结 研究提出视听火烈鸟,用于长复杂视频的联合理解与推理。贡献包括构建大规模视频集、设计三阶段课程及推理框架。实验显示其在多基准测试中表现优异,超越同类开放模型,在长复杂视听理解推理任务中竞争力强,有现实应用价值和泛化能力。

Comments Project Page: https://avflamingo.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15295 2026-07-20 cs.MM cs.AI cs.LG cs.SD 新提交 86%

AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

AV-JEPA:将LeJEPA扩展到视听自监督学习

Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University, Espoo, Finland(艾尔沃斯大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究将LeJEPA扩展到视听自监督学习,核心方法是用早期融合视觉Transformer和模态丢弃作掩码训练模型对齐视图嵌入,主要贡献是实现跨模态对齐,架构简洁,在分类任务中有竞争力且支持零样本音频-视频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15657 2026-07-20 cs.CR cs.CV cs.LG 新提交 83%

Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents

智能体是否会梦到虚假记忆?对多模态人工智能智能体长期记忆的黑盒视觉攻击

Halima Bouzidi, Mboutidem Ekemini Mkpong, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多模态人工智能智能体长期记忆的黑盒视觉攻击,提出Lucid框架,通过制作扰动实现记忆中毒和注入两种攻击模式,在多种对话领域和架构上评估,揭示了多模态记忆管道的结构漏洞。

Comments 34 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15285 2026-07-20 cs.MM 新提交 83%

Proof-Carrying Multimodal Timelines: Finite-Trace Modal Certificates for Video-Audio Consistency

携带证明的多模态时间线:用于视频-音频一致性的有限轨迹模态证书

Faruk Alpay, Hamdi Alakkad

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM

AI总结 研究视频-音频一致性问题,核心方法是将其作为有限轨迹模态监测,通过公式库规定多种一致性,证书记录关键信息,工件进行视频解码等操作,贡献是提供可重现见证及相关处理流程。

Comments 15 pages, 5 figures, 4 tables; ancillary files https://huggingface.co/datasets/Lightcap/pcmt-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2607.15689 2026-07-20 cs.CV 新提交 89%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15794 2026-07-20 cs.CV cs.AI 新提交 84%

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

基于事件的多模态自我运动估计中学习表征的几何结构研究

Stefano Silvestrini, Michele Ceresoli

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究基于事件的多模态自我运动估计中多模态网络的几何结构,通过跨模态注意力架构融合多模态信号并训练,分析潜在空间几何和注意力动态,揭示相关特性,架起分析估计理论与数据驱动融合的桥梁。

Comments 5 pages, 3 figures, to be published in SPAICE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15361 2026-07-20 hep-ex 新提交 71%

Mitigating Detector Ageing Effects with Graph-Based Multi-Modal Track Reconstruction at Belle II

在 Belle II 中使用基于图的多模态轨道重建减轻探测器老化效应

Lea Reuter, Tristan Brandes, Giacomo De Pietro, Torben Ferber

专题命中 视频多模态 :multi-modal(title)

AI总结 研究 Belle II 探测器老化对轨道寻找的影响,采用基于图神经网络的算法,将轨道寻找设为全局关系聚类问题,经全探测器模拟评估性能,结果显示该算法在探测器老化时能提高鲁棒性,稳定跟踪性能。

Comments proceedings for Connecting The Dots 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 70%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15768 2026-07-20 cs.CV cs.AI 新提交 62%

GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

GeoChrono:遥感中长期时间理解的基准测试与重新思考

Yujie Li, Jiancheng Pan, Zhiwei Wei, Jiuniu Wang, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Hunan Normal University(湖南师范大学) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对遥感中长期时间理解缺乏系统评估的问题,引入ChronoBench基准。基于评估结果提出GeoChrono模型,设计相关编码器和压缩器并构建训练数据集,该模型在基准测试中性能领先,压缩器有效减少视觉令牌。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15628 2026-07-20 eess.IV 新提交 50%

MSTF-Net: A UAV-Oriented Multi-Spectral Video Segmentation Method via Modality-Robust, Scale-Adaptive, and Consistent Fusion

MSTF-Net:一种通过模态稳健、尺度自适应和一致融合的面向无人机的多光谱视频分割方法

Chenwei Wang, Zhida Wang, Zelin Li, Elif Ozden-Yenigun, Houde Liu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对无人机多光谱视频分割面临的模态融合困境和时间变化问题,提出MSTF-Net框架,通过模态稳健、尺度自适应融合有效建模跨模态融合与时间一致性,在公共数据集实验中取得出色分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16050 2026-07-20 cs.LG 新提交 50%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15880 2026-07-20 cs.RO cs.LG 新提交 50%

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation

用于泛化到未见机器人操作的动力学感知元模仿

Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenyang University of Technology(沈阳工业大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对机器人模仿学习的数据稀缺与环境泛化问题,提出动力学感知元模仿(DAMI)框架,通过整合元学习、引入视觉运动轨迹模块等方法,有效捕捉任务动力学,在模拟和真实场景实验中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 4 篇

2607.15592 2026-07-20 cs.AI 新提交 93%

MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全

Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Communication University of China(中国传媒大学)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究多模态知识图谱补全问题,提出MGDT框架,先通过RASR-MoE模块选路径、抑干扰,再用MLLM对齐表示,最后KGDT去噪生成,实验证明该框架在三个基准数据集上性能优于基线。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15299 2026-07-20 cs.MM cs.CV cs.LG 新提交 92%

MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation

MLLM-DataEngine:闭合多模态指令微调数据生成的循环

Zhiyuan Zhao, Bin Wang, Linke Ouyang, Yiqi Lin, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title);分类 cs.CV、cs.MM

AI总结 本文提出MLLM-DataEngine闭环系统,通过自适应坏例采样模块分析模型弱点,为GPT-4提供信息以生成高质量增量数据集,能有针对性且自动地提升MLLMs能力,有望成为MLLMs数据管理通用方案。

Comments 6 pages, 4 figures, 7 tables; accepted by ICME 2026

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 30 June 2025 - 04 July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15686 2026-07-20 cs.AI 新提交 79%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15485 2026-07-20 cs.LG math.PR stat.ML 新提交 50%

Diffusion models recover accurate mixture weights despite score function insensitivity

扩散模型即使在得分函数不敏感的情况下也能恢复准确的混合权重

Andrew Dennehy, Ramchandran Muthukumar, Rebecca Willett, Nisha Chandramoorthy

机构 * University of Chicago(芝加哥大学) Data Science Institute(数据科学研究所) Department of Computer Science(计算机科学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究基于得分的生成模型在多模态分布中恢复混合权重的问题,通过定义扩散得分敏感性指数,证明其控制目标分布参数估计准确性,还展示了噪声调度对敏感性及模式放大的影响,此框架可用于恢复目标分布的定性参数。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 7 篇

2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16056 2026-07-20 cs.CV 新提交 79%

Multi-Modal Semantic Segmentation of Electrolyzer Components for Sustainable Hydrogen Technologies: A Dual-Branch Deep Learning Approach

用于可持续氢能技术的电解槽组件多模态语义分割:一种双分支深度学习方法

Wasimul Karim, Nur Mohammad Fahad, Abdul Hasib Siddique, Md Rafiqul Islam, Hooman Mehdizadeh-Rad, Asif Karim, Sami Azam

机构 * Applied Artificial Intelligence and INtelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统(AAIINS)实验室) University of Scholars(学者大学) Murdoch University(莫道克大学) Charles Darwin University(查尔斯达尔文大学)

专题命中 多模态评测 :multi-modal(title);cross-modal(abstract);分类 cs.CV

AI总结 针对电解槽材料分割难题,提出双分支深度学习框架HREM-Net,结合高光谱和RGB图像,通过创新模块、融合模块及损失函数,在相关数据集上取得良好效果,有望用于工业提升电解槽效率和制氢预测性维护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15436 2026-07-20 cs.CY 新提交 78%

Complete Trip: A Linked Multimodal Human Mobility Dataset

完整行程:一个链接的多模式人类移动数据集

Ruohan Li, Weiyu Luo, Xin Wu, Chenfeng Xiong

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出完整行程数据集,通过四阶段工作流程从LBS数据重建多模式旅行行为,涵盖犹他州六个县。能保留行程关系、提供路线表示并支持人口级分析,推动交通、公共卫生等多领域可重复研究。

Comments 16 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15752 2026-07-20 cs.CV 新提交 77%

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。

Comments The paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 73%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16146 2026-07-20 cs.RO cs.CV 新提交 57%

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

VTLoc:基于学习的视觉点云中触觉接触定位

Zhiyuan Wu, Zhuo Chen, Shan Luo

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究视觉与触觉融合的接触定位问题,提出VTLoc框架,通过几何多模态对齐模块和迭代定位更新器,利用视觉点云从触觉读数定位接触点,在新基准上减少对应模糊性,改善单触接触定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15605 2026-07-20 cs.CV 新提交 57%

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation

基于深度学习的局灶性皮质发育异常分割的MRI表征基准测试

Soumen Ghosh, John Phamnguyen, Amit Soni Arya, Subhojit Mandal, Tilottama Goswami, Rajat Vashistha

机构 * The University of Queensland(昆士兰大学) I-MED Radiology(I-MED放射学) Bennett University(贝内特大学) Indian Institute of Technology Madras(印度马德拉斯理工学院) University College of Engineering, Osmania University(奥斯曼尼亚大学工程学院) Mater Hospital(玛特医院) Royal Brisbane and Women’s Hospital(皇家布里斯班和妇女医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对局灶性皮质发育异常分割,利用nnU-Net框架对MRI表征进行基准测试,评估多种输入配置,发现FLAIR单模态性能最强,比率衍生表征单独不足,多模态配置可提高病变描绘,强调MRI表征设计在深度学习分割中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 3 篇

2607.16131 2026-07-20 cs.CL cs.AI 新提交 81%

ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证

Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(滑铁卢大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16038 2026-07-20 cs.AI 新提交 79%

SciForge: An AI-Native, Multimodal Workbench for Scientific Discovery

SciForge:用于科学发现的人工智能原生多模态工作台

SciForge Team, Zhangyang Gao, Minghao Fang, Yifei Liu, Hanhui Yang, Xinyu Gu, Shixiang Tang, Siqi Sun, Lei Bai, Cheng Tan, Mengdi Liu, Hao Wu, Shuizhou Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 SciForge针对科学工作中异构工件难保存为连贯可审计状态的问题,构建多模态工作台,围绕五个支柱运行,结合多种组件,通过多种应用场景展示实际影响,当前为桌面应用,未来深化团队协作且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15868 2026-07-20 cs.CV cs.AI cs.GR cs.HC cs.RO 新提交 62%

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

EgoExoMoCap:分布式自我-外部人体运动捕捉

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

机构 * Meta Reality Labs(元现实实验室) ETH Zürich(苏黎世联邦理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。

Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 3 篇

2607.16076 2026-07-20 cs.CV cs.AI cs.CL 新提交 89%

HCIG: A Hierarchical Cross-Modal Incongruity Graph Network for Multimodal Sarcasm and Cyberbullying Detection

HCIG:用于多模态讽刺和网络欺凌检测的分层跨模态不协调图网络

Bhavana Verma, Priyanka Meel, Dinesh Kumar Vishwakarma

机构 * Delhi Technological University(德里理工大学) Multimodal Data Analytics Research Laboratory(多模态数据分析研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态讽刺和网络欺凌检测难题,提出HCIG框架,利用图注意力网络在不同层面建模跨模态不协调并整合,引入GCCN辅助推理。实验表明该方法在相关数据集上表现出色,分层多粒度建模比传统策略更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏