arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-29 至 2026-04-29 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2604.25299 2026-04-29 cs.CV cs.AI 81%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25636 2026-04-29 cs.CV 79%

Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models

通过再生进行细化:扩大修改空间提升统一多模态模型中的图像细化

Jiayi Guo, Linqing Wang, Jiangshan Wang, Yang Yue, Zeyu Liu, Zhiyuan Zhao, Qinglin Lu, Gao Huang, Chunyu Wang

机构 * Tsinghua University(清华大学) Tencent HY(腾讯HY)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过再生进行细化的新框架,通过扩大修改空间提升统一多模态模型的图像细化效果,实验表明在多个基准测试中性能显著提升。

Comments GitHub: https://github.com/LeapLabTHU/RvR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25806 2026-04-29 cs.CL cs.AI cs.HC 62%

MAIC-UI: Making Interactive Courseware with Generative UI

MAIC-UI: 用生成式UI制作交互式课程ware

Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li, Lei Hou, Juanzi Li, Yu Zhang, Huiqin Liu

机构 * Tsinghua University(清华大学) Guangzhou University(广州大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 MAIC-UI通过零代码系统实现教育者快速编辑交互式课程ware,采用多模态知识分析、生成-验证-优化流程和点击定位编辑技术,提升教学效果和学习公平性。

Comments You can try our demo at https://open.maic.chat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13766 2026-04-29 cs.SE cs.AI cs.CL 62%

A Blueprint for AI-Driven Software Quality: Integrating LLMs with Established Standards

AI驱动软件质量的蓝图:整合大语言模型与现有标准

Avinash Patil

机构 * Juniper Networks Inc.(Juniper网络公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用大语言模型提升软件质量保证的过程,结合现有标准,分析AI在需求验证、缺陷检测等任务中的应用,并提出未来发展方向。

Comments 16 pages, 2 Table, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25164 2026-04-29 cs.CV 57%

IAM: Identity-Aware Human Motion and Shape Joint Generation

IAM:基于身份的人体运动与形状联合生成

Wenqi Jia, Zekun Li, Abhay Mittal, Chengcheng Tang, Chuan Guo, Lezi Wang, James Matthew Rehg, Lingling Tao, Size An

机构 * UIUC(伊利诺伊大学香槟分校) Meta Reality Labs(Meta现实实验室) Brown University(布朗大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于身份的人体运动与形状联合生成框架,通过多模态信号建模身体形态与运动动态的关系,提升运动真实性和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24833 2026-04-29 cs.RO cs.AI cs.GR cs.LG 57%

MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives

MotionBricks: 可扩展的实时动作生成与模块化潜在生成模型及智能原语

Tingwu Wang, Olivier Dionne, Michael De Ruyter, David Minor, Davis Rempe, Kaifeng Zhao, Mathis Petrovich, Ye Yuan, Chenran Li, Zhengyi Luo, Brian Robison, Xavier Blackwell, Bernardo Antoniazzi, Xue Bin Peng, Yuke Zhu, Simon Yuen

机构 * NVIDIA Simon Fraser University(西蒙·弗雷泽大学) The University of Texas at Austin(得克萨斯大学奥斯汀分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出MotionBricks,通过模块化潜在生成模型和智能原语实现实时动作生成,解决工业应用中实时可扩展性和多模态控制的挑战,展示了高质量和实时性能。

Comments ACM Transactions on Graphics; SIGGRAPH 2026. Project page: https://nvlabs.github.io/motionbricks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24913 2026-04-29 cs.LG q-bio.PE 50%

Generative diffusion models for spatiotemporal influenza forecasting

生成扩散模型用于时空流感预测

Joseph Lemaitre, Justin Lessler

机构 * Department of Epidemiology, Gillings School of Global Public Health, University of North Carolina at Chapel Hill(流行病学系,全球公共卫生学院,北卡罗来纳大学查佩尔希尔分校) Department of Epidemiology, Johns Hopkins Bloomberg School of Public Health, Baltimore, MD 21205, USA(流行病学系,约翰·霍普金斯伯恩斯坦公共卫生学院,巴尔的摩,MD 21205, USA) Carolina Population Center, University of North Carolina at Chapel Hill(卡罗来纳人口中心,北卡罗来纳大学查佩尔希尔分校)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Influpaint模型,利用扩散模型对流感流行病进行时空预测,通过将流感季节编码为时空图像,学习疾病动态的丰富分布,并在回顾评估中实现了与领先集成方法相当的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 17 篇

2604.25720 2026-04-29 cs.CV cs.CL 86%

Toward Multimodal Conversational AI for Age-Related Macular Degeneration

迈向年龄相关性黄斑变性的多模态对话式人工智能

Ran Gu, Benjamin Hou, Mélanie Hébert, Asmita Indurkar, Yifan Yang, Emily Y. Chew, Tiarnán D. L. Keenan, Zhiyong Lu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。

Comments 38 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 83%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 81%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25618 2026-04-29 cs.MM 79%

Beyond Isolated Utterances: Cue-Guided Interaction for Context-Dependent Conversational Multimodal Understanding

超越孤立话语:基于提示的交互用于依赖上下文的对话多模态理解

Zhaoyan Pan, Hengyang Zhou, Xiangdong Li, Yuning Wang, Ye Lou, Jiatong Pan, Ji Zhou, Wei Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出CUCI-Net,通过结合局部模态证据与全局上下文证据,明确抽象上下文与话语之间的依赖关系,将其作为提示融入最终多模态交互阶段,实现上下文条件下的预测。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25072 2026-04-29 cs.CV 79%

Beyond Accuracy: Benchmarking Cross-Task Consistency in Unified Multimodal Models

超越准确率:统一多模态模型跨任务一致性的基准测试

Weixing Wang, Liudvikas Zekas, Anton Hackl, Constantin Alexander Auga, Parisa Shahabinejad, Jona Otholt, Antonio Rueda-Toicen, Gerard de Melo

机构 * Hasso Plattner Institute / University of Potsdam(霍普夫纳研究所 / 波茨坦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出XT-C-Bench,用于评估统一多模态模型跨任务的语义一致性,发现高生成或理解性能不等于强跨任务对齐,揭示一致性由模态间学习目标耦合紧密度决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21304 2026-04-29 cs.IR 78%

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试

Yanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25914 2026-04-29 cs.CL 70%

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

DV-World:在现实场景中评估数据可视化代理的基准测试

Jinxiang Meng, Shaoping Huang, Fangyu Lei, Jingyu Guo, Haoxiang Liu, Jiahao Su, Sihan Wang, Yao Wang, Enrui Wang, Ye Yang, Hongze Chai, Jinming Lv, Anbang Yu, Huangjing Zhang, Yitong Zhang, Yiming Huang, Zeyao Ma, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 DV-World通过260个任务评估数据可视化代理在现实专业生命周期中的能力,涵盖表格操作、视觉进化和意图对齐,采用混合评估框架揭示现有模型在复杂数据可视化挑战中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17492 2026-04-29 cs.CV 70%

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22102 2026-04-29 cs.CV cs.AI cs.CL 67%

Mitigating Coordinate Prediction Bias from Positional Encoding Failures

缓解位置编码失效导致的坐标预测偏差

Xingjian Tao, Yiwei Wang, Yujun Cai, Yihong Luo, Kai Han, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VPSG方法,通过shuffle位置编码纠正坐标偏移,提升定位精度,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 62%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 62%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25757 2026-04-29 cs.CR cs.AI cs.RO cs.SY eess.SY 57%

Threat-Oriented Digital Twinning for Security Evaluation of Autonomous Platforms

面向威胁的数字孪生用于自主平台安全评估

Thomas J. Neubert, Laxima Niure Kandel, Berker Peköz

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Embry-Riddle Aeronautical University(埃姆布里-瑞德航空大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种面向威胁的数字孪生方法,用于评估具备学习能力的自主平台的网络安全。该方法通过模块化孪生技术,实现了对感知、自主和监督控制功能的分离,并引入了多模式感知、信任边界和运行时安全行为,提供可重复的测试模式以评估欺骗、重放、恶意输入注入等威胁。

Comments Camera ready accepted for presentation at and publication in the proceedings of 2026 56st Annual IEEE/IFIP International Conference on Dependable Systems and Networks Workshops (DSN-W): Dependable and Secure Autonomous Systems (DSAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25614 2026-04-29 cs.AI 57%

HotComment: A Benchmark for Evaluating Popularity of Online Comments

HotComment: 一个评估在线评论流行度的基准

Yafeng Wu, Yunyao Zhang, Liliang Ye, Guiyi Zeng, Junqing Yu, Chen Xu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Computer Technology and Applications(北京计算机技术与应用研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出HotComment基准,通过内容质量、流行度预测和用户行为模拟三个维度评估在线评论的流行度,同时引入StyleCmt提升社交共振效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25612 2026-04-29 cs.AI 57%

The Nonverbal Syntax Framework: An Evidence-Based Tiered System for Inferring Learner States from Observable Behavioral Cues

非语言语法框架:一种基于证据的分层系统,用于从可观察行为提示中推断学习者状态

Sherzod Turaev, Mary John, Jaloliddin Rustamov, Zahiriddin Rustamov, Saja Aldabet, Nazar Zaki, Khaled Shuaib

机构 * Department of Computer Science & Software Engineering, College of Information Technology, United Arab Emirates University(计算机科学与软件工程系,信息科技学院,阿拉伯联合酋长国大学) Academic Support Department, Abu Dhabi Polytechnic(阿布扎赫尔理工学院学术支持部) Department of Information Systems and Security, College of Information Technology, College of Information Technology, United Arab Emirates University(信息系统与安全系,信息科技学院,信息科技学院,阿拉伯联合酋长国大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出非语言语法框架,通过系统综述908项研究和17,043个提示-状态映射,解决术语碎片化、证据异质性和状态模糊性问题,提供分层结构用于推断学习者状态。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25388 2026-04-29 cs.CV cs.RO 57%

COMPASS: COmpact Multi-channel Prior-map And Scene Signature for Floor-Plan-Based Visual Localization

COMPASS:基于平面图的多通道先验图与场景签名用于基于平面图的视觉定位

Muhammad Shaheer, Miguel Fernandez-Cortizas, Asier Bikandi-Noya, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg (UL)(自动化与机器人研究组,安全、可靠性与信任跨学科中心(SnT),卢森堡大学(UL))

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出COMPASS算法,利用平面图中的几何和语义先验信息,通过多通道径向描述符估计配备双鱼眼相机的机器人姿态,验证了跨模态结构匹配的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25352 2026-04-29 cs.LG cs.AI 57%

GraphPL: Leveraging GNN for Efficient and Robust Modalities Imputation in Patchwork Learning

GraphPL: 利用GNN实现Patchwork学习中高效且鲁棒的模态补全

Xingjian Hu, Zuoyu Yan, Jianhua Zhu, Liangcai Gao, Fei Wang, Tengfei Ma

机构 * LumionHXJ

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GraphPL,结合图神经网络与Patchwork学习,有效整合所有观测模态并保持噪声输入下的鲁棒性,在基准数据集和真实世界电子健康记录数据集上均取得SOTA性能。

Comments Accepted at ICASSP 2026. This is a preprint of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24906 2026-04-29 cs.RO cs.LG cs.SY eess.SY 50%

An analysis of sensor selection for fruit picking with suction-based grippers

基于吸盘夹具的水果采摘传感器选择分析

Eva Krueger, Marcus Rosette, Joseph R. Davidson

机构 * Collaborative Robotics and Intelligent Systems (CoRIS) Institute(协作机器人与智能系统研究所)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种多模态传感系统,用于评估不同采摘阶段传感器的效用,通过实验证明随机森林和多层感知器在检测成功采摘和即将失败事件中的高准确率。

Comments IROS Conference Format, 6 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 4 篇

2604.25563 2026-04-29 cs.RO 78%

Improving Sensing Coverage and Compliance of 3D-Printed Artificial Skins Through Multi-Modal Sensing and Soft Materials

通过多模感知和柔性材料提升3D打印人工皮肤的感知覆盖与合规性

Carson Kohlbrenner, Caleb Escobedo, Sayak Ray, Alexander Dickhans, Anna Soukhovei, Nickolaus Jackoski, Lyle Antieau, Alessandro Roncone

机构 * University of Colorado Boulder(科罗拉多大学波尔得分校)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出结合时间飞行和自电容传感的柔性皮肤,实现多模感知、压力传感与电接口优化,提升3D打印人工皮肤的实用性和覆盖能力。

Comments This work was accepted at the "Towards Large-Area Tactile Sensing Skins: From Scalable Materials to Embodied Robotic Perception" workshop at the International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24793 2026-04-29 eess.IV cs.CV 74%

CRC-SAM: SAM-Based Multi-Modal Segmentation and Quantification of Colorectal Cancer in CT, Colonoscopy, and Histology Images

CRC-SAM:基于SAM的多模态结直肠癌在CT、结肠镜和组织学图像中的分割与量化

Daniel Lao

机构 * Independent researcher(独立研究者)

专题命中 多模态Agent :multi-modal(title);分类 cs.CV

AI总结 本文提出CRC-SAM框架,实现跨结肠镜、CT和病理图像的结直肠癌分割,通过LoRA层实现高效领域迁移,实验显示在多个数据集上优于现有方法。

Comments 4 pages, 3 figures, ISBI 2026 oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 70%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25376 2026-04-29 cs.CV cs.AI 62%

CoRE: Concept-Reasoning Expansion for Continual Brain Lesion Segmentation

CoRE:基于概念推理的连续脑病变分割

Qianqian Chen, Anglin Liu, Jingyang Zhang, Yudong Zhang

机构 * Southeast University, Nanjing, China(东南大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoRE框架,通过整合视觉特征与结构化概念,解决连续学习中容量限制和冗余参数增长问题,实现基于临床先验的模型进化。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 6 篇

2601.12052 2026-04-29 cs.CV 79%

Task-Driven Prompt Learning: A Joint Framework for Multi-modal Cloud Removal and Segmentation

任务驱动的提示学习:多模态云去除与分割的联合框架

Zaiyan Zhang, Jie Li, Shaowei Shi, Qiangqiang Yuan

机构 * Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出TDP-CR框架,通过任务驱动的多模态方法联合实现云去除与土地覆盖分割,解决云遮挡导致的语义不一致问题,提升分析级数据质量。

Comments Accepted by IGARSS 2026 Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14245 2026-04-29 cs.LG cond-mat.mtrl-sci cs.AI cs.CE q-bio.BM 79%

Curriculum-guided multimodal representation learning enables generalizable prediction of nanomaterial-protein interactions

基于课程引导的多模态表示学习可实现纳米材料-蛋白质相互作用的通用预测

Hengjie Yu, Kenneth A. Dawson, Haiyun Yang, Shuya Liu, Yan Yan, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所在先进科技研究院) Centre for BioNano Interactions, School of Chemistry, University College Dublin(都柏林大学学院化学系生物纳米相互作用中心) School of Biomolecular and Biomedical Science, UCD Conway Institute of Biomolecular and Biomedical Research(都柏林大学学院生物分子与生物医学科学系,康沃利斯生物分子与生物医学研究学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CuMMI模型,通过多阶段课程学习和大规模数据集,实现纳米材料-蛋白质相互作用的通用预测,验证了其在不同数据集上的鲁棒性和可迁移性。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏