arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2509.07525 2026-02-25 cs.CV cs.AI 84%

EHWGesture -- A dataset for multimodal understanding of clinical gestures

EHWGesture -- 一个用于多模态理解临床手势的数据集

Gianluca Amprimo, Alberto Ancilotto, Alessandro Savino, Fabio Quazzolo, Claudia Ferraris, Gabriella Olmo, Elisabetta Farella, Stefano Di Carlo

机构 * Department of Control and Computer Engineering, Politecnico di Torino(控制与计算机工程系,都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) CNR-IEIIT(意大利国家研究委员会-IEIIT)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EHWGesture是一个包含五个临床相关手势的多模态视频数据集,用于提升临床手势理解的多模态分析能力。

Comments Accepted at ICCV 2025 Workshop on AI-driven Skilled Activity Understanding, Assessment & Feedback Generation

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12876 2026-02-25 cs.AI 83%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12815 2026-02-25 cs.CL cs.AI cs.CY cs.MA 81%

Multimodal Multi-Agent Empowered Legal Judgment Prediction

多模态多智能体赋能的法律判决预测

Zhaolu Kang, Junhao Gong, Qingxi Chen, Hao Zhang, Jiaxin Liu, Rong Fu, Zhiyuan Feng, Yuan Wang, Simon Fong, Kaiyue Zhou

机构 * Peking University(北京大学) Chengdu Minto Tech(成都Minto科技) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Macau(澳门大学) Tsinghua university(清华大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出JurisMMA框架,通过多模态多智能体技术提升法律判决预测的准确性,并构建了包含大量司法记录的JurisMM数据集,验证了其在法律领域应用的广泛有效性。

Comments Accepted to the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05137 2026-02-25 cs.CV cs.AI 81%

FedGIN: Federated Learning with Dynamic Global Intensity Non-linear Augmentation for Organ Segmentation using Multi-modal Images

FedGIN: 一种用于多模态图像器官分割的联邦学习动态全局强度非线性增强

Sachin Dudda Nagaraju, Ashkan Moradi, Bendik Skarre Abrahamsen, Mattijs Elschot

机构 * Department of Circulation and Medical Imaging(循证医学与影像学系) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FedGIN通过动态全局强度非线性增强模块,在不共享原始数据的情况下实现多模态器官分割,提升跨模态泛化能力。

Comments Paper Accepted at MICCAI 2025 DeCaf Workshop Track

Journal ref MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08645 2026-02-25 cs.CL 79%

A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding

一种平行的跨语言基准用于多模态隐喻性理解

Dilara Torunoğlu-Selamet, Dogukan Arslan, Rodrigo Wilkens, Wei He, Doruk Eryiğit, Thomas Pickard, Adriana S. Pagano, Aline Villavicencio, Gülşen Eryiğit, Ágnes Abuczki, Aida Cardoso, Alesia Lazarenka, Dina Almassova, Amalia Mendes, Anna Kanellopoulou, Antoni Brosa-Rodríguez, Baiba Saulite, Beata Wojtowicz, Bolette Pedersen, Carlos Manuel Hidalgo-Ternero, Chaya Liebeskind, Danka Jokić, Diego Alves, Eleni Triantafyllidi, Erik Velldal, Fred Philippy, Giedre Valunaite Oleskeviciene, Ieva Rizgeliene, Inguna Skadina, Irina Lobzhanidze, Isabell Stinessen Haugen, Jauza Akbar Krito, Jelena M. Marković, Johanna Monti, Josue Alejandro Sauca, Kaja Dobrovoljc, Kingsley O. Ugwuanyi, Laura Rituma, Lilja Øvrelid, Maha Tufail Agro, Manzura Abjalova, Maria Chatzigrigoriou, María del Mar Sánchez Ramos, Marija Pendevska, Masoumeh Seyyedrezaei, Mehrnoush Shamsfard, Momina Ahsan, Muhammad Ahsan Riaz Khan, Nathalie Carmen Hau Norman, Nilay Erdem Ayyıldız, Nina Hosseini-Kivanani, Noémi Ligeti-Nagy, Numaan Naeem, Olha Kanishcheva, Olha Yatsyshyna, Daniil Orel, Petra Giommarelli, Petya Osenova, Radovan Garabik, Regina E. Semou, Rozane Rebechi, Salsabila Zahirah Pranida, Samia Touileb, Sanni Nimb, Sarfraz Ahmad, Sarvinoz Sharipova, Shahar Golan, Shaoxiong Ji, Sopuruchi Christian Aboh, Srdjan Sucur, Stella Markantonatou, Sussi Olsen, Vahide Tajalli, Veronika Lipp, Voula Giouli, Yelda Yeşildal Eraydın, Zahra Saaberi, Zhuohan Xie

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出XMPIE数据集,用于评估多语言多模态隐喻理解能力,包含34种语言和超过一万项内容,支持跨语言和跨模态的隐喻理解研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00618 2026-02-25 cs.CV 79%

RegTrack: Simplicity Beneath Complexity in Robust Multi-Modal 3D Multi-Object Tracking

RegTrack: 复杂性之下蕴含的简洁性在鲁棒多模态3D多目标跟踪中

Lipeng Gu, Xuefeng Yan, Song Wang, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) Shenzhen Institute of Research, Nanjing University of Aeronautics and Astronautics(深圳研究院,南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization, Nanjing, China(新型软件技术与产业化协同创新中心,南京,中国) School of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(计算机科学与控制工程学院,深圳大学先进技术学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 RegTrack通过统一三 cue 编码器实现鲁棒、高效且通用的多模态3D多目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20994 2026-02-25 eess.IV cs.AI cs.CL cs.CV cs.LG 78%

Multimodal MRI Report Findings Supervised Brain Lesion Segmentation with Substructures

多模态MRI报告辅助的监督性脑部病变分割与亚结构

Yubin Ge, Yongsong Huang, Xiaofeng Liu

机构 * Amazon AWS(亚马逊AWS) Yale University(耶鲁大学) Tohoku University(东北大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出MS-RSuper方法,通过解析报告中的定量和定性信息,结合亚结构和不确定性,提升脑部病变分割的准确性。

Comments IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21142 2026-02-25 cs.CV cs.LG 74%

LUMEN: Longitudinal Multi-Modal Radiology Model for Prognosis and Diagnosis

LUMEN: 长期多模态放射学模型用于预后和诊断

Zhifan Jiang, Dong Yang, Vishwesh Nath, Abhijeet Parida, Nishad P. Kulkarni, Ziyue Xu, Daguang Xu, Syed Muhammad Anwar, Holger R. Roth, Marius George Linguraru

机构 * 1 Sheikh Zayed Institute for Pediatric Surgical Innovation, Children's National Hospital, Washington DC, USA 2 Nvidia Corporation, Santa Clara, CA, USA 3 ETSI Telecomunicaci\' o n, Universidad Polit\' e cnica de Madrid, Madrid, Spain 4 School of Medicine Health Sciences, George Washington University, Washington DC, USA

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 LUMEN模型通过多任务指令微调提升纵向放射影像的诊断与预后能力。

Comments Accepted to IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01874 2026-02-25 cs.CV cs.AI 62%

CogFlow: Bridging Perception and Reasoning through Knowledge Internalization for Visual Mathematical Problem Solving

CogFlow:通过知识内化连接感知与推理以解决视觉数学问题

Shuhang Chen, Yunqiu Xu, Junjie Xie, Aojun Lu, Tao Feng, Zeying Huang, Ning Zhang, Yi Sun, Yi Yang, Hangjie Yuan

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Sichuan University(四川大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CogFlow通过知识内化连接感知与推理,提升视觉数学问题解决能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 57%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18296 2026-02-25 cs.CE cs.AI 57%

Context-Aware Mapping of 2D Drawing Annotations to 3D CAD Features Using LLM-Assisted Reasoning for Manufacturing Automation

基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏