arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-19 至 2026-03-19 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2603.17735 2026-03-19 cs.CV 57%

TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos

TAPESTRY:从几何到外观 via 一致的旋转台视频

Yan Zeng, Haoran Jiang, Kaixin Yao, Qixuan Zhang, Longwen Zhang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 TAPESTRY通过基于显式3D几何的视频扩散方法生成高保真旋转台视频,用于驱动纹理合成和神经渲染,实现高质量3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12220 2026-03-19 cs.CV 57%

TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation

TechImage-Bench: 基于评分标准的技术图像生成评估

Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft Project Website(微软项目网站)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17131 2026-03-19 cs.CV 57%

SMAL-pets: SMAL Based Avatars of Pets from Single Image

基于SMAL的宠物单图像生成高保真可编辑3D宠物化身

Piotr Borycki, Joanna Waczyńska, Yizhe Zhu, Yongqiang Gao, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) Huawei(华为)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SMAL-pets框架,通过混合架构结合3D高斯溅射与SMAL参数模型,实现单图像生成高质量可编辑宠物3D化身,支持通过文本提示进行外观和行为编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV 57%

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 24 篇

2504.04893 2026-03-19 cs.CV cs.AI 88%

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

SCAM:多模态基础模型的现实世界字形鲁棒性评估

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe

机构 * BLISS e.V.(BLISS协会) Berliner Hochschule für Technik (BHT)(柏林技术大学) Technische Universität Berlin(柏林技术大学) KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) Merantix Momentum(Merantix Momentum公司) Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。

Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2

Journal ref Journal of Data-centric Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 88%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17173 2026-03-19 cs.CV cs.AI 84%

Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience

通用多模态大语言模型通过人类显著性获得生物特征专家能力

Jacob Piland, Byron Dowling, Christopher Sweet, Adam Czajka

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究通用多模态大语言模型在隐私约束下通过人类显著性信息实现虹膜攻击检测的可行性,实验表明其在虹膜攻击检测中优于传统CNN模型和人工评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16934 2026-03-19 cs.CV cs.AI 84%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17476 2026-03-19 cs.CV cs.AI cs.CL 82%

UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models

UniSAFE:统一多模态模型安全评估的综合基准

Segyu Lee, Boryeong Cho, Hojung Jung, Seokhyun An, Juhyeong Kim, Jaehyun Kwak, Yongjin Yang, Sangwon Jang, Youngrok Park, Wonjun Chang, Se-Young Yun

机构 * KAIST AI(KAIST人工智能研究院) Department of Computer Science and Engineering, UNIST(UNIST计算机科学与工程系) Department of Mathematical Sciences, KAIST(KAIST数学科学系) University of Toronto(多伦多大学) KAIST CS(KAIST计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出UniSAFE基准,用于评估统一多模态模型的系统级安全性,发现多图像生成任务比文本生成任务更易出现安全漏洞。

Comments Equal contribution by first three authors, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21750 2026-03-19 cs.CV cs.AI cs.CL cs.RO 82%

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

SO-Bench:多模态大语言模型的结构输出评估

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出SO-Bench基准,评估多模态大语言模型在视觉输入下的结构化输出能力,揭示模型在准确性和符合数据模式方面的不足,并通过训练实验提升其结构化输出能力。

Comments v3 preprint. Added the link to the public benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16974 2026-03-19 cs.CV cs.AI 81%

Are a Thousand Words Better Than a Single Picture? Beyond Images -- A Framework for Multi-Modal Knowledge Graph Dataset Enrichment

千言胜过一幅图?超越图像——一个多模态知识图谱数据集增强框架

Pengyu Zhang, Klim Zaporojets, Jie Liu, Jia-Hong Huang, Paul Groth

机构 * University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学,荷兰阿姆斯特丹) Aarhus University, Aarhus, Denmark(哥本哈根大学,丹麦阿arhus) Amazon AGI, Seattle, USA(亚马逊人工智能实验室,美国西雅图)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Beyond Images框架,通过多阶段流程增强多模态知识图谱数据集,利用文本描述和大语言模型融合多源信息,提升图谱完成性能,实验显示在多个数据集上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17993 2026-03-19 cs.CV cs.RO 79%

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

GMT:用于3D场景中6自由度物体轨迹合成的目标条件多模态Transformer

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆桑大学人工智能研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GMT,一种多模态Transformer框架,通过结合3D边界框几何、点云上下文、语义物体类别和目标末端姿态,生成真实且目标导向的物体轨迹,提升了空间精度和方向控制。

Comments Accpeted by 3DV 2026. Project Page: https://huajian-zeng.github.io/projects/gmt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17304 2026-03-19 cs.CV 79%

3D MRI-Based Alzheimer's Disease Classification Using Multi-Modal 3D CNN with Leakage-Aware Subject-Level Evaluation

基于3D MRI的阿尔茨海默病分类:使用多模态3D CNN与泄漏感知的受试者级评估

Md Sifat, Sania Akter, Akif Islam, Md. Ekramul Hamid, Abu Saleh Musa Miah, Najmul Hassan, Md Abdur Rahim, Jungpil Shin

机构 * University of Rajshahi(拉贾斯坦大学) University of Aizu(御所大学) Pabna University of Science(帕布纳科学大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态3D卷积神经网络,利用原始OASIS 1 MRI体积进行阿尔茨海默病分类,通过受试者级交叉验证实现72.34%的准确率和0.7781的ROC AUC,验证了体积分析在疾病分类中的有效性。

Comments 5 tables, 6 figures, Submitted to International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11896 2026-03-19 cs.CV 79%

Digital FAST: An AI-Driven Multimodal Framework for Rapid and Early Stroke Screening

数字FAST:一种基于AI的多模态框架,用于快速和早期中风筛查

Ngoc-Khai Hoang, Thi-Nhu-Mai Nguyen, Huy-Hieu Pham

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种快速非侵入式多模态深度学习框架,用于基于F.A.S.T.评估数据的自动二分类中风筛查,通过融合面部表情、语音信号和上半身运动信息提升诊断鲁棒性,实验表明模型在准确率和F1分数上均优于单模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25620 2026-03-19 cs.CV 79%

LMOD+: A Comprehensive Multimodal Dataset and Benchmark for Developing and Evaluating Multimodal Large Language Models in Ophthalmology

LMOD+: 一个全面的多模态数据集和基准,用于开发和评估眼科中的多模态大语言模型

Zhenyue Qin, Yang Liu, Yu Yin, Jinyu Ding, Haoran Zhang, Anran Li, Dylan Campbell, Xuansheng Wu, Ke Zou, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih Chung Tham, Ninghao Liu, Xiuzhen Zhang, Qingyu Chen

机构 * School of Medicine, Yale University(耶鲁大学医学院) School of Computing, Australian National University(澳大利亚国立大学计算机学院) School of Engineering, Imperial College London(伦敦帝国理工学院工程学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨秀隆医学学院) National Eye Institute, National Institutes of Health(美国国立卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算机技术学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一个包含32633个实例的多模态眼科基准数据集,涵盖12种常见眼科疾病和5种成像模态,通过扩展数据集、扩展任务覆盖和系统评估24种最先进的MLLMs,推动眼科AI应用发展。

Comments ACM Transactions on Computing for Healthcare

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18694 2026-03-19 cs.RO cs.AI cs.SY eess.SY 79%

AgriChrono: A Multi-modal Dataset Capturing Crop Growth and Lighting Variability with a Field Robot

AgriChrono:一种捕捉作物生长和光照变化的多模态数据集

Jaehwan Jeong, Tuan-Anh Vu, Mohammad Jony, Shahab Ahmad, Md. Mukhlesur Rahman, Sangpil Kim, M. Khalid Jawed

机构 * Korea University(韩国大学) University of California, Los Angeles(加州大学洛杉矶分校) North Dakota State University(北达科他州立大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出AgriChrono数据集,通过多传感器平台采集农田动态变化数据,验证了高精度动态非刚性场景重建的挑战,推动农业机器人研究。

Comments Keywords: Agricultural Robotics, In-the-wild Dataset, 3D Reconstruction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17158 2026-03-19 cs.NI 78%

AI-Driven Multi-Modal Adaptive Handover Control Optimization for O-RAN

基于AI的多模态自适应切换控制优化用于O-RAN

Abdul Wadud, Fatemeh Golpayegani, Nima Afraz

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出一种多模态移动感知优化框架,通过rApp生成邻区推荐并结合E2测量实现切换决策,提升切换可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17746 2026-03-19 cs.CV 70%

Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation

概念到像素:无提示通用医学图像分割

Haoyun Chen, Fenghe Tang, Wenxin Ma, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Technology of China (USTC), Hefei, Anhui 230026, China Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu 215123, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China State Key Laboratory of Precision

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出C2P框架,通过分离解剖学知识为几何和语义表示,利用多模态大语言模型生成语义令牌,并引入几何令牌约束,实现无提示的通用医学图像分割,实验表明其在多种模态和数据集上表现优异。

Comments 32 pages, code is available at: https://github.com/Yundi218/Concept-to-Pixel

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15967 2026-03-19 cs.CV 70%

A Comprehensive Benchmark of Histopathology Foundation Models for Kidney Digital Pathology Images

一种针对肾数字病理图像的病理基础模型综合基准测试

Harishwar Reddy Kasireddy, Patricio S. La Rosa, Akshita Gupta, Anindya S. Paul, Jamie L. Fermin, William L. Clapp, Meryl A. Waldman, Tarek M. El-Ashkar, Sanjay Jain, Luis Rodrigues, Kuang Yu Jen, Avi Z. Rosenberg, Michael T. Eadon, Jeffrey B. Hodgin, Pinaki Sarder

机构 * Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Seed Production Innovation, Crop Science Division, Bayer Company(拜耳公司种子生产创新部) Division of Medicine – Quantitative Health, University of Florida(佛罗里达大学医学部-定量健康分部) Department of Health Outcomes and Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Pathology, Immunology and Laboratory Medicine, University of Florida College of Medicine(佛罗里达大学医学院病理学、免疫学与实验室医学系) Kidney Disease Branch, National Institute of Diabetes and Digestive and Kidney Diseases, National Institutes of Health(美国国立卫生研究院糖尿病、消化系统与肾病研究所肾病分支) Indiana University School of Medicine(印第安纳大学医学院) Departments of Medicine, Washington University School of Medicine(华盛顿大学医学院医学部) Universidade de Coimbra(科英布拉大学) Department of Pathology and Laboratory Medicine, University of California at Davis School of Medicine(加州大学戴维斯分校医学院病理学与实验室医学系) Department of Pathology, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院病理学系)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文评估了11种公开的病理基础模型在11个肾脏特定下游任务中的表现,揭示了其在肾病诊断中的适用性及改进方向。

Comments 31 Pages, 14 Tables, 12 figures, Co-correspondence to jhodgin@med.umich.edu and pinaki.sarder@ufl.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17413 2026-03-19 cs.CV 70%

Towards Motion-aware Referring Image Segmentation

面向运动感知的指认图像分割

Chaeyun Kim, Seunghoon Yi, Yejin Kim, Yohan Jo, Joonseok Lee

机构 * Seoul National University(首尔国立大学) AIM Intelligence(AIM智能)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出MRaCL方法,通过多模态径向对比学习提升运动相关查询的指认图像分割性能,并引入M-Bench基准测试运动主导的物体区分。

Comments Accepted at AISTATS 2026. * Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI 62%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17265 2026-03-19 cs.CV cs.CL 62%

LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis

LED:用于评估文档分析中布局错误检测的基准

Inbum Heo, Taewook Hwang, Jeesu Jung, Sangkeun Jung

机构 * Department of Computer Engineering Chungnam National Univ.(计算机工程系, 首尔国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出LED基准,用于评估文档分析中结构推理能力,定义八种标准错误类型并构建数据集,通过三种任务揭示模型在多模态和架构上的弱点。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL 62%

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17492 2026-03-19 cs.CV 57%

UAV-CB: A Complex-Background RGB-T Dataset and Local Frequency Bridge Network for UAV Detection

UAV-CB: 一种复杂背景RGB-T数据集和局部频率桥梁网络用于UAV检测

Shenghui Huang, Menghao Hu, Longkun Zou, Hongyu Chi, Zekai Li, Feng Gao, Fan Yang, Qingyao Wu, Ke Chen

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(南方科技大学) Peking University(北京大学) Xinjiang University(新疆大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UAV-CB数据集和LFBNet网络,针对低空环境中的UAV检测复杂背景和伪装问题,通过局部频率空间建模提升RGB-T融合性能,实验证明其在伪装和杂乱背景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17328 2026-03-19 cs.AI cs.LG 57%

A Progressive Visual-Logic-Aligned Framework for Ride-Hailing Adjudication

一种渐进式的视觉-逻辑对齐框架用于网约车责任判定

Weiming Wu, Zi-Jian Cheng, Jie Meng, Peng Zhen, Shan Huang, Qun Li, Guobin Wu, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出RideJudge框架,通过SynTraj合成轨迹模式和自适应上下文优化策略,解决网约车责任判定中的视觉与逻辑对齐问题,并采用有序敏感强化学习提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17186 2026-03-19 cs.CV cs.IR 57%

Visual Product Search Benchmark

视觉产品搜索基准

Karthik Sulthanpete Govindappa

机构 * nyris GmbH(nyris公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一个结构化的视觉嵌入模型基准,用于工业应用中的实例级图像检索,评估不同模型在真实场景下的性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05904 2026-03-19 cs.AR cs.AI 57%

LUMINA: LLM-Guided GPU Architecture Exploration via Bottleneck Analysis

LUMINA: 通过瓶颈分析指导的LLM引导的GPU架构探索

Tao Zhang, Rui Ma, Shuotao Xu, Yongqiang Xiong, Peng Cheng

机构 * Microsoft Research(微软研究院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 LUMINA利用AI提升GPU设计空间探索效率,通过自动编译DSE规则和基准测试,实现高效高质量的设计指导,比传统方法提升17.5倍效率和32.9%的设计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17851 2026-03-19 cs.RO 50%

DexViTac: Collecting Human Visuo-Tactile-Kinematic Demonstrations for Contact-Rich Dexterous Manipulation

DexViTac:收集人类视觉-触觉-运动示范以实现富接触的灵巧操作

Xitong Chen, Yifeng Pan, Min Li, Xiaotian Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology(智能制造装备与技术国家重点实验室) Huazhong University of Science and Technology(华中科技大学) Wuhan Huaweike Intelligent Technology Co., Ltd.(武汉华为凯科技有限公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 DexViTac通过高保真采集第一人称视觉、高密度触觉感知、末端执行器姿态和手部运动学,构建了超过2400个视觉-触觉-运动学示范的多模态数据集,提升了接触丰富灵巧操作的学习效率和成功率。

Comments 9 pages, 9 figures.Project page: https://xitong-c.github.io/DexViTac/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 10 篇

2509.13615 2026-03-19 cs.AI cs.CL cs.HC 81%

See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles

看见、思考、行动:通过识别切换器教多模态代理有效交互GUI

Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出State-aware Reasoning方法,通过识别当前切换状态和指令目标状态,提升多模态代理在GUI切换指令执行的准确性,实验显示准确率提升超30%。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 79%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏