arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 80 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2604.13073 2026-04-16 cs.CL cs.AI cs.MM 87%

OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs

OmniTrace:面向多模态大语言模型生成过程的统一归因框架

Qianqi Yan, Yichen Guo, Ching-Chen Kuo, Shan Jiang, Hang Yin, Yang Zhao, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) eBay

专题命中 多模态生成 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 OmniTrace提出一种轻量级框架,通过生成过程追踪实现多模态大语言模型的统一归因,提供跨模态解释并提升解释的稳定性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13540 2026-04-16 cs.CV cs.AI 81%

Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding

统一多模态模型的免费午餐:通过内在理解的反思校正增强生成

Yibo Jiang, Tao Wu, Rui Jiang, Yehao Lu, Chaoxiang Cai, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science(计算机科学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniRect-CoT框架,通过反思校正提升统一多模态模型的生成能力,利用内部知识校正中间结果,增强生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13236 2026-04-16 cs.CV cs.AI eess.IV 81%

SemiFA: An Agentic Multi-Modal Framework for Autonomous Semiconductor Failure Analysis Report Generation

SemiFA:一种用于自主半导体故障分析报告生成的代理多模态框架

Shivam Chand Kaushik

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院贾尔普尔)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 SemiFA通过多代理语言图框架实现自主生成半导体故障分析报告,利用多模态数据融合提升根因分析精度,首次整合SECS/GEM设备 telemetry 进行自动化报告生成。

Comments 11 pages, 6 figures, 8 tables. Dataset available at https://huggingface.co/datasets/ShivamChand/SemiFA-930. Code available at https://github.com/Shivamckaushik/SemiFA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13046 2026-04-16 cs.DB cs.CL cs.IR cs.LG cs.PL 79%

A Domain-Specific Language for LLM-Driven Trigger Generation in Multimodal Data Collection

面向LLM驱动触发生成的领域特定语言

Philipp Reis, Philipp Rigoll, Martin Zehetner, Jacqueline Henle, Stefan Otten, Eric Sax

机构 * FZI Research Center for Information Technology(FZI信息与技术研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出一种基于领域特定语言的意图驱动数据收集框架,通过自然语言交互与形式化规范相结合,实现多模态传感器数据的选择性采集,提升生成一致性与执行效率。

Comments Version submitted to the IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20340 2026-04-16 cs.SE cs.AI 74%

ContractSkill: Repairable Contract-Based Skills for Multimodal Web Agents

ContractSkill:可修复的基于合同的多模态网络代理技能

Zijian Lu, Yiping Zuo, Yupeng Nie, Xin He, Weibei Fan, Lianyong Qi, Shi Jin

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) China University of Petroleum (East China)(中国石油大学(华东)) Southeast University(东南大学)

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 本文提出ContractSkill框架,通过将草案技能转换为可执行的显式过程结构,解决网络代理技能隐含导致无法检查和局部修复的问题,实验证明其在真实网络环境中的有效性。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14148 2026-04-16 cs.CV 57%

Seedance 2.0: Advancing Video Generation for World Complexity

Seedance 2.0:提升世界复杂度的视频生成

Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei Chen, Feng Cheng, Tianheng Cheng, Yufeng Cheng, Mojie Chi, Xuyan Chi, Jian Cong, Qinpeng Cui, Fei Ding, Qide Dong, Yujiao Du, Haojie Duanmu, Junliang Fan, Jiarui Fang, Jing Fang, Zetao Fang, Chengjian Feng, Yu Gao, Diandian Gu, Dong Guo, Hanzhong Guo, Qiushan Guo, Boyang Hao, Hongxiang Hao, Haoxun He, Jiaao He, Qian He, Tuyen Hoang, Heng Hu, Ruoqing Hu, Yuxiang Hu, Jiancheng Huang, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Jishuo Jin, Ming Jing, Ashley Kim, Shanshan Lao, Yichong Leng, Bingchuan Li, Gen Li, Haifeng Li, Huixia Li, Jiashi Li, Ming Li, Xiaojie Li, Xingxing Li, Yameng Li, Yiying Li, Yu Li, Yueyan Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Wang Liao, J. H. Lien, Shanchuan Lin, Xi Lin, Feng Ling, Yue Ling, Fangfang Liu, Jiawei Liu, Jihao Liu, Jingtuo Liu, Shu Liu, Sichao Liu, Wei Liu, Xue Liu, Zuxi Liu, Ruijie Lu, Lecheng Lyu, Jingting Ma, Tianxiang Ma, Xiaonan Nie, Jingzhe Ning, Junjie Pan, Xitong Pan, Ronggui Peng, Xueqiong Qu, Yuxi Ren, Yuchen Shen, Guang Shi, Lei Shi, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Wenjing Tang, Boyang Tao, Zirui Tao, Dongliang Wang, Feng Wang, Hulin Wang, Ke Wang, Qingyi Wang, Rui Wang, Shuai Wang, Shulei Wang, Weichen Wang, Xuanda Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Zijie Wang, Ziyu Wang, Guoqiang Wei, Meng Wei, Di Wu, Guohong Wu, Hanjie Wu, Huachao Wu, Jian Wu, Jie Wu, Ruolan Wu, Shaojin Wu, Xiaohu Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Xin Xia, Xuefeng Xiao, Shuang Xu, Bangbang Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yihang Yang, Zhixian Yang, Ziyan Yang, Fulong Ye, Bingqian Yi, Xing Yin, Yongbin You, Linxiao Yuan, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Siyu Zhai, Zhonghua Zhai, Bowen Zhang, Chenlin Zhang, Heng Zhang, Jun Zhang, Manlin Zhang, Peiyuan Zhang, Shuo Zhang, Xiaohe Zhang, Xiaoying Zhang, Xinyan Zhang, Xinyi Zhang, Yichi Zhang, Zixiang Zhang, Haiyu Zhao, Huating Zhao, Liming Zhao, Yian Zhao, Guangcong Zheng, Jianbin Zheng, Xiaozheng Zheng, Zerong Zheng, Kuan Zhu, Feilong Zuo

机构 * ByteDance Seed(字节跳动Seed)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Seedance 2.0通过统一高效架构提升多模态音频视频生成能力,支持文本、图像、音频、视频四种输入模态,提供高质量生成体验。

Comments Seedance 2.0 Model Card

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21912 2026-04-16 cs.LG stat.ML 50%

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching

离散指导匹配:用于离散流匹配的精确指导

Zhengyan Wan, Yidong Ouyang, Liyan Xie, Fang Fang, Hongyuan Zha, Guang Cheng

机构 * School of Statistics, East China Normal University(华东师范大学统计学院) Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计系) Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种新的离散数据指导框架,通过推导所需分布的精确转移率,提高采样效率,并展示了其在能量引导模拟和文本到图像生成中的有效性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 18 篇

2604.13648 2026-04-16 cs.SE 85%

Figma2Code: Automating Multimodal Design to Code in the Wild

Figma2Code: 将多模态设计转换为代码的自动化

Yi Gui, Jiawan Zhang, Yina Wang, Tianran Ma, Yao Wan, Shilin He, Dongping Chen, Zhou Zhao, Wenbin Jiang, Xuanhua Shi, Hai Jin, Philip S Yu

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文提出Figma2Code任务,通过收集Figma文件元数据与设计图像,构建高质量数据集,评估多种多模态大语言模型,发现专有模型在视觉保真度上表现优异,但布局响应性和代码可维护性有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL 85%

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 84%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13252 2026-04-16 cs.LG cs.AI 83%

Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference

脱离上下文:多模态异常检测的可靠性需要上下文推断

Kevin Wilkinghoff, Neelu Madan, Juan Miguel Valverde, Kamal Nasrollahi, Radu Tudor Ionescu, Rafal Wisniewski, Thomas B. Moeslund, Wenwu Wang, Zheng-Hua Tan

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(先锋人工智能中心) Technical University of Denmark(丹麦技术大学) Milestone Systems(Milestone系统) University of Bucharest(布加勒斯特大学) University of Surrey(萨里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 多模态异常检测需通过上下文推断区分真实异常与环境变化,提出跨模态上下文推断框架以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12632 2026-04-16 eess.IV cs.CV 83%

Cyclic 2.5D Perceptual Loss for Cross-Modal 3D Medical Image Synthesis: T1w MRI to Tau PET

循环2.5D感知损失用于跨模态3D医学图像合成:T1加权MRI到tau PET

Junho Moon, Symac Kim, Haejun Chung, Ikbeom Jang

机构 * Department of Artificial Intelligence, Hanyang University, Seoul, South Korea(人工智能系,翰阳大学,首尔,韩国) Department of Electronic Engineering, Hanyang University, Seoul, South Korea(电子工程系,翰阳大学,首尔,韩国) Division of Computer Engineering, Hankuk University of Foreign Studies, Yongin, South Korea(计算机工程系,韩国外语大学, Yongin,韩国) Division of AI Data Convergence, Hankuk University of Foreign Studies, Yongin, South Korea(AI数据融合系,韩国外语大学, Yongin,韩国) Division of Language & AI, Hankuk University of Foreign Studies, Seoul, South Korea(语言与AI系,韩国外语大学,首尔,韩国)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出循环2.5D感知损失用于从T1加权MRI生成tau PET,通过交替优化不同切面提升体积一致性,并标准化SUVR以提高准确性。

Comments Published in Human Brain Mapping, available at https://doi.org/10.1002/hbm.70508

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV 82%

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25924 2026-04-16 cs.CV cs.AI cs.IR 81%

Good Scores, Bad Data: A Metric for Multimodal Coherence

好分数,坏数据:一种多模态一致性度量

Vasundra Srinivasan

机构 * AI Architect(人工智能架构师) Author, Data Engineering for Multimodal AI (O’Reilly)(多模态AI数据工程作者(O’Reilly)) Stanford School of Engineering, Graduate Certificate (in progress)(斯坦福工程学院,研究生证书(在读))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态一致性度量(MCS),用于评估多模态融合质量,不依赖下游模型。通过四个维度(身份、空间、语义、决策)评估,MCS在1000张视觉基因组图像和150张COCO图像上验证,比任务准确率更敏感。

Comments 9 pages, 6 figures, NeurIPS 2024 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13060 2026-04-16 cs.CL cs.LG cs.MM 81%

Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage

牙科分诊基准:用于分层牙科分诊的多模态推理基准

Ziyi He, Yushi Feng, Shuangyu Yang, Yinghao Zhu, Xichen Zhang, Pak Chuen Patrick Tai, Hei Yuet Lo, Songying Wu, Weifa Yang, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) The Prince Philip Dental Hospital(菲利普王子牙科医院) Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 本文提出Dental-TriageBench,首个专家标注的多模态牙科分诊基准,通过246个脱敏案例评估19种模型在细粒度治疗层面分诊中的表现,揭示了人类与模型间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13142 2026-04-16 cs.RO cs.CV cs.DB 79%

Multi-modal panoramic 3D outdoor datasets for place categorization

多模态全景三维户外数据集用于场所分类

Hojung Jung, Yuki Oto, Oscar M. Mozos, Yumi Iwashita, Ryo Kurazume

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院) Polytechnic University of Cartagena (UPCT)(卡塔赫纳理工学院) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出两个多模态全景三维户外数据集,用于语义场所分类,包含森林、海岸、住宅区、城市区及室内外停车场六类,通过激光扫描和同步图像获取数据,并比较了多种分类方法,取得高准确率。

Comments This is the authors' manuscript. The final published article was presented at IROS 2026, and it is available at https://doi.org/10.1109/IROS.2016.7759669

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13756 2026-04-16 cs.CL cs.CV 79%

MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging

MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架

Zhijie Bao, Fangke Chen, Licheng Bao, Chenhui Zhang, Wei Chen, Jiajie Peng, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 多模态评测 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13942 2026-04-16 cs.CV cs.AI cs.LG 62%

Frozen Forecasting: A Unified Evaluation

冻结预测:一种统一的评估

Jacob C Walker, Pedro Vélez, Luisa Polania Cabrera, Guangyao Zhou, Sayna Ebrahimi, Rishabh Kabra, Carl Doersch, Maks Ovsjanikov, João Carreira, Shiry Ginosar

机构 * Google DeepMind(谷歌DeepMind) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种统一的评估框架,用于评估冻结视觉骨干在多样化任务和抽象层次上的预测能力,通过训练潜在扩散模型直接在表示空间中预测未来特征,发现预测性能与感知质量密切相关,视频预训练模型表现优于图像预训练模型。

Comments New Title, Additional Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19088 2026-04-16 cs.CL cs.CV 62%

Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions

破解 juxtaposition 的密码:AI 模型能否理解幽默的矛盾

Zhe Hu, Tuo Liang, Jing Li, Yiren Lu, Yunlai Zhou, Yiran Qiao, Jing Ma, Yu Yin

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了AI在理解基于矛盾叙事的幽默中的挑战,通过引入YesBut基准测试,评估大型语言模型在识别和解释漫画中的表现,发现即使是最先进的模型仍无法匹敌人类水平。

Comments NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14089 2026-04-16 cs.RO cs.AI 57%

UMI-3D: Extending Universal Manipulation Interface from Vision-Limited to 3D Spatial Perception

UMI-3D:从视觉受限到3D空间感知的通用操作接口扩展

Ziming Wang

机构 * HKU(香港大学) USTC(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 UMI-3D通过集成轻量级低成本LiDAR传感器,提升数据采集的鲁棒性和可扩展性,实现3D空间感知,增强操作任务的性能与可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 57%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13456 2026-04-16 cs.LG cs.CV 57%

MyoVision: A Mobile Research Tool and NEATBoost-Attention Ensemble Framework for Real Time Chicken Breast Myopathy Detection

MyoVision:一种移动研究工具和NEATBoost-Attention集成框架用于实时鸡胸肌病检测

Chaitanya Pallerla, Siavash Mahmoudi, Dongyi Wang

机构 * Department of Biological and Agricultural Engineering, University of Arkansas(亚拉巴马大学生物与农业工程系) Department of Food Science, University of Arkansas(亚拉巴马大学食品科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MyoVision移动透光成像框架,结合NEATBoost-Attention模型实现低成本多类肌病检测,测试准确率达82.4%,优于传统方法并匹配高成本高光谱成像系统性能。

Comments Accepted at CVPR 2026 MetaFoods Workshop. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13409 2026-04-16 cs.CV 57%

CausalDisenSeg: A Causality-Guided Disentanglement Framework with Counterfactual Reasoning for Robust Brain Tumor Segmentation Under Missing Modalities

CausalDisenSeg: 一种基于因果推理的解耦框架,用于在缺失模态下的鲁棒脑肿瘤分割

Bo Liu, Yulong Zou, Jin Hong

机构 * School of Information Engineering, Nanchang University(南昌大学信息工程学院) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CausalDisenSeg框架,通过因果引导的解耦和反事实推理,解决多模态脑肿瘤分割中因模态偏差导致的鲁棒性问题,实验显示其在严重缺失模态场景下准确性和一致性均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13635 2026-04-16 cs.CV 57%

SemAttNet: Towards Attention-based Semantic Aware Guided Depth Completion

SemAttNet:基于注意力的语义感知引导深度补全

Danish Nazir, Marcus Liwicki, Didier Stricker, Muhammad Zeshan Afzal

机构 * Department of Computer Science, University of Kaiserslautern, 67663 Kaiserslautern, Germany(凯斯莱特大学计算机科学系) Mindgrage, University of Kaiserslautern, 67663 Kaiserslautern, Germany(Mindgrage凯斯莱特大学) Department of Computer Science, Luleå University of Technology, 971 87 Luleå, Sweden(卢勒奥技术大学计算机科学系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SemAttNet,通过三分支架构结合颜色、语义和深度引导,利用注意力机制融合特征,提升深度补全精度,实验表明在KITTI基准上达到最优性能。

Comments accepted at IEEE Access

Journal ref IEEE Access, vol. 10, pp. 120781-120791, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03596 2026-04-16 stat.ME 50%

SMART-MC: Characterizing the Dynamics of Multiple Sclerosis Therapy Transitions Using a Covariate-Based Markov Model

SMART-MC:利用基于协变量的马尔可夫模型研究多发性硬化症治疗转换的动力学

Beomchang Kim, Zongqi Xia, Priyam Das

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出SMART-MC模型,通过协变量影响治疗转换概率,解决参数可识别性和稀疏转换处理问题,揭示多发性硬化症患者亚组的治疗转换差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 13 篇

2604.12213 2026-04-16 cs.AI cs.MA cs.SE 83%

Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension

代理到代理网络中的模态本原路由:一种多模态A2A协议扩展

Vasundra Srinivasan

机构 * AI Architect, Author—Data Engineering for Multimodal AI (O’Reilly)(人工智能架构师,作者—多模态AI的数据工程(O’Reilly)) Stanford School of Engineering (April 2026)(斯坦福大学工程学院(2026年4月))

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出MMA2A架构,通过多模态本原路由提升任务准确率,其在跨模态任务中表现优于文本瓶颈基线,尤其在视觉依赖任务中效果显著,但增加了1.8倍的延迟。

Comments 14 pages, 4 figures (TikZ). PDFLaTeX. Supplementary code and experiment artifacts: https://github.com/vasundras/modality-native-routing-a2a-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20490 2026-04-16 cs.MA cs.CL cs.CV 81%

RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows

RadAgents: 多模态代理推理用于胸片解读的放射科工作流程

Kai Zhang, Corey D Barrett, Jangwon Kim, Lichao Sun, Tara Taghavi, Krishnaram Kenthapadi

机构 * Oracle Health AI Lehigh University(莱荷大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 RadAgents通过结合临床先验知识和任务感知的多模态推理,构建模块化、可审计的放射科工作流程,提升胸片解读的可靠性与临床一致性。

Comments MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13397 2026-04-16 cs.CV 79%

A Multimodal Clinically Informed Coarse-to-Fine Framework for Longitudinal CT Registration in Proton Therapy

一种多模态的临床导向粗到细框架用于质子治疗纵向CT配准

Caiwen Jiang, Yuzhen Ding, Mi Jia, Samir H. Patel, Terence T. Sio, Jonathan B. Ashman, Lisa A. McGee, Jean-Claude M. Rwigema, William G. Rule, Sameer R. Keole, Sujay A. Vora, William W. Wong, Nathan Y. Yu, Michele Y. Halyard, Steven E. Schild, Dinggang Shen, Wei Liu

机构 * Department of Radiation Oncology, Mayo Clinic, Phoenix, Arizona, USA(梅奥诊所放射肿瘤科) School of Biomedical Engineering, ShanghaiTech University, Shanghai, China(上海科技大学生物医学工程学院) Shanghai United Imaging Intelligence Co., Ltd., Shanghai 200230, China(上海联合影像智能科技有限公司) Shanghai Artificial Intelligence Laboratory, Shanghai 200232, China(上海人工智能实验室) Shanghai Clinical Research and Trial Center, Shanghai 201210, China(上海临床研究与试验中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态的临床导向粗到细框架,结合质子放疗工作流程中的多种信息,提升纵向CT配准的准确性和临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13488 2026-04-16 cs.AI 77%

Towards Scalable Lightweight GUI Agents via Multi-role Orchestration

通过多角色编排实现可扩展的轻量级GUI代理

Ziwei Wang, Junjie Zheng, Leyang Yang, Sheng Zhou, Xiaoxuan Tang, Zhouhua Fang, Zhiwei Liu, Dajun Chen, Yong Li, Jiajun Bu

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可及感知与智能系统重点实验室,浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) AntGroup(蚂蚁集团)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出LAMO框架,通过多角色编排提升轻量级GUI代理的任务扩展性,开发出支持单体执行和多代理系统编排的LAMO-3B代理,结合先进规划器实现持续性能提升。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13822 2026-04-16 cs.LG 67%

UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization

UI-Copilot: 通过工具集成策略优化推进长周期GUI自动化

Zhengxi Lu, Fei Tang, Guangyi Liu, Kaitao Song, Xu Tan, Jin Ma, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 本文提出UI-Copilot框架,通过分离持久观察与临时执行上下文实现内存解耦,结合工具集成策略优化提升长周期GUI任务性能,实验显示其在MemGUI-Bench和AndroidWorld上均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏