arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-23 至 2026-03-23 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2603.20188 2026-03-23 cs.CV 57%

Wildfire Spread Scenarios: Increasing Sample Diversity of Segmentation Diffusion Models with Training-Free Methods

野火蔓延场景:通过无训练方法增加分割扩散模型的样本多样性

Sebastian Gerard, Josephine Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过无训练方法提升分割扩散模型样本多样性,验证了粒子引导和SPELL等技术在野火蔓延场景中的有效性,提升了HM IoU指标。

Comments Accepted at NLDL 2026. This version contains small corrections compared to the initial publication, see appendix for details

Journal ref Proceedings of the 7th Northern Lights Deep Learning Conference (NLDL), PMLR, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19970 2026-03-23 cs.LG cs.AI 57%

Graph2TS: Structure-Controlled Time Series Generation via Quantile-Graph VAEs

Graph2TS: 通过分位数图变分自编码器实现结构控制的时间序列生成

Shaoshuai Du, Joze M. Rozanec, Andy Pimentel, Ana-Lucia Varbanescu

机构 * Informatics Institute, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学信息学院) Computer Architecture for Embedded Systems, University of Twente, Enschede, The Netherlands(特文特大学嵌入式系统计算机架构) Laboratory of Artificial Intelligence, Institute Jozef Stedan, Ljubljana, Slovenia(乔泽夫·斯特达安研究所人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Graph2TS,通过分位数图变分自编码器实现时间序列生成,通过结构与残差分离提升分布保真度和时序对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19752 2026-03-23 cs.CV 57%

PhysNeXt: Next-Generation Dual-Branch Structured Attention Fusion Network for Remote Photoplethysmography Measurement

PhysNeXt:下一代双分支结构注意力融合网络用于远程光体积脉搏波测记测量

Junzhe Cao, Bo Zhao, Zhiyi Niu, Dan Guo, Yue Sun, Haochen Liang, Yong Xu, Zitong YU

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Hefei University of Technology(合肥工业大学) Macao Polytechnic University(澳门理工学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 PhysNeXt通过融合视频帧和STMap表示,结合时空差分建模单元和跨模态交互模块,提升rPPG信号提取的鲁棒性,实验表明其在挑战性条件下具有更稳定和精细的信号恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 18 篇

2603.19744 2026-03-23 cs.CL 83%

Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking

重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究

Tomas Ruiz, Tanalp Agustoslu, Carsten Schwemmer

机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。

Comments 6 pages, 3 tables, 1 figure

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI 81%

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20148 2026-03-23 cs.CV 79%

Can Large Multimodal Models Inspect Buildings? A Hierarchical Benchmark for Structural Pathology Reasoning

大型多模态模型能否检查建筑?一种用于结构病理推理的分层基准

Hui Zhong, Yichun Gao, Luyan Liu, Hai Yang, Wang Wang, Haowei Zhang, Xinhu Zheng

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DefectBench基准,评估大型多模态模型在建筑表面检测中的能力,发现其在拓扑理解和语义理解方面表现优异,但在精确定位方面存在不足,并验证了零样本生成分割的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL 79%

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09833 2026-03-23 cs.LG 78%

ACT as Human: Multimodal Large Language Model Data Annotation with Critical Thinking

ACT作为人类:多模态大语言模型数据标注中的批判性思维

Lequan Lin, Dai Shi, Andi Han, Feng Chen, Qiuzheng Chen, Jiawen Li, Zhaoyang Li, Jiyuan Li, Zhenbang Sun, Junbin Gao

机构 * University of Sydney(悉尼大学) University of Cambridge(剑桥大学) Riken AIP(理化学研究所AIP分所) University of Adelaide(阿德莱德大学) ByteDance Australia(字节跳动澳大利亚)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出ACT标注框架,利用大语言模型作为评判者提高标注效率,通过批判性思维识别潜在错误,减少人工成本,提升标注质量。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02835 2026-03-23 cs.LG 78%

Subject-Adaptive Sparse Linear Models for Interpretable Personalized Health Prediction from Multimodal Lifelog Data

面向可解释个性化健康预测的主体适应稀疏线性模型

Dohyun Bu, Jisoo Han, Soohwa Kwon, Yulim So, Jong-Seok Lee

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出SASL框架,结合普通最小二乘回归与主体特定交互,通过迭代后向特征消除构建稀疏模型,并结合LightGBM提升预测性能,实现可解释的个性化健康预测。

Comments 6 pages, ICTC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19327 2026-03-23 cs.DL cond-mat.mtrl-sci 78%

Benchmarking Cross-Scale Perception Ability of Large Multimodal Models in Material Science

对材料科学中大多模态模型跨尺度感知能力的基准测试

Yuting Zheng, Zijian Chen, Qi Jia

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出CSMBench,通过评估多尺度下的图像描述和标题匹配任务,揭示了现有模型在不同物理尺度上的性能差异,强调了实现材料研究层次化准确理解的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12180 2026-03-23 cs.CL cs.AI 62%

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

策略导航还是随机搜索?智能体和人类如何在文档集合上进行推理

Łukasz Borchmann, Jordy Van Landeghem, Michał Turski, Shreyansh Padarha, Ryan Othniel Kearns, Adam Mahdi, Niels Rogge, Clémentine Fourrier, Siwei Han, Huaxiu Yao, Artemis Llabrés, Yiming Xu, Dimosthenis Karatzas, Hao Zhang, Anupam Datta

机构 * Snowflake\,AI\,Research University\,of\,Oxford Computer\,Vision\,Center

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过MADQA基准测试,探讨智能体与人类在文档检索中的策略性推理与随机搜索差异,揭示最佳智能体在准确性上接近人类,但依赖暴力搜索而非有效策略规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 62%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18048 2026-03-23 cs.AI cs.SD eess.AS 62%

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19863 2026-03-23 cs.CV 57%

MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment

MedQ-Engine:一种用于医疗图像质量评估中进化多模态大语言模型的闭环数据引擎

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedQ-Engine,通过闭环数据引擎迭代评估模型,发现失败原型,利用人类在循环注释提升模型性能,使8B参数模型在医疗图像质量评估中超越GPT-4o 13%并接近人类专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19779 2026-03-23 cs.CV 57%

One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment

一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估

Wen Yin, Cencen Liu, Dingrui Liu, Bing Su, Yuan-Fang Li, Tao He

机构 * University of Electronic Science and Technology of China(电子科技大学) Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19765 2026-03-23 cs.CV 57%

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK:一种用于高级MLLMs细粒度幻觉评估的基准测试

Zhihan Yin, Jianxin Liang, Yueqian Wang, Yifeng Yao, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FREAK基准测试,通过高质量图像评估MLLMs在细粒度视觉感知中的幻觉问题,揭示了现有模型在详细视觉感知上的严重幻觉问题。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17318 2026-03-23 cs.RO cs.AI cs.CE cs.LG physics.app-ph 57%

FORWARD: Dataset of a forwarder operating in rough terrain

FORWARD:在崎岖地形中操作的前送机数据集

Mikael Lundbäck, Erik Wallin, Carola Häggström, Mattias Nyström, Andreas Grönlund, Mats Richardson, Petrus Jönsson, William Arnvik, Lucas Hedström, Arvid Fälldin, Martin Servin

机构 * Umeå University(乌梅亚大学) Swedish University of Agricultural Sciences(瑞典农业科学大学) Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。

Comments 33 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24897 2026-03-23 cs.AI 57%

RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark

RealUnify: 统一模型真的能从统一中受益吗?一个全面的基准测试

Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu

机构 * PKU(北京大学) Kling Team(Kling团队) NTU(国立台湾大学) CASIA(中国科学院自动化研究所) NUS(国立新加坡大学) USTC(中国科学技术大学) THU(清华大学) ZJU(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 RealUnify基准测试旨在评估统一模型中理解与生成能力的双向协同效应,通过10类32子任务的1000个人工标注实例,揭示现有统一模型在协同能力上的不足,强调需新的训练策略来提升统一建模潜力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19517 2026-03-23 cs.CV cs.LG 57%

ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding

ReXInTheWild:医疗照片理解的统一基准

Oishi Banerjee, Sung Eun Kim, Alexandra N. Willauer, Julius M. Kernbach, Abeer Rihan Alomaish, Reema Abdulwahab S. Alghamdi, Hassan Rayhan Alomaish, Mohammed Baharoon, Xiaoman Zhang, Julian Nicolas Acosta, Christine Zhou, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究所) Department of Medicine, Division of Gastroenterology, Massachusetts General Hospital(麻省总医院内科与消化内科部门) Department of Neuroradiology, Heidelberg University Hospital(海德堡大学医院神经放射科部门) King Abdulaziz Medical City, National Guard Health Affairs(国王阿卜杜勒-阿齐兹医疗城,国民守卫健康事务局) Division of Pulmonary, Critical Care, and Sleep Medicine, University of Cincinnati(辛辛那提大学肺科、重症医学及睡眠医学部门)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ReXInTheWild基准,通过484张医学文献来源的照片和7个临床主题的955个多项选择问题,评估视觉-语言模型对医疗照片内容的理解能力,揭示不同模型在细粒度图像理解和医学推理上的性能差异。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23295 2026-03-23 cs.CV 57%

LED Benchmark: Diagnosing Structural Layout Errors for Document Layout Analysis

LED基准:诊断文档布局分析中的结构性布局错误

Inbum Heo, Taewook Hwang, Jeesu Jung, Sangkeun Jung

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LED基准,用于评估文档布局预测的结构鲁棒性,通过定义八种标准错误类型和三个互补任务,解决传统指标无法检测的结构性错误问题。

Comments This work has been substantially revised, including updates to the title and content. The revised version is available as arXiv:2603.17265

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19914 2026-03-23 cs.HC cs.RO 50%

Sense4HRI: A ROS 2 HRI Framework for Physiological Sensor Integration and Synchronized Logging

Sense4HRI: 一种基于ROS 2的人机交互框架,用于生理传感器集成与同步日志记录

Manuel Scheibl, Julian Leichert, Sinem Görmez, Britta Wrede

机构 * Medical Assistance Systems, Medical School OWL, Bielefeld University(比勒菲尔德大学医疗援助系统,医学学校OWL)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出Sense4HRI框架,用于在ROS 2中整合生理信号并提供标准化的多模态分析,支持可扩展的生理传感器集成与同步日志记录。

Comments 6 pages, 3 figures, submitted at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 7 篇

2603.01038 2026-03-23 cs.CV cs.AI 81%

From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

从直觉到探究:一种工具增强的推理MLLM框架用于可推广的面部反伪装

Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS智能科学研究院) MAIS, CASIA(CASIA模式识别与智能信息处理研究院) Baidu Inc(百度公司) CAIR, HKISI, CAS(HKISI CAS计算机视觉研究院) M.U.S.T

专题命中 多模态Agent :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TAR-FAS框架,通过整合外部视觉工具提升面部反伪装的泛化能力,采用CoT-VT范式使MLLM深入分析细微伪装线索,实验表明其在跨域协议下达到SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16931 2026-03-23 cs.AI cs.RO 79%

Multimodal Fused Learning for Solving the Generalized Traveling Salesman Problem in Robotic Task Planning

多模态融合学习用于解决机器人任务规划中的广义旅行商问题

Jiaqi Cheng, Mingfeng Fan, Xuefeng Zhang, Jingsong Liang, Yuhong Cao, Guohua Wu, Guillaume Adrien Sartoretti

机构 * Central South University(中南大学) National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多模态融合学习框架,通过图和图像表示捕捉问题互补方面,生成高质量实时任务规划方案,实验表明其在各类GTSP实例中性能优于现有方法。

Comments 14 pages, 6 figures, Proceedings of the Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00171 2026-03-23 cs.CV 70%

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent:一种用于视觉合规验证的代理框架

Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

机构 * Generative AI Innovation Center(生成式人工智能创新中心) Amazon Web Services(亚马逊网络服务)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 57%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19270 2026-03-23 cs.CL cs.LG 57%

Autonoma: A Hierarchical Multi-Agent Framework for End-to-End Workflow Automation

Autonoma:面向端到端工作流自动化的分层多智能体框架

Eslam Reda, Maged Yasser, Sara El-Metwally

机构 * Artificial Intelligence Program, Faculty of Computers and Information, Mansoura University(人工智能项目,计算机与信息学院,曼苏拉大学) Computer Science Department, Faculty of Computers and Information, Mansoura University(计算机科学系,计算机与信息学院,曼苏拉大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL

AI总结 本文提出Autonoma框架,通过分层多智能体结构实现端到端工作流自动化,解决传统单一架构在可扩展性、错误传播和任务聚焦方面的不足,实现高可靠性与可扩展性。

Comments 26 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19858 2026-03-23 cs.RO cs.MA 50%

Beyond detection: cooperative multi-agent reasoning for rapid onboard EO crisis response

超越检测:用于快速在轨遥感危机响应的协作多智能体推理

Alejandro D. Mousist, Pedro Delgado de Robles Martín, Raquel Lladró Climent, Julian Cobos Aparicio

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。

Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19555 2026-03-23 astro-ph.IM 50%

SpecZoo: An AI-Powered Platform for Spectral Analysis and Visualization in Science and Education

SpecZoo:一个基于AI的天文光谱分析与可视化平台

Yuan-Hao Pu, Guo-Hong Lei, Yang Xu, Xun-Zhou Chen, Hai-Jun Tian

专题命中 多模态Agent :multi-modal(abstract)

AI总结 SpecZoo平台利用人工智能技术,整合现代信息技术和机器学习,提升光谱数据处理效率,支持光谱可视化、自动分类、参数测量及多波段数据融合,应用于LAMOST、SDSS等重大项目,并促进天文与数据科学的教育融合。

Comments 19 pages, 11 figures, 2 tables, published in the journal of 'universe' (see the special issue: https://www.mdpi.com/journal/universe/special_issues/77CGKMGC3Q)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 12 篇

2603.19807 2026-03-23 cs.CV cs.AI 84%

Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision

通过语义引导监督增强统一多模态模型的对齐

Jiyeong Kim, Yerim So, Hyesong Choi, Uiwon Hwang, Dongbo Min

机构 * Ewha Womans University(成均馆大学) Soongsil University(顺天大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Semantically-Grounded Supervision方法,通过构建视觉接地图和语义引导的破坏输入,解决统一多模态模型中的粒度不匹配和监督冗余问题,提升生成质量和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19623 2026-03-23 cs.CV 83%

Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement

解耦后再对齐:通过跨尺度特征解耦实现非迭代混合多模态图像配准

Chunlei Zhang, Jiahao Xia, Yun Xiao, Bo Jiang, Jian Zhang

机构 * Faculty of Engineering and IT, University of Technology Sydney(新南威尔士大学工程与信息技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HRNet网络,通过解耦表示与混合参数预测,解决多模态图像配准中共享空间不稳定和单类型变换限制的问题,实现非迭代的粗到细配准。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏