arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2603.11698 2026-04-20 cs.CV cs.AI cs.CL 75%

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16170 2026-04-20 cs.CV cs.CE 74%

neuralCAD-Edit: An Expert Benchmark for Multimodal-Instructed 3D CAD Model Editing

neuralCAD-Edit:一个多模态指令引导的3D CAD模型编辑专家基准

Toby Perrett, Matthew Bouchard, William McCarthy

机构 * Autodesk Research(Autodesk研究院)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本文提出neuralCAD-Edit,首个基于专家CAD工程师采集的3D CAD模型编辑基准。通过捕捉专业设计师与CAD模型交互的视频,收集真实编辑请求,发现基础模型在自动指标和人工评估中均显著落后于CAD专家。

Comments Project page: https://autodeskailab.github.io/neuralCAD-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15453 2026-04-20 cs.CV cs.AI cs.LG 62%

(1D) Ordered Tokens Enable Efficient Test-Time Search

(1D) 有序标记实现高效的测试时搜索

Zhitong Gao, Parham Rezaei, Ali Cy, Mingqiao Ye, Nataša Jovanović, Jesse Allardice, Afshin Dehghan, Amir Zamir, Roman Bachmann, Oğuzhan Fatih Kar

机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Apple(苹果公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了有序标记对测试时搜索能力的影响,发现粗到细的1D结构比传统2D网格结构更易进行搜索,通过实验验证了有序结构在生成过程中能提升测试时扩展性。

Comments Project page: https://soto.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13590 2026-04-20 eess.IV cs.AI cs.CV 62%

Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation

智能医疗影像平台:基于视觉语言模型的自动化医学图像分析与临床报告生成框架

Samer Al-Hamadani

机构 * Automated Manufacturing Department/Al-Khwarizmi College of Engineering/ University of Baghdad/Gilgamesh University(自动化制造部门/阿尔·卡瓦尔齐米工程学院/巴格达大学/吉尔伽美什大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于视觉语言模型的智能多模态框架,用于自动化医学图像分析和临床报告生成,结合视觉特征提取与自然语言处理,实现上下文图像解释,并通过多层可视化技术提升临床信心。

Comments 32 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV 57%

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14605 2026-04-20 cs.CV 57%

Towards Design Compositing

面向设计合成

Abhinav Mahajan, Abhikhya Tripathy, Sudeeksha Reddy Pala, Vaibhav Methi, K J Joseph, Balaji Vasan Srinivasan

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Kharagpur(印度理工学院哈里科特) IIT Kanpur(印度理工学院坎普尔) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GIST,一种无需训练的身份保持图像合成器,用于提升组件到设计流程中的视觉和谐与美学质量。

Comments Accepted to CVEU workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21735 2026-04-20 cs.HC cs.AI 57%

Cognitive Agency Surrender: Defending Epistemic Sovereignty via Scaffolded AI Friction

认知代理退让:通过支架式AI摩擦捍卫认知主权

Kuangzhe Xu, Yu Shen, Longjie Yan, Yinghui Ren

机构 * Cyberspace Security University of China(中国网络安全大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示生成式AI导致认知代理退让的风险,提出支架式认知摩擦理论,通过多模态计算方法解耦决策与认知努力,以强化全球AI治理。

Comments 26 pages, 4 figure (one in appendix). This is a preprint of a perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17909 2026-04-20 cs.CV 57%

A Single Image and Multimodality Is All You Need for Novel View Synthesis

单张图像与多模态信息足矣实现新视角合成

Amirhosein Javadi, Chi-Shiang Gau, Konstantinos D. Polyzos, Tara Javidi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用稀疏多模态测距数据提升单图像新视角合成的几何一致性和视觉质量,通过多模态深度重建框架替代传统单目深度估计,增强扩散模型的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12370 2026-04-20 cs.CV 57%

LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

LLaMo:通过连续自回归令牌扩展预训练语言模型,实现统一的运动理解和生成

Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, Abhay Mittal

机构 * Brown University(布朗大学) Meta

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LLaMo通过模态特定的Transformer混合架构扩展预训练语言模型,解决运动-语言生成和理解的统一问题,实现高保真文本到运动生成和运动到文本描述。

Comments Project page: https://kunkun0w0.github.io/project/LLaMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03621 2026-04-20 cs.CV 57%

PILOT: A Promptable Interleaved Layout-aware OCR Transformer

PILOT:一种可提示的交错布局感知OCR变压器

Laziz Hamdi, Amine Tamasna, Pascal Boisson, Thierry Paquet

机构 * univ-rouen(鲁昂大学) LITIS(LITIS研究所) Malakoff Humanis(马拉科夫人类研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PILOT提出一种统一的OCR模型,通过交错布局感知和提示条件生成,实现手写和印刷文档的文本识别与空间定位,优于传统OCR和端到端HTR模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20699 2026-04-20 gr-qc astro-ph.HE 50%

Comparing next-generation detector configurations for high-redshift gravitational wave sources with neural posterior estimation

比较下一代探测器配置用于高红移引力波源的性能:基于神经后验估计

Filippo Santoliquido, Jacopo Tissino, Ulyana Dupletsa, Marica Branchesi, Jan Harms

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文利用神经后验估计方法评估了下一代引力波探测器网络配置,研究高红移双黑洞并合源的探测性能,发现2L MisA配置在天空定位和体积定位上优于三角形ET配置。

Comments 18 pages, 13 figures, 5 tables. Published in A&A

Journal ref A&A 708, A175 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 16 篇

2602.21950 2026-04-20 cs.CL 83%

MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models

MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型

Boqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Bang Zheng, Kyle Lam, Lin Li, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Amazon(亚马逊) University of Oxford(牛津大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16060 2026-04-20 cs.CV cs.AI 81%

Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

基于链式思维的多模态大语言模型视觉空间推理能力退化

Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究发现链式思维范式在视觉空间推理任务中导致性能下降,通过实验揭示多模态模型在空间基准测试中的关键缺陷,并指出需转向以视觉为中心的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 81%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13058 2026-04-20 cs.CL cs.LG cs.MM 81%

KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context

KMMMU:评估韩语多学科多模态理解

Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim, JunYoung An, Kyubeen Han, Il-Youp Kwak

机构 * Chung-Ang University(Chung-Ang 大学) Seoul National University(首尔国立大学) SK A.X OnelineAI HAE-RAE

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.MM

AI总结 KMMMU是首个针对韩语文化机构场景的多模态理解评估基准,包含3466道韩语原生考试题,涵盖九大学科和九种视觉模态,验证了多模态模型在韩语环境下的性能差异与挑战。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13131 2026-04-20 cs.AI cs.CV cs.ET cs.NI 81%

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

MM-Telco: 电信应用的多模态大语言模型基准与工具

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank Giri, Yashwanth Holla, Sunny Kumar, M. V. Kiran Sooraj

机构 * IIT Bhilai(比哈尔理工学院) IIT Kanpur(坎pur理工学院) INPT(伊斯兰北方技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-Telco,为电信领域设计的多模态基准和模型,旨在解决领域特定挑战,通过基准任务和实验验证提升大语言模型在电信中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16214 2026-04-20 cs.CV 79%

GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos

GAViD:一个大规模多模态数据集,用于视频中基于情境的群体情感识别

Deepak Kumar, Abhishek Pratap Singh, Puneet Kumar, Xiaobai Li, Balasubramanian Raman

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Roorkee(计算机科学与工程系,印度理工学院Roorkee分校) Indian Institute of Technology Ropar(印度理工学院Ropar分校) Zhejiang University(浙江大学) University of Oulu(奥卢大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAViD数据集和CAGNet网络,用于视频中基于情境的群体情感识别,通过多模态数据和上下文信息提升识别性能,测试准确率达63.20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15871 2026-04-20 cs.CV cs.AI 79%

UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs

UniEditBench: 一种统一且成本效益高的图像和视频编辑基准,通过压缩的多模态大语言模型

Lifan Jiang, Tianrun Wu, Yuhang Pei, Chenyang Wang, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniEditBench提出统一的图像和视频编辑基准,支持基于重建和指令驱动的方法,通过压缩的多模态大语言模型提供多维评分,减少部署成本并提高评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16298 2026-04-20 cs.CV cs.RO 74%

FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

FineCog-Nav:整合细粒度认知模块以实现零样本多模态无人机导航

Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo

机构 * Northwestern Polytechnical University(西北工业大学) Nanjing University(南京大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 本文提出FineCog-Nav框架,通过细粒度认知模块提升无人机零样本多模态导航性能,构建了AerialVLN-Fine基准测试集,实验表明其在指令遵循、长视距规划和环境泛化方面优于基线方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16104 2026-04-20 eess.IV cs.AI cs.CV 62%

Dual-Modal Lung Cancer AI: Interpretable Radiology and Microscopy with Clinical Risk Integration

双模肺癌AI:结合可解释放射学与显微镜的临床风险整合

Baramee Sukumal, Aueaphum Aueawatthanaphisut

机构 * Hatyaiwittayalai School(哈雅维泰莱学校) School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology(Sirindhorn国际技术学院) Thammasat University(泰国朱拉大学) Pathum Thani, Thailand(帕亨他尼,泰国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出整合CT放射学与H&E病理学的双模AI框架,利用卷积神经网络提取特征并融合临床数据,通过可解释AI技术提升诊断性能,实现肺癌亚型分类。

Comments 16 pages, 6 figures, 3 tables, 8 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09836 2026-04-20 cs.AI cs.CL cs.LG 62%

COMPOSITE-Stem

COMPOSITE-STEM基准:通过70个专家编写的任务评估AI代理的科学推理能力

Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillmann, Yuqi Li

机构 * PortexAI University of Milano-Bicocca(米兰-比科卡大学) University of Calgary(卡尔加里大学) University of Chicago(芝加哥大学) Inria(法国国家信息与自动化技术研究院) Fraunhofer Institute for Individualized Medical Technology IMTE(弗劳恩霍夫个性化医疗技术研究所) University of Cambridge(剑桥大学) Independent(独立) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Queen Mary University of London(伦敦大学玛丽女王学院) Dot Ingredients National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) University of Edinburgh(爱丁堡大学) Murdoch University(墨尔本大学) University of Porto(波尔图大学) Stanford University(斯坦福大学) Stony Brook University(史泰津布鲁克大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COMPOSITE-STEM基准,通过70个专家编写任务评估AI代理的科学推理能力,结合精确匹配评分和LLM作为评委的协议,展示AI在科学领域的能力突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21675 2026-04-20 cs.CL cs.CV cs.GR 62%

Is this chart lying to me? Automating the detection of misleading visualizations

这张图表在欺骗我吗?自动化检测误导性可视化

Jonathan Tonglet, Jan Zimny, Tinne Tuytelaars, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、图腾斯大学(TU Darmstadt)及应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电子工程系、鲁文大学) Department of Computer Science, KU Leuven(计算机科学系、鲁文大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究提出Misviz基准测试集和合成数据集,用于自动化检测误导性可视化,发现该任务仍极具挑战性。

Comments Camera-ready version accepted at ACL 2026 Main conference. Code and data available at: https://github.com/UKPLab/acl2026-misviz

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 57%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15837 2026-04-20 cs.AI 57%

Stein Variational Black-Box Combinatorial Optimization

Stein 变分黑盒组合优化

Thomas Landais, Olivier Goudet, Adrien Goëffon, Frédéric Saubion, Sylvain Lamprier

机构 * LERIA, Université d’Angers(安格里大学LERIA研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于Stein算子的变分黑盒组合优化方法,通过引入粒子间排斥机制促进群体分散探索多模态适应度景观,实验证明其在大规模问题上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14388 2026-04-20 cs.CV 57%

FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images

FoodSense:一个多感官食物数据集和基准,用于从图像预测味觉、嗅觉、触觉和声音

Sabab Ishraq, Aarushi Aarushi, Juncai Jiang, Chen Chen

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) College of Business Administration, University of Central Florida(中央佛罗里达大学商学院) Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FoodSense数据集,包含66,842个参与者的图像对,用于预测多感官体验,通过图像接地推理轨迹训练模型,展示传统评估指标在视觉感官推断中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22278 2026-04-20 cs.CV 57%

FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound

FETAL-GAUGE:用于评估胎儿超声检查中视觉-语言模型的基准

Hussain Alasmawi, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Fetal-Gauge基准,用于评估视觉-语言模型在胎儿超声检查中的性能,包含42000张图像和93000个问题-答案对,揭示当前模型在临床任务中的性能差距,强调需领域适应的架构和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15761 2026-04-20 cs.NE math.OC 50%

Frenetic Cat-inspired Particle Optimization: a Markov state-switching hybrid swarm optimizer with application to cardiac digital twinning

受 frenzy 猫启发的粒子优化:一种马尔可夫状态切换混合种群优化器及其在心脏数字孪生中的应用

Jorge Sánchez, Guadalupe García-Isla, Sandra Perez-Herrero, Beatriz Trenor, Javier Saiz

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种结合粒子群优化动态和显式状态马尔可夫切换控制器的混合种群优化器,用于解决昂贵黑箱问题中的优化问题,并在心脏数字孪生中应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 7 篇

2503.03509 2026-04-20 cs.RO 78%

Sampling-Based Multi-Modal Multi-Robot Multi-Goal Path Planning

基于采样的多模态多机器人多目标路径规划

Valentin N. Hartmann, Tirza Heinle, Yijiang Huang, Stelian Coros

机构 * Computational Robotics Lab ETH Zürich(机器人计算实验室ETH Zurich)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出基于采样的多机器人多目标路径规划方法,解决多机器人协同任务中的路径规划问题,实现概率完备和渐进最优的规划算法。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15327 2026-04-20 cs.HC cs.AI 74%

Eco-Bee: A Personalised Multi-Modal Agent for Advancing Student Climate Awareness and Sustainable Behaviour in Campus Ecosystems

Eco-Bee:一种面向校园生态系统的个性化多模态代理,用于提升学生气候意识和可持续行为

Caleb Adu, Neil Kapadia, Binhe Liu, Jonathan Randall, Sruthi Viswanathan

机构 * University of Hull(赫尔大学) The Spaceship Academy(太空学院) City St George’s, University of London(伦敦大学城市学院) King’s College London(伦敦国王学院) Lancaster University(兰卡斯特大学) University of Oxford(牛津大学)

专题命中 多模态Agent :multi-modal(title);分类 cs.AI

AI总结 Eco-Bee通过整合大语言模型、行星边界框架(Eco-Score)和对话代理,为学生提供个性化反馈和行为激励,推动校园可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15715 2026-04-20 cs.CL cs.AI 62%

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

GTA-2: 从原子工具使用到开放性工作流的通用工具代理基准测试

Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTA-2基准测试,涵盖原子工具使用和开放性工作流,通过递归检查点机制评估模型能力和执行框架,揭示了前沿模型在复杂任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏