arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 203 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 17 篇

2605.09392 2026-05-12 cs.CV 57%

HyNeuralMap: Hyperbolic Mapping of Visual Semantics to Neural Hierarchies

HyNeuralMap:视觉语义到神经层次的双曲映射

Zihan Ma, Tian Xia, Kexin Wang, Xiao Li, Xiaowei He, Yudan Ren

机构 * School of Electronic Information (School of Artificial Intelligence), the Xi’an Key Laboratory of Radiomics and Intelligent Perception, Northwest University(电子信息学院(人工智能学院)、西安放射组学与智能感知重点实验室、西北大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出HyNeuralMap框架,利用双曲洛伦兹模型将视觉语义映射到共享的跨被试神经层次,通过双曲空间的负曲率捕捉层次化语义结构,实验表明其在多标签预测和跨模态检索中优于欧几里得基线。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI 57%

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08421 2026-05-12 cs.CV 57%

Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

超越图像块:通过文本监督学习全局布局用于晚期交互视觉文档检索

Pascal Tilli, Mohsen Mesgar

机构 * University of Stuttgart(斯图加特大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过文本监督学习文档全局布局,改进视觉文档检索的晚期交互架构,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 26 篇

2605.10769 2026-05-12 cs.CV cs.AI 84%

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Southwest Jiaotong University(西南交通大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。

Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 79%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20001 2026-05-12 cs.CV 79%

NEXT: Multi-Grained Mixture of Experts via Text-Modulation for Multi-Modal Object Re-Identification

NEXT: 通过文本调制的多粒度专家混合实现多模态物体重识别

Shihao Li, Huaibo Huang, Junxian Duan, Aihua Zheng, Jin Tang, Jixin Ma

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Artificial Intelligence(人工智能学院) Anhui University(安徽大学) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) New Laboratory of Pattern Recognition(模式识别新实验室) CASIA(中国科学院自动化所) University of Chinese Academy of Sciences(中国科学院大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Greenwich(格林威治大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出NEXT框架,通过文本调制分离语义和结构分支,融合多粒度专家特征,提升多模态物体重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09981 2026-05-12 q-bio.BM cs.AI 79%

Yeti: A compact protein structure tokenizer for reconstruction and multi-modal generation

Yeti: 一种紧凑的蛋白质结构分词器用于重建和多模态生成

Nabin Giri, Steven Farrell, Kristofer E. Bouchard

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 Yeti是一种基于无查找量化的小型蛋白质结构分词器,通过端到端训练实现多模态学习,其在代码本利用和生成能力上表现优异,生成的结构与序列能产生合理结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-05-12 cs.CV 79%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01666 2026-05-12 quant-ph cs.AI cs.LG 79%

Synthesis of discrete-continuous quantum circuits with multimodal diffusion models

多模扩散模型在离散-连续量子电路合成中的应用

Florian Fürrutter, Zohim Chandani, Ikko Hamamura, Hans J. Briegel, Gorka Muñoz-Gil

机构 * Department of Theoretical Physics, University of Innsbruck(因斯布鲁克大学理论物理系) Quantum Algorithm Engineering, NVIDIA Corporation(NVIDIA公司量子算法工程)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多模扩散模型用于高效合成量子电路,通过生成电路结构和连续参数,在门数量和噪声条件下优于现有方法,并利用快速生成能力构建大规模电路数据集。

Comments Main Text: 11 pages, 8 figures and 1 table; Code available at: https://github.com/FlorianFuerrutter/genQC

Journal ref Machine Learning: Science and Technology 7.2 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI 79%

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08252 2026-05-12 cs.CV 79%

Multimodal Emotion Recognition via Causal-Diffusion Bridge (Affect-Diff)

通过因果-扩散桥进行多模态情绪识别(Affect-Diff)

Ankit Sanjyal

机构 * Department of Computer Science -- Data Science(计算机科学系——数据科学部) Fordham University(福特汉姆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对CMU-MOSEI数据集中情绪类别不平衡问题,Affect-Diff通过因果图、正则化潜在压缩和扩散先验机制提升识别性能,验证了其在平衡准确率和少数类敏感性上的优势。

Comments 10 Pages, 12 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08138 2026-05-12 cs.LG 78%

DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis

DataArc-SynData-Toolkit:多路径、多模态和多语言数据合成的统一闭环框架

Zhichao Shi, Cehao Yang, Hao Zhou, Xiaojun Wu, Huajie Li, Xuhui Jiang, Chengjin Xu, Yuanzhuo Wang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research(IDEA研究院) International Digital Economy Academy(国际数字经济学院) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出DataArc-SynData-Toolkit,通过统一的合成范式和模块化架构,解决现有合成数据工具在流程复杂、标准碎片化和多模态扩展性方面的不足,提升数据生成效率和质量。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03239 2026-05-12 cs.CV 77%

COP-GEN: Latent Diffusion Transformer for Copernicus Earth Observation Data

COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器

Miguel Espinosa, Eva Gmelich Meijling, Valerio Marsocci, Elliot J. Crowley, Mikolaj Czerkawski

机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) European Space Agency (ESA)(欧洲航天局) Asterisk Labs(Asterisk实验室)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV

AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21164 2026-05-12 cs.AI 77%

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08220 2026-05-12 cs.AI cs.CE cs.CL cs.CV cs.SE 67%

Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性

Andrei Lazarev, Dmitrii Sedov, Alexander Galkin

机构 * Russian Federation(俄罗斯联邦)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。

Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10730 2026-05-12 cs.CV 57%

Qwen-Image-2.0 Technical Report

Qwen-Image-2.0 技术报告

Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kuan Cao, Kun Yan, Liang Peng, Lihan Jiang, Niantong Li, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Xihua Wang, Yan Shu, Yanran Zhang, Yi Wang, Yilei Chen, Ying Ba, Yixian Xu, Yujia Wu, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, An Yang, Chen Cheng, Chenxu Lv, Dayiheng Liu, Fan Zhou, Hantian Xiong, Hongzhu Shi, Hu Wei, Huihong Zhao, Ivy Liu, Jianwei Zhang, Jiawei Zhang, Kai Chen, Kang He, Levon Xue, Lin Qu, Linhan Tang, Luwen Feng, Minggang Wu, Minmin Sun, Na Ni, Rui Men, Shuai Bai, Sishou Zheng, Tao Lan, Tianqi Zhang, Tingkun Wen, Wei Wang, Weixu Qiao, Weiyi Lu, Wenmeng Zhou, Xiaodong Deng, Xiaoxiao Xu, Xinlei Fang, Xionghui Chen, Yanan Wang, Yang Fan, Yichang Zhang, Yixuan Xu, Yu Wu, Zhiyuan Ma, Zhizhi Cai

机构 * Qwen Team(通义实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10717 2026-05-12 cs.LG cs.CV 57%

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

异方差扩散用于多智能体轨迹建模

Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。

Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10588 2026-05-12 cs.CV 57%

Thinking with Novel Views: A Systematic Analysis of Generative-Augmented Spatial Intelligence

以新视角思考:生成增强型空间智能的系统分析

Yanbing Zhang, Bo Wang, Jianhui Liu, Nan Jiang, Jiaxiu Jiang, Haoze Sun, Yijun Yang, Shenghe Zheng, Lin Song, Haoyang Huang, Nan Duan, Wenbo Li

机构 * Joy Future Academy(京东探索研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TwNV框架,通过生成新视角合成提升空间推理能力,系统实验表明指令格式、生成精度和推理时的视角缩放对性能有显著影响。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10445 2026-05-12 cs.CV 57%

Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning

Uni-Synergy:通过协作强化学习实现个性化推理的理解与生成弥合

Zijun Shen, Sihan Yang, Ruichuan An, Ziyu Guo, Hao Liang, Ming Lu, Renrui Zhang, Wentao Zhang

机构 * Peking University(北京大学) Nanjing University(南京大学) CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Sync-R1框架,通过协作强化学习统一优化个性化理解和生成,结合Sync-GRPO和DGS方法提升双任务协同效率,实验证明其在跨任务推理和鲁棒个性化方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 57%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 57%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05209 2026-05-12 cs.CV 57%

EAM: Enhancing Anything with Diffusion Transformers for Blind Super-Resolution

EAM: 利用扩散变换器提升盲超分辨率

Haizhen Xie, Kunpeng Du, Qiangyu Yan, Sen Lu, Jianhong Han, Hanting Chen, Hailin Hu, Jie Hu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出EAM模型,利用DiT架构提升盲超分辨率,引入Ψ-DiT块和渐进性掩码图像建模策略,实现更优的图像恢复效果。

Comments Revision of Section 4.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01196 2026-05-12 stat.ML cs.AI cs.LG 57%

An Interdisciplinary and Cross-Task Review on Missing Data Imputation

关于缺失数据填补的跨学科和跨任务综述

Jicong Fan

机构 * School of Data Science(数据科学学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了缺失数据填补的核心概念和方法,涵盖不同领域和数据类型,分析了填补方法的分类和应用,并探讨了填补与下游任务的整合及未来研究方向。

Journal ref Foundations and Trends in Signal Processing, Vol. 20, No. 3, pp. 185-317, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07384 2026-05-12 cs.LG 50%

StreamPhy: Streaming Inference of High-Dimensional Physical Dynamics via State Space Models

StreamPhy: 通过状态空间模型实现高维物理动态的流式推断

Panqi Chen, Yifan Sun, Shikai Fang, Xiao Fu, Lei Cheng

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of EECS,Oregon State University(俄勒冈州立大学电子工程与计算机科学学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出StreamPhy框架,通过自适应观测编码器、结构化状态空间模型和FT-FiLM解码器,实现高效准确的流式推断,实验显示其在复杂动态处理上优于现有方法,精度提升48%以上,速度提升20-100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09999 2026-05-12 cs.RO cs.PF cs.SY eess.SY 50%

Muninn: Your Trajectory Diffusion Model But Faster

Muninn:你的轨迹扩散模型但更快

Gokul Puthumanaillam, Hao Jiang, Ruben Hernandez, Jose Fuentes, Paulo Padrao, Leonardo Bobadilla, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) Providence College(普罗维登斯学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Muninn,一种无需训练的缓存包装器,通过利用扩散轨迹规划器的两个信号,减少去噪器计算,实现轨迹扩散模型的实时应用,提升速度并保证性能和安全性。

Comments Accepted to Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09291 2026-05-12 cs.LG stat.AP 50%

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

dFlowGRPO:面向离散流模型的速率感知策略优化

Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Toronto(多伦多大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出dFlowGRPO框架,用于离散流模型的强化学习,支持多种概率路径和非掩码源分布,通过轨迹概率推导和去噪马尔可夫决策过程,提升文本到图像生成和多模态理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09999 2026-05-12 cs.DC 50%

ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production

ServeGen:生产环境中大型语言模型服务的工作负载特征与生成

Yuxing Xiang, Xue Li, Kun Qian, Wenyuan Yu, Ennan Zhai, Xin Jin

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过深入分析真实世界中的大型语言模型服务工作负载,提出ServeGen框架,通过按客户端组合生成真实工作负载,有效避免了50%的欠配问题,提升了性能基准测试效果。

Comments 15 pages, NSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08733 2026-05-12 cs.LG cs.IT math.IT 50%

Generative Actor-Critic with Soft Bridge Policies

生成性动作-批评者与软桥策略

Ke He, Le He, Shunpu Tang, Yafei Wang, Lisheng Fan

机构 * Guangzhou University(广州大学) Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出SoftGAC,通过构建可解析的MaxEnt目标,实现高效的生成性策略,仅需单次演员前向传递即可生成动作,提升了连续控制任务的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08233 2026-05-12 eess.SP cs.LG 50%

Inverse Design of Multi-Layer Sub-Pixel-Resolution RF Passives Through Grayscale Diffusion with Flexible S-Parameter Conditioning

通过灰度扩散实现多层子像素分辨率射频被动元件的逆设计

Tommaso Dreossi, Christopher M. Bryant, Hao Liu, Nathan Mirman, Noah Kessler, Michael Frei, Harish Krishnaswamy

机构 * Arena Physica New York, NY, USA(Arena Physica纽约,纽约州,美国)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出一种基于部分S参数输入生成多层铜布局的逆设计方法,实现子像素灰度金属化,解决高维非良提问题,验证了其在实际制造中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 54 篇

2605.09152 2026-05-12 cs.CL q-bio.NC 89%

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

Meow-Omni 1:用于猫类行为学的多模态大语言模型

Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

机构 * University College London(伦敦大学学院) Tsinghua University(清华大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);omni-modal(abstract)

AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏