arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-05 至 2026-06-05 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2601.12983 2026-06-05 cs.CL 77%

ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

ChartAttack: 测试大型语言模型在图表生成中对恶意提示的脆弱性

Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta, Iryna Gurevych

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT索菲亚大学"圣克莱门特·欧赫里迪斯基") Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(无处不在知识处理实验室(UKP实验室)、计算机科学系、图腾达姆斯塔特大学和应用网络安全国家研究中心ATHENE) Arizona State University(亚利桑那州立大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL

AI总结 本文提出ChartAttack框架,用于评估多模态大语言模型在生成误导性图表方面的能力,通过注入误导性元素来诱导错误解释,并引入AttackViz数据集来评估和改进模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29219 2026-06-05 cs.CV 74%

SalsaAgent: A multimodal embodied language model for interactive dance generation

SalsaAgent: 一种用于交互式舞蹈生成的多模态具身语言模型

Payam Jome Yazdian, Zoe Stanley, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 提出SalsaAgent语言模型,通过非语言运动令牌传递和两阶段令牌到扩散管道,生成与人类领舞者及音乐背景交互的全身萨尔萨舞蹈动作。

Comments Project page: https://pjyazdian.github.io/Salsa-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10875 2026-06-05 cs.CL cs.AI cs.LG 62%

A Survey on Diffusion Language Models

扩散语言模型的综述

Tianyi Li, Mingda Chen, Bowei Guo, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(维拉实验室,穆罕默德·本·扎耶德人工智能大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了扩散语言模型的发展现状,探讨了其与自回归模型和掩码语言模型的关系,分析了预训练策略、后训练方法以及推理优化技术,并讨论了多模态扩展、应用场景、局限性及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05188 2026-06-05 cs.CY cs.AI 57%

Assessing the Geographic Diversity of AI's Platial Representations in Image Generation

评估图像生成中AI地点表征的地理多样性

Zilong Liu, Krzysztof Janowicz, Mina Karimi

机构 * Department of Geography and Regional Research, University of Vienna, Austria(维也纳大学地理与区域研究系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文以GPT和DALL-E模型为例,引入生态学中的物种多样性度量方法,通过相似性加权评估图像生成的地理多样性,发现旧模型可能更具多样性且提示修订比图像生成更促进多样性,同时观察到模型同质性导致缺乏地理多样性。

Comments Full conference paper accepted by the AGILE 2026 (https://agile-gi.eu/conference-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06344 2026-06-05 cs.LG cs.SC 50%

Equivariant Neural Belief Propagation

等变神经信念传播

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science, University of Oxford(计算机科学系,牛津大学) FLock.io

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出等变神经信念传播(ENBP),通过等变高斯混合消息和秩2精度矩阵合成,实现SE(3)对称性下的高效概率推理,在分子构象和机器人推理任务中显著超越基线。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06049 2026-06-05 cs.RO 50%

L-SDPPO: Policy Optimization of Spiking Diffusion Policy for Intra-vehicular Robotic Manipulation

L-SDPPO:用于舱内机器人操作的脉冲扩散策略优化

Liwen Zhang, Dong Zhou, Guanghui Sun, Yifei Zheng, Yuhui Hu, Kaihong Ouyang, Zuoquan Zhao

机构 * Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程系,哈尔滨工业大学) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(机械与自动化工程系,香港中文大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出L-SDPPO框架,结合脉冲扩散策略与强化学习优化,并引入状态依赖延迟注入机制,在舱内机器人操作任务中实现高成功率和低能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12951 2026-06-05 stat.ML cs.LG 50%

Coreset-Induced Conditional Velocity Flow Matching

由Coreset诱导的条件速度流匹配

Xiao Wang, Zihua She, Jianxi Su

机构 * Department of Statistics, Purdue University(普渡大学统计学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种生成模型CCVFM,通过数据驱动的源分布增强层次化修正流,利用Coreset压缩目标数据并生成高斯混合分布,从而在无需学习神经采样器的情况下实现条件速度律的闭式表达,并通过轻量级修正流进一步优化生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏