arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-22 至 2026-04-22 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 2 篇

2604.19489 2026-04-22 cs.CV cs.CY 79%

Seeing Candidates at Scale: Multimodal LLMs for Visual Political Communication on Instagram

大规模识别候选人:用于推特视觉政治沟通的多模态大语言模型

Michael Achmann-Denkler, Mario Haim, Christian Wolff

机构 * Media Informatics Group University of Regensburg(媒体信息学组莱比锡大学) Department of Media and Communication Ludwig-Maximilians-Universität Munich, Germany(媒体与传播系路德维希-马克西米利安大学慕尼黑,德国)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文评估了专用机器学习模型和新兴多模态大语言模型在视觉政治沟通分析中的能力,展示了GPT-4o在识别领先政治人物和计数中的优越性能。

Comments An earlier version was presented at #SMSociety 2024 (London)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09370 2026-04-22 cs.RO 50%

Phase-Aware Policy Learning for Skateboard Riding of Quadruped Robots via Feature-wise Linear Modulation

面向四足机器人滑板骑行的相位感知策略学习

Minsung Yoon, Jeil Jeong, Sung-Eui Yoon

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出相位感知策略学习框架,通过特征级线性调制层提升四足机器人滑板骑行的相位依赖行为捕捉与跨相位知识共享,验证了在仿真中的指令跟踪精度和效率。

Comments ICRA 2026 | Project Page: https://minsungyoon.github.io/projects/papl/ | M. Yoon and J. Jeong contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏