arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-02 至 2026-04-02 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2604.00550 2026-04-02 cs.AI 79%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05097 2026-04-02 cs.GR cs.CV 79%

Pulp Motion: Framing-aware multimodal camera and human motion generation

纸浆运动:面向场景的多模态摄像机和人体运动生成

Robin Courant, Xi Wang, David Loiseaux, Marc Christie, Vicky Kalogeiton

机构 * LIX, École Polytechnique, CNRS, IPP(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎文理研究大学) Inria Saclay(法国国家信息与自动化研究所萨克雷中心) Inria, IRISA, Univ Rennes, CNRS(法国国家信息与自动化研究所,IRISA,雷恩大学,法国国家科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文首次将人体运动与摄像机轨迹生成联合建模,通过投影人体关节到摄像机生成屏幕构图,实现一致的屏幕构图并提升生成精度,同时引入PulpMotion数据集和辅助采样方法,实验表明方法在生成屏幕一致的人体-摄像机运动和文本对齐方面效果显著。

Comments Project page: https://www.lix.polytechnique.fr/vista/projects/2025_pulpmotion_courant/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 79%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00382 2026-04-02 cs.CV eess.SP 57%

mmAnomaly: Leveraging Visual Context for Robust Anomaly Detection in the Non-Visual World with mmWave Radar

mmAnomaly:利用视觉上下文在非视觉世界中实现鲁棒的异常检测

Tarik Reza Toha, Shao-Jung, Lu, Mahathir Monjur, Shahriar Nirjon

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 mmAnomaly结合毫米波雷达与RGBD输入,通过语义线索和生成模型实现鲁棒的异常检测,应用于隐蔽武器、穿墙入侵和穿墙跌倒检测,达到94%的F1分数和亚米定位精度。

Comments Accepted at the 24th ACM/IEEE International Conference on Embedded Artificial Intelligence and Sensing Systems (SenSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 57%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00319 2026-04-02 cs.AI cs.MA 57%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏