arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-15 至 2026-07-15 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 4 篇

2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交 79%

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12894 2026-07-15 cs.CV 新提交 57%

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Hy-Embodied-VLM-1.0:高效的物理世界智能体

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

机构 * Tencent Robotics X(腾讯Robotics X团队) Hy Vision Team(腾讯混元视觉团队) Futian Laboratory(福田实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 研究旨在构建物理世界具身智能体,介绍Hy-Embodied-VLM-1.0模型。定义以行动为中心的能力分类法,开发数据管道。基于特定主干和编码器构建模型,用专家混合架构提升效率。在多基准测试中性能出色,较上一代有显著提升,在具身智能任务中也表现强大。

Comments Tech Report. Code and models are open-sourced at https://github.com/Tencent-Hunyuan/HY-Embodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12732 2026-07-15 cs.RO 新提交 50%

Globalized Constrained Stein Variational Inference for Diverse Feasible Robot Motion Planning

用于多样化可行机器人运动规划的全局约束斯坦变分推理

Jiayun Li, Georgia Chalvatzaki

机构 * PEARL Lab, Dept. of Computer Science, TU Darmstadt(珍珠实验室,达姆施塔特工业大学计算机科学系) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究机器人运动规划多模态问题,提出SteinSQP方法,通过约束斯坦变分推理演化粒子集合,用无矩阵原始对偶算法解决子问题,引入优点函数全局化方法,在多任务中表现良好,收敛快且可行性高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21477 2026-07-15 cs.CR 版本更新 50%

MCP Pitfall Lab: Exposing Developer Pitfalls in MCP Tool Server Security under Multi-Vector Attacks

MCP陷阱实验室:在多向攻击下暴露MCP工具服务器安全漏洞的开发人员陷阱

Run Hao, Zhuoran Tan

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出MCP Pitfall Lab框架,通过可复现的场景验证开发人员陷阱,评估MCP工具服务器在多向攻击下的安全性和修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏