arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 7 篇

2503.03509 2026-04-20 cs.RO 78%

Sampling-Based Multi-Modal Multi-Robot Multi-Goal Path Planning

基于采样的多模态多机器人多目标路径规划

Valentin N. Hartmann, Tirza Heinle, Yijiang Huang, Stelian Coros

机构 * Computational Robotics Lab ETH Zürich(机器人计算实验室ETH Zurich)

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出基于采样的多机器人多目标路径规划方法,解决多机器人协同任务中的路径规划问题,实现概率完备和渐进最优的规划算法。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15327 2026-04-20 cs.HC cs.AI 74%

Eco-Bee: A Personalised Multi-Modal Agent for Advancing Student Climate Awareness and Sustainable Behaviour in Campus Ecosystems

Eco-Bee:一种面向校园生态系统的个性化多模态代理,用于提升学生气候意识和可持续行为

Caleb Adu, Neil Kapadia, Binhe Liu, Jonathan Randall, Sruthi Viswanathan

机构 * University of Hull(赫尔大学) The Spaceship Academy(太空学院) City St George’s, University of London(伦敦大学城市学院) King’s College London(伦敦国王学院) Lancaster University(兰卡斯特大学) University of Oxford(牛津大学)

专题命中 多模态Agent :multi-modal(title);分类 cs.AI

AI总结 Eco-Bee通过整合大语言模型、行星边界框架(Eco-Score)和对话代理,为学生提供个性化反馈和行为激励,推动校园可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15715 2026-04-20 cs.CL cs.AI 62%

GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows

GTA-2: 从原子工具使用到开放性工作流的通用工具代理基准测试

Jize Wang, Xuanxuan Liu, Yining Li, Songyang Zhang, Yijun Wang, Zifei Shan, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTA-2基准测试,涵盖原子工具使用和开放性工作流,通过递归检查点机制评估模型能力和执行框架,揭示了前沿模型在复杂任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23304 2026-04-20 cs.CV cs.AI 62%

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

MedGemma vs GPT-4:开源与专有零样本医学疾病图像分类

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi

机构 * Department of Information and Communication Technology, Bangladesh University of Professionals(信息与通信技术系,孟加拉国专业大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文比较了开源MedGemma与专有GPT-4在医学图像零样本疾病分类中的性能,MedGemma通过LoRA微调在准确率和敏感性上均表现更优,凸显了领域特定微调对临床应用的重要性。

Comments Accepted for publication in the Journal of Machine Learning and Deep Learning (JMLDL). 9 pages, 9 figures, 10 tables

Journal ref Journal of Machine Learning and Deep Learning, Vol. 2, No. 2, pp. 1-9, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV 57%

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10096 2026-04-20 cs.CV 57%

ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents

ABot-Claw:持久、协作和自演化机器人代理的基础

Dongjie Huo, Haoyun Liu, Guoqing Liu, Dekang Qi, Zhiming Sun, Maoguo Gao, Jianxin He, Yandan Yang, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

机构 * AMAP CV Lab(AMAP CV 实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 ABot-Claw通过统一的具身接口、视觉导向的多模态记忆和基于批评者的闭环反馈机制,实现了持久上下文保留、在线进度评估和自演化能力,支持开放动态环境中的机器人代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20633 2026-04-20 cs.AI 57%

Seed1.8 Model Card: Towards Generalized Real-World Agency

Seed1.8 模型卡:迈向通用的现实世界代理

Bytedance Seed

机构 * Bytedance Seed(字节跳动Seed)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏