arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 110 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2511.20814 2026-04-07 cs.CV cs.AI cs.LG 62%

SPHINX: A Synthetic Environment for Visual Perception and Reasoning

SPHINX:一个用于视觉感知与推理的合成环境

Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗彻斯特理工学院) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14565 2026-04-07 cs.SE cs.AI cs.CV 62%

Detecting and Characterising Mobile App Metamorphosis in Google Play Store

在Google Play Store中检测和表征移动应用蜕变

D. Denipitiyage, B. Silva, K. Gunathilaka, S. Seneviratne, A. Mahanti, A. Seneviratne, S. Chawla

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Department of Computer Science and Engineering, University of Moratuwa(莫拉图瓦大学计算机科学与工程系) University of New South Wales (UNSW)(新南威尔士大学) Qatar Computing Research Institute, Hamad Bin Khalifa University (HBKU)(哈马德·本·哈利法大学卡塔尔计算研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态搜索方法,用于识别经历蜕变的应用程序,并分析Google Play Store的两个五年跨度快照,揭示蜕变场景及潜在安全隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG 62%

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03322 2026-04-07 cs.CV cs.AI cs.RO 62%

VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing

VitaTouch:面向制造领域机器人质量检测的属性感知视觉-触觉-语言模型

Junyi Zong, Qingxuan Jia, Meixian Shi, Tong Li, Jiayuan Li, Zihang Lv, Gang Chen, Fang Deng

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) Zhongguancun Academy(中关村学院) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of AI, Beijing Institute of Technology(北京理工大学人工智能学院) Beijing Key Laboratory of Lightweight Intelligent System, Beijing Institute of Technology(北京理工大学北京市轻量化智能系统重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VitaTouch通过融合视觉、触觉与语言信息,提升机器人在制造中对材料属性的识别能力,实现了高精度的质量检测与自然语言描述。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16197 2026-04-07 cs.LG cs.CL cs.MM 62%

ModalImmune: Immunity Driven Unlearning via Self Destructive Training

ModalImmune: 通过自毁式训练实现的免疫驱动反学习

Rong Fu, WeiZhi Tang, Ziming Wang, Jia Yee Tan, Zijian Zhang, Zhaolu Kang, Muge Qi, Shuning Zhang, Simon Fong

机构 * University of Macau(澳门大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) University of Pennsylvania(宾夕法尼亚大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出ModalImmune框架,通过可控地在训练中坍缩选定模态信息,使模型学习到对破坏性模态影响具有鲁棒性的联合表示,提升多模态系统在模态丢失或损坏时的可靠性。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17087 2026-04-07 cs.CL cs.AI cs.CY cs.DB cs.LG 62%

Informatics for Food Processing

食品加工的信息化

Gordana Ispirova, Michael Sebek, Giulia Menichetti

机构 * Channing Division of Network Medicine, Department of Medicine, Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里格姆妇女医院医学系钱宁网络医学部) Network Science Institute and Department of Physics, Northeastern University(东北大学网络科学研究所与物理系) Harvard Data Science Initiative, Harvard University(哈佛大学哈佛数据科学计划)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了食品加工的演变、分类及健康影响,提出利用机器学习和数据科学改进食品信息化,通过FoodProX模型和BERT等模型实现食品分类与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23607 2026-04-07 cs.CV cs.RO 57%

LongTail Driving Scenarios with Reasoning Traces: The KITScenes LongTail Dataset

长尾驾驶场景与推理轨迹:KITScenes长尾数据集

Royden Wagner, Omer Sahin Tas, Jaime Villa, Felix Hauser, Yinzhe Shen, Marlon Steiner, Dominik Strutz, Carlos Fernandez, Christian Kinzig, Guillermo S. Guitierrez-Cabello, Hendrik Königshof, Fabian Immel, Richard Schwarzkopf, Nils Alexander Rack, Kevin Rösch, Kaiwen Wang, Jan-Hendrik Pauls, Martin Lauer, Igor Gilitschenski, Holger Caesar, Christoph Stiller

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) FZI Research Center for Information Technology(FZI信息技术研究中心) University Charles III of Madrid(马德里卡洛斯三世大学) Technical University of Madrid(马德里理工大学) University of Toronto(多伦多大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出KITScenes长尾数据集,通过多视角视频、轨迹、指令和推理轨迹提升模型在长尾驾驶场景下的泛化能力,评估指令遵循与语义连贯性。

Comments 21 pages; v2: update MMS values (bugfix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08887 2026-04-07 cs.LG cs.AI 57%

FAST-CAD: A Fairness-Aware Framework for Non-Contact Stroke Diagnosis

FAST-CAD:一种面向非接触中风诊断的公平性感知框架

Tommy Sha, Zhan Cheng, Haotian Zhai, Xuwei Ding, Junnan Li, Haixiang Tang, Zaoting Sun, Yanchuan Tang, Yongzhe, Yi, Yuan Gao, Anhao Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出FAST-CAD框架,结合域对抗训练与群体分布鲁棒优化,实现公平且准确的非接触中风诊断,通过理论分析和实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04017 2026-04-07 cs.CL 57%

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

GeoBrowse:一种用于代理工具使用的地理定位基准测试

Xinyu Geng, Yanjing Xiao, Yuyang Zhang, Hanwen Wang, Xinyan Liu, Rui Min, Tianqing Fang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 GeoBrowse基准测试结合了视觉推理与知识密集型多跳查询,通过专家标注的逐步轨迹分析验证多步工具使用策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 57%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03572 2026-04-07 cs.CV physics.optics 57%

Physics-Informed Untrained Learning for RGB-Guided Superresolution Single-Pixel Hyperspectral Imaging

基于物理的无训练学习用于RGB引导的超分辨率单像素超光谱成像

Hao Zhang, Bilige Xu, Lichen Wei, Xu Ma, Wenyi Ren

机构 * College of Science, Northwest Agriculture & Forestry University(西北农林科技大学理学院) Key Laboratory of Photoelectronic Imaging Technology and System, School of Optics and Photonics, Beijing Institute of Technology(北京理工大学光电学院光电成像技术与系统教育部重点实验室) State Key Laboratory of Digital Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学数字制造装备与技术国家重点实验室)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于物理的无训练框架,利用未训练的神经网络和RGB引导,实现超分辨率和超光谱重建,无需外部训练数据,实验表明其在重建精度和光谱保真度上优于现有方法。

Comments 9 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26792 2026-04-07 cs.NE cs.AI cs.LG 57%

A Firefly Algorithm for Mixed-Variable Optimization Based on Hybrid Distance Modeling

一种基于混合距离建模的混合变量优化萤火虫算法

Ousmane Tom Bechir, Adán José-García, Zaineb Chelly Garcia, Vincent Sobanski, Clarisse Dhaenens

机构 * Univ. Lille, CNRS, Inria, Centrale Lille, UMR 9189 CRIStAL(里尔大学,法国国家科学研究中心,法国国家信息与自动化研究所,中央里尔高等电力工程学院,UMR 9189 CRIStAL) Univ. Lille, Inserm, CHU Lille, U1286 – INFINITE(里尔大学,法国国家健康与医学研究院,里尔大学医院,U1286 – INFINITE) Institut Universitaire de France (IUF)(法国大学研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种混合变量优化萤火虫算法,通过改进的距离吸引机制整合连续和离散变量,有效处理异构搜索空间,实验显示其在混合变量优化中表现优异。

Comments 25 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01895 2026-04-07 cs.CV 57%

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi

机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01256 2026-04-07 cs.NE 56%

Runtime Analyses of NSGA-III on Many-Objective Problems: Provable Exponential Speedup via Stochastic Population Update

NSGA-III在多目标问题上的运行时间分析:通过随机种群更新实现可证明的指数加速

Andre Opris

专题命中 多模态评测 :multimodal(abstract,comments)

AI总结 本文通过严格运行时间分析,揭示NSGA-III在多目标问题上的性能,证明随机种群更新机制在多目标多模态问题中可实现指数加速。

Comments This is the long version of the paper with the title "A First Runtime Analysis of NSGA-III on a Many-Objective Multimodal Problem: Provable Exponential Speedup via Stochastic Population Update" already appeared at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12165 2026-04-07 cs.LG 50%

Multi-Component VAE with Gaussian Markov Random Field

多组件变分自编码器与高斯马尔可夫随机场

Fouad Oubari, Mohamed El-Baha, Raphael Meunier, Rodrigue Décatoire, Mathilde Mougeot

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学,法国国家科学研究中心,巴黎高等师范学校萨克雷分校,博雷利中心) Michelin(米其林) ENSIIE(法国国立信息统计与高等技术学校)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出一种基于高斯马尔可夫随机场的多组件变分自编码器,通过建模组件间关系提升复杂交互的表示能力,在合成数据集和现实数据集上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03981 2026-04-07 cs.LG stat.CO 50%

Multirate Stein Variational Gradient Descent for Efficient Bayesian Sampling

多速率Stein变分梯度下降用于高效的贝叶斯采样

Arash Sarshar

机构 * Department of Computer Engineering and Computer Science, California State University, Long Beach(加州州立大学长滩分校计算机工程与计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出多速率SVGD方法,通过不同时间尺度更新不同组件,提升高维、各向异性或分层后验中的鲁棒性和效率,尤其在刚性分层、强各向异性及多模态目标中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03391 2026-04-07 cs.SE cs.LG 50%

SDVDiag: Using Context-Aware Causality Mining for the Diagnosis of Connected Vehicle Functions

SDVDiag:利用基于上下文的因果挖掘进行联网车辆功能诊断

Matthias Weiß, Falk Dettinger, Elias Detrois, Nasser Jazdi, Michael Weyrich

机构 * Institute of Industrial Automation and Software Engineering (IAS)(工业自动化与软件工程研究所(IAS)) University of Stuttgart(斯图加特大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种多模态方法,结合人类反馈和系统信息,提升联网车辆功能诊断的精度与可解释性。

Comments 7 pages, 4 figures, to be submitted to the VTC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04755 2026-04-07 cs.LG 50%

KindSleep: Knowledge-Informed Diagnosis of Obstructive Sleep Apnea from Oximetry

KindSleep:基于血氧数据的阻塞性睡眠呼吸暂停诊断

Micky C Nnamdi, Wenqi Shi, Cheng Wan, J. Ben Tamo, Benjamin M Smith, Chad A Purnell, May D Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) UT Southwestern Medical Center(德克萨斯大学西南医学中心)

专题命中 多模态评测 :multimodal(abstract)

AI总结 KindSleep利用深度学习整合临床知识与单通道血氧数据,实现精准的阻塞性睡眠呼吸暂停诊断,其在不同人群中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE 50%

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

专题命中 多模态评测 :multi-modal(abstract)

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 15 篇

2602.08392 2026-04-07 cs.RO cs.AI cs.CV 84%

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03586 2026-04-07 cs.CL 83%

MultiPress: A Multi-Agent Framework for Interpretable Multimodal News Classification

MultiPress:一种用于可解释多模态新闻分类的多智能体框架

Tailong Luo, Hao Li, Rong Fu, Xinyue Jiang, Huaxuan Ding, Yiduo Zhang, Zilin Zhao, Simon Fong, Guangyin Jin, Jianyuan Ni

机构 * New York Institute of Technology(纽约理工学院) University of Arizona(亚利桑那大学) University of Macau(澳门大学) Peking University(北京大学) Juniata College(朱尼亚塔学院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MultiPress多智能体框架,通过多模块协作和检索增强推理提升多模态新闻分类的准确性和可解释性。

Comments Accepted in International Joint Conference on Neural Networks (IJCNN) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11109 2026-04-07 cs.CV cs.AI cs.GR 81%

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

通过交错多模态推理的视觉-反图形代理

Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Impossible, Inc.(Impossible公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIGA框架,通过符号逻辑与视觉感知的交叉验证,解决视觉语言模型在单次设置中重建图像的挑战,支持2D文档生成、3D重建等任务。

Comments Project page: https://fugtemypt123.github.io/VIGA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04078 2026-04-07 eess.IV cs.AI cs.CV 81%

BAAI Cardiac Agent: An intelligent multimodal agent for automated reasoning and diagnosis of cardiovascular diseases from cardiac magnetic resonance imaging

BAAI心脏代理:一种智能多模态代理,用于从心脏磁共振成像自动推理和诊断心血管疾病

Taiping Qu, Hongkai Zhang, Lantian Zhang, Can Zhao, Nan Zhang, Hui Wang, Zhen Zhou, Mingye Zou, Kairui Bo, Pengfei Zhao, Xingxing Jin, Zixian Su, Kun Jiang, Huan Liu, Yu Du, Maozhou Wang, Ruifang Yan, Zhongyuan Wang, Tiejun Huang, Lei Xu, Henggui Zhang

机构 * Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Department of Radiology, Beijing Anzhen Hospital, Beijing Institute of Heart, Lung & Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院放射科,北京市心肺血管疾病研究所) Department of MR, the First Affiliated Hospital, Henan Medical University(河南医科大学第一附属医院磁共振科) Department of Cardiology, Clinical Center for Coronary Heart Disease, Beijing Institute of Heart, Lung and Blood Vessel Disease, Beijing Anzhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院心内科,冠心病临床中心,北京市心肺血管疾病研究所) Department of Cardiac Surgery, Beijing Anzhen Hospital, Institute of Heart, Lung and Vascular Diseases, Capital Medical University(首都医科大学附属北京安贞医院心脏外科,心肺血管疾病研究所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BAAI心脏代理,通过多模态智能系统实现心脏磁共振成像的端到端解读,实现了自动分割、功能量化、组织特征分析和疾病诊断,并在多个心血管疾病数据集上验证了其高准确率和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18599 2026-04-07 cs.CV 79%

Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback

Restore-R1: 通过多模态大语言模型感知反馈的强化学习图像修复代理

Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu

机构 * Amazon(亚马逊) Northeastern University(东北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Restore-R1框架,利用强化学习和多模态大语言模型感知反馈,高效解决图像修复问题,无需标注数据即可实现高质量修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03697 2026-04-07 cs.CV 79%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03393 2026-04-07 cs.AI 79%

TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering

TABQAWORLD: 优化多模态推理以实现多轮表格问答

Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin, Peng Lu, Chunhe Wang, Changlun Li, Hanwei Wu, Nan Tang, Elisa Kreiss, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SimpleWay

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 TABQAWORLD通过联合优化表格表示与估计,提升多轮表格问答的可靠性与效率,实现4.87%的准确率提升和33.35%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM 75%

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态Agent :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04901 2026-04-07 cs.CV cs.AI 62%

FileGram: Grounding Agent Personalization in File-System Behavioral Traces

FileGram:基于文件系统行为轨迹的智能体个性化研究

Shuai Liu, Shulin Tian, Kairui Hu, Yuhao Dong, Zhe Yang, Bo Li, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FileGram框架,通过文件系统行为轨迹实现智能体记忆与个性化,包含数据引擎、基准测试和内存架构,解决数据限制和多模态轨迹收集难题。

Comments Project Page: https://filegram.choiszt.com, Code: https://github.com/synvo-ai/FileGram

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV 57%

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03631 2026-04-07 cs.AI 57%

Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors

单 agent 与多 agent 在自动视频分析上的协作学习行为研究

Likai Peng, Shihui Feng

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Institute of Data Science, The University of Hong Kong(香港大学数据科学研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文比较了单 agent 和多 agent 框架在自动编码协作学习场景视频中的性能,提出两种多 agent 方法,分别在场景检测和动作检测任务中表现优异。

Comments 15 pages, 4 figures. To be published in the 27th International Conference on Artificial Intelligence in Education (AIED2026)

详情

展开后加载摘要…

URL PDF HTML 收藏