arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-08 至 2026-07-08 共收录 80 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2607.05649 2026-07-08 cs.CV cs.LG 新提交 74%

REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles

REVIVE:一种用于自动驾驶车辆中破坏行为检测与恢复的多模态框架

Abdullah Tariq Choudhry, Tapadhir Das

机构 * University of the Pacific(太平洋大学)

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

AI总结 研究自动驾驶车辆中破坏行为导致的遮挡攻击问题,提出REVIVE多模态框架,集成多种检测与恢复方法,如二进制VOA检测、多类VOA模式识别等,实验表明该框架能有效恢复图像,提升目标检测指标,提供结构化恢复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06565 2026-07-08 cs.CV cs.AI cs.LG 新提交 62%

ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

ELSA3D:用于统一3D理解与生成的弹性语义锚定

Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究统一3D基础模型文本-3D交互隐式问题,提出ELSA3D模型,通过弹性语义锚定联合构建语言和几何推理,用尺度感知八叉树令牌化器和锚定令牌表示几何,轻量级路由器使计算和推理弹性化,性能领先且减少计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 62%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交 57%

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 57%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 50%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 17 篇

2605.30794 2026-07-08 cs.CV cs.AI 版本更新 86%

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) Beijing University of Technology, China(北京理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。

Comments accept by iclm2026, add github link

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23916 2026-07-08 cs.CV cs.AI 版本更新 81%

DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning

DecepGPT: 基于多文化数据集和鲁棒多模态学习的模式驱动欺骗检测

Jiajian Huang, Dongliang Zhu, Zitong YU, Hui Ma, Jiayu Zhang, Chunmei Zhu, Xiaochun Cao

机构 * Great Bay University(Great Bay大学) Wuhan University(武汉大学) Sun Yat-sen University(孙中山大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DecepGPT,通过构建包含结构化线索描述和推理链的推理数据集,释放多文化数据集T4-Deception,并提出SICS和DMC模块,实现多模态欺骗检测的鲁棒学习,实验表明其在领域内和跨领域场景中均取得最佳性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06196 2026-07-08 cs.CL cs.CY 新提交 79%

Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability

Pluralis v0.1:迈向用于人工智能风险与可靠性的多元文化、多模态、多语言基准测试

Alicia Parrish, Rajat Shinde, Sanket Badhe, Xinyi Bai, Sree Bhargavi Balija, Hua-Rong Chu, Emilio Ferrara, Armstrong Foundjem, Rajat Ghosh, Aakash Gupta, Xuanli He, Ong Chen Hui, Minji Jung, Madhangi Karimanal, Faiza Khan Khattak, Boryoung Kim, Eugenia Kim, Liliya Lavitas, Seok Min Lim, Victor Lu, Jim Moirangthem, Dhivya Nagasubramanian, Deepak Pandita, Sita Rajagopal, Geetha Raju, Evgeniia Razumovskaia, Aravind Reddy, Federico Ricciuti, Nobin Sarwar, Sungpil Shin, Sunayana Sitaram, Snehal Thorat, Tharindu Cyril Weerasooriya, Jasmijn Bastings, Joachim Baumann, Kongtao Chen, Murali Emani, Mariya Hendriksen, Jiho Jin, Jun Seong Kim, Younghoon Ko, Alicja Kwasniewska, Minjae Lee, Tom Wei-cyuan Lin Kashyap Ramanandula Manjusha, Junho Myung, Junyeong Park, Roma Patel, Shyam Ratan, Sudarsun Santhiappan, Priyanka Suresh, Tuesday, Ksheeraj Sai Vepuri Laura Amortegui-Ordonez, Claire Dennis, Minsuk Kahng, Chris Knotz, Alice Oh, Balaraman Ravindran, Soojung Ryu William Bartholomew, Hiwot Tesfaye, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校) Google(谷歌) University of Missouri Columbia(密苏里大学哥伦比亚分校) Chunghwa Telecom Laboratories(春木电信实验室) University of Southern California(南加州大学) Polytechnique Montreal(蒙特利尔理工学院) Nutanix ThinkEvolve Labs(ThinkEvolve实验室) UCL(伦敦大学学院) Infocomm Media Development Authority(信息通信媒体发展局) Monark Health(Monark健康) Seoul National University(首尔国立大学) Microsoft(微软) Centre for Responsible AI (CeRAI), Wadhwani School of Data Science and AI (WSAI), Indian Institute of Technology Madras(负责任人工智能中心(CeRAI)、瓦达威人工智能学校(WSAI)、印度理工学院马德拉斯分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Microsoft Research India(微软印度研究院) Stanford University(斯坦福大学) Argonne National Laboratory(阿贡国家实验室) University of Oxford(牛津大学) KAIST(韩国科学技术院) Yonsei University(延世大学) Amazon(亚马逊) UIUC(伊利诺伊大学香槟分校) Rochester Institute of Technology(罗切斯特理工学院) Xenoscube Inc.(Xenoscube公司) Korea AI Safety Institute (K-AISI)(韩国人工智能安全研究所(K-AISI)) MLCommons CommonGround Artifex Labs(Artifex实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究针对现有AI安全评估框架忽视文化差异问题,构建多语言多模态数据集Pluralis v0.1,从文化优先视角引入新评估范式,提出Judge - Pluralis集成,揭示特定地区失败模式,为多语言多元文化评估提供基础和创新起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04628 2026-07-08 cs.CV 版本更新 79%

A Spatial-Spectral-Frequency Interactive Network for Multimodal Remote Sensing Classification

一种空间-光谱-频率交互网络用于多模态遥感分类

Hao Liu, Yunhao Gao, Wei Li, Mingyang Zhang, Maoguo Gong, Lorenzo Bruzzone

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息与电子学院) Beijing Key Laboratory of Fractional Signals and Systems, Beijing Institute of Technology(北京理工大学分数域信号与系统北京市重点实验室) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Key Laboratory of Collaborative Intelligent Systems of Ministry of Education, Xidian University(西安电子科技大学教育部协同智能系统重点实验室) Academy of Artificial Intelligence, Inner Mongolia Normal University(内蒙古师范大学人工智能研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出S$^2$Fin网络,通过空间、光谱和频率域的交互模块,提升多模态遥感图像分类性能,实验表明其在有限标注数据下表现优于现有方法。

Journal ref Pattern Recognition, Vol. 180, 2026, 114309

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09696 2026-07-08 cs.CV 版本更新 79%

ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试

Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) University of Alberta(阿尔伯塔大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Northeastern University(东北大学) Astadeus College of Southern Maryland(马里兰州南部学院) University of Geneva(日内瓦大学) University of Oregon(俄勒冈大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10166 2026-07-08 cs.RO cs.HC 78%

Dance2Hesitate: A Multi-Modal Dataset of Dancer-Taught Hesitancy for Understandable Robot Motion

Dance2Hesitate: 一种多模态舞者教学犹豫数据集,用于可理解的机器人运动

Srikrishna Bangalore Raghu, Anna Soukhovei, Divya Sai Sindhuja Vankineni, Alexandra Bacula, Alessandro Roncone

机构 * University of Colorado Boulder(科罗拉多大学波德分校) Pacific Lutheran University(太平洋 Lutheran 大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 Dance2Hesitate数据集通过多模态舞者教学生成,用于研究可理解的机器人犹豫运动,涵盖不同情境和身体状态下的运动轨迹。

Comments Accepted to the Designing Transparent and Understandable Robots (D-TUR) Workshop at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026, Edinburgh, UK

Journal ref Workshop on Designing Transparent and Understandable Robots, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03261 2026-07-08 cs.CV 新提交 74%

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

OmniLayout:用于印刷电路板布局中约束感知几何推理的原理图耦合多模态基准测试

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Binghamton University(宾汉姆顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 介绍OmniLayout基准测试,用于评估大语言模型在印刷电路板布局放置推理。含1681个工业级原理图耦合PCB布局及四项任务,揭示当前大语言模型在PCB布局放置上有诸多局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05989 2026-07-08 cs.CR 新提交 67%

ProvICS: A Provenance-based Intrusion Detection for Industrial Control Systems

ProvICS:一种基于溯源的工业控制系统入侵检测方法

Md Neyamul Islam Shibbir, Deepak K Tosh

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 针对工业控制系统因信息技术与运营技术融合面临多阶段网络攻击,且基于溯源的入侵检测系统在工业网络物理系统中适用性待探索的问题,提出ProvICS多模态溯源数据集,经实验验证其能有效检测攻击事件,填补现有基准空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05614 2026-07-08 cs.CL cs.AI cs.CV 新提交 67%

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

BaFCo:用于复杂孟加拉语表格理解的文档理解基准

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) Center for Computational & Data Sciences(计算与数据科学中心) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成式人工智能)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05880 2026-07-08 cs.CV cs.AI 新提交 62%

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context

哈里森.Rad 1.5技术报告:一种可根据图像、先验知识和临床背景起草报告的放射学基础模型

Suneeta Mall, Vladimir Nekrasov, Ashnil Kumar, Sajith Karunasena, Aiden Nibali, Alix Bird, Mateo Diaz Shine, Jarrel Seah

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对放射科报告积压问题,提出HR1.5多模态大语言模型,通过三阶段训练,用特定评分框架评估,该模型是唯一达模拟FRCR及格标准的系统,在多方面准确率最高,还研究了可解释性等以支持临床应用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06521 2026-07-08 cs.CV cs.CL 版本更新 62%

BabyVision: Visual Reasoning Beyond Language

BabyVision:超越语言的视觉推理

Liang Chen, Weichu Xie, Yiyan Liang, Hongfeng He, Hans Zhao, Zhibo Yang, Zhiqi Huang, Haoning Wu, Haoyu Lu, Y. charles, Yiping Bao, Yuantao Fan, Guopeng Li, Haiyang Shen, Xuanzhong Chen, Wendong Xu, Shuzheng Si, Zefan Cai, Wenhao Chai, Ziqi Huang, Fangfu Liu, Tianyu Liu, Baobao Chang, Ming Wu, Xiaobo Hu, Kaiyuan Chen, Yixin Ren, Yang Liu, Yuan Gong, Kuan Li

机构 * UniPat AI xbench Alibaba Group(阿里巴巴集团) MoonShot AI StepFun Peking University(北京大学) Tsinghua University(清华大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学) G Labs Equal Core Contributors(0G Labs 等核心贡献者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。

Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 57%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05493 2026-07-08 cs.CV 新提交 57%

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理

Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong Polytechnic University(香港理工大学) Linköping University(林雪平大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究3D环境自然语言查询的可操作性问题,提出Ground3D-LMM统一模型,以点云等为输入,支持3D空间对话,能给出基于点的响应和度量数值输出,通过定义新任务、引入数据集验证,为3D对话理解提供强大基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新 57%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14692 2026-07-08 cs.CY cs.AI 57%

The AI Assessment Scale (AIAS) in action: A pilot implementation of GenAI supported assessment- A Preprint

在实践中应用人工智能评估量表(AIAS):GenAI支持的评估试点实施 - 预印本

Leon Furze, Mike Perkins, Jasper Roe, Jason MacVaugh

机构 * Deakin University(德金大学) British University Vietnam(越南英国大学) James Cook University Singapore(新加坡詹姆斯库克大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AIAS框架,通过试点研究展示GenAI在高等教育中的有效应用,显著降低学术不端,提升学生成绩和课程通过率。

Journal ref Australasian Journal of Educational Technology 40(4) (2024) 38-55

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05657 2026-07-08 cs.AR 新提交 50%

NEMESIS: NEtlist-Driven Modeling and Equation Synthesis with Inversion-Aware SPICE Anchoring

NEMESIS:基于网表驱动的建模与方程合成,结合反演感知SPICE锚定

Subhadip Ghosh, Ramesh Harjani, Sachin S. Sapatnekar

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究基于大语言模型提出NEMESIS框架用于OTA设计,平衡分析模型与SPICE评估。通过识别电路原语生成性能方程,经修复循环优化。在65nm工艺下对五种OTA拓扑验证,方程误差小且评估速度大幅提升。

Comments Accepted for publication at the IEEE International Conference on LLM-Aided Design, 2026, to be held: Time: July 30-31, 2026 Location: Stanford University, Stanford, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09029 2026-07-08 cs.CY 50%

The AI Assessment Scale Revisited: A Framework for Educational Assessment

重新审视人工智能评估量表:一种教育评估框架

Mike Perkins, Jasper Roe, Leon Furze

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种更新的人工智能评估量表框架,旨在促进教育者与学生关于GenAI使用的开放对话,并帮助教育者重新设计评估,以适应不断扩展的人工智能能力。

Journal ref Journal of University Teaching and Learning Practice 22(7) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 7 篇

2607.06559 2026-07-08 cs.RO 新提交 67%

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

RynnWorld-4D:用于机器人操作的4D具身世界模型

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室)

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract)

AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 62%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 62%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05999 2026-07-08 cs.AI 新提交 57%

AgoraSim: A Hybrid Agent-Based Modeling Framework

AgoraSim:一个基于混合智能体的建模框架

Chung-Chi Chen

机构 * Human-Agent Ally Lab (HAA Lab)(人机协作实验室(HAA实验室)) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对大语言模型智能体模拟输出易被过度解读及难与社会动态比较的问题,提出AgoraSim框架,能将文本等解析为可编辑配置,运行混合智能体群体并比较场景,通过多种接口公开,助用户检查轨迹、比较假设及识别需验证的案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05765 2026-07-08 cs.CV cs.RO 新提交 57%

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Image2Sim:通过生成神经模拟器扩展具身导航

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学) HKUST(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 研究针对具身导航缺乏优质交互环境的问题,提出Image2Sim实时神经模拟框架,通过解耦3D空间锚定与观察合成构建环境,能大规模生成相关数据,训练的导航模型在基准测试中有提升且可迁移,为具身导航提供实用训练基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05511 2026-07-08 cs.CV 新提交 57%

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

Light-Omni:基于长期记忆的智能视频理解中的反射优于推理

Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 研究针对智能视频理解中先进智能体依赖迭代推理成本高的问题,提出Light-Omni框架,通过双重上下文状态实现反射式轻量级视频理解,经实验验证其有效性,性能优于M3-Agent且能增强现有MLLMs。

Comments Project Page: https://clare-nie.github.io/Light-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07089 2026-07-08 cs.CV 版本更新 57%

RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent

RS-Agent:通过智能代理实现遥感任务自动化

Wenjia Xu, Zijian Yu, Boyang Mu, Jiuniu Wang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(网络与交换技术国家重点实验室,北京邮电大学,中国) City University of HongKong, Hong Kong 999077, China(香港城市大学,中国) School of Geographic Sciences, Hunan Normal University, Changsha 410081, China(地理科学学院,湖南师范大学,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在遥感任务中的局限,提出RS-Agent智能代理,通过结构化任务规划等连接用户意图与遥感流程,含四个组件及两种方法,实验显示其在多任务中显著优于现有模型,证明结合两者用于智能地理空间分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏