arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-18 至 2026-05-18 共收录 77 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2605.16104 2026-05-18 q-bio.GN q-bio.QM 78%

StateXDiff: Cell State-Contextualized Multimodal Diffusion for Single-Cell Perturbation Prediction

StateXDiff: 单细胞扰动预测的细胞状态-上下文化多模态扩散框架

Peiting Shi, Ningfeng Que, Xianzhe Huang, Xiaofei Wang, Jianzhong Jeff Xi

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 StateXDiff通过整合转录组与蛋白质特征,构建多模态细胞状态表示,并利用条件扩散模型生成药物扰动特异性变化,提升单细胞扰动预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24550 2026-05-18 cs.LG cs.SD 78%

Training-Free Multimodal Guidance for Video to Audio Generation

无需训练的多模态引导用于视频到音频生成

Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecomm., Sapienza University of Rome, Italy(信息工程、电子与电信系,罗马大学萨皮恩扎)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出无需训练的多模态引导机制,用于视频到音频扩散生成,通过模态嵌入跨度强制视频、音频和文本的一致对齐,提升生成质量与多模态对齐效果。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14876 2026-05-18 cs.CV cs.AI 62%

Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

通过闭环验证推理解锁复杂视觉生成

Hanbo Cheng, Limin Lin, Ruo Zhang, Yicheng Pan, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLVR框架,结合视觉语言逻辑规划与像素级扩散生成,通过自动化数据引擎和PPRL解决多步推理中的优化问题,同时引入DSWM降低推理成本,实验表明其在多个基准上优于开源模型,实现了复杂视觉生成的扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02307 2026-05-18 cs.CV cs.AI 62%

NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation

NoiseShift: 为更好的低分辨率图像生成的分辨率感知噪声校准

Ruozhen He, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NoiseShift,通过校准噪声条件以恢复局部正反向一致性,提升低分辨率图像生成质量,无需额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15843 2026-05-18 cs.CV 57%

WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

WorldAct:将单体3D世界激活为可交互的以对象为中心的场景

Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc(华为公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 WorldAct通过多模态代理将静态生成的3D世界分解为可编辑的交互场景,支持对象级编辑和任务执行,保留全局一致性。

Comments Project page: https://sjtu-deepvisionlab.github.io/WorldAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12894 2026-05-18 cs.RO cs.CV 57%

Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning

稀疏动作生成:通过实时剪枝加速扩散策略

Kangye Ji, Jianbo Zhou, Yuan Meng, Ye Li, Hanyun Cui, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Computer Science(计算机科学系)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SAG方法,通过自适应剪枝和重用机制实现稀疏动作生成,提升实时视觉运动控制效率,实验显示生成速度提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15660 2026-05-18 cs.CV 57%

MaTe: Images Are All You Need for Material Transfer via Diffusion Transformer

MaTe:仅需图像进行材料迁移的扩散变换器

Nisha Huang, Henglin Liu, Yizhou Lin, Kaer Huang, Chubin Chen, Jie Guo, Tong-Yee Lee, Xiu Li

机构 * Tsinghua University(清华大学) PengCheng Laboratory(鹏城实验室) Lenovo Research(联想研究院) National Cheng-Kung University(国立成功大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 MaTe通过多模态注意力机制实现材料迁移,无需文本指导或辅助网络,提升了生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15243 2026-05-18 cs.LG cs.AI q-bio.BM q-bio.MN q-bio.QM 57%

Reading the Cell, Designing the Cure: Perturbation-Conditioned Molecular Diffusion for Function-Oriented Drug Design

解读细胞,设计治愈:基于扰动条件的分子扩散用于功能导向的药物设计

Ziyu Xu, Zijian Zhang, Liang Wang, Zhiyuan Liu, Qiang Liu, Shu Wu, Liang Wang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) National University of Singapore, Singapore(新加坡国立大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于转录组的药物设计(TBDD)作为生成逆问题,通过多分辨率转录组引导扩散框架,结合转录组扰动功能特征提取器,实现功能导向的药物分子设计,验证了其在结构质量和功能一致性上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16164 2026-05-18 cs.LG 50%

Entropic Auto-Encoding via Implicit Free-Energy Minimization

通过隐式自由能最小化实现熵编码解码

Hazhir Aliahmadi, Irina Babayan, Greg van Anders

机构 * Department of Physics, Engineering Physics & Astronomy, Queen’s University(物理系、工程物理与天文学系、女王大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出熵编码解码框架,通过自由能最小化隐式生成潜在变量先验,解决变分自编码器的后验崩溃问题,实现非高斯多模态潜在分布学习。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 15 篇

2605.10867 2026-05-18 cs.CR cs.AI cs.CV cs.LG cs.NI 81%

BEACON: A Multimodal Dataset for Learning Behavioral Fingerprints from Gameplay Data

BEACON:一个用于从游戏数据中学习行为指纹的多模态数据集

Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal, Guramrit Singh, Gurjot Singh, Maninder Singh

机构 * Computer Science and Engineering Department Thapar Institute of Engineering and Technology(计算机科学与工程系 泰帕尔工程与技术学院) David R Cheriton School of Computer Science University of Waterloo, Canada(大卫·R·切里顿计算机科学学院 温哥华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 BEACON数据集通过高精度运动技能和认知负荷,为行为生物特征的鲁棒性测试提供严格压力测试,支持连续认证、行为建模和多模态学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15755 2026-05-18 cs.CV 79%

Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models

基于属性的选型推理用于艺术品情感理解的多模态大语言模型

Cheng Zhang, Yuer Liu, Zhiyu Zhou, Hongxia Xie, Wen-Huang Cheng

机构 * Department of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Department of Computer Science, National Taiwan University(国立台湾大学计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于属性的选型推理方法,通过多模态大语言模型实现艺术品情感理解,通过引入属性瓶颈引导框架提升情感预测精度和解释简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15326 2026-05-18 cs.CV 79%

Multimodal Object Detection Under Sparse Forest-Canopy Occlusion

多模态目标检测在稀疏森林冠层遮挡下的应用

Nitik Jain, Mangal Kothari

机构 * Robotics & AI, Johns Hopkins University, USA(约翰霍普金斯大学机器人与人工智能系,美国) Department of Aerospace Engineering, IIT Kanpur(印度理工学院坎浦尔航空航天工程系) Senior Principal Flight Control Engineer, ADASI, EDGE Group, Abu Dhabi, UAE(阿布扎赫尔ADASI高级飞行控制系统工程师,EDGE集团)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态管道,结合激光雷达、可见-热成像融合和合成孔径成像技术,以提高森林冠层下人类检测的可靠性,展示了改进的YOLOv5检测器在热成像和融合图像上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 79%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 78%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15671 2026-05-18 eess.IV cs.CV 77%

Degradation-Aware Blur-Segmentation of Brain Tumor

考虑退化因素的脑肿瘤模糊分割

Yuchun Wang, Xiaosong Li, Gefei Liang, Yang Liu

机构 * School of Physics and Optoelectronic Engineering, Foshan University, China(物理与光电工程学院,佛山大学,中国)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出DABSeg网络,通过同步去模糊和精确分割,提升多模态3D脑肿瘤分割在退化条件下的鲁棒性与临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15764 2026-05-18 cs.CV cs.AI 62%

GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

GRASP:学习多个人非语言互动中的社会推理

Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic, Fiona Ryan, Bolin Lai, Sangmin Lee, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Amazon AGI Korea University(亚马逊AGI韩国大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。

Comments Project page: https://social-reaoning.github.io/grasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15997 2026-05-18 cs.CV 57%

Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning

分割、检测与解释:一种用于CT外观推理的统一框架

Yuyuan Liu, Can Peng, Yingyu Yang, Qianye Yang, Cheng Ouyang, J. Alison Noble

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出统一框架,整合语言引导的视觉推理,提升CT图像分割与检测的精度,并提供外观推理输出。

Comments 8 pages, 4 figures, submitted to IEEE Transactions on Medical Imaging (TMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15860 2026-05-18 cs.CV 57%

On RGB-TIR Stereo Calibration under Extreme Resolution Asymmetry

在极端分辨率不对称下的RGB-TIR立体校准

Michał Król, Michał Salamonowicz, Władysław Skarbek, Michał Tomaszewski

机构 * Independent Researcher(独立研究员) Warsaw University of Technology(华沙技术大学) Polish Japanese Academy of Information Technology(波兰日本信息科技学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种实用的RGB与TIR摄像头立体校准框架,解决低分辨率热传感器下的校准问题,通过动态OLED屏幕和专用角点检测算法实现高精度校准,验证了系统在建筑能耗评估中的应用。

Comments 27 pages, 12 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15794 2026-05-18 cs.CL 57%

ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation

ForMaT:用于视觉接地多语言PDF翻译的数据集

Michał Ciesiółka, Dawid Wiśniewski, Adrian Charkiewicz, Kamil Guttmann

机构 * Laniqo Faculty of Mathematics and Computer Science, Adam Mickiewicz University(亚当·密茨凯维奇大学数学与计算机科学学院) Poznań University of Technology(波兹南技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 ForMaT通过3956个PDF构建多语言翻译数据集,保留布局元数据以提升多模态翻译效果,采用K-Medoids采样捕捉复杂元素,揭示当前MT系统在空间接地与几何同步上的不足,为布局感知翻译模型提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03707 2026-05-18 cs.CL 57%

AirNav: A Large-Scale UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions

AirNav: 一个大规模无人机视觉与语言导航数据集,包含自然且多样的指令

Hengxing Cai, Yijie Rao, Ligang Huang, Zanyang Zhong, Jinhan Dong, Jingjun Tan, Changhao Nai, Jue Hou, Wenhao Lu, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出AirNav数据集,包含137K自然多样指令的导航样本,评估了多种方法,提出AirVLN-R1模型在测试中取得51.82%的成功率,并通过实际无人机实验验证了仿真到现实的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15708 2026-05-18 cs.CV 57%

3D Segmentation Using Viewpoint-Dependent Spatial Relationships

基于视角依赖空间关系的3D分割

Ayaka Nanri, Klara Reichard, Mert Kiray, Federico Tombari, Benjamin Busam, Asako Kanezaki

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个包含22万样本的3D参照分割数据集,通过密集视角采样扩展至数千万样本,研究视角依赖空间关系对3D大模型的影响,提升分割精度并提高mIoU至0.47。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15397 2026-05-18 cs.CV 57%

ELDOR: A Dataset and Benchmark for Illegal Gold Mining in the Amazon Rainforest

ELDOR:亚马逊雨林非法金矿开采的数据集和基准

Kangning Cui, Surendra Bohara, Suraj Prasai, Zishan Shao, Wei Tang, Martin Pillaca, Edwin Flores, Zhen Yang, Gregory Larsen, Evan Dethier, David Lutz, Jean-Michel Morel, Miles Silman, Victor Pauca, Fan Yang

机构 * Wake Forest University(威克森林大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Duke University(杜克大学) City University of Hong Kong(香港城市大学) Yale University(耶鲁大学) Alaska Spatial Science(阿拉斯加空间科学) Colby College(科林斯学院) Colby-Sawyer College(科林斯-萨威尔学院) Lingnan University(岭南大学) Centro de Innovación Cientifica Amazónica(亚马逊科学创新中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 ELDOR通过大规模无人机基准监测亚马逊雨林非法金矿开采对环境和景观的影响,包含2500多公顷的手动标注正射影像,涵盖采矿活动和生态结构的像素级语义标签,评估多种模型在细粒度和小规模结构识别上的性能。

Comments 70 pages, 35 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15223 2026-05-18 cs.AR cs.AI 57%

GenAI-Driven Approach to RISC-V Supply Chain Exploration

基于生成式人工智能的RISC-V供应链探索方法

Nenad Petrovic, Andre Schamschurko, Yingjie Xu, Alois Knoll

机构 * Chair of Robotics, Artificial Intelligence and Real-Time Systems(机器人、人工智能与实时系统教授会) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用LLM和VLM的供应链分析流程,结合MDE技术提升对异构数据的分析能力,通过知识图谱揭示供应链组件间的依赖关系,支持供应链韧性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12601 2026-05-18 cs.LG 50%

Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers

重新思考LLM路由的预测建模:当简单kNN胜过复杂学习路由

Yang Li

机构 * Independent researcher(独立研究者)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文通过简单性视角重新审视LLM路由,发现经过调优的kNN方法在多种任务中优于现有学习路由方法,引入标准化基准测试和多模态数据集,揭示嵌入空间局部性属性使非参数方法在样本复杂度更低的情况下实现强路由决策。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 6 篇

2605.15710 2026-05-18 cs.CL 79%

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16149 2026-05-18 cs.DS 78%

Fast and Memory Efficient Multimodal Journey Planning with Delays

快速且内存高效的考虑延迟的多模式行程规划

Denys Katkalo, Andrii Rohovyi, Toby Walsh

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种更高效、快速且准确的多模式行程规划方法,适用于单目标和双目标场景,通过优化算法提升速度和精度。

Comments v4: revised manuscript incorporating reviewer feedback (Related Work restructure, temporal-planning baselines, Bez 2020 thesis acknowledgment, equation relocation); style switched to the AAAI 2026 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19572 2026-05-18 cs.CL 70%

A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression

通过观察上下文压缩实现高效终端智能体的自进化框架

Jincheng Ren, Siwei Wu, Yizhi Li, Kang Zhu, Shu Xu, Boyu Feng, Ruibin Yuan, Wei Zhang, Riza Batista-Navarro, Jian Yang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) MAP 4 HKUST(GZ)(香港科技大学(广州)MAP 4) HKUST(香港科技大学) Beihang University(北京航空航天大学)

专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出TACO框架,通过自进化压缩规则提升终端智能体的效率与性能,实验表明在多个基准测试中均取得显著提升。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15542 2026-05-18 cs.AI 70%

DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding

DRS-GUI: 动态区域搜索用于无训练的GUI定位

Yichao Liu, Huawen Shen, Liu Yu, Shiyu Liu, Zeyu Chen, Yu Zhou

机构 * Nankai University(南开大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 DRS-GUI通过动态区域搜索框架提升GUI定位性能,利用轻量级UI感知器和MCTS动作规划器,实现高效区域探索与筛选,提升多模态大语言模型的定位能力。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15963 2026-05-18 cs.AI 57%

PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control

PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Jingxuan Wei, Xi Bai, Shan Liu, Caijun Jia, Zheng Sun, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) China University of Petroleum-Beijing(中国石油大学(北京))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出PAGER,通过依赖结构规划与像素级执行,解决对点精确几何GUI任务的需求,提升任务成功率至62%以上,填补语义-执行鸿沟。

Comments 27 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15611 2026-05-18 cs.AI 57%

TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices

TopoEvo: 一种面向拓扑的自演化多智能体框架用于微服务中的根本原因分析

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 针对微服务中观测数据异质性、故障传播和拓扑漂移问题,TopoEvo通过多模态对齐、拓扑约束推理和自演化机制,提升根本原因分析的鲁棒性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏