arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 192 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 43 篇

2604.17570 2026-04-21 cs.CV cs.AI 62%

PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation

PBSBench:一种多级视觉-语言框架和血液病理学全滑片图像解释基准

Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学) The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PBSBench,一种针对血液病理学全滑片图像解释的多级视觉-语言框架和基准,通过构建PBSInstr数据集和PBS-VL模型,提升了对血涂片图像的理解能力。

Comments 19 pages, 12 figures, Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16538 2026-04-21 cs.CV cs.CL 62%

VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis

VC-Inspector:通过事实分析推进无参考视频字幕评估

Shubhashis Roy Dipta, Tz-Ying Wu, Subarna Tripathi

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Intel(英特尔)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 VC-Inspector提出了一种轻量级开源大多模态模型,用于无参考视频字幕评估,专注于事实准确性。通过生成可控制事实错误的字幕及评分注释,实现了可重复和事实感知的评估,实验显示其与人类判断的高相关性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16851 2026-04-21 cs.LG cs.AI cs.CV q-bio.BM q-bio.QM 62%

Applications of deep generative models to DNA reaction kinetics and to cryogenic electron microscopy

深度生成模型在DNA反应动力学和低温电子显微镜中的应用

Chenwei Zhang

机构 * The University Of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了深度生成模型在DNA反应动力学和低温电子显微镜分析中的应用,提出ViDa和Struc2mapGAN等方法,提升生物过程的可解释性和结构建模的准确性。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16506 2026-04-21 cs.CV cs.CL 62%

Medical thinking with multiple images

多图像医学推理

Zonghai Yao, Benlu Wang, Yifan Zhang, Junda Wang, Iris Xia, Zhipeng Tang, Shuo Han, Feiyun Ouyang, Zhichao Yang, Arman Cohan, Hong Yu

机构 * Manning College of Information and Computer Sciences, UMass Amherst(UMass阿默斯特信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗保健中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Miner School of Computer and Information Sciences, UMass Lowell(UMass洛威计算机与信息科学学院) Department of Electrical and Computer Engineering, UMass Lowell(UMass洛威电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MedThinkVQA多图像医学推理基准,通过专家标注数据验证多图像整合对临床推理的重要性,发现多图像推理瓶颈在于证据提取与对齐,且增加推理时间计算效果有限。

Comments Equal contribution for the first two authors. To appear in the proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026). Code is in https://github.com/benluwang/MedThinkVQA. Dataset is in https://huggingface.co/datasets/bio-nlp-umass/MedThinkVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17894 2026-04-21 cs.CL 57%

Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language Instructions

基于用户定义动态模板和自然语言指令的自动幻灯片更新

Kun Zhou, Jiakai He, Wenmian Yang, Zhensheng Wang, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DynaSlide基准,结合多模态解析和自然语言指令,实现幻灯片动态更新,保留布局与样式,并设计评估协议揭示未来研究挑战。

Comments To appear in Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10963 2026-04-21 cs.CV cs.LG 57%

Pointy - A Lightweight Transformer for Point Cloud Foundation Models

Pointy - 一种轻量级的点云基础模型变压器

Konrad Szafer, Marek Kraft, Dominik Belter

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(机器人与机器智能研究所,波兹南技术大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 Pointy通过轻量级的点云变压器架构,在仅使用39k点云数据的情况下,超越了使用超过20万样本训练的更大基础模型,展示了精心设计的训练设置和架构的价值。

Comments To appear in the proceedings of ACIVS 2025. An earlier version was presented at the SCI-FM workshop at ICLR 2025

Journal ref In: Blanc-Talon, J., Delmas, P., Takahashi, H., Yasuhiro, M. (eds) Advanced Concepts for Intelligent Vision Systems. ACIVS 2025. Lecture Notes in Computer Science, vol 15656. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17817 2026-04-21 cs.HC cs.AI cs.MA 57%

Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots

LLM是否需要看到一切?基于Screentext与截图的LLM驱动智能手机自动化失败性基准与研究

Shiquan Zhang, Tianyi Zhang, Le Fang, Simon D'Alfonso, Hong Jia, Vassilis Kostakos

机构 * University of Melbourne(墨尔本大学) School of Computer Science(计算机科学学院) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文通过DailyDroid基准测试,探讨LLM驱动的智能手机自动化在文本与截图输入下的性能差异,揭示UI可访问性、输入模态及LLM应用设计中的关键问题。

Comments 29 pages. This study was conducted around May, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17318 2026-04-21 cs.CV 57%

When Background Matters: Breaking Medical Vision Language Models by Transferable Attack

背景的重要性:通过可转移攻击打破医疗视觉语言模型

Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) MBZUAI(穆桑大学人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedFocusLeak攻击方法,通过在非诊断背景区域注入协调扰动并利用注意力分散机制,使模型产生看似合理但错误的诊断,揭示了现代临床VLMs推理能力的弱点。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22516 2026-04-21 cs.LG cs.AI 57%

SCOPE-PD: Explainable AI on Subjective and Clinical Objective Measurements of Parkinson's Disease for Precision Decision-Making

SCOPE-PD:基于帕金森病主观和临床客观测量的可解释AI用于精准决策制定

Md Mezbahul Islam, John Michael Templeton, Masrur Sobhan, Christian Poellabauer, Ananda Mohan Mondal

机构 * Computing & Information Sciences(计算与信息科学) Florida International University(佛罗里达国际大学) Computer Science & Engineering(计算机科学与工程) University of South Florida(佛罗里达州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SCOPE-PD框架,结合主观和客观评估数据,利用随机森林算法实现98.66%的准确率,通过SHAP分析揭示运动障碍、运动迟缓和面部表情为主要贡献特征。

Comments 16 pages, 3 tables, 5 figures, to be published (full text online) in Springer (Springer CCIS series: electronic ISSN 1865-0937, print ISSN 1865-0929)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16984 2026-04-21 cs.CV 57%

Adverse-to-the-eXtreme Panoptic Segmentation: URVIS 2026 Study and Benchmark

极端恶劣环境全景分割挑战:URVIS 2026研究与基准

Yiting Wang, Nolwenn Peyratout, Tim Brodermann, Jiahui Wang, Yusi Cao, Michele Cazzola, Elie Tarassov, Takuya Kobayashi, Abderrahim Kasmi, Guillaume Allibert, Cédric Demonceaux, Valentina Donzella, Kurt Debattista, Radu Timofte, Zongwei Wu, Christos Sakaridis

机构 * MUSES-AXPS

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文报告了URVIS 2026挑战赛,首次针对极端恶劣环境下的全景分割,基于MUSES数据集,采用加权全景质量指标评估,总结了挑战设定、基准结果及当前进展与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16950 2026-04-21 cs.AI 57%

AutoPKG: An Automated Framework for Dynamic E-commerce Product-Attribute Knowledge Graph Construction

AutoPKG:一种用于动态电子商务产品-属性知识图谱构建的自动化框架

Pollawat Hongwimol, Haoning Shang, Chutong Wang, Zhichao Wan, Yi Gao, Yuanming Li, Lin Gui, Wenhao Sun, Cheng Yu

机构 * Lazada, Alibaba International Digital Commerce Group(Lazada,阿里巴巴国际数字 commerce 集团) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AutoPKG框架,通过多智能体大语言模型自动构建产品-属性知识图谱,解决电子商务产品属性提取中本体不一致、不完整和维护成本高的问题,实验证明其在提升GMV和推荐效果上的显著优势。

Comments Accepted as ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16586 2026-04-21 cs.LG cs.AI q-bio.QM 57%

A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era

在基础模型时代对深度学习用于分子性质预测的系统调查和基准测试

Zongru Li, Xingsheng Chen, Honggang Wen, Regina Qianru Zhang, Ming Li, Xiaojin Zhang, Hongzhi Yin, Qiang Yang, Kwok-Yan Lam, Pietro Lio, Siu-Ming Yiu

机构 * The University of Hong Kong, Hong Kong SAR(香港大学) Nanyang Technological University, Singapore(南洋理工大学) University of Cambridge, United Kingdom(剑桥大学) Zhejiang Normal University, China(浙江师范大学) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学) The University of Queensland(昆士兰大学) The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文系统调查了深度学习在分子性质预测中的应用,探讨了四种互补范式,并提出了未来三个发展方向,包括物理感知学习、可信推理的基础模型和整合计算与实验数据的基准生态系统。

Comments 32 pages. It is just accepted by Journal of Chemical Theory and Computation 2026

Journal ref Journal of Chemical Theory and Computation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16385 2026-04-21 cs.SE cs.AI 57%

StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability

StressWeb: 一个用于评估网络代理在现实交互变异下的鲁棒性的诊断基准

Haoyue Bai, Dong Wang, Long Chen, Bingguang Hao, Pengyang Shao, Yonghui Yang, Yicheng He, Chenyi Zhuang

机构 * Inclusion AI, Ant Group(Inclusion AI,蚂蚁集团) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出StressWeb基准,通过构建可控的网络环境和引入结构化扰动,评估网络代理在现实交互中的鲁棒性,揭示隐藏的失败模式和鲁棒性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV 57%

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16436 2026-04-21 cs.NE cs.LG 50%

Fuzzy Encoding-Decoding to Improve Spiking Q-Learning Performance in Autonomous Driving

模糊编码-解码以提升自动驾驶中的脉冲Q学习性能

Aref Ghoreishee, Abhishek Mishra, Lifeng Zhou, John Walsh, Anup Das, Nagarajan Kandasamy

机构 * Electrical and Computer Engineering Department(电气与计算机工程系) Drexel University(德雷塞尔大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出模糊编码-解码架构,通过改进视觉多模态深度脉冲Q网络,解决脉冲强化学习中的信息丢失和表征能力不足问题,提升自动驾驶决策精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16408 2026-04-21 cs.RO cs.HC 50%

An Edge-Host-Cloud Architecture for Robot-Agnostic, Caregiver-in-the-Loop Personalized Cognitive Exercise: Multi-Site Deployment in Dementia Care

一种面向机器人无关、陪护人员在环的个性化认知训练的边缘-主机-云架构:在痴呆症护理中的多地点部署

Wenzheng Zhao, Ruth Palan Lopez, Shu Fen Wung, Fengpei Yuan

机构 * Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出了一种分布式机器人交互平台,通过整合护理人员知识、边缘智能和机器人代理,实现个性化认知训练支持。平台通过多模态信号融合实现情感感知,并通过边缘服务器实现低延迟、隐私保护的部署。

Comments 21 pages, 6 figures, 10 tables, submitted to IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 14 篇

2604.17190 2026-04-21 cs.CV 84%

LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation

LookasideVLN: 基于方向的空中视觉与语言导航

Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Cardiff University(卡迪夫大学) Beihang University(北航) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出LookasideVLN,通过利用自然语言中的方向线索提升空中视觉与语言导航的准确性和效率,采用方向感知图、空间地标知识库和方向MLLM导航代理三种核心组件。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17611 2026-04-21 cs.LG cs.AI 79%

STEP-PD: Stage-Aware and Explainable Parkinson's Disease Severity Classification Using Multimodal Clinical Assessments

STEP-PD:基于多模态临床评估的阶段感知和可解释性帕金森病严重程度分类

Md Mezbahul Islam, John Michael Templeton, Christian Poellabauer, Ananda Mohan Mondal

机构 * School of Computing & Information Sciences, Florida International University(佛罗里达国际大学计算机与信息科学学院) College of AI, Cybersecurity and Computing, University of South Florida(佛罗里达州立大学人工智能、网络安全与计算学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出STEP-PD框架,利用PPMI数据中的多模态临床评估,通过SHAP解释性方法实现帕金森病严重程度的可解释分类,XGBoost在多种任务中表现出高准确性和稳定性。

Comments 10 pages, 6 figures, 4 tables, accepted at IEEE International Conference on Healthcare Informatics (ICHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA 79%

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19237 2026-04-21 cs.AI cs.RO 79%

Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots

多模态大语言模型驱动机器人中的躯体自我识别

Iñaki Dellibarda Varela, Pablo Romero-Sorozabal, Diego Torricelli, Gabriel Delgado-Oleas, Jose Ignacio Serrano, Maria Dolores del Castillo Sobrino, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics(自动化与机器人中心) University of Azuay(阿祖亚大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型通过躯体运动经验发展自我识别能力,展示机器人在环境感知、自我识别和预测意识方面的表现,揭示感觉整合对最小自我的影响及记忆协调机制。

Comments 16 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 79%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16333 2026-04-21 cs.LG cs.AI 79%

A Discordance-Aware Multimodal Framework with Multi-Agent Clinical Reasoning

一种考虑不一致性的多模态框架与多智能体临床推理

Pegah Ahadian, Mingrui Yang, Sixu Chen, Xiaojuan Li, Qiang Guan

机构 * Department of Computer Science(计算机科学系) Kent State University(肯特州立大学) Department of Biomedical Engineering(生物医学工程系) Cleveland Clinic(克利夫兰诊所)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合机器学习模型与多智能体推理系统的多模态框架,用于预测膝骨关节炎的进展并生成临床管理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17459 2026-04-21 cs.IR 78%

Transparent and Controllable Recommendation Filtering via Multimodal Multi-Agent Collaboration

通过多模态多智能体协作实现透明且可控的推荐过滤

Chi Zhang, Zhipeng Xu, Jiahao Liu, Dongsheng Li, Hansu Gu, Peng Zhang, Ning Gu, Tun Lu

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种结合端到云协作、多模态感知和多智能体编排的框架,有效减少推荐系统中的过度关联和误报,提升用户控制和透明度。

Comments 14 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 62%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :image-text(abstract);分类 cs.CV、cs.MM

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21064 2026-04-21 cs.AI cs.CV 62%

OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection

OVOD-Agent:一种用于主动视觉推理和自进化检测的马尔可夫-多臂框架

Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He

机构 * Wuhan University(武汉大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OVOD-Agent框架,通过将文本优化扩展为可解释的视觉CoT,结合弱马尔可夫决策过程和多臂模块,实现主动视觉推理和自进化检测,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16331 2026-04-21 cs.RO cs.AI cs.CV cs.MA 62%

BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning

BrainMem: 为具身智能任务规划设计的脑启发式记忆系统

Xiaoyu Ma, Lianyu Hu, Wenbing Tang, Zixuan Hu, Zeqin Liao, Zhizhen Wu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tianjin University, Tianjin, China(天津大学,天津,中国)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出BrainMem,一种无训练的分层记忆系统,通过构建知识图谱和符号指南,提升具身智能在复杂环境中的任务规划能力,尤其在长周期和空间复杂任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05508 2026-04-21 cs.CV cs.CL 62%

Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors

无需语言特定先验知识实现象形文字脚本级别的结构分析

Fuwen Luo, Zihao Wan, Ziyue Wang, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang, Peng Li, Yang Liu

机构 * THUNLP-MT(清华大学自然语言处理实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HieroSA框架,使多模态大语言模型能自动从字符位图中提取脚本级结构,无需人工数据,实现跨语言通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06812 2026-04-21 cs.AI cs.CY cs.LG 57%

Generative midtended cognition and Artificial Intelligence. Thinging with thinging things

生成性中介认知与人工智能。思考与思考之物

Xabier E. Barandiaran, Marta Pérez-Verdugo

机构 * IAS-Research Centre for Life, Mind and Society, Dept. Philosophy, UPV/EHU, University of the Basque Country, Donostia, Gipuzkoa (Spain)(生命、心智与社会研究中心,哲学系,巴斯克大学,Donostia, Gipuzkoa (西班牙))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文探讨生成性中介认知概念,分析生成AI与人类认知的结合,提出该认知类型更接近社会认知而非传统扩展认知,并定义了生成性中介认知的两个维度:宽度和深度。

Comments 16 pages, 2 figures. Post-print of article published in Synthese. The final published version is available open access at https://doi.org/10.1007/s11229-025-04961-4

Journal ref Synthese 205 (2025) 137

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV 57%

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16571 2026-04-21 cs.AR cs.SE 50%

EquivFusion: Unifying Hardware Equivalence Checking from Algorithms to Netlists via MLIR

EquivFusion:通过MLIR统一算法到网络列表的硬件等价性检查

Jiaying Zhu, Baoqi Zhang, Mengxia Tao, Kezhi Li, Hao Yan, Qiang Xu, Min Li

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出EquivFusion工具,通过MLIR统一多模态电路设计的算法与硬件等价性检查,解决软件与硬件之间语义差距的问题。

Comments Accepted to FSE 2026 (Tool Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏