arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-02 至 2026-06-02 共收录 212 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 39 篇

2606.00622 2026-06-02 cs.CV 79%

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

MM-Snowball:多模态多轮对话中的幻觉雪崩评估与缓解

Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Southern University of Science and Technology(南方科技大学) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) MM Lab, CUHK(CUHK 多模态实验室) RAMS Lab, Huawei Technologies Co., Ltd.(华为技术有限公司 RAMS 实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大模型在多轮对话中因初始错误累积导致幻觉雪崩的问题,提出首个细粒度诊断基准MM-Snowball,并设计无训练的冲突感知视觉校正方法CAVR,通过表示级刷新视觉锚定和logit级修正输出分布来缓解雪崩效应。

Comments Accepted by The International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01901 2026-06-02 cs.CV cs.AI cs.CL 78%

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

图像重建游戏:通过迭代多模态对话建立共同基础

Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩大学语言学系计算语言学部) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 提出图像重建游戏基准,通过多轮迭代中视觉语言模型向图像生成器发出纠正指令,使累积的共同基础直接可视化为重建图像,发现描述器是重建质量的主导因素,而生成器决定迭代改进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01398 2026-06-02 cs.RO 78%

A Sonar-Visual Dataset for Cross-Modal Underwater Robot Perception

用于跨模态水下机器人感知的声纳-视觉数据集

Weitung Chen, Phil Tinn, Per Gunnar Auran, Martin Ludvigsen, Peter Halland Haro

机构 * Massachusetts Institute of Technology(麻省理工学院) SINTEF(斯蒂纳夫) Norwegian University of Science and Technology(挪威科技大学)

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 提出SOVIS数据集,包含76,000多对声纳-视觉帧,通过端到端管道同步和清洗数据,并利用交互式标注工具加速标注,在跨模态鱼类检测任务中实现mAP@0.10提升7倍。

Comments 6 pages, 7 figures, 3 tables. Accepted to IEEE ICRA 2026 S2S Workshop (From Sea to Space: Advancing Perception in Harsh Domains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01186 2026-06-02 eess.SP 78%

Artificial-Intelligence-Assisted Multi-Modal Terahertz Sensing and Environment Reconstruction

人工智能辅助的多模态太赫兹感知与环境重建

Yejian Lyu, Zitong Fang, Zhiqiang Yuan, Henk Wymeersch, Chong Han

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 提出一种基于测量的多模态太赫兹感知与视觉框架,结合信号处理与AI视觉模块,通过智能体集成实现室内环境的几何一致且语义可解释的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00752 2026-06-02 cs.LG cs.CE cs.HC 78%

A multimodal dataset of photoplethysmography and continuous behavioral responses to ASMR and nature videos

光电容积描记术和ASMR及自然视频连续行为反应的多模态数据集

Tushar Das, Daigo Hozaki, Koushlendra Kumar Singh, Hirohito M. Kondo

机构 * Machine Vision & Intelligence Lab, National Institute of Technology Jamshedpur(机器视觉与智能实验室,jamshedpur国家理工学院) School of Psychology, Chukyo University(心理学系,chukyo大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出REST-ASMR数据集,包含34名参与者在ASMR和自然视频刺激下的光电容积描记图、时间对齐视听刺激和连续主观标注,验证了刺激有效性、心血管减速,并通过双向长短期记忆模型实现高精度ASMR状态分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00345 2026-06-02 cs.LG 78%

Longitudinal Multimodal Sensing of Physical Activity and Well-Being in Older Adults

老年人身体活动与福祉的纵向多模态感知

Flavio Di Martino, Mattia G. Campana, Marcello Magno, Lorenza Pratali, Franca Delmastro

机构 * IIT-CNR(意大利理工学院-克雷斯塔纳国家研究委员会) IFC-CNR(意大利弗洛rence-克雷斯塔纳国家研究委员会)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究通过纵向多模态数据(可穿戴传感、行为监测和临床评估)对66名老年人进行现实世界监测,发现可观察行为目标预测性能良好(macro-F1 65%),而抽象结果预测仍具挑战,且历史特征是最重要的预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09883 2026-06-02 cs.CV cs.AI 73%

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

笛卡尔捷径:在极坐标空间中重新评估视觉推理

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02535 2026-06-02 cs.CV 70%

LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models

LL-Bench: 在大规模生成模型时代重新思考低级视觉评估

Lu Liu, Huiyu Duan, Chenxin Zhu, Jintong Lu, Haoyun Jiang, Liu Yang, Qiang Hu, Guangtao Zhai, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出LL-Bench基准,包含大量真实退化图像和人工偏好标注,系统评估大规模生成模型在低级视觉任务中的性能,并引入LL-Score评估器以更好对齐人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00046 2026-06-02 cs.MM cs.AI cs.CV cs.CY 67%

When Jokes Cross the Line: Analyzing Regular Humor and Dark Humor in YouTube Shorts

当玩笑越界:分析YouTube Shorts中的常规幽默与黑色幽默

Sydney Johns, Sanjeev Parthasarathy, Shantnu Bhalla, Vaibhav Garg

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 通过构建TwistedHumor数据集(1211个YouTube Shorts及33041条评论的手工标注),结合多视角分析(LLooM概念归纳、评论情感分析、大模型评估),揭示了短格式视频中常规幽默与黑色幽默在主题、观众反应和模型检测上的差异,强调了上下文感知审核的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02523 2026-06-02 cs.CL cs.CV cs.CY 62%

FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes

FigSIM:用于自杀迷因的细粒度自杀严重程度和比喻语言数据集

Liuliu Chen, Elise R. Carrotte, Brian E. Chapman, Jo Robinson, Mike Conway

机构 * School of Computing and Information Systems, University of Melbourne, Australia(墨尔本大学计算与信息学院) Orygen, The National Centre of Excellence in Youth Mental Health, Australia(奥里根青少年心理健康国家研究中心) Centre for Youth Mental Health, University of Melbourne, Australia(墨尔本大学青少年心理健康中心) O’Donnell School of Public Health, UT Southwestern Medical Center, United States(奥唐奈公共卫生学院,西南医学中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出FigSIM数据集,包含1049个自杀迷因,标注了细粒度自杀严重程度、比喻现象和自杀相关内容,并评估了16个单模态和多模态模型在比喻语言、自杀严重程度和自杀相关内容检测任务上的表现,揭示了建模和内容审核的独特挑战。

Comments Content warning: contains suicide-related content. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01992 2026-06-02 cs.CV cs.AI cs.LG 62%

A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision

文本引导异常检测的结构化基准:当语言停止条件化决策时

Stefano Samele, Eugenio Lomurno, Teodora Jovanovic, Sanjay Shivakumar Manohar, Alberto Crivellaro, Matteo Matteucci

机构 * Politecnico di Milano, AIRLab(米兰理工学院,AIRLab) S&H – Software & Hardware(S&H – 软件与硬件)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出结构化基准TGAD,通过三个场景逐步增加语言功能角色,评估多模态异常检测系统的文本引导能力,发现当前系统仅表面受语言条件化,标准基准高估了其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01703 2026-06-02 cs.SD cs.AI cs.CV 62%

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

JenBridge: 跨场景转换的自适应长视频配乐

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang

机构 * Jen Music AI

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01287 2026-06-02 cs.CV cs.AI 62%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Garvin Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01057 2026-06-02 cs.CV cs.AI cs.GR cs.LG 62%

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

3DCodeBench:通过代码进行智能体程序化3D建模的基准测试

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。

Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00084 2026-06-02 cs.IR cs.AI cs.CL cs.LG 62%

SentimentLens: Reconciling Sentiment and Ratings via Dual-Modality in the Hospitality Sector

SentimentLens: 通过双模态调和酒店业中的情感与评分

Dineth Jayakody, Pasindu Thenahandi, Sampath Jayarathna

机构 * University of Peradeniya(珀拉尼亚大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出SentimentLens系统,基于方面级情感分析从非结构化酒店评论中提取知识,并通过跨模态调和文本情感与数值评分来识别运营冲突和服务改进机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27590 2026-06-02 cs.CV cs.MM 62%

ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes

ForestHG-Trace: 大规模森林场景下的可追踪长程生态推理

Zihang Cheng, Duanchu Wang, Cheng Li, Jing Huang, Huanzhao Fu, Di Wang

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出ForestHG-Trace框架,通过生态超图表示和LLM引导的确定性工具链,实现森林场景中可追踪的多步生态推理,并构建ForestTraceQA基准,显著提升长程生态问答的准确性和执行忠实度。

Comments It has theoretical flaws and experimental errors

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23220 2026-06-02 cs.CV cs.AI 62%

Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点

Anglin Liu, Ruichao Chen, Yi Lu, Hongxia Xu, Jintai Chen

机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。

Comments 29 pages, 14 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02215 2026-06-02 cs.CL cs.SI 57%

Better with Experience: Self-Evolving LLM Agents for Evidence-Grounded Health Community Notes

经验更优:用于证据基础健康社区笔记的自进化LLM智能体

Zihang Fu, Fanxiao Li, Jianyang Gu, Haonan Wang, Preslav Nakov, Bryan Hooi, Min-Yen Kan, Jiaying Wu

机构 * National University of Singapore(国立新加坡大学) Yunnan University(云南大学) The Ohio State University(俄亥俄州立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出EvoNote框架,通过自进化经验记忆和细粒度信用分配,在健康社区笔记生成中实现证据获取、分析与撰写,显著提升笔记质量并缩短生成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01936 2026-06-02 cs.CL 57%

What to Format and How: A Benchmark and Workflow Approach for Document Formatting

格式化什么以及如何格式化:文档格式化的基准与工作流方法

Shihao Rao, Liang Li, Jiapeng Liu, Tong Lin, Bing Li, Xiyan Gao, Peng Fu, Jing Huang, Can Ma

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 针对内容感知的文档格式化任务,提出基准DocFormBench和工作流方法DocFormFlow,通过解耦目标定位与修改执行,在提升准确率的同时降低token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00592 2026-06-02 cs.CV 57%

Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

通过PRISM:原则感知、可解释和多尺度的视觉设计评估

Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy, Sayan Nag

机构 * Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PRISM基准和一种多尺度评估框架,通过原则扰动和分层分析实现可解释的设计质量评估。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00544 2026-06-02 cs.LG cs.CL 57%

Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

逃离模式抽彩:多响应训练提升语言模型泛化能力

Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出多响应训练(MRT)方法,通过保留每个提示的多个有效响应来缓解传统单响应微调导致的“模式抽彩”问题,并从统计角度揭示了其提升分布泛化的原理和适用条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00168 2026-06-02 cs.CL 57%

RealityTest: How People Probe AI Identity and Whether Models Disclose It

RealityTest: 人们如何探查AI身份以及模型是否披露它

Anna Gausen, Sarenne Wallbridge, Bessie O'Dell, Christopher Summerfield, Hannah Rose Kirk

机构 * AI Security Institute(人工智能安全研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 通过收集来自49个国家约750名参与者的3152个身份探查查询,构建首个大规模多模态多语言基准RealityTest,发现仅31%的人在模糊场景中直接询问身份,且问题多样性远超机器生成查询,测试17个文本和6个语音模型后发现,问题措辞和对话上下文比模型本身对披露行为影响更大。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00162 2026-06-02 cs.RO cs.CV cs.LG 57%

Modeling Robotics Dataset Construction as an Artifact-Based Build Process

将机器人数据集构建建模为基于工件的构建过程

Leon Pohl, Lukas Beer, George Sebastian, Mirko Maehlisch

机构 * Institute for Autonomous Driving, University of the Bundeswehr Munich(自主驾驶研究所,联邦国防军 Munich 大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出将机器人数据集构建建模为基于工件的构建过程,并实现开源工具Bagzel,通过依赖图管理和增量构建显著降低数据集更新延迟,实验表明在迭代工作流中速度提升高达386倍。

Comments Accepted 2026 IEEE 22nd International Conference on Automation Science and Engineering (CASE 2026), 6 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31557 2026-06-02 cs.CV 57%

EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

EGOSTREAM: 面向第一人称视角的流式情景记忆诊断基准

Rosario Forte, Giuseppe Lando, Antonino Furnari

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) University of Catania(卡塔尼亚大学)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV

AI总结 提出EGOSTREAM基准,通过七种认知维度和答案有效期窗口,诊断流式视频中模型的情景记忆能力,并评估多种记忆管理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18326 2026-06-02 cs.CV 57%

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

OmniHuman:面向以人为中心的视频生成的大规模数据集与基准

Lei Zhu, Xing Cai, Yingjie Chen, Yiheng Li, Binxin Yang, Hao Liu, Jie Chen, Chen Li, Jing LYu

机构 * Peking University(北京大学) WeChat Lab(微信实验室) Chinese Academy of Sciences(中国科学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00355 2026-06-02 cs.RO 50%

FAIR^2 Drones: An AI-Ready Standard for Cross-Domain Wildlife Drone Datasets

FAIR^2 Drones:跨领域野生动物无人机数据集的AI就绪标准

Jenna Kline, Kilian Meier, Vandita Shukla, Edouard G. A. Rolland, Elena Iannino, Lucie Laporte-Devylder, Constanza Andrea Molina Catricheo, Blair Costelloe, Elizabeth Campolongo, Henrik S. Midtiby, Devis Tuia, Benjamin Risse, Ulrik P. S. Lundquist, Anders Lyhne Christensen, Fabio Remondino, Thomas Richardson, Tanya Berger-Wolf

机构 * The Ohio State University, Department of Computer Science and Engineering(俄亥俄州立大学计算机科学与工程系) School of Civil, Aerospace and Design Engineering, University of Bristol(布里斯托尔大学土木、航空航天与设计工程学院) D Optical Metrology (3DOM), Fondazione Bruno Kessler (FBK)(3DOM光学计量(3DOM),布鲁诺·克塞勒基金会(FBK)) Computer Vision and Machine Learning Systems Group, Institute for Geoinformatics, University of Muenster(计算机视觉与机器学习系统组,地理信息研究所,穆恩斯特大学) Unmanned Aerial Systems Center, University of Southern Denmark(无人飞行系统中心,南部丹麦大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(集体行为部门,动物行为马克斯·普朗克研究所) Department of Biology, University of Konstanz(生物学系,康斯坦茨大学) Department of Biology, University of Southern Denmark(生物学系,南部丹麦大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出FAIR^2 Drones标准,通过整合FAIR和AI就绪数据框架并添加平台元数据和标注规范,使无人机数据集同时支持生态分析、机器人算法开发和计算机视觉基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00030 2026-06-02 cs.CY 50%

From Parliamentary Rhetoric to Enacted Law: An NLP Pipeline for Semantic Auditing of the Greek Legislative Process

从议会修辞到制定法:用于希腊立法过程语义审计的NLP流水线

Despoina Antonakaki, Sotiris Ioannidis

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出一个多模态计算流水线,通过NLP分析议会辩论和立法文本,揭示法律复杂性、模糊性以及政治承诺与法律实施之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 22 篇

2606.02518 2026-06-02 cs.CV 81%

ToolFG: Towards Well-Grounded Fine-Grained Image Classification

ToolFG:面向良好基础的细粒度图像分类

Yu Xue, Haoxuan Qu, Zhuoling Li, Yihang Lou, Yan Bai, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Peking University(北京大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 提出ToolFG框架,通过MCTS引导的工具使用知识蒸馏和模型-工具协同进化机制,使MLLM自主调用外部工具获取可靠视觉线索,实现细粒度图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-06-02 cs.CV cs.AI 81%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL 81%

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏