arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 32 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 32 篇

2607.24191 2026-07-28 cs.CL cs.AI 新提交 84%

StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

StanceFlip:用于多模态对话立场翻转预测的综合多维基准测试

Heyan Chai, Xin Li, Wenjie Wang, Jianyang Qin, Chaoyang Li, Lu Wang, Hao Chen, Qing Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)) City University of Macau(澳门城市大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有对话立场检测基准测试的局限,提出StanceFlip基准测试及ConStaFF框架,含多模态立场六元组提取和动态立场翻转归因两个新子任务,基于大语言模型实现端到端立场推理,实验显示该方法性能领先。

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 82%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07263 2026-07-28 cs.HC cs.CV cs.MM 版本更新 81%

BATON: A Multimodal Benchmark for Bidirectional Automation Transition Observation in Naturalistic Driving

BATON:一种多模态基准,用于自然驾驶中的双向自动化过渡观察

Yuhang Wang, Yiyao Xu, Chaoyun Yang, Lingyao Li, Jingran Sun, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 BATON通过多模态数据捕捉真实驾驶自动化场景,定义了驾驶动作理解、手柄预测和接管预测三个任务,证明多模态数据融合对提升自动化过渡预测的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23633 2026-07-28 eess.IV cs.CV 新提交 79%

A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting

用于多模态短期太阳辐照度预测的可控视觉主干基准测试

Oshadha Samarakoon, Dushan Herath, Ishara Ranmandala, Dilshara Herath, Roshan Godaliyadda, Parakrama Ekanayake, Vijitha Herath

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态短期太阳辐照度预测,固定多模态预测管道,仅改变视觉主干进行基准测试。比较多种主干在不同数据集上的预测表现,给出了各主干的RMSE等结果,提供了可重复的编码器比较,未确立架构优势等。

Comments 6 pages, 3 figures, Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交 79%

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23972 2026-07-28 cs.CV 新提交 79%

Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化

Yu Li, Wengan He, Wenhui Xu, Lihong Jiang, Fan Xiao, Zhuohang Huang, Yuanzhu Liang, Jiayi Liu, Yuxi Chen, Yongsheng Luo

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。

Comments Survey paper, 77 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23870 2026-07-28 cs.MA cs.AI 新提交 79%

MulRobBench: A Decision-Level Benchmark for Safe and Security-Policy-Compliant Multimodal UAV Agents

MulRobBench:用于安全且符合安全策略的多模态无人机智能体的决策级基准测试

Belal S. Alsinglawi, Weizheng Wang, Junyi Wu, Yi Jiang, Lianhai Lin, Merouane Debbah, Izzat Alsmadi

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 智慧城市中无人机需在复杂条件下决策,MulRobBench作为决策级基准测试,将多模态观测、安全策略等集成,含多任务样本和评分维度,评估结合多种方式,给出模型得分,通过研究找出决策不稳定原因,为无人机多模态决策提供可重复基准。

Comments 22 pages, 18 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23537 2026-07-28 cs.AI 新提交 79%

ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试

Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22698 2026-07-28 cs.CV 新提交 79%

FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog

FogDrive:用于分级雾天感知的多模态合成驾驶数据集

Vansh Panwar

机构 * Indian Institute of Technology, Guwahati(印度理工学院古瓦哈提分校)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 FogDrive是用于分级雾天感知的多模态合成驾驶数据集,基于CARLA模拟器构建,含多种传感器数据,模拟不同密度雾。通过跨两种范式建立基线基准,得出训练中混合多密度雾可收紧3D边界框几何形状等见解,将开源加速多模态研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02570 2026-07-28 eess.SP cs.AI 版本更新 79%

DOSE-I: A Multimodal Biosignal Dataset of Procedural Sedation for Endoscopy -- Technical Report

DOSE-I:用于内镜操作镇静的多模态生理信号数据集——技术报告

Jakob Garbe, Jan W. Kantelhardt, Katja Seeliger, Thomas Schmid

机构 * Universitätsmedizin Halle (Saale)(哈勒(萨勒)大学医学院) Universitätsklinikum Halle (Saale)(哈勒(萨勒)大学医院) Universitätsklinik und Poliklinik für Innere Medizin I(内科学I大学医院和多科医院) Martin‑Luther‑Universität Halle‑Wittenberg(哈勒-维滕贝格马尔伯特大学) Medizinische Fakultät(医学系) Ernst‑Grube‑Straße 40(埃尔斯特-格鲁布街40号)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文介绍内镜镇静多模态生理信号数据集DOSE-I的构建细节,提供标注数据、预处理方案与开源代码,支撑相关医疗AI研究。

Comments Dataset can be accessed via zenodo DOI https://doi.org/10.5281/zenodo.18483292 For citation use the primary academic reference: Garbe J et al. Towards predicting sedation depth in endoscopy with large clinically annotated EEG data of continuous Propofol sedation. In: P. Andreevetal (Eds.): AIME2026, LNAI 16749, p.1-6, Springer, 2026. https://doi.org/10.1007/978-3-032-30813-9_58

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23822 2026-07-28 cs.LG 新提交 78%

DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification

DriveDNA:用于驾驶风格识别的大规模多模态自然驾驶数据集及基准测试

Yuhang Wang, Lingyao Li, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) University of Arizona(亚利桑那大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究引入DriveDNA数据集及基准测试用于驾驶风格识别,定义驾驶风格为车辆在相似条件下的特定行为模式,通过三个核心任务评估,对比多种基线方法得出学习表示更优,视频模型有路线泄漏问题,强调可靠评估需考虑多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05080 2026-07-28 q-fin.TR 版本更新 78%

MM-ARC: Multimodal Adaptive Routing of Capital with Robustness-Audited Strategy Pools

MM-ARC:具有稳健性审核策略池的资本多模态自适应路由

Yang Chen, Yuchen Cao, Jacky Keung, Leilei Gan, Kun Kuang, Yueheng Jiang, Zhaozhao Ma, Jianping Zhu, Fei Wu, Jinpeng Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究金融交易系统如何转化多模态市场历史,提出MM-ARC方法,通过多视图在不同专家间分配资本,经稳健性审核筛选候选方案,实验显示该方法在夏普比率和最大回撤等指标上优于基线,有相对基准的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24424 2026-07-28 cs.CV 新提交 74%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23542 2026-07-28 cs.CV 新提交 74%

GaitFace: A Multimodal Dataset for Long-Range Person Identification

GaitFace:一个用于远距离人员识别的多模态数据集

Alain Komaty, Luis S. Luevano, Vidit Vidit, Anjith George, Zeina Al Amine, Sébastien Marcel

机构 * Idiap Research Institute(伊迪阿普研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 介绍用于远距离人员识别的多模态数据集GaitFace,利用预注册和“野外”捕获数据反映真实边境场景,通过基准测试揭示当前面部和步态模型在低分辨率和高视角下的关键漏洞,为无约束生物识别研究提供公共基准。

Comments Accepted in IJCB 2026 , see https://idiap.ch/paper/gaitface/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22135 2026-07-28 cs.CV 版本更新 74%

GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

GLI-AL:一个具有统一解剖-病变标签的多模态胶质瘤MRI标签资源

Xingyu Xiang, Shuang Hao, Fan Wang, Jianhua Ma, Chunfeng Lian

机构 * Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi’an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi’an Jiaotong University(西安交通大学智能医疗设备与器械研究中心)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 研究针对现有BraTS-GLI数据集不足,引入BraTS-GLI Anatomy-Lesion资源,提供统一解剖-病变标签集及元数据。通过WMH感知监督,提升对共存病变敏感性,保持健康组织分割性能,支持多方面研究,数据和代码可获取。

Comments Minor revision: Figure 1 was repositioned. The scientific content remains unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25897 2026-07-28 cs.RO cs.LG cs.SY eess.SY 版本更新 71%

Variational Neural Belief Parameterizations for Robust Dexterous Grasping under Multimodal Uncertainty

变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取

Clinton Enwerem, Shreya Kalyanaraman, John S. Baras, Calin Belta

机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 多模态评测 :multimodal(title)

AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。

Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新 67%

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21344 2026-07-28 cs.CL cs.AI cs.CV cs.LG cs.MA 67%

Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

超越单图:多图表问答的基准测试

Azher Ahmed Efat, Seok Hwan Song, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PolyChartQA数据集,用于评估多图表问答性能,通过九种先进多模态语言模型测试,发现人类生成问题的LLM准确率下降27.4%,而本文提出的提示方法提升了5.39%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24567 2026-07-28 cs.AI cs.CV cs.IR 新提交 62%

DSCH-Loss: A Dynamic Semantic Channel Objective for Deep Semantic Hashing

DSCH损失:用于深度语义哈希的动态语义通道目标

Tobias J. Bauer, Christian Riess, Daniel Loebenberger, Christian Bergler

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究语义哈希方法,提出动态语义通道哈希(DSCH)损失函数,通过动态调整语义通道避免损失景观不连续性,采用考虑平局的mAP评估,实验表明DSCH训练的模型在多任务中表现优异,优于其他现有损失函数。

Comments 12 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24516 2026-07-28 cs.CV cs.AI 新提交 62%

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

DecoupleMix:用于可扩展视觉语言模型数据配方的解耦比率搜索和凸分配

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型数据构建缺乏原则性标准的问题,提出DecoupleMix框架,将其解耦为类间比率搜索和类内凸分配两个子问题,实验证明该方法优于启发式基线,且最优比率可跨规模转移,提升了VLM竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 62%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 62%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 62%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24727 2026-07-28 cs.CV 新提交 57%

Infrared Imaging Empowered by Artificial Intelligence for Pediatric Skeletal Triage: A Narrative Review and Future Perspectives

人工智能助力的儿科骨骼分类红外成像:综述与未来展望

Sajad Amiri, Pardis Afshar, Elham Anjomshoa

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 该研究旨在构建结合广谱红外成像与深度学习的混合框架用于儿科骨骼分类。回顾相关光谱窗口及采集方式,总结图像转换和特征匹配算法。指出儿科解剖利于红外穿透,集成多光谱红外+人工智能成像是无辐射补充,但面临多方面障碍。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24224 2026-07-28 cs.CV 新提交 57%

MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving

MATS:一种用于自动驾驶中3D感知的新型多模态多任务学习框架

Junchen Huo, Wanming Hao, Song Wang, Enqing Chen, Shouyi Yang, Guanghui Wang

机构 * School of Electrical and Information Engineering, Zhengzhou University(郑州大学电气与信息工程学院) Tianping College of Suzhou University of Science and Technology(苏州科技大学天平学院) Toronto Metropolitan University(多伦多都会大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对自动驾驶3D感知,提出MATS多模态多任务学习框架,通过模态自适应BEV融合和特定任务MoE模块,在nuScenes基准测试中,多模态输入下显著优于现有技术,单任务也优于基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22727 2026-07-28 cs.CV cs.LG 新提交 57%

Trustworthy Medical Segmentation: Uncertainty-Aware U-Net Evaluation Under Clinical Image Degradation

可信医学分割:临床图像退化下的不确定性感知U-Net评估

Pranav Kaliaperumal, Manisha Kaliaperumal

机构 * University of Colorado Denver(科罗拉多大学丹佛分校) Creighton University(克里顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究在临床图像退化下评估医学分割模型的不确定性,提出可重现框架,用合成脑肿瘤MRI队列训练U-Net等模型,经多种损坏类型及不同严重程度测试,结果表明不确定性感知推理可作安全层,还开源相关代码、模型和协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22703 2026-07-28 cs.CV 新提交 57%

Histopathological Spectrum-Guided Prostate Stratification via Segmentation-Assisted Diagnostic Transformer

基于分割辅助诊断变压器的组织病理学光谱引导前列腺分层

Leyang Li, Lihua Chen, Huangang Hu, Tianhang Hao, Hao Cheng, Xin Zhang, Qianru Sun, Bingxu Lu, Wenlong Yu, Feng Duan

机构 * College of Artificial Intelligence, Nankai University(南开大学人工智能学院) Tianjin First Central Hospital(天津市第一中心医院) School of Electronics and Information Engineering, Tiangong University(天津工业大学电子与信息工程学院) School of Artificial Intelligence, Hebei University of Technology(河北工业大学人工智能学院) North China Digital Health Technology Co., Ltd.(华北数字健康科技有限公司) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对多参数MRI前列腺癌诊断局限,构建数据集并提出LSDT模型,利用零样本分割和多模态融合分类,在患者队列交叉验证中取得较好准确率和召回率,增强了前列腺MRI细粒度分类及风险分层。

Comments 17 pages, 6 figures, and 4 tables. Code will be made publicly available in a future revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 57%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24118 2026-07-28 cs.CV 版本更新 57%

An LMM for Precisely Grounding Elements in Documents

一种用于精确文档元素定位的大型多模态模型

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Ji Qi, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出PreciseDoc,一种通过合成数据与强化学习联合训练实现文档元素精确定位的大型多模态模型,显著提升文档理解与视觉定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02929 2026-07-28 cs.IR cs.AI cs.LG 版本更新 57%

Realizing Scaling Laws in Recommender Systems: A Foundation-Expert Paradigm for Hyperscale Model Deployment

在推荐系统中实现扩展定律:超大规模模型部署的基础-专家范式

Dai Li, Kevin Course, Wei Li, Hongwei Li, Jie Hua, Yiqi Chen, Zhao Zhu, Rui Jian, Xuan Cao, Bi Xue, Yu Shi, Jing Qian, Kai Ren, Matt Ma, Qunshu Zhang, Rui Li

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 针对推荐系统中跨多界面部署基础模型的挑战,提出基础-专家范式,中央FM生成目标感知嵌入供特定界面专家模型使用,迁移率超现有方法,自2025年在Meta部署后实现线上指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏