arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2607.16146 2026-07-20 cs.RO cs.CV 新提交 57%

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

VTLoc:基于学习的视觉点云中触觉接触定位

Zhiyuan Wu, Zhuo Chen, Shan Luo

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究视觉与触觉融合的接触定位问题,提出VTLoc框架,通过几何多模态对齐模块和迭代定位更新器,利用视觉点云从触觉读数定位接触点,在新基准上减少对应模糊性,改善单触接触定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15605 2026-07-20 cs.CV 新提交 57%

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation

基于深度学习的局灶性皮质发育异常分割的MRI表征基准测试

Soumen Ghosh, John Phamnguyen, Amit Soni Arya, Subhojit Mandal, Tilottama Goswami, Rajat Vashistha

机构 * The University of Queensland(昆士兰大学) I-MED Radiology(I-MED放射学) Bennett University(贝内特大学) Indian Institute of Technology Madras(印度马德拉斯理工学院) University College of Engineering, Osmania University(奥斯曼尼亚大学工程学院) Mater Hospital(玛特医院) Royal Brisbane and Women’s Hospital(皇家布里斯班和妇女医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究针对局灶性皮质发育异常分割,利用nnU-Net框架对MRI表征进行基准测试,评估多种输入配置,发现FLAIR单模态性能最强,比率衍生表征单独不足,多模态配置可提高病变描绘,强调MRI表征设计在深度学习分割中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 57%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交 57%

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13548 2026-07-16 cs.AI 新提交 57%

How Far Can Root Cause Analysis Go on Real-World Telemetry Data?

根因分析在实际遥测数据上能走多远?

Athira Gopal, Ashwanth Krishnan

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 57%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09812 2026-07-14 eess.IV cs.CV cs.LG 新提交 57%

CHM-Net: Center Heatmap-driven Macro-Micro Modeling Network for MRI-based Microbial Density Stratification

CHM-Net:基于中心热图驱动的宏观-微观建模网络用于基于MRI的微生物密度分层

Jiaming Liang, Haolin Chen, Tingting Li, Bowen Yu, Qianyan Long, Tinghe Zhang, Xi Zhong, Xiaowei Hu, Xiaoqi Sheng, Hongmin Cai

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Future Technology(未来技术学院) Department of Medical Imaging(医学影像科) Affiliated Cancer Hospital, Guangzhou Medical University(广州医学院附属癌症医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究基于MRI的微生物密度分层,提出CHM-Net,通过中心热图引导小病变反应定位,构建宏观-微观证据预测微生物密度,在GBNPC 2026数据集上验证有效性,在两个3D医学图像数据集上证实鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10849 2026-07-14 cs.CL 新提交 57%

Capabilities of Claude Fable 5 on Biomedical Challenge Problems

Claude Fable 5在生物医学挑战问题上的能力

Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Chemistry, University of Illinois(伊利诺伊大学化学系) Institute of Bioinformatics, University of Georgia(佐治亚大学生物信息学研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究评估Claude Fable 5在八个生物医学基准上的能力,以确定性评分针对固定答案键评估,含两个Claude前身和GPT-5作基线。发现Fable 5拒绝率因基准而异,排除拒绝项后准确率超其他模型,还识别出两种拒绝模式,其生物医学应用主要受限在参与意愿。

Comments 15 pages, 6 tables, 4 figures, appendix with qualitative examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10308 2026-07-14 cs.CV 新提交 57%

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

通过虚拟模态合成将大型多模态模型推广到通用视觉模态

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究大型多模态模型推广到未见视觉模态的挑战,提出VVM-Tuning训练框架,通过模态合成和上下文让模型具备相关能力,引入VVM-Bench基准,实验证明经合成模态训练的模型在多模态上有改进且无需模态内训练。

Comments Accepted by the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09780 2026-07-14 cs.CV cs.LG 新提交 57%

Towards Real-World Wearable Motion Reconstruction

迈向现实世界的可穿戴运动重建

Andrea Boscolo Camiletto, Rishabh Dabral, Eduardo Alvarado, Thabo Beeler, Marc Habermann, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarbrücken Research Center for Visual Computing, Interaction and AI(萨尔布吕肯视觉计算、交互与人工智能研究中心) Google(谷歌)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究可穿戴设备运动捕捉问题,提出优先考虑轻便设备。贡献包括提供多模态数据集,提出WHIP模型,研究传感器互补性,以实现从任意传感器子集重建运动,处理缺失模态并生成合理运动。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 57%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08711 2026-07-10 cs.CV cs.LG 新提交 57%

LTM: Large-scale Terrain Model for Wildfire-prone Landscapes

LTM:适用于易发生野火地区的大规模地形模型

Xiao Fu, Yue Hu, Meida Chen, Peter Anthony Beerel, Barath Raghavan

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 针对易发生野火地区传统地形重建方法不足,提出利用过时DEM的多模态重建框架,通过物理像素对齐降低计算复杂度,经大型地形模拟器验证,相比现有技术显著提升了重建精度与计算效率,为野火应对提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07179 2026-07-09 cs.CV cs.LG 新提交 57%

Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

用于通用文档视觉问答的领域适应视觉语言模型的比较研究

Miguel Lopez-Duran, Elena Marrero, Julian Fierrez, Marta Robledo-Moreno, Ruben Vera-Rodriguez, Daniel DeAlcala, Aythami Morales, Ruben Tolosana, Oscar Delgado, Alvaro Ortigosa, Javier Ortega-Garcia

机构 * Universidad Autónoma de Madrid (UAM)(马德里自治大学) BiometricsAI(生物识别人工智能)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究对8个开源预训练VLMs在三种文档领域的DocVQA进行全面评估,通过多种评估方式发现其在不同布局性能有差异,参数缩放影响性能,视觉理解是瓶颈,还表明少样本微调能让模型快速适应目标域文档。

Comments 17 pages, 4 figures, accepted at the Automatically Domain-Adapted and Personalized Document Analysis workshop of the ICDAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06929 2026-07-09 cs.SD cs.AI 新提交 57%

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

MADB:一个具有专业和多维度注释的大规模音乐美学数据集

Sirui Zhang, Tianle Wang, Xinyi Tong, Peiyang Yu, Jishang Chen, Liangke Zhao, Haoxin Zhang, Duo Xu, Xin Jin, Feng Yu, Songchun Zhu

机构 * Central Conservatory of Music, China(中央音乐学院) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Tianjin Conservatory of Music(天津音乐学院) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究音乐美学评估问题,引入含9999首曲目、由30名注释者标注的MADB数据集,通过多预训练模型建立统一评估框架,揭示模型与人类判断差距,为音乐理解提供新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06838 2026-07-09 cs.CV 新提交 57%

WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence

WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台

Xiangyu Han, Mengyu Yang, Jiaqi Li, Bowen Chang, Ziyu Chen, Hexu Zhao, Rahul Kumar Agrawal, Anthony Rodriguez, Fiona Hua, Marco Pavone, Chen Feng, Yiming Li

机构 * May Mobility(五月出行公司) New York University(纽约大学) NVIDIA(英伟达公司) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。

Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06691 2026-07-09 cs.CV 新提交 57%

CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views

CoMind:从多视角理解人类协作活动

Alexey Gavryushin, Dingxi Zhang, Zhao Huang, Alexandros Delitzas, Jiaqi Chen, Ben Ellis, Cedric Zöllner, Manthan Patel, Manuel Kaufmann, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息研究所) Microsoft Switzerland(微软瑞士公司) TU Munich(慕尼黑工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 57%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05493 2026-07-08 cs.CV 新提交 57%

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理

Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong Polytechnic University(香港理工大学) Linköping University(林雪平大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究3D环境自然语言查询的可操作性问题,提出Ground3D-LMM统一模型,以点云等为输入,支持3D空间对话,能给出基于点的响应和度量数值输出,通过定义新任务、引入数据集验证,为3D对话理解提供强大基线。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03356 2026-07-07 eess.AS 新提交 57%

CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds

CaReCoS:基于频谱图的心脏、呼吸和咳嗽声音视觉基准

Harshit Rajgarhia, Shuubham Ojha, Akhil Pothanapalli, Rachuri Lokesh, Asif Shaik, Abhishek Mukherji, Prasanna Desikan

专题命中 多模态评测 :multimodal(abstract);分类 eess.AS

AI总结 研究针对医学声学信号频谱图缺乏多模态推理基准的问题,创建CaReCoS基准,将临床问题与频谱图配对,评估模型发现其难以处理频谱图中细粒度声学特征,强调医学声音可视化训练的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05131 2026-07-07 cs.AI 新提交 57%

TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios

TacReasoner:面向真实场景交互推理的动态触觉-语言框架

Kailin Lyu, Di Wu, Long Xiao, Jianning Zeng, Jianwei He, Chang Lin, Lianyu Hu, Lin Shu, Jie Hao, Ce Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Zhongguancun Academy(北京中关村科学城) Nanyang Technological University(南洋理工大学) Guangdong Institute of Artificial Intelligence and Advanced Computing(广东省人工智能与先进计算研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对动态触觉信号建模不足、触觉基础模型易幻觉的问题,提出含动态触觉编码器的TacReasoner框架,配套构建TouchCoT-10k数据集与DynTac-Bench基准,推理性能优于主流大模型。

Comments 8 pages, 7 figures. Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 57%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03789 2026-07-07 cs.CV 新提交 57%

G$^2$TAM: Geometry Grounded Track Anything Model

G$^2$TAM:几何基础的轨迹任意模型

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

机构 * HKU(香港大学) Shanghai AI Lab(上海人工智能实验室) BUAA(北京航空航天大学) SJTU(上海交通大学) UCLA(加州大学洛杉矶分校) ZJU(浙江大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 研究利用现代前馈3D重建模型的空间一致性,提出G$^2$TAM框架,用无序RGB图像或视频进行3D实例跟踪。核心是跨模态空间编码器,还构建数据集,实验表明该模型有多种优势,为交互式空间推理奠定基础。

Comments Accepted by ICML 2026. Project Page:https://zcmax.github.io/projects/G2TAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 57%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02553 2026-07-07 cs.CV cs.LG q-bio.NC 新提交 57%

Interpretable machine learning predicts Parkinson's disease severity using motion-corrected QSM MRI and multiband multiecho fMRI features

可解释机器学习利用运动校正QSM MRI和多波段多回波fMRI特征预测帕金森病严重程度

Aixa X. Andrade

机构 * Lyda Hill Department of Bioinformatics(Lyda Hill 生物信息学系) Department of Biomedical Engineering(生物医学工程系) University of Texas Southwestern Medical Center, Dallas, Texas, USA(德克萨斯西南医学中心,德克萨斯州达拉斯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 利用可解释机器学习,从QSM和多波段多回波静息态fMRI衍生的ReHo特征预测帕金森病运动严重程度。提取特征进行多模型实验,结果显示不同模型表现及特征贡献,表明结构和功能成像依临床预测目标作用不同。

Comments 16 pages from main manuscript and 17 pages from supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02549 2026-07-07 cs.CV cs.RO 新提交 57%

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

学习在杂乱收纳中进行刀片插入的3D可用空间

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal

机构 * Amazon Robotics(亚马逊机器人公司)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 研究杂乱收纳中刀片插入的3D可用空间问题,利用VulcanVoxel方法,通过基于3D占用场的掩码自动编码器,从单峰数据恢复多模态预测,提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03298 2026-07-07 cs.LG cs.AI econ.GN physics.ao-ph q-fin.EC 新提交 57%

A harmonised dataset for Earth system foundation models

用于地球系统基础模型的统一数据集

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系) RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所) CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对地球系统基础模型训练数据缺乏统一资源的问题,构建WorldTensor数据集,整合多类数据到标准网格,为训练和评估模型提供资源,推动多模态地球系统基础模型发展。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20723 2026-07-07 cs.CV 新提交 57%

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01612 2026-07-03 cs.AI 新提交 57%

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

自信地扩展:校准LLM的置信度以实现自适应测试时扩展

Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏