arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1521 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 318 篇

2601.08758 2026-07-01 eess.IV cs.CV 版本更新 57%

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24561 2026-07-01 cs.CV 版本更新 57%

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位

Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。

Comments 40pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 57%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 57%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08690 2026-06-24 cs.CV 版本更新 57%

CanadaFireSat: Toward high-resolution wildfire forecasting with multiple modalities

CanadaFireSat:面向多模态高分辨率野火预测

Hugo Porta, Emanuele Dalsasso, Jessica L. McCarty, Devis Tuia

机构 * EPFL(瑞士联邦理工学院) Université Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔INP,LJK实验室) NASA Ames Research Center, Earth Science Division(美国航空航天局阿姆斯研究中心,地球科学部门)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出CanadaFireSat基准数据集,利用多模态数据(高分辨率多光谱卫星图像、中分辨率卫星产品和环境因子)结合深度学习模型,实现加拿大100米分辨率野火预测,多模态输入在2023年野火季F1分数达60.3%。

Comments 37 pages, 11 figures. Published in ISPRS Journal of Photogrammetry and Remote Sensing (2026)

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, Volume 239, September 2026, Pages 555-572

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09416 2026-06-23 cs.CL cs.CY 版本更新 57%

Are Language Models Sensitive to Morally Irrelevant Distractors?

语言模型对道德无关干扰因素敏感吗?

Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22959 2026-06-19 cs.CV 版本更新 57%

Can Agents Distinguish Visually Hard-to-Separate Diseases in a Zero-Shot Setting? A Pilot Study

智能体能否在零样本设置中区分视觉上难以分离的疾病?一项初步研究

Zihao Zhao, Frederik Hauke, Juliana De Castilhos, Sven Nebelung, Daniel Truhn

机构 * Department of Diagnostic and Interventional Radiology, University Hospital Aachen, 52074 Aachen, Germany(诊断与介入放射科,亚琛大学医院,德国亚琛,52074)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究探索多模态大语言模型智能体在零样本下区分视觉混淆疾病(如黑色素瘤与不典型痣、肺水肿与肺炎)的能力,提出基于对比裁决的多智能体框架,在皮肤镜数据上准确率提升11个百分点,但总体性能仍不足临床部署。

Comments Code available at https://github.com/TruhnLab/Contrastive-Agent-Reasoning. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08355 2026-06-18 cs.CV 版本更新 57%

E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs

E-VAds:面向多模态大语言模型的电商短视频理解基准

Xianjie Liu, Yiman Hu, Liang Wu, Ping Hu, Yixiong Zou, Jian Xu, Bo Zheng

机构 * Alimama Tech, Taobao \& Tmail Group of Alibaba Huazhong University of Science Vin University

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出电商短视频理解基准E-VAds,通过多模态信息密度评估框架量化领域复杂性,并构建多智能体生成的问答数据集,最后开发基于强化学习的推理模型E-VAds-R1,在商业意图推理上实现109.2%的性能提升。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06367 2026-06-18 cs.CR cs.AI cs.LG 版本更新 57%

WebSP-Eval: Evaluating Web Agents on Website Security and Privacy Tasks

WebSP-Eval:在网站安全与隐私任务上评估网络代理

Guruprasad Viswanathan Ramesh, Asmit Nayak, Basieem Siddique, Kassem Fawaz

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出WebSP-Eval框架,通过200个任务实例和自动化评估器,测试多模态大模型在网站安全与隐私任务上的表现,发现状态UI元素(如开关)导致超过45%的任务失败。

Comments Accepted at PETS 2026. Project Page: https://wiscprivacy.com/webspeval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04796 2026-06-18 eess.AS cs.SD 版本更新 57%

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

LALM-as-a-Judge:用于多轮口语对话安全评估的大型音频语言模型基准测试

Amir Ivry, Shinji Watanabe

机构 * Computer Engineering, Technion--Israel Institute of Technology, Haifa, Israel(技术学院电子工程系,技术离子技术研究所,以色列海法) Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,卡内基梅隆大学,美国匹兹堡)

专题命中 多模态评测 :multimodal(abstract);分类 eess.AS

AI总结 针对口语对话中社会不安全内容评估仍以文本为中心、忽略韵律和转录失败的问题,提出包含24000个多轮口语对话的开放基准,评估6种大型音频语言模型在文本、音频和多模态设置下的敏感性、严重性顺序特异性和轮次位置偏差,发现音频提供非词汇证据,多模态增益非普遍且存在多种模式。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24696 2026-06-17 cs.CV 版本更新 57%

NeuroClaw Technical Report

NeuroClaw 技术报告

Cheng Wang, Zhibin He, Zhihao Peng, Shengyuan Liu, Yufan Hu, Carl Yang, Lifang He, Lichao Sun, Xiang Li, Yixuan Yuan

机构 * Electronic Engineering Department, The Chinese University of Hong Kong, China(香港中文大学电子工程系) School of Electronic Information, Northwest University, China(西北大学电子信息学院) Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系) Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(莱斯利大学计算机科学与工程系) Department of Radiology, Massachusetts General Hospital, Boston, MA, USA(麻省总医院放射科) Kempner Institute for Natural and Artificial Intelligence, Harvard University, Cambridge, MA, USA(哈佛大学自然与人工智能研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对神经影像学中多模态数据、长流程和可重复性挑战,提出NeuroClaw多智能体研究助手,通过数据驱动决策、环境管理和三层技能架构实现可执行可复现的神经影像分析,并在NeuroBench基准上显著优于直接调用智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04184 2026-06-16 cs.CV 版本更新 57%

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs

GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试

Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在群体心智理论推理上的不足,提出GroupToM-Bench基准,通过七级认知审计框架评估模型从微观BDI状态到宏观结果预测的因果链,揭示模型在处理社会结构和非线性集体动态上的缺陷。

Comments ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03447 2026-06-16 cs.CV 版本更新 57%

Proact-VL: A Proactive VideoLLM for Real-Time AI Companions

Proact-VL:用于实时AI伴侣的主动式视频大语言模型

Weicai Yan, Yuhong Dai, Qi Ran, Haodong Li, Wang Lin, Tao Jin, Xing Xie, Hao Liao, Jianxun Lian

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Proact-VL框架,通过游戏场景中的评论和引导任务,解决实时AI伴侣在低延迟推理、自主响应决策和内容质量控制方面的挑战,实现了主动式实时交互。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10496 2026-06-16 cs.CV 版本更新 57%

CheXGenBench: A Unified Benchmark For Fidelity, Privacy and Utility of Synthetic Chest Radiographs

CheXGenBench:合成胸片保真度、隐私和实用性的统一基准

Raman Dutt, Pedro Sanchez, Yongchen Yao, Steven McDonagh, Sotirios A. Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Samsung AI Center, Cambridge(剑桥三星AI中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出CheXGenBench,首个统一评估框架,同时衡量合成胸片生成模型的保真度、隐私风险和下游实用性,涵盖11种前沿T2I模型,揭示当前模型在长尾分布、隐私风险和下游多模态任务中的局限。

Comments Published in Transactions of Machine Learning Research (06/2026)

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18693 2026-06-15 cs.CV 版本更新 57%

Feature-Space Planes Searcher: A Universal Domain Adaptation Framework for Interpretability and Computational Efficiency

特征空间平面搜索器:一种通用领域自适应框架,兼顾可解释性与计算效率

Zhitong Cheng, Yiran Jiang, Yulong Ge, Yufeng Li, Zhongheng Qin, Rongzhi Lin, Jianwei Ma

机构 * School of Mathematics and Institute for Artificial Intelligence, Harbin Institute of Technology, China(数学学院和人工智能研究院,哈尔滨工业大学,中国) School of Earth and Space Sciences, Institute for Artificial Intelligence, Peking University, China(地球和空间科学学院,人工智能研究院,北京大学,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出特征空间平面搜索器(FPS),通过冻结特征编码器并利用特征空间几何模式优化决策边界,实现高效、可解释的领域自适应,在多个基准上达到竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10132 2026-06-12 physics.plasm-ph cs.AI 版本更新 57%

TokaMark: A Comprehensive Benchmark for MAST Tokamak Plasma Models

TokaMark:MAST托卡马克等离子体模型的综合基准

Cécile Rousseau, Samuel Jackson, Rodrigo H. Ordonez-Hurtado, Nicola C. Amorisco, Tobia Boschi, George K. Holt, Andrea Loreti, Eszter Székely, Alexander Whittle, Adriano Agnello, Stanislas Pamela, Alessandra Pascale, Robert Akers, Juan Bernabe Moreno, Sue Thorne, Mykhaylo Zayats

机构 * IBM Research Europe(IBM欧洲研究院) UK Atomic Energy Authority(英国原子能局) STFC Hartree Centre(STFC哈特ree中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 为解决聚变数据稀缺、分散且标注不一致的问题,提出TokaMark基准,包含14项任务,统一多模态聚变数据访问和评估协议,并提供基线模型,以加速数据驱动的AI等离子体建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20048 2026-06-10 cs.CL cs.CY 版本更新 57%

Culturally uneven urban perception in large language models

大型语言模型通过文化不平等的基线感知城市

Rong Zhao, Wanqi Liu, Zhizhou Sha, Nanxi Su, Yecheng Zhang, Ying Long

机构 * Centre for Advanced Spatial Analysis (CASA), UCL, London, UK(高级空间分析中心(CASA),伦敦大学学院,英国) School of Architecture, Tsinghua University, Beijing, China(清华大学建筑学院,北京,中国) Department of Computer Science, UT Austin, Austin, TX, USA(得克萨斯大学奥斯汀分校计算机科学系,奥斯汀,德克萨斯,美国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究通过全球平衡的街景样本测试前沿LLM的城市感知,发现中性提示实际上偏向欧美文化,且文化提示能改变情感评价但无法恢复人类语义多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12306 2026-06-10 cs.LG cs.AI 版本更新 57%

GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support

GCA框架:面向海湾合作委员会国家的数据集与气候决策支持智能体管道

Muhammad Umer Sheikh, Khawar Shehzad, Salman Khan, Fahad Shahbaz Khan, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德人工智能大学) University of Missouri(密苏里大学) Australian National University(澳大利亚国立大学) Linköping University(林肯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出GCA框架,包含GCC国家多模态数据集GCA-DS和工具增强型智能体GCA,通过领域微调和工具集成提升气候决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10376 2026-06-09 cs.CV 版本更新 57%

SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

SleepWalk:一种三层压力测试基准,用于指导的视觉-语言导航

Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Indian AI Research Organization (IAIRO)(印度人工智能研究组织) ĸragya Lab, BITS Pilani Goa(BITS Pilani Goa 的 ĸragya 实验室) University of Dhaka(达卡大学) Delhi Technological University(德里技术大学) Apple(苹果公司) Meta

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SleepWalk基准,用于评估基于指令的轨迹预测,针对局部化、交互导向的具身推理,揭示当前VLM在空间推理中的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15017 2026-06-09 cs.CV 版本更新 57%

No Modality Left Behind: Adapting to Missing Modalities via Knowledge Distillation for Brain Tumor Segmentation

不遗漏任何模态:通过知识蒸馏适应缺失模态的脑肿瘤分割

Shenghao Zhu, Yifei Chen, Weihong Chen, Shuo Jiang, Guanyu Zhou, Yuanhan Wang, Feiwei Qin, Changmiao Wang, Qiyuan Tian

机构 * Medical Image Analysis(医学影像分析)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出AdaMM框架,利用知识蒸馏和三个协同模块处理多模态MRI中模态缺失问题,在多个数据集上显著提升分割精度和鲁棒性。

Comments 51 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11755 2026-06-09 eess.IV cs.CV 版本更新 57%

A generalizable 3D framework and model for self-supervised learning in medical imaging

一种通用的3D框架和模型用于医学影像中的自监督学习

Tony Xu, Sepehr Hosseini, Chris Anderson, Anthony Rinaldi, Rahul G. Krishnan, Anne L. Martel, Maged Goubran

机构 * Department of Medical Biophysics, University of Toronto(多伦多大学医学生物物理学系) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Institute for Aerospace Studies, University of Toronto(多伦多大学航空航天研究所) Physical Sciences Platform, Sunnybrook Research Institute(圣母医院研究学院物理科学平台) Vector Institute, Toronto(多伦多向量研究所) Department of Laboratory Medicine and Pathobiology, University of Toronto(多伦多大学实验室医学与病理学系) Hurvitz Brain Sciences, Sunnybrook Health Sciences Centre(圣母医院健康科学中心Hurvitz脑科学) Harquail Centre for Neuromodulation, Sunnybrook Health Sciences Centre(圣母医院健康科学中心Harquail神经调制中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出3DINO方法,基于大规模多模态数据集预训练出通用医学影像模型3DINO-ViT,验证其在多种医学影像分割和分类任务中的泛化能力,优于现有方法。

Comments Published in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26431 2026-08-18 math.OC 版本更新 50%

Adjoint-Compatible Surrogates of the Expected Information Gain for Optimal Experimental Design

伴随兼容的期望信息增益代理用于最优实验设计

Luc de Montella, Sebastian Sager

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出两种伴随兼容的期望信息增益代理,用于解决动态系统参数估计中的最优实验设计问题,在非高斯或多模态先验不确定性下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17810 2026-08-05 cs.LG cs.IR 版本更新 50%

VIBE: Vector Index Benchmark for Embeddings

VIBE:用于嵌入的向量索引基准测试

Elias Jääsaari, Ville Hyvönen, Matteo Ceccarello, Teemu Roos, Martin Aumüller

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究针对现有ANN基准数据集无法代表现代应用的问题,推出开源VIBE框架,含分布内外数据集,评估22个向量索引,为ANN算法提供最新基准测试。

Comments The 2nd Workshop on Vector Databases (VecDB@VLDB2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14883 2026-08-04 eess.SP cs.HC cs.LG 版本更新 50%

BCI-Based Assessment of Ocular Response Time Using Dynamic Time Warping Leveraging an RDWT-Driven Deep Neural Framework

基于BCI的眼动响应时间评估:利用动态时间规整的RDWT驱动深度神经框架

Shantanu Sarkar, Sai Shashank Gandavarapu, Jeff Feng, Saurabh Prasad, Reza Khanbabaie, Jose L. Contreras-Vidal

机构 * Dept. of ECE, IUCRC BRAIN, Cullen College of Engineering University of Houston, Houston, USA Dept. of Data Science, Cullen College of Engineering University of Houston, Houston, USA Dept. of Industrial Design, IUCRC BRAIN, Gerald D.Hines College of Arch. \& Design University of Houston, Houston, USA Neurotechnology \& BCI Cognixion Inc. Toronto, Ontario, Canada

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种整合EEG与AR基VOMS任务的框架,利用RDWT驱动的深度神经网络估计个体眼动响应时间,通过波let域滤波提升预测性能,并利用动态时间规整评估眼动行为差异。

Comments Accepted at IEEE SMC 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15395 2026-08-04 cs.RO 版本更新 50%

Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述

Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis, Panagiotis Sarigiannidis, Efstratios Gavves, Kostas Bekris, Arash Ajoudani, Georgios Th. Papadopoulos

机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。

Journal ref Transactions on Machine Learning Research (TMLR), 07/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08913 2026-08-03 cs.LG stat.ML 版本更新 50%

GEMSS: A Variational Method for Discovering Multiple Sparse Solutions in Classification and Regression Problems

GEMSS: 一种用于在分类和回归问题中发现多个稀疏解的变分贝叶斯方法

Kateřina Henclová, Václav Šmídl

机构 * Faculty of Electrical Engineering, Czech Technical University(捷克技术大学电子工程系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出GEMSS算法,利用结构化spike-and-slab先验、高斯混合近似后验和Jaccard惩罚,通过变分推断同时发现多个多样化的稀疏特征组合,在128个实验和3个真实数据集上优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14021 2026-07-27 cs.RO 版本更新 50%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05988 2026-07-27 cs.LG 版本更新 50%

Layer-wise LoRA fine-tuning: a similarity metric approach

逐层LoRA微调:相似性度量方法

Keith Ando Ogawa, Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出逐层LoRA微调方法,通过选择性微调部分层以减少可训练参数并保持预测性能,适用于不同架构和任务。

Comments Accepted at the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25050 2026-07-24 stat.AP cs.LG q-bio.QM stat.ML 版本更新 50%

Multimodality Stacking with Blockwise missing values and application to the PIONeeR biomarkers study for prediction of resistance to immunotherapy

具有分块缺失值的多模态堆叠及其在预测免疫治疗耐药性的PIONeeR生物标志物研究中的应用

Mohamed Boussena, Florence Monville, Jacques Fieschi-Meric, Frederic Vely, Pierre Milpied, Julien Mazieres, Maurice Perol, Eric Vivier, Laurent Greillier, Fabrice Barlesi, Sebastien Benzekry

机构 * Inria – Inserm team COMPO, COMPutational pharmacology and clinical Oncology, Centre Inria Sophia Antipolis - Méditerranée, Centre de Recherches en Cancérologie de Marseille, Inserm U1068, CNRS UMR7258, Institut Paoli-Calmettes, Pharmacy faculty, Aix-Marseille University(Inria - Inserm COMPO团队,计算药理学和临床肿瘤学,Inria Sophia Antipolis -地中海, Marseille癌症研究中心,Inserm U1068,CNRS UMR7258,Paoli-Calmettes研究所,药学系,Aix-Marseille大学) Veracyte SAS, Marseille, France(Veracyte SAS,法国马赛) Assistance Publique-Hôpitaux de Marseille (APHM), Marseille, France(马赛公共医院(APHM),法国马赛) Toulouse University Hospital, Toulouse, France(图卢兹大学医院,法国图卢兹) Centre Leon Berard, Lyon, France(Leon Berard中心,法国里昂) Innate Pharma, Marseille, France(Innate Pharma,法国马赛) Université Paris Saclay, Gustave Roussy, Inserm, Prédicteurs Moléculaires et nouvelles cibles en oncologie (U981), F-94805, Villejuif, France(巴黎萨克雷大学,Gustave Roussy,Inserm,分子预测与肿瘤学新靶点(U981),法国维尔若,F-94805)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出多模态堆叠框架MSB,通过独立建模各模态特征并利用交叉验证堆叠元学习器聚合预测,解决高维和分块缺失问题,在PIONeeR研究中预测非小细胞肺癌免疫治疗无进展生存期,性能优于基线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11485 2026-07-24 cs.RO 版本更新 50%

i2Nav-Robot: A Large-Scale Indoor-Outdoor Robot Dataset for Multi-Sensor Fusion Navigation

i2Nav-Robot:用于多传感器融合导航的大规模室内外机器人数据集

Hailiang Tang, Tisheng Zhang, Liqiang Wang, Xin Ding, Man Yuan, Zhiyu Xiang, Jujin Chen, Yuhan Bian, Shuangyan Liu, Yuqing Wang, Guan Wang, Xiaoji Niu

专题命中 多模态评测 :multi-modal(abstract)

AI总结 针对无人地面车辆导航数据集不足,提出i2Nav-Robot数据集,集成多模态传感器,经在线硬件同步和离线校准获取精确时间戳,含十个大规模序列,经评估数据质量高,对推进车辆导航研究实用。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏