arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 94 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 94 篇

2606.16586 2026-07-30 cs.CV 版本更新 85%

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

LOCUS: 局部视觉线索搜索增强多模态大语言模型的细粒度感知

Zhou Tao, Fang Zhang, Zewen Ding, Shida Wang, Xiaokun Sun, YongXiang Hua, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(summary_cn);分类 cs.CV

AI总结 提出LOCUS训练框架,通过可验证的局部线索搜索代理任务,使MLLM内化细粒度证据选择,提升定位敏感视觉理解而不改变推理接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25451 2026-07-08 cs.LG 版本更新 85%

BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

BigMac: 打破多模态大语言模型训练中的计算与内存帕累托前沿

Zili Zhang, Chengxu Yang, Shenglong Zhang, Chenyu Wang, Yufan Zhang, Tuo Dai, Zhouyang Li, Yuhong Ge, Chao Jin, Xin Jin, Yuliang Liu

机构 * Peking University(北京大学) Independent Researcher(独立研究员) Xiaohongshu, Inc(小红书公司)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 提出BigMac训练流水线,通过嵌套编码器和生成器计算到LLM流水线中,同时优化计算效率和内存使用,打破帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02153 2026-06-15 math.NA cs.NA math.OC 版本更新 82%

A Joint Variational Framework for Multimodal X-ray Ptychography and Fluorescence Reconstruction

多模态X射线ptychography与荧光重建的联合变分框架

Chengru Eric Zou, Elle Buser, Zichao Wendy Di, Yuanzhe Xi

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种联合变分框架,整合X射线ptychography和荧光重建,通过共享空间变量解决非线性逆问题,提升稳定性和重建精度。

Comments Keywords: inverse problems, x-ray imaging science, ill-posedness, joint reconstruction. This work is sponsored by NSF DMS-2338904

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17343 2026-07-14 cs.CV 版本更新 81%

EvoGuard: An Extensible Agentic RL-based Framework for Practical and Evolving AI-Generated Image Detection

EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测

Chenyang Zhu, Maorong Wang, Jun Liu, Ching-Chun Chang, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所)

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。

Comments Template changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29064 2026-08-11 cs.CL cs.CV cs.HC cs.MA 版本更新 81%

Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

分析多模态大语言模型代理在城市感知中生成解释的角色效应

Neemias da Silva, Matt Ratto, Myriam Delgado, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * Universidade Tecnologica Federal do Parana(巴西南里奥格兰德联邦技术大学) University of Toronto(多伦多大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 通过对比不同角色提示和无角色设置下多模态大语言模型生成的文本,发现标题描述趋同,但理由描述随社会经济和政治属性系统变化,感知标签无显著差异。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07328 2026-07-10 cs.LG cs.AI cs.CV cs.CY 版本更新 81%

MultiFair: Multimodal Balanced Fairness-Aware Medical Classification with Dual-Level Gradient Modulation

MultiFair:具有双级梯度调制的多模态平衡公平感知医学分类

Md Zubair, Hao Zheng, Grayson W. Armstrong, Lucy Q. Shen, Gabriela Wilson, Yu Tian, Xingquan Zhu

机构 * School of Computing and Informatics, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校计算机与信息学学院) Louisiana Center for Health Innovation and College of Nursing & Health Sciences, University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校健康创新中心及护理与健康科学学院) Massachusetts Eye and Ear, Harvard Medical School(哈佛医学院马萨诸塞眼耳医院) Department of Computer Science, University of Central Florida(佛罗里达州立大学计算机科学系) Department of Electrical Engineering and Computer Science, Florida Atlantic University(佛罗里达Atlantic大学电子工程与计算机科学系)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态医学分类中数据模态学习不均衡和模型对特定群体不公平的问题,提出MultiFair方法,通过双级梯度调制过程动态调整训练梯度,在多数据集上评估,有效解决了上述挑战。

Comments This work has been accepted for publication in IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00215 2026-06-17 cs.CV cs.CL 版本更新 81%

Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design

通过奖励设计解耦多模态大语言模型中的感知与推理

Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Independent Researcher(独立研究者)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。

Comments 24 pages, 15 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01444 2026-06-16 cs.AI cs.CL cs.LG 版本更新 81%

Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning

双不确定性引导的多模态推理策略学习

Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent Hunyuan(腾讯文汇) University of Maryland(马里兰大学) University of North Carolina(北卡罗来纳大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28336 2026-08-04 cs.AI 版本更新 79%

Correcting What You Cannot See: Credit Assignment for Perception Distillation in Multimodal Reasoners

修正不可见之缺陷:多模态推理器中感知蒸馏的信用分配

Feng Xiong, Leyan Xue, Hongyu Lin

机构 * Thinking Machines Lab(思维机器实验室) DeepSeek-AI(深度求索公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态推理器的感知蒸馏信用分配问题,提出感知修正蒸馏(PCD)方法,经8个基准测试,可提升不同规模模型的宏平均和结果,消融实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07632 2026-07-28 cs.LG cs.AI 版本更新 79%

Sheaf-Laplacian Obstruction and Projection Hardness for Cross-Modal Compatibility on a Modality-Independent Site

sheaf-Laplacian 障碍与投影难度分析跨模态兼容性在模态无关站点

Tibor Sloboda

机构 * Faculty of Informatics and Information Technology, Slovak Technical University(斯洛伐克技术大学信息学与信息技术学院) aleph0 s. r. o.

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出统一框架分析学习表示中的跨模态兼容性,通过模态无关邻域站点和有限维实内积空间细胞sheaf,定义投影难度和sheaf-Laplacian障碍,分析两种失败模式并推导稳定性与误差界。

Comments 31 pages, 7 figures, submitted to Annals of Mathematics and Artificial Intelligence of Springer Nature, post-major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15748 2026-07-15 cs.LG cs.CV 版本更新 79%

Visual Species Recognition with Large Multimodal Models as Post-Hoc Correctors

以大型多模态模型作为事后校正器的视觉物种识别

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究视觉物种识别问题,比较少样本学习专家模型与大型多模态模型后发现后者虽有不足但有互补优势,进而提出事后校正框架,利用多模态提示策略提升少样本学习专家模型准确率,该框架具有通用性和有效性。

Comments website and code: https://tian1327.github.io/POC

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08949 2026-07-08 cs.CV 版本更新 79%

Tuned Reverse Distillation: Enhancing Multimodal Industrial Anomaly Detection with Crossmodal Tuners

调谐反向蒸馏:使用跨模态调谐器增强多模态工业异常检测

Xinyue Liu, Jianyuan Wang, Biao Leng, Shuo Zhang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of Education(教育部智能仿生无人系统重点实验室) School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文针对多模态工业异常检测问题,提出基于多分支设计的调谐反向蒸馏方法,通过为各模态设独立分支及设计跨模态调谐器,增强模态交互,能更精细检测异常,实验验证其在多模态异常检测和定位上达最优性能。

Comments Accepted by TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新 79%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06572 2026-06-12 cs.LG cs.AI 版本更新 79%

Hellinger Multimodal Variational Autoencoders

Hellinger多模态变分自编码器

Huyen Vo, Isabel Valera

机构 * Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) MPI-SWS, Saarland Informatics Campus(萨尔兰信息学校区Max Planck研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出基于Hellinger距离的矩匹配近似方法HELVAE,避免子采样,在多模态变分自编码器中实现更优的生成一致性与质量权衡。

Comments Accepted at AISTATS 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02568 2026-06-11 cs.AI 版本更新 79%

MLaGA: Multimodal Large Language and Graph Assistant

MLaGA: 多模态大语言与图助手

Dongzhe Fan, Yi Fang, Jiajin Liu, Djellel Difallah, Qiaoyu Tan

机构 * New York University(纽约大学) New York University Shanghai(纽约大学上海) New York University Brooklyn(纽约大学布鲁克林) Virginia Polytechnic Institute and State University(弗吉尼亚理工大学) New York University Abu Dhabi(纽约大学阿布扎克)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出MLaGA模型,通过结构感知多模态编码器和指令微调,将大语言模型扩展到多模态图数据,在监督和迁移学习任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01539 2026-07-07 hep-ph hep-ex hep-th nucl-ex nucl-th 版本更新 79%

Multimodal Fragmentation of All-Heavy Pentaquarks: Uncertainty-Aware Predictions for Hadron Colliders

所有重子五夸克的多模碎片化:用于强子对撞机的不确定性感知预测

Francesco Giovanni Celiberto

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出考虑不确定性的主导功率碎片化描述,用于研究强子对撞机中所有charm五夸克态的碎片化,构建多模碎片函数集PQ5Q1.1,结合微扰与非微扰不确定性,优化初始尺度输入以描述多夸克和双夸克产生机制,并应用于HL-LHC及未来FCC。

Comments 51 pages, 9 figures, 1 table, 264 references, version published in Phys. Rev. D. One novel set of multimodal (direct multicharm and diquark-like initial-scale inputs) PQ5Q1.1 NLO collinear fragmentation functions. Includes F-MHOU and F-NPWF uncertainty replicas, threshold-aware HF-NRevo DGLAP evolution, and LHAPDF release at https://github.com/FGCeliberto/Collinear_FFs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04430 2026-08-11 math.NA cs.NA stat.ML 版本更新 78%

An adaptive split-combine Gaussian mixture filter for nonlinear and multimodal state estimation

面向非线性与多模态状态估计的自适应拆分-合并高斯混合滤波器

San Kim, Won Chang, Daniel B. Forger, Dae Wook Kim

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文针对非线性多模态状态估计问题,提出自适应拆分-合并高斯混合滤波器(AMF),通过拆分合并高斯粒子实现高效准确的PDF估计,在多基准测试中性能优于基线滤波器,还提出了其并行实现方案。

Comments 60 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27048 2026-07-13 cs.RO 版本更新 78%

SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation

SpikeATac: 一种多模态触觉指尖,具有像素化动态传感的灵活操作

Eric T. Chang, Peter Ballentine, Zhanpeng He, Do-Gon Kim, Kai Jiang, Hua-Hsuan Liang, Joaquin Palacios, William Wang, Pedro Piacenza, Ioannis Kymissis, Matei Ciocarlie

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 SpikeATac通过结合动态和静态触觉传感技术,实现对易碎物体的灵活操控,利用强化学习优化力调节能力。

Comments 8 pages, 8 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09978 2026-07-09 cs.CE 版本更新 78%

RoadFed: A Multimodal Federated Learning System for Improving Road Safety

RoadFed:用于提高道路安全的多模态联邦学习系统

Yachao Yuan, Zhen Yu, Yali Yuan, Xingyu Chen, Yingwen Wu, Thar Baker

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对道路危险检测,提出多模态联邦学习系统RoadFed,包含多模态检测器、通信高效联邦学习法及局部差分隐私方法,在真实世界和公共数据集上实验,其准确率高、延迟低、通信成本低,能跨模态跨边缘协作训练并保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04136 2026-07-03 eess.SP 版本更新 78%

FLAME: A Federated Learning Approach for Multi-Modal RF Fingerprinting

FLAME:一种用于多模态射频指纹识别的联邦学习方法

Kasra Borazjani, Kiarash Kianfar, Seyyedali Hosseinalipour, Rajeev Sahay

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 提出FLAME框架,通过多模态表示(超越I/Q样本)加速联邦学习在射频指纹识别中的训练,理论证明收敛更快且精度更高,实验验证其优越性。

Comments 21 pages, 16 figures. Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29629 2026-07-01 cs.DC 版本更新 78%

Energy-Efficient Multimodal Inference Serving with Tri-serve

能效多模态推理服务:Tri-serve

Ziyang Jia, Sara Rashidi Golrouye, Laxmi Bhuyan, Benjamin Kubwimana, Devashree Tripathy, Zexin Li, Cong Liu, Daniel Wong

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态推理服务中GPU硬件频率管理导致的三种能效问题,提出软件DVFS控制器Tri-serve,联合优化依赖停顿、算术强度影响和热节流,实现22%能效提升且无延迟或吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05708 2026-06-29 q-bio.QM 版本更新 78%

HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw, Brendan Honick, Bill Shirey, Lisa Choy, Nikolay Akhmetov, Shaokun An, David Betancur, Dominic Bordelon, Karl Burke, Ivan Cao-Berg, John Conroy, Chris Csonka, Penny Cuda, Sean Donahue, Stephen Fisher, Derek Furst, Ed Hanna, Josef Hardi, Tabassum Kakar, Mark S. Keller, Devin Lange, Xiang Li, Yan Ma, Alison McWilliams, Austen Money, Richard Morgan, Eric Moerth, Juan Muerto, Mark A. Musen, Emily Nic, Martin J. O'Connor, Gesina Phillips, Alexander J. Ropelewski, Ryan Sablosky, Sravani Saripalli, Max Sibilla, Derek Simmel, Alan Simmons, Xu Tang, Joel Welling, Zhou Yuan, Martin Hemberg, HuBMAP Consortium, Matthew Ruffalo, Jonathan Silverstein, Philip Blood, Nils Gehlenborg

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 43 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04451 2026-08-10 cs.CV 版本更新 77%

RemoteZero: Geospatial Reasoning with Zero Labels

RemoteZero:零样本地理空间推理

Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng

专题命中 其他多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22784 2026-07-13 cs.CV cs.AI cs.RO 版本更新 76%

Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching

基于监督跨模态特征匹配的单帧点像素配准

Yu Han, Zhiwei Huang, Yanting Zhang, Fangjun Ding, Shen Cai, Xiaoyu Tang, Yanchao Dong, Rui Fan

机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28149 2026-07-17 cs.CV cs.AI 版本更新 73%

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06094 2026-08-11 cs.LG 版本更新 71%

Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems

你所需要的只是对正常情况建模:多模态网络物理系统中异常检测的联合潜在聚类

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology (HIT)(霍隆技术学院) Afeka Academic College of Engineering(阿法卡工程学院)

专题命中 其他多模态 :multimodal(title)

AI总结 研究多模态网络物理系统异常检测,提出联合潜在聚类方法,通过MIIM假设集、公平协议及潜在评分建模正常行为,在三个真实数据集上表现优异,优于其他深度检测器。

Comments 17 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20206 2026-08-05 cs.CV 版本更新 70%

Toward Visual Grounding: A Survey

视觉定位:一项综述

Linhui Xiao, Xiaoshan Yang, Xiangyuan Lan, Yaowei Wang, Changsheng Xu

专题命中 其他多模态 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本综述梳理视觉定位的发展与背景,总结近年进展与新挑战,定义规范研究设置,介绍相关数据集与应用,提出未来方向,是该领域最全面的综述,适合不同阶段研究者。

Comments Accepted by TPAMI 2025. We keep tracing related works at https://github.com/linhuixiao/Awesome-Visual-Grounding, article publication page: https://ieeexplore.ieee.org/abstract/document/11235566

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 3, pp. 2749-2771, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00143 2026-06-23 cs.LG cs.CV 版本更新 70%

Is Oracle Pruning the True Oracle?

Oracle剪枝真的是真正的Oracle吗?

Sicheng Feng, Keda Tao, Huan Wang

机构 * Westlake University(西湖大学) Nankai University(南开大学) ENCODE Lab, Westlake University(西湖大学ENCODE实验室)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。

Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16639 2026-08-03 cs.LG 版本更新 67%

SPICE: Synergy and Partial Information Based Curriculum Evolution

SPICE: 基于协同与部分信息的课程演化

Ankush Pratap Singh, Houwei Cao, Yong Liu

机构 * New York Institute of Technology(纽约理工学院) New York University(纽约大学)

专题命中 其他多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出SPICE框架,利用部分信息分解理论动态量化样本复杂度,设计渐进式课程使模型从学习共享跨模态线索过渡到模态特定模式再到复杂协同交互,在多个多模态基准上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 67%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract)

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏