arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-02 至 2026-03-02 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2602.23969 2026-03-02 cs.MM cs.CV 62%

MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation

MSVBench: 向多镜头视频生成的人机水平评估迈进

Haoyuan Shi, Yunxin Li, Nanhao Deng, Zhenran Xu, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 MSVBench通过引入分层脚本和参考图像,提出混合评估框架,验证了视频生成模型的连贯性和吸引力,并展示了其在多镜头视频生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19326 2026-03-02 cs.MA cs.AI 57%

City Editing: Hierarchical Agentic Execution for Dependency-Aware Urban Geospatial Modification

城市编辑:面向依赖意识的层级代理执行

Rui Liu, Steven Jige Quan, Zhong-Ren Peng, Zijun Yao, Han Wang, Zhengzhang Chen, Kunpeng Liu, Yanjie Fu, Dongjie Wang

机构 * University of Kansas, Lawrence, KS, USA(堪萨斯大学) Seoul National University, Seoul, South Korea(首尔国立大学) University of Florida, Gainesville, FL, USA(佛罗里达大学) NEC Laboratories America, Princeton, NJ, USA(NEC美国实验室) Clemson University, Clemson, SC, USA(克莱姆森大学) Arizona State University, Tempe, AZ, USA(亚利桑那州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于层级代理的框架,用于高效、准确地修改城市规划,通过分层几何意图和迭代验证机制提升空间修改的效率与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 12 篇

2602.23945 2026-03-02 cs.CV cs.AI cs.MM 85%

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23299 2026-03-02 cs.CV cs.MM 84%

MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection

MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测

Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23614 2026-03-02 cs.LG cs.AI 83%

When Does Multimodal Learning Help in Healthcare? A Benchmark on EHR and Chest X-Ray Fusion

多模态学习在医疗领域何时有助于提升性能?基于电子健康记录与胸部X光融合的基准测试

Kejing Yin, Haizhou Xu, Wenfang Yao, Chen Liu, Zijie Chen, Yui Haang Cheung, William K. Cheung, Jing Qin

机构 * Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学) Division of Artificial Intelligence(人工智能 division) Lingnan University(Lingnan 大学) School of Nursing(护理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过基准测试评估了电子健康记录与胸部X光融合在医疗中的有效性,揭示了多模态学习在不同模态缺失情况下的性能差异及公平性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19756 2026-03-02 cs.CV 83%

Multimodal Dataset Distillation Made Simple by Prototype-Guided Data Synthesis

通过原型引导的数据合成实现多模态数据集蒸馏

Junhyeok Choi, Sangwoo Mo, Minwoo Chae

机构 * Department of Industrial and Management Engineering(工业与管理工程系)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 通过原型引导的数据合成实现多模态数据集蒸馏,无需大规模训练和优化,提升跨架构泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23898 2026-03-02 cs.CV cs.AI cs.CL 82%

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

Ref-Adv:探索提及表达任务中的多模态大语言模型视觉推理

Qihua Dong, Kuo Yang, Lin Ju, Handong Zhao, Yitian Zhang, Yizhou Wang, Huimin Zeng, Jianglin Lu, Yun Fu

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Ref-Adv 是一个旨在评估多模态大语言模型视觉推理能力的基准,通过增加表达复杂性和减少干扰项,揭示模型在视觉推理和 grounding 方面的不足。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23980 2026-03-02 cs.CV 79%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23777 2026-03-02 cs.AI 79%

Reasoning-Driven Multimodal LLM for Domain Generalization

基于推理的多模态大语言模型用于领域泛化

Zhipeng Xu, Zilong Wang, Xinyang Jiang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) National Engineering Laboratory for Integrated Aero-Space-Ground- Ocean Big Data Application(国家一体化空天地海大数据应用工程实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出RD-MLDG框架,利用多模态大语言模型的推理能力,通过引入多任务交叉训练和自我对齐的推理正则化,提升领域泛化性能。

Comments Accepted at ICLR 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23632 2026-03-02 cs.AI 79%

MMKG-RDS: Reasoning Data Synthesis via Deep Mining of Multimodal Knowledge Graphs

基于多模态知识图谱的推理数据合成:通过深度挖掘多模态知识图谱进行推理数据合成

Lun Zhan, Feng Xiong, Huanyong Liu, Feng Zhang, Yuhui Yin

机构 * AI Research Institute, Qihoo 360(人工智能研究院,奇虎360)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 MMKG-RDS通过深度挖掘多模态知识图谱,提出灵活的推理数据合成框架,提升模型推理能力并生成高质量数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21048 2026-03-02 cs.CV cs.AI 73%

Veritas: Generalizable Deepfake Detection via Pattern-Aware Reasoning

Veritas:通过模式感知推理实现通用的深度伪造检测

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Chuanbiao Song, Senyuan Shi, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Ant Group(蚂蚁集团) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Veritas通过模式感知推理,基于多模态大语言模型实现通用深度伪造检测,提升对未知伪造技术和数据领域的检测能力。

Comments ICLR 2026 Oral. Project: https://github.com/EricTan7/Veritas

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24653 2026-03-02 cs.RO 71%

RoboMIND 2.0: A Multimodal, Bimanual Mobile Manipulation Dataset for Generalizable Embodied Intelligence

RoboMIND 2.0:一种多模态、双臂移动操作数据集,用于通用具身智能

Chengkai Hou, Kun Wu, Jiaming Liu, Zhengping Che, Di Wu, Fei Liao, Guangrun Li, Jingyang He, Qiuxuan Feng, Zhao Jin, Chenyang Gu, Zhuoyang Liu, Nuowei Han, Xiangju Mi, Yaoxu Lv, Yankai Fu, Gaole Dai, Langzhe Gu, Tao Li, Yuheng Zhang, Yixue Zhang, Xinhua Wang, Shichao Fan, Meng Li, Zhen Zhao, Ning Liu, Zhiyuan Xu, Pei Ren, Junjie Ji, Haonan Liu, Kuan Cheng, Shanghang Zhang, Jian Tang

专题命中 多模态评测 :multimodal(title)

AI总结 RoboMIND 2.0通过多模态双臂移动操作数据集和MIND-2系统,提升通用具身智能的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23730 2026-03-02 cs.AI 70%

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

解锁认知能力并分析感知-逻辑权衡

Longyin Zhang, Shuo Sun, Yingxu He, Won Cheng Yi Lewis, Muhammad Huzaifah Bin Md Shahrin, Hardik Bhupendra Sailor, Heng Meng Jeremy Wong, Tarun Kumar Vangani, Yi Ma, Qiongqiong Wang, Minh Duc Pham, Ridong Jiang, Jingtao Li, Jingyi Liao, Zhuohan Liu, Yanfeng Lu, Manas Gupta, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)

专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23114 2026-03-02 cs.CV 57%

WARM-CAT: Warm-Started Test-Time Comprehensive Knowledge Accumulation for Compositional Zero-Shot Learning

WARM-CAT: 基于温启动的测试时综合知识积累用于组合零样本学习

Xudong Yan, Songhe Feng, Jiaxin Wang, Xin Su, Yi Jin

机构 * School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 WARM-CAT通过温启动测试时综合知识积累,提升组合零样本学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 3 篇

2602.21157 2026-03-02 cs.RO 78%

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22939 2026-03-02 cs.CV 70%

ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving

ColaVLA: 借助认知潜在推理实现自动驾驶中的分层并行轨迹规划

Qihang Peng, Xuesong Chen, Chenye Yang, Shaoshuai Shi, Hongsheng Li

机构 * Tsinghua University(清华大学) CUHK MMLab(香港中文大学MMLab) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ColaVLA通过统一视觉-语言-动作框架,解决自动驾驶中轨迹规划的效率与准确性问题,实现高效、安全的多尺度轨迹生成。

Comments CVPR2026(Main Conference). Project page: https://pqh22.github.io/projects/ColaVLA/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24100 2026-03-02 cs.AI cs.LG 57%

Artificial Agency Program: Curiosity, compression, and communication in agents

人工代理计划:代理中的好奇心、压缩与交流

Richard Csaky

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出人工代理计划,旨在通过整合好奇心、压缩与交流机制,构建资源受限的AI代理系统,以提升感知、理解和行动能力并减少人机交互摩擦。

Comments This is a working draft. Feedback and criticism is most welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 15 篇

2507.05394 2026-03-02 cs.CV cs.LG 83%

pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models

pFedMMA: 为视觉-语言模型设计的个性化联邦微调多模态适配器

Sajjad Ghiasvand, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 pFedMMA通过多模态适配器实现视觉-语言模型的个性化联邦微调,平衡个性化与泛化能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 81%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24041 2026-03-02 cs.CV 79%

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

仔细观察:多模态大语言模型中的自适应视觉增强以缓解幻觉

Xingyu Zhu, Kesen Zhao, Liang Yi, Shuo Wang, Zhicai Wang, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(信息与电子技术联合实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出自适应视觉增强框架AIR,通过减少冗余标记和选择性整合补丁来缓解多模态大语言模型中的幻觉问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04576 2026-03-02 cs.CV 79%

TARDis: Time Attenuated Representation Disentanglement for Incomplete Multi-Modal Tumor Segmentation and Classification

TARDis: 用于不完整多模态肿瘤分割与分类的时间衰减表示解耦

Zishuo Wan, Qinqin Kang, Na Li, Yi Huang, Qianru Zhang, Le Lu, Yun Bian, Dawei Ding, Ke Yan

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Alibaba Group DAMO Academy(阿里巴巴集团DAMO学院) Hupan Lab(湖畔实验室) Departments of Radiology, Changhai Hospital(上海长海医院放射科)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 TARDis通过时间衰减表示解耦框架,解决多模态肿瘤分割与分类中缺失模态问题,提升诊断精度并降低辐射暴露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17966 2026-03-02 cs.IR cs.CV 79%

LLM-Enhanced Multimodal Fusion for Cross-Domain Sequential Recommendation

基于大语言模型的跨域序列推荐多模态融合

Wangyu Wu, Zhenhong Chen, Wenqiao Zhang, Xianglin Qiu, Siqi Song, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司) Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出LLM-EMF方法,通过融合视觉和文本数据提升跨域序列推荐性能,利用CLIP模型生成多模态嵌入并引入多重注意力机制,实验证明其在多领域推荐中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2504.15085

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01728 2026-03-02 cs.CV 79%

Shuffle Mamba: State Space Models with Random Shuffle for Multi-Modal Image Fusion

Shuffle Mamba:基于随机洗牌的态空间模型用于多模态图像融合

Ke Cao, Xuanhua He, Tao Hu, Chengjun Xie, Man Zhou, Jie Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Intelligent Machines(智能机器研究所) Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院) Intelligent Agriculture Engineering Laboratory of Anhui Province, Institute of Intelligent Machines(安徽省智能农业工程实验室,智能机器研究所)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 Shuffle Mamba通过引入随机洗牌策略和逆洗牌,解决多模态图像融合中固定扫描策略带来的偏见问题,提升融合质量。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23862 2026-03-02 cs.HC 78%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19955 2026-03-02 cs.IR 78%

Multimodal-enhanced Federated Recommendation: A Group-wise Fusion Approach

多模态增强的联邦推荐:一种组级融合方法

Chunxu Zhang, Weipeng Zhang, Guodong Long, Zhiheng Xue, Riting Xia, Bo Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种多模态增强的联邦推荐方法,通过组级融合机制提升推荐系统在多模态特征整合方面的性能。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23699 2026-03-02 cs.CV cs.CL 73%

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少

Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23959 2026-03-02 cs.CV 70%

Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought

通过图像作为连续动作进行思考:数值视觉链式推理

Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Chalmers University of Technology(楚克理工大学) University of Gothenburg(哥德堡大学)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 NV-CoT通过将图像推理动作空间扩展为连续欧几里得空间,提升MLLMs的定位精度和回答准确性,同时加速训练收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23734 2026-03-02 cs.CV cs.CL 62%

UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking

UTPTrack: 向简单和统一的令牌剪枝迈进:视觉跟踪中的统一令牌剪枝

Hao Wu, Xudong Wang, Jialiang Zhang, Junlong Tong, Xinghao Chen, Junyan Lin, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 UTPTrack通过统一令牌剪枝框架,在视觉跟踪中实现高精度与高效能的平衡,同时支持多模态和语言引导任务。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03059 2026-03-02 cs.CV 57%

CLAP: Unsupervised 3D Representation Learning for Fusion 3D Perception via Curvature Sampling and Prototype Learning

CLAP:通过曲率采样和原型学习实现融合3D感知的无监督3D表示学习

Runjian Chen, Hang Zhang, Avinash Ravichandran, Hyoungseob Park, Wenqi Shao, Alex Wong, Ping Luo

机构 * The University of Hong Kong(香港大学) Cruise Yale University(耶鲁大学) Shanghai AI Laboratory(上海人工智能实验室) HKU Shanghai Intelligent Computing Research Center(香港大学上海智能计算研究中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 CLAP通过曲率采样和原型学习,在无监督3D表示学习中实现图像与点云的联合预训练,提升融合3D感知的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22294 2026-03-02 cs.LG 50%

When Should a Model Change Its Mind? An Energy-Based Theory and Regularizer for Concept Drift in Electrocardiogram (ECG) Signals

模型何时应改变观点?一种基于能量的理论和正则化器用于心电图(ECG)信号中的概念漂移

Timothy Oladunni, Blessing Ojeme, Kyndal Maclin, Clyde Baidoo

机构 * Department of Computer Science, Morgan State University(计算机科学系,莫根州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究提出Physiologic Energy Conservation Theory (PECT)和Energy-Constrained Representation Learning (ECRL),用于在ECG信号中稳定概念,通过能量守恒原理减少误判和漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏